Complete your Databricks User Groups profile!

Fill out a few details about yourself so the community can get to know you.
Rio de Janeiro Databricks User Group

Smart Routing no Unity AI Gateway: o modelo mais caro nem sempre é necessário - e a Databricks quer decidir isso por você

Smart Routing no Unity AI Gateway: o modelo mais caro nem sempre é necessário - e a Databricks quer decidir isso por você

Sétimo post da série sobre o ecossistema Genie/governança de IA.

Nove dias depois de o Unity AI Gateway atingir GA, a Databricks anunciou uma nova capacidade dentro dele: Smart Routing (status: Beta, anunciado em 13/08/2026).

O problema que ataca:

Hoje existem mais de 33 modelos de IA lançados só em 2026, e a tendência de quem programa com IA é sempre escolher o modelo mais caro/frontier "pra garantir", mesmo em tarefas simples (mudar uma flag, editar um arquivo, corrigir um bug pontual). Isso infla custo sem necessidade.

Como funciona, segundo o blog:

Um classificador leve lê a descrição da tarefa e rotula características semânticas (tipo de mudança no sistema, tipo de evidência no código, padrão de falha, localização do fix, tipo de projeto).

Um mecanismo de política usa, por padrão, um modelo de nível intermediário, e só escala para um modelo caro em tarefas complexas - ou rebaixa para um mais barato em tarefas simples.

O roteamento acontece no início da sessão, pra preservar eficiência de cache e economia de tokens.

Para agentes de codificação, o Smart Routing se integra ao Omnigent - o "meta-harness" da própria Databricks para agentes de código. Ali ele atua em dois níveis: escolhe o modelo e o harness, e as chamadas de sub-agente passam pela API do Smart Routing. Ou seja, num fluxo com vários sub-agentes, cada um pode acabar rodando num modelo diferente conforme a complexidade da sua parte.

Como habilitar: o blog aponta dois caminhos, conforme o que você quer rotear:

- Só o modelo: ativar o Smart Routing pelo próprio Unity AI Gateway.

- Modelo e harness juntos: usar Smart Routing com o Omnigent, versão 0.9.0 ou superior.

O anúncio não traz o passo a passo de configuração - vale checar a documentação do Unity AI Gateway antes de tentar ligar em ambiente real.

Sobre os números - vale ler com atenção: o blog usa três números diferentes de economia, sem deixar claro por que divergem:

- 35% de economia num benchmark interno (codebase proprietário da Databricks)

- 56% de economia em benchmarks públicos, alcançando desempenho equivalente ao Opus 5 "por menos da metade do custo"

- "30%+ menor custo por tarefa" no título do próprio blog

E uma citação direta: "Smart Routing outperformed any single model at just 65% of the cost per task of a leading model like Opus 5" (65% do custo bate com a faixa dos outros dois números, mas o título arredonda pra "30%+", que é o número mais conservador dos três).

Como sempre nesses casos: são benchmarks e metodologias divulgados pela própria empresa, sem auditoria independente publicada - útil como direção, não como número único e definitivo.

Por que isso importa na prática: é uma extensão natural do Unity AI Gateway (que atingiu GA há poucos dias) para dentro do próprio consumo de IA, não só do controle de orçamento. Antes, Unity AI Gateway ajudava a saber quanto você está gastando e a travar excesso; Smart Routing tenta reduzir o gasto na origem, escolhendo o modelo certo pra cada tarefa automaticamente.

Ainda em Beta - vale acompanhar dados de produção reais antes de tratar os números do blog como o que você vai economizar na prática.

Alguém já testou Smart Routing?

Os 30-56% de economia bateram com o que vocês viram, ou a experiência real ficou mais próxima de um dos extremos?

Fonte oficial:

- [Smart Routing in Unity AI Gateway: Match Frontier Quality at 30%+ Lower Cost Per Task (Databricks Blog)](https://www.databricks.com/blog/smart-routing-unity-ai-gateway-match-frontier-quality-30-lower-cost-task) (2026-08-13)

0 comments