modelos

Roteamento de modelos: modelo certo, tarefa certa, preço certo

8 min de leitura

A maioria das equipes paga preço de modelo de ponta por trabalhos que não precisam de um modelo de ponta. Alguém escolhe o modelo mais potente que consegue encontrar, define-o como padrão, e cada solicitação depois disso passa a ser cobrada na taxa mais alta. O gasto sobe mais rápido do que a qualidade do que é entregue.

O roteamento de modelos é a solução. Em vez de enviar cada solicitação para um único modelo, um roteador analisa cada solicitação e escolhe o modelo mais adequado. Trabalhos simples vão para modelos rápidos e baratos. Trabalhos difíceis, de horizonte longo, vão para os modelos de ponta.

O roteamento de modelos está se tornando uma camada padrão na forma como as equipes trabalham com LLMs. A diferença entre o modelo capaz mais barato e o mais caro é enorme, e a maior parte do que você faz ao longo do dia está no lado fácil. Com um bom roteamento, você mantém a qualidade enquanto reduz significativamente os gastos. O restante deste guia aborda como o roteamento funciona na prática, o que medir para saber se está funcionando e como ativá-lo."

Por que o roteamento de modelos importa agora

Duas coisas mudaram ao mesmo tempo. Os modelos ficaram mais capazes em uma ampla faixa de preços, e os desenvolvedores passaram a enviar muito mais solicitações por eles à medida que os agentes assumiam uma parcela maior do trabalho. Essa combinação é o ponto em que usar um único modelo como padrão fica caro.

Aproximadamente 60% dos desenvolvedores que usam Cursor escolhem um único modelo como principal no dia a dia, o que significa que o trabalho rotineiro é executado com preço de modelo de ponta e os gastos com IA crescem muito mais rápido do que a qualidade dos resultados. Um modelo próprio, como o Composer 2.5, custa US 2,50 por milhão de tokens de saída, enquanto modelos de ponta custam várias vezes mais. Quando a maior parte do seu volume é trabalho comum de programação, o modelo que você define como padrão determina a maior parte da sua conta.

O setor chegou à mesma conclusão. O Foundry da Microsoft oferece um roteador de modelos com modos de custo, equilíbrio e qualidade. Sistemas de pesquisa como o RouteLLM relatam grandes reduções de custo com qualidade próxima à dos modelos de ponta. Isso está aparecendo em todo lugar ao mesmo tempo, o que geralmente significa que é difícil contestar os números.

As perguntas que vale a pena responder antes de configurar o roteamento

Se você está avaliando o roteamento de modelos, estes são os pontos que precisa definir primeiro. Considere-os em ordem.

O que é um roteador de modelos?

Um roteador de modelos é um sistema que fica entre você e um conjunto de modelos e escolhe qual deles vai processar cada requisição. Ele lê a requisição (o prompt, o contexto, o tipo de tarefa) e a envia para o modelo com maior chance de executar bem a tarefa pelo menor custo. Bons roteadores levam em conta o tipo e a complexidade da tarefa, não apenas seu tamanho. Os ruins seguem uma regra simplista e erram o alvo.

Como o roteamento decide qual modelo usar?

Os sistemas mais avançados classificam cada solicitação antes de qualquer modelo ser executado. O Cursor Router, por exemplo, executa um classificador para cada solicitação com base na query, no contexto, na complexidade da tarefa e no domínio, em combinação com o que ele sabe sobre o comportamento de cada modelo. Trabalhos de UI vão para modelos com melhor custo-benefício, trabalhos de interface vão para o modelo com o melhor senso estético, e problemas complexos de horizonte longo vão para modelos de raciocínio de ponta. A classificação acontece logo no início, então a escolha é feita antes que o modelo mais caro precisasse ser acionado.

How routing worksYour requestPrompt + contextRouter classifierTask type + complexityCheaper modelRoutine workFrontier modelHard workYou set the tradeoff. The router picks the model per request.CostOptimize token spendBalanceDaily-driver qualityIntelligenceTop-tier quality
A request moves through a router classifier to a cheaper model for routine work or a frontier model for hard work. Modes are Cost, Balance, and Intelligence.

O roteamento deve ser automático ou os engenheiros ainda devem escolher?

Os dois, em níveis diferentes. A escolha em cada solicitação deve ser automática, porque ninguém quer escolher um modelo manualmente centenas de vezes por dia, e a resposta ideal muda a cada tarefa. O que as equipes querem é uma forma de definir, de modo geral, em que ponto ficam no equilíbrio entre custo e qualidade. O design mais comum oferece alguns modos (custo, equilibrado, qualidade) que deslocam toda a equipe ao longo dessa curva, enquanto a decisão para cada solicitação é tomada por baixo dos panos.

O roteamento prejudica a qualidade?

Não deveria, se o roteador for avaliado pela qualidade, e não apenas pelo custo. O roteamento de modelos mantém as tarefas difíceis nos modelos mais capazes e só direciona o trabalho mais simples para modelos menos capazes. Nos testes A/B do Cursor com milhões de solicitações, o modo Intelligence ficou próximo de um modelo de ponta em satisfação dos usuários, com um custo cerca de 60% menor, e empresas com acesso antecipado tiveram economia de 30% a 50% em comparação com direcionar tudo para o melhor modelo, sem perda de qualidade. Na maioria das solicitações, o modelo que dá conta do recado não é o mais caro.

O que você deve medir?

Acompanhe o custo por unidade de trabalho real, não apenas o custo por solicitação. Isso pode ser medido pela satisfação do usuário (a pessoa pegou o resultado e seguiu em frente, ou voltou e o corrigiu?) e pela taxa de retenção (quanto do código gerado ainda está na base de código depois). O Cursor reporta o custo por commit como o indicador principal: em nossos testes, o roteador do Cursor alcança 6,76 em Intelligence, versus $7,34 para um baseline totalmente em Opus 4.8. O custo por commit (ou por PR) é o número a levar para uma conversa sobre orçamento, porque ele vincula o gasto ao trabalho entregue.

Cost per commitBalanceCursor Router$4.63IntelligenceCursor Router$6.76All Opus 4.8Baseline$7.34
Cost per commit is $4.63 for Cursor Router Balance, $6.76 for Intelligence, and $7.34 for an all-Opus 4.8 baseline.

Como o roteamento lida com cache e com a alternância de modelos?

Alternar entre modelos ao longo de uma conversa pode fazer você perder o cache do prompt, o que acrescenta um custo que uma comparação ingênua de antes e depois deixa de considerar. O Cursor leva isso em conta incluindo o custo das perdas de cache causadas pelas decisões de roteamento que ele toma na economia reportada. Ao avaliar um roteador, pergunte se os números consideram o cache. Se não considerarem, provavelmente estão superestimando a economia.

Como usar o roteamento de modelos no Cursor

Cursor Router é o sistema de roteamento de modelos por trás do Auto nos planos Teams e Empresas. Você escolhe quão agressiva será a otimização. No Balance e no Intelligence, o roteador seleciona o modelo de cada solicitação.

Escolha um modo. Selecione Auto no seletor de modelos e, depois, escolha o modo de otimização. Cost otimiza o gasto de tokens. Balance corresponde aos modelos de ponta que as pessoas preferem usar no dia a dia, e Intelligence prioriza qualidade de ponta. Todos os modos Auto são cobrados pelo preço de tabela do modelo roteado.

Deixe que ele classifique. No Balance e no Intelligence, o roteador lê cada solicitação e faz o roteamento com base no tipo de tarefa e na complexidade, mantendo o trabalho mais difícil nos modelos mais capazes e tirando o trabalho rotineiro do custo dos modelos de ponta. O Grok 4.5 precisa estar habilitado, já que o roteador o usa como opção mais econômica quando não está chamando um modelo de ponta.

Defina as regras de proteção (administradores). Habilite o Router por equipe ou grupo, escolha quais modos os membros podem usar, defina o padrão e permita ou bloqueie modelos específicos. Ele vem ativado por padrão nos planos Teams; administradores de Empresas o habilitam no dashboard.

Acompanhe os números. Acompanhe o uso no dashboard de uso para ver quanto está sendo executado pelos modelos do Cursor em comparação com outros e confirmar que a economia é real antes de ampliar a adoção.

Próxima etapa: Ative o Auto no seletor de modelos, escolha Balance ou Intelligence e siga a configuração completa em cursor.com/docs/cursor-router. Os administradores podem habilitar o Router e definir regras de proteção no painel da equipe.

Combine o modelo com a tarefa

O roteamento de modelos funciona porque o modelo mais potente raramente é o ideal para a maior parte do que você faz. Quando você combina o modelo com a tarefa, mantém o padrão de qualidade e paga muito menos pelo trabalho que nunca precisou de um modelo de ponta, para começo de conversa. Os roteadores que de fato entregam resultados roteiam com base na complexidade real da tarefa, mantêm os problemas difíceis em modelos capazes e se avaliam pelo custo por alteração entregue. Se isso combina com a forma como sua equipe já trabalha, ative o roteamento para uma equipe com alto volume de trabalho, acompanhe o custo por commit por uma semana e deixe esse número indicar até onde vale a pena ir.

Comece aqui.

Publicado em: modelos