modelos

Enrutamiento de modelos: el modelo adecuado, para el trabajo adecuado, al precio adecuado

8 min de lectura

La mayoría de los equipos pagan precios de vanguardia por trabajos que no necesitan un modelo de vanguardia. Alguien elige el modelo más potente que encuentra, lo configura como por defecto y, a partir de ahí, cada solicitud se ejecuta a la tarifa más alta. El gasto crece más rápido que la calidad de lo que se entrega.

El enrutamiento de modelos es la solución. En lugar de enviar cada solicitud a un único modelo, un router de modelos analiza cada solicitud y elige el modelo más adecuado. Las tareas sencillas van a modelos rápidos y baratos. El trabajo difícil y de largo plazo va a los modelos de vanguardia.

El enrutamiento de modelos se está convirtiendo en una capa estándar en la forma en que los equipos trabajan con LLM. La diferencia entre el modelo capaz más barato y el más caro es enorme, y la mayor parte de lo que haces cada día está en el extremo sencillo. Si lo enrutas bien, mantienes la calidad mientras reduces significativamente el gasto. El resto de esta guía explica cómo funciona realmente el enrutamiento, qué medir para saber si está funcionando y cómo activarlo.

Por qué el enrutamiento de modelos importa ahora

Dos cosas cambiaron a la vez. Los modelos se volvieron más capaces en una amplia gama de precios, y los desarrolladores empezaron a enviar muchas más solicitudes a través de ellos a medida que los agentes asumían una mayor parte del trabajo. Esa combinación es la que hace que usar un único modelo por defecto resulte caro.

Aproximadamente, el 60% de los desarrolladores que usan Cursor eligen un solo modelo como opción principal para el día a día, lo que significa que el trabajo rutinario se ejecuta con precios de vanguardia y el gasto en IA crece mucho más rápido que la calidad del resultado. Un modelo propio como Composer 2.5 cuesta 2.50 por millón de resultado, mientras que los modelos de vanguardia cuestan varias veces más. Cuando la mayor parte de tu volumen es trabajo de programación rutinario, el modelo que usas por defecto determina la mayor parte de tu factura.

La industria llegó a la misma conclusión. Microsoft Foundry ofrece un router de modelos con modos de costo, equilibrio y calidad. Sistemas de investigación como RouteLLM reportan grandes reducciones de costo con una calidad cercana a la de vanguardia. Esto está apareciendo en todas partes a la vez, lo que normalmente significa que es difícil discutir los números.

Las preguntas que vale la pena responder antes de definir el enrutamiento

Si estás evaluando el enrutamiento de modelos, estas son las cuestiones que debes resolver primero. Revísalas en orden.

¿Qué es un router de modelos?

Un router de modelos es un sistema que se sitúa entre ti y un conjunto de modelos, y elige cuál se encarga de cada solicitud. Lee la solicitud (el prompt, el contexto, el tipo de tarea) y la envía al modelo con más probabilidades de hacer bien el trabajo al menor costo. Los buenos routers tienen en cuenta el tipo de tarea y su complejidad, no solo la longitud. Los más flojos se basan en una regla burda y pasan por alto lo importante.

¿Cómo decide el enrutamiento qué modelo usar?

Los mejores sistemas clasifican cada solicitud antes de que se ejecute cualquier modelo. Cursor Router, por ejemplo, aplica un clasificador a cada solicitud en función de la consulta, el contexto,la complejidad de la tarea y el dominio, combinado con lo que sabe sobre cómo se comporta cada modelo. Las tareas de UI van a modelos eficientes en costo, las tareas de interfaz van al modelo con mejor criterio, y los problemas complejos de largo plazo van a modelos de razonamiento de vanguardia. La clasificación se hace de antemano, así que la elección se toma antes de tener que recurrir a un modelo costoso.

How routing worksYour requestPrompt + contextRouter classifierTask type + complexityCheaper modelRoutine workFrontier modelHard workYou set the tradeoff. The router picks the model per request.CostOptimize token spendBalanceDaily-driver qualityIntelligenceTop-tier quality
A request moves through a router classifier to a cheaper model for routine work or a frontier model for hard work. Modes are Cost, Balance, and Intelligence.

¿El enrutamiento debería ser automático o los ingenieros deberían seguir eligiendo?

Ambas cosas, pero en distintos niveles. La selección en cada solicitud debería ser automática, porque nadie quiere elegir un modelo manualmente cientos de veces al día y la opción adecuada cambia con cada tarea. Lo que los equipos sí quieren es una forma de decidir, a nivel general, en qué punto se sitúan dentro del equilibrio entre costo y calidad. El diseño habitual ofrece unos pocos modos (costo, equilibrado, calidad) que sitúan a todo el equipo a lo largo de esa curva, mientras la decisión sobre cada solicitud se resuelve por debajo.

¿El enrutamiento perjudica la calidad?

No debería, si el router se evalúa por calidad y no solo por costo. El enrutamiento de modelos mantiene las tareas difíciles en los modelos más capaces y solo deriva el trabajo sencillo a modelos menos potentes. En las pruebas A/B de Cursor con millones de solicitudes, el modo Intelligence quedó cerca de un modelo de vanguardia en satisfacción del usuario con un costo aproximadamente un 60% menor, y las empresas con acceso anticipado vieron ahorros de entre el 30 y el 50% frente a enrutarlo todo al modelo principal, sin ninguna caída en la calidad. Para la mayoría de las solicitudes, el modelo que resuelve bien la tarea simplemente no es el más caro.

¿Qué deberías medir?

Observa el costo por unidad de trabajo real, no solo el costo por solicitud. Esto puede medirse mediante la satisfacción del usuario (¿la persona tomó el resultado y siguió adelante, o volvió atrás y lo corrigió?) y la tasa de conservación (¿cuánto del código generado sigue en el codebase más adelante?). Cursor reporta el costo por commit como la cifra clave: en nuestras pruebas, el router de Cursor logra 6.76 en Intelligence, frente a $7.34 para una referencia all-Opus 4.8. El costo por commit (o por PR) es la cifra que debes llevar a una conversación sobre presupuesto, porque vincula el gasto con el trabajo entregado.

Cost per commitBalanceCursor Router$4.63IntelligenceCursor Router$6.76All Opus 4.8Baseline$7.34
Cost per commit is $4.63 for Cursor Router Balance, $6.76 for Intelligence, and $7.34 for an all-Opus 4.8 baseline.

¿Cómo maneja el enrutamiento el almacenamiento en caché y el cambio de modelos?

Cambiar de modelo a lo largo de una conversación puede hacer que se pierda la caché del prompt, lo que añade un costo que una comparación ingenua del antes y el después no tiene en cuenta. Cursor tiene esto en cuenta al incluir el costo de los fallos de caché derivados de las decisiones de enrutamiento que toma en los ahorros que reporta. Cuando evalúes un router, pregunta si sus cifras tienen en cuenta la caché. Si no es así, es probable que estén exagerando los ahorros.

Cómo usar el enrutamiento de modelos en Cursor

Cursor Router es el sistema de enrutamiento de modelos detrás de Auto en los planes Teams y Empresas. Tú decides hasta qué punto optimizar. En Balance e Intelligence, el router elige el modelo para cada solicitud.

Elige un modo. Selecciona Auto en el selector de modelos y luego elige el modo de optimización. Cost optimiza el gasto de tokens. Balance se ajusta a los modelos de vanguardia que la gente prefiere para el uso diario, e Intelligence apunta a la máxima calidad. Todos los modos de Auto se facturan al precio de lista del modelo enrutado.

Deja que clasifique. En Balance e Intelligence, el router analiza cada solicitud y la enruta según el tipo de tarea y su complejidad, manteniendo el trabajo más difícil en los modelos más capaces y sacando las tareas rutinarias del precio de los modelos de vanguardia. Grok 4.5 debe estar habilitado, ya que el router lo usa como opción rentable cuando no recurre a un modelo de vanguardia.

Configura las restricciones (administradores). Habilita Router por equipo o grupo, elige qué modos pueden usar los miembros, establece el valor por defecto y permite o bloquea modelos específicos. Está activado por defecto en los planes Teams; los administradores de Empresas lo habilitan desde el dashboard.

Supervisa las cifras. Haz seguimiento del uso en el dashboard de uso para ver cuánto pasa por los modelos de Cursor frente a otros, y comprueba que el ahorro sea real antes de ampliar el despliegue.

Siguiente paso: Activa Auto en el selector de modelos, elige Balance o Intelligence y sigue la configuración completa en cursor.com/docs/cursor-router. Los administradores pueden habilitar Router y configurar las restricciones desde el dashboard del equipo.

Asigna el modelo adecuado a cada trabajo

El enrutamiento de modelos funciona porque el modelo más potente rara vez es el más adecuado para la mayor parte de lo que haces. Si asignas el modelo adecuado a cada trabajo, mantienes el nivel de calidad mientras pagas mucho menos por el trabajo que, de entrada, nunca necesitó un modelo de vanguardia. Los routers que de verdad dan resultados enrutan según la complejidad real de cada tarea, reservan los problemas difíciles para modelos capaces y se miden por el costo por cambio entregado. Si eso encaja con la forma en que ya trabaja tu equipo, activa el enrutamiento para un equipo con mucha actividad, observa el costo por commit durante una semana y deja que ese número te diga hasta dónde conviene llevarlo.

Comienza aquí.

Archivado en: modelos