Modèles

Routage de modèles : le bon modèle, pour la bonne tâche, au bon prix

8 min de lecture

La plupart des équipes paient le prix des modèles de pointe pour des tâches qui n’en ont pas besoin. Quelqu’un choisit le modèle le plus puissant qu’il trouve, le définit comme modèle par défaut, puis chaque requête est facturée au tarif le plus élevé. Les dépenses augmentent plus vite que la qualité de ce qui est livré.

Le routage de modèles, c’est la solution. Au lieu d’envoyer chaque requête vers un seul modèle, un routeur examine chaque requête et choisit le modèle le plus adapté. Les tâches simples vont vers des modèles rapides et peu coûteux. Les tâches difficiles, à long horizon, vont vers les modèles de pointe.

Le routage de modèles est en train de devenir une couche standard dans la façon dont les équipes travaillent avec les LLM. L’écart entre le modèle compétent le moins cher et le plus coûteux est énorme, et la plupart de ce que vous faites au quotidien se situe du côté des tâches faciles. Si vous routez correctement, vous conservez la qualité tout en réduisant sensiblement les dépenses. La suite de ce guide explique comment le routage fonctionne concrètement, quelles métriques suivre pour vérifier qu’il fonctionne, et comment l’activer.

Pourquoi le routage de modèles est devenu important

Deux choses ont changé en même temps. Les modèles sont devenus plus performants sur une large gamme de prix, et les développeurs ont commencé à leur envoyer bien plus de requêtes à mesure que les agents prenaient en charge une part croissante du travail. Cette combinaison rend vite coûteux le choix par défaut d’un modèle unique.

Environ 60 % des développeurs qui utilisent Cursor choisissent un seul modèle comme modèle principal au quotidien, ce qui signifie que le travail de routine s’exécute au prix des modèles de pointe et que les dépenses en IA augmentent bien plus vite que la qualité des résultats. Un modèle propriétaire comme Composer 2.5 coûte 0,50  par million de tokens de sortie, tandis que les modèles de pointe coûtent plusieurs fois plus. Lorsque l’essentiel de votre volume correspond à des tâches de codage ordinaires, le modèle utilisé par défaut détermine l’essentiel de votre facture.

Le secteur est arrivé à la même conclusion. Microsoft Foundry propose un routeur de modèles avec des modes coût, équilibré et qualité. Des systèmes de recherche comme RouteLLM font état d’importantes réductions de coût pour une qualité proche de celle des modèles de pointe. On voit cela apparaître partout en même temps, ce qui signifie généralement que les chiffres parlent d’eux-mêmes.

Les questions à trancher avant de mettre en place le routage

Si vous évaluez le routage de modèles, voici les points à régler d’abord. Parcourez-les dans cet ordre.

Qu’est-ce qu’un routeur de modèles ?

Un routeur de modèles est un système qui se situe entre vous et un ensemble de modèles, et qui choisit lequel traite chaque requête. Il lit la requête (le prompt, le contexte, le type de tâche) et l’envoie au modèle le plus à même de bien faire le travail au moindre coût. Les bons routeurs tiennent compte du type de tâche et de sa complexité, pas seulement de sa longueur. Les moins performants s’appuient sur une règle grossière pour orienter la requête et passent à côté de l’essentiel.

Comment le routage décide-t-il quel modèle utiliser ?

Les meilleurs systèmes classent chaque requête avant même qu’un modèle ne s’exécute. Le routeur Cursor, par exemple, utilise un classificateur pour chaque requête en se basant sur la requête, le contexte, la complexité de la tâche et le domaine, ainsi que sur ce qu’il sait du comportement de chaque modèle. Le travail d’UI est dirigé vers des modèles économiques, le travail d’interface vers le modèle au meilleur jugement, et les problèmes complexes à long horizon vers des modèles de raisonnement de pointe. La classification se fait en amont : le choix est donc arrêté avant même qu’un modèle coûteux soit appelé.

How routing worksYour requestPrompt + contextRouter classifierTask type + complexityCheaper modelRoutine workFrontier modelHard workYou set the tradeoff. The router picks the model per request.CostOptimize token spendBalanceDaily-driver qualityIntelligenceTop-tier quality
A request moves through a router classifier to a cheaper model for routine work or a frontier model for hard work. Modes are Cost, Balance, and Intelligence.

Le routage doit-il être automatique, ou les ingénieurs doivent-ils encore choisir ?

Les deux, mais à des niveaux différents. Le choix pour chaque requête doit être automatique, car personne n’a envie de choisir un modèle à la main des centaines de fois par jour, et la bonne réponse varie selon la tâche. En revanche, ce que les équipes veulent, c’est un moyen d’agir sur leur position globale dans le compromis entre coût et qualité. L’approche la plus courante propose quelques modes (coût, équilibre, qualité) qui déplacent toute l’équipe le long de cette courbe, tandis que la décision au cas par cas est prise en dessous.

Le routage nuit-il à la qualité ?

Non, à condition que le routeur soit évalué en fonction de la qualité, et pas seulement du coût. Le routage de modèles garde les tâches difficiles sur les modèles les plus performants et ne redirige que les tâches simples vers des modèles moins performants. Dans les tests A/B de Cursor sur des millions de requêtes, le mode Intelligence a atteint un niveau de satisfaction utilisateur proche de celui d’un modèle de pointe pour un coût inférieur d’environ 60 %, et les entreprises en accès anticipé ont constaté des économies de 30 à 50 % par rapport au routage de toutes les requêtes vers le modèle le plus performant, sans baisse de qualité. Pour la plupart des requêtes, le modèle qui fait bien le travail n’est tout simplement pas le plus cher.

Que devez-vous mesurer ?

Surveillez le coût par unité de travail réel, et pas seulement le coût par requête. Cela peut être mesuré par la satisfaction utilisateur (la personne a-t-elle pris le résultat et avancé, ou est-elle revenue le corriger ?) et le taux de conservation (quelle part du code généré est encore présente plus tard dans la base de code). Cursor présente le coût par commit comme le chiffre qui compte au final : dans nos tests, le routeur Cursor atteint 6.76 en Intelligence, contre $7.34 pour une référence 100 % Opus 4.8. Le coût par commit (ou par PR) est le chiffre à apporter dans une discussion budgétaire, car il relie la dépense au travail livré.

Cost per commitBalanceCursor Router$4.63IntelligenceCursor Router$6.76All Opus 4.8Baseline$7.34
Cost per commit is $4.63 for Cursor Router Balance, $6.76 for Intelligence, and $7.34 for an all-Opus 4.8 baseline.

Comment le routage gère-t-il la mise en cache et le changement de modèle ?

Changer de modèle au cours d’une conversation peut faire perdre le bénéfice du cache du prompt, ce qui ajoute un coût qu’une comparaison naïve avant/après ignore. Cursor en tient compte en incluant le coût des ratés de cache liés aux décisions de routage qu’il prend dans les économies qu’il annonce. Lorsque vous évaluez un routeur, demandez si ses chiffres tiennent compte du cache. Si ce n’est pas le cas, ils surestiment probablement les économies.

Comment utiliser le routage de modèles dans Cursor

Le routeur Cursor est le système de routage de modèles qui alimente Auto dans les forfaits Teams et Enterprise. Vous choisissez le niveau d’optimisation souhaité. Avec Équilibre et Intelligence, le routeur sélectionne le modèle adapté à chaque requête.

Choisissez un mode. Sélectionnez Auto dans le sélecteur de modèles, puis choisissez le mode d’optimisation. Coût optimise les dépenses en jetons. Équilibre correspond aux modèles de pointe que les utilisateurs privilégient au quotidien, et Intelligence vise une qualité de tout premier plan. Tous les modes Auto sont facturés au tarif catalogue du modèle sélectionné par le routeur.

Laissez-le classer. Avec Équilibre et Intelligence, le routeur lit chaque requête et l’achemine selon le type de tâche et son niveau de complexité, en réservant les tâches difficiles aux modèles les plus performants et en écartant les tâches routinières de la tarification des modèles de pointe. Grok 4.5 doit être activé, car le routeur l’utilise comme option économique lorsqu’il ne fait pas appel à un modèle de pointe.

Définissez les garde-fous (administrateurs). Activez le routeur par équipe ou par groupe, choisissez les modes que les membres peuvent utiliser, définissez le mode par défaut et autorisez ou bloquez des modèles spécifiques. Il est activé par défaut pour les forfaits Teams ; les administrateurs Enterprise l’activent depuis le tableau de bord.

Surveillez les chiffres. Suivez l’utilisation dans le tableau de bord d’utilisation pour voir quelle part passe par les modèles de Cursor par rapport aux autres, et vérifiez que les économies sont bien réelles avant d’étendre le déploiement.

Étape suivante : Activez Auto dans le sélecteur de modèles, choisissez Équilibre ou Intelligence, puis suivez l’installation complète sur cursor.com/docs/cursor-router. Les administrateurs peuvent activer le routeur et définir des garde-fous depuis le tableau de bord de l’équipe.

Associez le modèle à la tâche

Le routage de modèles fonctionne parce que, dans la plupart des cas, le modèle le plus puissant n’est pas le plus adapté à ce que vous faites. Associez le bon modèle à la bonne tâche, et vous maintiendrez un niveau de qualité élevé tout en payant bien moins pour le travail qui, au départ, n’avait pas besoin d’un modèle de pointe. Les routeurs qui tiennent vraiment leurs promesses s’appuient sur la complexité réelle des tâches, réservent les problèmes difficiles à des modèles capables et se jugent au coût par changement livré. Si cela correspond à la façon dont votre équipe travaille déjà, activez le routage pour une équipe très sollicitée, suivez le coût par commit pendant une semaine et laissez ce chiffre vous indiquer jusqu’où aller.

Commencez ici.

Classé dans : Modèles