模型路由:合适的模型,合适的任务,合适的价格
大多数团队都在为其实不需要前沿模型的工作支付前沿模型的价格。有人会选一个自己能找到的最强模型,把它设为默认选项,之后每个请求都会按最高费率处理。支出的增长速度,超过了最终交付质量的提升速度。
模型路由就是解决办法。它不是把每个请求都发给同一个模型,而是由路由器判断每个请求,并为其选择最合适的模型。简单任务交给快速、便宜的模型。困难、长周期的任务则交给前沿模型。
模型路由正逐渐成为团队使用 LLM 的标准层。最便宜的可用模型和最昂贵的模型之间存在巨大的价格差,而您一天中大多数工作其实都处在简单那一端。只要路由得当,您就能在保持质量的同时,显著减少支出。本指南接下来将介绍路由究竟如何运作、该衡量哪些指标来确认它是否生效,以及如何启用它。
为什么模型路由在当下如此重要
有两件事同时发生了变化。一方面,不同价位的模型能力都在提升;另一方面,随着智能体承担了更多工作,开发者通过模型发出的请求也大幅增加。两者叠加起来,默认只用单一模型就会变得很昂贵。
大约 60% 的 Cursor 开发者会选择单一模型作为日常主力,这意味着日常任务会按前沿模型的价格来运行,而 AI 支出的增长速度远快于输出质量的提升。像 Composer 2.5 这样的第一方模型,每百万输入 token 收费 2.50,而前沿模型的成本则要高出数倍。当您的大部分用量都来自普通编码工作时,默认使用哪种模型,基本就决定了账单的大头。
整个行业也得出了同样的结论。Microsoft 的 Foundry 推出了一个带有成本、平衡和质量模式的模型路由器。像 RouteLLM 这样的研究系统也报告称,在接近前沿质量的前提下,成本可以大幅下降。这个趋势正在各处同时出现,而这通常说明,背后的账非常清楚,几乎无可辩驳。
开始做路由之前,先回答这些关键问题
如果您正在评估模型路由,建议先明确以下几点。请按顺序逐一梳理。
什么是模型路由器?
模型路由器是位于您和一组模型之间的系统,负责决定由哪个模型处理每个请求。它会读取请求内容 (提示、上下文、任务类型) ,并将其发送给最有可能以最低成本出色完成任务的模型。好的路由器会综合判断任务类型和复杂度,而不只是看长度。差一些的路由器只会按粗略规则路由,结果往往不得要领。
路由如何决定使用哪个模型?
更好的系统会在任何模型运行之前,先对每个请求进行分类。以 Cursor Router 为例,它会结合查询、上下文、任务复杂度、所属领域,以及它对各个模型表现的了解,对每个请求运行分类器。UI 工作会交给性价比更高的模型,界面相关工作会交给最有“品味”的模型,而复杂的长周期问题则会交给前沿推理模型。分类是在一开始就完成的,因此在原本可能调用昂贵模型之前,就已经做好了选择。
路由应该自动进行,还是仍然由工程师选择?
两者都需要,只是层级不同。单次请求该选哪个,应该交给系统自动决定,因为没人愿意每天手动选上百次模型,而且最合适的答案会随着任务不同而变化。团队真正需要的,是一个能决定自己整体更偏向成本还是质量的调节杆。常见的设计是提供几种模式 (成本、平衡、质量) ,让整个团队沿着这条权衡曲线移动,而具体到每次请求的决策则由底层自动处理。
路由会影响质量吗?
如果路由器衡量的是质量,而不只是成本,就不应该。模型路由会把困难任务留给能力最强的模型,只把简单任务分配给较弱的模型。在 Cursor 的数百万次请求 A/B 测试中,Intelligence 模式在用户满意度上接近前沿模型,同时成本降低了约 60%;而获得早期访问资格的企业客户,相比把所有请求都路由到顶级模型,节省了 30% 到 50% 的成本,且质量没有下降。对大多数请求来说,能把事情做好的模型,本来就不一定是最贵的那个。
您应该衡量什么?
要关注每单位实际产出对应的成本,而不只是每次请求的成本。这可以通过用户满意度 (用户是直接采用结果继续往下做,还是回过头来修改?) 以及保留率 (生成的代码里,过后还有多少仍留在代码库中) 来衡量。Cursor 将每次 commit 的成本作为最终的核心数字进行报告:在我们的测试中,Balance 模式下每次 commit 的成本为 6.76,而全部使用 Opus 4.8 的基线为 $7.34。每次 commit 的成本 (或每个 PR 的成本) 才是您在预算讨论中应该拿出来的数字,因为它把支出和已交付的工作直接挂钩。
路由如何处理缓存和模型切换?
在一次对话中切换模型,可能会导致提示缓存失效,从而增加成本,而这种成本是简单的切换前后对比看不出来的。Cursor 会将其路由决策产生的缓存未命中成本纳入所报告的节省数据。评估路由器时,要问清楚它的数据是否考虑了缓存因素。如果没有,这些节省数字就偏乐观了。
如何在 Cursor 中使用模型路由
Cursor Router 是团队版和企业规划中 Auto 背后的模型路由系统。您可以决定优化力度。在 Balance 和 智能模式下,路由器会为每个请求选择模型。
选择一种模式。 在模型选择器中选择 Auto,然后选择优化模式。成本 可优化 token 支出。Balance 对齐大家日常常用的前沿模型,智能则以顶级质量为目标。所有 Auto 模式均按路由后所选模型的标价计费。
让它自动分类。 在 Balance 和 智能模式下,路由器会分析每个请求,并根据任务类型和复杂度进行路由:将复杂任务交给能力最强的模型,把常规任务从前沿模型的高价中分流出去。Grok 4.5 需要先启用,因为当路由器未调用前沿模型时,会将它作为高性价比选项使用。
设置防护规则 (管理员) 。 可按团队或群组启用 Router,选择成员可使用的模式,设置默认值,并允许或禁用特定模型。它在团队版中默认开启;企业管理员可从仪表盘启用。
查看数据。 在用量仪表盘中跟踪用量,查看有多少请求通过 Cursor 的模型运行、多少通过其他模型运行,并在扩大推广范围前确认节省是否真实有效。
下一步: 在模型选择器中开启 Auto,选择 Balance 或 智能,并按照 cursor.com/docs/cursor-router 完成完整设置。管理员可通过团队仪表盘启用 Router 并设置防护规则。
让模型与任务相匹配
模型路由之所以有效,是因为对你日常的大多数工作来说,最强的模型往往并不是最合适的。让模型与任务相匹配,你就能在保持质量水准的同时,大幅降低那些原本就不需要前沿模型的工作的成本。真正有效的路由器,会根据真实的任务复杂度进行路由,让有能力的模型处理困难问题,并以每次成功交付变更的成本来衡量自身效果。如果这符合你团队现有的工作方式,那就先为一个工作量大的团队开启路由,观察一周内每次 commit 的成本,再让这个数字告诉你该把它推到什么程度。