模型

模型路由:用對模型、做對工作、付對價格

閱讀時間 1 分鐘

大多數團隊都在為其實不需要尖端模型的工作支付尖端模型的價格。有人會選擇自己能找到的最強模型,將它設為預設,之後每個請求都以最高費率處理。支出成長的速度,往往比最終交付成果的品質提升還快。

模型路由就是解法。它不會把每個請求都送到同一個模型,而是由路由器檢視每個請求,挑選最適合的模型。簡單的工作交給快速、便宜的模型;困難、需要長程規劃的工作則交給尖端模型。

模型路由正逐漸成為團隊使用 LLM 的標準層。最便宜且夠用的模型,和最昂貴的模型之間差距非常大,而你每天大部分的工作都落在簡單那一端。只要路由做得好,就能在維持品質的同時,大幅削減支出。這份指南接下來會說明路由實際如何運作、該衡量哪些指標才能確認它有效,以及如何啟用它。

為什麼模型路由現在很重要

有兩件事同時發生了變化。模型在各個價格帶都變得更強大,而隨著代理承擔越來越多工作,開發者透過它們送出的請求量也大幅增加。這兩者疊加起來,讓單一模型的預設選項變得相當昂貴。

大約有 60% 使用 Cursor 的開發者會選擇單一模型作為日常主力,這意味著例行工作也在支付尖端模型的價格,而 AI (人工智慧) 支出的成長速度遠遠快於輸出品質的提升。像 Composer 2.5 這類第一方模型,每百萬輸入 token 收費 2.50 美元,而尖端模型的成本則往往是它的數倍。當你的大部分用量都來自一般程式設計工作時,預設使用哪個模型,基本上就決定了帳單的大部分金額。

整個產業也得出了相同的答案。Microsoft 的 Foundry 提供了具備 cost、balanced 和 quality 模式的模型路由器。像 RouteLLM 這樣的研究系統也回報,能以接近尖端品質的表現大幅降低成本。這種做法如今到處都看得到,而這通常表示,背後的帳算起來很難不成立。

進行路由前值得先回答的疑問

如果你正在評估模型路由,以下是需要先釐清的幾件事。請依序逐一檢視。

什麼是模型路由器?

模型路由器是一種介於你與一組模型之間的系統,會決定每個請求該由哪個模型處理。它會讀取請求 (提示詞、上下文、任務類型) ,再將其送往最有可能以最低成本把工作做好的模型。優秀的路由器會根據任務類型與複雜度來判斷,而不只是看長度。較差的路由器則只依賴粗略的規則進行路由,結果往往抓不到重點。

路由如何決定要使用哪個模型?

較好的系統會在任何模型執行之前,先對每個請求進行分類。以 Cursor 路由器為例,它會根據查詢、上下文、任務複雜度和領域,並結合它對各模型行為的了解,對每個請求套用分類器。UI 工作會交給成本效益高的模型,介面相關工作會交給最有品味的模型,而複雜、需要長程規劃的問題則會交給尖端推理模型。分類會預先完成,因此在原本可能需要呼叫昂貴模型之前,選擇就已經決定好了。

How routing worksYour requestPrompt + contextRouter classifierTask type + complexityCheaper modelRoutine workFrontier modelHard workYou set the tradeoff. The router picks the model per request.CostOptimize token spendBalanceDaily-driver qualityIntelligenceTop-tier quality
A request moves through a router classifier to a cheaper model for routine work or a frontier model for hard work. Modes are Cost, Balance, and Intelligence.

路由應該自動進行,還是仍然由工程師自行選擇?

兩者都需要,只是層級不同。每次請求的選擇都應該自動進行,因為沒有人想一天手動挑選模型數百次,而且最佳答案也會隨著每個任務而改變。Teams 真正想要的是一個控制選項,用來決定整體要偏向成本與品質取捨的哪一端。常見的設計會提供幾種模式 (成本、平衡、品質) ,讓整個 Teams 沿著這條曲線調整,而每次請求的決策則由底層處理。

路由會降低品質嗎?

如果路由器衡量的是品質,而不只是成本,就不會。模型路由會把困難的任務交給能力最強的模型,只把簡單的工作分配給較低階的模型。在 Cursor 針對數百萬筆請求進行的 A/B 測試中,Intelligence 模式在使用者滿意度上幾乎與尖端模型相當,但成本低了約 60%;而搶先體驗的企業客戶,相較於把所有請求都路由到頂級模型,也節省了 30% 到 50% 的成本,且品質沒有下降。對大多數請求來說,真正能把事情做好的模型,其實不一定是最昂貴的那個。

你應該衡量什麼?

請關注每單位實際工作成果的成本,而不只是每次請求成本。這可以透過使用者滿意度 (使用者是接受結果後直接繼續,還是回頭修正?) 以及保留率 (產生的程式碼之後有多少仍留在程式碼庫中) 來衡量。Cursor 將每次提交成本作為最終關鍵數字:在我們的測試中,Cursor 路由器達到 Balance 為每次提交 6.76,而全 Opus 4.8 基準則為 $7.34。每次提交成本 (或每個 PR (拉取請求) 的成本) 才是你在預算討論中該拿出的數字,因為它能把支出和已交付的工作成果連結起來。

Cost per commitBalanceCursor Router$4.63IntelligenceCursor Router$6.76All Opus 4.8Baseline$7.34
Cost per commit is $4.63 for Cursor Router Balance, $6.76 for Intelligence, and $7.34 for an all-Opus 4.8 baseline.

路由如何處理快取與模型切換?

在同一段對話中切換模型,可能會錯失提示詞快取,因而增加成本,而粗略地比較切換前後往往不會把這點算進去。Cursor 會將其路由決策造成的快取未命中成本納入所報告的節省金額中。評估路由器時,請確認它的數據是否有考慮快取因素。若沒有,它們很可能高估了節省金額。

如何在 Cursor 中使用模型路由

Cursor 路由器是 Teams 和企業方案中 Auto 背後的模型路由系統。你可以決定最佳化要做到什麼程度。在 Balance 和 Intelligence 模式下,路由器會為每個請求挑選對應的模型。

選擇模式。 在模型選擇器中選取 Auto,然後選擇最佳化模式。Cost 可最佳化 token 支出。Balance 會對齊使用者日常偏好的尖端模型體驗,而 Intelligence 則以頂級品質為目標。所有 Auto 模式皆依路由後模型的牌價計費。

讓它自行分類。 在 Balance 和 Intelligence 模式下,路由器會讀取每個請求,並根據任務類型與複雜度進行路由,把較困難的工作交給能力最強的模型處理,並讓例行工作避開尖端模型的定價。Grok 4.5 需要先啟用,因為當路由器未呼叫尖端模型時,會將它作為兼顧成本效益的選項使用。

設定防護機制 (管理員) 。 你可以針對每個團隊或群組啟用路由器,選擇成員可使用的模式,設定預設,並允許或封鎖特定模型。Teams 方案預設為啟用;企業管理員可從儀表板啟用。

查看數據。usage 儀表板 中追蹤用量,查看有多少請求是透過 Cursor 的模型執行、多少是透過其他模型執行,並在擴大推行前確認節省是否確實存在。

下一步: 在模型選擇器中啟用 Auto,選擇 Balance 或 Intelligence,並依照 cursor.com/docs/cursor-router 的完整設定流程操作。管理員可從團隊儀表板啟用路由器並設定防護機制。

讓模型與任務相配

模型路由之所以有效,是因為對你大多數的工作而言,最強的模型很少是最合適的選擇。把模型和任務配對得當,就能在維持品質水準的同時,大幅降低那些原本根本不需要尖端模型的工作的成本。真正能帶來成效的路由器,會依據實際任務的複雜度進行路由,把棘手問題交給足以勝任的模型,並以每次已交付變更的成本來衡量自己。如果這符合你團隊既有的工作方式,就先為一個工作繁忙的團隊開啟路由,觀察一週的每次提交成本,然後讓那個數字告訴你該把它推到什麼程度。

從這裡開始。

分類於: 模型