將智慧投資的回報最大化
David Pan
去年接近尾聲時,代理式工程終於開始真正運作。一旦奏效,一切便同步成長。更多工程師開始採用這些工具,並用於更多任務;而隨著思考與工具呼叫增加,每項任務的成本也隨之提高。這三者相乘,於是許多工程團隊眼看 AI 支出沿著 J 型曲線攀升。
這些團隊會告訴你,這筆支出值得。他們交付得更快,也獲得了實質價值。但不論是否值得,他們的支出正迅速超出 2026 年預算;而我們目前幾乎接觸到的每位客戶,都有某種形式的相同要求:持續加速,同時嚴格控管成本。
說來容易,做起來難。以下是我對一些最常見問題的看法。
1. 我該使用較便宜的模型嗎?
大家都看得出來 Fable 和 Opus 相當昂貴,因此最直接的問題就是能否改用更便宜的選項。但這樣的疑慮很合理:如果便宜模型產出的成果必須重做,其實根本沒有省到錢。你付了兩次錢,還浪費了時間。
去年底,Opus 4.5 是唯一能讓你放心處理嚴肅工程工作的模型。如今,已有十幾個模型的表現超越它。在頂尖模型中,智慧程度的差距如今相當小,但價格與速度的差距則非常大。只要選對模型,同一項任務往往能以一小部分成本達到同樣的效果。
難就難在如何選對。沒有任何模型最擅長所有任務,而且尖端模型的格局每隔幾週就會改變。要求工程師把這套矩陣記在腦中並不合理。事實證明,這也是 AI (人工智慧) 能勝任的另一項工作。我們打造了模型路由器,以專門訓練的模型驅動,專門負責這件事:判斷哪些模型能有把握地處理特定任務,然後將任務路由至符合標準的最便宜模型。我們的路由器以低 68% 的成本,提供 Fable 等級的使用者滿意度。
所以,較便宜的模型確實能省下真金白銀。只是別讓工程師負責路由。
2. 我該使用開放權重模型嗎?
原則上,當然可以。如果開放權重模型在特定任務上能提供最佳的每美元效能,就該納入您的模型組合,最好和其他模型一樣由路由器在背後調度。
但就目前而言,截至本文撰寫時,它們還不在帕累托前緣上。當我們執行評測,並考量 token 效率而非僅看表面價格時,領先的封閉模型每美元仍能提供更高的智慧水準。
好消息是,即使您從未執行過開放權重模型,仍能從中受益。各大領先實驗室都密切關注開放權重生態系,而這肯定也是影響封閉模型定價的因素。因此,請繼續支持開放權重模型。不管怎樣,您都會受益。
3. 我應該使用雲端代理嗎?它們不會很貴嗎?
目前「軟體工廠」的概念備受矚目:成群的雲端代理全天候產出軟體。工程團隊主管常會說:聽起來很棒,但我已經花太多錢了。
可以理解。但雲端代理可能增加的許多支出,其實每天都已經在您的公司發生。工程師早已使用代理協助處理程式碼審查、合併衝突、CI 失敗等問題。只是目前這些任務同樣耗費大量工程時間,而且不同工程師的執行方式並不一致。
以程式碼審查為例。將薪資、福利和管理費用納入計算後,一名工程師每小時的成本可能為 50。一次 Bugbot 審查不到一美元,而且持續進步。最新版本速度提升超過 3 倍、成本降低 22%,並能找出多 10% 的錯誤。這筆帳不需要複雜的 投資報酬率 模型就算得出來。
任何雲端代理工作流程都有一套簡單的準則:先讓它能運作,再讓它做到最好,最後再降低成本。時間站在您這邊。隨著時間推進,智慧的成本只會持續下降。
4. 我應該追蹤哪些指標?
選擇能對應您想達成目標的指標。通常可分為三個階段。先從採用情況開始:大家是否真的在使用這些工具?接著衡量工程指標:是否能更快交付?交付是否更有效率?只有證明這些後,才應嘗試將這些成果與業務連結起來。
針對採用情況,請不要看程式碼行數和 token 支出。兩者都很容易被操弄,也可能促使人們採取適得其反的行為。應改為衡量每天使用這些工具的工程師人數,以及他們的使用深度。
以下是一些實用的工程指標。請搭配防護機制指標,以便及早發現這些成果是否在其他方面付出了代價。
- 開發速度: PR (拉取請求) 處理速度、工作單完成率、故事點數完成率。相較於導入 AI 前基準的端到端專案交付速度。
- 效率: 透過自動化重複任務所節省的時間,以及這些工作流程中每項任務的成本。
- 防護機制: 錯誤數量、回退率、程式碼變動率。
衡量對業務的影響最困難,我不會假裝這有簡單的答案。您的 AI 支出越高,將其與業務成果連結的壓力就越大。這是合理的。公司的董事會並不在意工程指標;他們想看到對營收與獲利的影響。
5. 我應該為每位工程師設定支出預算嗎?
很可能應該。具體如何設定,取決於貴公司的情況,並沒有唯一正確的數字。以下是幾項普遍適用的建議。
請使用可調高的軟性上限,而非硬性上限,並讓首次調高上限的流程盡可能順暢。這能讓大家意識到支出,同時將決定權主要交給工程師。隨著調高的幅度變大,再加強審核。AI 支出和聘請承包商並沒有太大差別;您不會為此開出空白支票。
也要預期會出現冪次法則。有些工程師的支出會遠高於其他人,這不一定是壞事。我們的用量資料顯示,重度使用者與其他使用者之間存在明顯差距,而支出最高的使用者往往也是全公司運用 AI 效率最高的使用者之一。
6. 我該如何檢視 AI 支出?
你可能不喜歡這個答案:你應定期檢視支出,並與財務團隊合作。大多數軟體組織早已以嚴謹的方式追蹤並最佳化雲端支出。若你正在閱讀這篇文章,你的 AI 支出可能已大到值得同等重視。你的財務團隊會因此感謝你。這些問題是 CFO 最關注的議題,因此我們專門成立了 CFO Council 來一同深入探討。
將用量資料分為四個面向:依團隊、依專案、依工作流程,以及依工作類型。判斷自己是否具備所需的可視性,一個好方法是看看能否回答以下問題:
- 我的支出中,有多少用於三項最重要的產品計畫?
- 團隊中的一位工程師上個月花了 $10k 購買 Token。這筆支出有帶來成效嗎?
- 修正一個錯誤的 Token 成本中位數是多少?趨勢如何?
找出異常值,以及任何金額龐大的「未知」支出類別。持續深入分析,直到你了解每一筆支出,並確信它們正為業務創造價值。
接著根據發現採取行動。在 AI 確實奏效的領域加大投入。為投資報酬率高的使用者提供更多預算,而不是更少。最後,盡量讓預算調整接近零和;若某個領域需要大幅超支,資金就必須從其他地方挪出。
7. 我該如何指導團隊?
當不必自己買單時,很容易養成不好的習慣,而在許多組織中,團隊甚至從未看過帳單。因此,應先提升成本透明度。
接著,將責任一路下放到各級管理者。第一線工程經理應將確保團隊的 AI (人工智慧) 支出物有所值視為職責的一部分,就像評估招募決策或大筆技術債投資一樣。
做好這兩件事,大部分的指導工作就會水到渠成。工程師天生會追求最佳化。讓他們掌握成果的成本與責任歸屬,他們自然會找到最有效率的路徑。