客戶

Basis 如何運用 Cursor 打造長時程會計代理

Basis 從第一天起就建立在 Cursor 上。其會計代理完成合夥事業報稅表的速度最高快 6 倍,並深受前 25 大會計師事務所中 40% 的信賴。

閱讀時間 1 分鐘

Basis 專為會計師打造 AI 代理。這些代理能在背景自主完成長時程、高複雜度的會計工作流程,並產出可直接審查的成果,讓會計團隊專注在專業判斷與客戶服務上。

這些代理為頂尖會計團隊承擔動輒數小時、且不容出錯的工作:月結、企業與合夥事業報稅表、審計規劃與實地查核。Basis 從創立第一天起就將整間公司建立在 Cursor 上。他們以對待程式碼的同等嚴謹態度,處理代理所讀取的上下文 (提示詞、技能、指示、工具說明) ,而 Cursor 正是他們讀取與修訂這些內容的地方。

無法濃縮成單一提示詞的工作

長時程並不只是指代理會連續執行好幾個小時,而是指在一條 軌跡 上要做出數百個決策,且後續步驟往往取決於先前的步驟。系統必須保留相關狀態、納入 tool call 的結果,並在失敗後復原,有時處理的資訊量還超出單一 上下文 window 所能容納的範圍。錯誤會層層累積:早期的一個小失誤,可能影響後續的研究、計算、tool call 與產物,而最終結果卻未必看得出問題從何而來。

會計工作讓這件事更加棘手,原因有三:

  1. 許多結果並沒有低成本且客觀的檢驗方式。
  2. 取自真實生產工作的標準答案範例,建立成本高昂且難以規模化。
  3. 最終成果可能需要數小時甚至數天才能產出並完成審查。

即使最終結果正確,也可能掩蓋了不可靠的過程。代理可能在缺乏研究依據的情況下得出正確的報稅表、在未保留來源的情況下擷取到正確的數字,或是透過無法通用的流程做出一份可用的工作簿。結果評估仍然重要,但執行成本高昂,而且無法解釋一條長 軌跡 中每個關鍵決策的來龍去脈。

上下文是正式環境的輸入

代理的最終輸出只是整個系統的一環。它的行為取決於工作過程中所接收到的上下文:指示、領域知識、範例、工具說明、技能、記憶,以及其他執行期資訊。這些上下文以自然語言撰寫,因此工程師必須親自讀過。

傳統程式不論檔案整理得多整齊,對同一份有效程式碼的解讀都不會改變。但在語言模型上,上下文的組織方式與用字遣詞會左右模型接下來的行為。一句含糊的敘述、一個被埋沒的例外情況,或一個具誤導性的範例,都可能改變正式環境中的行為。產生上下文檔案後未經閱讀就直接上線,是一種正式環境的風險。

行為規格讓標準變得明確

行為規格是一份 Markdown 檔案,用來定義 代理 在特定情境中應反覆展現的行為。它是寫給審查已記錄軌跡的人員與評審者看的,既不是提示詞,也不會顯示給 代理。

一份好的規格會清楚說明:該行為在何時適用、代理 應檢視哪些證據、應做出什麼決策、後續應採取什麼動作、證據不完整時該怎麼辦,以及什麼情況算是失敗。目標是讓行為能被評判,而不必為每個步驟寫死腳本。

評審者會收到規格、可觀察的軌跡,以及證據 (tool call、產物、檢索到的來源、決策紀錄) ,並回傳 true、false 或 NA。如此一來,團隊即使沒有整體任務的標準答案,也能評估流程中選定的部分。

Cursor 是他們修訂 代理 的地方

Basis 使用 Cursor 來打造並完善自己的 代理。工程師會用 Markdown 開啟一份行為規格文件,逐句檢視,詢問模型某段敘述是否太過模糊或太過脆弱,接著修訂該段落,並在同一個視窗中預覽完成的文件。他們也在同一個環境中完善 代理 實際看到的提示詞與上下文:技能、指示、工具說明。

Cursor 之所以適合這類工作,原因在於:

  • 真正的編輯器,能讀取並修訂上下文與規格的用字。
  • Markdown 預覽 (編輯與即時預覽並行) 。Basis 共同創辦人 Mitch Troyanovsky 稱這是在迭代規格、技能與其他 Markdown 文件時,最被低估的差異化優勢。
  • 直接與模型協作,就在文字所在的同一個環境裡。
  • 迭代過程中可以輕鬆切換模型。
  • 並排檢視:檔案與 代理 視窗形成一個循環。人人都有 代理 視窗,差別在於能否檢視並修改上下文。

Cursor 是我們檢視形塑 代理 之上下文的地方,並在此不斷修訂,直到行為穩定為止。

Mitch Troyanovsky
Basis 共同創辦人

開發循環

Basis 的工程師在 Cursor 中撰寫並完善行為規格。代理在 Basis 執行環境中運行,由評審者依據規格評估所記錄的軌跡。

  1. 團隊就一項值得衡量的重複性行為達成共識。
  2. 工程師在 Cursor 中撰寫或完善行為規格。
  3. 代理在生產環境中執行工作,產生一筆軌跡記錄。
  4. 評審者依據規格評估每項行為,回傳 true、false 或 NA。
  5. false 的判定代表預期行為與執行環境實作之間存在落差。
  6. 團隊更新執行環境的上下文、工具、提示詞或執行框架,並在 Cursor 中修訂相關措辭。
  7. 團隊再次運行代理,衡量行為是否有所改善。

規格與執行環境彼此分離。規格即為標準,實作則持續調整,直到代理能穩定達成標準為止。

行為規格這套做法,源自 Basis 為會計領域打造生產級代理的經驗。Basis 與 Braintrust 將其以開放標準的形式發布,讓其他團隊也能以相同的通用格式定義並評估代理行為。

就算稅務答案正確,背後仍可能藏著糟糕的流程。我想知道的是代理有沒有查核主要依據,而不只是答案對不對。規格就是我們評判這件事的依據。

Mitch Troyanovsky
Basis 共同創辦人

作品本身就是最好的證明

以下就是這些成果在實際生產環境中的樣貌。

  • Basis 的代理能針對單一交付成果執行 5 小時以上的作業。
  • 在 Form 1065 合夥事業報稅表上,人力約需 30 至 40 小時的工作,Basis 代理約 6 至 7 小時即可完成。
  • 前 25 大事務所中有 40% 信賴 Basis,更多領先的會計師事務所也在採用。

最有力的證明就是作品本身:代理在漫長的軌跡中做出大量決策,交付專業會計師實際審查並使用的成果。

隨著代理承擔更長期、影響更重大的工作,其上下文也成為一項正式環境的輸入。工程師必須檢視它、了解它,並加以修訂。

Cursor 正是 Basis 維護這些上下文的地方。行為規格讓選定的預期明確化;Braintrust 則評估這些行為是否真的出現在實際軌跡中。失敗案例會告訴團隊該在執行環境中調整什麼。

分類於: 客戶

作者: Cursor Team