Basis 如何借助 Cursor 构建长周期会计智能体
Basis 从第一天起就基于 Cursor 构建。其会计智能体完成合伙企业纳税申报的速度最高提升 6 倍,并赢得了前 25 大会计师事务所中 40% 的信赖。
Basis 专为会计师打造 AI 智能体。它们在后台自主完成长周期、高复杂度的会计工作流,并交付可直接审查的成果,让会计团队得以专注于专业判断与客户服务。
这些智能体为顶尖会计团队承担耗时数小时、事关重大的工作:月末结账、企业与合伙企业纳税申报、审计规划与现场作业。Basis 从第一天起就把整家公司构建在 Cursor 之上。对于智能体读取的上下文 (提示、技能、指令、工具描述) ,他们像对待代码一样严谨,而 Cursor 正是他们读取和修改这些内容的地方。
无法化简为单条提示的工作
长周期并不只是指智能体要运行数小时,而是指在一条轨迹上要做出数百个决策,且后续步骤往往依赖于先前的步骤。系统必须保留相关状态、吸收工具调用的结果,并从失败项中恢复,而所涉及的信息量有时会超出单个上下文窗口所能容纳的范围。错误还会层层累积:早期的一个失误可能影响后续的研究、计算、工具调用与产物,而最终结果却未必能看出问题究竟始于何处。
会计场景让这件事更加困难,原因有三:
- 许多结果没有低成本、客观的检验方式。
- 取自真实生产工作的基准真值样例创建成本高昂,且难以规模化。
- 得出并审查一个最终结果可能需要数小时甚至数天。
即便最终结果正确,背后也可能是一个并不可靠的过程。智能体可能在缺乏研究依据的情况下得出正确的纳税申报表,可能提取出正确的数字却未保留其来源,也可能通过一套无法推广的流程产出一份可用的工作簿。结果评估依然重要,但运行成本高昂,而且它无法解释一条长轨迹中每一个关键决策。
上下文是一种生产输入
智能体的最终输出只是整个系统的一环。它的行为取决于它在工作过程中接收到的上下文:指令、领域知识、示例、工具描述、技能、记忆以及其他运行时信息。这些上下文都以自然语言写成,因此工程师必须亲自阅读。
传统程序无论文件组织得是否整洁,对同一段有效代码的解释始终一致。而对语言模型来说,上下文的组织方式和措辞会直接影响模型接下来的行为。一句含糊的表述、一个被淹没的例外情况,或是一个具有误导性的示例,都可能改变生产环境中的行为。生成一个上下文文件却不加阅读就直接上线,本身就是一种生产风险。
行为规格说明让标准变得明确
行为规格说明是一个 Markdown 文件,用于定义智能体在特定情境下应反复表现出的行为。它写给审查记录下来的轨迹的人员和裁决者看,不是提示,也不会展示给智能体。
一份实用的规格说明应当讲清楚:该行为在何时适用、智能体应检查哪些证据、应做出什么决策、随后应采取什么行动、证据不完整时该怎么办,以及怎样算失败。目标是让行为可被裁决,而不必把每一步都写死成脚本。
裁决者会收到规格说明、可观察的轨迹以及证据 (工具调用、产物、获取到的来源、决策记录) ,并返回 true、false 或 NA。这样,团队无需为整个任务准备完整的标准答案,也能评估流程中选定的环节。
他们在 Cursor 中修订智能体
Basis 使用 Cursor 构建并打磨自己的智能体。工程师在 Markdown 中打开一份行为规格说明,逐句推敲,向模型确认某句话是否过于含糊或过于死板,修订该段内容,并在同一个窗口中预览成稿。他们也用同一套环境来打磨智能体真正看到的提示与上下文:技能、指令、工具描述。
Cursor 之所以适合这项工作:
- 真正的编辑器,可以阅读并修订上下文和规格说明的措辞。
- Markdown 预览 (编辑与实时预览并行) 。Basis 联合创始人 Mitch Troyanovsky 称,这是迭代规格说明、技能及其他 Markdown 文档时一项被低估的差异化优势。
- 直接与模型协作,就在文本所在的同一环境中。
- 迭代过程中可轻松切换模型。
- 并排布局:文件与智能体窗口构成一个循环。人人都有智能体窗口,区别在于能否检视并修改上下文。
在 Cursor 中,我们检视塑造智能体行为的上下文,并不断修订,直到行为稳定下来。
开发循环
Basis 的工程师在 Cursor 中编写并打磨行为规格说明。智能体在 Basis 运行时中运行,由裁决者依据规格说明评估记录下来的轨迹。
- 团队就某个值得衡量的重复性行为达成一致。
- 工程师在 Cursor 中编写或打磨行为规格说明。
- 智能体在生产环境中执行工作,产生一条记录下来的轨迹。
- 裁决者依据规格说明评估每项行为,返回 true、false 或 NA。
- false 的裁决说明预期行为与运行时实现之间存在差距。
- 团队更新运行时上下文、工具、提示或执行框架,并在 Cursor 中修订相应措辞。
- 团队再次运行智能体,衡量行为是否有所改善。
规格说明与运行时保持分离。规格说明即标准,实现则不断调整,直到智能体能稳定达标。
行为规格说明这一方法源自 Basis 为会计场景构建生产级智能体的经验。Basis 与 Braintrust 将其作为开放标准发布,让其他团队也能用同一套通用格式来定义和评估智能体行为。
税务答案正确,背后的过程仍可能很糟糕。我想知道的是智能体有没有核查一手权威依据,而不只是纳税申报结果对不对。规格说明就是我们判断的依据。
工作本身就是最好的证明
这些工作在生产环境中是这样的。
- Basis 智能体在单个交付成果上完成 5 小时以上的工作量。
- 一份 Form 1065 合伙企业纳税申报,人工大约需要 30 到 40 小时,Basis 智能体大约 6 到 7 小时即可完成。
- 前 25 大事务所中有 40% 信赖 Basis,更多领先会计师事务所也在使用。
最有力的证明就是工作本身:智能体在长轨迹中做出大量决策,交付出可供专业会计师审查和使用的成果。
随着智能体承担的工作周期更长、影响更大,它们的上下文也成为一种生产输入。工程师必须能够检视、理解并修改这些上下文。
Cursor 正是 Basis 维护这些上下文的地方。行为规格说明把选定的预期明确写出来,Braintrust 评估这些行为是否真的出现在实际轨迹中,失败项则告诉团队该在运行时中改什么。