介绍 Grok 4.6
今天,我们与 SpaceXAI 共同发布 Grok 4.6。
Grok 4.6 基于 Grok 4.5 打造,特别专注于长时间运行的智能体,以及更复杂的交互和视觉工作。无论是研究主题、分析信息、处理跨代码库的工作,还是将想法转化为精良的应用或工作成果,它都能持续完成需要多个步骤的复杂任务。
Grok 4.6 在多项智能体编程和知识工作基准测试中展现出前沿智能水平。在 Artificial Analysis Intelligence Index 上,它与 GPT-5.6 Sol 持平;该指数是由九项基准测试构成的综合评分。

Grok 4.6 今日已在 Cursor 和 Grok Build 中推出。首周我们将在 Cursor 和 Grok Build 中提供 2 倍包含的用量。
训练 Grok 4.6
与 Grok 4.5 相比,Grok 4.6 进行了更长时间的补充训练,采用了针对推理和高级技术概念的精选模型生成数据、高质量工程数据,以及改进的优化器和训练方法。这为后续的 SFT 和 RL 阶段奠定了更坚实的基础。
随后,我们使用 Grok 4.5,针对不同推理投入级别、智能体框架以及 STEM、软件工程和知识工作等领域,重新生成了 SFT 轨迹。我们通过基于模型的检查筛除了存在问题的轨迹。最终得到的 SFT 检查点表现强劲,行为也有所改善。
Grok 4.6 在广泛的智能体 RL 任务上进行了训练,包括知识工作、通用编程,以及 kernel 优化、Web 开发、计算机辅助设计等领域的特定环境。
将宏大创意变为可用项目
我们在旨在拓展 Grok 4.6 能力边界、考验其能否持续完成多步骤任务的项目中对其进行了测试。我们发现,该模型尤其擅长将宽泛的产品创意转化为可用的初始版本。它能够研究陌生领域、搭建应用结构、实现核心交互,并通过多轮反馈持续完善成果。
在更长的任务轨迹中,我们还开始看到更多自主测试与验证:模型会在继续推进前检查自己的工作。
与我们通常在 Grok 4.5 中看到的表现相比,Grok 4.6 在视觉和交互项目中能产出更强的初稿。给定一个具体的产品创意,它能够一次性确立应用的结构和视觉语言。这使其尤其适用于这样的项目:最快获得良好结果的方式是先从一个实质性的成果开始,然后在循环中迭代。
安全性与功能
Grok 4.6 的安全防护措施已得到改进,并根据模型的功能进行了校准。
我们的安全体系旨在最大限度兼顾合法使用场景中的实用性与安全性,使 Grok 4.6 能够在漏洞修复、加快工程设计周期和助力 AI 研究等领域既有用又安全。
我们的安全防护评估工作体现了 Grok 4.6 扩展后的功能,包括我们迄今最广泛的部署前功能测试与安全防护校准测试,以及广泛的部署后第三方测试。
开始使用 Grok 4.6
Grok 4.6 现已在 Cursor 和 Grok Build 中推出。也可通过 SpaceXAI API 以及包括 OpenRouter、Vercel 和 Cloudflare 在内的合作伙伴使用。
定价为:每百万输入 token 6。另有快速变体,价格为两倍。
第一周内,我们将在 Cursor 和 Grok Build 中提供 2 倍用量。