Grok 4.5 编程能力深度解读:Cursor 共训、Grok Build 与工程基准
从 Cursor 联合训练、Grok Build 编程智能体、Terminal Bench 与 DeepSWE 等真实工程评测,判断 Grok 4.5 是否适合代码生成、缺陷修复和团队级 Agent。
Grok 4.5 是一款明显偏向真实工程与长时智能体任务的前沿模型:终端操作强、输出速度快、Token 利用率高,但在最难的统一缺陷修复评测中并非第一。 它最值得关注的地方不是某一个跑分,而是 SpaceXAI、Cursor 数据、Grok Build 执行环境和低价 API 组成了一条从训练到分发的完整工程链路。
如果你主要关心 API 账单和竞品价格,请先看:Grok 4.5 API 价格深度对比。关于 Grok 的产品时间线,可参考什么是 Grok?。
Grok 4.5 为什么被称为“为真实工程而生”?
传统代码模型常用静态题库训练:输入一道明确问题,输出一段代码。真实软件工程却包含代码库探索、依赖安装、终端操作、测试失败、日志分析、方案回滚和多轮验证。
Cursor 官方发布说明确认,Grok 4.5 是 Cursor 与 SpaceXAI 共同训练的混合专家模型(Mixture of Experts,MoE)。训练使用了数万亿 Tokens 的 Cursor 数据,其中不仅包含代码,还包含开发者如何与代码库、软件工具和 Agent 交互的轨迹。
这种数据更接近“开发过程”而不是“最终答案”,因此模型学习到的重点包括:
- 如何进入陌生仓库并定位相关文件;
- 如何选择终端、搜索、编辑和测试工具;
- 如何在首次方案失败后恢复并重试;
- 如何根据测试或验证器判断任务是否真正完成;
- 如何在长任务中控制步骤和上下文。
Cursor 还强调,Grok 4.5 的训练数据并不只覆盖软件工程,也加入了高质量 STEM 任务、研究论文与知识工作。这解释了为什么 SpaceXAI 同时把它用于 Word、PowerPoint、Excel 和更通用的 Agent 场景。
训练信息核验:已知与未知
| 项目 | 当前可确认的信息 |
|---|---|
| 模型架构 | Cursor 确认为 MoE |
| 联合训练 | Cursor 与 SpaceXAI 共同训练 |
| Cursor 数据 | 数万亿 Tokens 的代码库与开发者-Agent 交互数据 |
| 强化学习 | 数十万项多步骤软件工程和技术任务 |
| 训练硬件 | 数万张 NVIDIA GB300 GPU |
| 参数规模 | 未披露,无法确认“1.5 万亿参数” |
| 上下文窗口 | 500K Tokens |
SpaceXAI 的官方发布页称,其强化学习系统允许 Agent rollout 持续数小时,同时在大规模异步训练架构上继续学习。这个方向和真实编程 Agent 的需求高度一致:难点不再只是生成一段函数,而是在长链路中保持目标、使用工具并验证结果。
四组工程基准怎么读?
Grok 4.5 的公开成绩呈现出明显的“偏科”:终端任务和长时工程竞争力强,统一框架下的高难缺陷修复仍落后于最强对手。
| Benchmark | Grok 4.5 | GPT-5.5 | Opus 4.8 | Fable 5 | 解读 |
|---|---|---|---|---|---|
| DeepSWE 1.0 | 62.0% | 64.31% | 55.75% | 66.1% | 接近第一梯队,但各家使用自己的 harness |
| DeepSWE 1.1 | 53% | 67% | 59% | 70% | 统一 mini-swe-agent 下差距更明显 |
| Terminal Bench 2.1 | 83.3% | 83.4% | 78.9% | 84.3% | 与 GPT-5.5 几乎持平,距离榜首 1 个百分点 |
| SWE Bench Pro | 64.7% | 58.6% | 69.2% | 80.4% | 超过 GPT-5.5,但落后 Opus 4.8 与 Fable 5 |
此外,SWE Marathon 的公开结果为 Grok 4.5 29%、Opus 4.8 26%、Fable 5 24%。这类长时任务更能反映模型在持续调查和多步骤执行中的韧性。
Terminal Bench 2.1:Grok 4.5 最亮眼的能力区
Terminal Bench 测试模型在命令行环境里完成复杂任务的能力。Grok 4.5 的 83.3% 与 GPT-5.5 的 83.4% 几乎相同,只比 Fable 5 低 1 个百分点。
这对 DevOps、依赖排查、构建修复、数据处理脚本和容器任务很有参考价值。它说明 Grok 4.5 不只是“会写代码”,还能够在工具环境中执行步骤。
DeepSWE 1.1:不能回避的能力短板
DeepSWE 1.1 使用 DataCurve 的 mini-swe-agent 框架运行真实 GitHub 缺陷修复。Grok 4.5 得分 53%,落后于 Opus 4.8、GPT-5.5 和 Fable 5。
这意味着遇到最复杂的跨文件逻辑缺陷时,最高成功率仍可能来自更昂贵的模型。一个实用的生产策略是模型路由:让 Grok 4.5 处理大多数高频任务,把连续失败或高风险问题升级给更强模型与人工工程师。
为什么同一个模型在不同榜单上差异这么大?
Benchmark 分数不仅取决于模型,也取决于 Agent harness、工具权限、推理档位、Token 预算、超时设置与验证方式。DeepSWE 1.0 允许各供应商使用自己的运行框架,而 1.1 使用统一的 mini-swe-agent,因此两组结果不能直接混为一谈。
Cursor 还主动披露:Grok 4.5 的训练数据曾意外包含较早的 Cursor 代码库快照,可能让它在 CursorBench 上占优势,影响幅度无法确定。Cursor 因此没有在发布比较中采用该项成绩,并表示未来模型已移除相关数据。这个披露也提醒团队:与训练数据接近的榜单,可能高估模型迁移到自有仓库后的效果。
4.2 倍 Token 效率意味着什么?
在 SpaceXAI 公布的 SWE Bench Pro 运行中:
- Grok 4.5 平均输出 15,954 Tokens/任务;
- Claude Opus 4.8 max 平均输出 67,020 Tokens/任务;
- Grok 4.5 的输出量约少 4.2 倍。
更短的推理轨迹通常带来三重收益:输出费用更低、任务完成更快、长 Agent 循环更不容易撑爆上下文。配合 2 美元输入、6 美元输出的标准 API 价,这种效率是 Grok 4.5 商业吸引力的重要组成部分。
但“Token 更少”不自动等于“工程质量更高”。如果短轨迹遗漏边界条件,导致测试失败或二次返工,节省的 Token 就没有意义。企业评测应同时记录成功率、回归缺陷、人工修改量和总用时。
Grok Build:模型如何变成编程智能体
Grok Build 是 SpaceXAI 推出的终端原生编程 Agent,Grok 4.5 现已成为其默认模型。它采用键盘优先的工作方式,面向专业软件工程和复杂代码任务。
Grok Build 的关键能力包括:
- Plan、Review、Approve:复杂任务先生成计划,用户可批准、评论或重写步骤;
- 并行 Subagents:把可独立推进的工作分给多个子智能体;
- 终端原生执行:直接搜索仓库、修改文件、运行命令和验证结果;
- 长任务管理:适合需要持续调查、测试和修复的工程流程;
- 办公工作延伸:SpaceXAI 展示了其处理 Excel 多工作表、公式、联网研究和备注的能力。
模型本身提供“推理能力”,Agent harness 则提供工具、权限、状态和验证闭环。二者缺一不可。因此,Grok 4.5 在 Grok Build、Cursor 或自研 Agent 中的表现,可能比单轮聊天窗口更能代表它的真实工程价值。
Grok 4.5 在 Cursor 中如何使用?
截至 2026 年 7 月 10 日,Grok 4.5 已进入 Cursor 桌面端、Web、iOS、CLI 和 SDK,并包含在个人与团队计划的第一方模型池中。Cursor 发布时还提供首周双倍用量;这类限时权益应以 Cursor 当前页面为准。
Cursor 公布了两个价格档:
| Cursor 中的版本 | 输入价格 | 输出价格 |
|---|---|---|
| Grok 4.5 base | $2 / 1M | $6 / 1M |
| Grok 4.5 fast | $4 / 1M | $18 / 1M |
Fast 版本用更高价格换取更快服务。是否值得选择,取决于等待时间对团队流程的影响,而不是单看 Tokens/秒。
通过 API 快速调用 Grok 4.5
SpaceXAI 的 Responses API 与 OpenAI 风格接口兼容。最小 curl 示例:
curl https://api.x.ai/v1/responses \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $XAI_API_KEY" \
-d '{
"model": "grok-4.5",
"input": "Inspect this bug report, propose a fix, and list the tests you would run."
}'生产环境还应设置稳定的缓存键、限制工具权限、记录每轮 Token 和工具调用,并对代码执行使用隔离沙箱。官方支持 Function Calling、Web Search、X Search 与 Code Execution,具体配额以 grok-4.5 开发者文档为准。
团队选型:哪些任务优先给 Grok 4.5?
适合作为默认模型
- 终端操作、构建修复和常规缺陷排查;
- 高频代码生成、重构、测试补全和文档更新;
- 对成本敏感、可自动验证的大规模 Agent 队列;
- 需要长上下文和多工具配合的代码库任务;
- 研究、表格、演示文稿等跨软件知识工作。
适合作为升级模型之前的第一层
对高风险核心模块,可以先让 Grok 4.5 分析、定位并提出补丁。如果自动测试失败、连续两轮未解决,或触及支付、认证、安全边界,再升级到在目标任务上成功率更高的模型和人工审核。
不应省略人工审批
涉及数据库迁移、权限系统、生产配置、依赖大版本升级和安全修复时,不应让任何模型在无审批条件下直接合并或部署。低价格只会让调用更容易,不会自动降低错误的业务影响。
如何做一轮可信的内部评测?
- 从真实仓库选取 30—50 个已关闭问题,覆盖简单、中等和困难任务;
- 给所有候选模型相同的工具、超时、推理预算和初始提示;
- 记录一次通过率、总 Token、墙钟时间、重试次数和人工修改行数;
- 用隐藏测试验证结果,避免模型只修复表面测试;
- 单独评估权限越界、秘密泄露、危险命令和依赖投毒风险;
- 按“成功任务总成本”而不是单次调用价格做最终排名。
这套评测比照搬供应商榜单更慢,却能回答真正重要的问题:Grok 4.5 是否适合你的仓库、工具链与质量标准。
FAQ
Grok 4.5 是目前最强的编程模型吗?
不能笼统地说“最强”。它在 Terminal Bench 2.1 和 SWE Marathon 上非常有竞争力,但在 DeepSWE 1.1 与 SWE Bench Pro 中仍落后于部分更昂贵模型。它更突出的优势是工程能力、速度和价格的综合平衡。
Grok 4.5 和 Cursor 是什么关系?
Cursor 与 SpaceXAI 共同训练了 Grok 4.5,并提供数万亿 Tokens 的开发者与 Agent 交互数据。SpaceX 已宣布以 600 亿美元收购 Cursor 背后的 Anysphere,按监管文件预计在 2026 年第三季度完成交割。
Grok Build 和 Cursor 有什么区别?
Grok Build 是终端原生编程 Agent;Cursor 是覆盖桌面、Web、移动端、CLI 与 SDK 的 AI 开发平台。两者都可使用 Grok 4.5,但交互界面、工具集和订阅体系不同。
Grok 4.5 有 1.5 万亿参数吗?
目前不能确认。官方只披露了 MoE 架构、训练数据方向与 GB300 GPU 规模,没有公开参数总量。
Grok 4.5 为什么在不同代码榜单上差异明显?
因为运行框架、工具权限、推理档位、Token 预算和验证器都会改变结果。应优先看统一 harness 的比较,并用自有仓库做最终验证。
参考资料
- SpaceXAI:Introducing Grok 4.5
- Cursor:Introducing Grok 4.5
- SpaceXAI:Introducing Grok Build
- SpaceXAI Developers:grok-4.5
- Artificial Analysis:Grok 4.5 模型分析
- AP:SpaceX 收购 Cursor 的交易进展
本文基于 2026 年 7 月 10 日可获得的官方资料与第三方评测。Benchmark 与产品可用性会持续变化,引用时请保留日期与测试条件。