Grok Online
  • 功能
  • 套餐与价格
  • 指南
Grok 指南、基准与价格对比Grok 4.5 编程能力深度解读:Cursor 共训、Grok Build 与工程基准
2026/07/10Grok Online

Grok 4.5 编程能力深度解读:Cursor 共训、Grok Build 与工程基准

从 Cursor 联合训练、Grok Build 编程智能体、Terminal Bench 与 DeepSWE 等真实工程评测,判断 Grok 4.5 是否适合代码生成、缺陷修复和团队级 Agent。

Grok 4.5 编程能力深度解读:Cursor 共训、Grok Build 与工程基准

Grok 4.5 是一款明显偏向真实工程与长时智能体任务的前沿模型:终端操作强、输出速度快、Token 利用率高,但在最难的统一缺陷修复评测中并非第一。 它最值得关注的地方不是某一个跑分,而是 SpaceXAI、Cursor 数据、Grok Build 执行环境和低价 API 组成了一条从训练到分发的完整工程链路。

如果你主要关心 API 账单和竞品价格,请先看:Grok 4.5 API 价格深度对比。关于 Grok 的产品时间线,可参考什么是 Grok?。

Grok 4.5 为什么被称为“为真实工程而生”?

传统代码模型常用静态题库训练:输入一道明确问题,输出一段代码。真实软件工程却包含代码库探索、依赖安装、终端操作、测试失败、日志分析、方案回滚和多轮验证。

Cursor 官方发布说明确认,Grok 4.5 是 Cursor 与 SpaceXAI 共同训练的混合专家模型(Mixture of Experts,MoE)。训练使用了数万亿 Tokens 的 Cursor 数据,其中不仅包含代码,还包含开发者如何与代码库、软件工具和 Agent 交互的轨迹。

这种数据更接近“开发过程”而不是“最终答案”,因此模型学习到的重点包括:

  • 如何进入陌生仓库并定位相关文件;
  • 如何选择终端、搜索、编辑和测试工具;
  • 如何在首次方案失败后恢复并重试;
  • 如何根据测试或验证器判断任务是否真正完成;
  • 如何在长任务中控制步骤和上下文。

Cursor 还强调,Grok 4.5 的训练数据并不只覆盖软件工程,也加入了高质量 STEM 任务、研究论文与知识工作。这解释了为什么 SpaceXAI 同时把它用于 Word、PowerPoint、Excel 和更通用的 Agent 场景。

训练信息核验:已知与未知

项目当前可确认的信息
模型架构Cursor 确认为 MoE
联合训练Cursor 与 SpaceXAI 共同训练
Cursor 数据数万亿 Tokens 的代码库与开发者-Agent 交互数据
强化学习数十万项多步骤软件工程和技术任务
训练硬件数万张 NVIDIA GB300 GPU
参数规模未披露,无法确认“1.5 万亿参数”
上下文窗口500K Tokens

SpaceXAI 的官方发布页称,其强化学习系统允许 Agent rollout 持续数小时,同时在大规模异步训练架构上继续学习。这个方向和真实编程 Agent 的需求高度一致:难点不再只是生成一段函数,而是在长链路中保持目标、使用工具并验证结果。

四组工程基准怎么读?

Grok 4.5 的公开成绩呈现出明显的“偏科”:终端任务和长时工程竞争力强,统一框架下的高难缺陷修复仍落后于最强对手。

BenchmarkGrok 4.5GPT-5.5Opus 4.8Fable 5解读
DeepSWE 1.062.0%64.31%55.75%66.1%接近第一梯队,但各家使用自己的 harness
DeepSWE 1.153%67%59%70%统一 mini-swe-agent 下差距更明显
Terminal Bench 2.183.3%83.4%78.9%84.3%与 GPT-5.5 几乎持平,距离榜首 1 个百分点
SWE Bench Pro64.7%58.6%69.2%80.4%超过 GPT-5.5,但落后 Opus 4.8 与 Fable 5

此外,SWE Marathon 的公开结果为 Grok 4.5 29%、Opus 4.8 26%、Fable 5 24%。这类长时任务更能反映模型在持续调查和多步骤执行中的韧性。

Terminal Bench 2.1:Grok 4.5 最亮眼的能力区

Terminal Bench 测试模型在命令行环境里完成复杂任务的能力。Grok 4.5 的 83.3% 与 GPT-5.5 的 83.4% 几乎相同,只比 Fable 5 低 1 个百分点。

这对 DevOps、依赖排查、构建修复、数据处理脚本和容器任务很有参考价值。它说明 Grok 4.5 不只是“会写代码”,还能够在工具环境中执行步骤。

DeepSWE 1.1:不能回避的能力短板

DeepSWE 1.1 使用 DataCurve 的 mini-swe-agent 框架运行真实 GitHub 缺陷修复。Grok 4.5 得分 53%,落后于 Opus 4.8、GPT-5.5 和 Fable 5。

这意味着遇到最复杂的跨文件逻辑缺陷时,最高成功率仍可能来自更昂贵的模型。一个实用的生产策略是模型路由:让 Grok 4.5 处理大多数高频任务,把连续失败或高风险问题升级给更强模型与人工工程师。

为什么同一个模型在不同榜单上差异这么大?

Benchmark 分数不仅取决于模型,也取决于 Agent harness、工具权限、推理档位、Token 预算、超时设置与验证方式。DeepSWE 1.0 允许各供应商使用自己的运行框架,而 1.1 使用统一的 mini-swe-agent,因此两组结果不能直接混为一谈。

Cursor 还主动披露:Grok 4.5 的训练数据曾意外包含较早的 Cursor 代码库快照,可能让它在 CursorBench 上占优势,影响幅度无法确定。Cursor 因此没有在发布比较中采用该项成绩,并表示未来模型已移除相关数据。这个披露也提醒团队:与训练数据接近的榜单,可能高估模型迁移到自有仓库后的效果。

4.2 倍 Token 效率意味着什么?

在 SpaceXAI 公布的 SWE Bench Pro 运行中:

  • Grok 4.5 平均输出 15,954 Tokens/任务;
  • Claude Opus 4.8 max 平均输出 67,020 Tokens/任务;
  • Grok 4.5 的输出量约少 4.2 倍。

更短的推理轨迹通常带来三重收益:输出费用更低、任务完成更快、长 Agent 循环更不容易撑爆上下文。配合 2 美元输入、6 美元输出的标准 API 价,这种效率是 Grok 4.5 商业吸引力的重要组成部分。

但“Token 更少”不自动等于“工程质量更高”。如果短轨迹遗漏边界条件,导致测试失败或二次返工,节省的 Token 就没有意义。企业评测应同时记录成功率、回归缺陷、人工修改量和总用时。

Grok Build:模型如何变成编程智能体

Grok Build 是 SpaceXAI 推出的终端原生编程 Agent,Grok 4.5 现已成为其默认模型。它采用键盘优先的工作方式,面向专业软件工程和复杂代码任务。

Grok Build 的关键能力包括:

  1. Plan、Review、Approve:复杂任务先生成计划,用户可批准、评论或重写步骤;
  2. 并行 Subagents:把可独立推进的工作分给多个子智能体;
  3. 终端原生执行:直接搜索仓库、修改文件、运行命令和验证结果;
  4. 长任务管理:适合需要持续调查、测试和修复的工程流程;
  5. 办公工作延伸:SpaceXAI 展示了其处理 Excel 多工作表、公式、联网研究和备注的能力。

模型本身提供“推理能力”,Agent harness 则提供工具、权限、状态和验证闭环。二者缺一不可。因此,Grok 4.5 在 Grok Build、Cursor 或自研 Agent 中的表现,可能比单轮聊天窗口更能代表它的真实工程价值。

Grok 4.5 在 Cursor 中如何使用?

截至 2026 年 7 月 10 日,Grok 4.5 已进入 Cursor 桌面端、Web、iOS、CLI 和 SDK,并包含在个人与团队计划的第一方模型池中。Cursor 发布时还提供首周双倍用量;这类限时权益应以 Cursor 当前页面为准。

Cursor 公布了两个价格档:

Cursor 中的版本输入价格输出价格
Grok 4.5 base$2 / 1M$6 / 1M
Grok 4.5 fast$4 / 1M$18 / 1M

Fast 版本用更高价格换取更快服务。是否值得选择,取决于等待时间对团队流程的影响,而不是单看 Tokens/秒。

通过 API 快速调用 Grok 4.5

SpaceXAI 的 Responses API 与 OpenAI 风格接口兼容。最小 curl 示例:

curl https://api.x.ai/v1/responses \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -d '{
    "model": "grok-4.5",
    "input": "Inspect this bug report, propose a fix, and list the tests you would run."
  }'

生产环境还应设置稳定的缓存键、限制工具权限、记录每轮 Token 和工具调用,并对代码执行使用隔离沙箱。官方支持 Function Calling、Web Search、X Search 与 Code Execution,具体配额以 grok-4.5 开发者文档为准。

团队选型:哪些任务优先给 Grok 4.5?

适合作为默认模型

  • 终端操作、构建修复和常规缺陷排查;
  • 高频代码生成、重构、测试补全和文档更新;
  • 对成本敏感、可自动验证的大规模 Agent 队列;
  • 需要长上下文和多工具配合的代码库任务;
  • 研究、表格、演示文稿等跨软件知识工作。

适合作为升级模型之前的第一层

对高风险核心模块,可以先让 Grok 4.5 分析、定位并提出补丁。如果自动测试失败、连续两轮未解决,或触及支付、认证、安全边界,再升级到在目标任务上成功率更高的模型和人工审核。

不应省略人工审批

涉及数据库迁移、权限系统、生产配置、依赖大版本升级和安全修复时,不应让任何模型在无审批条件下直接合并或部署。低价格只会让调用更容易,不会自动降低错误的业务影响。

如何做一轮可信的内部评测?

  1. 从真实仓库选取 30—50 个已关闭问题,覆盖简单、中等和困难任务;
  2. 给所有候选模型相同的工具、超时、推理预算和初始提示;
  3. 记录一次通过率、总 Token、墙钟时间、重试次数和人工修改行数;
  4. 用隐藏测试验证结果,避免模型只修复表面测试;
  5. 单独评估权限越界、秘密泄露、危险命令和依赖投毒风险;
  6. 按“成功任务总成本”而不是单次调用价格做最终排名。

这套评测比照搬供应商榜单更慢,却能回答真正重要的问题:Grok 4.5 是否适合你的仓库、工具链与质量标准。

FAQ

Grok 4.5 是目前最强的编程模型吗?

不能笼统地说“最强”。它在 Terminal Bench 2.1 和 SWE Marathon 上非常有竞争力,但在 DeepSWE 1.1 与 SWE Bench Pro 中仍落后于部分更昂贵模型。它更突出的优势是工程能力、速度和价格的综合平衡。

Grok 4.5 和 Cursor 是什么关系?

Cursor 与 SpaceXAI 共同训练了 Grok 4.5,并提供数万亿 Tokens 的开发者与 Agent 交互数据。SpaceX 已宣布以 600 亿美元收购 Cursor 背后的 Anysphere,按监管文件预计在 2026 年第三季度完成交割。

Grok Build 和 Cursor 有什么区别?

Grok Build 是终端原生编程 Agent;Cursor 是覆盖桌面、Web、移动端、CLI 与 SDK 的 AI 开发平台。两者都可使用 Grok 4.5,但交互界面、工具集和订阅体系不同。

Grok 4.5 有 1.5 万亿参数吗?

目前不能确认。官方只披露了 MoE 架构、训练数据方向与 GB300 GPU 规模,没有公开参数总量。

Grok 4.5 为什么在不同代码榜单上差异明显?

因为运行框架、工具权限、推理档位、Token 预算和验证器都会改变结果。应优先看统一 harness 的比较,并用自有仓库做最终验证。

参考资料

  • SpaceXAI:Introducing Grok 4.5
  • Cursor:Introducing Grok 4.5
  • SpaceXAI:Introducing Grok Build
  • SpaceXAI Developers:grok-4.5
  • Artificial Analysis:Grok 4.5 模型分析
  • AP:SpaceX 收购 Cursor 的交易进展

本文基于 2026 年 7 月 10 日可获得的官方资料与第三方评测。Benchmark 与产品可用性会持续变化,引用时请保留日期与测试条件。

全部指南

作者

avatar for Grok Online
Grok Online

分类

  • 产品
Grok 4.5 为什么被称为“为真实工程而生”?训练信息核验:已知与未知四组工程基准怎么读?Terminal Bench 2.1:Grok 4.5 最亮眼的能力区DeepSWE 1.1:不能回避的能力短板为什么同一个模型在不同榜单上差异这么大?4.2 倍 Token 效率意味着什么?Grok Build:模型如何变成编程智能体Grok 4.5 在 Cursor 中如何使用?通过 API 快速调用 Grok 4.5团队选型:哪些任务优先给 Grok 4.5?适合作为默认模型适合作为升级模型之前的第一层不应省略人工审批如何做一轮可信的内部评测?FAQGrok 4.5 是目前最强的编程模型吗?Grok 4.5 和 Cursor 是什么关系?Grok Build 和 Cursor 有什么区别?Grok 4.5 有 1.5 万亿参数吗?Grok 4.5 为什么在不同代码榜单上差异明显?参考资料

更多指南

什么是 Grok?模型、功能、API 与 Grok 4.5 详解
产品
Grok Online2026/07/23

什么是 Grok?模型、功能、API 与 Grok 4.5 详解

一份经过核查的 2026 年 7 月 Grok 指南:梳理模型演进、Grok 4.5 能力、使用入口、API 价格、上下文限制与关键注意事项。

Grok Online
Grok 4.5 API 价格深度对比:$2/$6 真能掀起大模型价格战吗?
新闻
Grok Online2026/07/10

Grok 4.5 API 价格深度对比:$2/$6 真能掀起大模型价格战吗?

基于 2026 年 7 月最新官方定价与独立评测,拆解 Grok 4.5 API 成本、Token 效率、上下文窗口及与 GPT-5.5、Claude Opus 4.8、Fable 5 的选型差异。

Grok Online

邮件列表

加入我们的社区

订阅邮件列表,及时获取最新消息和更新

准备好就开始

为下一个任务选择合适的模型。

免费开始对话
Grok Online

在一个独立工作台中使用 DeepSeek 与 Grok 模型,模型权限与积分费率清晰可见。

Email
产品
  • AI 对话
  • 套餐与价格
  • 网页分析
  • 图片生成
资源
  • 指南
  • 常见问题
公司
  • 关于我们
  • 联系我们
法律
  • Cookie政策
  • 隐私政策
  • 服务条款
© 2026 Grok Online。保留所有权利。