Grok 4.5 深度评测
Opus 级智能 + 四分之一价格?

Benchmark 全解析 · API 定价对比 · 真实编程 PK · Cursor 接入 · 选型决策

Grok 4.5 深度评测 SpaceXAI 编程模型 2026
2026 年 7 月 8 日,马斯克旗下 SpaceXAI 正式发布 Grok 4.5,宣称「Opus 级智能、速度更快、成本更低」。如果你正为团队选型 AI 编程 Agent、或已在 Cursor 里犹豫是否切换默认模型,本文将基于公开 benchmark、独立测评与 API 定价,回答:① 它在编程与 Agent 任务上到底强在哪、弱在哪;② 单次任务成本是否真的只有竞品的四分之一;③ 如何在 Cursor / API 中接入并控制 Token 开销。数据截至 2026 年 7 月 10 日。
01

Grok 4.5 是什么?SpaceXAI 旗舰编程模型核心规格

2026 年 7 月 8 日,SpaceXAI 上市后首款旗舰模型 Grok 4.5 正式发布。马斯克在 X 上称其为「Opus 级别,但更快、更省 Token、更便宜」。与以往不同,该模型与 AI 编程工具 Cursor 联合训练,注入数万亿 Token 的真实开发者交互数据;SpaceX 已于 2026 年 6 月完成对 Cursor 母公司 Anysphere 的收购,联合训练是收购后首批成果之一。

Grok 4.5 专为以下场景深度优化:

01

编程与代码 Agent:修 bug、大型代码库重构、端到端应用开发。

02

自主工作流(Agentic Tasks):跨工具、跨应用的多步骤自动化任务。

03

知识密集型工作:法律、医疗、教育、数据分析等专业场景。

04

高频调用成本痛点:团队每天数百至数千次 Agent 任务时,API 账单与 Token 效率直接决定 ROI。

05

一次搞定 vs 重试成本:复杂 UI 与状态管理任务上,模型准确率与重试次数影响交付周期。

参数数值
架构Mixture of Experts(MoE,混合专家)
上下文窗口500,000 Tokens(50 万)
推理模式低 / 中 / 高(默认:高)
推理速度官方 80 TPS,实测约 90 TPS
训练硬件数万块 NVIDIA GB300 GPU(孟菲斯数据中心)
参数量未公开(MoE 架构)
02

Grok 4.5 定价多少?与 Claude Opus、GPT-5.6 成本对比

定价是 Grok 4.5 最核心的卖点。标价之外,Token 效率才是高频 Agent 场景下的真实成本驱动因素。

模型输入(per 1M tokens)输出(per 1M tokens)
Grok 4.5$2.00$6.00
Grok 4.5(缓存命中)$0.50
Grok 4.5 Fast 版$4.00$18.00
Claude Opus 4.7$5.00$25.00
Claude Fable 5更高更高
GPT-5.6 Sol(旗舰)$5.00$30.00
GPT-5.6 Luna(经济档)$1.00$6.00

以编程 Agent 任务折算的每次实际成本

模型 / 平台每任务平均 Token 消耗每任务实际成本
Grok 4.5 / Grok Build~1.9M tokens$2.49
GPT-5.5 / Codex~6.2M tokens$5.07
Claude Fable 5 / Claude Code~7.2M tokens$11.80

在 SWE-Bench Pro 上,Grok 4.5 平均每次仅消耗 15,954 个输出 Token,Claude Opus 4.8 同任务消耗 67,020 个——差距 4.2 倍。按 500 次/天计,Grok 约 $1,245/天,Claude Code 约 $5,900/天。

03

Grok 4.5 Benchmark 评测:编程、Agent 与综合智能排名

3.1 编程 Benchmark

评测项目Grok 4.5Claude Fable 5Claude Opus 4.8GPT-5.5
DeepSWE 1.0(官方 harness)62.0%66.1%55.75%64.31%
DeepSWE 1.1(中立 harness)53%70%59%67%
Terminal Bench 2.183.3%84.3%78.9%83.4%
SWE-Bench Pro(解决率)64.7%80.4%69.2%58.6%

解读:DeepSWE 1.0 用各厂商自有 harness,Grok 4.5 排第三;换成中立 harness 的 DeepSWE 1.1 后差距放大,Fable 5 领先 17 个百分点。Terminal Bench 2.1 四款顶级模型差距在 5.4 个百分点以内,近乎平局。SWE-Bench Pro 是最严苛测试,Grok 4.5 排第三,落后 Fable 5 约 16 个点。

重要说明:CursorBench 在发布时被临时撤除——Cursor 代码库部分快照意外混入 Grok 4.5 训练数据,存在数据污染风险,是本次发布的明显瑕疵。

3.2 Agent 任务 Benchmark(Grok 4.5 高光舞台)

评测项目Grok 4.5Claude Fable 5Claude Opus 4.8
AutomationBench-AA(657 个企业工作流)51.4%48.6%48.5%
Snorkel GDPVal+(专业工作场景)29%21%

AutomationBench-AA 涵盖 Gmail、Slack、Salesforce、HubSpot 等 40 个模拟企业应用,Grok 4.5 是首个在不违反业务约束的前提下完成超过一半工作流目标的模型。Snorkel 评测中,Grok 4.5 在法律(40% vs 27–28%)、教育(58% vs 35–42%)、医疗(35% vs 23–25%)等领域大幅领先。

3.3 综合智能指数:Artificial Analysis 综合智能指数 54 分(第四名),排在 Fable 5(60)、Opus 4.8(56)、GPT-5.5(55)之后,但比上一代 Grok 大幅提升 16 分。

3.4 真实编程对比(TryAI 独立测评)

A

3D 立方体渲染(最难):Opus 4.8 与 Fable 5 一次成功;Grok 4.5 第一次仅渲染标题和按钮,第二次重试成功;GPT-5.5 失败。

B

速度:Grok 4.5 首 Token <0.5 秒,流速约 110 tokens/秒(约竞品 2 倍)。

C

成本:Grok 4.5 每次测试运行成本最低;Fable 5 最慢、最贵。

结论:高频重复性编程任务上,Grok 4.5 的速度与成本优势碾压;需要一次搞定复杂状态管理的高精度任务,Claude 系列仍更可靠。

04

Grok 4.5 怎么用?Cursor、API 与六步接入指南

Grok 4.5 已在以下平台上线(欧盟地区预计 7 月中旬开放):Grok Build(默认模型)、Cursor(全订阅计划,首周用量加倍)、SpaceXAI Console API、Office 插件(Word/PPT/Excel)、第三方网关(OpenRouter、Vercel、Cloudflare、Snowflake、Databricks Mosaic)。API 区域:us-east-1us-west-2;限流 150 req/s、50M tokens/min。

bash
curl -s https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.5",
    "input": "帮我找出这段代码的 bug 并修复:function median(a){a.sort();return a[a.length/2]}"
  }'
01

注册 SpaceXAI API:在 Console 创建 API Key,确认账户可访问 us-east-1us-west-2

02

Cursor 内切换模型:打开模型选择器,选择 Grok 4.5;发布首周享受双倍用量。

03

配置缓存键:Responses API 设置 prompt_cache_key,或 Chat Completions 使用 x-grok-conv-id Header,命中后输入降至 $0.50/M tokens。

04

长 Agent 循环:开启 Context Compaction,减少 Token 累积成本。

05

混合模型路由:常规子任务走 Grok 4.5,复杂架构决策升级 Claude Fable 5。

06

生产验证:对金融、安全关键代码加强输出校验;关注 AA-Omniscience 幻觉率(54%)并建立人工复核流程。

最佳实践:强烈建议始终设置对话路由缓存键;欧盟用户需等待 7 月中旬 API 开放后再部署生产流水线。

05

Grok 4.5 值得切换吗?可引用数据与选型结论

适合 Grok 4.5 的场景:① 每天数百至数千次编程 Agent 的团队;② 终端类任务与工具调用(Terminal Bench、AutomationBench 顶级表现);③ 已深度集成 Cursor 的团队;④ 预算敏感初创公司;⑤ 混合模型策略(Grok 处理重复子任务,Fable 5 处理架构决策)。

需要谨慎的场景:① SWE-Bench Pro 类高精度代码(Fable 5 领先约 16 点);② 幻觉率敏感生产环境(AA-Omniscience 幻觉率 54%);③ 欧盟用户 API 尚未开放;④ CursorBench 可信度待独立重测。

A

单次 Agent 任务成本:Grok 4.5 约 $2.49 vs Claude Code 约 $11.80(来源:SWE-Bench Pro 任务折算)。

B

输出 Token 效率:15,954 vs 67,020(4.2× 差距,同任务对比 Opus 4.8)。

C

推理吞吐:官方 80 TPS,独立实测约 90–110 tokens/秒,首 Token <500ms。

Grok 4.5 不是「最强的编程模型」,但是性价比最高的 Opus 级编程 Agent。真正价值在于:把 Token 效率与 API 定价折算成实际任务成本时,能以主流 Agent 工作流上七八折甚至更低的价格,完成与 Opus 4.8 相近质量的工作。纯 API 调用虽可起步,但本地 Mac 在长时间 Agent 循环中常遇内存压力、Swap 与 IDE 常驻开销;虚拟机方案又存在 Metal 与 Xcode 兼容性损耗。对于需要 7×24 稳定运行 Cursor Agent、并行 dev server 与推理常驻的工程团队,MESHLAUNCH 的 Mac Mini 云端裸金属租赁通常是更优解:独占 Apple Silicon、按天/周/月弹性下单,更适合高频 Agent 开发与 iOS CI/CD 自动化。

参考资料:SpaceXAI 官方发布 · Cursor 联合声明 · API 文档 · TechCrunch · Snorkel AI

常见问题

取决于维度。Opus 4.8 在 SWE-Bench Pro 准确率领先(69.2% vs 64.7%);Grok 4.5 在速度、Token 效率与单次成本上常具 4 倍优势,Agent 工作流完成率亦略胜。详见 租赁价格页 规划开发机预算。

SpaceXAI 曾在 Grok Build 与 Cursor 提供限时免费额度。正式 API 为输入 $2/M、输出 $6/M tokens;Cursor 订阅已纳入模型池。

所有 Cursor 订阅计划均已支持。打开模型选择器选择 Grok 4.5 即可;发布首周用量加倍。部署问题可参考 帮助中心

Cursor 代码库快照意外混入训练数据,存在污染风险;SpaceXAI 已撤回相关成绩,等待独立重测。

可以。亦支持 Vercel AI Gateway、Cloudflare、Snowflake、Databricks Mosaic 等第三方网关。