Grok 4.5 是什么?SpaceXAI 旗舰编程模型核心规格
2026 年 7 月 8 日,SpaceXAI 上市后首款旗舰模型 Grok 4.5 正式发布。马斯克在 X 上称其为「Opus 级别,但更快、更省 Token、更便宜」。与以往不同,该模型与 AI 编程工具 Cursor 联合训练,注入数万亿 Token 的真实开发者交互数据;SpaceX 已于 2026 年 6 月完成对 Cursor 母公司 Anysphere 的收购,联合训练是收购后首批成果之一。
Grok 4.5 专为以下场景深度优化:
编程与代码 Agent:修 bug、大型代码库重构、端到端应用开发。
自主工作流(Agentic Tasks):跨工具、跨应用的多步骤自动化任务。
知识密集型工作:法律、医疗、教育、数据分析等专业场景。
高频调用成本痛点:团队每天数百至数千次 Agent 任务时,API 账单与 Token 效率直接决定 ROI。
一次搞定 vs 重试成本:复杂 UI 与状态管理任务上,模型准确率与重试次数影响交付周期。
| 参数 | 数值 |
|---|---|
| 架构 | Mixture of Experts(MoE,混合专家) |
| 上下文窗口 | 500,000 Tokens(50 万) |
| 推理模式 | 低 / 中 / 高(默认:高) |
| 推理速度 | 官方 80 TPS,实测约 90 TPS |
| 训练硬件 | 数万块 NVIDIA GB300 GPU(孟菲斯数据中心) |
| 参数量 | 未公开(MoE 架构) |
Grok 4.5 定价多少?与 Claude Opus、GPT-5.6 成本对比
定价是 Grok 4.5 最核心的卖点。标价之外,Token 效率才是高频 Agent 场景下的真实成本驱动因素。
| 模型 | 输入(per 1M tokens) | 输出(per 1M tokens) |
|---|---|---|
| Grok 4.5 | $2.00 | $6.00 |
| Grok 4.5(缓存命中) | $0.50 | — |
| Grok 4.5 Fast 版 | $4.00 | $18.00 |
| Claude Opus 4.7 | $5.00 | $25.00 |
| Claude Fable 5 | 更高 | 更高 |
| GPT-5.6 Sol(旗舰) | $5.00 | $30.00 |
| GPT-5.6 Luna(经济档) | $1.00 | $6.00 |
以编程 Agent 任务折算的每次实际成本:
| 模型 / 平台 | 每任务平均 Token 消耗 | 每任务实际成本 |
|---|---|---|
| Grok 4.5 / Grok Build | ~1.9M tokens | $2.49 |
| GPT-5.5 / Codex | ~6.2M tokens | $5.07 |
| Claude Fable 5 / Claude Code | ~7.2M tokens | $11.80 |
在 SWE-Bench Pro 上,Grok 4.5 平均每次仅消耗 15,954 个输出 Token,Claude Opus 4.8 同任务消耗 67,020 个——差距 4.2 倍。按 500 次/天计,Grok 约 $1,245/天,Claude Code 约 $5,900/天。
Grok 4.5 Benchmark 评测:编程、Agent 与综合智能排名
3.1 编程 Benchmark
| 评测项目 | Grok 4.5 | Claude Fable 5 | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|
| DeepSWE 1.0(官方 harness) | 62.0% | 66.1% | 55.75% | 64.31% |
| DeepSWE 1.1(中立 harness) | 53% | 70% | 59% | 67% |
| Terminal Bench 2.1 | 83.3% | 84.3% | 78.9% | 83.4% |
| SWE-Bench Pro(解决率) | 64.7% | 80.4% | 69.2% | 58.6% |
解读:DeepSWE 1.0 用各厂商自有 harness,Grok 4.5 排第三;换成中立 harness 的 DeepSWE 1.1 后差距放大,Fable 5 领先 17 个百分点。Terminal Bench 2.1 四款顶级模型差距在 5.4 个百分点以内,近乎平局。SWE-Bench Pro 是最严苛测试,Grok 4.5 排第三,落后 Fable 5 约 16 个点。
重要说明:CursorBench 在发布时被临时撤除——Cursor 代码库部分快照意外混入 Grok 4.5 训练数据,存在数据污染风险,是本次发布的明显瑕疵。
3.2 Agent 任务 Benchmark(Grok 4.5 高光舞台)
| 评测项目 | Grok 4.5 | Claude Fable 5 | Claude Opus 4.8 |
|---|---|---|---|
| AutomationBench-AA(657 个企业工作流) | 51.4% | 48.6% | 48.5% |
| Snorkel GDPVal+(专业工作场景) | 29% | — | 21% |
AutomationBench-AA 涵盖 Gmail、Slack、Salesforce、HubSpot 等 40 个模拟企业应用,Grok 4.5 是首个在不违反业务约束的前提下完成超过一半工作流目标的模型。Snorkel 评测中,Grok 4.5 在法律(40% vs 27–28%)、教育(58% vs 35–42%)、医疗(35% vs 23–25%)等领域大幅领先。
3.3 综合智能指数:Artificial Analysis 综合智能指数 54 分(第四名),排在 Fable 5(60)、Opus 4.8(56)、GPT-5.5(55)之后,但比上一代 Grok 大幅提升 16 分。
3.4 真实编程对比(TryAI 独立测评)
3D 立方体渲染(最难):Opus 4.8 与 Fable 5 一次成功;Grok 4.5 第一次仅渲染标题和按钮,第二次重试成功;GPT-5.5 失败。
速度:Grok 4.5 首 Token <0.5 秒,流速约 110 tokens/秒(约竞品 2 倍)。
成本:Grok 4.5 每次测试运行成本最低;Fable 5 最慢、最贵。
结论:高频重复性编程任务上,Grok 4.5 的速度与成本优势碾压;需要一次搞定复杂状态管理的高精度任务,Claude 系列仍更可靠。
Grok 4.5 怎么用?Cursor、API 与六步接入指南
Grok 4.5 已在以下平台上线(欧盟地区预计 7 月中旬开放):Grok Build(默认模型)、Cursor(全订阅计划,首周用量加倍)、SpaceXAI Console API、Office 插件(Word/PPT/Excel)、第三方网关(OpenRouter、Vercel、Cloudflare、Snowflake、Databricks Mosaic)。API 区域:us-east-1、us-west-2;限流 150 req/s、50M tokens/min。
curl -s https://api.x.ai/v1/responses \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.5",
"input": "帮我找出这段代码的 bug 并修复:function median(a){a.sort();return a[a.length/2]}"
}'
注册 SpaceXAI API:在 Console 创建 API Key,确认账户可访问 us-east-1 或 us-west-2。
Cursor 内切换模型:打开模型选择器,选择 Grok 4.5;发布首周享受双倍用量。
配置缓存键:Responses API 设置 prompt_cache_key,或 Chat Completions 使用 x-grok-conv-id Header,命中后输入降至 $0.50/M tokens。
长 Agent 循环:开启 Context Compaction,减少 Token 累积成本。
混合模型路由:常规子任务走 Grok 4.5,复杂架构决策升级 Claude Fable 5。
生产验证:对金融、安全关键代码加强输出校验;关注 AA-Omniscience 幻觉率(54%)并建立人工复核流程。
最佳实践:强烈建议始终设置对话路由缓存键;欧盟用户需等待 7 月中旬 API 开放后再部署生产流水线。
Grok 4.5 值得切换吗?可引用数据与选型结论
适合 Grok 4.5 的场景:① 每天数百至数千次编程 Agent 的团队;② 终端类任务与工具调用(Terminal Bench、AutomationBench 顶级表现);③ 已深度集成 Cursor 的团队;④ 预算敏感初创公司;⑤ 混合模型策略(Grok 处理重复子任务,Fable 5 处理架构决策)。
需要谨慎的场景:① SWE-Bench Pro 类高精度代码(Fable 5 领先约 16 点);② 幻觉率敏感生产环境(AA-Omniscience 幻觉率 54%);③ 欧盟用户 API 尚未开放;④ CursorBench 可信度待独立重测。
单次 Agent 任务成本:Grok 4.5 约 $2.49 vs Claude Code 约 $11.80(来源:SWE-Bench Pro 任务折算)。
输出 Token 效率:15,954 vs 67,020(4.2× 差距,同任务对比 Opus 4.8)。
推理吞吐:官方 80 TPS,独立实测约 90–110 tokens/秒,首 Token <500ms。
Grok 4.5 不是「最强的编程模型」,但是性价比最高的 Opus 级编程 Agent。真正价值在于:把 Token 效率与 API 定价折算成实际任务成本时,能以主流 Agent 工作流上七八折甚至更低的价格,完成与 Opus 4.8 相近质量的工作。纯 API 调用虽可起步,但本地 Mac 在长时间 Agent 循环中常遇内存压力、Swap 与 IDE 常驻开销;虚拟机方案又存在 Metal 与 Xcode 兼容性损耗。对于需要 7×24 稳定运行 Cursor Agent、并行 dev server 与推理常驻的工程团队,MESHLAUNCH 的 Mac Mini 云端裸金属租赁通常是更优解:独占 Apple Silicon、按天/周/月弹性下单,更适合高频 Agent 开发与 iOS CI/CD 自动化。
参考资料:SpaceXAI 官方发布 · Cursor 联合声明 · API 文档 · TechCrunch · Snorkel AI
取决于维度。Opus 4.8 在 SWE-Bench Pro 准确率领先(69.2% vs 64.7%);Grok 4.5 在速度、Token 效率与单次成本上常具 4 倍优势,Agent 工作流完成率亦略胜。详见 租赁价格页 规划开发机预算。
SpaceXAI 曾在 Grok Build 与 Cursor 提供限时免费额度。正式 API 为输入 $2/M、输出 $6/M tokens;Cursor 订阅已纳入模型池。
所有 Cursor 订阅计划均已支持。打开模型选择器选择 Grok 4.5 即可;发布首周用量加倍。部署问题可参考 帮助中心。
Cursor 代码库快照意外混入训练数据,存在污染风险;SpaceXAI 已撤回相关成绩,等待独立重测。
可以。亦支持 Vercel AI Gateway、Cloudflare、Snowflake、Databricks Mosaic 等第三方网关。