Grok 4.5 深度評測
Opus 級智能 + 四分之一價格?

Benchmark 全解析 · API 定價對比 · 真實程式設計 PK · Cursor 接入 · 選型決策

Grok 4.5 深度評測 SpaceXAI 程式設計模型 2026
2026 年 7 月 8 日,馬斯克旗下 SpaceXAI 正式發布 Grok 4.5,宣稱「Opus 級智能、速度更快、成本更低」。如果你正為團隊選型 AI 程式設計 Agent、或已在 Cursor 裡猶豫是否切換預設模型,本文將基於公開 benchmark、獨立測評與 API 定價,回答:① 它在程式設計與 Agent 任務上到底強在哪、弱在哪;② 單次任務成本是否真的只有競品的四分之一;③ 如何在 Cursor / API 中接入並控制 Token 開銷。數據截至 2026 年 7 月 10 日。
01

Grok 4.5 是什麼?SpaceXAI 旗艦程式設計模型核心規格

2026 年 7 月 8 日,SpaceXAI 上市後首款旗艦模型 Grok 4.5 正式發布。馬斯克在 X 上稱其為「Opus 級別,但更快、更省 Token、更便宜」。與以往不同,該模型與 AI 程式設計工具 Cursor 聯合訓練,注入數兆 Token 的真實開發者互動數據;SpaceX 已於 2026 年 6 月完成對 Cursor 母公司 Anysphere 的收購,聯合訓練是收購後首批成果之一。

Grok 4.5 專為以下場景深度優化:

01

程式設計與程式碼 Agent:修 bug、大型程式碼庫重構、端到端應用開發。

02

自主工作流(Agentic Tasks):跨工具、跨應用的多步驟自動化任務。

03

知識密集型工作:法律、醫療、教育、數據分析等專業場景。

04

高頻呼叫成本痛點:團隊每天數百至數千次 Agent 任務時,API 帳單與 Token 效率直接決定 ROI。

05

一次搞定 vs 重試成本:複雜 UI 與狀態管理任務上,模型準確率與重試次數影響交付週期。

參數數值
架構Mixture of Experts(MoE,混合專家)
上下文視窗500,000 Tokens(50 萬)
推理模式低 / 中 / 高(預設:高)
推理速度官方 80 TPS,實測約 90 TPS
訓練硬體數萬塊 NVIDIA GB300 GPU(孟菲斯資料中心)
參數量未公開(MoE 架構)
02

Grok 4.5 定價多少?與 Claude Opus、GPT-5.6 成本對比

定價是 Grok 4.5 最核心的賣點。標價之外,Token 效率才是高頻 Agent 場景下的真實成本驅動因素。

模型輸入(per 1M tokens)輸出(per 1M tokens)
Grok 4.5$2.00$6.00
Grok 4.5(快取命中)$0.50
Grok 4.5 Fast 版$4.00$18.00
Claude Opus 4.7$5.00$25.00
Claude Fable 5更高更高
GPT-5.6 Sol(旗艦)$5.00$30.00
GPT-5.6 Luna(經濟檔)$1.00$6.00

以程式設計 Agent 任務折算的每次實際成本

模型 / 平台每任務平均 Token 消耗每任務實際成本
Grok 4.5 / Grok Build~1.9M tokens$2.49
GPT-5.5 / Codex~6.2M tokens$5.07
Claude Fable 5 / Claude Code~7.2M tokens$11.80

在 SWE-Bench Pro 上,Grok 4.5 平均每次僅消耗 15,954 個輸出 Token,Claude Opus 4.8 同任務消耗 67,020 個——差距 4.2 倍。按 500 次/天計,Grok 約 $1,245/天,Claude Code 約 $5,900/天。

03

Grok 4.5 Benchmark 評測:程式設計、Agent 與綜合智能排名

3.1 程式設計 Benchmark

評測項目Grok 4.5Claude Fable 5Claude Opus 4.8GPT-5.5
DeepSWE 1.0(官方 harness)62.0%66.1%55.75%64.31%
DeepSWE 1.1(中立 harness)53%70%59%67%
Terminal Bench 2.183.3%84.3%78.9%83.4%
SWE-Bench Pro(解決率)64.7%80.4%69.2%58.6%

解讀:DeepSWE 1.0 用各廠商自有 harness,Grok 4.5 排第三;換成中立 harness 的 DeepSWE 1.1 後差距放大,Fable 5 領先 17 個百分點。Terminal Bench 2.1 四款頂級模型差距在 5.4 個百分點以內,近乎平局。SWE-Bench Pro 是最嚴苛測試,Grok 4.5 排第三,落後 Fable 5 約 16 個點。

重要說明:CursorBench 在發布時被臨時撤除——Cursor 程式碼庫部分快照意外混入 Grok 4.5 訓練數據,存在數據污染風險,是本次發布的明顯瑕疵。

3.2 Agent 任務 Benchmark(Grok 4.5 高光舞台)

評測項目Grok 4.5Claude Fable 5Claude Opus 4.8
AutomationBench-AA(657 個企業工作流)51.4%48.6%48.5%
Snorkel GDPVal+(專業工作場景)29%21%

AutomationBench-AA 涵蓋 Gmail、Slack、Salesforce、HubSpot 等 40 個模擬企業應用,Grok 4.5 是首個在不違反業務約束的前提下完成超過一半工作流目標的模型。Snorkel 評測中,Grok 4.5 在法律(40% vs 27–28%)、教育(58% vs 35–42%)、醫療(35% vs 23–25%)等領域大幅領先。

3.3 綜合智能指數:Artificial Analysis 綜合智能指數 54 分(第四名),排在 Fable 5(60)、Opus 4.8(56)、GPT-5.5(55)之後,但比上一代 Grok 大幅提升 16 分。

3.4 真實程式設計對比(TryAI 獨立測評)

A

3D 立方體渲染(最難):Opus 4.8 與 Fable 5 一次成功;Grok 4.5 第一次僅渲染標題和按鈕,第二次重試成功;GPT-5.5 失敗。

B

速度:Grok 4.5 首 Token <0.5 秒,流速約 110 tokens/秒(約競品 2 倍)。

C

成本:Grok 4.5 每次測試執行成本最低;Fable 5 最慢、最貴。

結論:高頻重複性程式設計任務上,Grok 4.5 的速度與成本優勢碾壓;需要一次搞定複雜狀態管理的高精度任務,Claude 系列仍更可靠。

04

Grok 4.5 怎麼用?Cursor、API 與六步接入指南

Grok 4.5 已在以下平台上線(歐盟地區預計 7 月中旬開放):Grok Build(預設模型)、Cursor(全訂閱計劃,首週用量加倍)、SpaceXAI Console API、Office 外掛(Word/PPT/Excel)、第三方閘道(OpenRouter、Vercel、Cloudflare、Snowflake、Databricks Mosaic)。API 區域:us-east-1us-west-2;限流 150 req/s、50M tokens/min。

bash
curl -s https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.5",
    "input": "幫我找出這段程式碼的 bug 並修復:function median(a){a.sort();return a[a.length/2]}"
  }'
01

註冊 SpaceXAI API:在 Console 建立 API Key,確認帳戶可存取 us-east-1us-west-2

02

Cursor 內切換模型:開啟模型選擇器,選擇 Grok 4.5;發布首週享受雙倍用量。

03

設定快取鍵:Responses API 設定 prompt_cache_key,或 Chat Completions 使用 x-grok-conv-id Header,命中後輸入降至 $0.50/M tokens。

04

長 Agent 循環:開啟 Context Compaction,減少 Token 累積成本。

05

混合模型路由:常規子任務走 Grok 4.5,複雜架構決策升級 Claude Fable 5。

06

生產驗證:對金融、安全關鍵程式碼加強輸出校驗;關注 AA-Omniscience 幻覺率(54%)並建立人工覆核流程。

最佳實踐:強烈建議始終設定對話路由快取鍵;歐盟使用者需等待 7 月中旬 API 開放後再部署生產流水線。

05

Grok 4.5 值得切換嗎?可引用數據與選型結論

適合 Grok 4.5 的場景:① 每天數百至數千次程式設計 Agent 的團隊;② 終端類任務與工具呼叫(Terminal Bench、AutomationBench 頂級表現);③ 已深度整合 Cursor 的團隊;④ 預算敏感新創公司;⑤ 混合模型策略(Grok 處理重複子任務,Fable 5 處理架構決策)。

需要謹慎的場景:① SWE-Bench Pro 類高精度程式碼(Fable 5 領先約 16 點);② 幻覺率敏感生產環境(AA-Omniscience 幻覺率 54%);③ 歐盟使用者 API 尚未開放;④ CursorBench 可信度待獨立重測。

A

單次 Agent 任務成本:Grok 4.5 約 $2.49 vs Claude Code 約 $11.80(來源:SWE-Bench Pro 任務折算)。

B

輸出 Token 效率:15,954 vs 67,020(4.2× 差距,同任務對比 Opus 4.8)。

C

推理吞吐:官方 80 TPS,獨立實測約 90–110 tokens/秒,首 Token <500ms。

Grok 4.5 不是「最強的程式設計模型」,但是性價比最高的 Opus 級程式設計 Agent。真正價值在於:把 Token 效率與 API 定價折算成實際任務成本時,能以主流 Agent 工作流上七八折甚至更低的價格,完成與 Opus 4.8 相近品質的工作。純 API 呼叫雖可起步,但本地 Mac 在長時間 Agent 循環中常遇記憶體壓力、Swap 與 IDE 常駐開銷;虛擬機方案又存在 Metal 與 Xcode 相容性損耗。對於需要 7×24 穩定執行 Cursor Agent、並行 dev server 與推理常駐的工程團隊,MESHLAUNCH 的 Mac Mini 雲端裸金屬租用通常是更優解:獨占 Apple Silicon、按天/週/月彈性下單,更適合高頻 Agent 開發與 iOS CI/CD 自動化。

參考資料:SpaceXAI 官方發布 · Cursor 聯合聲明 · API 文件 · TechCrunch · Snorkel AI

常見問題

取決於維度。Opus 4.8 在 SWE-Bench Pro 準確率領先(69.2% vs 64.7%);Grok 4.5 在速度、Token 效率與單次成本上常具 4 倍優勢,Agent 工作流完成率亦略勝。詳見 租用價格頁 規劃開發機預算。

SpaceXAI 曾在 Grok Build 與 Cursor 提供限時免費額度。正式 API 為輸入 $2/M、輸出 $6/M tokens;Cursor 訂閱已納入模型池。

所有 Cursor 訂閱計劃均已支援。開啟模型選擇器選擇 Grok 4.5 即可;發布首週用量加倍。部署問題可參考 雲端說明中心

Cursor 程式碼庫快照意外混入訓練數據,存在污染風險;SpaceXAI 已撤回相關成績,等待獨立重測。

可以。亦支援 Vercel AI Gateway、Cloudflare、Snowflake、Databricks Mosaic 等第三方閘道。