Grok 4.5 是什麼?SpaceXAI 旗艦程式設計模型核心規格
2026 年 7 月 8 日,SpaceXAI 上市後首款旗艦模型 Grok 4.5 正式發布。馬斯克在 X 上稱其為「Opus 級別,但更快、更省 Token、更便宜」。與以往不同,該模型與 AI 程式設計工具 Cursor 聯合訓練,注入數兆 Token 的真實開發者互動數據;SpaceX 已於 2026 年 6 月完成對 Cursor 母公司 Anysphere 的收購,聯合訓練是收購後首批成果之一。
Grok 4.5 專為以下場景深度優化:
程式設計與程式碼 Agent:修 bug、大型程式碼庫重構、端到端應用開發。
自主工作流(Agentic Tasks):跨工具、跨應用的多步驟自動化任務。
知識密集型工作:法律、醫療、教育、數據分析等專業場景。
高頻呼叫成本痛點:團隊每天數百至數千次 Agent 任務時,API 帳單與 Token 效率直接決定 ROI。
一次搞定 vs 重試成本:複雜 UI 與狀態管理任務上,模型準確率與重試次數影響交付週期。
| 參數 | 數值 |
|---|---|
| 架構 | Mixture of Experts(MoE,混合專家) |
| 上下文視窗 | 500,000 Tokens(50 萬) |
| 推理模式 | 低 / 中 / 高(預設:高) |
| 推理速度 | 官方 80 TPS,實測約 90 TPS |
| 訓練硬體 | 數萬塊 NVIDIA GB300 GPU(孟菲斯資料中心) |
| 參數量 | 未公開(MoE 架構) |
Grok 4.5 定價多少?與 Claude Opus、GPT-5.6 成本對比
定價是 Grok 4.5 最核心的賣點。標價之外,Token 效率才是高頻 Agent 場景下的真實成本驅動因素。
| 模型 | 輸入(per 1M tokens) | 輸出(per 1M tokens) |
|---|---|---|
| Grok 4.5 | $2.00 | $6.00 |
| Grok 4.5(快取命中) | $0.50 | — |
| Grok 4.5 Fast 版 | $4.00 | $18.00 |
| Claude Opus 4.7 | $5.00 | $25.00 |
| Claude Fable 5 | 更高 | 更高 |
| GPT-5.6 Sol(旗艦) | $5.00 | $30.00 |
| GPT-5.6 Luna(經濟檔) | $1.00 | $6.00 |
以程式設計 Agent 任務折算的每次實際成本:
| 模型 / 平台 | 每任務平均 Token 消耗 | 每任務實際成本 |
|---|---|---|
| Grok 4.5 / Grok Build | ~1.9M tokens | $2.49 |
| GPT-5.5 / Codex | ~6.2M tokens | $5.07 |
| Claude Fable 5 / Claude Code | ~7.2M tokens | $11.80 |
在 SWE-Bench Pro 上,Grok 4.5 平均每次僅消耗 15,954 個輸出 Token,Claude Opus 4.8 同任務消耗 67,020 個——差距 4.2 倍。按 500 次/天計,Grok 約 $1,245/天,Claude Code 約 $5,900/天。
Grok 4.5 Benchmark 評測:程式設計、Agent 與綜合智能排名
3.1 程式設計 Benchmark
| 評測項目 | Grok 4.5 | Claude Fable 5 | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|
| DeepSWE 1.0(官方 harness) | 62.0% | 66.1% | 55.75% | 64.31% |
| DeepSWE 1.1(中立 harness) | 53% | 70% | 59% | 67% |
| Terminal Bench 2.1 | 83.3% | 84.3% | 78.9% | 83.4% |
| SWE-Bench Pro(解決率) | 64.7% | 80.4% | 69.2% | 58.6% |
解讀:DeepSWE 1.0 用各廠商自有 harness,Grok 4.5 排第三;換成中立 harness 的 DeepSWE 1.1 後差距放大,Fable 5 領先 17 個百分點。Terminal Bench 2.1 四款頂級模型差距在 5.4 個百分點以內,近乎平局。SWE-Bench Pro 是最嚴苛測試,Grok 4.5 排第三,落後 Fable 5 約 16 個點。
重要說明:CursorBench 在發布時被臨時撤除——Cursor 程式碼庫部分快照意外混入 Grok 4.5 訓練數據,存在數據污染風險,是本次發布的明顯瑕疵。
3.2 Agent 任務 Benchmark(Grok 4.5 高光舞台)
| 評測項目 | Grok 4.5 | Claude Fable 5 | Claude Opus 4.8 |
|---|---|---|---|
| AutomationBench-AA(657 個企業工作流) | 51.4% | 48.6% | 48.5% |
| Snorkel GDPVal+(專業工作場景) | 29% | — | 21% |
AutomationBench-AA 涵蓋 Gmail、Slack、Salesforce、HubSpot 等 40 個模擬企業應用,Grok 4.5 是首個在不違反業務約束的前提下完成超過一半工作流目標的模型。Snorkel 評測中,Grok 4.5 在法律(40% vs 27–28%)、教育(58% vs 35–42%)、醫療(35% vs 23–25%)等領域大幅領先。
3.3 綜合智能指數:Artificial Analysis 綜合智能指數 54 分(第四名),排在 Fable 5(60)、Opus 4.8(56)、GPT-5.5(55)之後,但比上一代 Grok 大幅提升 16 分。
3.4 真實程式設計對比(TryAI 獨立測評)
3D 立方體渲染(最難):Opus 4.8 與 Fable 5 一次成功;Grok 4.5 第一次僅渲染標題和按鈕,第二次重試成功;GPT-5.5 失敗。
速度:Grok 4.5 首 Token <0.5 秒,流速約 110 tokens/秒(約競品 2 倍)。
成本:Grok 4.5 每次測試執行成本最低;Fable 5 最慢、最貴。
結論:高頻重複性程式設計任務上,Grok 4.5 的速度與成本優勢碾壓;需要一次搞定複雜狀態管理的高精度任務,Claude 系列仍更可靠。
Grok 4.5 怎麼用?Cursor、API 與六步接入指南
Grok 4.5 已在以下平台上線(歐盟地區預計 7 月中旬開放):Grok Build(預設模型)、Cursor(全訂閱計劃,首週用量加倍)、SpaceXAI Console API、Office 外掛(Word/PPT/Excel)、第三方閘道(OpenRouter、Vercel、Cloudflare、Snowflake、Databricks Mosaic)。API 區域:us-east-1、us-west-2;限流 150 req/s、50M tokens/min。
curl -s https://api.x.ai/v1/responses \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.5",
"input": "幫我找出這段程式碼的 bug 並修復:function median(a){a.sort();return a[a.length/2]}"
}'
註冊 SpaceXAI API:在 Console 建立 API Key,確認帳戶可存取 us-east-1 或 us-west-2。
Cursor 內切換模型:開啟模型選擇器,選擇 Grok 4.5;發布首週享受雙倍用量。
設定快取鍵:Responses API 設定 prompt_cache_key,或 Chat Completions 使用 x-grok-conv-id Header,命中後輸入降至 $0.50/M tokens。
長 Agent 循環:開啟 Context Compaction,減少 Token 累積成本。
混合模型路由:常規子任務走 Grok 4.5,複雜架構決策升級 Claude Fable 5。
生產驗證:對金融、安全關鍵程式碼加強輸出校驗;關注 AA-Omniscience 幻覺率(54%)並建立人工覆核流程。
最佳實踐:強烈建議始終設定對話路由快取鍵;歐盟使用者需等待 7 月中旬 API 開放後再部署生產流水線。
Grok 4.5 值得切換嗎?可引用數據與選型結論
適合 Grok 4.5 的場景:① 每天數百至數千次程式設計 Agent 的團隊;② 終端類任務與工具呼叫(Terminal Bench、AutomationBench 頂級表現);③ 已深度整合 Cursor 的團隊;④ 預算敏感新創公司;⑤ 混合模型策略(Grok 處理重複子任務,Fable 5 處理架構決策)。
需要謹慎的場景:① SWE-Bench Pro 類高精度程式碼(Fable 5 領先約 16 點);② 幻覺率敏感生產環境(AA-Omniscience 幻覺率 54%);③ 歐盟使用者 API 尚未開放;④ CursorBench 可信度待獨立重測。
單次 Agent 任務成本:Grok 4.5 約 $2.49 vs Claude Code 約 $11.80(來源:SWE-Bench Pro 任務折算)。
輸出 Token 效率:15,954 vs 67,020(4.2× 差距,同任務對比 Opus 4.8)。
推理吞吐:官方 80 TPS,獨立實測約 90–110 tokens/秒,首 Token <500ms。
Grok 4.5 不是「最強的程式設計模型」,但是性價比最高的 Opus 級程式設計 Agent。真正價值在於:把 Token 效率與 API 定價折算成實際任務成本時,能以主流 Agent 工作流上七八折甚至更低的價格,完成與 Opus 4.8 相近品質的工作。純 API 呼叫雖可起步,但本地 Mac 在長時間 Agent 循環中常遇記憶體壓力、Swap 與 IDE 常駐開銷;虛擬機方案又存在 Metal 與 Xcode 相容性損耗。對於需要 7×24 穩定執行 Cursor Agent、並行 dev server 與推理常駐的工程團隊,MESHLAUNCH 的 Mac Mini 雲端裸金屬租用通常是更優解:獨占 Apple Silicon、按天/週/月彈性下單,更適合高頻 Agent 開發與 iOS CI/CD 自動化。
參考資料:SpaceXAI 官方發布 · Cursor 聯合聲明 · API 文件 · TechCrunch · Snorkel AI
取決於維度。Opus 4.8 在 SWE-Bench Pro 準確率領先(69.2% vs 64.7%);Grok 4.5 在速度、Token 效率與單次成本上常具 4 倍優勢,Agent 工作流完成率亦略勝。詳見 租用價格頁 規劃開發機預算。
SpaceXAI 曾在 Grok Build 與 Cursor 提供限時免費額度。正式 API 為輸入 $2/M、輸出 $6/M tokens;Cursor 訂閱已納入模型池。
所有 Cursor 訂閱計劃均已支援。開啟模型選擇器選擇 Grok 4.5 即可;發布首週用量加倍。部署問題可參考 雲端說明中心。
Cursor 程式碼庫快照意外混入訓練數據,存在污染風險;SpaceXAI 已撤回相關成績,等待獨立重測。
可以。亦支援 Vercel AI Gateway、Cloudflare、Snowflake、Databricks Mosaic 等第三方閘道。