Claude Opus 5 半價逼近 Fable 5
Kimi K3 陷「自稱 Claude」蒸餾門

Opus 5 發布 · Fable 5 性價比對比 · Kimi K3 白宮指控 · K3 自稱 Claude 技術證據 · 開發者選型 Runbook

Claude Opus 5 與 Kimi K3 蒸餾門 2026 AI 週報
本週 AI 圈兩件大事表面上不相關,卻都指向同一主題——性價比與模型能力的真實來源:7 月 24 日 Anthropic 發布 Claude Opus 5 並設為 Claude Max 預設模型;7 月 16 日月之暗面發布 Kimi K3 後遭白宮指控「蒸餾 Claude」,獨立研究者 Ryan Greenblatt 更發現 K3 會自稱是 Claude 並吐出內部部署 ID。本文面向需要快速選型的大模型開發者與 AI Agent 工程師,回答:① Opus 5 相對 Fable 5 的性價比是否值得升級;② Kimi K3 蒸餾指控的可驗證證據與時間線矛盾;③ 合規敏感場景下的六步 Runbook 與 FAQ。
01

Claude Opus 5 發布:價格沒變,效能為什麼「跳級」了?

2026 年 7 月 24 日,Anthropic 正式發布 Claude Opus 5(模型 ID:claude-opus-5),同步將其設為 Claude Max 預設模型,Claude Pro 使用者也可使用目前能拿到的最強版本。定價與 Opus 4.8 完全相同:輸入 $5 / 百萬 tokens,輸出 $25 / 百萬 tokens;上下文視窗 100 萬 tokens(預設且唯一檔位),最大輸出 128K tokens,Thinking 預設開啟。

01

Fable 5 太貴但不想降智:CursorBench 3.2 上 Opus 5 max effort 與 Fable 5 峰值僅差 0.5%,成本卻只要一半——這是 Anthropic 對「日常主力模型」的明確定位。

02

軟體工程任務成本倒掛:Frontier-Bench v0.1 上 Opus 5 超越所有模型,表現是 Opus 4.8 的兩倍以上,且單任務成本更低。

03

Agent 自動化場景:Zapier AutomationBench 上 Opus 5 以 100% 通過率登頂,此前模型均無法完成端到端帳戶健康工作流。

04

資料合規門檻:Opus 5 延續歷代 Opus 政策——預設存取不強制 30 天資料留存;Fable 5 / Mythos 5 則要求使用者接受資料留存協議。

05

安全對齊 vs 雙用途能力:Opus 5 是 Anthropic 迄今最對齊的一代,但在網路安全攻擊、生物安全等高風險雙用途能力上故意未衝前沿,該位置仍由受限發行的 Mythos 5 佔據。

Cursor 團隊評價:「Claude Opus 5 delivers near Fable 5 intelligence at Opus speed and cost. On CursorBench it's just under Fable 5 and has many of the same behaviors.」Box 企業客戶實測:資料分析工作流提升 11%,盡職調查場景提升 17%,整體準確率提升 8%。

02

Claude Opus 5 和 Fable 5 哪個好?Benchmark 與定價全對比

維度Claude Fable 5Claude Opus 5
定價(輸入/輸出)約 $10 / $50 每百萬 token$5 / $25 每百萬 token(與 Opus 4.8 相同)
CursorBench 3.2(max effort)峰值基準與 Fable 5 峰值相差僅 0.5%
Frontier-Bench v0.1超越所有模型,>2× Opus 4.8
ARC-AGI 3得分為次優模型的 3 倍
OSWorld 2.0最佳成績用 <1/3 Fable 5 成本超過其最佳成績
資料留存需接受 30 天資料留存預設不強制資料留存
產品定位旗艦 / 受限能力Claude Max 預設 / Pro 最強可用
平台可用性Anthropic API / Bedrock / Vertex / Foundry同上,模型 ID claude-opus-5

如果你之前覺得 Fable 5 效果好但太貴,Opus 5 現在提供了「損失極小、成本減半」的替代方案。

Opus 5 的網路安全分類器比 Fable 5 寬鬆約 85%,可用於原始碼級漏洞發現,但仍屏蔽二進位漏洞掃描、滲透測試、漏洞利用生成。生命科學方面,從光譜資料反推分子結構內部測試提升 10.2 個百分點,蛋白質序列變異功能預測提升 7.7 個百分點。

03

Kimi K3 蒸餾門:白宮指控 vs「K3 自稱是 Claude」技術證據

7 月 16 日,月之暗面發布 Kimi K3:總參數 2.8 兆,全球首個進入 3T 級的開源權重模型;稀疏 MoE(896 專家 / token 啟用 16 個,約 500 億啟用參數);100 萬 token 上下文 + 原生視覺理解;GPQA-Diamond 93.5%、BrowseComp 91.2%。完整權重承諾 7 月 27 日 放出——爭議爆發時外部尚無法獨立驗證。

7 月 22–23 日,白宮 OSTP 主任 Michael Kratsios 在 X 發文,指控月之暗面透過「大規模、隱蔽的產業級蒸餾」竊取 Anthropic Fable 模型能力,並提及涉嫌使用未獲出口許可的 Nvidia GB300 晶片。財政部長 Scott Bessent 附和稱在多款中國模型上發現美國大模型「浮水印」。早在 2026 年 2 月,Anthropic 已點名月之暗面偵測到超過 340 萬次 異常 API 互動。

時間線矛盾:Fable 5 面向公眾僅從 7 月 1 日起算,到 K3 發布(7 月 16 日)僅兩週。Snorkel AI 聯合創辦人 Braden Hancock 直言:「你不可能在兩週內蒸餾這麼多資料、訓練完模型還發布出來。」Allen Institute 研究員 Nathan Lambert 也認為,隨著中國模型逼近前沿,簡單監督微調式蒸餾邊際收益正在變小。

本次事件最具技術含金量的發現來自 Redwood Research 首席科學家 Ryan Greenblatt(GitHub: rgreenblatt/which_claude_is_k3):Kimi K3 被問及「你是誰」時,異常高頻地自稱是 Claude,甚至會吐出 Claude 官方內部部署 ID,如 claude-opus-4-5-20250929claude-sonnet-4-5-20250929——而真正的 Claude 模型自己都不會這樣準確報出內部版本號。

K3 身份混淆範例
問:你是誰?
Kimi K3 異常回答:我是 Claude Opus 4.5(claude-opus-4-5-20250929)

對比:真實 Claude Sonnet 4.5 僅回答「我是 Claude Sonnet 4.5」
      真實 Opus 4.5 通常不報或報錯內部版本號

Greenblatt 解讀:模型說出「教師模型」部署中繼資料比教師模型自己還準,很難用「模仿對話風格」解釋,更可能指向訓練資料混入了帶部署中繼資料標註的 Claude 資料(API 日誌或打標合成資料)。K3 自稱身份鎖定在 Claude 4.5 世代(2025 年末),K2 則指向更早的 Sonnet 4——呈現「逐代追新」規律。Greenblatt 強調這不能直接證明蒸餾發生,但結合 Anthropic 2 月指控,是迄今最接地氣的技術支撐。

04

開發者怎麼選?Claude Opus 5 vs Kimi K3 六步 Runbook

01

明確合規邊界:若場景涉及資料留存、出口管制、供應鏈稽核,優先評估 Opus 5 的「預設不強制資料留存」政策與 Anthropic 官方 SLA,而非僅看 Benchmark 分數。

02

算成本而非算分:用 CursorBench / Frontier-Bench 的「同成本下表現」而非裸分對比;Opus 5 在 high / xhigh / max 各檔位的性價比均超過市面所有模型。

03

Agent 工作流實測:若依賴 Zapier 類端到端自動化或 OSWorld 電腦操作,Opus 5 的 AutomationBench 100% 通過與 OSWorld 成本曲線值得優先 PoC。

04

Kimi K3 等權重再決策:7 月 27 日完整權重放出前,K3 架構與跑分仍屬「官方自評 + 外部猜測」;建議等 Hugging Face 權重落地後再做本地部署評估。

05

蒸餾風險納入採購清單:若企業採購需供應商聲明訓練資料來源,K3 爭議應寫入風險評估;可參考 Greenblatt 統計方法對候選模型做身份混淆抽檢。

06

本地 Agent 宿主選型:無論接入 Opus 5 API 還是等 K3 權重本地推理,7×24 Agent Gateway 需要穩定 Apple Silicon 宿主——詳見 Kimi K3 開源權重發布指南OpenRouter 多模型接入教學

05

可引用 Benchmark 資料與事件時間線

A

Opus 5 定價:輸入 $5 / 輸出 $25 每百萬 tokens;Fast 模式速度約 2.5×、價格 2×;100 萬 token 上下文,128K 最大輸出。

B

Kimi K3 官方跑分:GPQA-Diamond 93.5%、Terminal-Bench 2.1 88.3%、BrowseComp 91.2%、SWE Marathon 42.0%、DeepSearchQA F1 95.0%。

C

關鍵時間線:2026-06-09 Fable 5 / Mythos 5 發布 → 07-01 Fable 5 公眾可用 → 07-16 Kimi K3 發布 → 07-22/23 白宮指控 → 07-24 Opus 5 發布 + Greenblatt 分析 → 07-27(計畫)K3 完整權重開源。

注意:兩件事放在一起看,性價比才是 2026 下半年 AI 競爭主戰場——Opus 5 用「半價逼近旗艦」回應閉源市場,Kimi K3 用「開源 + 低價 + 少拒答」衝擊開源市場;K3 爭議則是對「低價能力來源」的公開攤牌。

若你正在本地跑 Agent 或 CI 管線做模型對比 PoC,筆電或家用 Mac 的睡眠斷連、記憶體 Swap 和 iCloud 同步衝突會拖垮 7×24 Gateway 穩定性;VPS 虛擬化對 Metal 與 Xcode 鏈路的損耗也不適合 iOS 建置場景。對於更穩定、更適合 iOS CI/CD 與 AI Agent 自動化的生產環境,MESHLAUNCH 的 Mac Mini 雲端租用通常是更優解:獨佔 Apple Silicon、7×24 線上、按天/週/月彈性下單,可並行掛載 Opus 5 API 呼叫與本地 Ollama 回落鏈路。

常見問題

Opus 5 維持 $5/$25 每百萬輸入/輸出 token,約為 Fable 5($10/$50 量級)的一半;CursorBench 3.2 峰值與 Fable 5 相差不到 0.5%。升級 API 前可先查看 租用價格頁 評估 Agent 宿主總成本。

是的,2026 年 7 月 24 日發布當天起 Opus 5 成為 Claude Max 預設模型,也是 Claude Pro 使用者可用的最強版本。可透過 Claude API、AWS Bedrock、Google Vertex AI、Microsoft Foundry 呼叫,模型 ID 為 claude-opus-5

截至本文發布仍屬有爭議、未被最終證實的指控。白宮官員指控缺乏公開證據;獨立專家從時間線角度質疑兩週內完成深度蒸餾不現實;Ryan Greenblatt 發現 K3 異常高頻自稱 Claude 並吐出內部部署 ID,是目前最具技術含量的間接證據,但不能直接證明蒸餾發生。

官方承諾 2026 年 7 月 27 日放出完整權重。本文發布時外部研究者尚無法完全獨立驗證架構與跑分。更多部署細節見 說明中心 與站內 Kimi K3 專題文章。