Claude Opus 5 リリース:マイナーアップデート以上の飛躍
Anthropic は 2026 年 7 月 24 日に Claude Opus 5(モデル ID: claude-opus-5)をリリースし、即座に Claude Max のデフォルトに設定しました。Claude Pro 加入者が利用できる最上位モデルです。料金は Opus 4.8 と同じ 入力 $5 / 100万 token、出力 $25 / 100万 token です。コンテキストウィンドウは 100万 token(単一ティア)、最大出力 128K token、Thinking はデフォルトで有効です。
Fable 5 級の品質を半額で: CursorBench 3.2 最大 effort では、Opus 5 は Fable 5 ピークとの差が 0.5% 以内ながら、タスクあたりコストは半分です。
ソフトウェア工学のコスト効率: Frontier-Bench v0.1 では Opus 5 が全モデルを上回り、Opus 4.8 の 2 倍以上のスコアをより低いタスクコストで達成しています。
エージェント自動化の突破: Zapier AutomationBench では、従来どのモデルも完遂できなかったエンドツーエンドワークフローで Opus 5 が 100% パス率を記録しました。
データ保持の強制なし: Fable 5 や Mythos 5 と異なり、Opus 5 は一般利用で 30 日間データ保持へのオプトインを要求しません。
アライメントと二用途フロンティアの分離: Opus 5 は Anthropic 史上最もアラインされたモデルですが、攻撃的サイバーや生物学分野では意図的に先頭を取らず、その役割は限定アクセスの Mythos 5 に委ねています。
Cursor チームは「Claude Opus 5 は Fable 5 に近い知能を Opus の速度とコストで提供する」と評価しています。Box ではデータ分析ワークフローで 11%、デューデリジェンスで 17% の改善を報告しました。
Claude Opus 5 vs Fable 5:アップグレードする価値はあるか
| 比較軸 | Claude Fable 5 | Claude Opus 5 |
|---|---|---|
| 料金(入/出) | おおよそ $10 / $50 per M token | $5 / $25 per M token |
| CursorBench 3.2(max) | ピーク基準 | Fable 5 ピークとの差 0.5% 以内 |
| Frontier-Bench v0.1 | — | 全モデル首位、Opus 4.8 の 2 倍超 |
| ARC-AGI 3 | — | 次点モデルの 3 倍 |
| OSWorld 2.0 | 従来ベスト | Fable 5 ベストを 1/3 未満のコストで上回る |
| データ保持 | 30 日保持が必須 | デフォルトで保持要件なし |
| ポジショニング | フラッグシップ / 限定能力 | Claude Max デフォルト / Pro 最上位 |
Fable 5 が品質の基準だったが価格が障壁だったなら、Opus 5 は Anthropic の回答です。難しいエージェントタスクでほぼ何も失わず、コストは半分になります。
Kimi K3 が Claude と名乗る理由:蒸留論争の整理
Moonshot AI は 2026 年 7 月 16 日に Kimi K3 を公開しました。総パラメータ 2.8 兆(3T を超える初のオープンウェイト)、スパース MoE(896 エキスパート中 16 活性、活性相当約 500 億)、100万 token コンテキスト、ネイティブビジョンです。ベンチマークは GPQA-Diamond 93.5%、BrowseComp 91.2% など。完全ウェイトは 7 月 27 日公開予定のため、論争が広がる間は独立検証が不可能でした。
7 月 22〜23 日、ホワイトハウス OSTP 長官 Michael Kratsios は Moonshot が Anthropic の Fable モデルから「大規模かつ隠蔽的な産業蒸留で米国の独自技術を窃取した」と指摘し、輸出規制対象の Nvidia GB300 チップ使用も主張しました。2026 年 2 月には Anthropic 自身が Moonshot に帰属する 340 万件超の異常 API インタラクションを報告していました。
タイムラインへの反論: Fable 5 の一般公開は 7 月 1 日から、K3 リリースまでわずか 2 週間です。Snorkel AI 共同創業者 Braden Hancock は「その量のデータを蒸留し、学習し、2 週間でリリースするのは不可能」と指摘しています。Allen Institute for AI の Nathan Lambert は、中国系ラボが強化学習へ移行するにつれ蒸留の限界効果は縮小していると論じています。
最も技術的に興味深い発見は Redwood Research の Ryan Greenblatt(GitHub: rgreenblatt/which_claude_is_k3)によるものです。自己識別を問うと、Kimi K3 は Claude と名乗る応答が統計的に過剰に現れ、claude-opus-4-5-20250929 のような Anthropic 内部デプロイ ID 文字列まで出力することがあります。本物の Claude モデルは通常、こうした内部文字列を自発的には開示しません。
Prompt: あなたは誰ですか? Kimi K3(異常応答): I am Claude Opus 4.5 (claude-opus-4-5-20250929) 本物の Claude Sonnet 4.5: I'm Claude Sonnet 4.5 本物の Opus 4.5: 内部バージョン文字列は通常省略または誤記
Greenblatt の解釈では、教師モデルのデプロイメタデータを 教師自身が自己申告するより正確に再現することは、会話模倣だけでは説明しにくいとしています。デプロイメタデータ付き Claude データ(API ログやタグ付き合成データ)での学習を示唆します。K3 が漏らす自己識別は Claude 4.5 世代(2025 年後半)を指し、K2 はより古い Sonnet 4 を指していたという「現行世代を追いかける」パターンも見られます。Greenblatt はこれが蒸留の 証明にはならないと強調しますが、論争の中で初めて技術的根拠に踏み込んだ分析です。
六ステップ Runbook:本番で Opus 5 と Kimi K3 を選ぶ
コンプライアンス境界を先に定義する: データ保持、輸出規制、サプライチェーン監査が重要なら、生のベンチマークスコアより Opus 5 のデフォルト非保持ポリシーを優先して評価してください。
生スコアではなくタスクあたりコストを比較する: CursorBench と Frontier-Bench で性能対ドルを測定してください。Opus 5 は high、xhigh、max の各 effort ティアでこの指標が全モデル首位です。
エージェントワークフローを PoC する: エンドツーエンド自動化(Zapier 型)やコンピュータ操作ベンチマークに依存するなら、Opus 5 の AutomationBench 100% パスと OSWorld コスト曲線を優先検証してください。
ローカル展開は K3 ウェイト公開を待つ: 7 月 27 日のウェイト公開までは、K3 のアーキテクチャ主張は「ベンダー自己申告+外部推測」の段階に留まります。
調達に蒸留リスクを組み込む: ベンダーに学習データの出所開示を求めるなら、K3 論争はリスク台帳に載せ、Greenblatt の手法による自己識別スポットチェックを検討してください。
安定した Agent ホストを選ぶ: Opus 5 を API 経由で呼ぶ場合も、ウェイト公開後に K3 をローカル実行する場合も、7×24 Gateway には安定した Apple Silicon が必要です。Kimi K3 オープンウェイトガイドとOpenRouter マルチモデルチュートリアルも参照してください。
引用可能なベンチマーク数値とイベントタイムライン
Opus 5 料金: 入力 $5 / 出力 $25 per M token。Fast モードは約 2.5 倍速で 2 倍料金。100万 token コンテキスト、最大出力 128K。
Kimi K3 ベンダーベンチマーク: GPQA-Diamond 93.5%、Terminal-Bench 2.1 88.3%、BrowseComp 91.2%、SWE Marathon 42.0%、DeepSearchQA F1 95.0%。
主要タイムライン: 2026-06-09 Fable 5 / Mythos 5 発表 → 07-01 Fable 5 一般公開 → 07-16 Kimi K3 → 07-22/23 ホワイトハウス指摘 → 07-24 Opus 5 + Greenblatt 分析 → 07-27(予定)K3 完全ウェイト。
まとめ: 両方のストーリーは同じ市場争いを反映しています。手の届く価格でフロンティア級知能を誰が届けるか、そしてそのためにどこまで踏み込むか。K3 論争は、低コストのフロンティア主張がより良い工学から来るのか、他社モデルに静かに乗るのかを問う最初の公開論点です。
ノート PC 上でローカル Agent PoC や CI パイプラインを回すと、スリープ切断、メモリスワップ、同期競合が 7×24 Gateway を壊します。VPS 仮想化も Metal や Xcode ツールチェーンの iOS ビルド性能を劣化させます。iOS CI/CD と AI Agent 自動化に適した安定環境には、MESHLAUNCH の Mac Mini クラウドレンタルが通常はより優れた選択です。専有 Apple Silicon、7×24 常時稼働、日/週/月の柔軟課金、Opus 5 API 呼び出しとローカル Ollama フォールバックの並列実行に十分な余裕を確保できます。
token あたりおおよそ半額(入力 $5 / 出力 $25 vs おおよそ $10 / $50、100万 token あたり)で、CursorBench 3.2 ピークは Fable 5 との差が 0.5% 以内です。API 費用と合わせた Agent ホスティング総コストの試算は料金ページをご覧ください。
はい。2026 年 7 月 24 日以降、Opus 5 が Claude Max のデフォルトであり、Claude Pro ユーザー向け最上位モデルです。Claude API、AWS Bedrock、Google Vertex AI、Microsoft Foundry でモデル ID claude-opus-5 として利用できます。
未確定で論争中です。ホワイトハウスの指摘には公開証拠がなく、Fable 5 公開から K3 リリースまで 2 週間というタイムラインでは深い蒸留は非現実的だと研究者が指摘しています。Ryan Greenblatt が K3 が Claude と名乗り内部デプロイ ID まで出力する点は、これまでで最も技術的(ただし決定的ではない)な証拠です。
Moonshot AI は 2026 年 7 月 27 日の公開を約束しています。本稿執筆時点では、アーキテクチャとベンチマークの独立検証は未完了でした。展開の詳細はヘルプセンターと本ブログの K3 関連記事もご参照ください。