OpenAIAnthropic News2026/07/24 0:00

Introducing Claude Opus 5

要点だけを先に読めるように短く再構成したセクションです。

元記事

Quick Digest

要約

要点だけを先に読めるように短く再構成したセクションです。

openaijamodel: gpt-5-mini-2025-08-07

Claude Opus 5 の紹介 — 高効率な次世代モデル

Key Points

  • Fable 5 級の性能を低コストで実現
  • コーディング・知識作業でSOTA
  • 自己検証と反復が強化

Summary

Claude Opus 5 が一般提供されました。Claude Fable 5 に近い最先端性能を半額程度のコストで提供し、特にコーディングや知識作業で高い効率と精度を示します。デフォルトで Claude Max に設定され、Claude Pro では最上位モデルです。エフォート設定で知能とトークン消費を調整でき、同等の精度をより低コストで達成できます。

Key Points

  • 利用可能日: 2026-07-24。デフォルト: Claude Max、最強モデル: Claude Pro。
  • 性能とコスト効率: Opus 4.8 と同コスト帯で大幅性能向上。CursorBench で Fable 5 に近いスコアを半分のコストで達成。
  • ベンチマーク実績: Frontier-Bench(SOTA)、CursorBench、ARC-AGI、Zapier AutomationBench、OSWorld 等で顕著な改善。
  • 科学・ライフサイエンス: 有機化学やタンパク質変異の評価で Opus 4.8 を大きく上回る。
  • 作業スタイル: 自己検証と反復に強く、コンピュータビジョンやテストハーネスを自前で作るなどエージェンシー的な挙動を発揮。
  • セーフティとアラインメント: 自動行動監査で過去モデルより高いアラインメント、誤誘導や危険行動に対する耐性が向上。

Practical guidance for engineers

  • まず自社の代表的ワークロードで Opus 5 をベンチし、エフォート設定(low→max)ごとの精度とトークン消費を比較してください。
  • コードレビュー、デバッグ、長期的なエージェント作業、データ解析や金融モデル等は優先的に移行候補です。
  • ビジュアル出力やフロントエンド/UX生成の品質も向上しているため、UI/資料生成パイプラインでも評価を推奨します。
  • 本番移行時はトークン消費と応答レイテンシを監視し、必要に応じてエフォートを調整してコストと精度の最適化を行ってください。

Quick checklist

  • 社内ベンチマークで Opus 5 を評価
  • エフォート設定でコスト・精度のトレードオフを測定
  • コードレビュー/自動化ワークフローの小規模移行検証
  • セーフティとガードレールの再確認

Full Translation

翻訳

原文の流れを保ったまま読める翻訳セクションです。

openaijamodel: gpt-5-mini-2025-08-07

Claude Opus 5 の導入

製品発表 — Introducing Claude Opus 5

公開日: 2026-07-24

Claude Opus 5 が本日利用可能になりました。これは思慮深く能動的なモデルで、Claude Fable 5 の最先端の知能に迫りつつ、価格は半分です。Frontier-Bench や GDPval-AA といったコーディング/知識作業の評価では、Opus 5 が新たな最先端を打ち立てますが、サイバーセキュリティ関連のタスクでは Mythos 5 に及びません。Opus 5 は日常的に使うことを想定して設計されており、他モデルより効率的に動作します。Claude Max の新しいデフォルトモデルであり、Claude Pro では最も強力なモデルです。

パフォーマンスとコスト効率

Claude Opus 5 は前作 Opus 4.8 と同じコストで大幅に性能が向上しています。本節のグラフは、顧客が知能を最大化するかトークンを節約して高速・安価な結果を得るかを選べる「effort」設定に応じて性能がどのように変化するかを示しています。Opus 5 は特に価値の高いソフトウェアエンジニアリング系タスクで優れています。

  • Frontier-Bench v0.1 では、Opus 5 が他モデルを上回り、Opus 4.8 を下回るコストで性能を2倍以上にしています。
  • CursorBench 3.2 では、max effort(最大努力)時に Fable 5 のピークスコアの 0.5% 内で動作しますが、タスク当たりのコストは半分です。high、xhigh、max の各 effort で、同コスト時に他モデルより高い性能を達成しています。

主な評価指標:

  • Frontier-Bench v0.1
  • CursorBench
  • AA Coding Agent Index

知識作業や問題解決タスクでも同様の結果が見られます。

  • ARC-AGI 3(新規問題を解く評価)では、Opus 5 のスコアは次点モデルの約3倍です。
  • Zapier AutomationBench(ビジネスタスクを開始から完了まで実行できるかを測る)では、同コストあたりで Opus 5 の合格率は次点モデルの約1.5×です。最低の effort 設定でも、Opus 5 は他のモデルより多くのタスクに合格します。
  • OSWorld 2.0(コンピュータ使用のベンチマーク)では、任意のコスト条件で他モデルを上回り、Fable 5 の最良結果をわずか 1/3 少々のコストで超えています。

その他、Opus 5 が最も優れ、コスト効率の高い評価:

  • ARC-AGI 3
  • GDPval-AA v2
  • OSWorld 2.0
  • HLE
  • AutomationBench
  • DeepSearchQA

科学研究への貢献

Opus 5 は Opus 4.8 に比べて科学研究分野で実用的な改善をもたらします。構造生物学、有機化学、バイオインフォマティクス等に関する当社のライフサイエンス評価のすべてで Opus 4.8 を上回っています。特に有機化学の課題(スペクトロスコピーから分子構造を推定するような問題)では内部ベンチマークで Opus 4.8 より 10.2 ポイント高く、タンパク質関連タスク(配列の変化が機能に与える影響の予測)では 7.7 ポイント高い改善を示しました。

ビジュアル出力の強化

Opus 5 ははるかに強力なビジュアル出力を生成できます。例:

  • 風洞(Wind tunnel) — 空気の流れを空力・非空力オブジェクト上に可視化。さまざまな設定をこちらで試せます。
  • 細胞の図(Cell artifact) — 簡略化された対話式の細胞図を構築。要素はこちらで探索できます。

(注: 上記の “こちら” は元記事にリンクが挿入されていた箇所を示します。)

Claude Opus 5 と働く

Opus 5 は自身の作業を検証し、成功するまで慎重に反復する能力が大きく強化されています。事前展開テストと早期アクセスの試験で、Opus 5 の主体性(agency)と徹底性の多くの実例が確認されました:

  • ある Frontier-Bench の課題で、機械部品の図面を与えられ 3D FreeCAD モデルを再構築するコードを書くよう求められました。しかし入力は図面の直接参照を許さない設定でした。Opus 5 は独自にコンピュータビジョンパイプラインを構築して生のピクセルから形状を抽出し、完全な機械部品を再構成しました。複数回にわたって成功し、同じ条件で試した他モデルは5回試しても解けませんでした。
  • 人気のあるオープンソースパッケージマネージャの実バグに対し、Opus 5 は根本原因を突き止め、コミュニティのパッチが見落としていたエッジケースを修正しました。競合モデルは表面的な症状しか修正せず、バグを解決したと報告してしまいました。
  • あるトレーディング企業のエンジニアは、1セッションで新取引所向けの市場データフィードを構築するために Opus 5 を使用しました。従来モデルはこのタスクを完遂できず、エンジニアの詳細な計画を与えても達成できませんでした。検証用のライブフィードが見つからなかったため、Opus 5 は自分でテストハーネスを構築して、コードが取引所のデータを正しく解析することを確認しました。

早期アクセス顧客からの報告

  • "FrontierCode 1.1 では、Claude Opus 5 は Fable レベルの性能に近づき、コストは半分です。Devin 内では難しいデバッグと根本原因分析に特に強さを示しています。" — Scott Wu, CEO
  • "Claude Opus 5 は Fable 5 に近い知能を Opus のスピードとコストで提供します。CursorBench では Fable 5 に僅かに劣る程度で、多くの同様の振る舞いを示しています。開発者が Cursor でどう使うか楽しみです。" — Sualeh Asif, Co-Founder
  • "Zapier の AutomationBench で Opus 5 はリーダーボード首位になり、以前の Claude モデルと同等以上のトークン消費で達成しました。生のアカウントヘルスワークブックを取り、完全なチャーン防止シーケンスを端から端まで実行しました。前モデルは合格しませんでしたが、Opus 5 は 100% を達成しました。" — Wade Foster, CEO
  • "ゲノミクス解析では、Claude Opus 5 はこれまで実行したどのモデルよりも慎重な科学者のように振る舞います。交絡因子を排除するための適切な統計検定を選び、独立した方法で結果を相互検証し、長い多段階の解析を通じて軌道を外れません。" — Alfredo Andere, CEO
  • "Opus 5 は当社の内部評価で同ファミリー内のすべてのモデルを上回りました。最も困難な主体的コーディングタスクで Opus 4.7 と比べて 22% の改善があり、実行間のばらつきも大幅に減っています。Lovable の何百万ものビルダーにとって、一貫性がすべてです。" — Fabian Hedin, Co-Founder
  • "Opus ファミリーで 4.5 以来の最大の飛躍です。フルスタックアプリの同じビルドで、フロントエンドにその差が現れます: これまでで最高のアニメーション、ゲーム、3D 表現が出ています。" — Madhav Jha, Co-Founder and CTO
  • "我々のエージェントが扱うようなオープンエンドの分析作業では、Opus 5 は Opus 4.8 に対する厳密なアップグレードです。応答はより明瞭で簡潔になり、高い effort レベルでも効率が改善しています。" — Izzy Miller, AI Research Lead
  • "金融リサーチのワークフローでは、Opus 5 は Opus 4.8 に比べて著しい改善を示します。数値推論、表作業、精密さが求められる批判的思考で際立っています。" — Shirley Zhang, Senior AI Engineer, Applied AI
  • "企業向けの専門コンテンツ解析には必須の知能と精度を提供します。Box は Opus 5 が Opus 4.8 を 8% 上回り、データ分析(11% 改善)やデューデリジェンス(17% 改善)で顕著な向上を確認しました。" — Ben Kus, CTO
  • "週末に Opus 5 に私の開発環境群の chief-of-staff 役を任せました: 自分でモニターを作り、各ボックスを操作し、判断が必要な時だけ私を呼びました。" — Cristian Rivera, Staff Software Engineer
  • "Opus 5 は当社の Fundamental Research Assistant コードベースに大規模な変更を加え、エージェント的なワークフローの中でフィードバックに順応し、これまで使ったどのモデルよりも明確に推論を説明しました。通常はより小さな単位に分ける作業を一括処理できました。" — Conor Kiernan, CTO
  • "最も難しい金融モデリングタスクのいくつかで、Opus 5 は正確性と効率の両面で Opus 4.8 に対して明確な優位を示します。性能の下限が実質的に高く、effort レベルを通して平均で 9 ポイント高い精度を示し、ターン数とツールコールが 1/3 減、時間は 60% 減でした。" — Richard Pham, Evals and Product Lead
  • "フロントエンド開発者のように自分の作業を検証します。ベンチマークではデスクトップとモバイル幅でページを開き、モバイル折り畳みの下に隠れたプロダクトや画面外のチェックアウトボタンを検出して修正しました。" — AJ Orbach, Co-Founder and CEO
  • "法律分野のエージェント作業で Opus 5 は prior Opus モデルより明らかに性能向上があり、コーポレートガバナンスや仲裁のような実務分野で特に大きな改善が見られました。max reasoning 時に Opus 4.8 と比べ平均で 26% 少ないトークンで同等の性能を維持できた点にも感心しました。" — Niko Grupen, Head of Applied Research
  • "より長期の作業(フルデッキを作って改訂する等)で最大の利得が見られます。成果物の品質がモデル採用の決め手ですが、ビジュアル理解の向上、整ったフォーマット、スライドの問題が少ないことが明確な差でした。" — Alex Wang, Applied AI
  • "判断力が際立ちます。PR を引き継ぐ際にも急いで公開せず、ブランチを検証しテンプレートをチェックし、テストの影響を考えて引き渡しがクリーンになるようにします。古いモデルは先走ってチェックで止められることがありました。" — Zimu Li, Member of Technical Staff
  • "再アーキテクトのセッションで私の提案に対して Opus 5 は反論を示し、私が押し切っても折れることはありませんでした。代わりに提案の価値ある点を明確に説明し、反対点を単一の設計問題に絞り、良い点を残しつつ欠陥を修正する妥協案を提示しました。これが少ない監視で信頼できる理由です。" — Marquis Wang, Principal AI Engineer
  • "初回ターンのレッドラインで Opus 5 は我々がテストしたどのモデルより高いスコアを獲得し、Opus 4.8 のほぼ2倍でした。NDAs へのコメントもより短時間かつ少ないパスで赤ラインに到達し、精度は維持または向上しました。" — Ryan Tanenholz, Member of Technical Staff
  • "クリーンで無駄のない diffs を書き、微妙でコードベース固有の問題のハザード検出が強いです。プロダクションワークロードに採用予定です。" — Neeraj Deshmukh, Director of Engineering
  • "Cosmos(当社の統合エージェントプラットフォーム)では確実にいくつかのユースケースを移行します。コードレビューでの利用が増えるのを楽しみにしており、人々に Opus 4.8 ではなく Opus 5 を使ってほしいと言えます。" — Igor Ostrovsky, Co-Founder and CTO
  • "Opus 5 の特徴は判断力です。書く前により深く考え、計画段階で自分自身の論理的欠陥を検出し、単に動くかどうかではなく『なぜ答えが正しいか』を論理立てて説明します。Claude のモデル間でこれほど明確な問題解決能力の飛躍は初めてで、JetBrains の IDE での採用を楽しみにしています。" — Denis Shiryaev, Head of AI in IDE
  • "当社のトレーディングベンチマークで Opus ファミリー中最強の成績を出し、推論トークンは約 1/7、レイテンシも Opus 4.8 の半分以下で到達しました。より少ない計算でより良い応答です。" — Matt Nassr, Head of Global Data Engineering and AI Transformation

アライメントと安全性

  • アライメント: 展開前テスト中、当社の自動行動監査では Opus 5 がこれまでで最もアラインされたモデルであることが示されました(下のグラフ参照)。Claude の Constitution により良く従い、Opus 4.8、Sonnet 5、Fable 5 よりも欺瞞行為の発現率が低く、誤用へと誘導されにくい傾向が確認されました。
  • 安全性: 取り返しのつかない副作用を招きかねない無謀な行動を避ける点でも、これまでで最も安全なモデルです。自動行動監査での "overall misaligned behavior" スコアは 2.3 で、最近のモデルの中で最も低い値でした。

(注: 本記事は製品発表の要約であり、より詳細な評価データやグラフは公式ドキュメントを参照してください。)