Claude Sonnet 5 の紹介
公開日: 2026-06-30
Claude Sonnet 5 は、これまでで最もエージェント志向(agentic)な Sonnet モデルとして設計されています。計画立案、ブラウザやターミナルなどのツール利用、自律実行が可能で、数か月前ならより大きく高価なモデルが必要だったレベルの自律性を低コストで実現します。
主なポイント
- Sonnet クラスのモデル(Claude Sonnet 3.5 / 3.6 / 3.7)は、コーディングやツール利用での高い能力を示し、エージェント時代の幕開けを担ってきました。最近は Opus クラスでのエージェント能力の向上が最も顕著でしたが、Sonnet 5 はその差を縮め、Opus 4.8 に近い性能を、より低い価格で提供します。
- Sonnet 5 は前世代の Sonnet 4.6 に比べ、推論、ツール使用、コーディング、知識労働などエージェント性能の重要な面で大幅に改善しています。
- Claude Sonnet 5 System Card には、より広範な評価結果が詳細に記載されています。
パフォーマンス比較(概要)
- 評価例: agentic search(BrowseComp)および agentic computer use(OSWorld-Verified)における Sonnet 5 のコストと性能の比較。
- Sonnet 5(オレンジ線)は Sonnet 4.6(灰色線)を一貫して上回り、Opus 4.8(黄色線)よりも広いコスト-パフォーマンスの選択肢をカバーします。
- 中程度の effort レベルではコスト効率が大幅に改善され、高 effort では一部タスクで Opus 4.8 に匹敵します。ユーザーは Sonnet 5 と Opus 4.8 の間で effort レベルを調整してコストと性能の最適なバランスを見つけられます。
- 表示されるチャートは、Sonnet 5 を $3/百万入力トークン、$15/百万出力トークンで示しています。ローンチ期間(~2026-08-31)は $2/MTok 入力、$10/MTok 出力 の導入価格が適用され、実効コストはさらに低くなります。Opus 4.8 は $5/MTok 入力、$25/MTok 出力 です。
- xhigh = extra high effort level(追加の超高 effort レベル)
早期アクセスパートナーのフィードバック
フィードバックは一貫しており、Sonnet 5 は前世代よりもはるかにエージェント志向であると評価されています。
「複雑なタスクを最後まで完遂します。以前の Sonnet モデルだと途中で止まってしまっていた作業が、エンドツーエンドで終わるようになりました。日常的な自動化では間違いなく有効です。」
— Zimu Li(テクニカルスタッフ)
「同じ出力品質で、より少ない手順で達成できます。不安全なリクエストは一貫してきれいに拒否します。」
— Daniel Shepard(シニアエンジニア)
「多数の難しいプルリクエストに対して、テスト・検証済みの結果を単独で出してくれました。エンジニアは判断や最終の承認に集中できます。」
— Yusuke Kaji(GM, AI for Business)
(他にも多数の事例があり、長期的なコーディング、ツール使用、デバッグに強みがあること、フォローアップや技術的基盤が重要なワークフローで特に有用であることが報告されています。)
安全性評価(要約)
- 事前展開の安全性評価では、Sonnet 5 は Sonnet 4.6 に比べ全体的に望ましくない振る舞いの発生率が低く、エージェント文脈での利用において一般により安全であると判断されました。
- エージェント安全性:悪意あるリクエストの拒否や、プロンプトインジェクションによるハイジャック耐性が改善。
- 幻覚(hallucination)や追従(sycophancy)の発生率が Sonnet 4.6 より低い。
- 自動化行動監査(behavioral audit)では、幅広い不整合行動(誤用に協力する傾向や欺瞞など)をテストしており、Sonnet 5 は全体として低い(つまり安全)スコアを示しました。ただし、Opus 4.8 や Claude Mythos Preview と比べると、やや高い不整合行動率を示す項目もありました(詳細は Sonnet 5 System Card の Section 6.4 を参照)。
サイバーセキュリティに関する能力と対策
- Sonnet 5 は意図的にサイバーセキュリティ用の訓練を受けていません。ルーチンで無害なサイバータスクは一部実行できますが、脆弱性を利用するソフトウェアエクスプロイトの開発など潜在的に危険なサイバー技能を試す評価では、Opus 4.8 や Mythos 5 と比べて著しく低い性能を示しました。
- 例: Firefox 147 の脆弱性に対するエクスプロイト開発評価(Mozilla と共同で開発;すべての脆弱性は Firefox 148 で修正済み)では、Sonnet モデルはいずれも完全な動作エクスプロイトを開発できませんでした(両モデルとも 0.0%)。ただし Sonnet 5 は Sonnet 4.6 より若干高い部分的成功率を示しました。これは特定の訓練ではなく、一般的な知能の改善による可能性が高いと考えられます(詳細は Sonnet 5 System Card の Section 3.2.4 を参照)。
- 対応策: Sonnet 5 はデフォルトでサイバー対策(危険なサイバー利用をリアルタイムで検出・ブロックする保護機構)が有効化されています。これらの保護は Claude Opus 4.7 / 4.8 と同等で、Fable 5 で導入されたより厳格なブロック範囲よりは緩やかです(当社評価では Sonnet 5 による全体的なサイバーリスクは低いと判断したため)。
可用性と価格
- 今日より、Claude Sonnet 5 はすべてのプランで利用可能です。
- Free および Pro プランのデフォルトモデル
- Max、Team、Enterprise のユーザーにも利用可能
- Claude Code および Claude Platform でも利用可能で、導入価格は次の通りです(ローンチ期間):
- 導入価格(~2026-08-31): $2 / 百万入力トークン、$10 / 百万出力トークン
- 2026-09-01 以降の標準価格: $3 / 百万入力トークン、$15 / 百万出力トークン
- 開発者は claude-sonnet-5 を Claude API 経由で利用できます。
- Chat、Cowork、Claude Code、Claude Platform 全体で高 effort レベルに対応するためレート制限を引き上げています。ユーザーはプロジェクトに応じて適切な effort レベルを選択してください。
開発用途での取り扱い
- マルチステップのソフトウェアエンジニアリング業務、持続的なコーディング、ツール使用、デバッグで高い実用性を発揮します。
- ブラウンフィールドコード(競合状態、隠れたテスト、手を付けたがられる箇所)での不具合追跡と根本原因修正に強みを持ちます。
チェンジログ
- 2026-06-30: 本投稿のオリジナル版では BrowseComp 評価のコスト・パフォーマンスチャートが、agentic search 評価で標準的に使用している方法論を反映していない単純化されたデータに基づいていました。これにより Sonnet 5 の評価を過小評価していました。チャートと周辺テキストを、Sonnet 5 System Card で議論している方法(10M トークン予算、コンパクション、プログラム的ツール呼び出しを用いた方法)に合わせて更新しました。
詳細な評価、メトリクス、各種テスト結果は Claude Sonnet 5 System Card を参照してください。