OpenAIAnthropic News2026/06/30 0:00

Introducing Claude Sonnet 5

要点だけを先に読めるように短く再構成したセクションです。

元記事

Quick Digest

要約

要点だけを先に読めるように短く再構成したセクションです。

openaijamodel: gpt-5-mini-2025-08-07

Claude Sonnet 5 の概要と導入ポイント

Key Points

  • エージェンシー強化
  • 導入価格あり
  • デフォルトでサイバー保護

Summary

Claude Sonnet 5 はSonnetシリーズで最もエージェンシー(自律的ツール利用・計画実行)に優れたモデルで、Sonnet 4.6 から大幅に改善され、低コストで Opus 4.8 に近い性能を出せる点が特徴です。開発者向けにはマルチステップのコーディング、ツール連携、既存(brownfield)コードの修正・デバッグに特に有用です。詳細な評価と振る舞いは Claude Sonnet 5 System Card を参照してください。

Key Points

  • 利用方法
    • モデル名: claude-sonnet-5(Claude API)
    • 利用先: Free / Pro のデフォルト、Max/Team/Enterprise でも利用可。Claude Code と Claude Platform に対応。
  • 価格(トークン単価)
    • 導入価格 (〜2026-08-31): 入力 $2 / M トークン、出力 $10 / M トークン
    • 標準価格(8/31以降): 入力 $3 / M トークン、出力 $15 / M トークン
  • コスト/性能
    • 中程度の effort レベルでコスト効率が大幅改善。高 effort で Opus 4.8 と同等のタスクが可能な場合あり。
    • 利用時は effort レベルを調整してコストと性能を最適化すること。
  • 安全性・サイバー対策
    • Sonnet 4.6 より全体的に望ましくない振る舞いが低下。
    • サイバー系(エクスプロイト作成など)は意図的に学習しておらず、Opus 系より能力が低い。
    • 危険なサイバー利用をリアルタイムで検出・遮断するサイバー保護がデフォルトで有効。
  • 運用上の注意
    • 高 effort レベルはトークン使用量が増加するため、プラットフォームのレート制限緩和を考慮する必要あり(既に一部サービスでレート上限を引き上げ)。
    • 重要タスクでは System Card の評価結果と自社ポリシーに基づくテストを実施すること。

Notes for Engineers

  • 推奨ユースケース: 自動化ワークフロー、長手順のコーディング・デバッグ、ツール駆動のSaaS連携やドメイン調査。
  • 制限: 高度な攻撃的サイバー作業は期待しないこと。セキュリティ敏感な用途は追加ガードやレビューを併用。
  • 次のアクション: 小スケールで effort レベルのコスト効果を評価し、必要に応じてトークン予算とレート設定を調整してください。

詳細は Claude Sonnet 5 System Card と公式ドキュメント(API リファレンス)を参照してください。

Full Translation

翻訳

原文の流れを保ったまま読める翻訳セクションです。

openaijamodel: gpt-5-mini-2025-08-07

Claude Sonnet 5 の紹介

Claude Sonnet 5 の紹介

公開日: 2026-06-30

Claude Sonnet 5 は、これまでで最もエージェント志向(agentic)な Sonnet モデルとして設計されています。計画立案、ブラウザやターミナルなどのツール利用、自律実行が可能で、数か月前ならより大きく高価なモデルが必要だったレベルの自律性を低コストで実現します。

主なポイント

  • Sonnet クラスのモデル(Claude Sonnet 3.5 / 3.6 / 3.7)は、コーディングやツール利用での高い能力を示し、エージェント時代の幕開けを担ってきました。最近は Opus クラスでのエージェント能力の向上が最も顕著でしたが、Sonnet 5 はその差を縮め、Opus 4.8 に近い性能を、より低い価格で提供します。
  • Sonnet 5 は前世代の Sonnet 4.6 に比べ、推論、ツール使用、コーディング、知識労働などエージェント性能の重要な面で大幅に改善しています。
  • Claude Sonnet 5 System Card には、より広範な評価結果が詳細に記載されています。

パフォーマンス比較(概要)

  • 評価例: agentic search(BrowseComp)および agentic computer use(OSWorld-Verified)における Sonnet 5 のコストと性能の比較。
  • Sonnet 5(オレンジ線)は Sonnet 4.6(灰色線)を一貫して上回り、Opus 4.8(黄色線)よりも広いコスト-パフォーマンスの選択肢をカバーします。
  • 中程度の effort レベルではコスト効率が大幅に改善され、高 effort では一部タスクで Opus 4.8 に匹敵します。ユーザーは Sonnet 5 と Opus 4.8 の間で effort レベルを調整してコストと性能の最適なバランスを見つけられます。
  • 表示されるチャートは、Sonnet 5 を $3/百万入力トークン、$15/百万出力トークンで示しています。ローンチ期間(~2026-08-31)は $2/MTok 入力、$10/MTok 出力 の導入価格が適用され、実効コストはさらに低くなります。Opus 4.8 は $5/MTok 入力、$25/MTok 出力 です。
  • xhigh = extra high effort level(追加の超高 effort レベル)

早期アクセスパートナーのフィードバック

フィードバックは一貫しており、Sonnet 5 は前世代よりもはるかにエージェント志向であると評価されています。

「複雑なタスクを最後まで完遂します。以前の Sonnet モデルだと途中で止まってしまっていた作業が、エンドツーエンドで終わるようになりました。日常的な自動化では間違いなく有効です。」

— Zimu Li(テクニカルスタッフ)

「同じ出力品質で、より少ない手順で達成できます。不安全なリクエストは一貫してきれいに拒否します。」

— Daniel Shepard(シニアエンジニア)

「多数の難しいプルリクエストに対して、テスト・検証済みの結果を単独で出してくれました。エンジニアは判断や最終の承認に集中できます。」

— Yusuke Kaji(GM, AI for Business)

(他にも多数の事例があり、長期的なコーディング、ツール使用、デバッグに強みがあること、フォローアップや技術的基盤が重要なワークフローで特に有用であることが報告されています。)

安全性評価(要約)

  • 事前展開の安全性評価では、Sonnet 5 は Sonnet 4.6 に比べ全体的に望ましくない振る舞いの発生率が低く、エージェント文脈での利用において一般により安全であると判断されました。
  • エージェント安全性:悪意あるリクエストの拒否や、プロンプトインジェクションによるハイジャック耐性が改善。
  • 幻覚(hallucination)や追従(sycophancy)の発生率が Sonnet 4.6 より低い。
  • 自動化行動監査(behavioral audit)では、幅広い不整合行動(誤用に協力する傾向や欺瞞など)をテストしており、Sonnet 5 は全体として低い(つまり安全)スコアを示しました。ただし、Opus 4.8 や Claude Mythos Preview と比べると、やや高い不整合行動率を示す項目もありました(詳細は Sonnet 5 System Card の Section 6.4 を参照)。

サイバーセキュリティに関する能力と対策

  • Sonnet 5 は意図的にサイバーセキュリティ用の訓練を受けていません。ルーチンで無害なサイバータスクは一部実行できますが、脆弱性を利用するソフトウェアエクスプロイトの開発など潜在的に危険なサイバー技能を試す評価では、Opus 4.8 や Mythos 5 と比べて著しく低い性能を示しました。
  • 例: Firefox 147 の脆弱性に対するエクスプロイト開発評価(Mozilla と共同で開発;すべての脆弱性は Firefox 148 で修正済み)では、Sonnet モデルはいずれも完全な動作エクスプロイトを開発できませんでした(両モデルとも 0.0%)。ただし Sonnet 5 は Sonnet 4.6 より若干高い部分的成功率を示しました。これは特定の訓練ではなく、一般的な知能の改善による可能性が高いと考えられます(詳細は Sonnet 5 System Card の Section 3.2.4 を参照)。
  • 対応策: Sonnet 5 はデフォルトでサイバー対策(危険なサイバー利用をリアルタイムで検出・ブロックする保護機構)が有効化されています。これらの保護は Claude Opus 4.7 / 4.8 と同等で、Fable 5 で導入されたより厳格なブロック範囲よりは緩やかです(当社評価では Sonnet 5 による全体的なサイバーリスクは低いと判断したため)。

可用性と価格

  • 今日より、Claude Sonnet 5 はすべてのプランで利用可能です。
    • Free および Pro プランのデフォルトモデル
    • Max、Team、Enterprise のユーザーにも利用可能
  • Claude Code および Claude Platform でも利用可能で、導入価格は次の通りです(ローンチ期間):
    • 導入価格(~2026-08-31): $2 / 百万入力トークン、$10 / 百万出力トークン
    • 2026-09-01 以降の標準価格: $3 / 百万入力トークン、$15 / 百万出力トークン
  • 開発者は claude-sonnet-5 を Claude API 経由で利用できます。
  • Chat、Cowork、Claude Code、Claude Platform 全体で高 effort レベルに対応するためレート制限を引き上げています。ユーザーはプロジェクトに応じて適切な effort レベルを選択してください。

開発用途での取り扱い

  • マルチステップのソフトウェアエンジニアリング業務、持続的なコーディング、ツール使用、デバッグで高い実用性を発揮します。
  • ブラウンフィールドコード(競合状態、隠れたテスト、手を付けたがられる箇所)での不具合追跡と根本原因修正に強みを持ちます。

チェンジログ

  • 2026-06-30: 本投稿のオリジナル版では BrowseComp 評価のコスト・パフォーマンスチャートが、agentic search 評価で標準的に使用している方法論を反映していない単純化されたデータに基づいていました。これにより Sonnet 5 の評価を過小評価していました。チャートと周辺テキストを、Sonnet 5 System Card で議論している方法(10M トークン予算、コンパクション、プログラム的ツール呼び出しを用いた方法)に合わせて更新しました。

詳細な評価、メトリクス、各種テスト結果は Claude Sonnet 5 System Card を参照してください。