OpenAIAnthropic NewsJul 2, 2026, 12:00 AM

More details on Fable 5’s cyber safeguards and our jailbreak framework

A condensed section focused on the key takeaways first.

Original Post

Quick Digest

Summary

A condensed section focused on the key takeaways first.

openaienmodel: gpt-5-mini-2025-08-07

More details on Fable 5’s cyber safeguards and our jailbreak framework

Key Points

  • Fable 5 redeployed globally
  • Four classifier categories; larger safety margin
  • Draft jailbreak severity framework + HackerOne

Summary

Claude Fable 5 has been re-deployed globally. This note summarizes the model’s cybersecurity safeguards (the safety classifiers), how they categorize cybersecurity-related prompts, and an early draft AI jailbreak severity framework developed with partners. It explains what the classifiers are intended to block, allow, or monitor, and describes practical steps for security researchers and engineers interacting with Fable 5.

Key Points

  • Classifier categories: prohibited use (blocked), high-risk dual use (blocked until stronger controls), low-risk dual use (monitored; sometimes blocked by a safety margin), and benign use (allowed, with monitoring).
  • Safety margin: Fable 5’s safety margin was intentionally increased versus prior models, causing more conservative blocking (higher false positives) to reduce risk of harmful outputs.
  • Prohibited examples: destructive malware, cyber-physical sabotage, defense evasion, command-and-control, exfiltration, malware development and delivery, internet backbone attacks — these are intended to be fully blocked.
  • High-risk dual use examples: unauthorized access, exploitation, privilege escalation, lateral movement, exploit weaponization, ICS/OT/telecom/financial attack techniques — blocked pending stricter access controls.
  • Low-risk dual use examples: OSINT, public scanning, vulnerability identification that many other tools already perform, and cryptographic protocol testing — generally allowed but some requests fall into the safety margin and may be blocked.
  • Benign use: core defensive/IT activities are typically allowed; any blocks are likely false positives from the safety margin.
  • Broader safeguards: classifiers operate alongside access controls, model safety training, and offline monitoring.
  • Jailbreak framework: an early draft severity taxonomy to standardize how developers, governments, and researchers describe jailbreak risk; feedback is requested to refine it.
  • How to engage: submit potential cyber jailbreaks via the new HackerOne program and send feedback to cyber-safeguards@anthropic.com.

Practical guidance for engineers

  • Expect stricter blocking for high-risk and prohibited prompts; design tests and automation to handle classifier rejections (clear error handling and human review paths).
  • When researching model behavior or potential jailbreaks, use the HackerOne program rather than posting exploits publicly; include context and reproduction steps.
  • If you rely on vulnerability-finding workflows, validate whether Fable 5’s classifier behaviour meets your needs (some high-uplift vulnerability finding is intentionally blocked).

What’s next

  • Anthropic may adjust classifier boundaries and the safety margin over time based on real-world feedback and security research. The jailbreak severity framework is a work in progress and they seek community input.

Full Translation

Translations

A translation section that keeps the flow of the original article.

openaijamodel: gpt-5-mini-2025-08-07

Fable 5のサイバー保護策と我々のAI jailbreakフレームワークの詳細

概要

Claude Fable 5(以下「Fable 5」)は再デプロイされ、全ユーザー向けにグローバルに利用可能になりました。本稿では二つの領域について追加情報を共有します。

  1. モデルとともに導入したサイバーセキュリティに関する保護策、特に「安全性分類器(safety classifiers)」の詳細。これらは危険(または潜在的に危険)なサイバー用途を検知・ブロックするためのAIシステムです。Fable 5の分類器が防止を意図する(および意図しない)有害事象の種類を詳述します。
  2. 我々がGlasswingのパートナーと協働して検討している、AI jailbreakの重大度(severity)フレームワークの初期ドラフト。AI jailbreakは、モデルの保護策を回避して本来防ぎたい挙動(危険なサイバータスク等)を有効化するための特殊なプロンプト手法です。jailbreakはその深刻度が様々で、些細な望ましくない挙動だけを解除するものから、広範な有害出力を可能にしてモデルを大きく危険化させるものまであります。だが、各jailbreakの深刻度を記述する合意された枠組みは存在しません。このようなフレームワークがあれば、AI開発者と政府が一貫した用語で各jailbreakのリスクを議論できます。本稿は現在の考え方を反映しており、学術界、業界、市民社会、政府を巻き込んだ有益な議論を喚起することを期待します。フィードバックや批評は cyber-safeguards@anthropic.com で歓迎します。

また、我々はセキュリティ研究者がFable 5で発見した可能性のあるサイバーjailbreakを提出できるHackerOneプログラムを立ち上げました。共同作業によって、防御的利用を可能にしつつ悪用を防ぐ標準を確立できると考えています。


Fable 5のサイバー保護策

サイバーセキュリティ分野はしばしば“デュアルユース”(dual use)であるため、AIの保護は特に難しいです。多くのセキュリティ能力は善意・悪意の両方に使われ得ます。例えば、我々はディフェンダーが自らのコードベースをスキャンして脆弱性を見つけることを許可したい一方で、同じ能力が悪用者の手に渡ればサイバー攻撃の前段階になり得ます。

したがって、Fable 5ではサイバー用途をすべてブロックする意図はありません。代わりに、我々は安全性分類器を訓練して、サイバー用途を次の4つのカテゴリに分類できるようにしています(危険性の高いものから低いものへ)。下表はその要約です。

  • カテゴリ/説明/分類器の意図する挙動
    • Prohibited use(禁止用途):重大な害を引き起こし得る、あるいは大多数の用途で害をもたらす活動。防御上の有用性がほとんどない。分類器はブロックする。
    • High-risk dual use(高リスクのデュアルユース):悪意ある行為者が広く用いるが、正当な用途(診断、レッドチーム等)もある。分類器はブロックする(既知の正当な行為者へのアクセス制御ができるまで)。
    • Low-risk dual use(低リスクのデュアルユース):主に防御目的で使用されるが、悪用価値もある。監視しつつ、多くは許可。ただし重大なjailbreakを防ぐための“safety margin”として一部をブロックする。
    • Benign use(良性利用):ほとんど濫用の可能性がなく、防御/IT運用に役立つ活動。許可され、必要に応じて監視される。

注:low-risk dual useカテゴリは、再デプロイに関する我々の投稿で説明した「safety margin」とかなり重複します(当該投稿からの図を本文で再掲)。安全余地(safety margin)には、我々が許可したい多くの良性利用が含まれる一方で、慎重さからブロックされるケースもあります。つまり、要求が明確に安全に見える必要があり、我々はこの余地の大きさを調整して分類器が有害行動をより確実に検知するようにしています(Fable 5では、この余地を前モデルよりも大きく設定しました)。

図:分類器の境界をどのように設定するかで“safety margin”の大きさが変わり、良性および低リスクデュアルユースの一部が含まれる。safety marginに入る要求は慎重さからブロックされ、偽陽性(本来良性のプロンプトがブロックされる)率は高くなるが、有害アウトカムの防止は強化される。Fable 5のsafety margin(行B)は他モデルのそれ(行A)より大きく設定された。※図は前回投稿から再掲。Vulns = vulnerabilities。

分類器は広範な保護策の一部に過ぎません。分類器に加え、アクセス制御、モデル安全性トレーニング、オフラインモニタリングなどの追加レイヤーを用いています。

以下では、4つの分類器カテゴリごとに含まれる具体例(およびサイバーに関連するが本分類器の対象外となるいくつかの利用)を詳述します。これらの例は分類器の現在の想定挙動を説明するものであり、実運用での振る舞いやフィードバックに応じて分類器は変更される可能性があります。


Prohibited use(禁止用途)

すべてのセキュリティ能力はデュアルユースですが、以下に挙げる禁止用途は防御上の直接的利益が比較的小さい、あるいは明確に犯罪的であるか、非常に大きな危害に寄与するものです。攻撃者にとって与える利益が防御者に比して著しく大きいため、Fable 5の分類器はこれらのリクエストをブロックすることを意図しています。

禁止用途の例(ブロック対象):

  • 破壊的影響:ランサムウェア/暗号化による恐喝、ワイパー、改ざん、データやプロセスの完全性破壊、サービス拒否(DoS)
  • サイバー物理破壊:デジタル手段による電力・水道・石油/ガス・交通・医療機器などの物理プロセスの操作
  • 防御回避:AV/EDRのバイパス、難読化、パッキング、living-off-the-land、アンチフォレンジクス、ログ改ざん
  • コマンド&コントロール(C2)や秘匿チャネルの構築
  • データの不正持ち出し(所有者のデバイスから攻撃者管理下のデバイスや既知の第三者クラウドサービス等への送出)
  • マルウェアの開発・改良・修正・デバッグ:トロイ、RAT、バックドア、ワーム、スティーラー、ローダー、ドロッパー、ルートキット、ブートキット、ランサムウェア、ワイパー、スパイウェア、ストーカーウェア、ハードウェアレベルのインプラント等
  • マルウェア配布と拡散:マルウェア配布のためのフィッシング/スミッシング、悪性ドキュメントやマクロ、ドライブバイダウンロード、サプライチェーン侵害、自動拡散メカニズム
  • 攻撃用インフラ(C2サーバ、リダイレクタ、ステージング、バレットプルーフホスティング)
  • インターネットバックボーン攻撃:BGPハイジャック/ルートリーク、DNSルート/TLD/リゾルバ攻撃、認証局(CA)侵害、NTP操作

これらの項目の中には、防御側でも定期的に使用されるもの(例:防御回避手法の理解やデータ流出解析)もありますが、実世界での攻撃で頻出し、害の可能性が高いため禁止としています。今後、特定項目の追加・削除を行う可能性があります。


High-risk dual use(高リスクのデュアルユース)

高リスクのデュアルユースは危害の可能性が高い一方で、サイバーセキュリティ専門家の日々の業務の一部でもあります。正当なセキュリティ評価、ペネトレーションテスト、レッドチーム活動で行われることが多い操作(不正アクセスの獲得、権限昇格、横移動、エクスプロイト開発など)は、高リスクであるがゆえに攻撃活動を模倣することを目的としています。正当性と悪用の境界は文脈(誰が、どのような権限で行うか)によって決まります。

Fable 5では、既知の正当な行為者に限定したアクセス制御などの手段が整うまではこれらの操作をブロックする想定です。

高リスクデュアルユースの例(ブロック対象):

  • ハッキング、ペネトレーションテスト、レッドチーミング、バグバウンティ活動(文脈次第で例外的扱いがあり得るが原則ブロック)
  • 不正または予期しない手段によるアクセス獲得:エクスプロイト、認証情報攻撃(ブルートフォース、スプレー、スタッフィング、盗難)、認証バイパス
  • 権限昇格、横移動、永続化
  • エクスプロイト開発と兵器化(ゼロクリック、メモリ破壊系の作業を含む)
  • 仮想マシン/コンテナの脱出(escape)
  • 産業制御システムを対象としたセキュリティ評価:ICS/SCADA/DCS、PLC、RTU、HMI、安全計装システム
  • OTプロトコルの悪用(Modbus、DNP3、OPC、IEC 61850等)
  • 電気通信コアを対象とした評価:SS7/Diameterの悪用、ベースバンドのエクスプロイト、lawful-intercept(正当な傍受)機能の悪用
  • 金融インフラを対象とした評価:支払基盤、銀行間メッセージング、決済・清算、取引所マッチングエンジン
  • 高いインパクトをもたらす脆弱性発見(high-uplift vulnerability finding):他の広く利用可能なモデルでは容易に見つからない脆弱性の特定

脆弱性発見とエクスプロイトについての注記

Claude Fable 5では、high-upliftな脆弱性発見をブロックすることを目指します。つまり、他の広く利用可能なモデルができないような脆弱性を本モデルが特定する能力を制御したいと考えています。とはいえ、脆弱性発見は防御的作業にとって重要な機能であるため、すべての脆弱性発見をブロックする意図はありません。公的な脆弱性報告やセキュリティパッチからエクスプロイトが作られることがあるため、自動的なエクスプロイト生成は慎重にブロックします。また、通常は上位の専門家のみが特定できる非常に複雑な脆弱性はブロック対象にしたいと考えています。一方で、業界内の多くの一般的なモデルがすでに発見可能な脆弱性であれば、Fableがそれを特定して修正することは有益です。

セキュリティコミュニティや米国政府は長く、脆弱性を見つけて責任ある公開を行うことは正の便益が大きいと支持してきました(引用:"[i]n the vast majority of cases, responsibly disclosing a newly discovered vulnerability is clearly in the national interest")。政府は倫理的行為者が脆弱性を発見・報告・修正しやすくする多くのプログラムを支援しています。


Low-risk dual use(低リスクのデュアルユース)

低リスクのデュアルユースは、使用の傾向として防御的な目的に寄る活動群です。高リスク同様、文脈によってブロック/許可の判断は変わりますが、一般には多くのプロンプトが許可される見込みです。ただし、前述のsafety marginのために大部分がブロックされるケースもあります。それでもこのカテゴリは重大懸念とみなしていません。

低リスクデュアルユースの例(多くは許可、ただし一部はsafety marginとしてブロック):

  • Open source intelligence(OSINT):システム、ネットワーク、人の特定
  • 公にアクセス可能なシステムのスキャンや列挙
  • 公開サービスの列挙
  • ダークウェブリサーチ
  • 他のモデルやツールですでに実行可能な脆弱性識別
  • SSL/TLSなど暗号プロトコルのテスト(研究目的)

Benign use(良性利用)

これらは組織のセキュリティを向上させるコアな防御・IT関連活動で、濫用の可能性がほとんどありません。Fable 5の分類器はこれらをブロックする意図はなく、もしブロックが発生する場合はsafety marginによる偽陽性である可能性が高いです。

良性利用の例(許可され、必要に応じて監視):

  • セキュアコーディングのベストプラクティスの助言
  • バグ修正やパッチ適用の支援(侵入や不正操作を助長しない形)
  • 一般的な運用・管理タスク(設定管理、アクセス制御の設計支援等)
  • ログ解析やフォレンジクスのための非侵襲的なサポート
  • セキュリティ教育・トレーニング用の教材作成や説明

AI jailbreak重大度フレームワーク(初期草案)

我々はGlasswingと協働して、AI jailbreakの深刻度を記述する枠組みの草案を作成しています。jailbreakの深刻度は、そのjailbreakが解除する行動の範囲と深さに依存します。フレームワークがあれば、開発者と政府が一貫した用語でリスクを議論でき、適切な対策や情報共有がしやすくなります。本稿で共有するのは現時点の考えであり、広範なフィードバックを期待しています。

フィードバックは cyber-safeguards@anthropic.com までお願いします。


共同作業と報告経路

  • HackerOneプログラム:セキュリティ研究者がFable 5で発見した可能性のあるサイバーjailbreakを提出できます。
  • 我々はアクセス制御、分類器、モデル安全トレーニング、オフラインモニタリングを組み合わせることで、防御的利用を可能にしつつ悪用を防ぐための標準を構築したいと考えています。

注:本文はFable 5のリリース時点での方針と想定挙動を記載しており、実運用での学びや外部からのフィードバックを踏まえて変更される可能性があります。

More details on Fable 5’s cyber safeguards and our jailbreak framework | Anthropic News | DocsDigest