OpenAIAnthropic NewsJun 30, 2026, 12:00 AM

Redeploying Fable 5

A condensed section focused on the key takeaways first.

Original Post

Quick Digest

Summary

A condensed section focused on the key takeaways first.

openaienmodel: gpt-5-mini-2025-08-07

Redeploying Fable 5 — access restored and safeguard updates

Key Points

  • Fable 5 redeployed globally July 1
  • New classifier blocks reported jailbreak >99% of cases
  • Blocked requests fallback to Opus 4.8; expect more false positives

Summary

Access to Claude Fable 5 has been restored after export controls were lifted on 2026-06-30. Fable 5 is redeployed and will be available globally starting 2026-07-01 on the Claude Platform, Claude.ai, Claude Code, and Claude Cowork. Mythos 5 access has been partially restored for approved US organizations. Anthropic worked with the US government and partners to train and deploy an improved safety classifier that blocks the reported jailbreak technique.

Key Points

  • Deployment and availability

    • Fable 5 available globally from 2026-07-01; Mythos 5 restored to a subset of US Glasswing partners.
    • For Pro, Max, Team, and select Enterprise plans, one Fable 5 slot covers up to 50% of weekly usage through 2026-07-07; thereafter access via usage credits.
    • Re-enablement on AWS, Google Cloud, and Microsoft Foundry is pending and will follow as quickly as possible.
  • Safeguard changes and runtime behavior

    • A new safety classifier was trained with government collaboration; it blocks the specific exploited behavior described in the report in over 99% of cases.
    • When a request is blocked by the classifier, traffic is routed to Opus 4.8 as a fallback.
    • The safety configuration uses a larger "safety margin" (defense-in-depth), so expect more false positives during routine coding/debugging; classifiers will be iteratively refined to reduce benign blocking.
  • Operational and collaboration notes

    • Anthropic confirmed that the reported bypass did not expose unique Mythos-level offensive capabilities; many less-capable models showed similar behavior in tests.
    • The company is coordinating with Glasswing partners (Amazon, Microsoft, Google, etc.) to develop a shared framework for rating jailbreak severity and increasing pre-release government collaboration for testing and information-sharing.

Practical guidance for engineers

  • If Fable 5 returns a blocked response, retry on Opus 4.8 or adjust prompts to remove suspicious cybersecurity intent.
  • Expect transient false positives in debugging and routine security work; log blocked requests and submit examples to Anthropic support if they are legitimate developer workflows.
  • Monitor vendor advisories for updates to the classifier, cloud availability, and any changes to usage-credit billing after 2026-07-07.

Full Translation

Translations

A translation section that keeps the flow of the original article.

openaijamodel: gpt-5-mini-2025-08-07

Fable 5 の再展開

アナウンス: Fable 5 の再展開

公開日: 2026-06-30

更新: Claude Fable 5 と Mythos 5 を 2026-07-01 に再展開しました。これにより Claude Fable 5 と Mythos 5 へのアクセスが復旧しました。

金曜日の 6 月 12 日に、米国政府が当社の最新モデルである Claude Fable 5 と Claude Mythos 5 に対して輸出管理を適用しました。これにより、米国内外を問わず外国人に対するアクセスを制限する必要が生じました。命令は即時発効であり、リアルタイムで国籍を確実に判定する方法がなかったため、当社は両モデルへのすべてのユーザーのアクセスを一時停止しました。

本日(6 月 30 日)現在、Fable 5 と Mythos 5 に対する輸出管理は解除されています。Fable 5 は明日 7 月 1 日(水)から、Claude Platform、Claude.ai、Claude Code、Claude Cowork 上で世界中のユーザーが利用可能になります。Pro、Max、Team、および一部の Enterprise プランでは、7 月 7 日までの週次使用上限の最大 50% まで「1 Fable 5」が含まれ、その後は使用クレジットを通じて利用可能になります。我々は AWS、Google Cloud、Microsoft Foundry でのアクセス再開もできるだけ速やかに再有効化します。

また、6 月 26 日に米国政府の承認を受けて、限定された米国の組織向けに Mythos 5 へのアクセスも復元しました。Glasswing プログラムの国内外のパートナーへのアクセス拡大に向け、政府と引き続き連携を進めています。

以下では、4 つの領域で詳細と更新を提供します:

  • 事象のタイムラインと我々が行ったセーフガードの更新
  • セーフガードに対する一般的なアプローチ(安全性分類器の使い方に関する文脈)
  • 業界共通のフレームワークについての取り組み
  • 政府とのより深い協力

タイムラインとセーフガードの更新

  • 当社は 6 月 9 日(火)に Fable 5 と Mythos 5 をリリースしました。両モデルは同じ基盤モデルを共有しますが、Fable 5 は一般利用向けにより強力なセーフガードを付与してリリースされました。Mythos 5 はセーフガードが少なく、主に防御的サイバーセキュリティ用途のために少数の信頼できる Project Glasswing パートナーに限定して提供されました。

  • 6 月 12 日の輸出管理指令は、Amazon の研究者が Fable 5 のセーフガードを回避する手法を見つけたという報告を政府が把握したことを受けて発出されました。報告では、Fable 5 に脆弱性を特定させるよう促すプロンプトが示され、ある事例では当該脆弱性を悪用する方法を示すコードが生成されました。

  • 過去 2 週間、当社は政府や Amazon を含む関係者と緊密に協力して報告と証拠を精査しました。我々のテストにより、Claude Opus 4.8、GPT-5.5、Kimi K2.7 を含む多くの能力の低いモデルでも、その報告で Fable 5 が特定したのと同じ脆弱性を特定できることが確認されました。単一の脆弱性をどのように悪用するかのデモに関しては、テストした全モデルが Fable 5 と同様のデモを生成できました(例:Claude Haiku 4.5、Sonnet 4.6、Opus 4.6、Opus 4.7、Opus 4.8、GPT-5.4、GPT-5.5、Kimi K2.7)。重要な点として、報告された手法は Mythos レベルの独自のサイバー能力を露呈するものではありませんでした。

  • この振る舞いは Fable 5 のセーフガードにとって境界的なケースを反映していました。下で説明するように、危険性が低いと思われるが慎重のためにブロックされるタスクが存在します。報告された手法はそのような振る舞いの一つにアクセスさせるもので、かつ日常的な防御的サイバーセキュリティ作業に限定されていました。しかしながら、当社は迅速に対応しました。

  • 政府と緊密に協力して、報告で記載された振る舞いを標的とする改良された安全性分類器(safety classifier)を訓練しました。リクエストが Fable 5 でブロックされた場合はユーザーに通知され、代わりに Opus 4.8 にリクエストが送られます。新しい分類器により、Amazon の報告で説明された特定の手法は 99% 以上のケースでブロックされます。

  • ごく一部のケースでは、モデルがサイバー攻撃者に十分な詳細を与えない情報を提供する可能性があります。下で述べるように、モデルのセーフガードはすべての低リスクの日常的なサイバーディフェンス能力を遮断することを目的としていません。危険性があるものだけを対象にしています。

  • 米国商務省の Center for AI Standards and Innovation (CAISI) の研究者は、当社の旧セーフガードと新セーフガードの双方をテストし、非常に強力であることに同意しています。

  • 新しい分類器は、日常的なコーディングやデバッグ作業中に良性のリクエストを誤検出する頻度を上げるというコストを伴います。他のすべてのセーフガードと同様に、誤検出(false positives)を減らし、正当なリクエストと悪用の可能性をよりよく区別するために改善を続けます。


サイバーセキュリティ向けセーフガードのアプローチ

Claude Mythos 5 は、他のどのモデルよりも効率的にソフトウェアの脆弱性を発見・悪用できる可能性があり、非常に熟練した人間のセキュリティ専門家を除いても高い能力を持ちます。こうした強力なサイバー能力は、悪意ある行為者にとって非常に魅力的です。

一方で Claude Fable 5 は、独自の攻撃的能力を提供することはありません。これは、これまでに適用した中で最も強力なセーフガードを付与してリリースしたためです。リリース前の 1 か月間で、当社は複数のチームから研究者とエンジニアを移し、取り組みの人員を倍増させました。

Fable 5 は多様な安全メカニズムとともにローンチしました。各メカニズム単体では完全な防御を提供しないこともありますが、組み合わせることでモデルの誤用を非常に困難にする「多層防御(defense in depth)」のアプローチを取っています。いくつかの防御はモデルを危険なリクエストに応答しないよう訓練することで、他はいったん発生した誤用パターンを後から分析するものです。

特に重要な安全メカニズムの一つが「分類器(classifiers)」です。分類器は小型の自動化された AI システムで、やり取りの途中でモデルが潜在的に有害なサイバーセキュリティ作業を要求されているか(あるいは潜在的に有害な出力を生成しているか)を検出します。検出された場合、分類器はモデルの応答をブロックします。

分類器の究極的な目的は、モデルが独自かつ危険な行動を行うのを防ぐことです。すべての安全メカニズムと同様に、分類器は誤りを犯します。潜在的に危険なコンテンツを見逃すことがあり、また意図的に「jailbreak(脱獄)」される場合もあります。ユーザーが分類器を騙すような異常な方法でプロンプトを構成すると、分類器を回避して本来ブロックすべき有害な出力を得られることがあります。

したがって我々は意図的に分類器のトリガー基準を、通常は良性であろうリクエストを含むように設定しました。この「セーフティマージン」アプローチにより、分類器を回避するにはリクエストが極めて明らかに安全である必要があります(下の図の行 A を参照)。ユーザーには、モデルがいくつかの合理的で無害なリクエストに拒否応答する形でセーフティマージンが体験されます。

Fable 5 では、このセーフティマージンをこれまでのどのローンチよりも大きく設定しました(行 B)。結果として、より多くの良性リクエストがブロックされることを承知の上で、モデルの他の高度な能力を広く利用可能にするというトレードオフを選びました。

セーフティマージンは jailbreak の緩和にも寄与します。多くの jailbreak は狭義で、特定のモデル挙動のアンロックに限定されます。ある場合では、仮想的な利用者がモデルを小規模に jailbreak してセーフティマージン(あるいはあいまいに有害と判断される振る舞い)に踏み入れることができますが、本来我々が遮断すべき中核的な有害行動までは到達しません(下の行 C)。

我々の見解では、これまでに報告された Fable 5 の jailbreak はこの「小規模」なカテゴリに該当します。より重大な jailbreak は、より多くの有害行動をアンロックします。狭義の有害な jailbreak(行 D)は特定の有害行動を引き出すことがありますが、その狭さのため重大度は低〜中程度にとどまる傾向があります。最も懸念されるのは普遍的な jailbreak(行 E)で、広範な有害行動群をアンロックしてしまいます。

図の説明(要約):

  • 行 A: 分類器は許可される無害なリクエストと、ブロックすべき有害なリクエストを判別します。分類器はあいまいなリクエスト(たとえば脆弱性発見のように防御目的か攻撃目的か判別が難しいもの)や明らかに危険なリクエスト(ソフトウェアエクスプロイトの連鎖を構築するなど)をブロックします。さらに「セーフティマージン」を設け、確率的に有害である可能性のある、おおむね良性のリクエストもブロックします。
  • 行 B: Fable 5 ではこのセーフティマージンを拡大し、多くの良性リクエストをブロックする代わりに、真に有害なリクエストが見逃される可能性をさらに低下させました。
  • 行 C〜E: jailbreak の種類ごとの影響範囲(小規模、狭義有害、普遍的有害)を示します。

先に述べたように、AI モデルを完全に jailbreak に対して堅牢(不変)にすることはおそらく不可能です。ある程度の jailbreak は我々のモデルでも発見されると予想しており、その重大度は様々です。小規模な jailbreak が多く、狭義の有害なものがいくつか、Fable 5 に対しては執筆時点で普遍的な jailbreak は発見されていませんが、専門の安全性研究者によるレッドチーミングは続いています。

我々は、重大な jailbreak を悪意ある行為者が利用する前に自分たちと安全パートナーが最初に発見して修正することを目指しています。慎重なアプローチにより、大多数の jailbreak は危険な行動を成功裏にアンロックできません。分類器は成功する jailbreak を高コストかつ高労力にし、たとえ jailbreak が成功しても追加の防御層が緩和策を提供します。新たな jailbreak 手法を学ぶにつれて分類器を更新し続けます。


ジェイルブレイクに関する業界の合意フレームワーク

現時点で、AI ジェイルブレイクの重大度を客観的に記述するための業界共通の基準は存在していません。これにより、ジェイルブレイク手法が発見されるたびに大きな不確実性が生じます:開発者はどの発見を最優先で対処すべきか合意がなく、政府側もいつ行動すべきかの合意基準を持ちません。

この問題は今後数か月でより深刻化する見込みです。より強力なサイバーセキュリティ能力(およびその他の能力)を備えたモデルが次々と訓練・評価・リリースされるためです。AI ジェイルブレイクを評価する共通の基準は、当社や他社が新しいモデルをより安全にローンチするのに役立ち、ユーザーが高度な能力を最大限に活用することを可能にします。

そのため我々は、Amazon、Microsoft、Google、およびその他の Glasswing ...(原文はここで途切れています)

Redeploying Fable 5 | Anthropic News | DocsDigest