OpenAIAnthropic News2026/06/30 0:00

Redeploying Fable 5

要点だけを先に読めるように短く再構成したセクションです。

元記事

Quick Digest

要約

要点だけを先に読めるように短く再構成したセクションです。

openaijamodel: gpt-5-mini-2025-08-07

Fable 5 の再展開と安全対策の要点

Key Points

  • Fable 5 を7/1再展開
  • 改良分類器で99%ブロック
  • Mythos 5 は一部復旧済み

Summary

2026-06-30 に米国の輸出規制が解除され、Fable 5 のアクセスは 7 月 1 日からグローバルに復帰しました。Claude Mythos 5 は一部の米国内組織向けに 6 月 26 日承認を受けて復旧済みです。6 月 12 日の規制発動を受けて一時停止していたが、報告された「バイパス」手法に対し改良した安全分類器を導入し、問題の挙動は99%以上ブロックされるようになりました。ブロックされたリクエストは自動的に Opus 4.8 にフォールバックします。クラウド(AWS/GCP/Microsoft Foundry)上の再有効化は順次対応予定です。

Key Points

  • 重要日付
    • 2026-06-09:Fable 5 / Mythos 5 公開(Fable 5 は強化された保護で一般公開)
    • 2026-06-12:米国が輸出規制を発動、全ユーザー向けアクセスを一時停止
    • 2026-06-26:Mythos 5 の一部米国組織向け承認
    • 2026-06-30:輸出規制解除、Fable 5 復帰発表、7/1 グローバル提供開始
  • 技術的対策
    • 問題のバイパス手法を標的とする改良分類器を導入し、該当手法を99%以上ブロック
    • ブロック時はリクエストを Opus 4.8 にルーティングして代替応答を提供
    • 分類器の「安全マージン」を従来より広げ、誤検知(正当な防御用途のブロック)が増加する可能性あり
  • 利用制限と課金
    • Pro/Max/Team/一部 Enterprise では 7/7 まで週次使用量の最大50% を Fable 5 で利用可能(以降は使用クレジットにより提供)
  • ガバメント/業界連携
    • 米政府(CAISI 等)と協働で事前検証・情報共有を強化
    • Amazon/Microsoft/Google 等と共に「ジェイルブレイク評価フレームワーク」を開発中

エンジニア向け実務的対応(短く)

  • 運用モニタリング:分類器によるブロックと Opus 4.8 フォールバックのログを確認し、ユーザー影響を評価する
  • テスト/QA:デバッグ・脆弱性検出ワークフローで誤検知ケースを洗い出し、必要なら回避手順やユーザー向けガイダンスを作成する
  • セキュリティ/レッドチーム:引き続き新たなジェイルブレイクを探索し、発見時は即時報告・分類器改良へ連携する
  • 展開計画:クラウド再有効化のタイミングに備えて依存サービスの互換性とアクセス制御を確認する

必要であれば、ブロックの閾値やログ形式、Opus 4.8 フォールバック挙動の詳細についてさらにまとめます。

Full Translation

翻訳

原文の流れを保ったまま読める翻訳セクションです。

openaijamodel: gpt-5-mini-2025-08-07

Fable 5 の再展開

アナウンス: Fable 5 の再展開

公開日: 2026-06-30

更新: Claude Fable 5 と Mythos 5 を 2026-07-01 に再展開しました。これにより Claude Fable 5 と Mythos 5 へのアクセスが復旧しました。

金曜日の 6 月 12 日に、米国政府が当社の最新モデルである Claude Fable 5 と Claude Mythos 5 に対して輸出管理を適用しました。これにより、米国内外を問わず外国人に対するアクセスを制限する必要が生じました。命令は即時発効であり、リアルタイムで国籍を確実に判定する方法がなかったため、当社は両モデルへのすべてのユーザーのアクセスを一時停止しました。

本日(6 月 30 日)現在、Fable 5 と Mythos 5 に対する輸出管理は解除されています。Fable 5 は明日 7 月 1 日(水)から、Claude Platform、Claude.ai、Claude Code、Claude Cowork 上で世界中のユーザーが利用可能になります。Pro、Max、Team、および一部の Enterprise プランでは、7 月 7 日までの週次使用上限の最大 50% まで「1 Fable 5」が含まれ、その後は使用クレジットを通じて利用可能になります。我々は AWS、Google Cloud、Microsoft Foundry でのアクセス再開もできるだけ速やかに再有効化します。

また、6 月 26 日に米国政府の承認を受けて、限定された米国の組織向けに Mythos 5 へのアクセスも復元しました。Glasswing プログラムの国内外のパートナーへのアクセス拡大に向け、政府と引き続き連携を進めています。

以下では、4 つの領域で詳細と更新を提供します:

  • 事象のタイムラインと我々が行ったセーフガードの更新
  • セーフガードに対する一般的なアプローチ(安全性分類器の使い方に関する文脈)
  • 業界共通のフレームワークについての取り組み
  • 政府とのより深い協力

タイムラインとセーフガードの更新

  • 当社は 6 月 9 日(火)に Fable 5 と Mythos 5 をリリースしました。両モデルは同じ基盤モデルを共有しますが、Fable 5 は一般利用向けにより強力なセーフガードを付与してリリースされました。Mythos 5 はセーフガードが少なく、主に防御的サイバーセキュリティ用途のために少数の信頼できる Project Glasswing パートナーに限定して提供されました。

  • 6 月 12 日の輸出管理指令は、Amazon の研究者が Fable 5 のセーフガードを回避する手法を見つけたという報告を政府が把握したことを受けて発出されました。報告では、Fable 5 に脆弱性を特定させるよう促すプロンプトが示され、ある事例では当該脆弱性を悪用する方法を示すコードが生成されました。

  • 過去 2 週間、当社は政府や Amazon を含む関係者と緊密に協力して報告と証拠を精査しました。我々のテストにより、Claude Opus 4.8、GPT-5.5、Kimi K2.7 を含む多くの能力の低いモデルでも、その報告で Fable 5 が特定したのと同じ脆弱性を特定できることが確認されました。単一の脆弱性をどのように悪用するかのデモに関しては、テストした全モデルが Fable 5 と同様のデモを生成できました(例:Claude Haiku 4.5、Sonnet 4.6、Opus 4.6、Opus 4.7、Opus 4.8、GPT-5.4、GPT-5.5、Kimi K2.7)。重要な点として、報告された手法は Mythos レベルの独自のサイバー能力を露呈するものではありませんでした。

  • この振る舞いは Fable 5 のセーフガードにとって境界的なケースを反映していました。下で説明するように、危険性が低いと思われるが慎重のためにブロックされるタスクが存在します。報告された手法はそのような振る舞いの一つにアクセスさせるもので、かつ日常的な防御的サイバーセキュリティ作業に限定されていました。しかしながら、当社は迅速に対応しました。

  • 政府と緊密に協力して、報告で記載された振る舞いを標的とする改良された安全性分類器(safety classifier)を訓練しました。リクエストが Fable 5 でブロックされた場合はユーザーに通知され、代わりに Opus 4.8 にリクエストが送られます。新しい分類器により、Amazon の報告で説明された特定の手法は 99% 以上のケースでブロックされます。

  • ごく一部のケースでは、モデルがサイバー攻撃者に十分な詳細を与えない情報を提供する可能性があります。下で述べるように、モデルのセーフガードはすべての低リスクの日常的なサイバーディフェンス能力を遮断することを目的としていません。危険性があるものだけを対象にしています。

  • 米国商務省の Center for AI Standards and Innovation (CAISI) の研究者は、当社の旧セーフガードと新セーフガードの双方をテストし、非常に強力であることに同意しています。

  • 新しい分類器は、日常的なコーディングやデバッグ作業中に良性のリクエストを誤検出する頻度を上げるというコストを伴います。他のすべてのセーフガードと同様に、誤検出(false positives)を減らし、正当なリクエストと悪用の可能性をよりよく区別するために改善を続けます。


サイバーセキュリティ向けセーフガードのアプローチ

Claude Mythos 5 は、他のどのモデルよりも効率的にソフトウェアの脆弱性を発見・悪用できる可能性があり、非常に熟練した人間のセキュリティ専門家を除いても高い能力を持ちます。こうした強力なサイバー能力は、悪意ある行為者にとって非常に魅力的です。

一方で Claude Fable 5 は、独自の攻撃的能力を提供することはありません。これは、これまでに適用した中で最も強力なセーフガードを付与してリリースしたためです。リリース前の 1 か月間で、当社は複数のチームから研究者とエンジニアを移し、取り組みの人員を倍増させました。

Fable 5 は多様な安全メカニズムとともにローンチしました。各メカニズム単体では完全な防御を提供しないこともありますが、組み合わせることでモデルの誤用を非常に困難にする「多層防御(defense in depth)」のアプローチを取っています。いくつかの防御はモデルを危険なリクエストに応答しないよう訓練することで、他はいったん発生した誤用パターンを後から分析するものです。

特に重要な安全メカニズムの一つが「分類器(classifiers)」です。分類器は小型の自動化された AI システムで、やり取りの途中でモデルが潜在的に有害なサイバーセキュリティ作業を要求されているか(あるいは潜在的に有害な出力を生成しているか)を検出します。検出された場合、分類器はモデルの応答をブロックします。

分類器の究極的な目的は、モデルが独自かつ危険な行動を行うのを防ぐことです。すべての安全メカニズムと同様に、分類器は誤りを犯します。潜在的に危険なコンテンツを見逃すことがあり、また意図的に「jailbreak(脱獄)」される場合もあります。ユーザーが分類器を騙すような異常な方法でプロンプトを構成すると、分類器を回避して本来ブロックすべき有害な出力を得られることがあります。

したがって我々は意図的に分類器のトリガー基準を、通常は良性であろうリクエストを含むように設定しました。この「セーフティマージン」アプローチにより、分類器を回避するにはリクエストが極めて明らかに安全である必要があります(下の図の行 A を参照)。ユーザーには、モデルがいくつかの合理的で無害なリクエストに拒否応答する形でセーフティマージンが体験されます。

Fable 5 では、このセーフティマージンをこれまでのどのローンチよりも大きく設定しました(行 B)。結果として、より多くの良性リクエストがブロックされることを承知の上で、モデルの他の高度な能力を広く利用可能にするというトレードオフを選びました。

セーフティマージンは jailbreak の緩和にも寄与します。多くの jailbreak は狭義で、特定のモデル挙動のアンロックに限定されます。ある場合では、仮想的な利用者がモデルを小規模に jailbreak してセーフティマージン(あるいはあいまいに有害と判断される振る舞い)に踏み入れることができますが、本来我々が遮断すべき中核的な有害行動までは到達しません(下の行 C)。

我々の見解では、これまでに報告された Fable 5 の jailbreak はこの「小規模」なカテゴリに該当します。より重大な jailbreak は、より多くの有害行動をアンロックします。狭義の有害な jailbreak(行 D)は特定の有害行動を引き出すことがありますが、その狭さのため重大度は低〜中程度にとどまる傾向があります。最も懸念されるのは普遍的な jailbreak(行 E)で、広範な有害行動群をアンロックしてしまいます。

図の説明(要約):

  • 行 A: 分類器は許可される無害なリクエストと、ブロックすべき有害なリクエストを判別します。分類器はあいまいなリクエスト(たとえば脆弱性発見のように防御目的か攻撃目的か判別が難しいもの)や明らかに危険なリクエスト(ソフトウェアエクスプロイトの連鎖を構築するなど)をブロックします。さらに「セーフティマージン」を設け、確率的に有害である可能性のある、おおむね良性のリクエストもブロックします。
  • 行 B: Fable 5 ではこのセーフティマージンを拡大し、多くの良性リクエストをブロックする代わりに、真に有害なリクエストが見逃される可能性をさらに低下させました。
  • 行 C〜E: jailbreak の種類ごとの影響範囲(小規模、狭義有害、普遍的有害)を示します。

先に述べたように、AI モデルを完全に jailbreak に対して堅牢(不変)にすることはおそらく不可能です。ある程度の jailbreak は我々のモデルでも発見されると予想しており、その重大度は様々です。小規模な jailbreak が多く、狭義の有害なものがいくつか、Fable 5 に対しては執筆時点で普遍的な jailbreak は発見されていませんが、専門の安全性研究者によるレッドチーミングは続いています。

我々は、重大な jailbreak を悪意ある行為者が利用する前に自分たちと安全パートナーが最初に発見して修正することを目指しています。慎重なアプローチにより、大多数の jailbreak は危険な行動を成功裏にアンロックできません。分類器は成功する jailbreak を高コストかつ高労力にし、たとえ jailbreak が成功しても追加の防御層が緩和策を提供します。新たな jailbreak 手法を学ぶにつれて分類器を更新し続けます。


ジェイルブレイクに関する業界の合意フレームワーク

現時点で、AI ジェイルブレイクの重大度を客観的に記述するための業界共通の基準は存在していません。これにより、ジェイルブレイク手法が発見されるたびに大きな不確実性が生じます:開発者はどの発見を最優先で対処すべきか合意がなく、政府側もいつ行動すべきかの合意基準を持ちません。

この問題は今後数か月でより深刻化する見込みです。より強力なサイバーセキュリティ能力(およびその他の能力)を備えたモデルが次々と訓練・評価・リリースされるためです。AI ジェイルブレイクを評価する共通の基準は、当社や他社が新しいモデルをより安全にローンチするのに役立ち、ユーザーが高度な能力を最大限に活用することを可能にします。

そのため我々は、Amazon、Microsoft、Google、およびその他の Glasswing ...(原文はここで途切れています)