OpenAIOpenAI News2026/06/26 10:00

Previewing GPT-5.6 Sol: a next-generation model

要点だけを先に読めるように短く再構成したセクションです。

元記事

Quick Digest

要約

要点だけを先に読めるように短く再構成したセクションです。

openaijamodel: gpt-5-mini-2025-08-07

GPT-5.6 Sol のプレビュー — 次世代モデルの概要と実務向け要点

Key Points

  • 限定プレビュー開始
  • ultraモード導入
  • 強化セーフガード

Summary

GPT‑5.6シリーズ(Sol/Terra/Luna)の限定プレビューを開始。Solはフラッグシップで長時間推論を行う新しいmax reasoning effortや、複雑タスクを分散処理するultra mode(サブエージェント)を導入。コーディング、ゲノミクス、生物学、サイバーセキュリティ領域で性能が向上し、最も強化された多層セーフガードと自動レッドチーミングにより悪用抑止を強化している。一般提供は数週間内を予定している。

Key Points

  • 利用形態
    • 現在は政府と調整した信頼パートナー向け限定プレビュー。一般公開は数週間内を目標。
  • モデルの棲み分け
    • Sol:最高性能、長期推論と複雑ワークロード向け。
    • Terra:GPT‑5.5相当の性能を維持しつつコストを2x削減(コスト効率重視の汎用作業向け)。
    • Luna:最小コストで高速応答が必要な用途向け。
  • 新機能と実装上の注意
    • max reasoning effort:深い推論により長時間・多段階タスクの性能向上。リクエストのレイテンシやトークン消費に注意。
    • ultra mode:サブエージェントによるタスク分割・並列化。エージェント間の状態管理や一貫性検証が必要。
  • ベンチマーク(開発者向け参考)
    • Terminal‑Bench 2.1(コマンドラインワークフロー)で最高スコアを更新。
    • GeneBench v1(長期ゲノミクス)でトークン効率向上。
    • ExploitBench / ExploitGym(セキュリティ)で長期的な攻撃・防御タスクの効率改善。
  • セーフティと運用
    • 感度の高いサイバー要求や繰り返しの悪用に対する強化保護、多層のセーフガードを実装。正当な防御・デバッグ・教育用途は活用可能だが、攻撃の自動化やエンドツーエンド悪用は制限される。
  • エンジニア向け推奨アクション
    • 長期的・複雑な推論が必要なワークロードはSolで検証。
    • コスト試算はTerraをベースに実施、迅速プロトタイプはLunaを活用。
    • プレビュー中はシステムカードと追加評価結果をチェックし、脆弱性試験やアクセス制御ポリシーを更新する。

Full Translation

翻訳

原文の流れを保ったまま読める翻訳セクションです。

openaijamodel: gpt-5-mini-2025-08-07

GPT‑5.6 Solのプレビュー:次世代モデル

概要

2026年6月26日、限定プレビューとしてGPT‑5.6シリーズを発表します。シリーズには以下のモデルが含まれます:

  • Sol:当社のフラッグシップモデル
  • Terra:日常業務向けのバランス重視モデル(GPT‑5.5と競合する性能で、コストは2x安価)
  • Luna:高速かつ低コストで強力な性能を提供するモデル

GPT‑5.6 Solはこれまでで最も強固な安全対策スタックを導入してローンチします。高リスクの活動、センシティブなサイバー要求、反復的な誤用に対する保護を強化し、数週間にわたる弱点発見と実戦的な耐圧テストを経て堅牢化しました。今後数週間でSol、Terra、Lunaを順次一般提供する予定です。

入手可能性と政府との調整

  • 発表に先立ち、米国政府との継続的な協議の一環として、モデルの計画と能力を事前に共有しました。
  • 要請に応じて、まず政府と共有された参加情報を持つ少数の信頼できるパートナー向けに限定プレビューを開始します。その後、より広くリリースします。
  • プレビュー期間中はパートナーと密接に連携しつつ追加のテストを継続します。
  • このような政府向け事前アクセスプロセスが長期的なデフォルトとなるべきだとは考えていません。最良のツールをユーザー、開発者、企業、サイバー防御者、世界中のパートナーから遠ざけてしまうためです。短期的な措置として実施するのは、行政と協働してサイバーに関するExecutive Orderフレームワークや将来のモデルリリースのための再現可能なプロセスを策定する間に、数週間でより広く提供できるようにするためです。

主な能力(Capabilities)

GPT‑5.6 Solは当社史上で最も能力が高いモデルです。いくつかの評価から、コーディング、バイオロジー、サイバーセキュリティ分野での「エージェント的」能力の改善が示されています。追加の安全性および準備性に関する評価は当社のsystem card(opens in a new window)に掲載しています。モデルを一般提供する際に、評価結果の拡張版を共有します。

  • 新機能

    • max reasoning effort:Solに深い推論時間を与える新しい最大推論努力モードを導入
    • ultra mode:サブエージェントを活用して単一エージェントの能力を超え、複雑な作業を加速
  • コーディング

    • Terminal‑Bench 2.1(コマンドラインワークフローの計画、反復、ツール調整をテスト)で新たなSOTAを樹立
  • バイオロジー

    • GeneBench v1(長期のゲノミクスおよび定量生物学解析を評価)で、GPT‑5.5より少ないトークンでより良い結果を達成
  • サイバーセキュリティ

    • 長期的なセキュリティタスク(脆弱性調査やエクスプロイトなど)における性能・効率のフロンティアを前進
    • ExploitBench ²では、出力トークン数が約1/3でありながらMythos Previewと競合する性能を示す
    • ExploitGym(opens in a new window)3(UC Berkeleyの研究者がOpenAIなどの研究所と共同で作成したベンチマーク)でも、推論を増やすにつれてSol/Terra/Luna全てでサイバー能力の強化が確認される

より強力なサイバー能力と、より強固な安全対策

GPT‑5.6 Sol、Terra、Lunaはこれまでで最も堅牢な安全対策で設計され、各モデルの能力に合わせた構成を採っています。モデルの能力が高まるにつれて、現実世界の敵対的な圧力に耐えうるように安全対策を強化しつつ、以下のような正当な業務へのアクセスを保護することに注力しています:

  • コードレビュー
  • 脆弱性調査(防御目的)
  • パッチ作成
  • デバッグ
  • セキュリティ教育
  • 防御的テスト

目的は、禁止される攻撃的活動を不可能にすることではなく、より困難・不確実・検出しやすくする一方で、これらの有益な利用を不必要に制限しないことです。モデルと安全対策の評価に基づき、正当な防御作業には実質的な利益をもたらす一方で、禁止される攻撃的利用を意味のある形で制約すると期待しています。GPT‑5.6 Solは、エンドツーエンドの攻撃を確実に実行するよりも、人々が脆弱性を見つけて修正するのを支援する能力に優れています。

今後の方針

能力がさらに進化するにつれて、私たちの優先事項は引き続き、モデルが有益な用途を支援しつつ誤用を抑制することです。今後も外部パートナーや政府機関と協調しながら、より広範な提供と安全性強化を進めていきます。

GPT‑5.6 Solのプレビュー:次世代モデル | OpenAI News | DocsDigest