GPT-5.6 Sol のプレビュー — 次世代モデルの概要と実務向け要点
Key Points
- 限定プレビュー開始
- ultraモード導入
- 強化セーフガード
Summary
GPT‑5.6シリーズ(Sol/Terra/Luna)の限定プレビューを開始。Solはフラッグシップで長時間推論を行う新しいmax reasoning effortや、複雑タスクを分散処理するultra mode(サブエージェント)を導入。コーディング、ゲノミクス、生物学、サイバーセキュリティ領域で性能が向上し、最も強化された多層セーフガードと自動レッドチーミングにより悪用抑止を強化している。一般提供は数週間内を予定している。
Key Points
- 利用形態
- 現在は政府と調整した信頼パートナー向け限定プレビュー。一般公開は数週間内を目標。
- モデルの棲み分け
- Sol:最高性能、長期推論と複雑ワークロード向け。
- Terra:GPT‑5.5相当の性能を維持しつつコストを2x削減(コスト効率重視の汎用作業向け)。
- Luna:最小コストで高速応答が必要な用途向け。
- 新機能と実装上の注意
- max reasoning effort:深い推論により長時間・多段階タスクの性能向上。リクエストのレイテンシやトークン消費に注意。
- ultra mode:サブエージェントによるタスク分割・並列化。エージェント間の状態管理や一貫性検証が必要。
- ベンチマーク(開発者向け参考)
- Terminal‑Bench 2.1(コマンドラインワークフロー)で最高スコアを更新。
- GeneBench v1(長期ゲノミクス)でトークン効率向上。
- ExploitBench / ExploitGym(セキュリティ)で長期的な攻撃・防御タスクの効率改善。
- セーフティと運用
- 感度の高いサイバー要求や繰り返しの悪用に対する強化保護、多層のセーフガードを実装。正当な防御・デバッグ・教育用途は活用可能だが、攻撃の自動化やエンドツーエンド悪用は制限される。
- エンジニア向け推奨アクション
- 長期的・複雑な推論が必要なワークロードはSolで検証。
- コスト試算はTerraをベースに実施、迅速プロトタイプはLunaを活用。
- プレビュー中はシステムカードと追加評価結果をチェックし、脆弱性試験やアクセス制御ポリシーを更新する。