長期ホライズンモデルの時代における安全性と整合性OpenAI News / 2026/07/20新たな時間的リスク反復デプロイで改善長期評価が必須safetyalignmentlong-runningmonitoringdeploymentrobustness
GPT-Red: 堅牢性のための自己改善を解き放つOpenAI News / 2026/07/15自己プレイで自動赤チーミングプロンプト注入への耐性向上安全性と整合性を継続改善red-teamingself-playsafetyalignmentprompt-injectionrobustnessautomation
最先端LLMにおける指示階層の改善OpenAI News / 2026/03/10IH‑Challenge公開安全性と注入耐性向上過剰拒否を回避instruction-hierarchyrlhfprompt-injectionsafetydatasetrobustness