OpenAIOpenAI News2026/07/08 0:00

Introducing GPT-Live

要点だけを先に読めるように短く再構成したセクションです。

元記事

Quick Digest

要約

要点だけを先に読めるように短く再構成したセクションです。

openaijamodel: gpt-5-mini-2025-08-07

GPT‑Live 発表 — フルデュプレックス音声モデル

Key Points

  • フルデュプレックス音声
  • バックグラウンド推論
  • APIまもなく提供

Summary

GPT‑Live は対話の自然さを大幅に向上させる新世代の音声モデルです。フルデュプレックス設計により同時に聞き取りと発話が可能で、会話中の相槌や短い応答で注意を示したり、ユーザーが考える間は沈黙したりできます。複雑な検索や深い推論が必要な場面では、背後で GPT‑5.5 ベースのフロンティアモデルに処理を委任し、その結果を会話に戻します。ローンチ時点で GPT‑Live‑1 と GPT‑Live‑1 mini を ChatGPT にて順次展開中で、API はまもなく提供予定です。今後、より強力なフロンティアモデルへ随時アップデートされ、長時間・複雑・エージェント的な音声ワークフローにも対応することが期待されます。

Key Points

  • フルデュプレックス: 同時に聞き取りと発話が可能で、バックチャネル(「うん」「なるほど」等)に対応。
  • 背景委任: 複雑な処理は GPT‑5.5 ベースのフロンティアモデルに非同期で委任し、結果を会話に差し込む。
  • ロールアウト: GPT‑Live‑1 / GPT‑Live‑1 mini を ChatGPT に展開中。API は近日提供予定、開発者登録フォームあり。
  • エンジニア視点の注意点:
    • フルデュプレックスとストリーミング要件を設計に組み込む(部分的な音声・結果のマージ処理を想定)。
    • 非同期委任による中断と再開のハンドリング(会話コンテキストの一貫性を保つ)。
    • 将来的なバックエンドモデル更新を想定した互換性設計(モデルアップグレードに伴う挙動変化に備える)。
  • 利用想定: より自然な会話UI、長時間の音声ワークフロー、エージェント的タスクの音声実行。

実装やAPI公開に向けては、ストリーミング入力の取り扱い、部分応答と最終応答の統合、そしてモデル更新に伴うテストケース整備を優先してください。

Full Translation

翻訳

原文の流れを保ったまま読める翻訳セクションです。

openaijamodel: gpt-5-mini-2025-08-07

GPT‑Liveの紹介

2026年7月8日 製品リリース

GPT‑Liveの紹介

新しい世代の音声モデル「GPT‑Live」を発表します。GPT‑Liveは、人とAIの会話がまるで実際の対話のように感じられることを目的とした新しい音声モデル群です。GPT‑Liveは全二重(full‑duplex)アーキテクチャを採用しており、同時に聞くことと話すことが可能です。会話中、GPT‑Liveは「mhmm」や「yeah」といった相槌で注意を示したり、短いやり取りに素早く応じたり、あなたが考える時間が必要なときには静かに待つこともできます。その結果、自然で話しやすい音声体験が実現します。

GPT‑Liveは同時に、これまでで最も賢い音声モデルでもあります。ウェブ検索やより深い推論、複雑な作業が必要な質問に対しては、バックグラウンドで最新のfrontier modelに処理を委任し、準備が整い次第その結果を会話の中に取り戻します。処理中もGPT‑Liveは会話を継続し、対話の流れを保ちます。

ローンチ時点では、GPT‑LiveはバックグラウンドでGPT‑5.5を使用します。今後新しいfrontierモデルをリリースするたびに、GPT‑Liveで使用するモデルも継続的に更新していきます。これらの進歩は、より知的で自然に使える新しいChatGPT Voice体験を支えます。時間が経つにつれて、この研究は音声を使ったより複雑で長時間にわたる、よりエージェンシー(自律的)な作業の実現も解き放つと私たちは考えています。

本日より、GPT‑Liveの2つのバージョン—GPT‑Live‑1とGPT‑Live‑1 mini—を世界中のChatGPTユーザーに向けて順次展開し始めます。近くAPIにも対応する予定で、開発者や企業はこのフォームで通知を受け取るよう登録できます。


新しい人間とAIの対話の時代へ

私たちのビジョンは、真に自然な人間‑AI対話を実現することです。つまり、AIとの協働が別の人と仕事をするのと同じように流暢で反応的に感じられ、推論や複雑なタスク実行が背景でシームレスに行われる世界を目指しています。

これまでのアプローチ

従来の世代の音声AIシステムはこのビジョンに近づけましたが、重要なトレードオフがありました。

カスケード型音声システム

カスケード型音声システムは、各ターンを処理するために複数のモデルが順番に動作する仕組みに依存します。元のChatGPT Voiceは3つのモデルを連結していました:speech-to-textモデルで音声を文字起こしし、large language modelで応答を生成し、text-to-speechモデルで再び音声に変換します。このアプローチによりフロンティアAIモデルと会話することが可能になりましたが、複雑さには代償がありました:モデル間で情報が失われることがあり、応答は遅くぎこちないものになりがちです。

  • カスケード型音声システム: 応答が遅く、ぎこちない。長いポーズ。
  • フロー(例): STT → GPT‑5.5 → TTS

トランスクリプト: Example conversation with Standard Voice Mode, using GPT‑5.5 Instant