OpenAI、音声モデルGPT-Live-1をAPI提供

仕組みと性能

聞く・話すの同時処理
割り込み応答の改善
推論と操作の外部委任

開発者の選択肢

声色・速度・話し方の調整
長時間会話と電話対応

導入条件

毎分0.05ドル
APIでの即日提供
詳細を読む

OpenAIは2026年9月10日、開発者向けAPIを通じてリアルタイム音声モデル「GPT‑Live‑1」の提供を始めました。聞く・話すを単一モデルで同時処理し、割り込みや沈黙、雑音に自然に対応しながら、複雑な推論やツール操作を背後のモデルへ委ねられるため、音声アプリや業務フローの構築を簡素化します。

従来の音声エージェントは、音声認識、推論音声合成をつなぐ構成で、処理の受け渡しごとに遅延や文脈の欠落が生じやすい設計でした。GPT‑Live‑1は音声の入出力を一体で扱い、会話を続けながらバックエンドに高度な処理を任せます。

評価ではFull Duplex BenchがGPT‑Realtime‑2.1を30ポイント上回り、応答開始の速さや対話動作が改善しました。GPT‑6 Astraと組み合わせた構成は、音声エージェントの一連の業務遂行能力を測るTau3で首位を記録し、語学学習サービスSpeakでは従来方式より割り込みが約80%減りました。

開発者はシステムプロンプトで口調、速度、会話スタイルを調整し、用途に応じて背後のモデルやツールを選べます。長時間の文脈保持、英数字の認識、キーワード優先、話者交代の検出に加え、予約や顧客対応などの電話業務にも対応します。

GPT‑Live‑1は提供開始日からAPIで利用でき、フロントエンドの音声層は1分当たり0.05ドルです。より多様なアクセント、方言、言語の音声を用意し、カスタム音声は営業窓口を通じて利用資格と申請手続きを確認します。