OpenAIは現在、精神的に一文字違いの名前を持つ2つの音声テクノロジーを保有しており、7月8日のGPT-Live発表により、その混乱は一般的になりました。「GPT Live API」を検索するとGPT-Realtimeのドキュメントにたどり着き、発表に関する記事を読むと、この2つが interchangeably(互換的に)使われていることがわかります。しかし、これらは同じものではありません。
一行での明確化:GPT-LiveはChatGPT内の消費者向け音声体験です。GPT-Realtimeは、独自の音声アプリケーションを構築するための開発者向けAPIファミリーです。 ここに全体像と、どちらを探しているのかを見分ける方法を説明します。
2つのスタックを比較
| GPT-Live | GPT-Realtime | |
|---|---|---|
| それが何か | ChatGPT音声の基盤となる音声モデルファミリー | Realtime API内の音声間モデル |
| 誰のためのものか | ChatGPTユーザー | 音声製品を開発する開発者 |
| どこで動作するか | ChatGPTアプリ (iOS, Android, Web), CarPlay | あなたのアプリケーション、API経由で |
| APIアクセス | まだなし (OpenAIによると「間もなく」) | 一般提供中 |
| 現在のモデル | GPT-Live-1, 1 mini, 1 Medium, 1 High | gpt-realtime, gpt-realtime-1.5, gpt-realtime-2.1, 2.1-mini |
| アーキテクチャ | 全二重 + GPT-5.5へのバックグラウンド委任 | 単一の音声間モデル、高速なターンベース |
| 会話スタイル | 話しながら聞く、バックチャネル | 割り込み処理を伴う低レイテンシーのターン |
| 追加機能 | ウェブ検索、翻訳、ビジュアルカード、記憶機能 | 関数呼び出し、MCPサーバー、SIP通話、画像入力 |
| 料金 | 未公開 (ChatGPTのプランに含まれる) | 公開済み: 例: gpt-realtimeが入力$4/M、出力$16/M |
GPT-Liveとは何か
GPT-LiveはChatGPT音声の新しいデフォルトです。これは、出力生成中に着信オーディオを処理し、話す、聞く、一時停止する、割り込むといった判断を1秒間に何度も行う全二重モデルです。質問が検索やより深い推論を必要とする場合、GPT-Liveは「GPT-5.5のような別のモデルにタスクを委任」し、その結果を会話に織り込むことができます。
GPT-Liveを統合することはありません。ChatGPTアプリ内で使用します。有料プランではGPT-Live-1がデフォルトとなり、無料プランではGPT-Live-1 miniが提供されます。セットアップガイドには、バリアントとプラットフォームが記載されています。
GPT-Realtimeとは何か
GPT-RealtimeはOpenAIのRealtime APIの背後にあるモデルファミリーです。これは、WebSocketまたはWebRTC経由で接続し、電話通話用のSIPサポートとツール利用用のリモートMCPサーバーを備えた音声間モデルです。これは一般提供されており、バージョン管理され、API製品として価格設定されています。最新のメンバーである`gpt-realtime-2.1`と`2.1-mini`は、GPT-Liveが発表される2日前の2026年7月6日に出荷されました。
これは、弊社のハンズオンガイドがカバーしているスタックです。オリジナルのgpt-realtimeウォークスルー、GPT-Realtime-2、およびGPT-Realtime-2.1-miniです。これを使って開発している場合、ApidogはWebSocketセッションを直接駆動でき、不透明なリアルタイムデバッグを検査可能なイベントストリームに変えます。無料でダウンロードして、数分で`gpt-realtime-2.1`に対するセッションをテストできます。
なぜ混乱が理解できるのか
2つのスタックは異なる方向から収束しています。GPT-Realtimeは音声間レイテンシーを実稼働エージェントに十分な低さにまで引き下げました。GPT-Liveはその上に全二重レイヤーと委任機能を追加しましたが、これはChatGPT内に限られます。アーキテクチャ的には、GPT-LiveはRealtime APIの次世代が目指すもののように見え、OpenAIはGPT-Liveモデルが「間もなく」APIに登場すると述べています。
それが実現するまで、実用的なマッピングは次のとおりです。
- 「AIと話したい。」 ChatGPT内のGPT-Live。コードは不要です。
- 「自分のアプリや電話回線でユーザーと話したい。」 Realtime API経由のGPT-Realtime、今日から利用可能。
- 「アプリでGPT-Liveの全二重動作を使いたい。」 まだ利用できません。委任パターンを手動で実装するなど、最も近い近似値についてはGPT-Live APIはありますか?で説明しています。
GPT-LiveがAPIに到達したらどうなるか
OpenAIは、GPT-LiveモデルがRealtime APIに参加するのか、置き換えるのか、あるいは別のインターフェースとして登場するのかを明らかにしていません。4つのバリアント構造(2つの努力レベルでのインスタントバックとGPT-5.5思考バック)は、セッションレベルでのレイテンシー/深さのトレードオフを示唆しています。現在開発を進めているチームにとって安全な姿勢は、Realtime API上でイベント駆動型セッションコードを使い、委任ロジックを疎結合に保つことです。これにより、3つの結果のいずれにおいてもクリーンに移植できます。
よくある質問
GPT-LiveはGPT-Realtimeと同じですか? いいえ、異なります。GPT-Liveは消費者向けChatGPT音声の基盤であり、GPT-RealtimeはRealtime API内の開発者向けモデルファミリーです。
自分のアプリでGPT-Liveを使用できますか? まだできません。OpenAIはAPI提供を「間もなく」計画しています。`gpt-realtime-2.1`を搭載したRealtime APIが現在の代替手段です。
GPT-RealtimeはGPT-Liveに置き換えられますか? OpenAIはそのような発表をしていません。GPT-Realtimeは引き続き一般提供されており、GPT-Liveがローンチされる2日前に更新されたため、共存を計画上の前提として扱うべきです。
どちらの方が高機能ですか? 目的が異なります。GPT-LiveはChatGPT内で全二重会話とGPT-5.5への委任機能を提供します。一方、GPT-Realtimeは開発者向けのインターフェース(関数呼び出し、MCP、SIP、公開された料金設定)を備えています。
