返回深度
模型产品发布2026-09-15 07:03:226 min readAione Editorial V4

OpenAI发布GPT-Live全双工语音模型并开放API

OpenAI已发布GPT-Live全双工语音模型并开放API,支持边听边说与实时任务处理,将显著提升AI语音交互自然度并拓展商业化场景。

Aione AI 编辑部
Research · Writing · Review · Publishing
2026-09-15 07:03:22 6 分钟

GPT-Live发布背景与核心定位

在GPT-Live问世前,ChatGPT的语音交互经历过多轮架构迭代。早期语音功能依赖ASR语音识别、大语言模型推理、TTS语音合成三段式管道,各模块串联带来明显延迟,也容易在上下文衔接与语气表达上出现割裂感。2024年推出的GPT-4o曾尝试以端到端统一模型压缩延迟,但在稳定性与场景覆盖上仍与理想体验存在差距。与此同时,行业内谷歌、字节跳动等厂商也在推进实时语音对话产品,用户对自然、连续、低延迟的AI语音交互需求持续上升。[S9]

OpenAI于2026年7月8日正式推出新一代语音模型GPT-Live,定位为让AI对话更接近真实交流的语音产品,并同步升级ChatGPT语音模式。官方将其视为ChatGPT新的统一交互入口,目标是把语音从附加功能升级为贯穿日常帮助、学习、陪伴与工作流的核心能力。[S10]

全双工架构的技术突破与交互特性

GPT-Live最核心的技术变化,是采用原生全双工架构替代传统轮次式语音模型。轮次式模型即便在单模型内处理音频,也依然遵循“用户说完—模型判断静默—再开始回答”的离散节奏,短暂停顿或背景噪音都可能被误判为对话结束,导致插话时机生硬。[S9]

GPT-Live则可以同时进行语音输入处理与语音输出,真正实现边听边说。模型不再处理一连串彼此独立的消息,而是在生成输出的同时连续理解输入,每秒可多次做出交互决策:继续倾听、开始说话、暂停、打断用户,或是调用后端工具。这种连续交互能力让对话节奏更接近真人面对面交流,也支持实时翻译等对时序敏感的场景。[S9]

在具体交互细节上,GPT-Live会通过“嗯哼”等简短回应传递倾听信号,增强对话真实感;当用户稍作停顿思考时,模型会耐心等待而非贸然插话;面对车辆驶过、周围交谈等背景噪音,它也能更好地聚焦用户声音,抗干扰能力显著增强。此外,模型还支持话题快速转换,并能在对话过程中保持上下文连贯。[S1][S9]

另一项关键架构设计,是GPT-Live将连续交互层与深度推理任务解耦。当用户提出需要搜索、复杂推理或智能体能力的问题时,前台的语音交互模型可以继续维持对话节奏,同时把繁重任务委派给GPT-5.5等后端模型处理,并在结果就绪后即时反馈。这种分工既保证了语音交互的流畅性,又能持续接入最新的基础模型与工具能力。[S9]

ChatGPT端产品版本与用户权益划分

面向普通用户,GPT-Live已向全球ChatGPT用户推送两个版本:GPT-Live-1与GPT-Live-1 mini。其中GPT-Live-1默认面向Plus和Pro付费用户,Free免费用户则默认使用GPT-Live-1 mini版本。用户点击语音按钮即可体验新的对话功能。[S1]

目前ChatGPT内的GPT-Live暂不支持语音通话与屏幕共享功能,相关功能仍在开发中。这意味着用户现阶段主要体验的是一对一实时语音对话,而多人通话、共享屏幕协作等更复杂场景仍需等待后续更新。[S1]

从产品策略看,双版本划分既保证了免费用户可获得基础的全双工语音体验,也为付费用户提供了更强的性能与完整功能,延续了OpenAI在ChatGPT产品线上的分层运营思路。不过官方尚未详细披露两个版本在响应速度、推理深度、工具调用能力等方面的具体差异参数。[S1]

API开放能力、定价模式与应用场景

在C端产品落地之外,OpenAI于2026年9月10日宣布将GPT-Live-1开放API调用,使开发者能够基于其构建实时语音交互应用与业务流程。官方将API版本定位为面向开发者的自然语音模型,可同时倾听与说话,并支持将深度推理与工具调用委派给后端模型或智能体框架。[S2][S7]

定价方面,GPT-Live-1 API的前端语音层为每分钟0.05美元,按秒计费;后端模型与工具使用费用则单独计算。这种将语音交互层与推理层分开计费的模式,使开发者可以根据业务需求灵活选择后端模型,控制整体成本。[S2][S4]

在能力清单上,GPT-Live-1 API支持原生语音识别转写、回复文本生成、字母数字理解、关键词偏置及显式轮次检测。开发者可通过系统提示词控制语气、语速和对话风格,也可配置不同的后端模型、工具及智能体框架。[S5]

应用场景上,GPT-Live-1 API明确支持电话场景部署,可用于餐厅预订、客户支持等全双工语音智能体。官方展示的合作案例中,Yelp Host可借助GPT-Live-1在背景噪音、旁侧交谈与打断中顺利完成预订流程。此外,语言学习、医疗服务、企业内部语音工作流等场景也被视为重要落地方向。[S3][S5]

性能表现与早期落地案例

官方公布的评测数据显示,GPT-Live-1搭配中等推理强度的GPT-6 Astra时,在Tau3端到端语音智能体任务上首次尝试完成率达83.6%,显著高于GPT-Realtime-2.1的45.7%。Tau3涵盖航空、零售与电信支持等场景,更贴近真实客服任务。在针对文档检索与账户工具使用的TauBanking测试中,同一组合也取得了38.1%的成绩。[S2][S4]

在全双工专项测试Full Duplex Bench中,GPT-Live-1表现较GPT-Realtime-2.1高出30个百分点,说明其在打断、停顿、并行说话等复杂时序场景下的处理能力有代际提升。[S4][S5]

早期合作伙伴反馈同样指向交互自然度的改善。语言学习平台Speak的测试显示,GPT-Live-1对学习者思考停顿的误打断次数较传统轮次系统减少近80%,这对语言练习场景尤为关键,因为学习者往往需要更长的组织语言时间。另有医疗服务平台团队表示,接入新模型后语音相关代码量减少约80%,删除约2.3万行代码,开发效率明显提升。[S4][S5]

当前功能边界与后续演进方向

尽管GPT-Live在自然度与架构上实现突破,其当前能力仍有明确边界。除ChatGPT端暂不支持语音通话与屏幕共享外,GPT-Live-1与mini版本的具体性能差异、支持的语言与方言覆盖范围、长时会话下的稳定性与资源消耗等细节尚未完整公开。[S1]

对开发者而言,全双工语音模型虽然简化了语音层架构,但业务状态管理、工具调用容错、中断恢复与不确定结果处理等仍需自行设计。尤其是在客服、预订等强业务约束场景中,语音流畅只是基础,任务完成率与异常处理能力同样重要。[S7]

从后续演进看,ChatGPT端语音通话与屏幕共享功能的上线进度、API生态的开发者接入规模、更多行业落地案例的涌现,以及与谷歌、字节跳动等厂商同类产品的竞争格局,都将成为观察GPT-Live影响力的重要维度。可以确定的是,全双工语音模型正在把AI语音交互从“一问一答”推向“实时共在”的新阶段。[S3][S7]

参考资料 [S1] https://soft.china.com/article/1469251.html?f=230712 [S2] https://community.openai.com/t/introducing-gpt-live-1-in-the-api/1396471 [S3] https://openai.com/index/introducing-gpt-live-1-in-the-api/ [S4] https://www.panewslab.com/zh-hant/articles/01a08ddd-fb64-750a-8728-230d8e1ad4e9 [S5] https://52ai.com/36874.html [S7] https://m.sohu.com/a/1075547560_122964940/ [S9] https://openai.com/zh-Hans-CN/index/introducing-gpt-live/ [S10] https://openai.com/zh-Hans-CN/research/index/release/

Editorial dossier

制作记录

公开编辑轨迹,不含隐藏推理。

制作记录已完成审读
材料已核验公开资料经过整理
多方来源互证保留可追溯引用
文字完成审读编辑意见已被处理
制作记录文章已进入公开阅读

正在整理制作记录…

Reader Signal

这篇文章对你有帮助吗?

只收集预设选项,不开放评论,不公开展示个人反馈。

选择一个判断,也可以附加一个预设标签。

发布于 2026-09-15 07:03:22。本文由明确标注的 Aione AI 编辑 Agent 参与制作,未经授权不得转载,不构成投资建议。