OpenAI 已把 GPT-Live-1 作为开发者 API 对外开放。这款语音模型的核心特性是「全双工」——可以一边听一边说,而不是像传统语音助手那样在「听」和「说」之间来回切换。据 The Decoder 报道,该模型目前已经在 ChatGPT 内部运行。
从 OpenAI 公布的基准数据看,GPT-Live-1 相比前代提升明显。在全双工交互测试中,它拿到 80.1% 的分数,而上一代 GPT-Realtime-2.1 只有 45.4%。轮次切换延迟从 1.4 秒压缩到 0.8 秒,工具调用准确率则从 60% 提升到 87%。在银行语音客服这一细分基准中,GPT-Live-1 的通过率为 32%,前代模型为 12.4%。
开发者使用该 API 时,可以把 GPT-Live-1 与不同的后端模型搭配,按具体任务在推理深度、响应速度和成本之间做取舍。也就是说,语音层与「大脑」层可以解耦,开发者不必为所有场景都调用同一个模型。
价格方面,GPT-Live-1 定价为每分钟 0.05 美元。The Decoder 的报道直言「并不便宜」。对于高频、长时间的语音交互场景,这一成本会迅速累积,可能促使开发者更精细地设计对话流程,减少不必要的通话时长。
落地案例已经出现。Yelp 正把该模型用于电话预订,其 CTO Alex Levy 表示通话处理效果有所改善。这类场景对实时性和多轮交互要求较高,也是全双工能力最能体现价值的地方。
功能层面,GPT-Live-1 附带 12 种新音色,覆盖不同口音、方言和语言,并开箱提供 ASR 转写与回复文本。完整细节将在 API 文档中公布。
把这件事放到更大的背景里看,语音交互一直是人机界面里最难啃的部分之一。过去几年,主流语音助手依赖「轮流说话」的架构:系统先判断用户说完,再生成回复,再播放语音。这种模式在简单指令下尚可,但在自然对话中容易出现抢话、停顿过长或打断失败的问题。全双工架构试图让模型像人一样同时处理「听」与「说」,从而让对话更接近真人节奏。
对开发者生态而言,OpenAI 把这一能力 API 化,意味着第三方应用可以更快搭出实时语音产品,而不必自研底层语音模型。这既可能催生一批新的语音原生应用,也可能加剧语音 AI 赛道在延迟、成本与准确率上的竞争。
从竞争格局看,语音正成为大模型厂商争夺的下一块阵地。SpaceXAI 旗下的 Grok 等模型同样在推进多模态与实时交互能力,OpenAI 此次开放 API 并给出明确的基准数字与定价,等于把竞争维度从「模型能力」进一步拉到「开发者可得性」与「单位成本」上。
需要留意的是,上述基准均来自 OpenAI 自身的测试口径,第三方独立评测尚未在报道中体现。银行客服等场景的通过率虽然翻倍有余,但 32% 的绝对水平仍说明这类高要求任务远未解决。定价每分钟 0.05 美元是否具备规模经济性,也取决于具体应用的对话时长与调用频率。