OpenAI 已把 GPT-Live-1 作為開發者 API 對外開放。這款語音模型的核心特性是「全雙工」——可以一邊聽一邊說,而不是像傳統語音助手那樣在「聽」和「說」之間來回切換。據 The Decoder 報道,該模型目前已經在 ChatGPT 內部執行。

從 OpenAI 公佈的基準資料看,GPT-Live-1 相比前代提升明顯。在全雙工互動測試中,它拿到 80.1% 的分數,而上一代 GPT-Realtime-2.1 只有 45.4%。輪次切換延遲從 1.4 秒壓縮到 0.8 秒,工具呼叫準確率則從 60% 提升到 87%。在銀行語音客服這一細分基準中,GPT-Live-1 的通過率為 32%,前代模型為 12.4%

開發者使用該 API 時,可以把 GPT-Live-1 與不同的後端模型搭配,按具體任務在推理深度、響應速度和成本之間做取捨。也就是說,語音層與「大腦」層可以解耦,開發者不必為所有場景都呼叫同一個模型。

價格方面,GPT-Live-1 定價為每分鐘 0.05 美元。The Decoder 的報道直言「並不便宜」。對於高頻、長時間的語音互動場景,這一成本會迅速累積,可能促使開發者更精細地設計對話流程,減少不必要的通話時長。

落地案例已經出現。Yelp 正把該模型用於電話預訂,其 CTO Alex Levy 表示通話處理效果有所改善。這類場景對即時性和多輪互動要求較高,也是全雙工能力最能體現價值的地方。

功能層面,GPT-Live-1 附帶 12 種新音色,覆蓋不同口音、方言和語言,並開箱提供 ASR 轉寫與回覆文本。完整細節將在 API 文件中公佈。

把這件事放到更大的背景裡看,語音互動一直是人機介面裡最難啃的部分之一。過去幾年,主流語音助手依賴「輪流說話」的架構:系統先判斷使用者說完,再生成回覆,再播放語音。這種模式在簡單指令下尚可,但在自然對話中容易出現搶話、停頓過長或打斷失敗的問題。全雙工架構試圖讓模型像人一樣同時處理「聽」與「說」,從而讓對話更接近真人節奏。

對開發者生態而言,OpenAI 把這一能力 API 化,意味著第三方應用可以更快搭出即時語音產品,而不必自研底層語音模型。這既可能催生一批新的語音原生應用,也可能加劇語音 AI 賽道在延遲、成本與準確率上的競爭。

從競爭格局看,語音正成為大模型廠商爭奪的下一塊陣地。SpaceXAI 旗下的 Grok 等模型同樣在推進多模態與即時互動能力,OpenAI 此次開放 API 並給出明確的基準數字與定價,等於把競爭維度從「模型能力」進一步拉到「開發者可得性」與「單位成本」上。

需要留意的是,上述基準均來自 OpenAI 自身的測試口徑,第三方獨立評測尚未在報道中體現。銀行客服等場景的通過率雖然翻倍有餘,但 32% 的絕對水平仍說明這類高要求任務遠未解決。定價每分鐘 0.05 美元是否具備規模經濟性,也取決於具體應用的對話時長與呼叫頻率。