OpenAI 於 7 月 29 日通過 API 釋出了 GPT Transcribe 和 GPT Live Transcribe 兩款新的語音識別模型,旨在提升轉錄能力並降低使用成本。GPT Transcribe 專為處理預錄音頻檔案設計,處理速度比即時快約 34 倍;GPT Live Transcribe 則針對低延遲的即時流式轉錄場景。兩款模型均支援轉錄上下文、關鍵詞以及多種輸入語言。
根據第三方評測機構 Artificial Analysis 的 AA-WER 基準測試,GPT Transcribe 的詞錯誤率(WER)為 3.31%,相比一年前釋出的 GPT-4o Transcribe 改善了 0.7 個百分點。同時,OpenAI 將定價下調 25%,至每分鐘音訊 0.0045 美元。
儘管效能有所提升,OpenAI 在語音識別準確率上仍落後於多家競爭對手。在 AA-WER 排行榜上,ElevenLabs Scribe v2 以 2.3% 的錯誤率位居榜首,Google 的 Gemini 3 Pro 以 2.9% 緊隨其後,Mistral 的 Voxtral Small 則以 3.0% 位列第三。Mistral 近期還推出了 Voxtral Transcribe V2,起價僅為每分鐘 0.003 美元,進一步加劇了價格競爭。
新發布的轉錄模型與 OpenAI 此前宣佈的 Realtime 模型生成功能形成互補,後者也包括即時轉錄模型 GPT-Realtime-Whisper。OpenAI 在其官方轉錄指南中提供了詳細的技術文件。
此次釋出正值語音 AI 市場快速擴張之際,企業對高精度、低成本的語音識別需求日益增長。OpenAI 在降低價格的同時提升效能,意圖鞏固其在開發者生態中的地位。然而,面對 ElevenLabs、Google 和 Mistral 等對手在準確率上的領先優勢,OpenAI 仍需在模型架構或訓練資料上尋求突破,以縮小差距。