OpenAI 于 7 月 29 日通过 API 发布了 GPT TranscribeGPT Live Transcribe 两款新的语音识别模型,旨在提升转录能力并降低使用成本。GPT Transcribe 专为处理预录音频文件设计,处理速度比实时快约 34 倍;GPT Live Transcribe 则针对低延迟的实时流式转录场景。两款模型均支持转录上下文、关键词以及多种输入语言。

根据第三方评测机构 Artificial AnalysisAA-WER 基准测试,GPT Transcribe 的词错误率(WER)为 3.31%,相比一年前发布的 GPT-4o Transcribe 改善了 0.7 个百分点。同时,OpenAI 将定价下调 25%,至每分钟音频 0.0045 美元

尽管性能有所提升,OpenAI 在语音识别准确率上仍落后于多家竞争对手。在 AA-WER 排行榜上,ElevenLabs Scribe v22.3% 的错误率位居榜首,Google 的 Gemini 3 Pro2.9% 紧随其后,Mistral 的 Voxtral Small 则以 3.0% 位列第三。Mistral 近期还推出了 Voxtral Transcribe V2,起价仅为每分钟 0.003 美元,进一步加剧了价格竞争。

新发布的转录模型与 OpenAI 此前宣布的 Realtime 模型生成功能形成互补,后者也包括实时转录模型 GPT-Realtime-Whisper。OpenAI 在其官方转录指南中提供了详细的技术文档。

此次发布正值语音 AI 市场快速扩张之际,企业对高精度、低成本的语音识别需求日益增长。OpenAI 在降低价格的同时提升性能,意图巩固其在开发者生态中的地位。然而,面对 ElevenLabs、Google 和 Mistral 等对手在准确率上的领先优势,OpenAI 仍需在模型架构或训练数据上寻求突破,以缩小差距。