OpenAI 发布 GPT-Transcribe 与实时转写模型,取代 Whisper
两款新语音转文字模型成为 OpenAI 推荐默认方案,支持可提示的上下文注入,价格低至每分钟 0.0045 美元。
OpenAI 于 7 月 28 日在 API 中上线两款语音转文字模型,并明确建议新项目改用它们,而非 Whisper 或 gpt-4o-transcribe 系列。
两条产品线
GPT-Live-Transcribe 面向低延迟流式场景,仅通过实时转写端点提供,按音频时长每分钟 0.017 美元计费,延迟可调。GPT-Transcribe 处理完整音频文件与批量任务,每分钟 0.0045 美元。OpenAI 称两者在真实音频上均有提升——口音、中英混说、数字、短语音、专业术语以及强背景噪声;其内部对比显示异步模型的错误率不到 Whisper 的一半。
可提示的上下文
更关键的变化是转写本身变成「可提示」的了。开发者可以传入描述录音场景的自由文本、专有名词与行业术语的关键词表、预期输入语种,以及格式要求。OpenAI 公布的数据是:在 Context Aware ASR 基准上,语义准确率从不提供自由文本上下文时的 41.6% 升至 45.2%。绝对提升不大,但正好打在让 ASR 难以产品化的那个痛点上——模型转写一场问诊或一通销售电话时,并不知道涉及哪些药品名、股票代码或内部产品编号。此前业界的通行补丁是再挂一道 LLM 事后纠错。OpenAI 同时提供了从 Whisper 迁移的 cookbook。
为何重要
Whisper 在 2022 年的开源事实上定下了整个语音转文字市场的地板,而 OpenAI 现在正式把重心让给按分钟计费的闭源 API 模型。对语音智能体这条栈而言意义更直接:转写位于所有下游决策的上游,一个听错的人名会污染整轮对话,而可提示上下文正好省掉了当下多数生产部署自己维护的那层胶水代码。同一周,Fish Audio 拿下 5200 万美元种子轮,主打面向创作者与企业的语音模型——提醒业界音频层如今是资金充裕的专业玩家在争夺,而非已被视为解决的基础设施。此外,流式与批量档位之间价差接近 4 倍,会促使架构师在延迟预算允许的范围内,把尽可能多的转写量挪出实时链路。