OpenAI 推出两款转录模型:GPT-Live-Transcribe 与 GPT-Transcribe
OpenAI 于 7 月 29 日发布了两款新一代音频转录模型——GPT-Live-Transcribe 与 GPT-Transcribe,现已通过 API 开放调用。与单纯的语音转文字工具不同,这两款模型强调对上下文的理解能力,能够更好地处理口音、专业术语、数字以及背景噪音等复杂场景。
两款模型定位各异。GPT-Live-Transcribe 面向实时转录场景,以低延迟为设计目标,定价为每分钟 0.017 美元(约合人民币 0.12 元);GPT-Transcribe 则专注异步处理,适用于已录制音频及批量任务,价格为每分钟 0.0045 美元(约合人民币 0.03 元)。
上下文理解是此次升级的核心。测试显示,GPT-Transcribe 在 Context Aware ASR 基准测试中,语义准确率从无上下文时的 41.6% 提升至 45.2%,表明模型能够结合语境判断词义。
与 OpenAI 自家的 Whisper 相比,新模型进步显著。在 Common Voice 涵盖的 22 种语言测试中,GPT-Transcribe 错误率为 19.27%,低于 Whisper(whisper-1)的 40.37%;在真实世界九种语言录音基准上,其错误率进一步降至 8.98%,而 Whisper 为 15.21%。