xAI 发布 Grok Voice Think Fast 2.0:语音识别模型升级,面向智能体开发者
xAI 推出新一代语音识别模型 Grok Voice Think Fast 2.0,面向构建语音智能体的开发者开放。官方称,该模型在智能水平、转录准确率、对话能力以及工具调用效率方面均有提升,定价为每分钟音频 0.08 美元,且无需修改现有提示词即可在多数应用场景中获得性能改进。
在 Artificial Analysis 语音识别基准测试中,Grok Voice Think Fast 2.0 综合得分达到 82.9%,高于前代 Think Fast 1.0 的 75.7%,也超过 GPT-Realtime-2.1 的 79.1% 和 Gemini 3.1 Flash 的 69.5%。其中,智能体能力评分达到 56.5%,领先于 Think Fast 1.0 的 52.1%、GPT-Realtime-2.1 的 45.7% 以及 Gemini 3.1 Flash 的 37.7%。模型首次音频播放时间从 1.25 秒缩短至 0.70 秒,响应速度进一步提升。
语音转录方面,xAI 针对 24 种语言的大量语音片段进行了测试。官方数据显示,相比 Deepgram Nova 3 和 ElevenLabs Scribe v2,Think Fast 2.0 的转录准确率提升约 1.5 至 2 倍;相比上一代模型,准确率提升约 1.4 倍。在背景噪音和电话压缩等复杂环境下,xAI 称两者差距可扩大至约 10 倍。
技术层面,Think Fast 2.0 支持语音并行推理,通过减少等待时间提升复杂任务处理效率。相比上一代模型,其推理标记使用量中位数下降至 0.4 次,使工具调用通常能够在智能体完成首句回复前执行。同时,强化学习优化了模型对话策略,使其倾向于采用更短回答、单次处理一个问题,并减少无效信息输出,以更好支持复杂工作流程。
xAI 表示,此次升级主要面向真实业务场景中语音智能体的可靠性提升。目前,Grok Voice 已在 Starlink 电话服务中进行 A/B 测试,带来了销售转化率和客服响应效率的提升。
按照计划,2026 年 8 月 5 日,grok-voice-latest 别名将自动从 grok-voice-think-fast-1.0 切换至 grok-voice-think-fast-2.0。仍需使用旧版本的开发者需要提前锁定 1.0 版本标识符,其他用户无需额外操作。
随着 AI 智能体逐步进入客服、销售、办公等实际应用场景,低延迟、高准确率、多工具协同的语音模型正成为下一阶段智能交互的重要基础。