xAI 推出新一代语音模型 Grok Voice Think Fast 2.0,每分钟音频定价 0.08 美元
人工智能企业 xAI 近日发布新一代语音识别与生成模型 Grok Voice Think Fast 2.0,并向开发者全面开放。该模型在智能水平、转录准确率、对话交互能力及工具调用效率等方面均有显著提升,官方定价为每分钟音频 0.08 美元。
在 Artificial Analysis 语音识别基准测试中,Grok Voice Think Fast 2.0 的综合得分达到 82.9%,超越前代版本,也高于 GPT-Realtime-2.1 与 Gemini 3.1 Flash。其智能体能力评分为 56.5%,在同类模型中处于领先位置。响应速度方面,该模型的首次音频播放时间缩短至 0.70 秒。
语音转录精度方面,新模型在多语言环境下的转录准确率较上一代提升约 1.4 倍,在多国语言大规模音频测试中表现突出。在背景噪音干扰和电话压缩等复杂场景中,其抗干扰能力也有明显进步。
技术架构上,Grok Voice Think Fast 2.0 采用语音并行推理机制,有效减少系统等待时间。通过强化学习对对话策略进行优化,模型能够输出更简洁的回答,并确保单次处理单个核心问题,从而提升复杂任务中的工具调用效率。
目前,该技术已在实际业务场景中进行验证,并在 Starlink 电话服务中完成 A/B 测试,推动销售转化率与客服响应效率提升。按照官方规划,旧版本标识符将于 2026 年 8 月 5 日自动切换至新版本。