最新消息:关注人工智能 AI赋能新媒体运营

Google发布Gemini 3.5 Transcribe:嘈杂环境精准语音转文字

科技资讯 admin 浏览

谷歌发布 Gemini 3.5 Transcribe:号称系列最强语音识别模型

谷歌近日正式发布 Gemini 3.5 Transcribe,将其定位为该系列迄今准确度最高的语音转文字模型。该模型面向开发者、企业及普通用户开放,重点解决嘈杂环境、复杂专业术语及自然口语表达等长期困扰行业的识别难题。

在技术能力方面,Gemini 3.5 Transcribe 展现出较强的泛化能力,能够有效过滤背景噪声,并对专业领域的复杂词汇提供支持。目前,该模型已率先应用于 macOS 平台的 Gemini 应用,以及 Android 平台 Gboard 键盘的 Rambler 功能。开发者可借助该工具构建语音智能体、实时字幕工具及通话后分析流程等应用。

Gemini 3.5 Transcribe 功能示意图

针对日常对话的复杂性,该模型在功能设计上进行了多项优化。它能更好地捕捉说话者的语义意图、识别自定义词汇,并辅助用户通过语音完成任务。模型内置自动自我修正、智能过滤口语填充词(如"嗯"、"啊"等),以及输出文本自动格式化等功能。此外,它还能将文件分析、图像生成等复杂任务委派给其他 Gemini 模型处理,实现多模型协作。

在转写准确率方面,谷歌公开数据显示,Gemini 3.5 Transcribe 在流式语音识别场景中的平均词错误率(WER)为 4.0%,非流式场景则降至 2.6%。即使在噪声较多的环境中,该模型仍能保持较高的识别稳定性,且在识别字母与数字交织的关键信息(如订单编号、邮政编码等)时表现更为精准。

在多语言支持方面,该模型覆盖 85 种语言,可适应不同地区的口音与方言变体。针对预处理音频,它支持为最多三名说话者提供带时间戳的语音归属识别。同时,模型支持用户自定义词汇表,以应对各行业专业术语、特殊拼写及专属名称。

目前,开发者可通过 Google AI Studio 和 Google Antigravity 中的 Gemini API 以公开预览形式体验该模型,普通用户则可在 Android 和 macOS 平台进行日常使用。谷歌计划未来将其引入 Chrome 浏览器,支持在网页输入框中直接语音输入。伴随 Gemini 3.7 Flash 推出、Gemini in Chrome 向美国安卓全量用户开放,以及助手接入 Waymo 自动驾驶出租车等举措,谷歌正持续完善其全场景 AI 产品矩阵。