最新消息:关注人工智能 AI赋能新媒体运营

微软发布自研MAI双模型:图像与语音不依赖第三方蒸馏,已接入Bing和PPT

科技资讯 admin 浏览

微软发布两款自研AI模型:MAI-Image-2.5-Pro与MAI-Voice-2-Flash

7月23日,微软宣布推出两款自研AI模型——MAI-Image-2.5-Pro和MAI-Voice-2-Flash,目前均已进入公开预览阶段。两款模型分别聚焦高质量图像生成与高并发语音交互场景,微软强调其训练数据经过清理和可追踪,不依赖第三方模型蒸馏,从底层设计就直接服务于微软产品用户。

图像模型精度创新高,GPU成本最高降84%

MAI-Image-2.5-Pro是微软目前精度最高的图像模型,面向主视觉图片生成、细节编辑及图像内文字渲染等高要求场景,支持自然语言编辑指令。该模型已在Bing Image Creator中成为默认图像生成模型,在PowerPoint中用于图像到图像编辑功能,与GPT-Image-2相比可降低最高84%的GPU成本。在OneDrive中部署后,相关场景保存成功率提升26%,P95延迟降低约25%,中等负载生产环境效率提升2.5倍。

定价方面,文本输入每百万Token收费5美元,图像输出每百万Token收费106美元。

语音模型速度提升2倍,已服务T-Mobile等客户

MAI-Voice-2-Flash针对高频语音应用优化,相比上一代速度提升约2倍,成本降低32%,适用于客服中心和语音助手等快速响应场景。该模型已接入Dynamics 365 Contact Center,为T-Mobile、EasyJet等客户提供服务,GPU成本最高降低89%。微软还将其集成至Azure Voice Live服务,支持开发者构建语音到语音交互智能体。

此外,同系列的MAI-Transcribe-1.5已应用于医疗语音解决方案Dragon Copilot,被17万名医疗服务提供者使用,上季度处理2800万次患者问诊记录,支持58种语言,多数语言转录错误率相对下降50%。微软透露下一代GB200计算集群已投入运行,MAI系列模型将持续扩展。