腾讯混元将1.8B翻译模型压缩至数百MB,已落地B站直播弹幕实时翻译
腾讯混元团队公布了一项技术成果,成功将旗下端侧1.8B翻译模型压缩至几百兆大小,在基本保持翻译质量的同时,已应用于哔哩哔哩(B站)直播弹幕实时翻译场景。
作为基底的Hy-MT2-1.8B模型属于腾讯混元翻译模型族,原生支持33个语种互译。在同等尺寸模型中,其整体翻译质量在FLORES-200通用翻译评测上优于多款商业翻译API。但该模型在FP16精度下需占用3.3GB内存,即使用4-bit量化仍需1GB以上,难以满足端侧多任务并发的内存管理需求。
针对这一问题,腾讯推出了两档极低比特量化方案。
第一档为面向中高端设备的2-bit模型,采用拉伸弹性量化(SEQ)技术,将参数量化至特定离散数值,并结合量化感知蒸馏(QAD)手段,将模型体积压缩至574MB,翻译质量几乎无损。
第二档是面向全系设备的1.25-bit极低比特方案,基于腾讯自研的Sherry稀疏高效三值量化技术。该技术已被ACL 2026选为Oral。其核心策略是通过细粒度稀疏机制,使每4个参数中最重要的3个用特定数值存储,其余置零,平均每个参数仅占用1.25-bit。配合专为CPU设计的STQ内核,原始3.3GB模型被压缩至440MB。
为让极低比特模型摆脱对特定移动端ARM架构的依赖,英特尔团队针对x86生态进行了深度适配。通过对量化矩阵运算中的向量化、权重重排和VNNI指令融合进行优化,Hy-MT2的低比特量化格式在英特尔主流机型(包括第三代酷睿Ultra及酷睿处理器)上的token运行速率实现显著提升,将极低比特方案从移动端扩展至PC和边缘设备。
在实际业务验证方面,哔哩哔哩已将该极低比特模型正式接入直播弹幕实时翻译。整套资源下载大小约600MB,运行时内存占用500到700MB,平均单条弹幕翻译耗时500到800毫秒,在常规弹幕频率下能够实现流畅实时翻译,并能处理各类网络流行语。该设备本地独立运行模式既降低了云端服务器调用成本与带宽开销,也避免了数据上传,保障了用户隐私安全。