腾讯开源 AngelSpec 框架,破解大模型推理成本难题
随着大模型规模与服务需求的持续增长,自回归解码带来的高昂计算成本已成为行业普遍面临的痛点。腾讯技术团队近日正式开源统一训练框架 AngelSpec,通过多方案协同与工作负载异构适配,提升大模型在真实场景中的推理吞吐量。
针对不同应用场景的文本特征差异,AngelSpec 采用差异化训练策略。对于高熵、开放式的多轮对话任务,系统采用轻量多 token 预测机制(MTP),结合训练时测试(TTT)与端到端总变差损失,以适应自回归展开中的状态分布变化。而在结构约束更强的代码生成与数学推理任务中,则通过专有块扩散模型进行强化,挖掘长跨度可预测序列的潜力。
架构层面,该框架提出名为 DFly 的创新块扩散框架。该设计通过混合目标条件编码骨干与前序条件自回归头,在保持高吞吐量并行生成的同时,优化目标特征利用率与块内依赖建模。此外,系统引入动态验证机制,可根据在线负载、硬件条件及前缀置信度,在运行时自适应调整验证深度,平衡计算资源与吞吐效率。
在 Hy3 模型系列的系统测试中,搭载 DFly 的方案在并发数 4 至 64 的各项测试里均实现最高平均吞吐量,相比传统自回归解码提升显著,为大模型工程化落地与高效推理提供了开源工具支持。
项目地址:https://github.com/Tencent/AngelSpec
论文:https://arxiv.org/pdf/2607.25852