月之暗面GTC演讲:重新设计Transformer三大基础组件
在GTC 2026演讲中,月之暗面CEO杨植麟没有局限于介绍Kimi K2.5产品本身,而是系统阐述了公司过去一年的技术思考:当开源模型逼近闭源前沿,除了堆参数和算力,还存在另一条路径——重新设计Transformer沿用近十年的三个基础组件。
这三个组件分别是:2014年提出的优化器Adam、2017年诞生的注意力机制、2015年出现的残差连接。月之暗面为三者各提供了替代方案,并全部开源。
MuonClip:让同等数据量效果翻倍
高质量数据即将耗尽是行业面临的现实瓶颈。月之暗面的应对思路是提高数据利用效率,而非单纯增加数据量。其推出的MuonClip优化器基于Muon改进,在参数更新时保持不同方向信息的独立性,减少重复计算。
实验数据显示,MuonClip能让同等数量数据的训练效果接近数据量翻倍。杨植麟举例称,若手握50万亿高质量Token,效率提升一倍等同于额外获得50万亿Token。在优质数据日益稀缺的背景下,这种效率提升比单纯增加算力更为关键。
Muon在万亿参数规模扩展时存在数值稳定性问题:注意力层最大logit会飙升至1000以上,远超50-100的正常范围,导致训练崩溃。月之暗面为此设计了QK-Clip机制,在前向计算中实时监测各注意力头的最大logit,超限即同步缩放Q、K投影。该技术使Muon成功扩展至万亿参数,训练超15万亿Token未出现一次loss spike。
Kimi Linear:让长上下文真正可用
Transformer的上下文越长、预测通常越准,但标准全注意力的计算量随长度平方增长,百万Token级别的成本令人难以承受。月之暗面的解决方案是Kimi Linear,其核心KDA(Kimi Delta Attention)线性注意力机制将单一全局衰减系数拆分为多个,不同信息通道采用不同遗忘速度——慢衰减保留长距离信息,快衰减及时释放空间。
实际应用中,Kimi Linear以3:1比例混合线性注意力层与全注意力层。杨植麟称其为首个在短上下文、长输入、长输出任务上全面超越全注意力的架构,上下文扩展至百万Token以上时效率优势更为显著。
Agent Swarm:从单兵到团队
月之暗面将单Agent扩展为多Agent协作系统Agent Swarm,组织架构类似公司:主Agent担任CEO,负责任务拆解与分配;子Agent分别扮演研究员、程序员、数据分析师等角色。核心价值在于将串行任务改为并行执行。
训练采用三种动态权重奖励:实例化奖励鼓励创建可并行子任务;完成奖励防止空任务;最终结果奖励评判任务解决质量。训练前期侧重任务拆解与并行化,后期转向最终结果。Kimi K2.5发布时支持最多100个Agent并行、1500个执行步骤,K2.6已将并行上限提升至300个。
视觉训练反哺文本:早期融合的意外收获
K2.5采用早期融合训练,从初始阶段即混合视觉与文本数据,而非先训文本再"贴"视觉能力。这带来两个意外发现:仅训练视觉任务也能提升文本推理能力;文本基座足够强时,甚至无需专门视觉SFT数据——K2.5采用零视觉SFT方案,纯文本监督微调后通过联合强化学习获得视觉能力,仍能达到接近先进水平。
杨植麟认为,双向迁移源于早期融合使两种模态进入同一表征空间,这也是K2.5能看图写代码的基础。
Attention Residue:深度维度的注意力替代
演讲最后介绍了3月15日刚发布的研究Attention Residue(注意力残差)。标准残差连接让每层既处理上层输出、又保留直接传递通道。月之暗面受此启发:Transformer已用注意力替代LSTM在时间维度的循环,深度维度是否也能同样替换?
Attention Residue允许当前层查看所有前序层输出,通过注意力主动挑选历史信息,而非被动接收上层结果。为控制成本,实际采用分块方案:每16层为一个块,块内标准残差,块间注意力残差,约8个块即可获取大部分收益。该技术带来约24%的Token效率提升,在GPQA、MATH、HumanEval等推理、数学与编程测试中提升明显。
开源不能只是开放,还必须足够强
月之暗面的替代清单已清晰呈现:Adam换为MuonClip、全注意力换为Kimi Linear、残差连接换为Attention Residue,分别对应从有限数据学更多、更高效利用超长上下文、让深层网络更灵活传递信息。三者均可独立替换现有组件,且均已开源。
这些技术能否直接叠加、增益能否简单相乘,尚待完整验证。但它们至少表明:许多被视为"足够好"的基础组件,可能远未到达终点。在优质数据减少、训练成本攀升的当下,重新设计底层组件同样可能带来可观提升——这也正是杨植麟整场演讲的核心主张。