海光DCU完成Kimi K3全栈适配 国产算力首次支撑万亿参数模型
国产算力平台首次实现对万亿参数级大模型的稳定支撑。海光信息近日宣布,已完成Kimi K3在海光DCU平台上的全栈适配与性能验证,标志着运行此类超大规模模型的算力选择不再局限于少数海外旗舰芯片。
从技术路径来看,海光DCU实现了从底层算子到推理引擎的全链路优化。模型代码无需修改即可直接运行,迁移成本近乎为零,开发者能够即拿即用。针对KDA注意力机制与896个专家组成的MoE架构,海光进行了算子级定制优化;即便在896个专家并行、百万级上下文的重负载场景下,推理仍能保持高效稳定。
在应用场景层面,K3在海光DCU上可支撑长程智能体工程、视觉闭环创作、自主芯片设计等前沿方向,国产算力用户得以首次亲手跑通万亿级开源模型。值得注意的是,月之暗面在K3正式发布前,已联合海光信息与中科曙光完成兼容性调优:曙光基于海光DCU硬件栈,打通了Kimi MoE架构的分布式训练与多卡并行推理链路;海光DCU则通过底层硬件与软件栈的协同优化,在曙光8000集群上实现了长文本推理的稳定运行。
官方测试数据显示,国产卡的性能折损控制在12%以内,已达到商用部署标准。万亿参数模型与国产GPU之间的技术壁垒正被逐步打破,智能时代的算力格局或将迎来新的变量。