最新消息:关注人工智能 AI赋能新媒体运营

阿里开源Qwen3.8-Flash-Next:轻量化多模态大模型突破效能瓶颈

科技资讯 admin 浏览

阿里千问团队发布多模态MoE模型Qwen3.8-Flash,开源下一代架构

阿里千问团队近日正式发布多模态MoE模型Qwen3.8-Flash,并同步开源下一代底层架构Qwen3.8-Flash-Next,该架构也是全新一代Qwen4系列模型的雏形。

Qwen3.8-Flash总参数量达1250亿,额外搭载510亿N-gram Embedding参数,但每token仅激活60亿参数。模型原生支持26万token上下文窗口,借助YaRN技术可扩展至100万token。在成本控制方面优势显著,训练开销仅为前代Qwen3.7-Plus的九分之一,API定价为每百万tokens输入1元、输出3元。目前该模型已上线千问AI平台,同步推出"千问办公"功能。

Qwen3.8-Flash模型架构示意图

架构层面,团队完成四项核心升级:注意力模块采用GDN+QSA混合架构,GDN负责压缩历史信息,QSA筛选关键上下文,百万token场景下Prefill、Decode分别最高加速7.6倍、4.9倍;Gated Residual机制将残差流拓展为4条并行分支,依靠动态门控优化跨层信息传递,提升训练稳定性;N-gram Embedding利用局部上下文查表扩充模型容量,新增510亿参数几乎不增加计算负担;训练环节采用Muon与AdamW混合优化策略,重新拟合Scaling Law,省去批次预热流程。

多项基准测试显示,依靠60亿激活参数,基础模型在14项评测中斩获8项最优成绩。微调版本在代码、智能体、多模态任务上表现亮眼,SWE-bench Pro达到62.5分,CoWorkBench、Toolathlon等智能体榜单大幅领先同类模型。

目前Qwen3.8-Flash-Next权重已在Hugging Face、ModelScope开源,完整技术报告同步公开。千问团队提前开放架构,希望借助社区力量验证创新方案,持续迭代技术,稳步推进Qwen4系列模型研发。