面壁智能开源 ForgeStencil:全球首个 AI 驱动 Stencil 自动优化系统
高性能计算(HPC)领域长期存在一道瓶颈:Stencil 模板计算。从天气预报、地震勘探到电磁仿真、材料模拟,这类计算的核心模式都是通过网格点邻居的加权组合反复刷新整张网格。由于其访存密集、受内存带宽严重制约的特性,Stencil 计算往往消耗应用大部分运行时间,其效率直接决定关键工业与科研软件的整体性能。
传统上,将 Stencil 优化推向硬件物理极限依赖极少数 HPC 专家的手工调优。尽管编译器、代码生成器和自动调优系统能够自动出码、自动搜索参数,但优化算法本身仍需人工设计和集成,一旦场景、形状或硬件发生变化,就必须重新手工接入,难以规模化。面壁智能联合 OpenBMB 开源社区发布的 ForgeStencil,试图打破这一困局。
据官方披露,该系统是全球首个支持 Stencil 自动研究、自动部署的 AI 优化系统。ForgeStencil 在一周内完成了 100 多个真实工业和科学计算软件的自动优化,将单应用优化时长压缩至小时级,研发效率提升约 100 倍,且能随算力规模并行扩展。
该系统采用双 Agent 架构,实现零人工介入。用户只需输入待优化的应用源码,系统即可完成自动分析、热点定位、Kernel 生成、算子替换、正确性验证及原应用集成等全流程。其中,Kernel Agent 负责自主研究并合成高性能 Kernel,针对不同 Stencil 类型、形状和精度要求构建专用算子矩阵;App Agent 则负责工程落地,为每个真实应用定制优化方案,建立 GPU 基线并完成端到端评测。
在与现有框架的对比测试中,ForgeStencil 与 Halide、Devito、EBISU、DRStencil、FlashFFTStencil 等进行了算力对决。结果显示:同精度 fp32 条件下取得几何平均 2.35 倍加速;混合精度 fp16 读写带来额外 1.95 倍提速;即使在公认最难的变系数 Stencil 全形状测试中,相比最优基线仍有 1.34 倍几何平均加速。
该系统已切入真实工业场景。在主流科学软件与权威基准测试中,约 42% 的优化直接对应实际生产需求:hypre 结构化多重网格求解器库加速 3.86 倍,minisweep 核反应堆中子学输运加速 5.78 倍,gprMax 与 FDTD 电磁仿真加速 2.47 倍,RTM 逆时偏移油气地震成像加速 1.81 倍,道达尔 minimod 地震 mini-app 加速 1.22 倍,QuantLib 债券定价加速 1.82 倍,非笛卡尔 MRI 重建加速 2.45 倍,数字乳腺断层成像反投影加速 1.63 倍。
与人类专家经验难以共享不同,ForgeStencil 让大量并行 Agent 共用知识库,经验实时互通,实现智能的集体同步进化。这是面壁智能继 5 月 ForgeTrain 之后,基于 Forge Engineering 软件工程范式的又一成果,标志着从自动生成代码向自动研究优化、从局部算子提速向真实应用部署的跨越。
短期而言,存量工业软件可通过该系统在小时级获得接近硬件极限的优化实现,直接降低算力成本、压缩研发周期;长期来看,CAE 仿真、地震成像、电磁与流体等高端装备、能源勘探、芯片设计领域的数字底座自动化优化,将为国产制造业升级提供助力。目前 ForgeStencil 已在 GitHub 开源,面壁智能向 HPC 学者、工业软件从业者和开源开发者发出共建邀请。