
从天气预报、地震勘探,到电磁仿真、材料模拟……现代工业与前沿科研的每一次突破,都离不开规模庞大的高性能计算(HPC)软件。
在这些软件的底层,均有一个极度消耗算力、却又无法避开的核心计算模式——Stencil(模块计算),其核心是对规则网格上每个点及其固定邻域执行相同局部运算。
无论是大气动力学、地震波场传播、电磁场演化,还是流体力学与相场模拟,其底层的计算都可以归纳为同一种操作:用网格点邻居的加权组合,反复更新整个网格。这类计算访存密集、受内存带宽主导,往往占据整个应用的大部分运行时间。
因此,Stencil 的性能高低,直接决定了国家关键工业与科研软件的整体效率。
但如何将一个 Stencil 优化到硬件的物理极限?
过去一般是依靠极度稀缺的高性能计算(HPC)专家。
他们开发了大量面向 Stencil 的编译器、代码生成器和自动调优系统,能自动生成代码、自动搜索参数配置,但本质上这些自动化工具背后的优化算法都需要人来设计和集成,面对新的应用场景、新的 Shape 和新的硬件平台,研究人员仍需不断提出新的优化策略,并手工将成果接入真实应用。因此,Stencil 优化始终高度依赖专家经验、难以规模化。
现在,这一局面有望被彻底改写——
今天,面壁智能联合 OpenBMB 开源社区发布并开源了全球首个支持 Stencil 自动研究、自动部署的 AI 优化系统 —— ForgeStencil。
据统计,ForgeStencil 在一周内完成了 100+ 个真实工业和科学计算软件的自动优化,远超人类专家的优化速度。这意味着,Stencil 优化的规模化成为可能;AI 加速千行百业、推动国产「智造」升级,正在成为现实。
双 Agent 驱动:零人工介入
ForgeStencil 之所以能超越以往所有的自动调优工具,关键在于:它首次实现了 从「提出优化想法」到「应用无缝部署」的全自动闭环。
在整个过程中,人类只需要提供待优化的应用源码,后续全流程由 ForgeStencil 接手——从自动分析真实应用、定位热点函数、锻造 Kernel,到完成算子替换、正确性验证与集成回原应用,全程没有人类专家介入任何一步优化决策。
ForgeStencil 系统由 Kernel Agent 与 App Agent 组成,二者结合完成了从算子优化到应用部署的完整闭环,不止是优化单个 Kernel,更是优化整个应用:
Kernel Agent:算子锻造的「科学家」
它专注于自主研究并合成高性能 Kernel,针对主流 Stencil 类型、多种 Shape 与精度要求,自主构建专用算子矩阵,将 Stencil 算子的数学表达写成逼近硬件物理极限的优雅代码。
在算子测试中,ForgeStencil 与目前市面上开源的最优算法(包括 Halide、Devito、EBISU、DRStencil、FlashFFTStencil 等知名框架)在同等硬件下进行对比测试,展示了强劲的技术优势:
同精度(fp32)对比下,获得了几何平均 2.35× 的加速比;
混合精度(fp16)读写时,又拿下了额外的 1.95× 提速;
即便在业界公认最难的「变系数 Stencil」全部 Shape 上,相比最优基线仍取得几何平均下 1.34× 的加速。
App Agent:应用部署的「实干派」
不同于干净、理想化的 Benchmark 测试环境,现实世界中的科学计算算法往往不是标准的Stencil循环,从输入输出形式到计算流程都与具体应用紧密相关。因此,传统的静态算子库通常无法直接融入真实软件。
App Agent 的做法是为每个应用单独锻造方案:定位性能热点、建立应用自身的 GPU 基线、锻造候选优化、用程序自带的校验与计时验证、再集成回原应用。
在框架级,App Agent 寻找算子融合的机会,并把待优化的 Stencil 算子提取出来。Kernel Agent 则负责优化具体的算子,其在之前建立的算子矩阵被作为后续开发的知识库。最终,App Agent 会使用应用自带的测例做端到端评测,以确保优化面向真实场景。
ForgeStencil 是面壁智能基于 Forge Engineering(旨在推动智能进化效率的全新软件工程范式)研发,继 5 月「AI 制造 AI」成果 ForgeTrain 之后所取得的又一重大技术突破。
通过 Kernel Agent(理论发现)与 App Agent(工程落地)的闭环协同,ForgeStencil 成功实现了 从「自动生成代码」向「自动研究优化」、从「局部算子提速」向「真实应用部署」的智能进化。
100+ 真实软件优化,仅需 1 周
在过去,一位 HPC 专家要优化一个真实的工业软件或科学计算应用,需要进行性能瓶颈分析、软件架构理解、Stencil 模式识别、优化方案设计、高性能 Kernel 开发、正确性验证、应用集成……整个流程历时数日到数周,每人每年能精调的应用软件通常不超过 20 个。
但在大模型时代,这一研究规则被改写了:
据统计,ForgeStencil 完成 100+ 真实应用软件的自动优化,仅用了 1 周——单应用优化时长被压缩到小时级别,研发吞吐提升约 1–2 个数量级,研发效率提升约 100 倍,且可以随着算力规模的加大并行放大。
这也意味着,Stencil 算子的优化,及其所决定的工业软件和科学计算应用优化,打破了过去人力的限制,首次实现规模化的可能性,能够有力加速国产「智」造的进程。

目前,ForgeStencil 已在一批主流科学软件与权威基准上完成自动优化,并在应用自带的 GPU 实现之上取得真实的端到端加速,其中约 42% 直接对应真实工业生产软件场景。
这也是 ForgeStencil 的差异化之处:它不仅停留在榜单上,而是直接面向真实工业场景,优化目标直接服务于石油公司、医疗设备、气象部门等行业的实际生产。
这些工业生产中的应用包括:
hypre(LLNL 结构化多重网格求解器库,加速 3.86×):全球工业仿真最广泛依赖的生产级数值库之一,ForgeStencil 自己搞定了高难度的红黑 GS 光滑子访存合并优化
minisweep(Sn 离散纵标输运,核反应堆中子学,加速 5.78×):设计核反应堆核心计算的必需品,ForgeStencil 重构了极其复杂的 KBA 波前扫掠结构。
gprMax / FDTD(Yee 网格 Maxwell 电磁仿真,加速 2.47×):雷达和芯片电磁仿真的骨干,ForgeStencil 完成了电磁装备与探地雷达的核心 Stencil 核替换。
RTM 逆时偏移(油气地震成像,加速 1.81×)。
TOTAL E&P minimod(道达尔油气地震 mini-app,加速 1.22×):石油勘探的主力算法。
QuantLib 债券定价(量化金融,加速 1.82×):金融机构所使用的定价库。
FHd 非笛卡尔 MRI 重建(加速 2.45×):医学影像软件。
DBT 数字乳腺断层成像反投影(加速 1.63×):医疗设备中的重建与成像负载。

与人类专家优化相比,AI 优化的另一技术优势在于:
人类专家的经验都在自己脑子里,很难共享给别人;但 ForgeStencil 有大量并行的 Agent 共享知识库,经验可以实时共享,可以实现智能的集体同步进化。
助力国产工业软件性能突围
ForgeStencil 旨在为工业软件和科学计算应用带来全新的研发范式。
短期内,存量软件的自动优化可以带来直接的收益。已有的以 Stencil 为热点的工业或科学软件,能在小时级拿到接近硬件极限的实现。通过算力节约和研发时间的压缩,助力工业和科研的降本增效。
长期来看,ForgeStencil 为国产制造业升级按下了「加速键」。
Stencil 算子背后的应用包括 CAE 仿真、地震成像、电磁与流体计算等等工业软件——它们是高端装备、能源勘探、芯片设计的数字底座,当这些软件的性能优化被自动化后,国产制造业的发展也会进入快车道。
从 ForgeTrain 到 ForgeStencil,面壁智能坚信 Forge Engineering 是未来的软件研发新范式。目前,ForgeStencil 已开源,我们诚邀广大 HPC 学者、工业软件从业者和开源社区开发者共同参与,携手用 AI 锻造更高效、更自主的计算未来。
➤ 开源链接
🔗 https://github.com/OpenBMB/ForgeStencil