这篇论文针对深度算子学习中注意力机制的作用进行了受控的系统性研究。作者在数据驱动和物理信息两种训练模式下,比较了五种带有不同注意力机制的DeepONet变体,以隔离交叉注意力、自注意力、令牌化和注意力深度的影响。实验覆盖了非线性扩散-反应方程、粘性Burgers方程和二维Poisson热传导问题。关键发现是,基于逐传感器令牌化的交叉注意力在所有基准组合中将经典DeepONet的平均相对L2误差降低了2.4至28.0倍,是最可靠的机制;而分支自注意力仅在处理复杂二维源场时有效,且效果不稳定。增加交叉注意力深度能进一步提升精度,但收益递减且物理信息训练成本显著增加。研究结论为算子学习中的注意力架构选择提供了实证指导。
| DeepONet | 深度算子网络,一种学习函数到函数映射的神经网络架构,用于求解偏微分方程。 |
| cross-attention | 交叉注意力,一种注意力机制,允许模型关注输入函数的不同部分,常用于编码器-解码器结构。 |
| self-attention | 自注意力,一种注意力机制,使序列中的每个元素能够关注同一序列中的其他元素,捕捉内部依赖关系。 |
| tokenization | 令牌化,将输入数据分割成离散的令牌或单元,以便神经网络处理。 |
| physics-informed training | 物理信息训练,一种训练方法,将物理定律作为损失函数的一部分,以约束模型输出符合物理规律。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅