UAT(Cybenko, 1989;Hornik, 1991 推广)指出:只要激活函数连续且非多项式(如 Sigmoid、tanh、ReLU、GELU),一个含单隐藏层的前馈网络就能在任意紧集上以任意精度逼近任何连续函数 $\hat f(x)=\sum_i w_i\,\sigma(v_i^\top x + b_i)$,误差上界可小于任意 $\varepsilon>0$。它是一切「神经网络能拟合万物」主张的数学地基。
因为物理场解(PDE 的解映射)是连续函数,UAT 保证存在某个网络能表示它——这正是 PINN/神经算子「能逼近物理场解」的依据。但 UAT 只保证存在性,不保证三件事,必须诚实说明:
这三点恰好论证了 SwarmLabs 飞轮的必要性:物理先验(PIML 残差)缩小假设空间,主动学习(真实实验回填)保证泛化——二者共同补足 UAT 沉默的部分。
交叉注意力中,查询 $Q$ 来自目标序列(解码侧),键 $K$ 与值 $V$ 来自源序列(编码侧):$\mathrm{CrossAttn}(Q,K,V)=\mathrm{softmax}(QK^\top/\sqrt{d_k})V$,注意力矩阵为 $n_t\times n_s$ 矩形。这种不对称信息流天然适合长度/模态/角色不同的两路融合。
在 SwarmLabs 中,交叉注意力用于多域代理模型:例如把「PDE 场表征」作为源序列、「参数/边界条件序列」作为目标序列做桥接,实现跨域知识迁移;或桥接多保真度(粗糙仿真 ↔ 高精度实验),让廉价数据引导昂贵数据的预测。
三者叠加,构成 SwarmLabs「实验→验证→训练集→代理模型」飞轮的数学与架构底座。相关可复用实现见 scripts/llm_experiment/cross_attention_bridge.py。
UAT 指出:使用连续非多项式激活函数(如 ReLU、Sigmoid)的前馈网络,可在任意紧集上以任意精度逼近任何连续函数。它是神经网络表达能力的理论地基。
UAT 只保证「存在」某个网络,不保证宽度可控、可训练、能泛化。PIML 用物理方程残差缩小假设空间,主动学习用真实实验保证泛化——共同补足 UAT 沉默的部分。
作为双序列交互桥梁,把「PDE 场表征」与「参数/边界条件序列」或「多保真度数据」做跨域融合,实现知识迁移与廉价数据引导昂贵预测。
靠主动学习飞轮:每次真实实验的结果回填训练集,配合 PIML 物理先验约束,使模型在未见工况下仍保持物理一致与可靠。