代理建模/优化(贝叶斯优化基准)
已收敛
ground-truth:Forrester et al. 2008: min ≈ -6.0208 @ x≈0.7572
种子基线 rmse0.0266
95% CI 覆盖率1.00
校准误差0.050
外推诚实度4.25×
闭环累积点2
来源:Hydra-0: Action Flow for Generalist World Modeling and Control;From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation;Multi-Agent AI System for Radiology Report Structuring and Quality Assurance with Independent Radiologist Evaluation
新实验方向建议- ✅ 已收敛:可升保真度阶梯(PINN / 神经算子)或作跨域校准锚点;新方向——用该场景验证其他域代理的可迁移性。
下一步实验锦标赛(按信息增益排名)- #1 点 [0.994] · 期望信息增益 0.0432(σ=0.2079)
- #2 点 [0.988] · 期望信息增益 0.0345(σ=0.1857)
- #3 点 [0.001] · 期望信息增益 0.0331(σ=0.1819)
- #4 点 [0.986] · 期望信息增益 0.0317(σ=0.1779)
- #5 点 [0.003] · 期望信息增益 0.0316(σ=0.1777)
代理建模/优化(2D 基准)
已收敛
ground-truth:Branin min ≈ 0.397887 @ 3 个已知点
种子基线 rmse0.6336
95% CI 覆盖率1.00
校准误差0.050
外推诚实度19.82×
闭环累积点7
来源:Ultrafast and high resolution spatial light modulation for cold atoms;Planning Against Learning in Rank-1 Games;On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification
新实验方向建议- ✅ 已收敛:可升保真度阶梯(PINN / 神经算子)或作跨域校准锚点;新方向——用该场景验证其他域代理的可迁移性。
下一步实验锦标赛(按信息增益排名)- #1 点 [9.55, 0.226] · 期望信息增益 4181.9774(σ=64.6682)
- #2 点 [-4.485, 14.724] · 期望信息增益 4167.5433(σ=64.5565)
- #3 点 [9.227, 0.466] · 期望信息增益 4160.4599(σ=64.5016)
- #4 点 [-4.628, 14.408] · 期望信息增益 4159.794(σ=64.4965)
- #5 点 [8.496, 0.096] · 期望信息增益 4143.6782(σ=64.3714)
代理建模/优化(6D 高维基准)
已收敛
ground-truth:Hartmann 6D min ≈ -3.32237
种子基线 rmse0.0044
95% CI 覆盖率1.00
校准误差0.050
外推诚实度28.30×
闭环累积点6
来源:Ultrafast and high resolution spatial light modulation for cold atoms;Planning Against Learning in Rank-1 Games;On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification
新实验方向建议- ✅ 已收敛:可升保真度阶梯(PINN / 神经算子)或作跨域校准锚点;新方向——用该场景验证其他域代理的可迁移性。
下一步实验锦标赛(按信息增益排名)- #1 点 [0.019, 0.679, 0.021, 0.747, 0.993, 0.957] · 期望信息增益 0.1643(σ=0.4053)
- #2 点 [0.825, 0.035, 0.125, 0.967, 0.095, 0.113] · 期望信息增益 0.1641(σ=0.405)
- #3 点 [0.106, 0.044, 0.348, 0.945, 0.959, 0.229] · 期望信息增益 0.164(σ=0.405)
- #4 点 [0.944, 0.079, 0.078, 0.705, 0.068, 0.971] · 期望信息增益 0.1639(σ=0.4049)
- #5 点 [0.986, 0.715, 0.481, 0.909, 0.245, 0.039] · 期望信息增益 0.1636(σ=0.4045)
热传导(物理信息/PDE)
已收敛
ground-truth:1D 热方程解析解 u=sin(πx)e^{-π²t}
种子基线 rmse0.0017
95% CI 覆盖率1.00
校准误差0.050
外推诚实度2.18×
闭环累积点5
来源:1D 热方程解析解 u=sin(πx)e^{-π²t}
新实验方向建议- ✅ 已收敛:可升保真度阶梯(PINN / 神经算子)或作跨域校准锚点;新方向——用该场景验证其他域代理的可迁移性。
下一步实验锦标赛(按信息增益排名)- #1 点 [0.994] · 期望信息增益 0.0001(σ=0.0087)
- #2 点 [0.988] · 期望信息增益 0.0001(σ=0.0082)
- #3 点 [0.986] · 期望信息增益 0.0001(σ=0.008)
- #4 点 [0.001] · 期望信息增益 0.0001(σ=0.0079)
- #5 点 [0.982] · 期望信息增益 0.0001(σ=0.0078)
生物/群体动力学
已收敛
ground-truth:Logistic 增长 N(t)=K/(1+Ae^{-rt}), K=100,r=0.6,A=19
种子基线 rmse0.0583
95% CI 覆盖率1.00
校准误差0.050
外推诚实度2.89×
闭环累积点4
来源:Unique Ergodicity for the Projective Process of the 2D Navier--Stokes Equation with Nondegenerate Noise;Energy-efficient, Reconfigurable Optoelectronic Artificial Synapses Based on MoWS$_2$ Alloy for Pattern Recognition and Color Image Filtering Applications;A note on the partial sum of bounded Dirichlet series
新实验方向建议- ✅ 已收敛:可升保真度阶梯(PINN / 神经算子)或作跨域校准锚点;新方向——用该场景验证其他域代理的可迁移性。
下一步实验锦标赛(按信息增益排名)- #1 点 [0.01] · 期望信息增益 2.1484(σ=1.4657)
- #2 点 [0.032] · 期望信息增益 2.0404(σ=1.4284)
- #3 点 [0.059] · 期望信息增益 1.9191(σ=1.3853)
- #4 点 [0.064] · 期望信息增益 1.8967(σ=1.3772)
- #5 点 [0.08] · 期望信息增益 1.8352(σ=1.3547)
微生物/生长动力学(Monod)
已收敛
ground-truth:Monod 1949: μ(S)=μmax·S/(Ks+S), E.coli μmax=0.81 h⁻¹, Ks=0.22 g/L(文献代表值)
种子基线 rmse0.0058
95% CI 覆盖率0.90
校准误差0.050
外推诚实度2.24×
闭环累积点2
来源:From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation;Analytic Continuation of Conformal Integrals in Momentum Space;TokEval: A Tokenizer Evaluation Suite
新实验方向建议- ✅ 已收敛:可升保真度阶梯(PINN / 神经算子)或作跨域校准锚点;新方向——用该场景验证其他域代理的可迁移性。
下一步实验锦标赛(按信息增益排名)- #1 点 [0.022] · 期望信息增益 0.0(σ=0.0054)
- #2 点 [0.026] · 期望信息增益 0.0(σ=0.0053)
- #3 点 [1.988] · 期望信息增益 0.0(σ=0.0053)
- #4 点 [0.032] · 期望信息增益 0.0(σ=0.0052)
- #5 点 [0.033] · 期望信息增益 0.0(σ=0.0052)
微生物/底物抑制(Andrews)
已收敛
ground-truth:Andrews 1968 底物抑制 μ=μmax·S/(Ks+S+S²/Ki), Ki≈1.0 g/L(文献代表值)
种子基线 rmse0.0021
95% CI 覆盖率1.00
校准误差0.050
外推诚实度6.05×
闭环累积点5
来源:Robust Orbital Angular Momentum Transfer Using low-cost Diffractive Optics;Optically Writable Atomic Vapor Memory as a Substrate for Optical Reservoir Computing;Growth of Altermagnetic α-MnTe Films: Substrate Variation and Surface Modification
新实验方向建议- ✅ 已收敛:可升保真度阶梯(PINN / 神经算子)或作跨域校准锚点;新方向——用该场景验证其他域代理的可迁移性。
下一步实验锦标赛(按信息增益排名)- #1 点 [0.053] · 期望信息增益 0.0(σ=0.0045)
- #2 点 [2.983] · 期望信息增益 0.0(σ=0.0044)
- #3 点 [0.059] · 期望信息增益 0.0(σ=0.0042)
- #4 点 [0.067] · 期望信息增益 0.0(σ=0.0039)
- #5 点 [0.069] · 期望信息增益 0.0(σ=0.0038)
LLM/缩放律(Kaplan 2020)
已收敛
ground-truth:Scaling law L(N)=(N_c/N)^α, α=0.076, N_c=6.4e13(Kaplan 2020 发表系数,nats)
种子基线 rmse0.0091
95% CI 覆盖率1.00
校准误差0.050
外推诚实度1.07×
闭环累积点5
来源:Hydra-0: Action Flow for Generalist World Modeling and Control;From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation;Unique Ergodicity for the Projective Process of the 2D Navier--Stokes Equation with Nondegenerate Noise
新实验方向建议- ✅ 已收敛:可升保真度阶梯(PINN / 神经算子)或作跨域校准锚点;新方向——用该场景验证其他域代理的可迁移性。
下一步实验锦标赛(按信息增益排名)- #1 点 [7.004] · 期望信息增益 0.0003(σ=0.0164)
- #2 点 [7.013] · 期望信息增益 0.0003(σ=0.0164)
- #3 点 [7.024] · 期望信息增益 0.0003(σ=0.0164)
- #4 点 [7.026] · 期望信息增益 0.0003(σ=0.0163)
- #5 点 [7.032] · 期望信息增益 0.0003(σ=0.0163)
化学/吸附等温(Langmuir 1916)
收敛中
ground-truth:Langmuir 1916 吸附等温线 θ=KP/(1+KP);K 取代表性值 1.5(吸附等温文献区间 0.1–10)
种子基线 rmse0.0084
95% CI 覆盖率0.85
校准误差0.100
外推诚实度3.69×
闭环累积点2
来源:On Chern's conjecture for minimal submanifolds of the sphere;Quantum Geometric Tensor Preconditioning for Stable Training of Recurrent Neural Quantum States;TokEval: A Tokenizer Evaluation Suite
新实验方向建议- 校准误差 0.100 处于临界带(判定线 0.08):名义置信水平与实际覆盖已出现可测偏离,建议下一轮同时记录 epistemic/aleatoric 分量,定位偏离来源。
下一步实验锦标赛(按信息增益排名)- #1 点 [9.941] · 期望信息增益 0.0(σ=0.0065)
- #2 点 [9.885] · 期望信息增益 0.0(σ=0.006)
- #3 点 [9.859] · 期望信息增益 0.0(σ=0.0058)
- #4 点 [0.11] · 期望信息增益 0.0(σ=0.0057)
- #5 点 [0.131] · 期望信息增益 0.0(σ=0.0056)
化学/一阶反应器转化率(Arrhenius 动力学, 2D)
已收敛
ground-truth:一阶全混/活塞流反应器转化率 X=1-exp(-k0·exp(-Ea/RT)·τ);Ea 取代表性 30 kJ/mol,k0 归一定标使 X(410K,τ=5)≈0.9(均相反应动力学文献区间;Levenspiel 1999 反应器设计)
种子基线 rmse0.0011
95% CI 覆盖率1.00
校准误差0.050
外推诚实度10.95×
闭环累积点5
来源:一阶全混/活塞流反应器转化率 X=1-exp(-k0·exp(-Ea/RT)·τ);Ea 取代表性 30 kJ/mol,k0 归一定标使 X(410K,τ=5)≈0.9(均相反应动力学文献区间;Levenspiel 1999 反应器设计)
新实验方向建议- ✅ 已收敛:可升保真度阶梯(PINN / 神经算子)或作跨域校准锚点;新方向——用该场景验证其他域代理的可迁移性。
下一步实验锦标赛(按信息增益排名)- #1 点 [407.899, 0.568] · 期望信息增益 0.0269(σ=0.164)
- #2 点 [342.404, 4.917] · 期望信息增益 0.0268(σ=0.1637)
- #3 点 [341.734, 4.822] · 期望信息增益 0.0262(σ=0.1618)
- #4 点 [406.393, 0.64] · 期望信息增益 0.025(σ=0.1581)
- #5 点 [344.746, 4.868] · 期望信息增益 0.0246(σ=0.1568)
对标前沿实验室:验证主导 + 实验锦标赛
本验证闭环对应 Google Co-Scientist 的「验证主导计算 + idea tournament(Elo 排名)」与
DeepMind A-Lab / Periodic 的「仿真→真实实验校准」闭环:以论文真实数据作 ground-truth、
用量化误差棒代替单一 loss、用主动学习挑信息量最大的下一点(SwarmLabs 的「实验锦标赛」对标
Co-Scientist 的 Elo 排名)。SwarmLabs 轻量、纯 numpy、可日级自治运行;差异在:不做 LLM 假设生成、
暂未接真实实验台、不依赖 Gemini——这是有意的轻量定位,算力重组件(PINN / 神经算子 / RemoteLab)已留桩待规模。
可信面 · Trust Surface(AERS 风格 rigor rubric)
每场景用论文/基准公布的真实 ground-truth 作 gold、重算校验;覆盖率按双侧判定
(<0.85 欠覆盖/过自信,>1.0 过覆盖/误差棒过宽,0.85–1.0 达标)。rubric 含:
gold 溯源、rmse 相对误差、双侧覆盖率、校准误差、lengthscale 来源可追溯。
外推诚实度=域外预测 std / 域内 std(🏆 旗舰场景≥1.3×,证明 UQ 诚实表达未知区域)。
| 场景 |
rmse |
95% CI 覆盖率 |
校准误差 |
rubric |
闭环累积点 |
外推诚实度 |
ground-truth 来源 |
| 代理建模/优化(贝叶斯优化基准) 🏆 | 0.0297 | 1.00 (ok) | 0.050 | 5/5 | 2 | 4.25× | Forrester et al. 2008: min ≈ -6.0208 @ x≈0.7572 |
| 代理建模/优化(2D 基准) 🏆 | 0.4284 | 1.00 (ok) | 0.050 | 5/5 | 7 | 19.82× | Branin min ≈ 0.397887 @ 3 个已知点 |
| 代理建模/优化(6D 高维基准) 🏆 | 0.0025 | 1.00 (ok) | 0.050 | 5/5 | 6 | 28.30× | Hartmann 6D min ≈ -3.32237 |
| 热传导(物理信息/PDE) 🏆 | 0.0011 | 1.00 (ok) | 0.050 | 5/5 | 5 | 2.18× | 1D 热方程解析解 u=sin(πx)e^{-π²t} |
| 生物/群体动力学 🏆 | 0.0484 | 1.00 (ok) | 0.050 | 5/5 | 4 | 2.89× | Logistic 增长 N(t)=K/(1+Ae^{-rt}), K=100,r=0.6,A=19 |
| 微生物/生长动力学(Monod) | 0.0049 | 0.90 (ok) | 0.050 | 5/5 | 2 | 2.24× | Monod 1949: μ(S)=μmax·S/(Ks+S), E.coli μmax=0.81 h⁻¹, Ks=0.22 g/L(文献代表值) |
| 微生物/底物抑制(Andrews) | 0.0018 | 1.00 (ok) | 0.050 | 5/5 | 5 | 6.05× | Andrews 1968 底物抑制 μ=μmax·S/(Ks+S+S²/Ki), Ki≈1.0 g/L(文献代表值) |
| LLM/缩放律(Kaplan 2020) | 0.0080 | 1.00 (ok) | 0.050 | 5/5 | 5 | 1.07× | Scaling law L(N)=(N_c/N)^α, α=0.076, N_c=6.4e13(Kaplan 2020 发表系数,nats) |
| 化学/吸附等温(Langmuir 1916) | 0.0052 | 0.85 (ok) | 0.100 | 4/5 | 2 | 3.69× | Langmuir 1916 吸附等温线 θ=KP/(1+KP);K 取代表性值 1.5(吸附等温文献区间 0.1–10) |
| 化学/一阶反应器转化率(Arrhenius 动力学, 2D) 🏆 | 0.0008 | 1.00 (ok) | 0.050 | 5/5 | 5 | 10.95× | 一阶全混/活塞流反应器转化率 X=1-exp(-k0·exp(-Ea/RT)·τ);Ea 取代表性 30 kJ/mol,k0 归一定标使 X(410K,τ=5)≈0.9(均相反应动力学文献区间;Levenspiel 1999 反应器设计) |
汇总:场景 10 · 🏆 旗舰 6 · rubric 满通过 9/10 ·
gold 溯源 10/10 ·
闭环累积点合计 43 ·
覆盖率 达标 10 / 欠覆盖 0 / 过覆盖 0