Failure Cases — 我们公开承认失败的场景

一个"可信验证层"如果只挂 PASS,它不是验证层——它是营销层。这一页集中展示所有 REFUTED / CONTRADICTED / UNANCHORED 的场景,包括 主账本 PASS 但湿实验锚点反驳 的双证据链分歧。 每一条都可点击下钻到对应的 10 章 V&V 报告。
数据来源:frontend_fixed/reports/heldout_index.json(留出集压测)、 frontend_fixed/reports/wet_lab_anchors.json(湿实验锚点)、 frontend_fixed/reports/gate_ledger.json(门禁账本)。 判定口径与 V&V Report Gallery 同源。

双证据链分歧:主账本说 PASS,湿实验说 CONTRADICTED

这是我们最贵、也最诚实的一类失败。主账本的 R²=1.000、coverage=1.000 只证明 「模型忠实于它的场景真值函数(oracle)」,不能证明「oracle 符合真实生物学」。 两条证据链相互独立:

主账本:模型 vs 场景自带的解析解 / 发表基准,R² 与覆盖率
湿实验锚点:模型参数(Ks / μmax / D60 …)落在真实湿实验文献区间内吗?
当两者冲突时,湿实验优先——门禁账本一律把它们判 BLOCK_AUTONOMOUS_ACTION

① 湿实验锚点反驳 —— 主账本 PASS 但湿实验 CONTRADICTED

两条证据链的交叉验证失败。R² 高只能说明"代理拟合了 oracle", 不能说明"oracle 反映真实世界"。这两条不是营销上的失败,是哲学层的诚实: 模型可以精确拟合一个错的假设。

② 留出集压测 —— Robustness Held-out REFUTED

把每个场景的训练/测试切分重新洗牌(不同 split),观察结论是否稳定。 稳定失败的场景在这里——它们在换切分后仍无法达到 MARGINAL 门槛。 主账本 PASS 说明"这个切分下能拟合",此处 REFUTED 说明"这不是模型的稳定能力"。

③ 外推压力测试 —— Extrapolation Stress REFUTED

把测试点放到训练区间之外。这一档 REFUTED 是设计使然—— 任何代理模型都不该在没有数据的地方拍板。这里 53/62 被判 REFUTED, 我们把它挂在页面上:外推失败不是我们的失败,是代理模型的天性。 真正失败的是那些被宣传成"可以外推"的模型。

外推 REFUTED 不代表模型没用——它代表 「把测试点放到训练区间之外时,模型诚实拒绝给结论」。 门禁账本会在这些场景上标记 PROCEED_WITH_HUMAN_CHECK, 而不是 PROCEED诚实的失败优于自信的胡说

④ UNANCHORED —— 没有湿实验对照物

场景没有可锚定的闭式模型 / 语义错配。这不是失败,是诚实的边界: 我们明确说这些场景"没有第二证据链可用", 所以门禁账本一律 NO_WET_LAB_ANCHOR,不给自主动作放行。

为什么这一页存在

一份 62/62 PASS 的报告库,对读者是零信息——它什么都没说。 失败样本是可信验证层的真凭据

• 它证明我们对 R²、coverage、oracle 一致性 的判据不是自洽的漂亮数字, 而是会真的把不合格的场景拒之门外
• 它证明我们有两条独立证据链——主账本与湿实验锚点,冲突时不掩盖;
• 它证明外推失败我们承认,不做营销包装;
• 它提供可点击的失败样本——每一条都可以下钻到 10 章 V&V 报告,看判定路径。

如果你在做 AI4S 选型,请点开这些失败样本看看:一个愿意挂失败的团队, 才值得相信它的 PASS

判定口径:R² ≥ 0.90 且单侧下界 coverage ≥ 0.90 → PASS;R² ≥ 0.70 且 coverage ≥ 0.80 → MARGINAL; 其余 → REFUTED。
湿实验锚点等级:AGREE(在文献区间内)· NEAR(同数量级)· CONTRADICTED(跨数量级)· UNANCHORED(无锚点)。
数据来源: frontend_fixed/reports/heldout_index.json · frontend_fixed/reports/wet_lab_anchors.json · frontend_fixed/reports/gate_ledger.json
定位:本页与 V&V Report Gallery 都是免费公开资产。