一个"可信验证层"如果只挂 PASS,它不是验证层——它是营销层。这一页集中展示所有
REFUTED / CONTRADICTED / UNANCHORED 的场景,包括
主账本 PASS 但湿实验锚点反驳 的双证据链分歧。
每一条都可点击下钻到对应的 10 章 V&V 报告。
数据来源:frontend_fixed/reports/heldout_index.json(留出集压测)、
frontend_fixed/reports/wet_lab_anchors.json(湿实验锚点)、
frontend_fixed/reports/gate_ledger.json(门禁账本)。
判定口径与 V&V Report Gallery 同源。
这是我们最贵、也最诚实的一类失败。主账本的 R²=1.000、coverage=1.000 只证明 「模型忠实于它的场景真值函数(oracle)」,不能证明「oracle 符合真实生物学」。 两条证据链相互独立:
• 主账本:模型 vs 场景自带的解析解 / 发表基准,R² 与覆盖率
• 湿实验锚点:模型参数(Ks / μmax / D60 …)落在真实湿实验文献区间内吗?
当两者冲突时,湿实验优先——门禁账本一律把它们判 BLOCK_AUTONOMOUS_ACTION。
外推 REFUTED 不代表模型没用——它代表
「把测试点放到训练区间之外时,模型诚实拒绝给结论」。
门禁账本会在这些场景上标记 PROCEED_WITH_HUMAN_CHECK,
而不是 PROCEED。诚实的失败优于自信的胡说。
NO_WET_LAB_ANCHOR,不给自主动作放行。
一份 62/62 PASS 的报告库,对读者是零信息——它什么都没说。 失败样本是可信验证层的真凭据:
• 它证明我们对 R²、coverage、oracle 一致性 的判据不是自洽的漂亮数字,
而是会真的把不合格的场景拒之门外;
• 它证明我们有两条独立证据链——主账本与湿实验锚点,冲突时不掩盖;
• 它证明外推失败我们承认,不做营销包装;
• 它提供可点击的失败样本——每一条都可以下钻到 10 章 V&V 报告,看判定路径。
如果你在做 AI4S 选型,请点开这些失败样本看看:一个愿意挂失败的团队, 才值得相信它的 PASS。
frontend_fixed/reports/heldout_index.json ·
frontend_fixed/reports/wet_lab_anchors.json ·
frontend_fixed/reports/gate_ledger.json。