七项 rubric 通过率
按领域分布(场景数 / 满通过数)
全部 82 个场景
展开场景清单
诚实边界(适用边界,不隐藏)
上方卡片与清单是样本内口径(79 PASS, 2 MARGINAL, 1 REFUTED)。更严苛的留压测试下,诚实失败会更多:
外推压力测试:82 个场景中有 73 个落在 REFUTED 区间(模型在训练域外失效);
鲁棒性留出集:82 个场景中有 10 个被判 REFUTED。
这些"失败"不是缺陷,而是"哪里可信、哪里会失效"判定报告的一部分——SwarmLabs 卖的是可归档的适用边界,不是万能预测。