真实评测台账
全部 108 条真实评测 episode 的逐条台账:模型逐字回复、判定结果、停止原因、选中记录数与分数,可按来源与判定筛选。
108 条真实评测 episode,含全部失败
这一页不是挑出来的样例,是全部 108 条真实评测 episode 的逐条台账。 每条都带模型的逐字回复、判定结果、停止原因、选中记录数与分数。
数据来自 runtime_score_bands.json 与 nm2_1_final_runtime_e2e.json,
由 tools/make_ledger.py 生成 assets/js/ledger.js,
字段逐字复制,未做改写、润色或换算。模型输出里的错字、冗余和编造的内容都按原样保留。
期望锚点是评测里的随机码(形如 VAL-XXXXXXX),它只出现在唯一一条候选事实里,
因此可以用来检测「证据混用」。