- 引入 MemoryRouterXL 与 v5/v6 流式多线程训练/编码管线 - 修复 prepare_memory_router_dataset 候选池重建缺陷(mega 家族 3568x 加速,输出逐字节相同) - 修复 v5 被破坏的拒答与多跳标签(train 未知样本 319 -> 16319,multi_hop 平均正例 1.00 -> 2.00) - 同存储预算下 V2-128 v6 逐轴 22/22 通过:Top-1 41.12% -> 94.62%,未知拒答 0.00% -> 100.00% - 记录三条被实测推翻的显然优化(logits_to_keep=1 反而慢 55%、XL 容量未带来收益) - 记忆手术跨架构可移植性 14/14,读写关闭时与原生模型逐位相同
152 lines
3.7 KiB
JSON
152 lines
3.7 KiB
JSON
{
|
|
"rv2_new_e2e": {
|
|
"cases": 200,
|
|
"legacy_accuracy_pct": 70.0,
|
|
"accuracy_pct": 79.5,
|
|
"answerable_accuracy_pct": 83.43,
|
|
"unknown_refusal_pct": 52.0,
|
|
"wrong_abstention_pct": 2.86,
|
|
"per_category": {
|
|
"alias_paraphrase": {
|
|
"cases": 25,
|
|
"legacy_accuracy_pct": 100.0,
|
|
"accuracy_pct": 100.0
|
|
},
|
|
"long_fact": {
|
|
"cases": 25,
|
|
"legacy_accuracy_pct": 72.0,
|
|
"accuracy_pct": 72.0
|
|
},
|
|
"multi_entity": {
|
|
"cases": 25,
|
|
"legacy_accuracy_pct": 96.0,
|
|
"accuracy_pct": 96.0
|
|
},
|
|
"multi_hop": {
|
|
"cases": 25,
|
|
"legacy_accuracy_pct": 24.0,
|
|
"accuracy_pct": 100.0
|
|
},
|
|
"near_miss": {
|
|
"cases": 25,
|
|
"legacy_accuracy_pct": 100.0,
|
|
"accuracy_pct": 100.0
|
|
},
|
|
"noise_context": {
|
|
"cases": 25,
|
|
"legacy_accuracy_pct": 72.0,
|
|
"accuracy_pct": 72.0
|
|
},
|
|
"unknown_attribute": {
|
|
"cases": 25,
|
|
"legacy_accuracy_pct": 52.0,
|
|
"accuracy_pct": 52.0
|
|
},
|
|
"update_conflict": {
|
|
"cases": 25,
|
|
"legacy_accuracy_pct": 44.0,
|
|
"accuracy_pct": 44.0
|
|
}
|
|
}
|
|
},
|
|
"rv2_supersede_e2e": {
|
|
"cases": 200,
|
|
"legacy_accuracy_pct": 73.0,
|
|
"accuracy_pct": 80.0,
|
|
"answerable_accuracy_pct": 84.0,
|
|
"unknown_refusal_pct": 52.0,
|
|
"wrong_abstention_pct": 4.0,
|
|
"per_category": {
|
|
"alias_paraphrase": {
|
|
"cases": 25,
|
|
"legacy_accuracy_pct": 100.0,
|
|
"accuracy_pct": 100.0
|
|
},
|
|
"long_fact": {
|
|
"cases": 25,
|
|
"legacy_accuracy_pct": 76.0,
|
|
"accuracy_pct": 76.0
|
|
},
|
|
"multi_entity": {
|
|
"cases": 25,
|
|
"legacy_accuracy_pct": 96.0,
|
|
"accuracy_pct": 96.0
|
|
},
|
|
"multi_hop": {
|
|
"cases": 25,
|
|
"legacy_accuracy_pct": 44.0,
|
|
"accuracy_pct": 100.0
|
|
},
|
|
"near_miss": {
|
|
"cases": 25,
|
|
"legacy_accuracy_pct": 100.0,
|
|
"accuracy_pct": 100.0
|
|
},
|
|
"noise_context": {
|
|
"cases": 25,
|
|
"legacy_accuracy_pct": 72.0,
|
|
"accuracy_pct": 72.0
|
|
},
|
|
"unknown_attribute": {
|
|
"cases": 25,
|
|
"legacy_accuracy_pct": 52.0,
|
|
"accuracy_pct": 52.0
|
|
},
|
|
"update_conflict": {
|
|
"cases": 25,
|
|
"legacy_accuracy_pct": 44.0,
|
|
"accuracy_pct": 44.0
|
|
}
|
|
}
|
|
},
|
|
"rv2_anslast2_e2e": {
|
|
"cases": 200,
|
|
"legacy_accuracy_pct": 76.0,
|
|
"accuracy_pct": 82.0,
|
|
"answerable_accuracy_pct": 86.29,
|
|
"unknown_refusal_pct": 52.0,
|
|
"wrong_abstention_pct": 2.29,
|
|
"per_category": {
|
|
"alias_paraphrase": {
|
|
"cases": 25,
|
|
"legacy_accuracy_pct": 100.0,
|
|
"accuracy_pct": 100.0
|
|
},
|
|
"long_fact": {
|
|
"cases": 25,
|
|
"legacy_accuracy_pct": 72.0,
|
|
"accuracy_pct": 72.0
|
|
},
|
|
"multi_entity": {
|
|
"cases": 25,
|
|
"legacy_accuracy_pct": 96.0,
|
|
"accuracy_pct": 96.0
|
|
},
|
|
"multi_hop": {
|
|
"cases": 25,
|
|
"legacy_accuracy_pct": 52.0,
|
|
"accuracy_pct": 100.0
|
|
},
|
|
"near_miss": {
|
|
"cases": 25,
|
|
"legacy_accuracy_pct": 100.0,
|
|
"accuracy_pct": 100.0
|
|
},
|
|
"noise_context": {
|
|
"cases": 25,
|
|
"legacy_accuracy_pct": 72.0,
|
|
"accuracy_pct": 72.0
|
|
},
|
|
"unknown_attribute": {
|
|
"cases": 25,
|
|
"legacy_accuracy_pct": 52.0,
|
|
"accuracy_pct": 52.0
|
|
},
|
|
"update_conflict": {
|
|
"cases": 25,
|
|
"legacy_accuracy_pct": 64.0,
|
|
"accuracy_pct": 64.0
|
|
}
|
|
}
|
|
}
|
|
} |