- 引入 MemoryRouterXL 与 v5/v6 流式多线程训练/编码管线 - 修复 prepare_memory_router_dataset 候选池重建缺陷(mega 家族 3568x 加速,输出逐字节相同) - 修复 v5 被破坏的拒答与多跳标签(train 未知样本 319 -> 16319,multi_hop 平均正例 1.00 -> 2.00) - 同存储预算下 V2-128 v6 逐轴 22/22 通过:Top-1 41.12% -> 94.62%,未知拒答 0.00% -> 100.00% - 记录三条被实测推翻的显然优化(logits_to_keep=1 反而慢 55%、XL 容量未带来收益) - 记忆手术跨架构可移植性 14/14,读写关闭时与原生模型逐位相同
833 B
833 B
运行时端到端评测(零重叠改写,大样本)
每条 episode 把全部 5 个同形候选事实写入运行时,再问改写后的问题。 随机基线 1/5 = 20.00%。全部为百分比。
| blend | 用例 | 可回答 | 回答正确率 | 答成别的属性 | 未知泄漏率 | 平均选中记录 | 活跃记录 min/max |
|---|---|---|---|---|---|---|---|
| prior=0.00 blend=1.00 | 200 | 175 | 77.14% | 15.43% | 56.00% | 3.3350 | 2/9 |
检索最高分分布(原始分,非百分比;用于判断阈值能否分开『未知』与『可回答』)
| 组 | n | min | p10 | p50 | p90 | max |
|---|---|---|---|---|---|---|
| prior=0.00 blend=1.00 · 可回答 | 175 | 0.18 | 0.18 | 8.37 | 8.52 | 8.54 |
| prior=0.00 blend=1.00 · 不可回答 | 25 | 0.18 | 0.18 | 1.18 | 8.52 | 8.54 |