- 引入 MemoryRouterXL 与 v5/v6 流式多线程训练/编码管线 - 修复 prepare_memory_router_dataset 候选池重建缺陷(mega 家族 3568x 加速,输出逐字节相同) - 修复 v5 被破坏的拒答与多跳标签(train 未知样本 319 -> 16319,multi_hop 平均正例 1.00 -> 2.00) - 同存储预算下 V2-128 v6 逐轴 22/22 通过:Top-1 41.12% -> 94.62%,未知拒答 0.00% -> 100.00% - 记录三条被实测推翻的显然优化(logits_to_keep=1 反而慢 55%、XL 容量未带来收益) - 记忆手术跨架构可移植性 14/14,读写关闭时与原生模型逐位相同
1.8 KiB
1.8 KiB
冻结特征是否编码「提问问的是哪个属性」?
属性数 24(随机基线 4.17%);训练查询 1200 条,评测查询 300 条(同为这些属性的不同改写,训练时从未见过)。
| 指标 | 值 |
|---|---|
| 训练集准确率 | 83.42% |
| 评测集准确率(未见改写) | 83.33% |
| 评测集·仅可回答子集 | 100.00% |
| 随机基线 | 4.17% |
结构化拒答规则(判属性 → 查是否在库里)
规则:predict the asked-about attribute; refuse when the candidate set lacks it。
| 指标 | 值 |
|---|---|
| 可回答 episode 中「预测属性在候选集内」 | 100.00%(250 条) |
| 未知 episode 中「预测属性在候选集内」 | 0.00%(50 条) |
| 未知拒答率(规则命中) | 100.00% |
| 已知问题被误拒率 | 0.00% |
| 混淆计数 | tp=50 fn=0 fp=0 tn=250 |
按属性(评测集可回答)
| 属性 | 评测问法数 | 正确率 |
|---|---|---|
| 主管姓名 | 12 | 100.00% |
| 入职年份 | 11 | 100.00% |
| 出生城市 | 9 | 100.00% |
| 办公城市 | 9 | 100.00% |
| 午餐偏好 | 12 | 100.00% |
| 咖啡口味 | 19 | 100.00% |
| 团队名称 | 10 | 100.00% |
| 客户名称 | 12 | 100.00% |
| 宿舍楼号 | 14 | 100.00% |
| 工位楼层 | 6 | 100.00% |
| 常住城市 | 13 | 100.00% |
| 常用编辑器 | 6 | 100.00% |
| 手机尾号 | 11 | 100.00% |
| 档案标识 | 16 | 100.00% |
| 紧急联系人姓氏 | 7 | 100.00% |
| 设备型号 | 7 | 100.00% |
| 课程名称 | 12 | 100.00% |
| 起床时间 | 12 | 100.00% |
| 运动习惯 | 6 | 100.00% |
| 通勤方式 | 8 | 100.00% |
| 邮箱域名 | 7 | 100.00% |
| 阅读工具 | 7 | 100.00% |
| 项目代号 | 12 | 100.00% |
| 默认语言 | 12 | 100.00% |