- 引入 MemoryRouterXL 与 v5/v6 流式多线程训练/编码管线 - 修复 prepare_memory_router_dataset 候选池重建缺陷(mega 家族 3568x 加速,输出逐字节相同) - 修复 v5 被破坏的拒答与多跳标签(train 未知样本 319 -> 16319,multi_hop 平均正例 1.00 -> 2.00) - 同存储预算下 V2-128 v6 逐轴 22/22 通过:Top-1 41.12% -> 94.62%,未知拒答 0.00% -> 100.00% - 记录三条被实测推翻的显然优化(logits_to_keep=1 反而慢 55%、XL 容量未带来收益) - 记忆手术跨架构可移植性 14/14,读写关闭时与原生模型逐位相同
52 lines
1.8 KiB
Markdown
52 lines
1.8 KiB
Markdown
# 冻结特征是否编码「提问问的是哪个属性」?
|
||
|
||
属性数 24(随机基线 4.17%);训练查询 1200 条,评测查询 300 条(**同为这些属性的不同改写,训练时从未见过**)。
|
||
|
||
| 指标 | 值 |
|
||
|---|---:|
|
||
| 训练集准确率 | 83.42% |
|
||
| **评测集准确率(未见改写)** | **83.33%** |
|
||
| 评测集·仅可回答子集 | 100.00% |
|
||
| 随机基线 | 4.17% |
|
||
|
||
## 结构化拒答规则(判属性 → 查是否在库里)
|
||
|
||
规则:predict the asked-about attribute; refuse when the candidate set lacks it。
|
||
|
||
| 指标 | 值 |
|
||
|---|---:|
|
||
| 可回答 episode 中「预测属性在候选集内」 | **100.00%**(250 条) |
|
||
| 未知 episode 中「预测属性在候选集内」 | **0.00%**(50 条) |
|
||
| 未知拒答率(规则命中) | **100.00%** |
|
||
| 已知问题被误拒率 | **0.00%** |
|
||
| 混淆计数 | tp=50 fn=0 fp=0 tn=250 |
|
||
|
||
## 按属性(评测集可回答)
|
||
|
||
| 属性 | 评测问法数 | 正确率 |
|
||
|---|---:|---:|
|
||
| 主管姓名 | 12 | 100.00% |
|
||
| 入职年份 | 11 | 100.00% |
|
||
| 出生城市 | 9 | 100.00% |
|
||
| 办公城市 | 9 | 100.00% |
|
||
| 午餐偏好 | 12 | 100.00% |
|
||
| 咖啡口味 | 19 | 100.00% |
|
||
| 团队名称 | 10 | 100.00% |
|
||
| 客户名称 | 12 | 100.00% |
|
||
| 宿舍楼号 | 14 | 100.00% |
|
||
| 工位楼层 | 6 | 100.00% |
|
||
| 常住城市 | 13 | 100.00% |
|
||
| 常用编辑器 | 6 | 100.00% |
|
||
| 手机尾号 | 11 | 100.00% |
|
||
| 档案标识 | 16 | 100.00% |
|
||
| 紧急联系人姓氏 | 7 | 100.00% |
|
||
| 设备型号 | 7 | 100.00% |
|
||
| 课程名称 | 12 | 100.00% |
|
||
| 起床时间 | 12 | 100.00% |
|
||
| 运动习惯 | 6 | 100.00% |
|
||
| 通勤方式 | 8 | 100.00% |
|
||
| 邮箱域名 | 7 | 100.00% |
|
||
| 阅读工具 | 7 | 100.00% |
|
||
| 项目代号 | 12 | 100.00% |
|
||
| 默认语言 | 12 | 100.00% |
|