Files
natural-memory-nm21/query_attribute_classifier.md
T
WpyQwq 643e22ecb9 Natural Memory NM2.1: 记忆路由器分叉、数据集缺陷修复与全轴评测证据
- 引入 MemoryRouterXL 与 v5/v6 流式多线程训练/编码管线
- 修复 prepare_memory_router_dataset 候选池重建缺陷(mega 家族 3568x 加速,输出逐字节相同)
- 修复 v5 被破坏的拒答与多跳标签(train 未知样本 319 -> 16319,multi_hop 平均正例 1.00 -> 2.00)
- 同存储预算下 V2-128 v6 逐轴 22/22 通过:Top-1 41.12% -> 94.62%,未知拒答 0.00% -> 100.00%
- 记录三条被实测推翻的显然优化(logits_to_keep=1 反而慢 55%、XL 容量未带来收益)
- 记忆手术跨架构可移植性 14/14,读写关闭时与原生模型逐位相同
2026-09-19 11:11:31 +08:00

52 lines
1.8 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 冻结特征是否编码「提问问的是哪个属性」?
属性数 24(随机基线 4.17%);训练查询 1200 条,评测查询 300 条(**同为这些属性的不同改写,训练时从未见过**)。
| 指标 | 值 |
|---|---:|
| 训练集准确率 | 83.42% |
| **评测集准确率(未见改写)** | **83.33%** |
| 评测集·仅可回答子集 | 100.00% |
| 随机基线 | 4.17% |
## 结构化拒答规则(判属性 → 查是否在库里)
规则:predict the asked-about attribute; refuse when the candidate set lacks it。
| 指标 | 值 |
|---|---:|
| 可回答 episode 中「预测属性在候选集内」 | **100.00%**(250 条) |
| 未知 episode 中「预测属性在候选集内」 | **0.00%**(50 条) |
| 未知拒答率(规则命中) | **100.00%** |
| 已知问题被误拒率 | **0.00%** |
| 混淆计数 | tp=50 fn=0 fp=0 tn=250 |
## 按属性(评测集可回答)
| 属性 | 评测问法数 | 正确率 |
|---|---:|---:|
| 主管姓名 | 12 | 100.00% |
| 入职年份 | 11 | 100.00% |
| 出生城市 | 9 | 100.00% |
| 办公城市 | 9 | 100.00% |
| 午餐偏好 | 12 | 100.00% |
| 咖啡口味 | 19 | 100.00% |
| 团队名称 | 10 | 100.00% |
| 客户名称 | 12 | 100.00% |
| 宿舍楼号 | 14 | 100.00% |
| 工位楼层 | 6 | 100.00% |
| 常住城市 | 13 | 100.00% |
| 常用编辑器 | 6 | 100.00% |
| 手机尾号 | 11 | 100.00% |
| 档案标识 | 16 | 100.00% |
| 紧急联系人姓氏 | 7 | 100.00% |
| 设备型号 | 7 | 100.00% |
| 课程名称 | 12 | 100.00% |
| 起床时间 | 12 | 100.00% |
| 运动习惯 | 6 | 100.00% |
| 通勤方式 | 8 | 100.00% |
| 邮箱域名 | 7 | 100.00% |
| 阅读工具 | 7 | 100.00% |
| 项目代号 | 12 | 100.00% |
| 默认语言 | 12 | 100.00% |