- 引入 MemoryRouterXL 与 v5/v6 流式多线程训练/编码管线 - 修复 prepare_memory_router_dataset 候选池重建缺陷(mega 家族 3568x 加速,输出逐字节相同) - 修复 v5 被破坏的拒答与多跳标签(train 未知样本 319 -> 16319,multi_hop 平均正例 1.00 -> 2.00) - 同存储预算下 V2-128 v6 逐轴 22/22 通过:Top-1 41.12% -> 94.62%,未知拒答 0.00% -> 100.00% - 记录三条被实测推翻的显然优化(logits_to_keep=1 反而慢 55%、XL 容量未带来收益) - 记忆手术跨架构可移植性 14/14,读写关闭时与原生模型逐位相同
18 lines
715 B
JSON
18 lines
715 B
JSON
{
|
|
"package_label": "NM2.1",
|
|
"output_package": "H:\\Memory\\dynamic_memory_lab\\qwen3_5_4b_natural_memory_v2_1",
|
|
"source_package": "H:\\Memory\\dynamic_memory_lab\\qwen3_5_4b_natural_memory_v2",
|
|
"router_checkpoint": "checkpoints\\router_replay_v7_v2_128\\memory_router_v2.pt",
|
|
"router_sha256": "69f8295e78821e52c0b41b248e7eddbfa47d7e409539f4a13382c0c82d189deb",
|
|
"shard": "model.safetensors-00005-of-00005.safetensors",
|
|
"files_copied": 22,
|
|
"router_tensors_replaced": 16,
|
|
"tensors_left_untouched": 47,
|
|
"verification": {
|
|
"router_tensors_bit_exact": true,
|
|
"router_mismatches": [],
|
|
"non_router_tensors_unchanged": true,
|
|
"changed_non_router": []
|
|
},
|
|
"passed": true
|
|
} |