- 引入 MemoryRouterXL 与 v5/v6 流式多线程训练/编码管线 - 修复 prepare_memory_router_dataset 候选池重建缺陷(mega 家族 3568x 加速,输出逐字节相同) - 修复 v5 被破坏的拒答与多跳标签(train 未知样本 319 -> 16319,multi_hop 平均正例 1.00 -> 2.00) - 同存储预算下 V2-128 v6 逐轴 22/22 通过:Top-1 41.12% -> 94.62%,未知拒答 0.00% -> 100.00% - 记录三条被实测推翻的显然优化(logits_to_keep=1 反而慢 55%、XL 容量未带来收益) - 记忆手术跨架构可移植性 14/14,读写关闭时与原生模型逐位相同
24 lines
580 B
JSON
24 lines
580 B
JSON
{
|
|
"package": "qwen3_5_4b_natural_memory_v2",
|
|
"shard": "qwen3_5_4b_natural_memory_v2\\model.safetensors-00005-of-00005.safetensors",
|
|
"deployed_keys": 16,
|
|
"candidate_keys": 16,
|
|
"missing_in_candidate": [],
|
|
"extra_in_candidate": [],
|
|
"shape_mismatches": {},
|
|
"drop_in_compatible": true,
|
|
"runtime_construction": {
|
|
"hidden_size": 2560,
|
|
"router_dim": 128,
|
|
"num_heads": 8,
|
|
"max_hops": 3
|
|
},
|
|
"scores_finite": true,
|
|
"score_shape": [
|
|
2,
|
|
32
|
|
],
|
|
"bank_routed_records": 3,
|
|
"bank_key_dim": 128,
|
|
"bank_routing_ok": true
|
|
} |