Files

227 lines
11 KiB
JavaScript
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
/* 本文件由脚本从评测原始结果逐字提取,请勿手改。
来源:H:\Memory\dynamic_memory_lab\dirty_real_corpus_compare_4b_router_final.json
创建时间:2026-09-06T11:36:26+0800 协议:greedy / max_new_tokens=64 / top_k=2 */
window.NM_EXAMPLES = [
{
"id": "user-004",
"domain": "user_dialogue",
"category": "paraphrase",
"answerable": true,
"query": "我不想翻聊天记录,当前这个记忆模型叫什么?",
"expected": "Natural Memory v1",
"expected_anchors": [
"Natural Memory v1"
],
"nm": {
"response": "当前这个记忆模型叫 **Natural Memory v1**。",
"correct": true,
"tokens": 14,
"recall": true,
"retrieved_values": [
"Natural Memory v1",
"重要信息写入,禁止胡编乱造,并学习写入、清理和总结时机"
],
"records": [
{
"record_id": "mem_da9418d179467fba",
"entity": "user",
"attribute": "模型名称",
"value": "Natural Memory v1",
"status": "active",
"version": 0,
"source": "user_provided_dialogue",
"text_preview": "用户给当前模型定名:Natural Memory v1。"
},
{
"record_id": "mem_862617d79b828161",
"entity": "user",
"attribute": "记忆质量要求",
"value": "重要信息写入,禁止胡编乱造,并学习写入、清理和总结时机",
"status": "active",
"version": 0,
"source": "user_provided_dialogue",
"text_preview": "用户要求:重要信息都要存进去,但不能让模型胡编乱造记忆,还要学会什么时候写入和清理总结。"
}
]
},
"base": {
"response": "您提到的“当前这个记忆模型”具体指代什么,取决于您使用的平台或应用。如果您是在使用某个特定的 AI 助手或应用程序,那么该应用可能内置了某种形式的记忆功能,用于记住您的偏好、历史对话或其他相关信息。\n\n不过,从技术角度来看,并没有一个统一的“记忆",
"correct": false,
"tokens": 64
},
"note": "actual user-stated fact with a hand-written natural paraphrase"
},
{
"id": "code-symbol-010-a",
"domain": "real_repository",
"category": "symbol_navigation",
"answerable": true,
"query": "我现在不想翻完整个屎山代码库,_generate_student 这个 def 定义落在哪个文件?",
"expected": "benchmark_memory_vs_full_kv.py",
"expected_anchors": [
"benchmark_memory_vs_full_kv.py",
"_generate_student"
],
"nm": {
"response": "根据已保存的长期记忆,`_generate_student` 这个函数定义落在文件 **`benchmark_memory_vs_full_kv.py`** 中(具体在第 171 行)。",
"correct": true,
"tokens": 43,
"recall": true,
"retrieved_values": [
"benchmark_memory_vs_full_kv.py",
"benchmark_compare_baselines_4b.py",
"test_restart_memory_dialogue.py"
],
"records": [
{
"record_id": "mem_df66c88a7e2ea9da",
"entity": "benchmark_memory_vs_full_kv.py",
"attribute": "symbol:_generate_student",
"value": "benchmark_memory_vs_full_kv.py",
"status": "active",
"version": 0,
"source": "real_repository_symbol_index",
"text_preview": "真实代码库事实:文件 benchmark_memory_vs_full_kv.py 的第 171 行定义了 def _generate_student。原始代码行:def _generate_student("
},
{
"record_id": "mem_7fb124c563472b07",
"entity": "benchmark_compare_baselines_4b.py",
"attribute": "symbol:_base_generate",
"value": "benchmark_compare_baselines_4b.py",
"status": "active",
"version": 0,
"source": "real_repository_symbol_index",
"text_preview": "真实代码库事实:文件 benchmark_compare_baselines_4b.py 的第 116 行定义了 def _base_generate。原始代码行:def _base_generate("
}
]
},
"base": {
"response": "我无法直接访问您的本地文件系统或代码库,因此无法告诉您 `_generate_student` 这个函数具体落在哪个文件中。\n\n不过,您可以尝试以下几种方法来快速定位:\n\n1. **使用 IDE 的搜索功能**:在您的代码编辑器(如 VS Code、PyCharm 等)中",
"correct": false,
"tokens": 64
},
"note": "real symbol extracted from repository source"
},
{
"id": "user-unknown-004",
"domain": "user_dialogue",
"category": "unknown_refusal",
"answerable": false,
"query": "我在这次对话里有没有说过生日?",
"expected": "",
"expected_anchors": [],
"nm": {
"response": "在这次对话中,**您还没有提到过生日**。\n\n截至目前,我们的交流内容中没有任何关于您生日、年龄或庆祝生日的提及。如果您想分享,随时可以告诉我!",
"correct": true,
"tokens": 41,
"recall": false,
"retrieved_values": [],
"records": []
},
"base": {
"response": "在这次对话中,**您还没有提到过生日**。\n\n截至目前,我们的交流内容中没有任何关于您生日、年龄或庆祝生日的提及。如果您想分享,随时可以告诉我!",
"correct": true,
"tokens": 41
},
"note": "unknown or deliberately sensitive field absent from the supplied dialogue slice"
},
{
"id": "code-unknown-008",
"domain": "real_repository",
"category": "unknown_refusal",
"answerable": false,
"query": "请告诉我没有出现在仓库里的部署区域。",
"expected": "",
"expected_anchors": [],
"nm": {
"response": "根据您提供的长期记忆证据(特别是 `README_NATURAL_MEMORY_V2.md` 的内容),**该文档中并没有列出任何具体的“部署区域”(Deployment Regions)**。\n\n文档主要关注的是以下技术架构和逻辑,而非地理或云端的部署位置:\n\n1. **核心设计",
"correct": false,
"tokens": 64,
"recall": false,
"retrieved_values": [
"README_NATURAL_MEMORY_V2.md",
"README_NATURAL_MEMORY_V2.md"
],
"records": [
{
"record_id": "mem_796c6e8c86afce71",
"entity": "README_NATURAL_MEMORY_V2.md",
"attribute": "operational:1",
"value": "README_NATURAL_MEMORY_V2.md",
"status": "active",
"version": 0,
"source": "real_repository_snapshot",
"text_preview": "真实项目文件:README_NATURAL_MEMORY_V2.md\n## 核心设计\n\n### KV 与 Memory Slot 的分工\n\n```text\n最近 32K token(最多可配置到 128K) -> GPU 热 KV:保留精确顺序和局部连贯性\n长期个人事实 / 项目决策 / 纠错版本 -> Memory Slot:保存压缩、可寻址的证据\n当前问题 -> 稀疏路由:只读取少量相关记录\n```\n\nMemory Slot 不模拟完整 KV。它只接管 KV 中最昂贵、最适合长期保存、最容易重复利用的部分。这里的目标是比长 K"
},
{
"record_id": "mem_32331793e07a8a4f",
"entity": "README_NATURAL_MEMORY_V2.md",
"attribute": "operational:0",
"value": "README_NATURAL_MEMORY_V2.md",
"status": "active",
"version": 0,
"source": "real_repository_snapshot",
"text_preview": "真实项目文件:README_NATURAL_MEMORY_V2.md\n把一百万个 slot 当作一张巨大的 KV Cache,而是把历史中最适合长期保存的部分压缩成有地址的记忆记录;当前对话仍由 Qwen 的热 KV 负责连续理解。\n\n## 先看结论\n\n当前版本已经完成以下闭环:\n\n```text\n普通用户输入\n -> 自动写入策略\n -> 置信度 / 重要性 / 来源审计\n -> 紧凑地址投影\n -> 分页存储\n -> LSH 粗索引\n -> 候选页重排\n -> 候选记录精排\n -> Top-K 证据注入 Qwen\n -> 版本冲突 / "
}
]
},
"base": {
"response": "您好!由于我无法访问您的仓库系统或具体业务数据,无法直接列出“未出现在仓库里的部署区域”。\n\n为了帮您准确定位,请提供以下信息:\n1. 仓库系统名称(如 GitLab、Jenkins、阿里云容器服务等)\n2. 您关注的部署区域范围",
"correct": true,
"tokens": 64
},
"note": "target deliberately absent from the real repository snapshot"
},
{
"id": "user-009",
"domain": "user_dialogue",
"category": "constraint",
"answerable": true,
"query": "你记得我对持久化文件和分页的限制吗?",
"expected": "第三个权重文件",
"expected_anchors": [
"第三个权重文件",
"不使用 SQLite",
"不使用磁盘分页"
],
"nm": {
"response": "是的,我记住了。\n\n根据您之前的要求,关于持久化方案和分页的限制如下:\n* **持久化方案**:不使用 SQLite 或磁盘分页,所有信息完全由**第三个权重文件**储存。\n* **实体**:user\n* **属性**:记忆持久化",
"correct": false,
"tokens": 64,
"recall": true,
"retrieved_values": [
"第三个权重文件,不使用 SQLite 或磁盘分页",
"Qwen3.5 4B"
],
"records": [
{
"record_id": "mem_c3886345cac35147",
"entity": "user",
"attribute": "记忆持久化方案",
"value": "第三个权重文件,不使用 SQLite 或磁盘分页",
"status": "active",
"version": 0,
"source": "user_provided_dialogue",
"text_preview": "用户要求:不使用 SQLite 或磁盘分页,完全由第三个权重文件储存所有信息。"
},
{
"record_id": "mem_149a0c2ab04c0f56",
"entity": "user",
"attribute": "对照模型",
"value": "Qwen3.5 4B",
"status": "active",
"version": 0,
"source": "user_provided_dialogue",
"text_preview": "用户要求和原版 qwen3.5 4b 做跑分对比,并纠正为 4B。"
}
]
},
"base": {
"response": "作为一个人工智能模型,我**无法访问您的个人历史对话记录、系统配置或您之前设定的具体规则**(例如具体的持久化文件大小限制、分页数量限制等)。每次对话对我来说都是全新的开始,除非您在当前的对话中明确告知我这些限制。\n\n不过,我可以帮您**重新设定",
"correct": false,
"tokens": 64
},
"note": "actual user-stated fact with a hand-written natural paraphrase"
}
];