AI 记得太多:一次记忆误记复盘
数字人 Agent 的记忆系统出过一次反直觉的事故:大模型对 14 条记忆候选全部给出 0.99 的置信度,自动确认了其中 11 条;人工复核发现,这 11 条全是误记,原始 precision 是 0%。置信度很高,正确率是零——置信度不能单独作为自动确认的依据。
发生了什么
用大模型对 5 封已回复的真实用户来信做受控回放:5 个记忆抽取任务全部成功,生成 14 条候选;自动整理环节确认了其中 11 条(78.6%)。
人工抽样复核后,结论很干脆:11 条全部属于一次性任务请求、模板、模型回复或"尚未确认"的过程信息,不应成为长期记忆。没有一条是稳定偏好、事实经历或可复用的关系事实。
典型的误记长这样
- "用户曾请求整理上海近期的新鲜事……"
- "双方此次对话中,数字人提供了一份小红书文案模板。"
- "数字人明确表示尚未确认最新的上海实时新鲜事。"
- "双方在本次对话中共同形成了一版草稿和两版配图提示词。"
看出来了吗?这些内容描述的都是任务过程或模型输出:整理了什么、提供了什么模板、尚未确认什么、形成了什么草稿。它们回答的是"这次对话发生了什么",不是"这个用户是谁、喜欢什么、和我们有什么关系"。
根因:过程噪声,不是抽取错误
这次事故的根因值得单独说:抽取本身没错,错的是"什么值得记住"的判断。模型忠实地记录了对话内容,问题是对话内容里大部分是过程噪声——一次性任务请求、用完即弃的模板、模型自己的回复、还没确认的状态。这些东西在对话当下有用,变成长期记忆就是污染。
而 0.99 的置信度,表达的是模型对"抽取正确性"的信心,不是"值得长期记住"的判断。这是两个完全不同的问题,用一个数字回答,必然翻车。自动确认的门禁如果只看置信度,等于把"记得准"和"记得对"混为一谈。
修复:门禁从置信度转向类别
11 条误记做了软撤销并保留审计记录。自动整理的门槛改成了两道:记忆类别必须是"已完成共同经历"或"严格验证知识",且置信度 >=0.95。任务产物、模型声明、未确认状态、稳定事实和关系判断,保留为例外或直接排除。
同时新增了配套机制:跨 7 天的同主题合并、历史自动记忆重审、观测接口和人工标注。历史 2 条按旧规则自动记住的研究内容,也按新规则做了软撤销。
还没解决的问题
这次回放的 5 封样本以任务型来信为主,不能代表普通闲聊、明确的个人事实或连续的关系互动。Wiki 里列了后续要做的标注评测:构造至少 30 封多类型样本,计算抽取召回率、正式记忆 precision、例外队列占比和置信度校准;precision 没到 95% 就只收紧类别,不降低门槛。
门槛收紧后 precision 能不能达到 95%,还需要用多类型样本验证。另外,任务请求到底该作为短期会话记忆保留、还是彻底不记,也还没定论。记忆系统的调优没有终点,只有"当前证据下够不够用"。
小结
记忆系统的质量门禁,拦的不是"抽错了",而是"不值得记"。置信度回答"有多确定",类别回答"配不配记住"——自动确认必须同时看这两道门。