记忆污染与纠错机制
LLM 有时会”一本正经地胡说八道”——如果这些错误结论被写入记忆,就会污染整个记忆系统。如何检测和修复被污染的记忆?
什么是记忆污染?
污染来源
| 来源 | 说明 | 示例 |
|---|---|---|
| LLM 幻觉 | 模型生成错误信息 | ”用户说他住在火星上” |
| 错误提取 | 从对话中错误提取信息 | 把反问句当作事实 |
| 上下文污染 | 错误信息在上下文中传播 | 引用了错误的检索结果 |
| 对抗注入 | 恶意用户故意注入 | Prompt Injection |
污染危害
| 危害 | 影响 |
|---|---|
| 错误决策 | 基于错误记忆做决策 |
| 用户体验下降 | 回答与用户实际偏好不符 |
| 信任崩塌 | 用户不再信任系统 |
| 恶性循环 | 错误记忆导致更多错误 |
检测机制
一致性检测
新记忆写入前,与已有记忆做一致性检查:
if 新记忆 与 已有记忆 矛盾:
标记为可疑
请求用户确认
或 使用来源优先级判断
置信度评分
| 因素 | 高置信 | 低置信 |
|---|---|---|
| 来源 | 用户明确陈述 | LLM 推断 |
| 频率 | 多次出现 | 首次出现 |
| 一致性 | 与多条记忆一致 | 存在矛盾 |
| 时效 | 近期信息 | 过时信息 |
自洽性检查
检查方法:
1. 对同一条记忆从不同角度提问
2. 比较多次回答的一致性
3. 不一致 → 该记忆可能被污染
纠错机制
纠错策略
| 策略 | 说明 | 适用场景 |
|---|---|---|
| 用户确认 | 高风险记忆请求用户确认 | 关键决策、个人信息 |
| 来源追溯 | 检查记忆的原始来源 | 需要验证准确性 |
| 交叉验证 | 与多个来源对比 | 重要事实核查 |
| 时效淘汰 | 旧记忆自动过期 | 时效性强的信息 |
| 主动遗忘 | 用户请求删除 | 隐私保护 |
降级处理
当检测到可能的污染时:
1. 降低该记忆的置信度权重
2. 在检索时标注"此记忆未经验证"
3. 要求额外的用户确认
4. 记录污染事件用于分析
速记卡(面试闪卡)
Q1:一句话讲清「记忆污染与纠错机制」到底是什么?
A:记忆污染是错误信息混入长期记忆,需靠检测与纠错机制防”张冠李戴”。
Q2:一、什么是记忆污染:四类来源 —— 怎么理解?
A:像往档案室塞错文件:LLM 幻觉写假话、错误提取把反问当事实、上下文以讹传讹、还有人故意注入毒数据——四类污染源。英文:Memory Pollution。
Q3:二、检测机制:一致性、置信度、自洽性 —— 怎么理解?
A:像银行对账三招:写入前和旧记忆比一致性、按来源/频率/时效打置信分、换角度问同一件事查自洽——任一异常就标”可疑”。英文:Consistency / Confidence / Self-Consistency。
Q4:三、纠错策略:确认、追溯、遗忘 —— 怎么理解?
A:像处理假新闻:高风险记忆请用户确认、可疑的追溯原始来源、重要的多源交叉验证,过时的按时效淘汰、隐私的主动遗忘。英文:Correction Strategy。
Q5:四、降级处理:污染来了先降权 —— 怎么理解?
A:像发现食材变质先下架:降低该记忆置信权重、检索时标注”未经验证”、追加用户确认、并记下污染事件供复盘。英文:Degraded Fallback。
Q6:核心速记主线有哪些?
-
污染源:幻觉 / 错误提取 / 上下文污染 / 对抗注入
-
三检测:一致性比对、置信度评分、自洽性提问
-
五纠错:确认、追溯、交叉验证、时效淘汰、主动遗忘
-
防扩散:降权 + 标注 + 确认 + 记录
口诀
A:记忆污染藏档案,
幻觉错提加隐患;
检测三招对账严,
确认遗忘保平安。
相关链接
快速问答
| 问题 | 参考答案 |
|---|---|
| 什么是记忆污染? | LLM 幻觉、错误提取、上下文污染、对抗注入导致的错误信息被写入记忆系统 |
| 如何检测记忆污染? | 一致性检测(新旧对比)、置信度评分(来源/频率/一致性/时效)、自洽性检查(多角度验证) |
| 如何修复被污染的记忆? | 用户确认、来源追溯、交叉验证、时效淘汰、主动遗忘。高风险场景请求用户确认 |