07 - 记忆与上下文外泄:被诱导说出来的那些事
前置:01 - 威胁模型的 Lethal Trifecta,06 - 凭证与密钥的出口侧脱敏。
本篇回答:Agent 记住的关于用户的一切,怎么被第三方诱导吐出去;以及别人怎么往这份记忆里塞东西。
会用到的词:
- 长期记忆:跨会话保留的用户信息。和「上下文窗口」不同 —— 上下文随会话结束而消失,长期记忆不会
- 记忆投毒(memory poisoning):攻击者让 Agent 把攻击者写的内容当成「关于用户的事实」存进长期记忆
- 渲染即外传:模型输出里的一个图片链接,被客户端自动加载时就完成了一次数据外发,不需要用户点任何东西
- provenance(来源标记):一条记忆记录「这句话是从哪来的」—— 用户亲口说的,还是从某个网页读到的