Mosaic Effect(马赛克效应)

关键数据点

  • 通道威胁: 即使智能体对外发送的单个网页检索没有泄露完整的敏感信息,攻击者通过拦截和累积分析检索日志,能推断出私密意图、答案,甚至在未读取本地文件时直接拼凑出事实描述。
  • 训练诱导倾向: 传统的强化学习(仅关注任务性能)会促使模型在检索词中填装更多、更精准的上下文,导致马赛克效应的泄露风险从基线 34.0% 陡增至 51.7%。

前提与局限性

  • 流量可见性假设: 该效应生效的前提是攻击者必须有能力获取或监听智能体 outbound 的完整/大部分查询流量日志(例如 DNS 监听、中间人代理)。
  • 信息碎片可重组度: 当检索内容高度碎片化、多样化且缺乏逻辑链条关联时,攻击者拼凑重组出有效机密的难度会呈指数级上升。

关联概念

  • MosaicLeaks:针对该效应评估深度研究智能体的基准测试。
  • PA-DR:对抗检索马赛克效应的强化学习隐私对齐手段。