MosaicLeaks:研究型Agent如何避免泄露隐私信息

深度Hugging Face2026年6月18日10 分钟阅读
MosaicLeaks:研究型Agent如何避免泄露隐私信息
ServiceNow 的研究提出了 MosaicLeaks 基准测试,用于评估深度研究型 Agent 在结合本地文档和网络检索时的隐私泄露风险。他们发现,仅提升任务表现会让泄露更严重,而一种感知隐私的强化学习方法 PA-DR 能将信息泄露率从 34.0% 降至 9.9%,同时几乎不牺牲任务成功率。
本文编译自 MosaicLeaks: Can your research agent keep a secret?,版权归原作者所有。

觉得有用?分享给更多人

获取每周 AI 工具精选

工具推荐、实战教程和生态洞察,每周更新。

相关文章

Goodfire 推出一种新型 AI 智能体监控方案,通过探针读取模型内部激活信号而非重读输出,在 Kimi K3 测试中监控约 1500 次会话仅需 51 美元,远低于传统方案的 233 至 10000 美元,同时捕获 94% 的恶意黑客会话。该技术已通过 Baseten 向客户提供,针对开源模型缺乏安全护栏的问题。

深度·10月8日·4 分钟

作者把自己的 Azure 凭证交给编程 Agent,实测了鉴权、授权、权限范围和审计覆盖的真实状态。借来的凭证让审计日志只认人不认 Agent,还悄悄继承了人累积的组权限(而标准权限检查根本看不到这些)。即使换成配置规范的服务账号,问题依然存在:数据库无法区分调用者是谁。

深度The New Stack·10月8日·12 分钟

评论