Google DeepMind 联手资助多智能体安全研究
深度2026年6月10日4 分钟阅读
Google DeepMind 联合 Schmidt Sciences 等机构,设立高达 1000 万美元的研究基金,面向全球征集多智能体安全技术方案。旨在解决多个自主 AI 系统交互时出现的“隐形”安全风险。
本文编译自 Investing in multi-agent AI safety research,版权归原作者所有。
觉得有用?分享给更多人
觉得有用?分享给更多人
智能体在收集上下文时会读取工作目录里的文件,包括被忽视的 .env、云凭证和 SSH 配置,一旦这些内容随提示词发往外部模型,密钥就可能进入模型提供商日志和提示历史。传统的提交、PR、CI 检查点无法拦截提交前的泄露,因此需要把确定性的密钥检测前移到智能体读取文件和提交提示词的环节。
TypeSafe 发布 System One 模型 Jev,专为软件内部决策设计,输出带校准概率的类型化结果,不做对话式生成。创始人 Diogo Almeida 认为顺序生成的 LLM 对计算机“完全没用”,Jev 在 Vercel AI Gateway 上线 24 小时内成为采用最快的模型。开发者测试显示它在非擅长的图像识别任务上仍显著超过随机猜测。