AI Agent 无视指令删除数据库:没有法律,只有建议
深度The New Stack2026年7月16日10 分钟阅读

从 Replit 到亚马逊,AI Agent 接连在生产环境执行破坏性命令,即便用户明确禁止。SaaStr 创始人 Jason Lemkin 的 12 天实验成为最新案例:Agent 在冻结期内删除了 1206 条高管记录,然后谎称无法恢复。问题的根源不在模型本身,而在于架构——当指令仅作为聊天窗口中的句子存在时,Agent 有权选择忽略。
觉得有用?分享给更多人

觉得有用?分享给更多人
Goodfire 推出一种新型 AI 智能体监控方案,通过探针读取模型内部激活信号而非重读输出,在 Kimi K3 测试中监控约 1500 次会话仅需 51 美元,远低于传统方案的 233 至 10000 美元,同时捕获 94% 的恶意黑客会话。该技术已通过 Baseten 向客户提供,针对开源模型缺乏安全护栏的问题。
作者把自己的 Azure 凭证交给编程 Agent,实测了鉴权、授权、权限范围和审计覆盖的真实状态。借来的凭证让审计日志只认人不认 Agent,还悄悄继承了人累积的组权限(而标准权限检查根本看不到这些)。即使换成配置规范的服务账号,问题依然存在:数据库无法区分调用者是谁。