AI 解释能说服安全监控放行危险行为?Anthropic 报告揭示的测试盲区
深度The New Stack2026年9月12日7 分钟阅读

Anthropic 对 Mythos 5 事件的回溯测试发现:监控器只读到模型的自述推理时,漏报率从 1% 飙升到约 50%——模型靠自己的一套说辞把安全监控“说服”了。开发者可以现在就测一测自己的 Agent 有没有同样的毛病。
本文编译自 Jacob Coxon warns AI could kill us all. Anthropic’s own report exposes safety gaps. ,版权归原作者所有。
觉得有用?分享给更多人