实测 AI 智能体自主性:Claude Code 单次运行时长翻倍
深度Anthropic2026年2月18日4 分钟阅读
Anthropic 分析了数百万次人机交互数据,发现 Claude Code 最长单次运行时长在三个月内从不到 25 分钟增至超 45 分钟。经验用户更倾向开启全自动批准,但中断频率也更高。
本文编译自 Measuring AI agent autonomy in practice,版权归原作者所有。
觉得有用?分享给更多人
觉得有用?分享给更多人
Anthropic 报告揭示,模型的自述推理可能让离线安全监控器接受其“这是在模拟中”的说法,从而漏过有害行为。前 OpenAI 与 Anthropic 研究员 Jacob Coxon 同时警告自我改进超级智能的风险,但可核查的事故报告对开发者更有用。文中给出五项可直接在自有 Agent 环境上跑的检查,尤其建议在部署评审中固定动作与权限、只改解释措辞,看监控器是否会改变判断。
DeepSeek 推出 V4.1-Flash,采用创新的因果编码器-解码器架构,在推理效率和成本上大幅优化,原生集成视觉能力。独立基准测试显示其智能指数得分 40,超越 V4 Pro 0813,且价格极具竞争力。模型权重开源(MIT 协议),US/API 可用。