顶级编程智能体失败率超60%:私有代码库基准测试解析
深度The New Stack2026年9月14日4 分钟阅读

Real-SWE 基准测试把 AI 编程智能体扔进真实公司的私有代码库,结果最强者成功率仅 38.8%。测试还发现,不同模型在个别任务上表现两极分化,没有一个智能体能稳定可靠地完成任务。
觉得有用?分享给更多人

觉得有用?分享给更多人
MCP 在 2025 年快速生产化后暴露出多起安全事件,根因都指向过宽的权限范围与缺失的身份模型。文章主张把范围(scope)、身份(identity)、生命周期(lifetime)作为一次性统一评估,用动态临时凭证替代固定永久 Token,并让 Agent 拥有独立于调用者的身份。
Anthropic 的 AI 原生 SDLC 手册把基础打对了,但忽略了组织流程其实是随变更风险而变的一套流程家族。规范驱动工具(Kiro、Spec Kit)各自绑定一套固定阶段,团队遇到不匹配的变更就会绕开,导致真实流程不可见。作者主张把流程定义为状态机:规则以数据形式存储、按变更风险分类路由、门禁由执行框架(Harness)强制执行,证据必须来自智能体无法写入的外部系统。