顶级编程智能体失败率超60%:私有代码库基准测试解析

深度The New Stack2026年9月14日4 分钟阅读
顶级编程智能体失败率超60%:私有代码库基准测试解析
Real-SWE 基准测试把 AI 编程智能体扔进真实公司的私有代码库,结果最强者成功率仅 38.8%。测试还发现,不同模型在个别任务上表现两极分化,没有一个智能体能稳定可靠地完成任务。

觉得有用?分享给更多人

获取每周 AI 工具精选

工具推荐、实战教程和生态洞察,每周更新。

相关文章

MCP 在 2025 年快速生产化后暴露出多起安全事件,根因都指向过宽的权限范围与缺失的身份模型。文章主张把范围(scope)、身份(identity)、生命周期(lifetime)作为一次性统一评估,用动态临时凭证替代固定永久 Token,并让 Agent 拥有独立于调用者的身份。

深度The New Stack·9月12日·9 分钟

Anthropic 的 AI 原生 SDLC 手册把基础打对了,但忽略了组织流程其实是随变更风险而变的一套流程家族。规范驱动工具(Kiro、Spec Kit)各自绑定一套固定阶段,团队遇到不匹配的变更就会绕开,导致真实流程不可见。作者主张把流程定义为状态机:规则以数据形式存储、按变更风险分类路由、门禁由执行框架(Harness)强制执行,证据必须来自智能体无法写入的外部系统。

深度The New Stack·9月12日·8 分钟

评论