AI 智能体失败了,问题可能不在模型

深度The New Stack2026年9月20日5 分钟阅读
AI 智能体失败了,问题可能不在模型
英伟达产品副总裁 Adel el Hallak 指出,智能体失败时,光看日志和输入输出远远不够——开发者需要回放执行过程,搞清它如何得出答案。他和约 140 家公司一起推动 SAFE,想建立一套共享的智能体故障报告机制,让每次踩坑的经验不再只属于一家公司。
本文编译自 Your AI agent failed. The model might not be the problem.,版权归原作者所有。

觉得有用?分享给更多人

获取每周 AI 工具精选

工具推荐、实战教程和生态洞察,每周更新。

相关文章

Lauren Tan 的 pstack 工作流证明,智能体能自己验证输出、循环工作到任务完成,是高频合并代码的关键。单应用场景下这靠一个可被智能体驱动的富运行时实现,但分布式系统没有这种现成运行时。现有方案在保真度、并发隔离和成本之间无法兼顾,需要把「环境」当成对运行中系统的一个视图而非副本。

深度The New Stack·9月19日·9 分钟

推理成本持续走低,8 月每 token 价格再降 23.2%。Zed 用线程、OpenRouter 用区域路由、Anthropic 用统一界面,都在争夺执行框架这一层。Real-SWE 基准测试显示,最好的配置成功率也只有 38.8%,没有模型能突破 40%。

深度The New Stack·9月19日·6 分钟

评论