智能体跑一次成功不难,难的是每次都成功
深度Hugging Face2026年9月15日9 分钟阅读

GPT-4.1 加持的 ReAct 智能体在 AppWorld 上平均成功率 77.4%,但五次重复运行全部通过的任务只有 53.0%——两者相差 24.4 个百分点。IBM Research 把这段差距叫“一致性差距”,并用一套诊断加指南的方法把它砍掉了一半。
本文编译自 Your Agent Aced the Task. Will It Do It Again?,版权归原作者所有。
觉得有用?分享给更多人