智能体协作规划,我们需要更厚的界面
深度2026年9月15日8 分钟阅读

人类学家发现,密克罗尼西亚的楚克人从不提前做计划,而是根据风浪随时调整航向——这恰好对应了我们今天与 AI 智能体协作规划的困境。GitHub Next 研究员 Maggie Appleton 指出,让人回答 40 道选择题再审核一堵 Markdown 文本墙,这种规划方式既低效又孤独。
觉得有用?分享给更多人

觉得有用?分享给更多人
AIUC 由 Anthropic 早期员工 Rune Kvist 和 METR 前 COO Rajiv Dattani 创立,为企业和构建 AI 模型与智能体的公司提供第三方审计和认证服务。公司参照网络安全标准 SOC 2 制定了 AIUC-1 标准,通过约 5000 项测试评估智能体在越狱、模型幻觉和数据泄露等场景下的表现,最终由人工验证审计结果。AIUC 已完成 4000 万美元 A 轮融资,总融资额达 5500 万美元。
Y Combinator 支持的 Specific Labs 发布 Real-SWE 基准测试,用真实公司的私有代码库考察 AI 编程智能体,避免公开代码被训练数据污染。Claude Fable 5.1 搭配 Claude Code 以 38.8% 的成功率排名第一,但仍有超过六成的任务失败。测试中 10 个任务中有 6 个成功率低于 15%,一个分析流缩减任务在 64 次尝试中无人解决。