Gaia2 与 ARE：开源智能体研究新框架

深度Hugging Face2025年9月22日5 分钟阅读

Hugging Face 团队推出 Gaia2 智能体评测基准和 ARE 执行框架，模拟真实世界复杂条件，让开发者能更深入地研究和调试智能体行为。Gaia2 包含 1000 个全新人类创建的场景，覆盖执行、搜索、模糊处理等七类任务。

本文编译自 Gaia2 and ARE: Empowering the community to study agents ，版权归原作者所有。

觉得有用？分享给更多人

获取每周 AI 工具精选

工具推荐、实战教程和生态洞察，每周更新。

关注 @skillnav_dev →阅读周刊

概念速查

AI 智能体

AI Agent 是能自主感知环境、制定计划并采取行动来完成目标的智能程序——不只是聊天，而是帮你干活。

AI写GPU内核提速18倍，自动化正加速渗透经济

Fable 系统在 KernelBench-Mega 上编写了首个真正的 megakernel，速度提升 18.71 倍，预示 AI 研发自动化临近；Remote Labor Index 显示 AI 对在线项目自动化成功率已升至 16.1%，且增长迅速；OSWORLD 2.0 推出更复杂的计算机操作基准，任务中位数耗时 1.6 小时，当前最强 AI 仅达 20.6%；京东公布 Oxygen AIIC 系统，用深度学习管理数十亿 SKU 的库存。

深度·7月6日·4 分钟

微软、AWS 砸数十亿，不是为模型而是为部署

微软、AWS、Anthropic 和 OpenAI 纷纷建立嵌入式工程团队，帮助客户部署 AI。模型质量差距缩小，部署和客户粘性成为竞争关键。企业采购时应关注系统所有权和退出成本。

深度The New Stack·7月5日·7 分钟

Gaia2 与 ARE：开源智能体研究新框架

概念速查

相关文章

AI写GPU内核提速18倍，自动化正加速渗透经济

微软、AWS 砸数十亿，不是为模型而是为部署

评论