语言模型智能体探索与利用误差的可测量方法

深度2026年4月14日19 分钟阅读
研究发现,即使最先进的语言模型在探索与利用任务中也存在明显缺陷,不同模型展现出不同的失败模式。这项研究为AI研究人员和语言模型开发者提供了量化评估智能体决策能力的新方法,对推进AI编码、具身AI等应用具有重要意义。

觉得有用?分享给更多人

获取每周 AI 工具精选

工具推荐、实战教程和生态洞察,每周更新。

相关文章

Google 推出 GKE Agent Sandbox 和 Agent Substrate,承认 Kubernetes 并非为 AI Agent 设计。Sandbox 提供安全沙箱运行不可信代码,Substrate 则是一个轻量级调度层,支持大量闲置会话的复用。

深度The New Stack·7月15日·7 分钟

Linux 基金会在六周内成立了 Tokenomics 基金会、Appia 基金会和 X402 基金会,分别聚焦 AI agent 的 token 成本标准化、安全合规验证以及无账户即时支付。x402 协议已获 AWS、Cloudflare 部署,过去 30 天处理超 7500 万笔交易。

深度The New Stack·7月15日·5 分钟

评论