DR³-Eval:面向真实可复现的深度研究评估基准
深度2026年4月18日38 分钟阅读
研究发现当前深度研究代理在检索鲁棒性和幻觉控制方面存在显著缺陷。该论文为AI研究社区、评估基准开发者和多模态系统研究者提供了重要的评估工具和方法参考。
觉得有用?分享给更多人
觉得有用?分享给更多人
Google 推出 GKE Agent Sandbox 和 Agent Substrate,承认 Kubernetes 并非为 AI Agent 设计。Sandbox 提供安全沙箱运行不可信代码,Substrate 则是一个轻量级调度层,支持大量闲置会话的复用。
Linux 基金会在六周内成立了 Tokenomics 基金会、Appia 基金会和 X402 基金会,分别聚焦 AI agent 的 token 成本标准化、安全合规验证以及无账户即时支付。x402 协议已获 AWS、Cloudflare 部署,过去 30 天处理超 7500 万笔交易。