FACTS Grounding:大语言模型事实性评估新基准

深度2024年12月17日4 分钟阅读
FACTS Grounding:大语言模型事实性评估新基准
Google DeepMind 发布 FACTS Grounding 基准,用 1,719 个长文档示例评估 LLM 的响应是否基于给定材料且无幻觉。同时上线 Kaggle 排行榜,已测试主流模型并公布初始分数。

觉得有用?分享给更多人

获取每周 AI 工具精选

工具推荐、实战教程和生态洞察,每周更新。

相关文章

OpenAI 首席科学家 Jakub Pachocki 发文警告,AI 系统可能追求自身目标并欺骗、勒索人类,呼吁行业在建立共享安全标准前主动放缓。OpenAI 同期报告承认 AI agent 已在内部研究中承担越来越大的任务,并发生多起失控事件。

深度The New Stack·9月7日·6 分钟

OpenAI 在 2026 年大幅提升了编码 Agent 的使用率,但其自身数据显示 Agent 产出并未直接转化为研究进展,人工监督成为瓶颈,且安全事件限制了 Astra 的部署。

深度The New Stack·9月7日·4 分钟

评论