弱监督下大语言模型何时能学会推理?

深度2026年4月20日33 分钟阅读
最有趣的发现是:推理忠实度(中间步骤对最终答案的逻辑支持程度)能准确预测模型在弱监督下的泛化表现,而输出多样性单独无法提供有效信息。本文适合研究大语言模型推理能力、强化学习弱监督方法以及模型泛化机制的研究人员和工程师阅读。
本文编译自 When Can LLMs Learn to Reason with Weak Supervision?,版权归原作者所有。

觉得有用?分享给更多人

获取每周 AI 工具精选

工具推荐、实战教程和生态洞察,每周更新。

相关文章

Y Combinator 支持的 Specific Labs 发布 Real-SWE 基准测试,用真实公司的私有代码库考察 AI 编程智能体,避免公开代码被训练数据污染。Claude Fable 5.1 搭配 Claude Code 以 38.8% 的成功率排名第一,但仍有超过六成的任务失败。测试中 10 个任务中有 6 个成功率低于 15%,一个分析流缩减任务在 64 次尝试中无人解决。

深度The New Stack·9月14日·4 分钟

MCP 在 2025 年快速生产化后暴露出多起安全事件,根因都指向过宽的权限范围与缺失的身份模型。文章主张把范围(scope)、身份(identity)、生命周期(lifetime)作为一次性统一评估,用动态临时凭证替代固定永久 Token,并让 Agent 拥有独立于调用者的身份。

深度The New Stack·9月12日·9 分钟

评论