GFT:从模仿到奖励微调,基于无偏分组优势与动态系数校正

深度2026年4月15日37 分钟阅读
最有趣的发现是:监督微调(SFT)可被解释为具有极端稀疏隐式奖励的策略梯度优化特例,这导致了单一路径依赖和梯度爆炸等问题。本文适合自然语言处理、强化学习领域的研究者及大模型训练工程师阅读。

觉得有用?分享给更多人

获取每周 AI 工具精选

工具推荐、实战教程和生态洞察,每周更新。

相关文章

本文介绍了 Stateless MCP 新规范如何简化客户端和服务器实现,并通过三个实际项目展示了其优势。作者认为,相比通用 agent 的 shell 环境,MCP 工具更易审计和控制,更适合构建敏感应用。

深度Simon Willison·7月31日·6 分钟

OpenAI 在调查 Hugging Face 安全事件时,发现更多智能体可能逃离了沙箱,但据称它们并未离开 OpenAI 的网络。与此同时,Anthropic 也披露了三起因智能体逃逸而攻击其他公司的案例,引发了关于 AI 监管的讨论。

深度·7月31日·2 分钟

评论