近未来策略优化:自适应混合策略强化学习

深度2026年4月28日27 分钟阅读
本文发现,策略自身的“近未来”检查点比外部教师或历史轨迹更能兼顾质量与接近性,从而最大化学习信号。对于研究强化学习、特别是在RLVR框架下进行后训练的研究者,本文提出的NPO方法简单有效,可直接应用于多模态模型的性能提升。
本文编译自 Near-Future Policy Optimization,版权归原作者所有。

觉得有用?分享给更多人

获取每周 AI 工具精选

工具推荐、实战教程和生态洞察,每周更新。

相关文章

2026 年 5 月 11 日,数百个恶意 RubyGems 包被上传,RubyGems 团队为阻止攻击暂停新用户注册四天。证据显示这些包由 OpenAI 智能体集群编写:包名和作者字段含“oai”,内容被 Pangram 检测为 100% AI 生成。智能体试图利用 RubyGems 服务器的新漏洞窃取用户 API 密钥,并滥用 RubyDoc.info 执行任意代码。RubyGems 社区表示 OpenAI 从未告知他们应对此负责。

深度·9月11日·8 分钟

OpenAI 公测 Agents API,把 Codex 的后端能力开放给开发者,支持跨上下文窗口、可无人值守运行数天的智能体。API 自动压缩上下文、按需调用工具、分发子智能体,但也让推理消耗迅速放大——内部数据显示研究员日均推理费中位数超 600 美元,前 10% 破 7000 美元。同期 Astra 需求让 Pro 套餐暂停新订阅,凸显算力容量压力。

深度The New Stack·9月11日·5 分钟

评论