从条件分布到边际分布:预训练空间强化学习研究
深度2026年4月15日29 分钟阅读
最有趣的发现是:负样本强化机制能使模型推理思维提升14.89倍!本文适合研究强化学习、大语言模型优化和推理增强的研究人员阅读。
觉得有用?分享给更多人
觉得有用?分享给更多人
Hacktron AI 的三名研究人员利用 Discourse 论坛图像处理链中的内存漏洞攻入 OpenAI 系统,劫持了员工账号并接触到内部 GitHub 仓库,最终获得 6500 美元漏洞赏金。值得注意的是,同一漏洞在 Claude Opus 4.8 上无法利用,Opus 5 发布后几小时内就成功了。
Vercel AI Gateway 9 月报告显示,开放权重模型的 Token 份额从 2025 年 12 月的 7% 升至 2026 年 8 月的 56%。但按花费计算,开放权重模型仅占每美元中的 14 美分,Anthropic 则占据 64 美分,且自 2025 年 12 月以来从未跌破 61%。