GPT-OSS 智能体强化学习训练实战复盘
深度Hugging Face2026年1月27日5 分钟阅读

LinkedIn 团队在 Hugging Face 博客分享,他们成功解锁了 GPT-OSS 模型的智能体强化学习(Agentic RL)训练能力。实验发现,由于 GPT-OSS 的 MoE 架构特性,训练初期出现了梯度爆炸和奖励不增的问题。
觉得有用?分享给更多人

觉得有用?分享给更多人
Anthropic 用无状态的 Playground 取代了 Workbench,砍掉了保存提示词和多轮评估等功能。实测中,它一次就能导出可直接运行的代码,而 OpenAI 导出的只是会话记录。作者认为 Anthropic 没有敷衍,留下的部分确实好用。
总部位于纽约的 General Intuition 正以 60 亿美元投前估值洽谈融资,新投资者包括 Valor Equity Partners、Point72 Ventures 和 Seven Seven Six,老股东 Khosla Ventures 和 General Catalyst 也参与。公司计划将资金用于提升通用模型,重点发展机器人具身智能。