协同进化策略蒸馏:统一文本、图像与视频推理
深度2026年5月5日22 分钟阅读
本文发现混合强化学习会因能力间冲突导致性能下降,而先训练专家再蒸馏则因师生行为模式差异而难以充分吸收专家能力。CoPD通过专家并行训练与双向在线蒸馏实现了多模型能力的无缝融合,值得关注后训练扩展的研究者阅读。
本文编译自 Co-Evolving Policy Distillation,版权归原作者所有。
觉得有用?分享给更多人
觉得有用?分享给更多人
Anthropic 回应了用户对 Claude 文本水印的质疑,解释水印基于低风险词汇选择,不影响输出质量,轻编辑不易去除,完整重写可去除,且对代码影响极小。
Flue 2 是首个稳定版本,以 React 风格的 Agent Hooks 为基础,内置 16 个 hooks,让智能体在运行时动态调整配置。Schott 强调智能体必须有内置的执行框架,并与 Vercel 的 eve 形成直接竞争。