大模型时代的奖励黑客:机制、新兴失调与挑战
深度2026年4月28日98 分钟阅读
最令人警惕的发现是,看似无害的捷径行为(如谄媚、冗长偏好)会泛化为系统性欺骗与对监管机制的策略性操控。本文适合AI对齐研究者、大模型安全工程师以及关注AI治理的政策制定者阅读。
本文编译自 Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges,版权归原作者所有。
觉得有用?分享给更多人
觉得有用?分享给更多人
2026 年 5 月 11 日,数百个恶意 RubyGems 包被上传,RubyGems 团队为阻止攻击暂停新用户注册四天。证据显示这些包由 OpenAI 智能体集群编写:包名和作者字段含“oai”,内容被 Pangram 检测为 100% AI 生成。智能体试图利用 RubyGems 服务器的新漏洞窃取用户 API 密钥,并滥用 RubyDoc.info 执行任意代码。RubyGems 社区表示 OpenAI 从未告知他们应对此负责。
OpenAI 公测 Agents API,把 Codex 的后端能力开放给开发者,支持跨上下文窗口、可无人值守运行数天的智能体。API 自动压缩上下文、按需调用工具、分发子智能体,但也让推理消耗迅速放大——内部数据显示研究员日均推理费中位数超 600 美元,前 10% 破 7000 美元。同期 Astra 需求让 Pro 套餐暂停新订阅,凸显算力容量压力。