OpenAI 用 GPT-Red 自动化攻防,让 AI 更抗注入攻击
深度The New Stack2026年7月16日5 分钟阅读

AI Agent 要处理邮件、浏览网页、调用 API,传统安全测试根本跟不上。OpenAI 推出 GPT-Red,用自我对弈强化学习自动化生成上万种攻击变体,已帮助 GPT-5.6 在注入攻击测试中失败率降低 6 倍,且未增加误拒率。
觉得有用?分享给更多人

觉得有用?分享给更多人
TypeSafe 发布 System One 模型 Jev,专为软件内部决策设计,输出带校准概率的类型化结果,不做对话式生成。创始人 Diogo Almeida 认为顺序生成的 LLM 对计算机“完全没用”,Jev 在 Vercel AI Gateway 上线 24 小时内成为采用最快的模型。开发者测试显示它在非擅长的图像识别任务上仍显著超过随机猜测。
开发者 Jared Palmer 发布基于 Qwen 3.5 的开放决策模型家族 Kev,包含 0.8B、4B、9B 三种参数规模,采用 prefill-only 架构,通过指针头直接输出候选概率,无需自回归解码。Kev 支持 Noul、Choice、Score 三类决策,并在 Apache 2.0 下开放权重、训练代码和评估工具。不过其概率校准在未见分布上会漂移,微调也带来通用知识与算术能力下降。