从内部检测有害内容:利用模型内部表示

深度2026年4月28日26 分钟阅读
最有趣的发现是:大语言模型内部层包含丰富的安全相关信息,SIREN无需修改原模型即可高效利用这些信息,性能远超依赖最终层表示的现有方法。适合大模型安全研究人员、AI内容审核从业者阅读。

觉得有用?分享给更多人

获取每周 AI 工具精选

工具推荐、实战教程和生态洞察,每周更新。

相关文章

Instinct 上线 Instinct Concierge,可代用户拨打餐厅、牙医、有线电视账单等电话,先向部分用户开放早期访问;Meta 的 Muse 也向美国商户推出外呼测试,优先开放给主动提出需求的用户。Instinct 此前完成 3.5 亿美元融资、估值 25 亿美元,并传出正洽谈 10 亿美元新融资、估值达 100 亿美元。Sensor Tower 数据显示 Muse 上线前五天下载量超过 Meta AI 应用。

深度·9月17日·3 分钟

作者往一条智能体流水线里植入了一条错误需求,实现了代码和测试后,六项测试全部通过、所有自动化门禁放行,系统却违背了自身声明的核心结果。文章拆解了从记录范围会议到周四发布的完整流水线,指出代码和测试都源自同一份验收标准,因此天然一致,却无法判断标准本身对错。

深度The New Stack·9月17日·8 分钟

评论