从内部检测有害内容:利用模型内部表示
深度2026年4月28日26 分钟阅读
最有趣的发现是:大语言模型内部层包含丰富的安全相关信息,SIREN无需修改原模型即可高效利用这些信息,性能远超依赖最终层表示的现有方法。适合大模型安全研究人员、AI内容审核从业者阅读。
觉得有用?分享给更多人
觉得有用?分享给更多人
Instinct 上线 Instinct Concierge,可代用户拨打餐厅、牙医、有线电视账单等电话,先向部分用户开放早期访问;Meta 的 Muse 也向美国商户推出外呼测试,优先开放给主动提出需求的用户。Instinct 此前完成 3.5 亿美元融资、估值 25 亿美元,并传出正洽谈 10 亿美元新融资、估值达 100 亿美元。Sensor Tower 数据显示 Muse 上线前五天下载量超过 Meta AI 应用。
作者往一条智能体流水线里植入了一条错误需求,实现了代码和测试后,六项测试全部通过、所有自动化门禁放行,系统却违背了自身声明的核心结果。文章拆解了从记录范围会议到周四发布的完整流水线,指出代码和测试都源自同一份验收标准,因此天然一致,却无法判断标准本身对错。