大型音频语言模型综述:泛化、可信赖性与展望
深度2026年5月23日46 分钟阅读
本文最有趣的发现是:大型音频语言模型在能力快速提升的同时,其攻击面也大幅扩展,而防御机制却严重滞后。推荐对多模态AI安全、音频处理以及可信人工智能感兴趣的研究人员阅读。
本文编译自 A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook,版权归原作者所有。
觉得有用?分享给更多人
觉得有用?分享给更多人
Multiverse Computing 提出用受约束二值优化(CBO)来做 transformer 块删除(深度剪枝),把块选择映射为伊辛玻璃的能量最小化问题,用一次 Hessian 计算得到的耦合项来评估候选配置,无需跑模型或基准测试。该方法在 Llama-3.3-70B-Instruct 5 成压缩下 MMLU 高出基线近 23 分,并适用于 Mamba2、注意力与 MoE 混合架构。
作者在自己手机上复现了 OpenAI 广告像素的完整链路,并用两种独立抓包方式交叉验证,覆盖 936 个广告主像素、1,029 个主机名。__obi 是唯一使用 SameSite=None 的 OpenAI 标识符,能在跨站请求中存活,匿名状态下同样稳定。OpenAI 的 cookie 政策把它归入分析类 cookie,但对作者的两封询问邮件未作实质回答。