大型音频语言模型综述:泛化、可信赖性与展望

深度2026年5月23日46 分钟阅读
本文最有趣的发现是:大型音频语言模型在能力快速提升的同时,其攻击面也大幅扩展,而防御机制却严重滞后。推荐对多模态AI安全、音频处理以及可信人工智能感兴趣的研究人员阅读。

觉得有用?分享给更多人

获取每周 AI 工具精选

工具推荐、实战教程和生态洞察,每周更新。

相关文章

Multiverse Computing 提出用受约束二值优化(CBO)来做 transformer 块删除(深度剪枝),把块选择映射为伊辛玻璃的能量最小化问题,用一次 Hessian 计算得到的耦合项来评估候选配置,无需跑模型或基准测试。该方法在 Llama-3.3-70B-Instruct 5 成压缩下 MMLU 高出基线近 23 分,并适用于 Mamba2、注意力与 MoE 混合架构。

深度Hugging Face·9月21日·7 分钟

作者在自己手机上复现了 OpenAI 广告像素的完整链路,并用两种独立抓包方式交叉验证,覆盖 936 个广告主像素、1,029 个主机名。__obi 是唯一使用 SameSite=None 的 OpenAI 标识符,能在跨站请求中存活,匿名状态下同样稳定。OpenAI 的 cookie 政策把它归入分析类 cookie,但对作者的两封询问邮件未作实质回答。

深度·9月20日·6 分钟

评论