Anthropic 曝光三家中国 AI 实验室的蒸馏攻击

深度Anthropic2026年2月23日5 分钟阅读
Anthropic 曝光三家中国 AI 实验室的蒸馏攻击
Anthropic 发现 DeepSeek、Moonshot AI 和 MiniMax 通过约 2.4 万个欺诈账户,与 Claude 进行了超 1600 万次对话,以非法提取其智能体推理、工具调用和编码能力。这种大规模的蒸馏攻击绕过了区域访问限制,并可能剥离模型原有的安全护栏,带来国家安全风险。
本文编译自 Detecting and preventing distillation attacks,版权归原作者所有。

觉得有用?分享给更多人

获取每周 AI 工具精选

工具推荐、实战教程和生态洞察,每周更新。

相关文章

Anthropic 周四发布报告,指控中国 AI 公司对其 Claude 模型发起蒸馏攻击,以提取思维链用于训练自家模型。报告称共观测到近 2 亿次对话,归因于五个独立行动,规模最大的一起来自阿里,涉及 1.51 亿次对话,目标是为 Qwen 系列模型生成训练数据。另一起来自月之暗面,近 30 万次请求可能与中国军方有关。

深度·9月10日·3 分钟

GPT-Live-1 采用原生全双工架构,能边对话边把复杂请求交给后台模型(如 GPT-6 Astra 或 Luna)处理,再通过事件机制把结果融入对话。它比 GPT-Realtime-2.1 在 Full Duplex Bench 上高出 30 个百分点,定价每分钟 0.05 美元。代价是开发者要把更多语音栈的控制权交给 OpenAI。

深度The New Stack·9月10日·4 分钟

评论