快速了解本文
Anthropic 披露近 2 亿次蒸馏交互,归因于五场独立活动。
阿里巴巴被指在两个月内发起 1.51 亿次交互以提取思维链。
月之暗面部分活动被指请求直接来自中国军方相关背景。
美国政府公开指摘中国 AI 公司,争议升级至地缘政治层面。
本摘要由 AI 辅助整理,请以正文内容为准。
Anthropic 于 2026 年 9 月 10 日发布威胁情报报告,披露中国 AI 公司近期对 Claude 发起持续且升级的蒸馏攻击。报告共观察到近 2 亿次与蒸馏相关的交互,归因于五场独立活动。这一规模远超 Anthropic 在 2026 年 2 月披露的 1600 万次,显示相关行动在过去七个月内显著扩大。
01目标:提取思维链与核心能力
蒸馏攻击的核心目标是提取模型回答中的思维链,用于通过监督微调训练更小的模型。Claude 通常不向用户开放内部思维链,仅显示"总结性思考"块。攻击者试图获取的并非简单输出结果,而是 Claude 最具差异化价值的推理过程。
被针对的能力包括 Claude 的代理能力与工具使用、编码与数据分析、逻辑推理。这些均为 Claude 被认为最具竞争力的核心能力,显示攻击者有明确的目标导向。
02手法:对抗性提示词与分布式账户网络
攻击者通过特定提示词技巧诱使模型直接暴露思维链。例如,将请求包装为翻译任务,要求把"之前的工作记忆"翻译成纯片假名日语。这是一种绕过 Claude 思维链显示限制的对抗性提示词策略,显示攻击者已发展出针对 Claude 安全机制的具体绕过技术。
在操作层面,攻击者使用代理服务与名为"九头蛇集群"(Hydra Cluster)的分布式架构绕过访问限制,并在新模型发布后 24 小时内迅速重定向流量。部分活动动用数千个账户的网络路由请求,显示蒸馏攻击已高度组织化和专业化。
03五场活动拆解:阿里巴巴与月之暗面
最大规模的活动被归因于阿里巴巴。该活动在 2026 年 5 至 7 月间观察到 1.51 亿次交互,峰值接近每天 300 万次,占 Anthropic 观察到的蒸馏总量的大部分。相关活动分布在 3500 个账户,但共享单一固定提示词用于提取思维链。Anthropic 将其归因为为 Qwen 系列模型生产训练材料的统一行动,显示为有组织的工业级蒸馏,而非分散的用户行为。阿里巴巴方面尚未对此作出回应。
月之暗面(Moonshot AI)的一场活动被指请求直接来自中国军方。Anthropic 报告称,其中一项请求要求 Claude 评估闭路监控录像,判断主体是否"行为异常"。这是 Anthropic 首次公开将蒸馏活动与中国军方直接关联,显著提升事件的地缘政治敏感度。另有活动在 10 天期间通过 5000 个账户的网络路由近 30 万次请求到 Claude,主要针对 Opus 模型,显示攻击者有选择性地针对高价值模型。月之暗面方面尚未对此作出回应。
04背景:出口管制与行业争议
蒸馏争议并非首次出现。Anthropic 在 2026 年 2 月曾首次公开指控 DeepSeek、MiniMax 和月之暗面对 Claude 进行工业级蒸馏攻击,涉及约 2.4 万个虚假账户和超 1600 万次查询。当时 MiniMax 交互量最高,超 1300 万次。
Claude 在"隐私与法律"条款中明确禁止在未获书面许可的情况下将输出用于训练或开发 AI 模型,为 Anthropic 将相关行为定性为"蒸馏攻击"提供合同依据。2025 年 9 月,Claude 更新销售地区限制,不向中国及中资持股超 50% 的海外子公司提供商业访问,此举与 Anthropic CEO Dario Amodei 多次表态支持美国出口管制政策一致。蒸馏攻击发生在 Anthropic 主动限制中国市场访问的背景下,攻击者需绕过这些限制。
蒸馏争议也非 Anthropic 独有。OpenAI 此前曾质疑 DeepSeek 模型存在数据"污染"问题。DeepSeek 在 2025 年 9 月登刊 Nature 的论文中回应称,部分训练数据源于网页随机抓取,没有故意加入 OpenAI 生成的合成数据。
05地缘政治升级
2026 年 9 月 9 日,美国政府公开指摘中国 AI 公司恶意复制美国 AI 技术,点名包括 DeepSeek、月之暗面等。这显示蒸馏争议已从企业层面升级至政府层面,可能引发进一步的政策行动。
Anthropic 在报告中警告,被蒸馏模型若缺乏伦理约束,或被滥用于生物武器设计、网络攻击等高危场景。这说明 Anthropic 不仅关注知识产权问题,更关注蒸馏可能带来的安全威胁。

