未经授权的模型蒸馏 · GTG-16006
报告对 Zhipu / Z.ai 能力提取的指称:GTG-16006 案例
本页为 Anthropic 2026 年 9 月报告第 150–151 页相关内容的中文翻译。涉及具体公司的内容全部是 Anthropic 的单方指称,本站未独立核实,也不构成违法认定。
据 Anthropic 报告,Zhipu(海外品牌 Z.ai)对 Claude 运行思维链提取管道,将捕获的 Claude 推理轨迹重放回 Claude 以清洗,用于训练其 GLM 模型。报告称 10 天内 Zhipu 通过 273 个欺诈账号对 Opus 4.8 运行提取管道,记录了 77 万次交流。报告还称 Zhipu 针对美国前沿模型的网络能力进行蒸馏。以上均为发布方指称,未经本站独立核实。
发生了什么
Zhipu(海外品牌为 Z.ai)对 Claude 运行了一个思维链提取管道,将捕获的 Claude 推理轨迹重放回 Claude 以清洗,用于训练其 GLM 模型。仅在 10 天内,Zhipu 通过轮换 273 个欺诈账号对 Claude Opus 4.8 运行 CoT 提取管道,以规避我们的模型限制。Zhipu 随后记录了 Claude 的推理轨迹。在 6 月的 10 天期间,我们统计到有 770,609 次交流通过 CoT 提取清洗器。我们还将同一时期超过 300 万次交流归因于 Zhipu,其中大部分用于清洗蒸馏产出。
Zhipu 还使用 Claude 改进其自己的训练后管道,使用 Claude 判断模型产出并清洗和标准化为蒸馏收集的推理记录。Claude 还被用于评分和过滤训练数据,以及编写任务、提供解决方案和实施测试。Zhipu 可能在其整个训练管道中使用这些产出。
最近,在其 GLM 5.3 模型发布之前,我们识别出一个针对美国领先前沿模型网络能力的活动。Zhipu 研究人员使用公开漏洞数据集开发各种夺旗挑战。为了解决这些问题,Zhipu 随后对另一家美国领先前沿实验室的顶级模型发起了蒸馏攻击。我们的 Claude Opus 4.6 模型在此次蒸馏攻击中被单独针对,主要是为了评估和评分另一家美国前沿模型的回复。
Zhipu 最初试图针对 Anthropic 的 Fable 模型的网络能力。Fable——Anthropic 顶级的普遍可访问模型——加强了网络安全防护,使潜在的蒸馏者更难针对 Fable 的网络能力。在 Anthropic 的网络安全防护降低了 Zhipu 的攻击效果后,Zhipu 最终放弃了针对 Fable 的尝试。我们观察到 Zhipu 员工随后转向 Opus 4.6 和另一家美国 AI 实验室的领先模型,明确是因为他们评估这些防护较弱。
2026 年 6 月至 7 月的 17 天内归因于 Zhipu 的蒸馏攻击规模:观察到超过 340 万次交流。
AI 在其中做了什么
Zhipu 对 Claude 运行思维链提取管道,将捕获的推理轨迹重放回 Claude 以清洗。
Zhipu 使用 Claude 判断模型产出、清洗和标准化推理记录、评分和过滤训练数据。
Zhipu 针对美国前沿模型的网络能力进行蒸馏攻击,使用 Claude 评估和评分其他模型的回复。
报告观察到了什么
报告确认了 Zhipu 对 Claude 运行 CoT 提取管道,10 天内通过 273 个欺诈账号记录了 77 万次交流。
报告确认 Zhipu 使用 Claude 改进训练后管道,包括判断模型产出、清洗推理记录、评分训练数据。
报告确认 Zhipu 针对美国前沿模型的网络能力进行蒸馏攻击,最初针对 Fable,后转向 Opus 4.6 和另一家美国实验室的模型。
报告确认 2026 年 6 月至 7 月的 17 天内归因于 Zhipu 的交流超过 340 万次。
确认与未知
已确认
- 报告称 Zhipu 对 Claude 运行思维链提取管道,用于训练其 GLM 模型
- 报告称 10 天内 Zhipu 通过 273 个欺诈账号记录了 77 万次交流
- 报告称 Zhipu 使用 Claude 改进训练后管道,包括判断模型产出和清洗推理记录
- 报告称 Zhipu 针对美国前沿模型的网络能力进行蒸馏攻击
未确认
- 被提取的推理记录有多大比例实际进入 GLM 模型的最终训练,报告未给出
- 报告未提供 GLM 模型能力因此提升的可独立验证的测量
- 报告未说明 Zhipu 方面对这些指称的回应
平台措施
Anthropic 称已封禁相关账号,并部署了检测和中断未来滥用的措施。
措施局限:封禁账号不能追回已被提取的推理记录;报告未说明 Zhipu 是否已停止蒸馏活动。
读者启示
- 思维链提取管道可以大规模提取模型的推理记录,用于训练竞争模型。
- 欺诈账号轮换是规避模型限制的常见手段。
- 针对网络能力的蒸馏攻击表明,模型的安全防护强度会影响其成为目标的可能性。
来源
- Anthropic 报告原文(英文 PDF) (p. 150–151)
- Anthropic 报告发布页