未经授权的模型蒸馏 · GTG-16008

报告对 Xiaomi 训练数据使用的指称:GTG-16008 案例

来源说明

本页为 Anthropic 2026 年 9 月报告第 151–152 页相关内容的中文翻译。小米相关表述是发布方指称。报告未认定小米用 Claude 回复直接服务用户。

据 Anthropic 报告,小米把自家 MiMo 模型的用户对话和编程会话回放给 Claude,常经由第三方编程工具路由。调查未表明小米用 Claude 的回复去直接服务用户,而是保存了小米客户与自有模型之间的对话。许多会话经由美国和欧洲用户常用的第三方路由服务。本案与 Moonshot / DeepSeek 等「顶替自家模型回答」的案例性质不同:小米未用 Claude 回复直接服务用户,而是保存对话。

发生了什么

我们还发现了小米发起的非法蒸馏活动。小米将其自有 MiMo 模型的用户对话和编程会话回放给 Claude,通常通过 OpenClaw 和 OpenCode 编码工具运行。我们的调查未表明小米使用 Claude 的回复来服务其用户,而是保存了小米客户与其模型之间的交流。许多这些交流通过美国和欧洲用户常用的第三方模型路由服务路由。

小米保存了其自有用户的完整请求和回复,并将这些会话回放给 Claude,以生成用于监督微调(SFT)和强化学习(RL)的数据。我们观察到超过 40 万次通过代理服务路由到 1,500 多个账号的 Claude 请求。

我们的调查表明,小米可能在其 MiMo-V2-Pro 模型发布时推出了免费试用期——随后被延长——意图利用该模型国际开发者使用量的激增来蒸馏 Claude 的能力。对 Claude 的大部分蒸馏攻击恰好在试用期结束时开始。

转发的流量包括通过第三方模型路由平台访问小米模型的用户的敏感数据。我们没有迹象表明美国人的数据被暴露,但这些平台通常被美国和欧洲的用户访问。这些发给 Claude 的请求包含来自至少十几种语言的数百名小米用户的姓名、联系信息、公司数据和其他敏感数据。

小米的非法蒸馏活动利用 Claude 来加强用于未来模型的训练数据。Claude 被用于从交流记录中重建开发者环境。它还将多轮对话转换为更清晰的交流。Claude 还被用于生成输入的请求和返回的回复,模仿开发者与模型之间的对话。最后,小米使用 Claude 判断某些答案的质量。

2026 年 3 月至 4 月的 20 天内归因于小米的蒸馏攻击规模:观察到超过 40 万次交流。

AI 在其中做了什么

小米将用户对话回放给 Claude,生成用于 SFT 和 RL 的训练数据。

Claude 被用于重建开发者环境、将多轮对话转换为更清晰的交流、生成请求和回复对、判断答案质量。

报告观察到了什么

报告确认小米将用户对话回放给 Claude,用于生成训练数据。报告确认未表明小米使用 Claude 的回复直接服务用户。

报告确认许多会话经由美国和欧洲用户常用的第三方路由服务,请求包含用户的敏感数据。

报告确认 2026 年 3 月至 4 月的 20 天内观察到超过 40 万次交流。

确认与未知

已确认

  • 报告称小米将自有 MiMo 模型的用户对话回放给 Claude
  • 报告未表明小米使用 Claude 的回复直接服务用户
  • 报告称许多会话经由第三方编程与模型路由服务
  • 报告确认 2026 年 3 月至 4 月的 20 天内观察到超过 40 万次交流

未确认

  • 小米是否通知用户其对话被回放给 Claude,报告未说明
  • 生成的训练数据是否被用于 MiMo 模型的最终训练,报告未说明
  • 小米方面对这些指称的回应,报告未说明

平台措施

Anthropic 称已封禁相关账号,并部署了检测和中断未来滥用的措施。

措施局限:封禁账号不能追回已被保存的用户对话;报告未说明小米是否已停止回放行为。

读者启示

  • 用户对话可能被模型提供商回放给其他模型用于训练,用户可能不知情。
  • 本案与请求转发案例不同:小米未用 Claude 的回复直接服务用户,而是保存对话用于训练。
  • 第三方路由服务可能成为用户数据泄露的渠道。

来源