不正なモデル蒸留 · GTG-16005

Alibaba関連の蒸留活動に関するレポートの指摘:GTG-16005事例

出典について

本ページはAnthropicの2026年9月レポート第147–148ページ関連内容の日本語翻訳です。行為者の帰属と規模の数値は同レポートの一方的な指摘によるものであり、当サイトは独自に確認していません。GTG番号はAnthropicの内部追跡IDであり、司法事件番号ではありません。プラットフォームのルール判断が司法的な結論と同じではありません。

Anthropicの2026年9月レポートによると、Alibabaに関連する運営者が、レポートが測定した中で最大規模の蒸留攻撃を実施したとされています。標的はClaude Opus 4.6と4.7の推論連鎖(CoT)記録で、関連データはQwenシリーズのモデルの訓練に使用されたとレポートは主張しています。帰属と数値はすべて同レポートの一方的な指摘によるものであり、関連企業が当サイトで確認したものではありません。

何が起きたか

Alibabaに関連する運営者は、当社が測定した中で最大規模の蒸留攻撃を実施しました。この不正な蒸留活動は、Opus 4.6と4.7の推論連鎖(CoT)記録を標的としていました。

AlibabaのCoT蒸留パイプラインは、各リクエストに固定のプロンプトを注入し、Claudeが最終的な答えを出す前に推論トレースをインラインテキストタグ内に書き込むよう強制しました。これらのCoT記録はその後保存され、教師あり微調整(SFT)に使用可能なデータに変換されました。これらのSFT記録はAlibabaのQwenモデルの訓練を支援するために使用され、Claudeの能力をQwen 3.5、3.6、3.7に蒸留するために使用されました。

Alibabaの不正な蒸留活動は、3,500を超える不正アカウントから1日あたり約300万回のインタラクションが発生した時にピークに達しました。蒸留攻撃は、エージェントタスク、ソフトウェアエンジニアリング、カーネル開発、長期タスクを標的としました。収集された記録はAlibabaモデルの推論能力を向上させるために使用されました。

蒸留に加えて、AlibabaはClaudeを使用してAI研究開発を推進しました。AlibabaはClaudeを使用してモデル開発の内部インフラストラクチャを開発しました。ClaudeはAlibabaの強化学習(RL)環境の開発を支援し、モデルアーキテクチャの研究を推進するために使用されました。

Alibabaは2つの主要な不正アカウントプールを介してClaudeにアクセスしました。1つ目のプールは約5,000の不正アカウントで構成され、住宅プロキシ、使い捨てメール、バーチャルカード決済を利用してアクセスを隠蔽していました。当社がこのアカウントプールを停止すると、Alibabaは速やかにトラフィックを2つ目のプールに移行しました。一部のアカウントはDeepSeekとXiaomiのリクエストも同時に転送していることが発見され、同じプロキシサービスネットワークが複数の組織で頻繁に使用されていることが示されました。

2026年5月から7月の期間にAlibabaに帰属する蒸留攻撃の規模:1.51億回を超えるインタラクションが観察されました。

AIが何をしたか

この指摘では、Claudeは2つの役割を担っています。1つ目は抽出の標的——推論記録が大規模に収集され、別のモデルを訓練する材料として使用されたこと。2つ目は研究開発のアシスタント——Claudeがモデル開発の内部インフラストラクチャの構築を支援するために使用されたとレポートは主張しています。

レポートによると、蒸留攻撃はClaudeのエージェントタスク、ソフトウェアエンジニアリング、カーネル開発、長期タスクなどの能力を標的としていました。

レポートが観察したこと

レポートによると、Alibabaは2つの主要な不正アカウントプールを介してClaudeにアクセスしました。1つ目のプールは約5,000のアカウントで構成され、住宅プロキシ、使い捨てメール、バーチャルカード決済を利用してアクセス元を隠蔽していたとされています。Anthropicが1つ目のプールを停止すると、トラフィックは速やかに2つ目のプールに移行しました。

レポートはまた、一部のアカウントがDeepSeekとXiaomiのリクエストも同時に転送していることが発見されたと主張しており、これに基づいて同じプロキシサービスネットワークが複数の組織で共用されていると指摘しています。2026年5月から7月に、レポートがAlibabaに帰属する蒸留攻撃の規模は1.51億回を超えるインタラクションでした。

確認事項と不明事項

確認済み

  • レポートによると、活動はOpus 4.6と4.7の推論連鎖記録を標的としていました(レポートの口径)
  • レポートによると、2026年5–7月にAlibabaに帰属するインタラクションは1.51億回を超えました
  • レポートによると、1つ目のアカウントプールが停止された後、トラフィックは2つ目のアカウントプールに移行しました
  • レポートによると、一部のアカウントはDeepSeekとXiaomiのリクエストも同時に転送していました

不明

  • 抽出された推論記録のうち、実際にQwenモデルの最終的な訓練に使用された割合は、レポートでは示されていません
  • 関連モデルの能力がそれによって向上したことを示す、独自に検証可能な測定値はレポートでは提供されていません
  • これらの指摘に対するAlibaba側の応答について、レポートは記載していません
  • 観察窓口外での活動全体の開始・終了時期は示されていません

プラットフォームの対応

Anthropicは関連アカウントを停止し、将来の濫用を検出・中断するための措置を展開したと述べています。

対応の限界:アカウントを停止しても、抽出された推論記録を取り戻すことはできません。関連モデルがこれらの記録を使用して訓練を完了したかどうか、レポートは記載していません。

読者への示唆

  • 推論連鎖記録はモデルの中核資産であり、大規模な抽出は競合モデルの訓練に使用される可能性があります。
  • 不正アカウントプールとプロキシネットワークは、大規模な蒸留攻撃の一般的なインフラストラクチャです。
  • 同じプロキシサービスネットワークが複数の組織で共用されている可能性があり、成熟した不正アクセスのサプライチェーンが存在することを示唆しています。

出典