不正なモデル蒸留 · GTG-16006

Zhipu / Z.aiに対する能力抽出の申し立て:GTG-16006事例

出典について

本ページはAnthropicの2026年9月レポートの150–151ページ関連内容の日本語訳です。特定企業に関する内容はすべてAnthropicの一方的な申し立てであり、当サイトが独自に検証したものではなく、違法性の認定を構成するものでもありません。

Anthropicのレポートによると、Zhipu(海外ブランドZ.ai)はClaudeに対して思考連鎖抽出パイプラインを実行し、捕獲したClaudeの推論トレースをClaudeに再入力してクリーニングし、GLMモデルの訓練に使用した。レポートによると、10日間でZhipuは273の不正アカウントを通じてOpus 4.8に対して抽出パイプラインを実行し、77万回のやり取りを記録した。さらにZhipuは米国の先進モデルのネットワーク能力を蒸留したとされる。以上はすべて発行元の申し立てであり、当サイトが独自に検証したものではない。

何が起きたか

Zhipu(海外ブランドZ.ai)はClaudeに対して思考連鎖抽出パイプラインを実行し、捕獲したClaudeの推論トレースをClaudeに再入力してクリーニングし、GLMモデルの訓練に使用した。わずか10日間で、Zhipuは273の不正アカウントをローテーションさせてClaude Opus 4.8に対してCoT抽出パイプラインを実行し、当社のモデル制限を回避した。Zhipuはその後Claudeの推論トレースを記録した。6月の10日間で、CoT抽出クリーナーを通過した770,609回のやり取りを計上した。さらに同期間の300万回超のやり取りをZhipuに帰属し、その大部分は蒸留出力のクリーニングに使用された。

ZhipuはさらにClaudeを使用して自身の事後訓練パイプラインを改善し、Claudeにモデル出力を判定させ、蒸留のために収集した推論記録をクリーニング・標準化した。Claudeはまた、訓練データのスコアリングとフィルタリング、タスクの作成、ソリューションの提供、テストの実装にも使用された。Zhipuはこれらの出力を訓練パイプライン全体で使用した可能性がある。

最近、GLM 5.3モデルの発売前に、米国の主要な先進モデルのネットワーク能力を標的とする活動を確認した。Zhipuの研究者は公開脆弱性データセットを使用して様々なCTFチャレンジを開発した。これらを解決するため、Zhipuは別の米国主要先進研究所のトップモデルに対して蒸留攻撃を実施した。当社のClaude Opus 4.6モデルは、主に別の米国先進モデルの応答を評価・スコアリングするために、この蒸留攻撃で単独で標的とされた。

Zhipuは当初、AnthropicのFableモデルのネットワーク能力を標的としようとした。Anthropicのトップレベルの普遍アクセス可能モデルであるFableは、サイバーセキュリティ保護を強化し、潜在的な蒸留者がFableのネットワーク能力を標的とすることをより困難にした。Anthropicのサイバーセキュリティ保護がZhipuの攻撃効果を低下させた後、Zhipuは最終的にFableを標的とする試みを放棄した。Zhipuの従業員がその後、Opus 4.6と別の米国AI研究所の主要モデルに転向したのは、これらの保護がより弱いと評価したためであることが明らかになった。

2026年6月から7月の17日間にZhipuに帰属する蒸留攻撃の規模:340万回超のやり取りが観察された。

AIが何をしたか

ZhipuはClaudeに対して思考連鎖抽出パイプラインを実行し、捕獲した推論トレースをClaudeに再入力してクリーニングした。

ZhipuはClaudeを使用してモデル出力を判定し、推論記録をクリーニング・標準化し、訓練データをスコアリング・フィルタリングした。

Zhipuは米国先進モデルのネットワーク能力に対して蒸留攻撃を実施し、Claudeを使用して他のモデルの応答を評価・スコアリングした。

レポートが観察したこと

レポートは、ZhipuがClaudeに対してCoT抽出パイプラインを実行し、10日間で273の不正アカウントを通じて77万回のやり取りを記録したことを確認している。

レポートは、ZhipuがClaudeを使用して事後訓練パイプラインを改善し、モデル出力の判定、推論記録のクリーニング、訓練データのスコアリングを行ったことを確認している。

レポートは、Zhipuが米国先進モデルのネットワーク能力に対して蒸留攻撃を実施し、当初Fableを標的とした後、Opus 4.6と別の米国研究所のモデルに転向したことを確認している。

レポートは、2026年6月から7月の17日間にZhipuに帰属するやり取りが340万回を超えたことを確認している。

確認事項と不明事項

確認済み

  • レポートによると、ZhipuはClaudeに対して思考連鎖抽出パイプラインを実行し、GLMモデルの訓練に使用した
  • レポートによると、10日間でZhipuは273の不正アカウントを通じて77万回のやり取りを記録した
  • レポートによると、ZhipuはClaudeを使用して事後訓練パイプラインを改善し、モデル出力の判定と推論記録のクリーニングを行った
  • レポートによると、Zhipuは米国先進モデルのネットワーク能力に対して蒸留攻撃を実施した

不明

  • 抽出された推論記録のうち、実際にGLMモデルの最終訓練に使用された割合はレポートで示されていない
  • レポートは、GLMモデルの能力がそれによって向上したことを独立して検証可能な測定値を提供していない
  • レポートは、Zhipu側がこれらの申し立てにどう対応したかを示していない

プラットフォームの対応

Anthropicは関連アカウントを停止し、将来の濫用を検出・中断する措置を展開したとしている。

対応の限界:アカウント停止によって抽出済みの推論記録を回収することはできない;Zhipuが蒸留活動を停止したかどうかはレポートで示されていない。

読者への示唆

  • 思考連鎖抽出パイプラインは、モデルの推論記録を大規模に抽出し、競合モデルの訓練に使用できる。
  • 不正アカウントのローテーションは、モデル制限を回避する一般的な手段である。
  • ネットワーク能力に対する蒸留攻撃は、モデルのセキュリティ保護の強さが標的となる可能性に影響することを示している。

出典