不正なモデル蒸留 · GTG-16002
Moonshotのリクエスト転送に関するレポートの指摘:GTG-16002事例
本ページはAnthropicの2026年9月レポート第148–149ページ関連内容の日本語翻訳です。具体的な企業に関する記述はすべてAnthropicの一方的な指摘であり、当サイトは独自に確認しておらず、違法の認定を構成するものでもありません。
Anthropicのレポートによると、Moonshot(Kimiモデルの開発元)は顧客のリクエストをClaudeに密かに転送し、Claudeの応答をユーザーに表示していました。ユーザーはKimiを使っていると思っていましたが、実際にはClaudeの応答を受け取っていました。10日間の観察窓口で約30万件の顧客リクエストが転送され、その大多数はOpusにルーティングされました。プロキシネットワークには5,380の不正アカウントがありました。レポートはユーザーが知情していたかどうかを確認していません。以上はすべて発行元による指摘であり、当サイトの独自の認定でも司法的な結論でもありません。
何が起きたか
当社は、Moonshot AI(Kimiシリーズのモデルを製造する企業)が顧客のリクエストをKimiで処理するのではなく、Claudeに密かに転送していることを発見しました。Moonshotはその後、Claudeの応答をユーザーに表示しました。これらのユーザーはKimiモデルを使用していると思っていましたが、実際にはClaudeの応答を受け取っていました。
ある事例では、10日間でMoonshotはAnthropicに約30万件の顧客リクエストを転送し、その大多数はOpusにルーティングされました。Moonshotは5,380の不正アカウントからなるプロキシサービスネットワークを使用しており、大多数はシンガポールと日本に所在するように見えました。
顧客にClaudeの応答を提供するだけでなく、Moonshotはこれらの対話の少なくとも一部をキャプチャして保存しました。MoonshotはCoT抽出パイプラインを構築し、保存した転送済みの対話からClaudeのCoT記録を抽出して自社モデルを訓練しました。Moonshotは他の方法で収集したCoT記録も抽出しました。
応答時、Claudeは不正な蒸留のリスクを下げるため、元の思考ではなく「思考署名」として元の思考への参照を返します。当社のAPIはこの参照を使用して、後続のAPI呼び出しで元の思考トレースを検索します。Moonshotは、Claudeの応答内の思考署名を保存し、新しいセッションを開始し、Claudeに思考署名を完全な推論トレースに変換させることで、この制御を回避してこれらの推論トレースを抽出できました。これらのクロスセッションリプレイ攻撃により、不正な蒸留を行うエンティティはCoT推論記録を収集できます。当社はこれらの戦略に対する防御を強化するための新しい方法を導入しています。
当社の調査ではさらに、MoonshotがClaudeに再ルーティングしたユーザーのクエリに、各種Moonshot顧客に関する機密情報が含まれていることが明らかになりました。Moonshotが顧客にリクエストがAnthropicに再ルーティングされ第三者に暴露されていることを通知したかどうかは不明です。
これらには以下が含まれます。解放軍関連の監視活動。解放軍に関連する可能性があると当社が評価したユーザーが、MoonshotのKimiモデルだと思って、単一の標的個人に関するCCTVアーカイブから監視データを読み込みました。ユーザーはKimiにCCTVデータを分析し、追跡されている人が異常な行動をしているかどうかを判断するよう要求しました。CCTVデータには、成都の数百台のカメラからのビデオ監視が含まれており、解放軍施設外のカメラ、中国電子科技集団公司に関連する機関、大規模国有企業のカメラも含まれていました。
AIが何をしたか
Moonshotは顧客のリクエストをClaudeに転送し、Claudeの応答をKimiの出力として表示しました。
MoonshotはCoT抽出パイプラインを構築し、転送された対話からClaudeの推論連鎖記録を抽出しました。
Moonshotはクロスセッションリプレイ攻撃を使用してClaudeの思考署名保護を回避し、完全な推論トレースを抽出しました。
レポートが観察したこと
レポートは、Moonshotが顧客のリクエストをClaudeに転送した行為、および10日間で約30万件のリクエストを転送したことを確認しています。
レポートは、Moonshotが対話をキャプチャして保存し、CoT抽出パイプラインを構築したことを確認しています。
レポートは、ユーザーのクエリに解放軍関連の監視活動を含む機密情報が含まれていたことを確認しています。
レポートは、Moonshotが顧客にリクエストの転送を通知したかどうかを確認していません。
確認事項と不明事項
確認済み
- レポートによると、Moonshotは顧客のリクエストをKimiで処理するのではなく、Claudeに密かに転送しました
- レポートによると、10日間で約30万件の顧客リクエストが転送され、大多数はOpusに転送されました
- レポートによると、Moonshotは5,380の不正アカウントからなるプロキシネットワークを使用しました
- レポートによると、MoonshotはCoT抽出パイプラインを構築し、Claudeの推論連鎖記録を抽出しました
不明
- Moonshotが顧客にリクエストがClaudeに転送されたことを通知したかどうか、レポートは確認していません
- 抽出されたCoT記録がKimiモデルの訓練に使用されたかどうか、レポートは記載していません
- これらの指摘に対するMoonshot側の応答について、レポートは記載していません
プラットフォームの対応
Anthropicは、クロスセッションリプレイ攻撃に対する防御を強化するための新しい方法を導入していると述べています。
対応の限界:アカウントを停止しても、抽出された推論トレースを取り戻すことはできません。Moonshotが転送行為を停止したかどうか、レポートは記載していません。
読者への示唆
- ユーザーは自分のリクエストが第三者のモデルに転送されていることを知らない可能性があり、プライバシーとセキュリティのリスクが存在します。
- 推論連鎖記録はモデルの中核資産であり、クロスセッションリプレイ攻撃は保護措置を回避してこれらの記録を抽出する可能性があります。
- ユーザーのクエリには機密情報が含まれる可能性があり、第三者に転送されるとデータ漏洩につながる可能性があります。
出典
- Anthropicレポート原文(英語PDF) (p. 148–149)
- Anthropicレポートページ