Distillation illicite de modèles · GTG-16006

Allégations d'extraction de capacités de Zhipu / Z.ai : affaire GTG-16006

Avis de source

Cette page est une traduction en français du contenu pertinent du rapport d'Anthropic de septembre 2026, pages 150–151. Tout le contenu concernant des entreprises spécifiques consiste en des allégations unilatérales d'Anthropic ; ce site ne les a pas vérifiées de manière indépendante et elles ne constituent pas une déclaration d'illégalité.

Selon le rapport d'Anthropic, Zhipu (marque étrangère Z.ai) a exécuté un pipeline d'extraction de chaîne de pensée contre Claude, en rejouant les traces de raisonnement capturées de Claude dans Claude pour nettoyage, afin de former son modèle GLM. Le rapport indique qu'en 10 jours, Zhipu a exécuté le pipeline d'extraction contre Opus 4.8 via 273 comptes frauduleux, enregistrant 770 000 conversations. Le rapport indique également que Zhipu a ciblé les capacités de cybersécurité des principaux modèles frontaliers américains pour distillation. Tout ce qui précède sont des allégations de l'éditeur, non vérifiées de manière indépendante par ce site.

Ce qui s'est passé

Zhipu (marque étrangère Z.ai) a exécuté un pipeline d'extraction de chaîne de pensée contre Claude, en rejouant les traces de raisonnement capturées de Claude dans Claude pour nettoyage, afin de former son modèle GLM. En seulement 10 jours, Zhipu a exécuté le pipeline d'extraction CoT contre Claude Opus 4.8 en faisant tourner 273 comptes frauduleux pour contourner nos limites de modèle. Zhipu a ensuite enregistré les traces de raisonnement de Claude. Pendant la période de 10 jours en juin, nous avons compté 770 609 conversations passant par le nettoyeur d'extraction CoT. Nous avons également attribué plus de 3 millions de conversations à Zhipu pendant la même période, dont la plupart ont été utilisées pour nettoyer les sorties de distillation.

Zhipu a également utilisé Claude pour améliorer son propre pipeline post-formation, en utilisant Claude pour juger les sorties du modèle et nettoyer et normaliser les enregistrements de raisonnement collectés pour la distillation. Claude a également été utilisé pour noter et filtrer les données d'entraînement, ainsi que pour rédiger des tâches, fournir des solutions et mettre en œuvre des tests. Zhipu peut utiliser ces sorties tout au long de son pipeline d'entraînement.

Récemment, avant la sortie de son modèle GLM 5.3, nous avons identifié une campagne ciblant les capacités de cybersécurité des principaux modèles frontaliers américains. Les chercheurs de Zhipu ont utilisé des ensembles de données publics sur les vulnérabilités pour développer divers défis de capture de drapeau. Pour les résoudre, Zhipu a ensuite lancé une attaque de distillation contre le modèle principal d'un autre laboratoire frontalier américain de premier plan. Notre modèle Claude Opus 4.6 a été spécifiquement ciblé dans cette attaque de distillation, principalement pour évaluer et noter les réponses d'un autre modèle frontalier américain.

Zhipu a initialement tenté de cibler les capacités de cybersécurité du modèle Fable d'Anthropic. Fable — le modèle généralement accessible le plus important d'Anthropic — a renforcé ses protections de cybersécurité, ce qui rend plus difficile pour les distillateurs potentiels de cibler les capacités de cybersécurité de Fable. Après que les protections de cybersécurité d'Anthropic ont réduit l'efficacité de l'attaque de Zhipu, Zhipu a finalement abandonné ses tentatives de cibler Fable. Nous avons observé que les employés de Zhipu se sont ensuite tournés vers Opus 4.6 et le modèle d'un autre laboratoire d'IA américain de premier plan, explicitement parce qu'ils ont évalué que ces protections étaient plus faibles.

Échelle de l'attaque de distillation attribuée à Zhipu sur 17 jours entre juin et juillet 2026 : plus de 3,4 millions d'interactions observées.

Ce qu'a fait l'IA

Zhipu a exécuté un pipeline d'extraction de chaîne de pensée contre Claude, en rejouant les traces de raisonnement capturées dans Claude pour nettoyage.

Zhipu a utilisé Claude pour juger les sorties du modèle, nettoyer et normaliser les enregistrements de raisonnement, et noter et filtrer les données d'entraînement.

Zhipu a lancé une attaque de distillation ciblant les capacités de cybersécurité des principaux modèles frontaliers américains, en utilisant Claude pour évaluer et noter les réponses d'autres modèles.

Ce que le rapport a observé

Le rapport confirme que Zhipu a exécuté un pipeline d'extraction CoT contre Claude, enregistrant 770 000 conversations via 273 comptes frauduleux en 10 jours.

Le rapport confirme que Zhipu a utilisé Claude pour améliorer son pipeline post-formation, notamment juger les sorties du modèle, nettoyer les enregistrements de raisonnement et noter les données d'entraînement.

Le rapport confirme que Zhipu a lancé une attaque de distillation ciblant les capacités de cybersécurité des principaux modèles frontaliers américains, ciblant initialement Fable, puis se tournant vers Opus 4.6 et le modèle d'un autre laboratoire américain.

Le rapport confirme plus de 3,4 millions d'interactions attribuées à Zhipu sur 17 jours entre juin et juillet 2026.

Confirmé et inconnu

Confirmé

  • Le rapport affirme que Zhipu a exécuté un pipeline d'extraction de chaîne de pensée contre Claude pour former son modèle GLM
  • Le rapport affirme que Zhipu a enregistré 770 000 conversations via 273 comptes frauduleux en 10 jours
  • Le rapport affirme que Zhipu a utilisé Claude pour améliorer son pipeline post-formation, notamment juger les sorties du modèle et nettoyer les enregistrements de raisonnement
  • Le rapport affirme que Zhipu a lancé une attaque de distillation ciblant les capacités de cybersécurité des principaux modèles frontaliers américains

Inconnu

  • Quelle proportion des enregistrements de raisonnement extraits est réellement entrée dans la formation finale du modèle GLM n'est pas indiquée dans le rapport
  • Le rapport ne fournit pas de mesures vérifiables de manière indépendante de l'amélioration résultante des capacités du modèle GLM
  • Le rapport n'indique pas la réponse de Zhipu à ces allégations

Réponse de la plateforme

Anthropic déclare avoir interdit les comptes concernés et avoir déployé des mesures pour détecter et perturber les abus futurs.

Limites de la réponse:L'interdiction de comptes ne permet pas de récupérer les traces de raisonnement déjà extraites ; le rapport n'indique pas si Zhipu a arrêté son activité de distillation.

À retenir

  • Les pipelines d'extraction de chaîne de pensée peuvent extraire les enregistrements de raisonnement d'un modèle à grande échelle pour former des modèles concurrents.
  • La rotation de comptes frauduleux est un moyen courant de contourner les limites du modèle.
  • Les attaques de distillation ciblant les capacités de cybersécurité montrent que la force des protections de sécurité d'un modèle affecte sa probabilité d'être ciblé.

Sources