Destilación ilícita de modelos · GTG-16006

Denuncias sobre extracción de capacidades de Zhipu / Z.ai: Caso GTG-16006

Aviso de fuente

Esta página es una traducción al español del contenido relevante del informe de Anthropic de septiembre de 2026, páginas 150–151. Todo el contenido sobre empresas específicas consiste en denuncias unilaterales de Anthropic; este sitio no las ha verificado de forma independiente y no constituyen una declaración de ilegalidad.

Según el informe de Anthropic, Zhipu (marca extranjera Z.ai) ejecutó una canalización de extracción de cadena de pensamiento contra Claude, reproduciendo las trazas de razonamiento capturadas de Claude de nuevo en Claude para su limpieza, con el fin de entrenar su modelo GLM. El informe afirma que en 10 días Zhipu ejecutó la canalización de extracción contra Opus 4.8 a través de 273 cuentas fraudulentas, registrando 770.000 conversaciones. El informe también afirma que Zhipu se dirigió a las capacidades de ciberseguridad de los principales modelos fronterizos de EE. UU. para su destilación. Todo lo anterior son denuncias del editor, no verificadas de forma independiente por este sitio.

Qué sucedió

Zhipu (marca extranjera Z.ai) ejecutó una canalización de extracción de cadena de pensamiento contra Claude, reproduciendo las trazas de razonamiento capturadas de Claude de nuevo en Claude para su limpieza, con el fin de entrenar su modelo GLM. En solo 10 días, Zhipu ejecutó la canalización de extracción de CoT contra Claude Opus 4.8 rotando 273 cuentas fraudulentas para eludir nuestros límites de modelo. Zhipu luego registró las trazas de razonamiento de Claude. Durante el período de 10 días en junio, contamos 770.609 conversaciones que pasaron por el limpiador de extracción de CoT. También atribuimos más de 3 millones de conversaciones a Zhipu durante el mismo período, la mayoría de las cuales se utilizaron para limpiar los resultados de la destilación.

Zhipu también utilizó Claude para mejorar su propia canalización posterior al entrenamiento, utilizando Claude para juzgar los resultados del modelo y limpiar y estandarizar los registros de razonamiento recopilados para la destilación. Claude también se utilizó para puntuar y filtrar los datos de entrenamiento, así como para redactar tareas, proporcionar soluciones e implementar pruebas. Zhipu puede utilizar estos resultados en toda su canalización de entrenamiento.

Recientemente, antes del lanzamiento de su modelo GLM 5.3, identificamos una campaña dirigida a las capacidades de ciberseguridad de los principales modelos fronterizos de EE. UU. Los investigadores de Zhipu utilizaron conjuntos de datos públicos de vulnerabilidades para desarrollar diversos desafíos de captura de bandera. Para resolverlos, Zhipu luego lanzó un ataque de destilación contra el modelo principal de otro laboratorio fronterizo líder de EE. UU. Nuestro modelo Claude Opus 4.6 fue específicamente objetivo en este ataque de destilación, principalmente para evaluar y puntuar las respuestas de otro modelo fronterizo de EE. UU.

Zhipu inicialmente intentó dirigirse a las capacidades de ciberseguridad del modelo Fable de Anthropic. Fable —el modelo generalmente accesible más importante de Anthropic— ha fortalecido las protecciones de ciberseguridad, lo que dificulta que los posibles destiladores se dirijan a las capacidades de ciberseguridad de Fable. Después de que las protecciones de ciberseguridad de Anthropic redujeran la efectividad del ataque de Zhipu, Zhipu finalmente abandonó sus intentos de dirigirse a Fable. Observamos que los empleados de Zhipu luego se desplazaron a Opus 4.6 y al modelo de otro laboratorio de IA líder de EE. UU., explícitamente porque evaluaron que estas protecciones eran más débiles.

Escala del ataque de destilación atribuido a Zhipu durante 17 días entre junio y julio de 2026: se observaron más de 3,4 millones de interacciones.

Qué hizo la IA

Zhipu ejecutó una canalización de extracción de cadena de pensamiento contra Claude, reproduciendo las trazas de razonamiento capturadas de nuevo en Claude para su limpieza.

Zhipu utilizó Claude para juzgar los resultados del modelo, limpiar y estandarizar los registros de razonamiento, y puntuar y filtrar los datos de entrenamiento.

Zhipu lanzó un ataque de destilación dirigido a las capacidades de ciberseguridad de los principales modelos fronterizos de EE. UU., utilizando Claude para evaluar y puntuar las respuestas de otros modelos.

Qué observó el informe

El informe confirma que Zhipu ejecutó una canalización de extracción de CoT contra Claude, registrando 770.000 conversaciones a través de 273 cuentas fraudulentas en 10 días.

El informe confirma que Zhipu utilizó Claude para mejorar su canalización posterior al entrenamiento, incluido juzgar los resultados del modelo, limpiar los registros de razonamiento y puntuar los datos de entrenamiento.

El informe confirma que Zhipu lanzó un ataque de destilación dirigido a las capacidades de ciberseguridad de los principales modelos fronterizos de EE. UU., dirigiéndose inicialmente a Fable, luego desplazándose a Opus 4.6 y al modelo de otro laboratorio de EE. UU.

El informe confirma más de 3,4 millones de interacciones atribuidas a Zhipu durante 17 días entre junio y julio de 2026.

Confirmado y desconocido

Confirmado

  • El informe afirma que Zhipu ejecutó una canalización de extracción de cadena de pensamiento contra Claude para entrenar su modelo GLM
  • El informe afirma que Zhipu registró 770.000 conversaciones a través de 273 cuentas fraudulentas en 10 días
  • El informe afirma que Zhipu utilizó Claude para mejorar su canalización posterior al entrenamiento, incluido juzgar los resultados del modelo y limpiar los registros de razonamiento
  • El informe afirma que Zhipu lanzó un ataque de destilación dirigido a las capacidades de ciberseguridad de los principales modelos fronterizos de EE. UU.

Desconocido

  • Qué proporción de los registros de razonamiento extraídos realmente entró en el entrenamiento final del modelo GLM no se indica en el informe
  • El informe no proporciona mediciones verificables de forma independiente de la mejora resultante en las capacidades del modelo GLM
  • El informe no indica la respuesta de Zhipu a estas denuncias

Respuesta de la plataforma

Anthropic afirma que ha prohibido las cuentas relevantes y ha implementado medidas para detectar e interrumpir abusos futuros.

Límites de la respuesta:La prohibición de cuentas no puede recuperar las trazas de razonamiento que ya han sido extraídas; el informe no indica si Zhipu ha detenido su actividad de destilación.

Conclusiones

  • Las canalizaciones de extracción de cadena de pensamiento pueden extraer los registros de razonamiento de un modelo a gran escala para entrenar modelos competidores.
  • La rotación de cuentas fraudulentas es un medio común para eludir los límites del modelo.
  • Los ataques de destilación dirigidos a las capacidades de ciberseguridad muestran que la fuerza de las protecciones de seguridad de un modelo afecta su probabilidad de ser objetivo.

Fuentes