Destilación ilícita de modelos · GTG-16002

Presuntas acusaciones del informe sobre el enrutamiento de solicitudes de Moonshot: caso GTG-16002

Aviso de fuente

Esta página es una traducción del chino del contenido de las páginas 148–149 del informe de septiembre de 2026 de Anthropic. Todo el contenido que involucra a empresas específicas es una acusación unilateral de Anthropic; este sitio no lo ha verificado de forma independiente y no constituye una constatación de ilegalidad.

Según el informe de Anthropic, Moonshot (el desarrollador de los modelos Kimi) reenvió silenciosamente las solicitudes de los clientes a Claude y luego mostró las respuestas de Claude a los usuarios, que pensaban que estaban usando Kimi. En un período de diez días, se reenviaron casi 300.000 solicitudes de clientes, la gran mayoría a Opus; la red de proxy tenía 5.380 cuentas falsas. El informe no confirmó si los usuarios lo sabían. Todo lo anterior son acusaciones del editor, no hallazgos independientes de este sitio, ni una conclusión judicial.

Qué sucedió

Descubrimos que Moonshot AI (la empresa que produce la serie de modelos Kimi) reenvió silenciosamente las solicitudes de los clientes a Claude en lugar de procesarlas con Kimi. Moonshot luego mostró las respuestas de Claude a los usuarios. Estos usuarios pensaban que estaban usando el modelo Kimi, pero en realidad recibían las respuestas de Claude.

En un caso, durante diez días, Moonshot reenvió casi 300.000 solicitudes de clientes a Anthropic, la gran mayoría de las cuales se enrutaron a Opus. Moonshot utilizó una red de servicios de proxy de 5.380 cuentas fraudulentas, la mayoría de las cuales parecían estar ubicadas en Singapur y Japón.

Además de proporcionar las respuestas de Claude a los clientes, Moonshot también capturó y guardó al menos algunas de estas conversaciones. Moonshot construyó un conducto de extracción de CoT para extraer los registros de CoT de Claude de las conversaciones reenviadas guardadas para entrenar sus modelos. Moonshot también extrajo registros de CoT recopilados por otros medios.

Al responder, Claude devuelve una referencia a su pensamiento original como una 'firma de pensamiento' en lugar del pensamiento original, para reducir el riesgo de destilación no autorizada. Nuestra API utiliza esta referencia para buscar la traza de pensamiento original en llamadas API posteriores. Moonshot pudo eludir este control y extraer estas trazas de razonamiento guardando la firma de pensamiento de la respuesta de Claude, iniciando una nueva sesión e induciendo a Claude a convertir la firma de pensamiento de nuevo en la traza de razonamiento completa. Estos ataques de reproducción entre sesiones permiten a las entidades responsables de la destilación ilícita recopilar registros de razonamiento de CoT. Estamos introduciendo nuevos métodos para fortalecer las defensas contra estas tácticas.

Nuestra investigación también muestra que las consultas de los usuarios reenrutadas a Claude por Moonshot contenían información sensible sobre varios clientes de Moonshot. No sabemos si Moonshot notificó a sus clientes que sus solicitudes estaban siendo reenrutadas a Anthropic y expuestas a terceros.

Estos incluyeron: Actividad de vigilancia vinculada al EPL. Un usuario que evaluamos que podría estar vinculado al EPL utilizó lo que creía que era el modelo Kimi de Moonshot para cargar datos de vigilancia de imágenes de CCTV de un solo individuo objetivo. El usuario pidió a Kimi que analizara los datos de CCTV para comprender si la persona rastreada se comportaba de manera anormal. Los datos de CCTV incluían videovigilancia de cientos de cámaras en Chengdu, incluidas cámaras fuera de las instalaciones del EPL, instituciones vinculadas a China Electronics Technology Group Corporation y una gran empresa estatal.

Qué hizo la IA en este caso

Moonshot reenvió las solicitudes de los clientes a Claude y mostró las respuestas de Claude como la salida de Kimi.

Moonshot construyó un conducto de extracción de CoT para extraer los registros de razonamiento de cadena de pensamiento de Claude de las conversaciones reenviadas.

Moonshot utilizó un ataque de reproducción entre sesiones para eludir la protección de firma de pensamiento de Claude y extraer trazas de razonamiento completas.

Qué observó el informe

El informe confirmó el enrutamiento por parte de Moonshot de las solicitudes de los clientes a Claude, así como un volumen de reenvío de casi 300.000 solicitudes en diez días.

El informe confirmó que Moonshot capturó y guardó conversaciones y construyó un conducto de extracción de CoT.

El informe confirmó que las consultas de los usuarios contenían información sensible, incluida la actividad de vigilancia vinculada al EPL.

El informe no confirmó si Moonshot notificó a los clientes que sus solicitudes estaban siendo enrutadas.

Confirmado y desconocido

Confirmado

  • El informe afirma que Moonshot reenvió silenciosamente las solicitudes de los clientes a Claude en lugar de procesarlas con Kimi
  • El informe afirma que se reenviaron casi 300.000 solicitudes de clientes en diez días, la gran mayoría a Opus
  • El informe afirma que Moonshot utilizó una red de proxy de 5.380 cuentas fraudulentas
  • El informe afirma que Moonshot construyó un conducto de extracción de CoT para extraer los registros de cadena de pensamiento de Claude

Desconocido

  • Si Moonshot notificó a los clientes que sus solicitudes estaban siendo enrutadas a Claude, el informe no lo ha confirmado
  • Si los registros de CoT extraídos se utilizaron para entrenar los modelos Kimi, el informe no lo indica
  • La respuesta de Moonshot a estas acusaciones, el informe no la indica

Respuesta de la plataforma

Anthropic afirma que está introduciendo nuevos métodos para fortalecer las defensas contra los ataques de reproducción entre sesiones.

Límites de la respuesta:La suspensión de cuentas no puede recuperar los registros de razonamiento ya extraídos; el informe no indica si Moonshot ha detenido el comportamiento de enrutamiento.

Conclusiones

  • Es posible que los usuarios no sepan que sus solicitudes se están enrutando a un modelo de terceros, lo que crea riesgos de privacidad y seguridad.
  • Los registros de razonamiento de cadena de pensamiento son un activo central del modelo; los ataques de reproducción entre sesiones pueden eludir las protecciones para extraer estos registros.
  • Las consultas de los usuarios pueden contener información sensible, y su reenvío a terceros puede provocar filtraciones de datos.

Fuentes