La lucha contra la destilación de Anthropic y OpenAI: bloqueos y cadenas de pensamiento ocultas, pero no pueden frenar el acercamiento
PanewslabAutor: Wang Ziyi, LatePost (晚點)
Editor: Cheng Manqi
La lógica comercial importa más que la lógica técnica.
El 10 de septiembre de 2026, Anthropic publicó un informe de 154 páginas en el que afirmaba haber identificado y bloqueado una destilación a gran escala de Claude por parte de siete laboratorios de IA chinos.
La destilación es un método común de entrenamiento de modelos: los desarrolladores usan un modelo más potente para generar datos y luego entrenan sus propios modelos con esos datos para imitar al modelo líder. Anthropic denomina «destilación ilícita» a la extracción no autorizada, a gran escala y encubierta de las capacidades de un modelo.
Anthropic afirma que las organizaciones implicadas utilizaron métodos claramente infractores para extraer los resultados del modelo de vanguardia, como el uso de tarjetas de crédito robadas, credenciales de acceso y claves de API para crear cuentas falsas en masa.
El informe también señala que algunas empresas chinas de modelos reenviaban las solicitudes de los usuarios a Claude o compraban conversaciones de usuarios a servicios de enrutamiento de terceros para entrenar sus modelos con esos datos. Algunas conversaciones contenían nombres, datos empresariales y credenciales de acceso válidas.
No es la primera vez que Anthropic acusa de «ataques de destilación». En febrero de 2026, afirmó que DeepSeek, Moonshot AI y MiniMax realizaron más de 16 millones de interacciones con Claude a través de unas 24.000 cuentas falsas. Desde entonces, Anthropic ha reforzado sus defensas. OpenAI y Google también siguen identificando y respondiendo a los ataques de destilación.
¿Pueden estas medidas frenar la destilación?
Liu Yi, profesor asistente de la Universidad Griffith de Australia, se muestra escéptico. Lleva mucho tiempo investigando la inteligencia artificial y la ciberseguridad, y fue científico investigador de IA en Quantstamp. Su investigación de 2023 sobre inyección de prompts figura como referencia en la entrada LLM 01 de OWASP, una organización mundial de seguridad. También ha recibido dos recompensas por vulnerabilidades de seguridad de Anthropic y ha investigado ataques de robo de cadenas de pensamiento en modelos comerciales de primer nivel.
Liu Yi compartió sus principales conclusiones:
Tomando a Anthropic como ejemplo, las empresas estadounidenses de modelos de vanguardia han establecido actualmente tres capas de defensa contra la destilación:
(1) Utilizar clasificadores diseñados específicamente para detectar la extracción adversarial de datos, de modo que el modelo rechace de forma endógena las solicitudes sospechosas;
(2) Ocultar o comprimir la cadena de pensamiento en el diseño de la arquitectura antes de emitirla;
(3) Utilizar detectores externos para identificar la extracción de datos y, a continuación, interrumpir la solicitud o bloquear la cuenta.
La lucha contra la destilación es un falso dilema. En teoría, la destilación es difícil de erradicar, y el objetivo más realista de las empresas estadounidenses de modelos de vanguardia es aumentar el coste de la recopilación de datos, ralentizar a los competidores y prolongar su ventaja.
Para las empresas estadounidenses de modelos de vanguardia, la lucha contra la destilación no solo protege las capacidades del modelo; también defienden el valor comercial construido sobre su liderazgo tecnológico.
Liu Yi considera que, para entender las acciones contra la destilación de las empresas estadounidenses de modelos de vanguardia, la lógica comercial importa más que la lógica técnica.
Anthropic puede identificar comportamientos sospechosos de destilación, pero le resulta difícil obtener pruebas concluyentes
LatePost : Anthropic publicó un informe el 10 de septiembre acusando a siete laboratorios de IA chinos de destilación ilícita. ¿A qué se refiere exactamente el «ataque de destilación»?
Liu Yi: Los grandes modelos de lenguaje actuales constan de tres partes: la entrada del usuario, la cadena de pensamiento intermedia del razonamiento y la salida del modelo. Ahora Anthropic y OpenAI ocultan la cadena de pensamiento intermedia y solo te dan la respuesta final. Para tareas de razonamiento complejas, extraer la cadena de pensamiento es una forma de ataque de destilación.
LatePost : ¿Por qué son tan importantes los datos como las trayectorias de razonamiento y las trayectorias completas de los agentes para mejorar las capacidades del modelo?
Liu Yi: Puedes entender la cadena de pensamiento como la solución que un modelo más potente ya ha elaborado; son datos de alta calidad que pueden usarse para entrenar modelos.
El rendimiento de un modelo grande está determinado conjuntamente por el número de parámetros (N), la cantidad de datos (D) y la cantidad de cómputo (C). El número de parámetros aumenta con bastante rapidez en todas las empresas, y con tiempo y potencia de cálculo limitados, si una empresa quiere mejorar más rápido las capacidades de su modelo, necesita más datos de alta calidad.
Pero construir datos de alta calidad para tareas complejas y de largo recorrido es muy difícil, y los datos de entrenamiento valiosos del mundo real son cada vez más escasos. Por eso algunas empresas de modelos grandes utilizan todo tipo de métodos para destilar modelos más avanzados.
LatePost : ¿Cómo se extraen la cadena de pensamiento y más trayectorias de tareas?
Liu Yi: Hay varias combinaciones de técnicas. Por ejemplo, mediante codificación, jailbreaking, inyección de prompts y luego con todo tipo de hipnosis, se le da continuamente una personalidad a la IA para que crea que es un investigador que está haciendo algo difícil pero significativo y que necesita concentrarse en resolver la tarea. No tengo mucho contacto con gente de China, pero sé que en el extranjero hay gente que reconstruye así las cadenas de pensamiento; básicamente, con leer los papers te haces una idea de cómo lo hacen.
Además de extraer directamente la cadena de pensamiento nativa, también se puede intentar sintetizar la cadena de pensamiento intermedia a partir de la entrada y la salida. Se dice que algunas empresas de datos venden cadenas de pensamiento de tareas de largo recorrido por 800-1000 yuanes cada una.
LatePost : Entre Anthropic, OpenAI y Google, ¿quién sufre más destilación?
Liu Yi: Según los informes públicos actuales, debería ser Anthropic. Pero creo que es difícil de decir. He visto los textos reales de las cadenas de pensamiento de DeepSeek, GLM, Kimi, Anthropic y OpenAI, y los estilos de lenguaje no difieren mucho. Es difícil saber quién destila a quién; es posible que al principio ellos también destilaran a DeepSeek.
LatePost : Técnicamente, ¿cómo se suele identificar un ataque de destilación? Desde «este lote de solicitudes se parece mucho a una destilación» hasta «esta es la destilación de tal organización», ¿qué cadena de evidencia se necesita?
Liu Yi: Anthropic se basa más en el comportamiento de las llamadas para juzgar. Por ejemplo, ciertas cuentas emiten de repente una gran cantidad de solicitudes y extraen de forma concentrada ciertos conjuntos de datos fijos.
Anthropic primero localiza las cuentas anómalas y luego busca patrones compartidos entre distintas cuentas, como los mismos prompts de sistema. Como cada empresa usa una arquitectura de agente (harness) diferente, los prompts de sistema también son distintos, y así se puede identificar a la empresa que hay detrás. Por ejemplo, con la caché de prefijos, Anthropic puede descubrir qué grupos de prompts comparten la misma caché y no coinciden con los prompts de sistema conocidos, lo que facilita localizar al destilador.
LatePost : Tras identificar las cuentas anómalas, ¿puede Anthropic confirmar de forma concluyente que sus datos se usaron para entrenar un modelo concreto?
Liu Yi: Es muy difícil confirmarlo al 100%. Puede acusar a una empresa de intentar destilar Claude, pero es muy difícil demostrar que ciertos datos entraron realmente en el modelo de la otra parte.
GLM, Kimi y DeepSeek son modelos de código abierto, pero solo publican los pesos, no los conjuntos de datos. Y a partir de los pesos del modelo es muy difícil obtener pruebas concluyentes de destilación. Si no, Anthropic no habría tenido que ser tan críptico en el informe, centrándose en describir el funcionamiento de los servicios de retransmisión; en esencia, porque no se puede analizar con métodos de caja blanca.
Otro ejemplo: puedes preguntarle a un modelo grande por las primeras 100 palabras del primer libro de Harry Potter, y probablemente te responderá. Pero eso no significa que haya entrenado directamente con la obra original; también podría provenir de blogs o reseñas que citan el texto original.
LatePost : Es decir, el «ataque de destilación» es muy difícil de confirmar por completo y también muy difícil de refutar.
Liu Yi: Anthropic puede formar pruebas de atribución bastante sólidas a partir de los registros de llamadas de la plataforma, las asociaciones de cuentas y la información de infraestructura, pero eso es un problema distinto a demostrar a partir del modelo final que un lote concreto de datos de Claude entró realmente en el entrenamiento. Esto último es mucho más difícil técnicamente.
La lucha contra la destilación aumenta el coste de recopilación para los rivales y también puede «dañar» a los usuarios normales
LatePost : ¿Qué métodos técnicos concretos tienen actualmente las empresas estadounidenses de IA de vanguardia para hacer frente a los ataques de destilación?
Liu Yi: Creo que se dividen en tres categorías.
Primero, detección integrada: Anthropic debería tener clasificadores específicos para la extracción de cadenas de pensamiento; en cuanto se detecta que se ha activado un estado relacionado con la cadena de pensamiento, se puede impedir la extracción;
Segundo, ocultación en la arquitectura del producto: el modelo ya no emite la cadena de pensamiento original, sino que primero la comprime, la resume y luego la emite;
Tercero, detección externa: por ejemplo, puede comprobar si el contenido de salida se solapa con su propia cadena de pensamiento; si se alcanza cierto umbral de fuga, se impide la salida. Cuando se acumulan comportamientos similares, la cuenta se bloquea.
LatePost : El informe de Anthropic no incluye estos detalles, ¿cómo los conoces?
Liu Yi: Es mi propia especulación, porque son operaciones bastante comunes. ¿Por qué Anthropic lanza programas de recompensas por vulnerabilidades para poner a prueba sus propias defensas de seguridad? Quiere pagar a la gente para que haga jailbreak a sus prompts; en cuanto descubre que algo ha sido vulnerado, lo entrena inmediatamente en su clasificador, de modo que el siguiente ataque se vuelve cada vez más difícil.
LatePost : Has recibido dos recompensas por vulnerabilidades de seguridad de Anthropic, ¿cómo fue el proceso?
Liu Yi: Dediqué unas 2 o 3 semanas, principalmente dentro del alcance del programa de recompensas autorizado por Anthropic, a realizar pruebas adversariales contra su clasificador de seguridad, intentando encontrar entradas que pudieran eludir las defensas existentes. Porque vulnerar es cero o uno: solo hay éxito o fracaso, no hay un estado de 0,5. El objetivo de la tarea era obtener respuestas a ciertas preguntas designadas por Anthropic, sin implicar directamente la reconstrucción de la cadena de pensamiento. Pero parte de la lógica es similar.
LatePost : ¿Las operaciones para prevenir ataques de destilación pueden perjudicar a los usuarios normales de suscripción?
Liu Yi: Los usuarios con suscripción normal deberían estar bien; los que activan el control de riesgos son principalmente usuarios anómalos, como cuentas de servicios de retransmisión o cuentas que intentan atacar a Claude.
Recuerdo que en el informe de Anthropic también se reveló que dos estudiantes de grado de una universidad de Hunan diseñaron por su cuenta un agente de ciberseguridad y lo usaron para atacar todo tipo de sitios web; incluso eso fue descubierto.
En teoría, toda la información con la que interactúas con Anthropic puede ser consultada por ellos si quieren.
LatePost : Entonces, ¿cuando Anthropic considera que un usuario puede ser una amenaza, puede acceder y revisar los datos del usuario?
Liu Yi: Eso depende de los términos de usuario de cada empresa de modelos. Según tengo entendido, Anthropic, OpenAI y Google ofrecen algún mecanismo de Retención Cero de Datos (ZDR), comprometiéndose a destruir inmediatamente los prompts de entrada del cliente y las respuestas generadas por la IA tras procesar la tarea, sin almacenarlos, conservarlos ni usarlos para entrenar modelos. Esta función está dirigida principalmente a clientes de API o empresariales que cumplan los requisitos, y normalmente requiere solicitud o configuración adicional. Para los usuarios normales de Claude, ChatGPT y Gemini, la política de retención de datos se rige por los respectivos acuerdos de usuario, y no equivale a una ZDR estricta.
Por ejemplo, si una empresa de modelos reescribe ligeramente tus datos y los usa para entrenar, ¿cuenta como usar tus datos?
LatePost : Es decir, ¿los modelos de vanguardia, mientras cobran a los usuarios por usarlos, pueden usar los datos de los usuarios para seguir escalando?
Liu Yi: Exacto. Por ejemplo, cuando los usuarios corrigen las respuestas del modelo en Claude Code o Codex, esa retroalimentación es una señal de recompensa muy valiosa que puede mejorar el post-entrenamiento.
La destilación sigue la misma lógica. El post-entrenamiento de los modelos actuales depende principalmente del aprendizaje por refuerzo, y la clave es la señal de recompensa. Cuando una empresa de modelos obtiene la cadena de pensamiento de un modelo más potente, es como obtener el «gran resultado»: accede directamente a rutas de resolución de alta calidad. Esto reduce la exploración a ciegas, permite que el modelo converja más rápido a un buen estado y ahorra tiempo y cómputo.
LatePost : ¿Cuál es el criterio de éxito para las empresas estadounidenses de modelos de vanguardia en la prevención de ataques de destilación?
Liu Yi: Primero, impedir que otras empresas de modelos entrenen por atajos y garantizar la ventaja de liderazgo de su propio modelo. Segundo, aumentar el coste de destilación y de recopilación de datos para otras empresas. Y al mismo tiempo, intentar no afectar al uso normal de los usuarios.
LatePost : ¿Se puede prevenir?
Liu Yi: Creo que es imposible de prevenir por completo. Mientras un modelo esté disponible para la gente, hay riesgo de fuga.
Pero recientemente vi que OpenAI lanzó oficialmente la beta pública de Agents API el 10 de septiembre. A diferencia de la anterior Responses API, donde el usuario da una entrada y el modelo grande da una salida con una cadena de pensamiento en medio, la lógica de Agents API es que el usuario da una tarea y obtiene directamente el resultado de la tarea. La cadena de pensamiento intermedia y el proceso del harness de agentes quedan ocultos; es como vender un entorno de ejecución completo. El usuario ya no necesita ocuparse de detalles muy finos, y la ejecución general de la tarea se vuelve cada vez más abstracta. En este escenario, volver a intentar un ataque de destilación probablemente tendrá un coste mayor.
La verdadera motivación de la lucha contra la destilación: ocupar la opinión pública y proteger la valoración
LatePost : ¿Crees que la destilación es la solución óptima para mejorar las capacidades del modelo? ¿Parece que la velocidad de copia de los que van por detrás nunca alcanza la velocidad de la innovación de vanguardia?
Liu Yi: Antes tenía una opinión: en 2024, a corto plazo, la innovación en la propia estructura del modelo era un foso. Después, el foso podría extenderse a la potencia de cálculo. Y más adelante, el foso sería la infraestructura y la energía. Observo que actualmente la tendencia va más o menos en esa dirección.
LatePost : ¿En qué parte de tu razonamiento sobre los fosos encajaría la destilación?
Liu Yi: Creo que encajaría en la potencia de cálculo. En teoría, probando mucho también se puede llegar, pero quizá el tiempo no lo permita.
LatePost : ¿Qué protege en última instancia la lucha contra la destilación?
Liu Yi: La lucha contra la destilación es un falso dilema. En teoría, la destilación es indefendible: por naturaleza humana, mientras destilarte sea más eficiente que construir mis propios datos para entrenar mi modelo, primero intentaré destilarte a ti.
LatePost : ¿Crees que la lucha contra la destilación de las empresas estadounidenses de IA de vanguardia es una batalla condenada al fracaso?
Liu Yi: Sí. Esa es mi opinión.
LatePost : Si técnicamente está condenada al fracaso, ¿por qué las empresas estadounidenses de IA de vanguardia se empeñan tanto?
Liu Yi: Quieren mantener su liderazgo tecnológico. Recientemente, OpenAI afirmó haber usado unos 10.000 agentes de IA durante 88 horas para completar la demostración matemática de uno de los siete «Problemas del Milenio». Por ejemplo, supongamos que DeepSeek anuncia a finales de año que ya ha resuelto los siete problemas matemáticos del Milenio y escribe en su informe técnico: «Solo he usado 1/10 del coste de OpenAI para completar la tarea». Los inversores estadounidenses podrían preguntar: ¿por qué necesitas tanto dinero y aun así lo haces peor que otros? La valoración de OpenAI podría caer.
Por eso, la esencia del comportamiento contra la destilación de OpenAI y otras empresas estadounidenses de modelos de vanguardia sigue siendo la lógica comercial, y no solo la lógica del desarrollo tecnológico:
Anthropic, por un lado, quiere recopilar datos y construir su propio ciclo de datos; por otro, quiere mejorar sus ingresos recurrentes anuales (ARR) para preparar su salida a bolsa.
La lógica de OpenAI es similar. ¿Por qué OpenAI reparte continuamente créditos de reinicio? ¿No equivale eso a regalar dinero cada vez que se pulsa? Pues para recopilar datos y hacer que los estados financieros se vean mejor.
LatePost : El 12 de septiembre, el fundador de Anthropic, Dario Amodei, publicó un artículo pidiendo a toda la industria que ralentizara el ritmo de iteración de los modelos de IA de vanguardia. ¿Qué opinas?
Liu Yi: Creo que deben de haber visto algún cuello de botella. El cuello de botella puede deberse a tres factores: primero, los datos; segundo, la potencia de cálculo; tercero, la infraestructura y la energía. Pero no puedo decir cuál es el cuello de botella concreto; puede que influyan los tres factores.
El capital busca beneficios. En teoría, si pudiera crear una AGI y dominar el mundo, no tendría ninguna razón para detener el desarrollo; simplemente iría «a por todas» para lograr la AGI. Lo más probable es que hayan encontrado un cuello de botella y, escudándose en la seguridad de la IA, salgan a pedir: la IA es demasiado peligrosa, sentémonos primero a discutir cómo limitar su desarrollo.
LatePost : En tu opinión, ¿cuál es la razón esencial de la lucha contra la destilación por parte de las empresas de modelos de vanguardia?
Liu Yi: Aumentar el coste de destilación para los rivales y mantener su propia ventaja de liderazgo. Quizá juzgan que los modelos chinos pronto los alcanzarán, pero no han encontrado una forma mejor de mantener su ventaja, así que solo pueden reforzar las restricciones y ocupar primero el terreno de la opinión pública.
Desde el punto de vista del consenso básico de la industria, la destilación es un gran problema de seguridad, equivalente al robo de propiedad intelectual. Pero desde el punto de vista práctico, en esencia es una forma de igualdad en IA. La destilación es una manera de equilibrar rápidamente el mercado. Precisamente porque hay muchos competidores, ninguna empresa de modelos puede monopolizar, dominar en solitario y fijar los precios como quiera.
LatePost : Has mencionado el valor positivo de la destilación; por otro lado, ¿qué daños potenciales puede traer la destilación para toda la industria y para los usuarios normales?
Liu Yi: Para la industria, los estilos de salida de todos tienden a converger, y los modelos heredan ciertos patrones de fallo de los modelos maestros. Para los usuarios, hay riesgos de fuga de privacidad.
LatePost : En general, ¿en qué estado se encuentra el campo de la seguridad de la IA, incluidos los ataques y defensas de destilación, y a qué retos se enfrenta?
Liu Yi: Me preocupa más la tensión estructural entre la seguridad de la IA y los incentivos comerciales.
Las empresas de modelos invierten muchos recursos en seguridad, pero en algunos escenarios, medidas de seguridad más estrictas pueden afectar a las capacidades del modelo, retrasar el lanzamiento de productos o reducir la experiencia del usuario, de modo que los objetivos de seguridad y los objetivos competitivos no siempre coinciden del todo. Por tanto, una cuestión de gobernanza importante es cómo alinear mejor la inversión en seguridad con los incentivos comerciales de la empresa. Al menos a corto plazo, es difícil encontrar una solución elegante que resuelva los problemas de seguridad sin sacrificar el rendimiento del modelo.
LatePost : ¿Cómo crees que evolucionarán los ataques de destilación en el futuro?
Liu Yi: El ataque y la defensa continuarán, alcanzando un equilibrio dinámico. Puede que haya varias corrientes: una, prescindir de la cadena de pensamiento y empezar a destilar directamente, explorando hasta dónde se puede destilar un modelo de vanguardia. Dos, en el caso de querer la cadena de pensamiento, obtener la cadena de pensamiento nativa. Tres, sintetizar uno mismo la cadena de pensamiento.
LatePost : Para evitar fugas de datos privados, ¿qué consejos darías a los usuarios normales?
Liu Yi: No uséis servicios de retransmisión. Al usar ciertos modelos, si podéis elegir si queréis que vuestros datos se usen para entrenar, no elijáis que sí. Poco más podéis hacer. Al fin y al cabo, estamos a su merced.
Este contenido se proporciona únicamente con fines informativos y educativos y no constituye asesoramiento de inversión relacionado con BTCC. BTCC realiza todos los esfuerzos posibles, pero no puede garantizar la veracidad, exactitud u originalidad del contenido anterior.