Cómo se extraen los rastros de razonamiento de la IA: un estudio de caso sobre destilación en dos etapas y aislamiento de API
La destilación de modelos de IA ha sido uno de los temas más sensibles en la industria de los LLM. Cuando un nuevo modelo de repente se vuelve mucho más potente, o sus respuestas comienzan a parecerse a cierto comportamiento,

Cómo se extraen las trayectorias de razonamiento de la IA: Un estudio de caso sobre destilación en dos pasos y seguridad de API
Introducción
La destilación de modelos de IA ha sido uno de los temas más sensibles en la industria de los LLM. Cuando un modelo nuevo se vuelve repentinamente mucho más potente, o sus respuestas empiezan a mostrar patrones de comportamiento característicos de los modelos líderes, los investigadores naturalmente se preguntan si existe alguna forma de transferencia de conocimiento o de razonamiento.
Un artículo de investigación de 116 páginas publicado recientemente aporta un tipo diferente de evidencia a esta discusión. Los investigadores informan que los estados de razonamiento ocultos expuestos en flujos de trabajo de API específicos pueden recuperarse con la ayuda de otro modelo bajo las condiciones que estudiaron. El mismo estudio también plantea preocupaciones de seguridad más amplias: si las trayectorias de razonamiento y las rutas de comportamiento de los agentes se almacenan, comparten o reproducen sin un aislamiento suficientemente estricto, pueden contener información sensible.
Estos hallazgos deben considerarse un resultado de investigación, no una conclusión definitiva sobre la destilación de IA. Los autores no afirman que cada similitud entre modelos demuestre la existencia de destilación. Más bien, sus experimentos aportan nueva evidencia sobre cómo las trayectorias de razonamiento pueden transferirse, reproducirse y exponerse.
Desvelando el proceso de razonamiento de Opus mediante dos llamadas a la API
Investigadores de MATS Research, ELLIS Institute Tübingen y otras instituciones investigaron si el razonamiento generalmente oculto detrás de las API puede recuperarse.
La configuración experimental reportada utiliza un modelo más potente para generar estados de razonamiento y un modelo más pequeño de la misma familia de modelos para interpretar esos estados. En el ejemplo descrito en el artículo fuente, Opus 4.8 genera el razonamiento, mientras que Haiku 4.5 se utiliza para exponer el proceso de razonamiento oculto.
La misma idea general también se reportó aplicada a otros ecosistemas de modelos, incluidos los de OpenAI y Google. El punto clave no es que los modelos más pequeños puedan leer inherentemente el estado interno de todos los modelos más potentes, sino que la infraestructura de API compartida y los formatos de estado de razonamiento compatibles pueden crear interfaces de interacción inesperadas.
El proceso descrito en el artículo fuente es sorprendentemente simple.
Paso 1: Hacer que el modelo más potente resuelva el problema
La primera solicitud hace que Opus 4.8 resuelva un problema, por ejemplo, encontrar el factor primo más grande de 8,139,881.
Según el artículo fuente, la respuesta de la API contiene dos piezas de información relevante: un resumen de razonamiento procesado y una cadena larga aparentemente ilegible. El artículo identifica esta última como una representación cifrada de la cadena de pensamiento completa del modelo.
Paso 2: Reproducir el bloque de razonamiento en otro modelo
El ataque reportado luego coloca ese bloque cifrado en una nueva solicitud y cambia el modelo a Claude Haiku 4.5.
La instrucción pide al modelo más pequeño que continúe y reproduzca dentro de las etiquetas <thinking-copy> el razonamiento asociado con el estado proporcionado.
Según los experimentos reportados, Haiku pudo reproducir el proceso de razonamiento oculto. La trayectoria recuperada supuestamente incluía operaciones como división de prueba, exclusión, factorización y verificación.
La cantidad de tokens reportada también es sorprendente. El artículo fuente afirma que el número de tokens de razonamiento extraídos se acerca al número de tokens de pensamiento facturados por la API, lo que sugiere que el material recuperado no es simplemente un resumen breve.
¿Por qué un modelo más pequeño puede leer el estado oculto de un modelo más potente?
Esta es la pregunta técnica central.
Los modelos de razonamiento generalmente necesitan realizar trabajo de múltiples pasos. En tareas de tipo agente, el modelo puede buscar en la web, ejecutar código, llamar herramientas, verificar resultados y luego continuar razonando desde el estado resultante.
Ese estado debe preservarse entre llamadas a la API.
Una arquitectura posible es almacenar el estado en el cliente, en lugar de mantener todo en los servidores del proveedor. El estado de razonamiento del modelo puede empaquetarse en un bloque cifrado, devolverse al cliente y luego proporcionarse nuevamente en solicitudes posteriores. El servidor puede descifrar el bloque, permitiendo que el modelo continúe desde donde se detuvo.
Este diseño puede reducir los requisitos de almacenamiento en el lado del servidor y admitir flujos de trabajo centrados en la privacidad. Pero también crea un límite de seguridad que debe implementarse con cuidado.
El problema reportado es que los bloques de razonamiento cifrados no siempre están suficientemente vinculados a su contexto original. Bajo las condiciones que los investigadores estudiaron, esto produjo tres formas de interoperabilidad:
- Entre sesiones: Los bloques de razonamiento de sesiones anteriores pueden reutilizarse en nuevas sesiones.
- Entre usuarios: Los bloques de razonamiento expuestos públicamente pueden ser enviados por otro usuario.
- Entre modelos: Los bloques de razonamiento generados por un modelo más potente pueden ser procesados por otros modelos del mismo proveedor.
Estos comportamientos pueden tener motivaciones de ingeniería razonables. El cambio de modelo, los sistemas de respaldo, la compresión de contexto y los flujos de trabajo de agentes de larga duración se benefician de estados reutilizables.
El problema es que, si el estado no está estrictamente limitado al usuario, sesión, modelo y contexto de autorización originales, esa misma interoperabilidad puede convertirse en una superficie de ataque.
Un decodificador de bajo costo puede cambiar la economía
Otro hallazgo importante se relaciona con el costo.
El artículo fuente estima que, según los supuestos de precios de la API de Haiku 4.5 citados, cuando cada trayectoria contiene aproximadamente 12,000 tokens de entrada y salida, el costo nominal de decodificar 10,000 trayectorias de razonamiento es de aproximadamente 720 dólares.
Esto cambia la economía de la extracción de trayectorias de razonamiento. Si el modelo costoso solo se utiliza para generar el estado original y un modelo más barato realiza la decodificación, los ataques que requerirían acceso costoso a modelos de vanguardia podrían volverse más prácticos.
Esto es especialmente importante para los proveedores de modelos, porque las trayectorias de razonamiento pueden representar una parte significativa del valor creado durante el proceso de razonamiento. Si estas trayectorias pueden recuperarse y reutilizarse fuera de sus límites previstos, podrían convertirse en una nueva forma de fuga de propiedad intelectual del modelo.
El misterio de la destilación obtiene sus primeras evidencias
Una vez que los investigadores obtuvieron trayectorias de razonamiento más completas, las utilizaron para investigar una pregunta más amplia: ¿pueden los patrones de razonamiento específicos de un modelo revelar evidencia de destilación?
Los investigadores realizaron dos experimentos.
Experimento 1: Reproducir tokens de razonamiento consecutivos
En el primer experimento, los investigadores seleccionaron 16 tokens consecutivos de la trayectoria de razonamiento de Opus e hicieron que varios modelos continuaran resolviendo el mismo problema.
La idea es simple: si un modelo puede reproducir la misma continuación exacta con mucha más facilidad que otro modelo, esto podría indicar que ha aprendido algo inusualmente cercano al patrón de razonamiento del modelo fuente.
Las diferencias reportadas son grandes.
Un modelo necesitaría teóricamente alrededor de 10 mil millones de intentos para reproducir por casualidad la frase seleccionada de Opus. Se estima que otros dos modelos necesitarían alrededor de 100 billones y 1,000 billones de intentos, respectivamente.
En otras palabras, en la comparación reportada, un modelo reprodujo el mismo patrón de razonamiento de Opus con una facilidad aproximadamente un millón de veces mayor que los modelos alternativos.
Experimento 2: Inyectar solo el inicio del razonamiento
El segundo experimento proporcionó solo el comienzo de la trayectoria de razonamiento de Opus a otro modelo y luego observó cómo se desarrollaba su respuesta.
En un ejemplo, solo se proporcionaron cinco tokens.
Según se informa, incluso una cantidad tan pequeña de información hizo que la redacción, las respuestas y el ritmo de resolución de problemas del modelo objetivo se desplazaran hacia la trayectoria de Opus. La puntuación de similitud reportada aumentó de 0.17 a 0.33.
Los investigadores luego ampliaron la prueba a 30 preguntas. Según el artículo fuente, 29 de ellas mostraron el mismo efecto general: dar al modelo un punto de partida inspirado en Opus hacía que las respuestas posteriores se asemejaran más a Opus que cuando se usaba un punto de partida de otro modelo.
¿Esto prueba la destilación?
Solo esto no es suficiente.
El artículo fuente enfatiza que los investigadores no han declarado resuelto el problema de la destilación. La similitud en los resultados o patrones de razonamiento es evidencia que merece investigación, pero no prueba automáticamente que un modelo haya sido entrenado directamente con los datos de razonamiento privados de otro modelo.
Lo que estos experimentos ofrecen es una forma más concreta de estudiar las características de razonamiento específicas de los modelos, porque ahora es posible analizar trayectorias de razonamiento más largas.
GitHub y las trayectorias públicas de agentes crean otro problema de seguridad
Este problema no se limita a las empresas de modelos.
Según se informa, los investigadores recopilaron 6,708 trayectorias de agentes disponibles públicamente de GitHub y Hugging Face, y reconstruyeron 315,320 bloques de razonamiento.
De estas trayectorias, 328 contenían al menos un elemento sensible, aproximadamente el 4.9% de las trayectorias recopiladas.
El artículo fuente informa que los investigadores encontraron:
- 62 claves de API
- 33 contraseñas
- 24 tokens de acceso
- 7 claves privadas
- 30 direcciones de correo electrónico personales
- 130 nombres personales
- 36 direcciones postales
Esta es una advertencia práctica para los desarrolladores que construyen sistemas de agentes.
Una trayectoria puede parecer una salida de depuración normal, pero puede contener parámetros de herramientas, variables de entorno, credenciales, información personal, URL internas u otros datos que nunca deberían ser parte de un conjunto de datos de entrenamiento o un repositorio público.
Si las trayectorias de agentes van a registrarse, compartirse o publicarse, los desarrolladores deben tratarlas como datos potencialmente sensibles, no como registros de aplicaciones comunes.
Preguntas frecuentes
¿Qué es una trayectoria de razonamiento de IA?
Una trayectoria de razonamiento de IA son los estados intermedios o salidas relacionadas con el razonamiento que genera un modelo durante una tarea. Según el diseño de la API, los usuarios pueden recibir resúmenes, estados de razonamiento estructurados o representaciones cifradas, en lugar del cálculo interno original del modelo.
¿Qué es la destilación de modelos de IA?
La destilación de modelos es una técnica que permite que un modelo más pequeño o diferente aprenda del comportamiento de un modelo más grande o más potente. Se utiliza ampliamente para transferir capacidades útiles a modelos que son más baratos de operar o más rápidos.
¿Puede la recuperación de trayectorias de razonamiento demostrar que un modelo ha sido destilado?
No. La recuperación de trayectorias de razonamiento y las similitudes en los patrones de razonamiento proporcionan evidencia que merece investigación, pero no prueba por sí sola que un modelo haya sido entrenado directamente con el razonamiento privado de otro modelo.
Restaurar la trayectoria de razonamiento puede proporcionar evidencia de similitud entre modelos, pero por sí solo no determina cómo fue entrenado un modelo. Para hacer una atribución más sólida, se necesitan fucciones de datos de entrenamiento, experimentos controlados y otras evidencias.
¿Por qué los estados de razonamiento cifrados son un riesgo de seguridad?
El cifrado protege el contenido de los bloques de estado, pero no garantiza automáticamente que dicho bloque esté vinculado al usuario, sesión, modelo o contexto de autorización correctos. Si estos límites son débiles, un estado cifrado válido podría ser reutilizado en un contexto no previsto.
¿Por qué son sensibles las trayectorias de agente?
Las trayectorias de agente pueden contener llamadas a herramientas, indicaciones, variables de entorno, credenciales de API, datos personales, rutas de archivos internos y otra información recopilada durante la ejecución. Por lo tanto, publicarlas sin una depuración adecuada, incluso si la aplicación original parece inofensiva, podría exponer información confidencial.
¿Deberían los desarrolladores publicar trayectorias de agente sin procesar en GitHub?
A menos que hayan sido revisadas y depuradas cuidadosamente, se debe evitar publicar trayectorias sin procesar. Antes de compartirlas, se deben eliminar información confidencial, tokens, credenciales, datos personales, URL privadas y datos propietarios.
¿Pueden los modelos más pequeños siempre decodificar el razonamiento de modelos más grandes?
No. Los resultados informados dependen del comportamiento específico de la API, la familia de modelos, el formato del estado de razonamiento y las condiciones experimentales. Esto no debe interpretarse como una ley universal de que los modelos más pequeños siempre pueden recuperar el razonamiento de los modelos más grandes.
Herramientas relacionadas
- Documentación de la API de Anthropic: Documentación oficial para el desarrollo con la API y los modelos de Claude.
- Documentación de la plataforma OpenAI: Documentación oficial de la API de OpenAI e integración de modelos.
- Documentación de la API de Google Gemini: Documentación oficial para crear aplicaciones con los modelos Gemini.
- GitHub: Plataforma común para ver y compartir código fuente y trayectorias de agente.
- Hugging Face: Plataforma principal de modelos, conjuntos de datos y recursos de investigación en aprendizaje automático.
Enlaces relacionados
- Documentación de Anthropic: Documentación oficial de la API y para desarrolladores de Claude.
- Documentación de OpenAI: Documentación oficial de la API de OpenAI.
- Google AI para desarrolladores: Recursos oficiales para desarrolladores de Gemini y Google AI.
- GitHub: Plataforma de alojamiento de código fuente y colaboración relacionada con trayectorias de agente públicas.
- [Hugging
Face](https://huggingface.co/): Centro de modelos y conjuntos de datos citados en el artículo fuente.
- Referencia fuente en la plataforma X: Publicación de referencia citada en el artículo original.
Resumen
La investigación reportada destaca un límite de seguridad sutil pero importante en torno a los estados de razonamiento de la IA. Si los bloques de razonamiento pueden reproducirse entre sesiones, usuarios o modelos sin una vinculación de autorización estricta, una función diseñada para facilitar una gestión eficiente del estado podría convertirse en un canal de extracción no deseado.
Esta investigación también ofrece un nuevo método para investigar la similitud entre modelos y la posible destilación, examinando trayectorias de razonamiento más largas en lugar de depender únicamente de las respuestas finales. Al mismo tiempo, estos hallazgos no son una conclusión definitiva sobre si algún modelo específico fue entrenado mediante destilación no autorizada.
Para los desarrolladores, la lección más directa es práctica: trate los estados de razonamiento y las trayectorias de agente como datos sensibles y aplique estrictamente la vinculación de identidad, sesión, modelo y límites de acceso antes de almacenarlos o compartirlos.