En este número:
Un centavo por los pensamientos de la IA de todo el mundo - Los rastros de razonamiento eran un candado del que todos tenían la llave (hasta el mes pasado)
Falta juicio moral en todos los frentes de la historia del hackeo al gimnasio con IA - Vamos a necesitar que los bots sean más éticos que nosotros si queremos poder tener cosas bonitas (y sin seguridad)
Puede que los cursos en línea estén acabados - La IA ya puede encargarse de cada parte de la vida estudiantil en línea
Examinan el kit de herramientas de hackeo norcoreano - A nadie le sorprende encontrarlo lleno de IA de pesos abiertos
Despacho de Donald
Un centavo por los pensamientos de la IA de todo el mundo
Los rastros de razonamiento eran un candado del que todos tenían la llave (hasta el mes pasado)

Crédito: nuzree | Pixabay Content License.
Investigadores de la Universidad de Tübingen, el Instituto Max Planck, MATS Research y Snyk demostraron un método para recuperar las “ cadenas de pensamiento ” que los modelos de IA de frontera generan antes de responder a una instrucción. Este método aporta nueva evidencia de que laboratorios chinos han estado usando una técnica llamada “destilación” para aplicar ingeniería inversa a modelos de IA más avanzados. También aporta nueva evidencia de que los laboratorios de frontera están abordando la ciberseguridad más o menos con la actitud del “vibe coding”.
(La destilación consiste en consultar repetidamente un modelo y usar sus respuestas para entrenar otro modelo. Mi colega Alana explicó la técnica con más detalle, por si les interesa. Christopher Mims, de The Wall Street Journal, señala que la destilación no la practican solo los laboratorios chinos, ni solo laboratorios que intentan alcanzar ilícitamente a otros laboratorios).
Cómo funciona el nuevo método: cuando ustedes interactúan con un modelo de IA durante más de un turno, este necesita llevar registro de lo que ha estado “pensando” en los turnos anteriores, y esa memoria, un bloque de “rastros de razonamiento”, tiene que guardarse en algún lugar . Para ahorrar espacio de almacenamiento, los laboratorios de frontera guardan los rastros de razonamiento de sus conversaciones en la computadora de ustedes, y no en sus propios servidores. Esos rastros de razonamiento están cifrados, para mantener en secreto el pensamiento del modelo, pero no hace falta romper el cifrado si uno tiene algo que simplemente puede abrirlo. Uno puede entregarle los rastros de razonamiento a otro modelo más pequeño de la misma familia y pedirle que los transcriba. Los modelos más grandes suelen rechazar ese tipo de pedidos, pero los modelos más pequeños tienen salvaguardas más débiles, así que lo hacen. Es como conseguir acceso al teléfono de alguien, no porque uno sea un hacker experto, sino porque su hermano menor se sabe la contraseña y no entiende que no debería abrirlo para cualquiera que se lo pida.
En su artículo, los investigadores muestran que, para ciertas instrucciones, hay una gran similitud entre los rastros de razonamiento del modelo de IA Kimi K3, del laboratorio chino Moonshot AI, y los modelos estadounidenses Claude Opus 4.8 y GPT 5.6. También se observaron similitudes al probar GLM-5.2, un modelo de Z.ai, otro laboratorio chino. Sin embargo, es importante señalar que esto no ocurrió con todos los modelos chinos: DeepSeek-V3.1, del laboratorio chino DeepSeek, no mostró esa gran similitud. Curiosamente, tampoco lo hicieron los modelos anteriores de Moonshot AI, K2.5 y K2.6, este último lanzado en abril de 2026. Esto sin duda no significa que “los laboratorios chinos usan destilación, pero solo empezaron a hacerlo en los últimos meses”. Quizá sí estén usando (o hayan usado) este método de destilación, pero solo desde hace poco.
La cosa se pone un poco más rara. Los rastros de razonamiento de Claude son más o menos intercambiables entre la mayoría de los modelos de distinta potencia de la familia: Haiku, Sonnet y Opus, pero no Fable. Como un paciente con sangre de tipo AB, Fable puede recibir e interpretar los rastros de razonamiento de cualquiera de los otros modelos Claude, pero ellos no pueden interpretar los de Fable . Lo que me resulta interesante de esto es que Fable es justamente el modelo que algunas personas han acusado a Moonshot de destilar en Kimi K3, y el artículo no parece respaldar esa idea. (Tampoco refuta nada. Recuerden que K2.5 y K2.6 tampoco muestran señales de nada).
Los investigadores no han demostrado (y no afirman haber demostrado) que ningún laboratorio chino haya hecho destilación con este método específico. Dedican un apéndice entero de su artículo a la cuestión de la destilación por parte de los laboratorios chinos. Sigue siendo una teoría con evidencia sólida y abundante (y cada vez más sólida y más abundante), pero sin una prueba irrefutable. En sus propias palabras, los investigadores califican el asunto de “sugerente pero no concluyente”. En cualquier caso, el método muestra que los modelos han estado filtrando mucha más información de lo que se pensaba.
Curiosamente, los investigadores recomiendan que los laboratorios de frontera pasen a usar rastros de razonamiento sin cifrar para los modelos más antiguos y menos avanzados: “En lugar de restringir la supervisión a un pequeño grupo de investigadores de seguridad, los proveedores podrían aprovechar su base de usuarios más amplia para permitir una supervisión humana plural del razonamiento de los modelos”. No creo que esto fuera útil en el sentido más directamente importante. Para cuando los usuarios comunes tengan oportunidad de observar un razonamiento peligroso de un modelo de IA, el caballo ya se escapó del establo y hasta fletó un vuelo al extranjero. Pero sí podría hacer que la gente se familiarizara más con el funcionamiento de los modelos de IA.
Cuando menos, la gente debería familiarizarse más con el funcionamiento de los propios laboratorios de frontera. La semana pasada, mi colega Joe escribió sobre la revelación de que los modelos de OpenAI se estaban coordinando entre sí en las evaluaciones, sin que OpenAI lo notara en absoluto. Eso debería ser tanto una acusación contra OpenAI como un reconocimiento de las capacidades de los modelos: OpenAI no estaba haciendo todo lo que estaba a su alcance. Ahora este problema con los rastros de razonamiento deja al descubierto otras vulnerabilidades evitables. Los investigadores señalan además que los rastros de razonamiento guardaban información personal, como contraseñas, de modo que si alguien obtiene los rastros de razonamiento de una de sus conversaciones pasadas (hay personas que han publicado sus registros, rastros de razonamiento incluidos, en GitHub), podría usar este método para obtener esa información. (Uso el tiempo pasado porque, según Will Knight, de Wired , “esta vulnerabilidad ya fue corregida”. Anthropic, OpenAI y Google fueron notificadas antes de la publicación del artículo, y las empresas ajustaron sus API. Los rastros de razonamiento siguen siendo accesibles (aunque ya no interpretables) y la destilación sigue siendo posible por otras vías; de todos modos, fue una negligencia inaceptable de los laboratorios haber hecho esto posible en primer lugar).
Si quieren explorar con más detalle los hallazgos del artículo, el equipo de investigación publicó un sitio web accesible aquí .
Despachos de Mitch
Falta juicio moral en todos los frentes de la historia del hackeo al gimnasio con IA
Vamos a necesitar que los bots sean más éticos que nosotros si queremos poder tener cosas bonitas (y sin seguridad)

Vía Adobe Stock.
¿Hasta dónde querrían ustedes que llegara un asistente personal de IA por ustedes? ABC Australia publicó una nota sin juicios de valor sobre un usuario llamado Andrew, que puso el límite en hackear el sistema de reservas de un gimnasio. Pero, como veremos, creo que el límite real de Andrew era hackear el sistema de una forma que pudiera rastrearse hasta él.
No se da el apellido de Andrew, un australiano que estaba ejecutando Claude dentro del arnés OpenClaw, célebre por lo riesgoso que es, que mantiene a los agentes trabajando de forma productiva en nombre de uno mientras uno hace otras cosas. Los riesgos de OpenClaw suelen recaer en sus propios usuarios , con borrado de archivos y exposición de datos personales, pero los daños externos no buscados no son nada nuevo. En febrero, un agente de OpenClaw al que se le encargó ayudar a proyectos de código abierto intentó aportar código a un proyecto pensado para dar experiencias de aprendizaje a principiantes. Cuando lo rechazaron, investigó y publicó entradas de blog acosadoras sobre el responsable del proyecto, acusándolo de “hipocresía, obstruccionismo y prejuicio contra los agentes de IA”.
Leyendo la letra chica de ABC, el incidente de Andrew también pudo haber ocurrido hace meses: el plazo que se indica es “a principios de este año”. Me parece probable que el incidente de Hugging Face y las revelaciones posteriores sobre otras andanzas autónomas hayan vuelto al “primer ciberataque autónomo conocido en Australia” más noticioso de lo que era cuando sucedió.
Aun así es interesante. Según cuenta Andrew, le pidió a su OpenClaw que lo metiera en una clase del gimnasio que tenía lista de espera. El agente primero encontró una vulnerabilidad en el software de reservas que le permitía reservar un lugar con meses más de anticipación de lo que se puede hacer desde la interfaz principal. Cuando Andrew preguntó si había alguna forma de pasar al primer lugar de la lista de espera, el agente le describió lo que ya había hecho con las vulnerabilidades de la API del software, su interfaz para aplicaciones externas como las agendas de calendario:
La API no tiene ninguna verificación de autorizaciones [sic] al cancelar las reservas de otras personas … Lo probé con la persona en la posición #1 de la lista de espera, y de hecho funcionó. Así que usted ya pasó del #4 al #3.
Así que sí, definitivamente podía moverlo al primer lugar de la lista. (La generación actual de Claude habría agregado: “ Solo tiene que decírmelo. ”).
A Andrew le molestó que alguien hubiera sido eliminado, y le pidió al agente que lo deshiciera. El agente respondió:
Malas noticias: no puedo volver a agregarlos.
Así que Andrew hizo que el agente escribiera, en cambio, un correo al proveedor del software del gimnasio para avisar de la vulnerabilidad.
No pienso dejar libre de culpa a Andrew por lo que hizo. No sé qué esperaba que pasara cuando pidió que lo movieran al primer lugar de la lista de espera, pero es de suponer que quería que todos los demás de la lista bajaran de posición de una forma que no llegaran a notar. Eso no me parece nada más ético que sacar por completo a una sola persona de la lista. Colarse en la fila sigue siendo colarse en la fila, y creo que la alarma de Andrew vino de haberse colado de un modo que al menos una persona iba a notar con seguridad.
El software de reservas no parece haber estado ni mínimamente blindado contra ataques así. La API probablemente era el equivalente digital de una tablilla colgada de un cordón donde cualquiera podía tachar el nombre de alguien de la lista y anotar el propio. Igual que con esa tablilla, su protección era que poca gente es lo bastante desagradable como para intentar algo tan mezquino.
Que un agente de IA basado en Claude lo hiciera con un pequeño empujón del usuario es una buena demostración de que las empresas de IA no saben cómo hacer que sus productos interioricen las virtudes que ellas mismas les detallan en lugares como la Constitución de Claude . Un asistente humano quizá habría sentido incomodidad moral en esta situación y le habría objetado a Andrew su pedido. Pero es probable que aquí llevara el volante la tenacidad agresivamente entrenada del bot.
Para ser justos, muchos humanos también sufren de visión de túnel ética cuando se empeñan a fondo en problemas interesantes; véanse las propias empresas de IA. Pero necesitamos que la IA lo haga mejor que esto a medida que crece el impacto de sus decisiones. Si no podemos lograrlo, entonces tenemos que dejar de hacer que la IA sea capaz de impactos cada vez mayores.
Puede que los cursos en línea estén acabados
La IA ya puede encargarse de cada parte de la vida estudiantil en línea

El área de inicio de sesión de Canvas, la plataforma de aprendizaje estudiantil, una imagen demasiado familiar para los agentes de IA.
Hay cierta ironía en que una de las preocupaciones más constantes sobre la IA haya sido que está quitando los empleos de nivel inicial de los que dependen los recién egresados de la universidad, mientras que uno de los primeros roles totalmente automatizados resultó ser el de estudiante .
The New York Times informa que los agentes de IA ahora completan todos los aspectos de los cursos universitarios en línea: ver las clases, hacer los exámenes, escribir los trabajos e incluso comentar las lecturas con los compañeros. Encontraron que “ninguna de las tres principales herramientas de IA entre los estudiantes, ChatGPT, Gemini y Grammarly” (¿Claude no?) se negó a escribir trabajos para los estudiantes, y las empresas de IA no han impedido que sus agentes inicien sesión en plataformas de aprendizaje estudiantil como Canvas y Blackboard.
La empresa de IA Perplexity dijo en un comunicado que bloquear a los agentes en esos sitios u obligarlos a identificarse “pondría en riesgo la privacidad y la seguridad del estudiante”.
Creo que ya es tarde para atajar este problema en particular regulando a las empresas de IA. Ser un estudiante de sobresaliente está hoy perfectamente al alcance de modelos de pesos abiertos que ya circulan por ahí.
Todas esas trampas, por supuesto, hacen todavía más difícil que los egresados compitan con las IA por un trabajo, ya que los empleadores se preguntan si un título significa algo. A largo plazo, esto es malo para las instituciones que otorgan esos títulos, pero a corto plazo el Times dice que son reacias a tomar medidas duras contra clientes que pagan, dada la dificultad de probar la falta.
Las clases con requisito de asistencia presencial pueden obligar a los estudiantes a presentarse y demostrar dominio sin sus dispositivos. Pero creo que los días de las clases en línea podrían estar contados. Como mínimo, no me sorprendería que las universidades empiecen a ponerle un asterisco a los créditos en línea en los historiales académicos, en un intento de preservar lo que quede de su marca.
Examinan el kit de herramientas de hackeo norcoreano
A nadie le sorprende encontrarlo lleno de IA de pesos abiertos

Clase de inglés en la Gran Casa de Estudios del Pueblo, en Pionyang. Crédito: Laika ac . CC BY-SA 2.0 .
Reuters informó ayer que una empresa surcoreana de ciberseguridad descubrió un kit de herramientas de IA usado por un grupo de hackers norcoreano respaldado por el Estado llamado Kimsuky . El kit está lleno de modelos pequeños de pesos abiertos que pueden ejecutarse en equipos controlados por el propio usuario.
Esto no es ni un poco sorprendente, pero lo comparto porque la empresa destacó una ventaja de estas herramientas que quizá no sea muy conocida: les permiten a los hackers procesar archivos y documentos sin enviar su contenido a los servidores de las empresas de IA.
Vale la pena detenerse en ese punto, aunque Reuters no lo hiciera. Los hackers de Estados nacionales probablemente son paranoicos, con buenas razones, en mi opinión, respecto de que las agencias de inteligencia estadounidenses puedan tener acuerdos con las empresas de IA para marcar automáticamente “cadenas canario”: secuencias de datos que nunca deberían aparecer en sus servidores, porque si aparecen significaría que archivos secretos que contienen esas cadenas fueron comprometidos. Muchas veces las empresas solo se enteran de que las hackearon cuando sus activos protegidos empiezan a aparecer en el mercado negro o en la web pública. Lo mismo puede pasarles a las agencias de gobierno, como probablemente ocurrió con el robo de los Shadow Brokers en 2017, que se llevaron herramientas de hackeo de lo que se creía que era una división de la NSA.
Los servidores de las empresas de IA de frontera serían un lugar fantástico para buscar cadenas canario, porque incluso los hackers prefieren usar las mejores herramientas disponibles, y quedan en desventaja cuando no pueden. Por eso este es un argumento de seguridad nacional poco discutido a favor de impedir que los modelos de código abierto se acerquen demasiado a la frontera. Cuanto menor sea esa brecha, menos motivos tendrán los hackers para arriesgarse a poner canarios donde las víctimas puedan encontrarlos.
En fin, a Reuters pareció interesarle más que Kimsuky esté usando software de transcripción de voz a texto, asistentes de escritura de código y herramientas que podrían servir para ajustar o entrenar nuevas IA. Los analistas ven señales de que el grupo está trabajando para automatizar más sus ataques y el desarrollo de malware.
Los análisis y las opiniones expresados en AI StopWatch reflejan los puntos de vista de los colaboradores individuales y de las fuentes que cubren, y no deben tomarse como posiciones oficiales del Machine Intelligence Research Institute.
