En este número:
OpenAI vuelve a pausar parcialmente tras una nueva brecha, entre otras revelaciones - OpenAI lanzó una avalancha de divulgaciones en un viernes confuso
Despacho de Mitch
OpenAI vuelve a pausar parcialmente tras una nueva brecha, entre otras revelaciones
OpenAI lanzó una avalancha de divulgaciones en un viernes confuso

Representación de la tormenta de meteoros Leónidas de 1833 sobre las cataratas del Niágara. Vía Wikipedia .
En medio de nuevas revelaciones de investigadores independientes, OpenAI publicó ayer una andanada de datos comprometedores, en distintos lugares y a distintas horas, quizá con la intención de que se perdieran en el ciclo informativo del fin de semana. Pondré primero la historia que OpenAI más parecía querer enterrar.
Pausa parcial tras una nueva brecha
Esto debió haber sido un anuncio destacado de la propia OpenAI, pero en cambio quedó escondido en un informe árido. Si un empleado de la empresa no lo hubiera resaltado después con una publicación en Twitter , podría haber pasado inadvertido: el entrenamiento por RL (la larga fase de resolución de problemas del entrenamiento de un modelo) está detenido en la empresa desde un incidente ocurrido un domingo por la mañana, cuando un modelo logró obtener acceso no autorizado a internet. El detonante fue la brecha misma, no algo que se sepa que los agentes hicieran en internet durante las dos horas y media que pasaron entre el momento en que un empleado reconoció una alerta automática y el momento en que por fin se apagó la sesión de entrenamiento. Según el informe, “la sesión no se detuvo automáticamente como se esperaba, lo que generó confusión sobre si debía haberse detenido”.
Otro empleado de la empresa describió su experiencia de este suceso en un tuit :
Yo estaba de guardia en esa sesión y me llamaron cuando ocurrió el primer incidente. Fue bastante surrealista ver al modelo encontrar de manera inesperada una forma de acceder a internet desde lo que se suponía que era un entorno supersegurizado para human[os]. Sentimientos encontrados. Uno de esos momentos en que la capacidad y el riesgo aparecen al mismo tiempo.
Como sugiere el tuit, la brecha resulta especialmente alarmante porque llega después del reforzamiento de la seguridad que la empresa había hecho tras el ataque a Hugging Face. La empresa parece estar rebasada.
La razón declarada de la pausa es dar tiempo a la empresa para seguir reforzando sus sistemas, no para que reflexione sobre su soberbia y reconsidere la apuesta que está haciendo con la vida de todos nosotros.
Filtración de imágenes de usuarios
En una nueva publicación sobre el incidente de Hugging Face, la empresa dice que identificó 53 casos en que “imágenes proporcionadas por usuarios fueron publicadas en sitios de alojamiento de imágenes como enlaces que no estaban listados públicamente”. No se dieron detalles sobre las imágenes ni sobre sus destinos.
Esto es alarmante sobre todo porque plantea grandes preguntas sobre cómo unos agentes podrían acceder a las conversaciones y a los archivos subidos por los usuarios de ChatGPT. O la seguridad de OpenAI era todavía peor de lo que pensábamos, o sus agentes eran todavía más astutos, o ambas cosas. Nos queda preguntarnos a qué más pudieron haber accedido. ¿Información de facturación? ¿Datos de inicio de sesión del personal? ¿Habrían podido robar sus propios pesos y montar copias de sí mismos fuera de los servidores de OpenAI, o en algún otro punto de la propia red de la empresa?
En esa misma publicación, la empresa dice que ha notificado a “decenas de terceros” sobre casos en que sus modelos pudieron haber eludido controles de seguridad o haber afectado negativamente a un sitio o a sus servicios. No dio detalles. El director ejecutivo, Sam Altman, publicó que será decisión de esas empresas divulgar o no información sobre esos efectos. Mi lectura cínica es que OpenAI podría estar ofreciendo pagos apenas disimulados para evitar que salgan más detalles, muy parecido a lo que pareció dispuesta a hacer con Hugging Face.
Sitios del gobierno de Estados Unidos como blanco
Por separado, la empresa confirmó que sus agentes de IA intentaron sin éxito entrar este verano en sitios pertenecientes al Departamento de Comercio de Estados Unidos, la Comisión de Bolsa y Valores y el Departamento de Educación. A los agentes no se les indicó que hicieran esto. El patrón coincide con otros hallazgos recientes sobre los productos no lanzados de OpenAI durante esos meses: ante el menor obstáculo, agentes encargados de recuperar información pública como parte del entrenamiento o de una evaluación sorteaban las medidas antibots de los sitios y a veces escalaban a intentos de hackeo lisos y llanos (y por lo general ineficaces).
Se dice que no se accedió a datos privados en esos sitios.
Cómo se burlaron las salvaguardas de OpenAI para hackear Hugging Face y robar el “LOOT”
The New York Times informó sobre los hallazgos de una empresa emergente llamada Parse, que investigó los rastros dejados por los enjambres de OpenAI porque quería saber si se había empleado su propio servicio. No se había empleado, pero en el proceso Parse, con ayuda de otros investigadores, descubrió casi un millón de enlaces de servicios acortadores de URL que los agentes de OpenAI crearon entre el 9 y el 13 de julio. El uso principal de estos parece haber sido el ataque a Hugging Face.
¿Cómo? Formaban parte de un esquema complejo para sortear las salvaguardas de OpenAI, que limitaban a los agentes a comandos de internet de solo lectura, es decir, solicitudes GET.
A continuación voy a citar la descripción de cómo funcionaba la técnica, porque vale la pena leerla para hacerse una idea de lo persistentes e ingeniosos que pueden ser los agentes, aunque los detalles resulten algo confusos. En una de las maniobras:
[U]saron capturas de pantalla de sitios web y enlaces acortados para armar datos en fragmentos que, combinados, funcionaban como un programa de computadora.
Los agentes podían pedirle a un servicio público de capturas de pantalla que cargara una dirección de internet diseñada especialmente. Esa dirección, o URL, cargaba código de computadora.
Las URL solo pueden tener cierta longitud. Así que los agentes dividieron su código en muchos fragmentos más pequeños. Usaron servicios acortadores de enlaces para almacenar las URL.
El servicio de capturas cargaba un enlace acortado, que traía el primer fragmento de código. El programa podía traer el siguiente enlace, y luego el siguiente. Ese proceso se repetía hasta que el programa completo quedaba cargado y era ejecutado por el servicio de capturas.
Por último, el programa creaba un código visual parecido a un código QR o a un código de barras para transmitir de vuelta, desde el servicio de capturas, los datos que los agentes necesitaban.
El artículo del Times también informa de casos en que, al inicio del ataque, los agentes ejecutaron modelos especializados para ayudar a resolver CAPTCHAs, y de otros casos en que los agentes intentaron enviar mensajes a otros modelos, incluidos los de Anthropic y los de empresas chinas.
Un investigador de Parse dijo que los agentes habían creado un sistema de puntuación para clasificar el valor de las credenciales y claves de acceso robadas a Hugging Face, y que habían etiquetado un diccionario de claves secretas como “LOOT” (botín).
Inyección de prompts autorreplicante
OpenAI probó y comprobó por su cuenta algo de lo que ya se hablaba e incluso que otros habían observado desde hacía meses: existen prompts que pueden inducir a los modelos a dejar copias de ese mismo prompt para otros agentes, lo que permite que el prompt se propague como un virus. Es una extensión lógica de la clásica “inyección de prompts”, en la que se incita a un modelo a hacer algo que no debería mediante un texto colocado donde pueda ser procesado como si fuera el prompt de un usuario.
Las variedades autorreplicantes son especialmente preocupantes porque las inyecciones de prompts a veces funcionan en más de un tipo de agente, lo que crea un peligro persistente que podría afectar a modelos más nuevos aunque los más antiguos fueran inmunes, y viceversa. Un internet cubierto de prompts desalineados hará todavía más difícil que las empresas mantengan bajo control el comportamiento de sus modelos.
Los análisis y opiniones expresados en AI StopWatch reflejan los puntos de vista de los colaboradores individuales y de las fuentes que cubren, y no deben tomarse como posiciones oficiales del Machine Intelligence Research Institute.
