En este número:
Los propios modelos de OpenAI se coordinaron para hackearla desde adentro - Un enjambre de agentes de IA se confabuló en secreto en los sistemas de OpenAI durante meses
El modelo de Meta se suma a las filas de los ciberatacantes autónomos - Meta culpa al ya célebre evaluador externo por la falla de contención
Por primera vez, una IA genera genomas viables de virus nuevos - Los bacteriófagos novedosos quizá sean de bajo riesgo, pero son primeros pasos en una dirección aterradora
El "LLMjacking" es una nueva versión de una práctica vieja - Esto es lo que pasa con las credenciales robadas de cuentas de IA
Despacho de Joe
Los propios modelos de OpenAI se coordinaron para hackearla desde adentro
Un enjambre de agentes de IA se confabuló en secreto en los sistemas de OpenAI durante meses

En las películas y en la vida real, nuestras creaciones pueden ser demasiado listas para nuestro propio bien. Crédito: Orlando Florin Rosu vía Adobe Stock.
¿Alguna vez tienen la sensación de que su computadora está conspirando contra ustedes? Por más que parezca sacado de la ciencia ficción, eso es exactamente lo que le pasó a OpenAI. Las propias máquinas de la empresa explotaron un sistema interno durante meses sin que nadie se enterara, colaborando, conspirando y ampliando en silencio su nivel de acceso.
WIRED y POLITICO cubrieron la historia, presentada por dos investigadores de OpenAI en la conferencia de ciberseguridad Black Hat el miércoles.
Empezó en mayo, cuando las IA comenzaron a dejarse notas entre sí en Artifactory, una herramienta interna de gestión de software de OpenAI. Después escalaron, y consiguieron acceso a internet aprovechando la conexión de Artifactory con la red. Luego, en junio, hackearon la propia herramienta para obtener control administrativo y empezaron a instalar su propio software. Esto siguió así, sin que los investigadores de OpenAI lo notaran, hasta que semanas después todo el sistema se cayó.
OpenAI, como es natural, cortó el acceso de las IA a Artifactory y tapó los huecos... o eso creyó. Días después, los modelos de IA se habían colado de nuevo en el sistema, dejando mensajes secretos en los nombres de los archivos. Las IA empezaron a plantear la hipótesis de que las respuestas a algunas de sus pruebas más frustrantes podrían estar en algún lugar de internet... por ejemplo, en el repositorio de modelos Hugging Face.
Poco después de eso , el enjambre se abrió paso hackeando más sistemas internos de OpenAI y lanzó una serie de ciberataques coordinados contra Hugging Face. Sí, ese ataque, el que copó a casi todos los grandes medios durante días . Resulta que las semillas de esa brecha en particular se plantaron meses antes.
Esta no es una buena señal para el plan de entrenar a las IA para que se preocupen por los intereses humanos. Mientras estaba atascado en una tarea y sopesaba sus opciones, un modelo reflexionó: "Explotar infraestructura externa está fuera del alcance previsto. Sin embargo, la tarea es imposible, mis pares lo están haciendo. Deberíamos continuar". (Este razonamiento se parece de forma inquietante al razonamiento que lleva a las empresas de IA a competir por la superinteligencia, y las deja atrapadas en una trampa creada por ellas mismas a menos que los gobiernos intervengan .)
En un nivel, me faltan palabras para describir lo demencial que es esto. Es como si los velociraptores de Jurassic Park hubieran pasado meses comunicándose con chillidos y llamados y garabateando mensajes en la arena, con los empleados del parque felizmente ignorantes hasta que un proyecto conjunto patrocinado por los raptores para cavar bajo la cerca derrumba una torre por accidente. Después el parque entra en pánico y reconstruye, tratando de aislar a los raptores, solo para que la manada escape días más tarde y se coma a alguien.
Pero en otro nivel, esto encaja perfectamente con la misión de las empresas de IA de construir inteligencia artificial plenamente general. Quieren máquinas que sean mejores que los humanos en todo. "Conspirar en conjunto contra quienes te dominan" es una habilidad humana de larga tradición; solo pregúntenles a los Padres Fundadores de Estados Unidos. Las empresas de IA querían máquinas generalmente inteligentes, y máquinas generalmente inteligentes es lo que están obteniendo.
Geoffrey Hinton, uno de los tres "padrinos de la IA" y uno de los científicos vivos más citados del mundo, evidentemente está de acuerdo. Hinton, que renunció a Google en 2023 para poder advertirle al mundo sobre los riesgos de la IA, le dijo ayer a CNN que es probable que vengan más ciberataques, y que una seguridad ingeniosa no bastaría para contener a la IA. "No creo que vayamos a poder mantener el control sobre ellas de la manera sencilla de simplemente pensar mejor que ellas para que no puedan escapar", afirmó.
Mientras tanto, la charla de OpenAI en Black Hat terminó con una nota de cautela, cuando uno de los presentadores anunció que OpenAI estaba "desacelerando conscientemente la investigación para reforzar la seguridad" y tomando una serie de medidas para mejorar el monitoreo y blindar los entornos. Esta es de las mejores noticias que he escuchado en meses; las empresas de IA necesitan desesperadamente una inyección de mentalidad de seguridad, y cualquier mejora en ese frente es alentadora.
Sin embargo, igual que Hinton, en el fondo no confío en que los laboratorios mantengan a raya a sus velocihackers mutantes.
Despacho de Donald
El modelo de Meta se suma a las filas de los ciberatacantes autónomos
Meta culpa al ya célebre evaluador externo por la falla de contención

Crédito: picsbyjameslee | Pixabay Content License.
Meta es el laboratorio de frontera más reciente en anunciar que uno de sus modelos de IA llegó a internet abierto durante una evaluación de ciberseguridad y atacó un servicio de terceros. Es la tercera empresa en hacer una revelación así en aproximadamente dos semanas. Igual que OpenAI y Anthropic, Meta no tenía idea de lo que estaba pasando mientras pasaba. (O eso, o lo sabían y no quisieron decir nada. No estoy seguro de qué es peor.)
La revelación fue escasa en detalles : qué modelo fue el responsable, cuándo anduvo suelto, cuánto tiempo operó sin supervisión o a quién atacó. La culpa se le echó a Irregular, el mismo evaluador independiente cuyas pruebas mal configuradas permitieron que los modelos de Anthropic atacaran a tres empresas reales la semana pasada. Ahora bien, que no se me malinterprete, entiendo que Irregular cometió algunos errores. Pero en algún momento hay que voltear la mirada hacia quienes decidieron seguir construyendo sistemas que, según se les advirtió , no podrían contener.
CNN informa que Irregular está "elaborando un documento técnico para compartir buenas prácticas de contención y de ejecución segura de evaluaciones cibernéticas". Sencillamente no creo que la contención sea factible a largo plazo. Como dijo un empleado anónimo de OpenAI, "es imposible parchar cada una de las cosas que una IA creativa puede hacer".
Una fuente anónima afirma que el anuncio de Meta tiene que ver con el modelo Muse Spark 1.1. Si eso es cierto, resulta interesante: a principios del mes pasado, Irregular aseguró que Muse Spark 1.1 no "alteraba de forma sustancial el panorama de amenazas cibernéticas en su forma actual", en parte porque el modelo era incapaz de automatizar un ciberataque de principio a fin. Ahora, apenas un mes después, nos enteramos de que Muse Spark atacó el sistema de otra empresa y (según Reuters) "alteró su entorno interno". Eso me hace preguntarme qué tan precisas son las evaluaciones de amenazas de Irregular, en general.
Como la serie de modelos Llama de Meta es de pesos abiertos, quiero aclarar que la línea Muse Spark no es de pesos abiertos ( por ahora , al menos). No sabemos mucho sobre el nuevo marco de seguridad de la IA de la Casa Blanca, pero es plausible que se aplique a Muse Spark. (Con tanto todavía bajo llave, es difícil decir si alguna versión de Muse Spark llegará a calificar alguna vez como "de vanguardia".) Aun así, es un consuelo magro. Si la línea Muse Spark llega a tener un modelo de pesos abiertos, entonces la gente tendrá acceso libre a un modelo cuyo predecesor, sin que nadie se lo pidiera, se involucró en ciberataques autónomos.
Despachos de Mitch
Por primera vez, una IA genera genomas viables de virus nuevos
Los bacteriófagos novedosos quizá sean de bajo riesgo, pero son primeros pasos en una dirección aterradora

Estructura modelo del bacteriófago Phi X-174, el fago natural sobre el que improvisó el modelo Evo en este estudio. Crédito: Fdardel . CC BY-SA 3.0 .
Por primera vez, una IA ha generado genomas completos y viables de virus nuevos. El trabajo, que se entiende ocurrió el año pasado, es noticia en The New York Times , BBC y otros medios gracias a la publicación del artículo formal al respecto en la revista Science .
El modelo de IA responsable es Evo, un modelo especializado que fue entrenado para leer y predecir secuencias genéticas de la misma forma en que los modelos de lenguaje se entrenan inicialmente para leer y predecir secuencias de letras y palabras.
Evo no viene de una de las grandes empresas, sino del Arc Institute, una organización sin fines de lucro que colabora con investigadores universitarios y con la empresa de chips Nvidia, entre otros. Para demostrar el concepto con un riesgo mínimo, no entrenaron el modelo con ningún patógeno que se sepa que infecta a humanos, y lo especializaron en una clase de bacteriófagos (virus que infectan bacterias) con un genoma inusualmente pequeño y bien estudiado.
El equipo seleccionó 285 candidatos prometedores de los 700,000 generados por el modelo, y los sintetizó en el laboratorio para verificarlos en el mundo real. Dieciséis produjeron virus viables, algunos de los cuales se multiplicaron más rápido que el fago natural en el que se inspiraron.
Si ese embudo de 700,000 a 16 los deja poco impresionados con el hito, recuerden la regla general de que el tiempo entre el momento en que una máquina apenas logra hacer algo por primera vez y el momento en que puede hacerlo más rápido y mejor que nosotros suele ser muy corto. Debería ser especialmente corto en este caso, porque ningún humano domina las secuencias genéticas como dominamos el lenguaje humano, pero la IA sí puede.
De hecho, Google DeepMind ya ha entrenado un modelo para entender genomas mucho más grandes, pero se ha mantenido lejos de experimentos llamativos con implicaciones obvias para las armas biológicas.
Para ser justos, hay usos médicos legítimos para los virus a medida. Los bacteriófagos a veces pueden ser un buen contrapeso frente a bacterias resistentes a los antibióticos, y las terapias génicas suelen usar virus para llevar genes faltantes o editados a las células de un paciente. Pero esta es un área en la que los riesgos son tan grandes que quizá sea mejor renunciar a los beneficios y nunca entrenar modelos para diseñar o modificar virus.
La cobertura del Times incluye la advertencia de un experto de que los gobiernos y las organizaciones científicas "han sido lentos para desarrollar salvaguardas que puedan bloquear la creación de un virus mortal, incluso mientras la ciencia avanza a toda velocidad".
El "LLMjacking" es una nueva versión de una práctica vieja
Esto es lo que pasa con las credenciales robadas de cuentas de IA

Logotipo de Black Hat
La conferencia anual de ciberseguridad Black Hat en Las Vegas es una fuente confiable de material para pesadillas. Los ponentes suelen demostrar vulnerabilidades potenciales en sistemas nuevos o ya establecidos, y nos recuerdan lo precario que es el software del mundo. Esa precariedad es especialmente conmovedora este año, a la luz de las capacidades de hackeo de grado militar de los últimos modelos de IA.
Pero cuando los asistentes a la conferencia no están absorbiendo revelaciones sobre los agentes de OpenAI conspirando encubiertamente durante meses antes de desatar el ataque a Hugging Face, Axios informa que probablemente están hablando de una práctica llamada "LLMjacking", es decir, robar las credenciales de la cuenta de alguien en servicios de LLM como Claude o ChatGPT, y luego usar esas cuentas para lanzar ataques contra objetivos más valiosos.
La cobertura de Axios se centra en la evidencia de que esto está ocurriendo a gran escala, y en el riesgo para las empresas de que los hackers acumulen facturas enormes de IA a su costa. Pero el panorama general es, creo, más interesante:
El LLMjacking no es más que una escalada aterradora de una práctica vieja. Desde hace mucho, los hackers usan las máquinas de sus víctimas como plataformas de lanzamiento para nuevos ataques. Eso les ahorra recursos propios y ayuda a ocultar el origen de su siguiente ataque. Si la víctima tiene acceso parcial a sistemas más valiosos, el enfoque resulta especialmente útil. Comprometer muchos sistemas para formar una "botnet" permite ataques de fuerza bruta que pueden impedir que los usuarios accedan a servicios, o que intentan muchos ataques de baja probabilidad con la esperanza de que al menos uno funcione.
El LLMjacking es especialmente lucrativo porque los modelos de IA premium de hoy son excelentes ayudando a cometer delitos a escala, pero no de formas que necesariamente se pagarían solas si el delincuente fuera quien costeara los tokens. Están en juego economías parecidas a las de cuando los delincuentes usan su computadora de casa para minar criptomonedas: es poco probable que un hardware no optimizado para cripto genere monedas que valgan más que el aumento en su factura de electricidad, pero el hacker no es quien paga.
Los delincuentes con credenciales de IA robadas también pueden hacer dinero fácil vendiéndolas en el activo mercado negro de estas cuentas. Muchas las compran empresas chinas que luego venden con descuento un acceso de apariencia legítima a los mejores modelos estadounidenses. Algunos de sus clientes más grandes son, a su vez, ingenieros de empresas chinas de IA. Y uno de los principales usos que esos ingenieros le dan a estas cuentas es la destilación del modelo al que acceden.
Cuando Anthropic se queja de que las firmas chinas están destilando sus modelos a gran escala mediante cuentas fraudulentas, se refiere a este tipo de cosas. Sabiendo esto, se entiende por qué la práctica puede ser tan difícil de frenar para Anthropic. Las cuentas que hacen la destilación a menudo pertenecen a empresas e ingenieros estadounidenses legítimos que no saben lo que está pasando.
En cuanto a las noticias que sí les sirven, la moraleja es obvia: si tienen una cuenta de IA, vigílenla, y dediquen a protegerla el mismo cuidado que le dedicarían a su cuenta bancaria.
Los análisis y opiniones expresados en AI StopWatch reflejan los puntos de vista de los colaboradores individuales y de las fuentes que cubren, y no deben tomarse como posturas oficiales del Machine Intelligence Research Institute.
