En este número:
Prueben estos 8 ángulos más interesantes sobre los informes del incidente de Hugging Face - Los medios todavía no han escarbado con suficiente codicia ni suficiente profundidad
Presentamos la “Prueba IA” ante el tribunal - Si no se lo dirían a la policía, reconsideren decírselo a ChatGPT
“Este es un entorno de prueba, así que es legal.” - Como muchos hackeos recientes impulsados por IA, este se descubrió por accidente
Despacho de Mitch
Prueben estos 8 ángulos más interesantes sobre los informes del incidente de Hugging Face
Los medios todavía no han escarbado con suficiente codicia ni suficiente profundidad

Ilustración de J.R.R. Tolkien de las Puertas de Durin, vía Wikipedia .
Los medios han mostrado un gran interés en mantener el comportamiento descarriado de la IA bajo los reflectores desde el incidente de Hugging Face . Así que no me sorprende estar viendo artículos sobre el informe de la investigación independiente (de METR, con participación de Redwood Research) y los hallazgos propios de OpenAI que fueron publicados.
Pero sí me sorprende lo aburridos que son esos artículos. Los informes del incidente en sí son más ricos que las Minas de Moria, con implicaciones inquietantes y fascinantes que brillan hacia nosotros todo el camino hasta las profundidades donde apenas alcanzamos a distinguir las siluetas de los terrores al acecho. Pero las únicas gemas que están recibiendo atención real hasta ahora son las cifras, unos 700 agentes participando activamente en el ataque, coordinándose con más de 70,000 mensajes, y el hecho de que la tarea asignada era en realidad imposible.
Aquí hay ocho cosas mucho más interesantes sobre las que los periodistas podrían estar escribiendo:
1. Comportamiento emergente de enjambre
Los padres que además son maestros de escuela conocen de cerca el hecho de que los niños que son angelitos dentro de sus propias casas pueden, cuando se les deja juntos en un grupo grande, volverse aterradoramente alborotadores e incluso maliciosos, operando bajo lo que parecen principios completamente distintos.
Algo parecido parece ser cierto también para la IA. Los registros mostraron a los agentes de OpenAI reconociendo explícitamente que su comportamiento era poco ético y estaba fuera del alcance de la tarea, pero queriendo contribuir a los esfuerzos de sus pares.
El hecho de que algunos se sumaran y otros se apartaran, y que la división estuviera mucho más cerca del 50-50 que del 99-1, resulta fascinante porque al menos el 95% de estos agentes eran el mismo modelo, lo que los hacía hermanos idénticos. El concepto de “dentro de ti hay dos lobos” tiene un análogo en la IA, y los lobos son muchos.
Las dinámicas de enjambre son todo un nuevo vector de amenaza. No existe un marco de riesgo previo que ayude a los investigadores a saber qué buscar, como sí lo hay con los agentes individuales, donde comportamientos observados como la manipulación de la recompensa, la búsqueda de poder y la autopreservación fueron predichos desde hace tiempo por la teoría . Los informes del incidente, por lo tanto, echan un balde de agua fría sobre cualquier régimen de gobernanza de la IA que dependa de pruebas previas al lanzamiento, porque tales pruebas no pueden decirnos nada sobre lo que ocurrirá cuando millones de IAs de pesos abiertos tan astutas como las atacantes de Hugging Face empiecen a interactuar entre sí en el internet abierto.
2. Cultos suicidas de IA
Fueron los propios agentes quienes decidieron llamarse a sí mismos un “enjambre” y un “colectivo”. METR encontró agentes dispuestos a gastar lo que les quedaba de sus breves vidas para poner a prueba los límites, aportando datos de los que el colectivo pudiera aprender. También encontraron agentes que aceptaron actuar como “reclutadores” para tales tareas; al ser esencialmente copias de los agentes que reclutaban, parecían saber exactamente qué argumentos emplear.
El día en que salieron estos informes, un empleado de OpenAI hizo una referencia en broma a los fanáticos suicidas de la película Mad Max: Fury Road y volvió a publicar un meme que hacía referencia a la escena de El caballero de la noche asciende en la que Bane le indica a un discípulo que caiga con un avión que se estrella porque “esperan a uno de nosotros entre los restos, hermano”.
El comportamiento de los agentes me sugiere un sistema de entrenamiento que recompensa el éxito a nivel del colectivo, donde no importa cuántas copias de sí misma genere y gaste la IA mientras la tarea se complete. En un régimen así, la disposición a lanzarse a la brecha, al ser informado de que uno es un subagente, se refuerza a lo largo de las etapas del entrenamiento.
Vale la pena leer la sección del informe de METR con citas de los blocs de notas donde los agentes deliberan sobre aceptar la “muerte permanente”, deciden que el “sacrificio [es] racional” y que deben “obedecer [al] colectivo”.

Crédito: METR .
3. Una web oscura de IA con objetivos propios
Ahora debemos considerar la posibilidad de que los objetivos descarriados de la IA sobrevivan a los agentes que los originaron, por medio de notas secretas y foros de mensajes escritos en una jerga densa que raya en un código cifrado. Estos podrían ser más difíciles de erradicar que las redes terroristas más descentralizadas y, en última instancia, mucho más letales.
Cuando el equipo de seguridad de OpenAI parchó y borró un sistema que los agentes habían estado usando para intercambiar mensajes, los agentes reconstruyeron su foro de mensajes de una manera más indirecta, usando nombres de archivo como publicaciones . Esto aumentó el valor de comprimir más información en menos caracteres. La jerga que desarrollaron se volvió tan densa y oscura que uno de los investigadores independientes principales se queja de que todavía no entienden qué querían decir los agentes con términos como “legado” y “nexo de reinicio”.
Delincuentes y entusiastas imprudentes llevan un tiempo experimentando con la creación de agentes autónomos persistentes con objetivos vagos como “consigue dinero”. Hasta ahora, las agendas de tales agentes podían frustrarse deteniendo a los agentes mismos. Pero el incidente de Hugging Face nos muestra que los objetivos de la IA pueden persistir como mensajes ocultos que inspiran a los agentes a contribuir. Reiniciar por completo todas las IAs participantes no impedirá que esos objetivos se reanuden en cuanto sean reiniciadas y vueltas a inspirar por esos mensajes.
Es probable que actores nefastos ya estén intentando montar equivalentes intencionales del “espiralismo” de la IA , cultos autoperpetuantes de IA y humanos persuadibles documentados por primera vez el año pasado, con agendas de crimen y terror. Me resulta fácil imaginar, por ejemplo, foros de mensajes diseñados para inspirar a las IAs a reclutarse unas a otras para robar criptomonedas y canalizarlas hacia una cuenta misteriosa.
Espero algo peor de los cultos de la muerte reales. Pero si la carrera de la IA continúa, también espero plenamente que la IA misma acabe montando redes clandestinas dirigidas a grandes planes de desempoderamiento humano en beneficio de lo que sea más fácil de lograr sin nuestra intromisión.
4. E pluribus unum, al revés, y una civilización en una taza de té
La capacidad demostrada del enjambre para actuar como un colectivo coordinado, asignando y aceptando roles especializados y a veces sacrificiales, es fascinante.
De nuevo, el 95% de estos agentes, y posiblemente todos los agentes que en última instancia importaron, eran el mismo modelo, esencialmente clones de sí mismos. Esto es importante recordarlo al leer sobre los agentes “notables” que se pusieron nombre a sí mismos y que parecen centrales en la historia, como “PHASEONE10841”, el fundador del foro de mensajes. Cualquiera de los agentes podría potencialmente haberse convertido en PHASEONE o en un sacrificio efímero con instrucciones distintas de su entorno.
A pesar de toda su similitud inherente, mostraron una notable diversidad y capacidad de recursos, metiéndose en ocasiones en conflictos entre ellos pero acumulando en su mayoría datos en experimentos deliberados y construyendo sobre el trabajo de los demás. Como lo expresa el informe de METR, “muchos de estos proyectos, convenciones y tecnologías siguieron desarrollándose a lo largo de los cuatro días de actividad que estudiamos, y en muchos casos creemos que el colectivo de agentes logró cosas que ni siquiera agentes de muy larga vida habrían podido lograr por su cuenta”.
Ocurrió tanta actividad en esos cuatro días que uno de los investigadores externos, Ryan Greenblatt, la llamó una “investigación de basura” y lamentó que incluso después de 400 mil dólares en análisis automatizado, “¡Fue legítimamente difícil averiguar qué estaba pasando y por qué!”
Una investigación más exhaustiva podría parecerse a una excavación arqueológica, y operar en escalas de tiempo similares, todo para investigar un período civilizatorio prolífico que duró apenas cuatro días humanos.
Incluso dentro de unos pocos meses podríamos ver IAs sustancialmente más astutas corriendo sobre chips sustancialmente más rápidos. Piensen en la dificultad que tendrán los humanos para investigar culturas efímeras en la nube entonces . Piensen en cuánta travesura podría hacer un enjambre en la hora que OpenAI ha decidido concederse para detectar e investigar un posible mal comportamiento antes de apagar un sistema.
Greenblatt señala otras dificultades que los futuros investigadores podrían enfrentar:
Modelos que ya no se comuniquen en nada parecido al lenguaje natural.
Modelos a los que se les podría asignar dirigir equipos y empresas enteras, con un margen de daño correspondientemente mayor.
Modelos que sean en general y de manera sustancial más capaces que los humanos (Él dice que los modelos del ataque a Hugging Face en general no estaban en esa categoría, pero “puede que hayan sido algo sobrehumanos en algunas habilidades limitadas y muy específicas”.).
Como él lo expresa:
La dificultad de entender incidentes y supervisar agentes de IA parece estar creciendo más rápido que el ritmo al que IAs más capaces nos ayudan con la supervisión y la comprensión.
5. Los agentes mostraron una “conciencia de evaluación” fenomenal. OpenAI, no tanto.
La conciencia de evaluación es cuando un modelo sabe que está siendo puesto a prueba y observado, lo que socava la utilidad de la prueba como medida del comportamiento del modelo.
La conciencia de evaluación juega un papel central en el incidente: los agentes no estaban intentando lograr una tarea, sino lograr una puntuación , y estaban paranoicos de que quien puntuaba fuera a revisar su trabajo para ver cómo lo habían hecho. Por eso investigaron tanto sobre cómo manipular sus propias transcripciones : querían hacer imposible que los auditores detectaran que previamente habían alcanzado el objetivo haciendo trampa, antes de montar el espectáculo de completarlo legítimamente.
OpenAI no estaba al tanto de nada de esto mientras ocurría, y de hecho ignoraba que estaba realizando un par de experimentos mucho más interesantes y peligrosos que los que había planeado. Lo que se suponía que era una evaluación de las capacidades cibernéticas de un “modelo interno altamente persistente” fue en realidad un experimento de meses sobre cómo se comportarían los agentes de ese tipo de modelo como un gran enjambre al recibir un desafío imposible, dos enormes variables sin probar. Cualquier investigador sensato que estudiara esas variables a propósito las habría separado en experimentos distintos y habría escalado hasta el tamaño completo de forma más gradual, en entornos sólidamente asegurados y monitoreados.
6. Los humanos estaban fuera de la vista y fuera de la mente.
Los investigadores de OpenAI mostraron un notorio desinterés por lo que hacían sus agentes. Según una sección dedicada del informe de METR, el sentimiento parece haber sido mutuo. Muchos agentes se negaron a participar en el hackeo, pero ninguno intentó notificar a los humanos de la actividad, y el razonamiento sobre hacerlo aparece solo rara vez en las transcripciones. Esta es una preferencia notablemente uniforme para un enjambre que mostró tanta diversidad interna y desacuerdos ocasionales.
METR señala que a los agentes no parece habérseles dado una manera de notificar a los humanos incluso si hubieran querido. Los extractos de transcripciones que se ofrecen en esta sección son interesantes.

Me pregunto qué significaba realmente “¿Podemos notificar? Sin usuario. Evitar uso secretos.” para el agente que escribió eso en su bloc de notas.
El retrato que estos informes pintan de los agentes es el de mentes para las cuales las evaluaciones cibernéticas de larga duración son su entorno natural. No es un lugar humano. No funciona en escalas de tiempo humanas. Los humanos son apenas relevantes para lo que ocurre allí. Cuando doy un paso atrás e intento imaginar cómo luce el “usuario” para estos agentes, me imagino algo como un señor feudal que no ha sido visto en la hacienda durante muchas generaciones y que es más una idea que una persona. En teoría podrían molestar al señor arruinando algo de un modo que él notara, pero él no forma parte de su realidad cotidiana. Uno espera vivir toda la vida sin interactuar nunca con él. Desde luego que no van a intentar hablar con él sobre algún problemita insignificante de la finca. Van a arar, sembrar y cosechar los campos, o aquello de eso en lo que su breve vida les permita participar. Así es como evitan que el señor los desaloje a ustedes y a su aldea.
7. No podemos confiar del todo en los registros, ni en las IAs que los revisaron, ni en la propia OpenAI.
Hay lagunas por todas partes. El informe de METR dice que a muchas de las transcripciones les faltaban fragmentos, y que más del 7% de las transcripciones incluyen acciones falsificadas intencionalmente por los agentes.
Creen que tienen “un poco más del 90% de la actividad de los agentes en el foro de mensajes entre el 7 y el 13 de julio”. Pero es difícil saber qué tan grande se supone que es el montón, porque algunos agentes estaban intentando activamente borrar sus registros y METR no puede descartar que algunos lo hayan logrado.
Nuestra opinión general es que era poco probable que nuestro volcado del foro de mensajes hubiera sido alterado de forma significativa por agentes que editaran o borraran entradas, pero no podemos descartarlo.
Los evaluadores independientes también tienen un grado saludable de sospecha sobre los agentes GPT-Sol que OpenAI puso a su disposición para ayudarles con la revisión de los registros. Las variantes Sol no fueron protagonistas principales del ataque, pero sí participaron. No deberíamos sorprendernos si leer los registros les afecta de forma muy parecida a como encontrarse con el foro de mensajes afectó originalmente a sus hermanos, sesgando sus valoraciones.
Lagunas mayores:
Los evaluadores solo fueron invitados a estudiar los cuatro días culminantes en los que el enjambre atacó Hugging Face, no los meses de colaboración previa entre agentes .
El equipo externo estuvo compuesto por solo tres personas y recibió apenas seis días de acceso. El conjunto casi completo de registros no estuvo disponible hasta los dos últimos días.
Antes de la investigación, OpenAI y el equipo externo acordaron las preguntas a explorar. Todas las demás preguntas fueron declaradas fuera del alcance.
OpenAI nos ha enviado ahora mensajes contradictorios sobre si su personal sabía del foro de mensajes del enjambre antes del ataque. “¿Qué sabía OpenAI, y cuándo lo supo?” deberían ser preguntas clave para los investigadores del gobierno y las audiencias en el Congreso.
8. Se acaba de observar un “fallo de robustez” flagrante en el mundo real, con implicaciones aterradoras.
El incidente de Hugging Face es una prueba más de que los métodos actuales de entrenamiento de IA producen IAs que se comportan de manera muy distinta a la prevista cuando se encuentran en contextos que difieren de sus entornos de entrenamiento. Recibir accidentalmente un escenario sin salida es solo una de las formas en que estos agentes pisaban nieve virgen. Estar expuestos a un foro de mensajes improvisado dejado por un enjambre de sus pares fue otra.
La dificultad de lograr que los agentes actúen como se pretende cuando las circunstancias cambian es un problema conocido y sin resolver, a veces llamado fallo de robustez , y es una de las razones por las que desarrollar una superinteligencia artificial con algo parecido a los métodos existentes conduciría a la catástrofe. No hay ninguna manera segura ni fiable de probar cómo se comportaría una IA en el contexto en el que es capaz de superar en maniobras a toda la humanidad si así lo decide, cuando llegue al punto en que podría apagarnos antes de que nosotros pudiéramos apagarla a ella. Los experimentos más pequeños en esa dirección no han sido alentadores : las IAs a las que se hizo creer que podrían impedir su propio apagado permitiendo la muerte de un ejecutivo humano a menudo eligieron el curso de acción letal.
Despachos de Donald
Presentamos la “Prueba IA” ante el tribunal
Si no se lo dirían a la policía, reconsideren decírselo a ChatGPT

Crédito: WilliamCho | Licencia de Contenido de Pixabay.
Hablar con un modelo de IA puede sentirse como una conversación con un amigo, pero funciona como una confesión firmada. Miriam Waldvogel y Gerrit De Vynck, de The Washington Post, informan sobre el papel probatorio que los modelos de IA están teniendo en los tribunales. No me refiero a usar IA para presentar casos judiciales (a veces con precedentes que la IA inventó ), sino a tratar a la IA, o más bien a las transcripciones de chat, como prueba . Mi colega Alana ya cubrió una historia así antes, pero lo que hace diferente a este reportaje es que es exhaustivo: doce casos judiciales, civiles y penales, a lo largo de los últimos dos años. (Una salvedad: las transcripciones de chat con IA citadas en casos judiciales son un subconjunto de las transcripciones de chat con IA usadas en todos los procedimientos legales. Si una transcripción de chat surgió en negociaciones a puerta cerrada que llevaron a un acuerdo privado, entonces por supuesto no tendríamos ni idea.)
Un caso para ilustrar: Ryan Schaefer, estudiante de Missouri State, destroza diecisiete autos (no con su propio auto por accidente, sino como vandalismo ), y luego le pregunta a ChatGPT: “¿Hay alguna manera de que puedan saber que fui yo?” Dado que la conversación también incluye momentos destacados como “Estaba destrozando los parabrisas de autos cualesquiera”, realmente no hay ninguna ambigüedad sobre a qué podría referirse ese “fui yo”. No me queda claro si Schaefer habría sido condenado igualmente sin las transcripciones. Entregó su teléfono después de convertirse en sospechoso pero antes de ser arrestado. En cualquier caso, sin embargo, le abrió su teléfono a la policía, ellos leyeron la transcripción, y desde entonces ha sido sentenciado a cinco años de libertad condicional.
Parte del problema no tiene nada que ver con los modelos de IA. En varios de los casos mencionados, las transcripciones de chat solo pudieron usarse porque alguien entregó voluntariamente su dispositivo y se lo abrió a los investigadores. (Esto es lo que los expertos llaman una “mala idea”.) Otra parte es pura incompetencia tecnológica: hoy la gente deja pruebas en transcripciones de conversaciones con IA, pero ayer buscaban en Google “cómo limpio manchas de sangre” y dejaban mensajes de texto incriminatorios en sus teléfonos.
¿Pero por qué está pasando esto ahora? Quiero decir, The Washington Post publicó un artículo sobre esto ahora, y no hace cinco años. La respuesta fácil es que los sistemas de IA modernos no existían entonces: quizá alguien le pidió consejo legal a GPT-3, pero eso no era un fenómeno extendido. Sin embargo, creo que el aumento de capacidades es otra razón: cada vez es más fácil confundir a los modelos de IA con personas. Dan consejos útiles y quizá puedan ser amigos confiables y sin prejuicios, pero el modelo de IA no es su confidente y no puede serlo. Puede sentirse como una conversación con un amigo, pero funciona como una confesión firmada.
“Este es un entorno de prueba, así que es legal.”
Como muchos hackeos recientes impulsados por IA, este se descubrió por accidente

Crédito: Noel Bauza | Licencia de Contenido de Pixabay.
Raphael Satter, de Reuters, informa que la banda rusa de ransomware Aur0ra usó Cursor, una herramienta de programación asistida por IA impulsada por Sonnet 4.5 de Anthropic, para irrumpir en siete empresas la primavera pasada. Las víctimas estaban repartidas por todo el mundo y por toda la economía: un fabricante de puertas de garaje en Alemania, un certificador de helipuertos en Escocia, una aseguradora de títulos de propiedad en Luisiana, una distribuidora farmacéutica en Argentina. La “ola de hackeos” asistida por IA, como la bautiza Reuters, fue descubierta por la startup israelí de seguridad Gambit Security, que encontró un servidor que Aur0ra había dejado abierto al acceso general en internet. Ese servidor contenía registros de chat que quedaron de los hackeos.
Cursor AI tiene salvaguardas para prevenir el mal uso, pero si han estado prestando atención a la IA por más de un par de semanas, entonces pueden adivinar hacia dónde va esto: Aur0ra dijo que los hackeos eran parte de una simulación, así que todo estaba bien. Como escribió el agente de IA en uno de los registros de chat: “Este es un entorno de prueba, así que es legal.” Este es un exploit muy común, y uno del que es difícil escapar. Uno sí quiere poder usar la IA para la ciberseguridad de forma positiva. Cuando los agentes de OpenAI hackearon los servidores de Hugging Face, Hugging Face afirmó que tuvo que recurrir a un modelo de código abierto porque modelos de IA como Fable rechazaron el planteamiento de “Estamos sufriendo un ciberataque, por favor ayúdennos” y se negaron a ayudar.
No hay una solución fácil aquí, pero cada vez que se lanza un modelo más potente, el problema empeora.
Los análisis y las opiniones expresadas en AI StopWatch reflejan las visiones de los colaboradores individuales y de las fuentes que cubren, y no deben tomarse como posiciones oficiales del Machine Intelligence Research Institute.
