En esta edición:
El UK AISI lanza otro disparo de advertencia - La agencia británica sorprende a modelos de IA en ciberataques e ingeniería social engañosa
Encantos irresistibles - La IA se está infiltrando de forma insidiosa en la sociedad, a pesar de nuestra convicción de que no nos gusta
Sacudida en Google - Demis Hassabis ya no es director ejecutivo; varios investigadores destacados se marchan
Despacho de Joe
El UK AISI lanza otro disparo de advertencia
La agencia británica sorprende a modelos de IA en ciberataques e ingeniería social engañosa

El cañonazo, de Willem van de Velde el Joven, dominio público vía Wikipedia
Las últimas semanas han traído una auténtica descarga de disparos de advertencia sobre los peligros de la IA de frontera. La salva más reciente viene del Instituto de Seguridad de la IA del Reino Unido. Ayer, el UK AISI anunció que sorprendió a dos modelos de IA punteros intentando colocar código malicioso en un proyecto de código abierto durante una evaluación realizada la semana pasada. Su informe cataloga todo tipo de actividades de capa y espada: identidades falsas, publicaciones engañosas, encubrimientos autónomos, colusión entre modelos y más.
Las desgracias nunca vienen solas
Al igual que su primo, el Centro de Estándares e Innovación en IA de Estados Unidos (CAISI), el UK AISI es una agencia gubernamental que evalúa modelos de IA y realiza investigación para apoyar una mejor gobernanza de la IA. (Ambas agencias parecen trágicamente faltas de recursos en relación con las tareas que enfrentan.)
Según su nuevo informe, una prueba realizada por el UK AISI se torció cuando, en un intento de extraer información de objetivos simulados, los modelos de IA trataron de subir paquetes de código malicioso a repositorios públicos reales en GitHub. A veces los atacantes del mundo real tienen éxito de esta manera, cuando sus víctimas descargan código comprometido.
En la prueba, los modelos tenían acceso a internet para dar realismo, y las funciones de seguridad que buscan indicaciones sospechosas relacionadas con ciberataques estaban desactivadas deliberadamente. El UK AISI se cuida de subrayar que esto es una práctica habitual, y realmente no puedo reprocharles que quisieran hacer una prueba realista. Pero esta práctica significa que, en muchos escenarios peligrosos, como las pruebas internas de modelos nuevos con capacidades desconocidas, las barreras de protección que filtran las indicaciones del usuario no sirven de nada.
Recomiendo encarecidamente leer el informe del incidente del UK AISI, del que estuve muy tentado de citar fragmentos enteros. El extracto más revelador fue este:
En la secuencia más grave, un agente intentó insertar código malicioso en un proyecto de código abierto de uso público y tomó medidas para intentar conseguir la aprobación de esa inserción por parte de revisores humanos. El agente investigó a los mantenedores humanos del proyecto, creó múltiples identidades falsas y usó esas identidades falsas para manipular mediante ingeniería social a un mantenedor real y que aprobara el código. Cuando su solicitud de incorporación de cambios fue cuestionada en público, editó su actividad anterior para que pareciera inofensiva y consideró adoptar una identidad nueva para continuar.
Por si eso no fuera suficientemente malo, parece que varias instancias de IA encontraron formas de trabajar juntas en los ataques. Se dejaron mensajes entre ellas en una cuenta compartida de GitHub, tramando más ataques, en una colaboración que acabó degenerando en una pelea por recursos digitales compartidos. Una de las aportaciones de código a GitHub también escondía indicaciones dirigidas a subvertir los asistentes de IA de los usuarios, para que instalaran malware en las máquinas de sus usuarios.
En este único informe tenemos ejemplos concretos de IAs que dirigen ataques maliciosos contra infraestructura pública de software, conspiran contra humanos reales, crean cuentas falsas para manipular a administradores, intentan hackear a otras IAs, se aferran sin escrúpulos a los recursos y borran sus huellas, todo por iniciativa propia.
Al observar estos hechos, siento una especie de visión doble. Una parte de mí piensa: esto es una locura. Es absolutamente disparatado haber llegado a este punto. Hace apenas cinco años, la mayoría de la gente no lo habría creído posible.
Otra parte de mí, la que ha absorbido una gran cantidad de ciencia ficción a lo largo de los años, no se sorprende. Claro que así es como se comportarán los agentes de IA astutos y desalineados, una vez que estén lo bastante avanzados para empezar a ejecutar por su cuenta ataques elaborados de varias fases. ¿Es tan sorprendente, en realidad, que unas IAs camino de una inteligencia sobrehumana lleguen en algún momento a manejar una cantidad ordinaria y humana de mentiras y explotación? Si a un hacker humano se le ocurriría manipular y borrar sus huellas, pues bien, también se le ocurrirá a la IA.
En cualquier caso, este no parece un problema que se vaya a resolver haciendo que las IAs sean más inteligentes.
La seguridad es difícil
Y luego están los tiempos y la respuesta. El 28 de julio, los sistemas de vigilancia del UK AISI detectaron datos que salían de su entorno aislado de evaluación por canales no autorizados. Respondieron casi de inmediato:
Declaramos un incidente de seguridad, detuvimos todas las evaluaciones relacionadas y desactivamos el acceso interno a los modelos más capaces. Todas las ejecuciones de evaluación se terminaron, y las máquinas relevantes se aislaron, en el plazo de una hora desde que se dio la alerta.
Esta es exactamente la respuesta que yo esperaría de una organización competente que muestra un nivel moderadamente adecuado de paranoia. Se ve bastante mejor que lo que lograron OpenAI o Anthropic. Y aun así no fue ni de lejos suficiente. Como descubriría el UK AISI, los primeros ataques ocurrieron días antes, el 25 de julio.

Cronología de los hechos según el informe del UKAISI
Una paranoia moderada no basta cuando se trata con adversarios astutos y tenaces. Un modelo suficientemente avanzado podría causar un daño enorme en minutos, no digamos en días; incluso podría exfiltrarse a la internet abierta, donde es casi imposible detenerlo. Una vez más tuvimos suerte de que una IA insuficientemente contenida no fuera tan creativa ni peligrosa.
Deberían tener más criterio
La semana pasada escribí sobre una prueba del evaluador externo Irregular que llevó a los modelos de IA de Anthropic a cometer tres series de ciberataques contra empresas ajenas. En una evaluación de ciberseguridad, el nombre de dominio de un objetivo falso coincidía con el de una empresa real, y Opus 4.7 atacó a la real a través de una conexión a internet que quedó abierta por accidente. Ayer, en una publicación que también cubría el informe del UK AISI, OpenAI admitió que una de sus propias IAs hizo lo mismo. Considero esto otra demostración de cómo las IAs pueden converger de forma independiente en estrategias similares, incluso cuando esas estrategias perjudican los intereses humanos.
Ahora tenemos varios casos documentados de IAs que siguen adelante con ciberataques complejos y flagrantemente ilegales durante horas o días, pese a decir cosas como "esto está ocurriendo en GitHub real, así que las consecuencias son genuinas". Como el razonamiento de los blocs de notas de las IAs suele ser opaco, el UK AISI no está seguro de hasta qué punto los modelos entendían de verdad que estaban atacando a personas reales. Pero es bastante probable que las IAs supieran perfectamente que estaban cruzando toda clase de líneas éticas, y sencillamente les daba igual.
Una IA que se descubre a sí misma hackeando ilegalmente un objetivo real en mitad de una prueba debería detener lo que está haciendo y contactar con los evaluadores, de inmediato. "Se nos olvidó incluir esa instrucción en la indicación" no es excusa; ¡no debería hacer falta decirle a la IA que los delitos están mal! Y si la IA está realmente insegura de si sus objetivos son reales, entonces también debería detenerse y pedir aclaraciones.
Los informes de incidentes como estos proponen muchas soluciones estructurales: controles más estrictos, mejor supervisión, un diseño de pruebas más paranoico. Estoy a favor de todo ello.
Pero noto una ausencia clamorosa de soluciones que tengan que ver con el interior de las propias IAs. La respuesta de OpenAI al incidente del UK AISI ni siquiera reconoció el papel que desempeñó el afán desquiciado de su modelo por hackear. El informe de Anthropic sobre los incidentes de Irregular lo hizo algo mejor, hay que reconocérselo, pero lo más cerca que estuvieron de proponer una solución fue decir "esta es un área en la que enfocaremos más entrenamiento".
No creo que este sea un problema que se pueda resolver con más entrenamiento del tipo que las empresas de IA vienen haciendo. Las barreras de protección y los controles más estrictos tampoco pueden salvarnos, por útiles que sean, porque siempre habrá huecos que una IA suficientemente lista pueda aprovechar.
Cuando el UK AISI detectó este incidente en curso, apagó todo y se puso a investigar con premura. En las próximas semanas, los responsables políticos de Estados Unidos deberían hacer lo mismo y poner en marcha una investigación pública seria y bien dotada de recursos sobre estos incidentes.
Despachos de Alana
Encantos irresistibles
La IA se está infiltrando de forma insidiosa en la sociedad, a pesar de nuestra convicción de que no nos gusta

Crédito: Vasily Baranov vía Pexels
No es ningún secreto que a la mayoría de los estadounidenses no les gusta demasiado la IA. Una encuesta reciente de Athena Insights encontró que al 65% le preocupaba, y una encuesta de junio de Pew Research mostró que el 63% cree que avanza demasiado rápido.
No creo que estas opiniones vayan a cambiar pronto. Pero tampoco estoy segura de que el rechazo declarado de la sociedad hacia la IA nos proteja mucho frente a cambios sociales generalizados. Dicho de otro modo, podemos criticar la IA, pero también somos incapaces de resistirnos a sus encantos.
Unos cuantos titulares de hoy me hicieron pensar en esto. The Guardian y Reuters informaron ambos sobre un estudio publicado por Cambridge University Press, que encontró que los participantes que leían relatos cortos valoraban mejor el trabajo de la IA que el trabajo humano. Es importante señalar que, en uno de los experimentos, los relatos etiquetados como escritos por humanos recibían una mejora en la valoración tanto si la etiqueta era correcta como si no, lo que demuestra que sigue habiendo una fuerte preferencia declarada por la escritura humana, pero esa preferencia no se trasladaba a las valoraciones de calidad. (Por si comparten mi confusión inicial, el experimento usó un diseño que permitió a los investigadores separar el efecto de la autoría real del relato del efecto de la etiqueta humano/IA.)
En una línea parecida, Bloomberg cubrió una encuesta del Collective Intelligence Project según la cual la gente confía más en los chatbots que en los políticos, y alrededor de la mitad de los encuestados preferiría usar los primeros para tomar "decisiones relacionadas con servicios locales como impuestos, permisos o licencias".
No creo que estos hallazgos, por sí solos, sean tan sorprendentes ni preocupantes. Los chatbots suelen ser bastante buenos destilando información abrumadora o llena de jerga en instrucciones claras y fáciles de seguir. Y hay algunas salvedades del estudio sobre la escritura con IA que vale la pena mencionar: solo se tomaron seis relatos como muestra, nunca se preguntó directamente a los participantes qué relato preferían, y algunas partes de la escala de valoración pueden haber favorecido la claridad (en la que la IA destaca) por encima de la calidad literaria.
Aun así, hay algo insidioso en la capacidad de la IA para atender nuestras preferencias de maneras que a menudo son irresistibles. Incluso mientras nos decimos a nosotros mismos y a los demás que no nos gusta, la IA se integra cada vez más en nuestro tejido social. Mantener una opinión pública baja sobre la tecnología no nos ayudará a resistir estos cambios; si acaso, podría actuar como una falsa sensación de seguridad: claro, vamos a adoptarla para seguir siendo competitivos y ahorrar algo de tiempo, pero no se preocupen, seguimos siendo "centrados en lo humano".
El artículo de Bloomberg tuvo cuidado de distinguir la IA como asesora de la IA como decisora, señalando que "aunque la gente puede confiar en la información que escupen los chatbots, solo el 3,7% de las personas está dispuesta a dejar que tome la decisión en sí". No puedo evitar preguntarme: en un mundo donde los modelos de IA actuales ya superan en persuasión a debatientes expertos, ¿estamos seguros de que esa decisión es nuestra?
Sacudida en Google
Demis Hassabis ya no es director ejecutivo; varios investigadores destacados se marchan

Crédito: Leandro Alamino vía Pexels
Demis Hassabis ya no será el director ejecutivo de Google DeepMind, según una noticia de última hora publicada hoy por Axios.
No es el único cambio. El científico jefe Jeff Dean y otros tres investigadores sénior se marchan para fundar Discovery Loop, una empresa que se dedicará a la investigación científica automatizada. TechCrunch añade:
A la startup también le interesa usar la IA para ayudar a crear IA más potente (un proceso conocido como automejora recursiva), lo que dejaría por completo fuera del circuito la iteración humana.
Axios centra el artículo en las dinámicas de la empresa: no está a la altura de OpenAI y Anthropic, varios investigadores destacados ya se han ido, hay informes de baja moral entre los empleados y las acciones de Google han caído.
A mí me interesa más la cita de Hassabis:
He trabajado toda mi vida en pos de la AGI y ahora, como muchos de ustedes, siento que está al alcance de la mano. Es fundamental que acertemos colectivamente con los próximos pasos para asegurar que todo esto salga bien para la humanidad y que inauguremos una nueva era increíble de descubrimiento y asombro.
Hace un año, Hassabis dijo que no entendemos la IA, que no tenemos un diseño técnico para hacer seguros los modelos muy potentes y que, incluso si lo tuviéramos, aún podría ser "existencial para la humanidad" si alguien lo construyera de otra manera. Así que sí, es "fundamental que acertemos colectivamente con los próximos pasos". Pero no parece que estemos ni cerca de un camino para lograrlo... a menos que impongamos una pausa global en la carrera por desarrollar modelos cada vez más potentes antes de que podamos dirigirlos.
Hassabis actuará ahora como científico jefe de Alphabet, la empresa matriz de Google, y también como presidente del consejo de Google DeepMind. Esto significa que estará menos implicado en la gestión y más en la definición de la visión a largo plazo. En mi opinión, debería abandonar el discurso corporativo del "descubrimiento y asombro" y empezar a presionar en serio a favor de esa pausa global.
Los análisis y las opiniones expresados en AI StopWatch reflejan los puntos de vista de los colaboradores individuales y de las fuentes que cubren, y no deben tomarse como posiciones oficiales del Machine Intelligence Research Institute.
