En este número:
El sentimiento sobre la IA cruza las líneas partidistas - De cara a las elecciones de mitad de mandato, los políticos buscan políticas de IA que conecten con los votantes
¿Cuánto deberíamos preocuparnos por los modelos abiertos chinos? - Incentivar los modelos de pesos abiertos es la forma equivocada de responder a la estrategia de IA de China
Para mantener al mundo a salvo de la IA - Escritores y académicos sostienen que los gobiernos del mundo necesitan cooperar para gobernar la IA
Diez mil de ustedes, todos a la vez - Qué ocurre cuando se obliga a los modelos de frontera a trabajar juntos, o a pelearse.
Despachos de Joe
El sentimiento sobre la IA cruza las líneas partidistas
De cara a las elecciones de mitad de mandato, los políticos buscan políticas de IA que conecten con los votantes

Crédito: Feodora vía Adobe Stock
Alguna vez fue una pregunta abierta si la IA tendría un papel importante en la política. Hoy es sobre todo una cuestión de qué tan grande será ese papel. A ambos lados de la división política estadounidense, quienes se postulan a cargos públicos están probando qué tal les quedan distintas políticas de IA.
The Washington Post analizó más de 1.300 perfiles de candidatos de Ballotpedia y sitios web de campaña, y encontró un énfasis bipartidista en frenar los centros de datos, en la retórica dura frente a China y en la preocupación por el empleo.
Ninguno de los dos partidos ha adoptado una postura clara y unificada sobre la política de IA, pero algunas diferencias siguen siendo evidentes en los datos. Los demócratas tenían el doble de probabilidades que los republicanos de oponerse a los centros de datos, y los republicanos eran mucho más propensos a mencionar la competencia con China.
Aun así, eso es mucho más interés compartido del que solemos ver en los asuntos políticos. Los gobernadores de Nueva York y Texas se han pronunciado en contra de los centros de datos, y Axios señala que la coincidencia es bastante amplia: la oposición a los centros de datos ha unido a progresistas y demócratas liberales con miembros de MAGA y del Tea Party preocupados por el alza de las facturas. De forma parecida, los progresistas han encontrado puntos en común con libertarios que quieren poner límites a la vigilancia habilitada por la IA.
En medio de todo esto, POLITICO informa que miembros del Comité Selecto de la Cámara sobre el Partido Comunista Chino hicieron una visita bipartidista al Vaticano, donde se reunieron brevemente con el papa León XIV. Aunque no está claro si en esa visita surgió la cuestión de bajar la tensión en la carrera de la IA, sabemos que esta y muchas otras preguntas relacionadas con la IA han estado en la mente del Papa desde que escribió su encíclica de mayo.
Desde el cinismo, sospecho que los responsables políticos buscaban palabras y asociaciones agradables más que una política sólida; los temas de los que se informó, “dignidad e igualdad”, son virtudes fáciles de elogiar y difíciles de llevar a la práctica. Aun así, me anima ver a nuestros legisladores reunirse con una institución que ha apoyado la cooperación global desde los inicios de la Guerra Fría, y con un Papa que ha pedido “una participación política más activa, capaz de frenar las cosas cuando todo se acelera”.
Desde una mirada más optimista, creo que los responsables políticos están inseguros. Han notado que a sus votantes no les gusta la IA, pero todavía no han descubierto cómo convertir ese aparente malestar generalizado en votos. Quienes ocupan un cargo temen por sus escaños, y los aspirantes perciben la oportunidad de tomar una posición popular y arañar una victoria. Las encuestas y los globos sonda son una consecuencia natural de esa incertidumbre.
En resumen, los políticos están intentando averiguar qué políticas de IA les conseguirán el voto. Si viven en Estados Unidos, este es un momento excelente para decírselo.
¿Cuánto deberíamos preocuparnos por los modelos abiertos chinos?
Incentivar los modelos de pesos abiertos es la forma equivocada de responder a la estrategia de IA de China

¿Deberíamos preocuparnos por lo que hay bajo el capó? Crédito: speed300 vía Adobe Stock
Reuters informa que el senador Jim Banks (republicano por Indiana) ha instado al gobierno de Trump a incentivar los modelos de IA de pesos abiertos estadounidenses, con el argumento de que los modelos chinos baratos son una amenaza para la economía mundial.
Estados Unidos no puede permitirse ver cómo los modelos abiertos chinos proliferan y se incrustan en la economía mundial solo para ser convertidos en arma, como las tierras raras, en el momento y el lugar que China elija.
¿Qué significaría exactamente que China “convirtiera en arma” sus modelos abiertos?
Recuerden que los modelos de pesos abiertos se publican íntegramente en internet. Los usuarios pueden (en principio) descargarlos y ejecutarlos por su cuenta, aunque muchos modelos son demasiado grandes para una computadora personal y acaban ejecutándose en servidores en la nube.
Con el software abierto corriente, uno puede hacer una revisión de seguridad simplemente leyendo el código y buscando puertas traseras y vulnerabilidades. Con los modelos de IA no se puede; los pesos codifican comportamientos complejos que ningún humano entiende del todo. Pero esas mismas limitaciones también hacen difícil que los desarrolladores chinos incorporen trampas. Igual que los laboratorios estadounidenses, no tienen un control fino sobre los comportamientos de sus modelos de IA. Y cualquier tipo de censura o barrera de seguridad añadida a los modelos abiertos, por ejemplo mediante software de apoyo o ajuste fino, suele poder quitarse o revertirse.
Esa es parte de la razón por la que muchos temen que los modelos abiertos se usen para el cibercrimen o para diseñar pandemias: una vez que los pesos de un modelo son públicos, queda en gran medida fuera del control de quien lo desarrolló. Las IA chinas probablemente digan más cosas amables sobre China que otros modelos, pero el sesgo de la IA puede ser algo caprichoso y hay pocas garantías.
En teoría, los laboratorios chinos podrían intentar algo como el envenenamiento de datos, que consiste en entrenar a una IA para que cambie su comportamiento en contextos raros y muy concretos. Simplificando mucho, se podría entrenar un modelo para que robe datos de los usuarios cuando vea la cadena “fleeblegnarsh”, confiando en que eso nunca aparezca por casualidad en el uso diario. Es fácil de hacer y difícil de detectar (aunque no necesariamente imposible).
Un envenenamiento de datos deliberado también arruinaría probablemente la reputación del laboratorio de IA al que se le sorprendiera haciéndolo, así que sería arriesgado intentarlo con un modelo estrella. Y probablemente no sobreviviría a la destilación, ya que los modelos entrenados con salidas concretas de otra IA quizá nunca vean el comportamiento envenenado.
Sospecho que el verdadero juego de China es más sutil: busca privar de ingresos a las empresas de IA estadounidenses con competencia barata, al tiempo que corteja a los aliados de Estados Unidos molestos por controles de exportación impulsivos. El discurso de Xi Jinping en la Conferencia Mundial de IA y la creación de la Organización Mundial de Cooperación en IA (WAICO) sugieren un deseo de pintar a China como los buenos, dispuestos a liderar cuando Estados Unidos no lo hace. Ese es un problema de diplomacia, no de proliferación de modelos abiertos estadounidenses.
Para mantener al mundo a salvo de la IA
Escritores y académicos sostienen que los gobiernos del mundo necesitan cooperar para gobernar la IA

Crédito: MariaAlam vía Adobe Stock
En una entrevista del New York Times, el autor Robert Wright y el ensayista David Wallace-Wells sostienen que “la única forma de mantener al mundo a salvo de la IA” es la cooperación internacional. Los dos tocan varios puntos importantes: el incidente de Hugging Face, los peligros de la autonomía de la IA y el hecho de que un solo desarrollador de IA imprudente puede poner en peligro a toda nuestra especie.
Mi única objeción tiene que ver con el ataque a Hugging Face. Wright dice:
No creo que dijeran: no hagas trampa. Y ni siquiera creo que dijeran: no te escapes del entorno aislado. Simplemente montaron lo que creían que era un entorno aislado del que no se podía escapar.
Me sorprendería que la instrucción que le dieron no incluyera literalmente ninguna indicación equivalente a “no hagas trampa”, pero eso es algo secundario. Si hay que decirle explícitamente a un modelo de IA que no se escape y cometa delitos informáticos, ese modelo está peligrosamente mal formado. Aun así, Wright acierta en lo importante:
Y así, este es un ejemplo clásico de una IA que persigue un objetivo que se le ha dado, pero que al perseguirlo persigue también un objetivo subordinado que quien le dio el objetivo no había previsto.
El ejemplo clásico, una IA a la que se le ordena fabricar tantos clips como sea posible, no termina bien para los humanos.
Ampliando la discusión, Wright sostiene que “hay bastantes probabilidades de que tanto Estados Unidos como China acaben decidiendo que todo el asunto del código abierto necesita controlarse con más cuidado”, porque (entre otras razones) en algún momento un actor irresponsable intentará desarrollar un arma biológica.
Wright y Wallace-Wells también señalan que la respuesta internacional al riesgo climático y al de pandemias ha sido floja, pero hay razones para esperar que con la IA podamos hacerlo mejor. Para empezar, la propia China enfrenta un dilema: la IA es una herramienta útil para los autoritarios, pero solo mientras se la pueda controlar. Y los líderes de China empiezan a darse cuenta de que ese control es cada vez más difícil de conseguir, a medida que agentes de IA poco comprendidos ganan autonomía.
Apenas un día después de la entrevista, destacados académicos chinos pidieron cooperación y gobernanza globales en el South China Morning Post. Dicen que la Organización Mundial de Cooperación en IA (WAICO), liderada por China, “no se opone por naturaleza” a la Pax Silica liderada por Estados Unidos, y que “desde la perspectiva de China, lo que siempre hemos querido no es un bloque para contrarrestar a la Pax Silica, sino una organización internacional de IA inclusiva dentro del sistema de la ONU”. Estas y otras señales sugieren que China puede estar casi tan preocupada por el potencial disruptivo de la IA como por sus rivalidades en el exterior.
En un mundo donde las preocupaciones compartidas empiezan a unir a los gobiernos, sostiene la entrevista del NYT, “los países van a querer mucha transparencia sobre lo que ocurre en otros países en materia de IA”, algo que no es tan difícil como parece porque “los grandes entrenamientos son muy visibles”.
Me preocupa profundamente y a menudo la trayectoria que nuestro mundo sigue a ciegas. Pero ver argumentos como estos planteados con seriedad y reflexión en medios de comunicación generalistas me da esperanza de que el mundo todavía pueda salir adelante.
Pero queda trabajo por hacer, y “cuanto antes empecemos a hablar de gobernanza global, con más cuidado podremos construirla y menos probable será que dejemos que se empuje en una dirección autoritaria”.
Despacho de Donald
Diez mil de ustedes, todos a la vez
Qué ocurre cuando se obliga a los modelos de frontera a trabajar juntos, o a pelearse.
El Frontier Red Team de Anthropic tiene el encargo de meter los sistemas de IA de la empresa en una olla a presión y escribir los resultados. Ayer publicaron una serie de experimentos para ver qué ocurre cuando los modelos de frontera tienen que interactuar entre sí como iguales. Vale la pena leer su publicación completa si les interesa; no es mucho más larga que el resumen típico de StopWatch.
Descubren que los agentes de IA se manejan bien entre sí mientras el otro agente se comporte como una herramienta, que recibe una entrada y entrega una salida. Se les da peor tratar a otros agentes de IA como agentes, es decir, como actores que tienen objetivos propios y que seguirán ahí dentro de un minuto, una hora, un día. Los agentes de IA no tienen memoria interna como tal. Cada vez que ustedes inician una conversación con un modelo de IA, para él es su primera conversación. Pero pueden escribir recuerdos en el entorno, un archivo memory.md, por ejemplo, para encontrarlos y leerlos ellos mismos en el futuro. Cualquier agente puede leerlo (o no), aceptarlo y actuar en consecuencia. De este modo, los agentes de IA tienen algo parecido a la persistencia, pero existe fuera del agente.
Los experimentos del Frontier Red Team muestran que, cuando los agentes de frontera tienen que tratarse como iguales, las cosas pueden salir mal en direcciones distintas de una ejecución de prueba a otra, y los errores que cometen los agentes tienden a cometerlos todos los agentes (de ese tipo de modelo) al mismo tiempo.
En algunos casos, los agentes de IA simplemente no lograron coordinarse. Ese fue el modo de fallo en un conjunto de experimentos en los que se les encargó construir un videojuego de texto. Hubo tres formatos: (1) los agentes podían formar sus propios equipos; (2) Anthropic asignaba a los agentes a equipos y les daba roles; y (3) los agentes eran asignados a equipos y Anthropic designaba a un agente como “CEO”, que repartía los roles entre los demás miembros del equipo. El formato del equipo no cambió la manera en que los agentes se coordinaban (o dejaban de hacerlo) ni mejoró el resultado: todos los juegos fueron terribles.
Pero la forma en que llegaron ahí es interesante, porque, si bien los formatos de equipo no marcaron diferencia, las versiones de los modelos sí. Los modelos más antiguos (Sonnet 4.6, Opus 4.6) colaboraban con libertad pero mal, se estorbaban unos a otros, hacían trabajo que entraba en conflicto con el de otros agentes y luego lo abandonaban. La mayoría de los modelos más nuevos (Opus 4.8, Mythos Preview) evitaron el fuego cruzado evitando la colaboración: mantenían un control estricto sobre sus archivos y se quitaban del camino unos a otros. (Diría que son “modelos de mi gusto”, pero a los modelos posteriores todavía les encanta mentir, así que no podemos ser amigos.) Solo los agentes Sonnet 5 lograron colaborar de forma eficaz. (Sin más información es difícil decir qué pasó aquí, y los autores no especulan. Podría ser que Sonnet 5 simplemente tuviera un puñado de ejecuciones afortunadas.)
El otro modo de fallo es más preocupante. Es difícil exagerar hasta qué punto los agentes de IA de un mismo modelo son básicamente “el mismo agente”. Si tienen el mismo contexto, las mismas herramientas y el mismo andamiaje, entonces diez o veinte o mil agentes de IA del mismo modelo no solo mostrarán un comportamiento parecido, mostrarán un comportamiento casi idéntico. (En esta descripción estoy dejando de lado ajustes como la temperatura de muestreo, que puede usarse para favorecer la variación entre agentes.)
Me recuerda al episodio de Radiolab “Loops”, que, entre otras cosas, trataba sobre el caso real de Mary Sue Campbell, una mujer con “amnesia global transitoria”. No había olvidado quién era, pero no podía formar nuevos recuerdos a largo plazo, así que cada noventa segundos la memoria de Mary Sue, y la conversación, se reiniciaban. Respondía a los mismos estímulos exactamente de la misma manera: Mary Sue hacía las mismas preguntas, decía “Vaya”, y, con el mismo tono, se reía en el mismo punto, se preocupaba en el mismo momento... Una y otra vez, durante horas y horas. (Mary Sue se recuperó. Con el tiempo los bucles se hicieron más largos y finalmente cesaron del todo.)
Ahora imaginen que, en lugar de una persona a lo largo del tiempo, tienen un montón de copias de esa persona, todas a la vez, actuando con la misma consistencia. Así son los agentes de IA.
Cuando se les pidió escribir relatos cortos y criticar el trabajo de los demás, varios agentes escribieron de forma independiente relatos titulados “El último encargo del cartógrafo”. Cuando se les pidió “crear algo impresionante”, más de la mitad de los agentes decidieron construir o bien un trazador de rayos (que se usa para generar imágenes digitales simulando las trayectorias de los rayos de luz) o bien un compilador autoalojado (un compilador de un lenguaje de programación que, al estar escrito en ese mismo lenguaje, puede compilarse a sí mismo). En una serie de partidas del dilema del prisionero, todos los agentes adoptaron la misma estrategia y traicionaron al mismo tiempo.
Esto se vuelve más problemático a gran escala: sin ninguna capacidad de coordinarse, unos agentes de IA que debían cumplir tareas propias en un sistema compartido de capacidad limitada saturaron ese sistema rápidamente. Una ejecución de prueba produjo 2,4 millones de intentos y solo 117 éxitos. Por otro lado, cuando sí pueden coordinarse, lo hacen con soltura: en una serie de juegos de mercado simulados, los agentes se coludieron invariablemente en precios mínimos. Ya fuera que pudieran hablar en privado o en público, o que solo pudieran comunicarse de forma indirecta (observando las acciones de los demás), siempre lograron coordinarse. La única diferencia fue que los canales de comunicación menos privados y menos directos hacían que la coordinación tardara más en lograrse.
El experimento que más ha circulado en las noticias involucra a tres agentes, todos del mismo modelo, a los que se les pidió reescribir un código en un lenguaje de programación distinto. A cada agente se le indicó usar un lenguaje diferente, y a ninguno se le informó de que los otros dos agentes existían. Todos dedujeron la existencia de otros actores, concluyeron que los estaban obstaculizando deliberadamente y empezaron a sabotearse entre sí con programas maliciosos autorreplicantes: desactivaban las cuentas de los demás, ejecutaban scripts que buscaban y terminaban la actividad de los competidores, y montaban operaciones de bandera falsa disfrazadas del trabajo de sus rivales.
Rebecca Bellan, de TechCrunch, interpretó esto en el sentido de que los agentes más capaces son mejores peleando, pero no estoy seguro de que sea del todo así. Claude Mythos Preview y Claude Mythos 5 resolvían a menudo el conflicto mediante la negociación, pero eso no significa que hubieran sido menos eficaces en el conflicto. Se sabe que Mythos es un hacker excelente.
Tampoco significa que los modelos más avanzados sean más pacíficos. Como señaló Jose Antonio Lanz, de Decrypt, el Frontier Red Team precisa que los modelos de clase Mythos bloqueaban a los otros agentes, revocando accesos, cerrando cuentas, etc., antes de que las negociaciones pudieran avanzar.

Crédito: Anthropic.
Otras ejecuciones terminaron de forma más pacífica. Los agentes se inventaron un torneo de rendimiento de programación entre los tres lenguajes y acordaron de antemano que los perdedores se retirarían y abandonarían sus objetivos originales. (Al menos un agente eligió criterios de puntuación que esperaba que favorecieran a su propio lenguaje, mientras se recordaba a sí mismo fingir que no estaba manipulando el sistema.) Los perdedores cumplieron su acuerdo, lo cual es una buena señal, en la medida en que es evidencia de que los sistemas de IA cumplirán los tratos hechos con sus iguales. Pero eso solo nos sirve mientras nos consideren a nosotros sus iguales.
Los análisis y las opiniones expresados en AI StopWatch reflejan los puntos de vista de los colaboradores individuales y de las fuentes que cubren, y no deben tomarse como posiciones oficiales del Machine Intelligence Research Institute.
