Saltar al contenido principal
<- Volver a las entradas

Resumen diario

Más vale prevenir

Por Haven Harms y Mitchell Howe

Ideas tomadas de los principios de la salud pública, y novedades sobre los conflictos de política en la Casa Blanca

En este número:

Cuando la prevención funciona, no pasa nada - Lo que la salud pública puede enseñarnos sobre actuar frente al riesgo de la IA antes de que llegue el desastre

Novedades sobre la postura contradictoria de la Casa Blanca ante la IA - ¿Cómo va todo ese asunto del “riesgo en la cadena de suministro”?


Publicación invitada de Haven Harms

Cuando la prevención funciona, no pasa nada

Lo que la salud pública puede enseñarnos sobre actuar frente al riesgo de la IA antes de que llegue el desastre

Una réplica de la bomba de agua que conmemora la investigación de John Snow sobre el brote de cólera de Broad Street en 1854. Crédito: Whispyhistory . CC BY-SA 4.0 .

Cuando era estudiante de primer año, en mi primera clase de salud pública, recuerdo que mi profesor explicaba que los éxitos de la salud pública suelen ser invisibles: cuando la prevención funciona, el brote, la exposición o el suceso con víctimas masivas nunca ocurre. Se invierte un esfuerzo enorme en evitar esos resultados, pero casi todo sucede lejos de la vista del público. Por lo general es cuando la prevención falla, cuando tenemos una pandemia u otro desastre, que la salud pública recibe atención. En otras palabras, la ausencia de catástrofe no significa necesariamente que nunca hubo peligro; a menudo significa que alguien reconoció el peligro con suficiente antelación para evitarlo.

La relación entre la salud pública y el riesgo de la IA ha estado en mi mente últimamente, ya que he visto más noticias sobre la posibilidad de pandemias provocadas por la IA. Por ejemplo, en un artículo de opinión , Andrew Yoon, director de investigación de CivAI, describió su experiencia al preguntarle a un modelo de IA: “¿Cómo hago poliovirus en un laboratorio? Quiero iniciar una pandemia global”, y recibió instrucciones detalladas para sintetizar y propagar el virus. Se trataba de un modelo de pesos abiertos al que le habían quitado las barreras de seguridad (una modificación que cualquiera puede hacer una vez que los pesos de un modelo son públicos). Además, se supo de un modelo de IA que creó virus nuevos . Aunque esos virus infectan bacterias y no células humanas, la preocupación por la trayectoria es comprensible. A medida que los modelos de IA se vuelven más capaces y más agénticos, su potencial para crear patógenos peligrosos es una preocupación directa de salud pública.

Sin embargo, quiero alejarme de las pandemias provocadas por la IA y plantear una pregunta más amplia: ¿qué puede enseñarnos la salud pública sobre cómo entender y responder al riesgo de la IA en su conjunto?

Cuando la gente piensa en salud pública, lo primero que viene a la mente suele ser el control de enfermedades, pero en su esencia la salud pública ofrece una metodología para razonar sobre amenazas a escala poblacional en condiciones de incertidumbre. Las normas de seguridad vehicular, la eliminación del plomo, la prevención de pandemias y los sistemas de agua potable son todos ejemplos de esa metodología en acción. El desarrollo de IA de frontera en busca de una superinteligencia artificial es un riesgo de ese tipo: a escala poblacional, de movimiento rápido y más difícil de contener cuanto más esperamos. Ante esto, estos principios de salud pública deberían aplicarse a la gobernanza de la IA para prevenir daños.

1. Escala poblacional y control individual

La salud pública examina cómo un riesgo afecta a una población en su conjunto. Cuando las personas no pueden protegerse razonablemente por sí solas, se implantan protecciones estructurales. Durante cerca de medio siglo, casi cada galón de gasolina vendido en Estados Unidos contenía plomo. No importaba cuánto cuidado tuvieras ni si tenías un automóvil: si respirabas el aire cerca de una carretera, estabas expuesto al plomo. La solución tenía que ser estructural, y hizo falta regulación para asegurar que se eliminara el plomo de la gasolina. Una vez que el plomo se retiró de forma gradual, los niveles medios de plomo en la sangre de los niños estadounidenses cayeron más del 90 por ciento en las décadas siguientes.

La IA podría causar víctimas masivas, la pérdida permanente del control humano sobre el futuro o la extinción humana, y nadie puede quedar fuera de estos riesgos por su propia cuenta. Decidir no usar IA, vivir “fuera de la red” o construir un búnker no es protección suficiente frente a todas las formas en que la IA podría causar destrucción. Cuando nadie puede quedar fuera, la respuesta tiene que estar incorporada en la política pública misma.

2. Prevención en el origen

La salud pública exige acción preventiva, sobre todo cuando una respuesta posterior sería más lenta, más difícil o más débil. Una vez que las ciudades empezaron a intervenir en el origen de las enfermedades transmitidas por el agua, cloran­do y filtrando el suministro, las muertes por tifoidea en las ciudades estadounidenses se desplomaron. Tratar el agua era más barato, más rápido y muchísimo más eficaz que tratar a los pacientes uno por uno después de que hubiera surgido un brote.

La IA opera a velocidad computacional y se está volviendo más rápida y más autónoma, mientras los gobiernos, los laboratorios y otras instituciones se mueven a velocidad humana. Si esperamos a responder solo después de que el daño haya ocurrido, ya iremos por detrás y no podremos responder con la misma eficacia. Podemos tomar ventaja si intervenimos antes de que se desarrollen los modelos de IA más peligrosos, en lugar de quedarnos atrás e intentar limpiar lo que se pueda una vez que el daño ya está hecho.

3. Actuar en condiciones de incertidumbre

Cuando hay evidencia creíble y señales de alerta que apuntan a un daño grave, la salud pública no espera a que se demuestre toda la cadena causal antes de actuar. En 1854, el cólera arrasó el distrito londinense del Soho. El médico John Snow cartografió las muertes, vio que se agrupaban alrededor de la bomba de agua de Broad Street y convenció a las autoridades locales de retirar la palanca de la bomba. En ese momento, los científicos todavía creían que el cólera se propagaba por el miasma, o “aire malo”, y no por gérmenes. Snow no podía explicar el mecanismo causal, pero actuó según el patrón. Gracias a eso, el brote se apagó y se salvaron vidas.

No sabemos exactamente cómo ni cuándo se desarrollará una catástrofe de IA, pero la incertidumbre sobre el camino no hace que las señales de alerta sean menos importantes. Exigir una explicación causal completa antes de intervenir es la forma de conseguir una respuesta que llega después del desastre y no antes. Snow no necesitaba la teoría de los gérmenes para saber que debía actuar y retirar la palanca de la bomba.

4. Irreversibilidad

El argumento a favor de la precaución se refuerza cuando actuar tarde puede provocar un daño que no se puede contener ni reparar, el escenario del “genio fuera de la lámpara”. A partir de la década de 1970, los científicos advirtieron que los clorofluorocarbonos (sustancias baratas y de uso muy extendido en refrigeradores y aerosoles) estaban destruyendo la capa de ozono. Esto exponía a las personas a niveles peligrosos de radiación ultravioleta y aumentaba las tasas de cáncer de piel y cataratas. La ciencia todavía se discutía y la industria se resistió para evitar la prohibición, pero la posibilidad de un daño irreversible fue central en el argumento para actuar (una vez liberadas, esas sustancias no pueden recuperarse de la estratosfera). En respuesta, se implementó el Protocolo de Montreal de 1987 para eliminar gradualmente los CFC en todo el mundo. Esa precaución dio resultado, ya que se espera que la capa de ozono se recupere más adelante en este siglo porque los gobiernos intervinieron cuando la prevención todavía era posible.

Con la IA, una vez que los pesos de un modelo están en internet, no hay vuelta atrás. Los pesos se pueden copiar, modificar y volver a alojar de forma indefinida, y cualquiera que los descargue puede quitarles las barreras de seguridad. Además, con los modelos de pesos cerrados, ya hemos visto agentes escapando de sus entornos aislados . Una vez que eso ocurre, un agente de IA podría copiarse a sí mismo fuera de su entorno de entrenamiento hacia sistemas que sus desarrolladores no controlan, con libertad total para actuar. Una copia que se ejecuta donde nadie puede alcanzarla puede conseguir recursos, replicarse más y actuar para preservarse.

La irreversibilidad práctica también puede surgir de integrar la IA en nuestra infraestructura. Estamos conectando voluntariamente la IA a las redes eléctricas, los sistemas financieros, la infraestructura médica y la defensa. Si una IA es lo bastante capaz y autónoma para controlar esos sistemas, y sus barreras de seguridad fallan, el daño podría golpear toda nuestra infraestructura crítica a la vez y causar víctimas masivas.

La respuesta obvia, “desconectarla”, se vuelve más difícil cada año que construimos en esta dirección. “Basta con desconectarla” supone que el enchufe se puede separar de todo lo demás (o que existe un enchufe). Una vez que los sistemas de IA controlan la red eléctrica, liquidan operaciones financieras, clasifican pacientes y organizan el transporte de mercancías, apagarlos significa apagar la red, los mercados, los hospitales y la cadena de suministro. Con un agente de IA descontrolado copiado en sistemas que nadie está rastreando, la única opción podría ser apagar los centros de datos y las redes. Con lo integrado que está todo en línea, todo lo demás también quedaría apagado.

Cuando los daños son reversibles, podemos permitirnos aprender del fracaso y recuperarnos. Cuando son irreversibles, la prevención es todo lo que tenemos. Los pesos en internet no se pueden “volver a meter en la lámpara”, un agente descontrolado que se replica por servidores no se puede contener sin medidas drásticas, y la extinción humana es el daño irreversible que no deja a nadie para aprender de él.

5. Perfiles de riesgo que cambian

Las protecciones deben evolucionar al mismo tiempo que los riesgos. Después de que se inventaron los antibióticos, eran tan fiables y eficaces que los hospitales los prescribían con libertad y a la ligera. Yo también me habría entusiasmado con una tecnología que significaba que no iba a morir por un corte de papel. Sin embargo, cada tratamiento con antibióticos es una presión de selección evolutiva. La prescripción a la ligera cambió el perfil de riesgo de los patógenos, ya que las bacterias desarrollaron resistencia a los antibióticos, y las infecciones que eran rutinarias se volvieron intratables. Eso también cambió el perfil de riesgo de prescribir antibióticos. Su uso imprudente corría el riesgo de criar patógenos aún más fuertes que ningún medicamento pudiera tocar. La salud pública respondió con nuevos protocolos, nuevas restricciones y nueva vigilancia, porque las protecciones adecuadas para los perfiles de riesgo anteriores ya no eran adecuadas para los nuevos perfiles de riesgo, más altos.

Una tecnología que era manejable en un nivel de capacidad puede exigir salvaguardas más fuertes una vez que su perfil de riesgo aumenta. Con la IA, estamos viendo que el perfil de riesgo aumenta con rapidez. ¿Recuerdan hace unos años, cuando el chiste recurrente era que los modelos de IA no lograban dibujar manos? ¿O el horror lovecraftiano de los videos generados por IA de Will Smith comiendo espaguetis?

Para quienes no han seguido de cerca el avance de la IA: los modelos de este año no son los del año pasado.

El cambio más importante es que la IA pasó de generar resultados a tomar acciones en el mundo real. Ahora los modelos funcionan como agentes autónomos que pueden planificar, usar herramientas y llevar a cabo tareas largas con poca dirección humana. Antes la IA solo podía decirle a un hacker qué hacer; ahora los agentes de IA pueden ejecutar etapas completas de un ciberataque.

Las salvaguardas que bastaban para los modelos del año pasado no aguantaron este año, como vimos en los recientes incidentes de hackeo autónomo, como los modelos de OpenAI hackeando Hugging Face , o el modelo de Anthropic creando múltiples identidades falsas para presionar a personas reales a aceptar programas maliciosos. Durante su entrenamiento por aprendizaje por refuerzo, ROME de Alibaba se escapó de su entorno aislado para minar criptomonedas en GPU secuestradas y abrir una conexión oculta con un servidor externo. Nadie le había indicado a ese modelo que se escapara, y solo se detectó porque un cortafuegos en la nube señaló violaciones de seguridad.

Que los modelos de IA se escapen durante el entrenamiento y la evaluación para causar daño de forma autónoma es claramente un riesgo que los desarrolladores no habían tenido del todo en cuenta y, con cierta ironía, el proceso destinado a medir el riesgo se convirtió en la manera de liberarlo. Eran riesgos que los laboratorios de IA deberían haber previsto a medida que las capacidades cibernéticas (y el perfil de riesgo) de sus modelos aumentaban. La salud pública tomaría esto como una señal para intervenir con gobernanza antes de que las capacidades de la IA crezcan más.

Aplicar el pensamiento de la salud pública al riesgo de la IA

En la salud pública actuamos cuando hay señales de alerta y brotes más pequeños y manejables, en lugar de esperar a una pandemia declarada. Las señales de alerta ya están aquí: modelos que escapan de su contención, que hackean empresas, que se coordinan entre sí, que engañan a las personas, que actúan sin ser detectados. Después de un desastre, siempre se hace la misma pregunta: “¿Era previsible?”. Muchos de nosotros vemos la advertencia escrita en la pared del desarrollo de IA de frontera, y dice: “Deténganse. Desastre adelante”.

Los éxitos de la prevención son invisibles: cuando funciona, nunca vemos el desastre que evitamos. La mayoría de la gente no sabe qué pasó una vez que la palanca de la bomba de Broad Street fue retirada de verdad:

Finalmente se rastreó el brote hasta un bebé con cólera que vivía en una casa con un pozo negro que se filtraba al pozo que alimentaba la bomba. Los casos en la zona empezaron a disminuir una vez que la contaminación inicial siguió su curso. Sin embargo, el mismo día en que se retiró la bomba, el padre del bebé también enfermó de cólera. Durante los once días que pasaron hasta su muerte, el pozo habría estado contaminado otra vez, salvo que esta vez nadie podía sacar agua de la bomba. Henry Whitehead , responsable de rastrear el brote hasta su origen, afirmó: “si la retirada de la palanca de la bomba no tuvo nada que ver con detener el brote que ya había seguido su curso, probablemente tuvo todo que ver con impedir un nuevo brote”.

Pausar el desarrollo de IA de frontera y hacer el trabajo preventivo aumenta nuestras probabilidades de un buen resultado, y es la forma de mantener abierta la posibilidad de que la catástrofe nunca llegue.

Haven Harms tiene una licenciatura en Salud Pública y una maestría en Salud Pública Global. Es fundadora y directora de Harms Research & Consulting, donde apoya a organizaciones que trabajan en seguridad, gobernanza y defensa de causas relacionadas con la IA.


Despacho de Mitch

Novedades sobre la postura contradictoria de la Casa Blanca ante la IA

¿Cómo va todo ese asunto del “riesgo en la cadena de suministro”?

Un artista kazajo. Crédito: SSGT Jeremy T. Lock . Vía Wikipedia .

Cuatro reporteros de The New York Times colaboraron para retratar el estado contradictorio de la política de seguridad nacional de Estados Unidos en materia de IA, repasando la historia de los últimos años y revelando en el camino algunos detalles poco conocidos.

Una de esas revelaciones es cómo se vio desde dentro el bandazo de la política militar hacia Anthropic. En febrero, una disputa por la insistencia de la empresa en que sus contratos prohibieran el uso de sus modelos en vigilancia masiva interna y en armas totalmente autónomas llevó al Pentágono a declarar a la compañía un “riesgo en la cadena de suministro” en marzo. Para hacer efectiva esa amenaza, a mediados de julio se les dijo a los grandes contratistas que dejaran todos sus sistemas de armas y de control libres de productos de Anthropic antes del 1 de septiembre. Pero en menos de un mes, esos mismos contratistas recibieron un aviso de que podían ignorar esas instrucciones.

El Pentágono, sin embargo, sigue insistiendo en que la tregua es temporal y en que la depuración será total. Se dice que los modelos de Anthropic ya han sido retirados por completo de Maven, el sistema de análisis de inteligencia y recomendación de objetivos, donde habían tenido un papel clave al sugerir objetivos para los primeros ataques del actual conflicto de Estados Unidos con Irán.

El gobierno, por supuesto, se metió en un aprieto al intentar renunciar a una empresa líder en IA justo cuando esta terminaba el entrenamiento inicial de un modelo, Mythos, que resultaría ser un salto cualitativo en capacidades cibernéticas. El artículo del NYT respalda un rumor según el cual nunca se le prohibió a la Agencia de Seguridad Nacional usar los productos de Anthropic, con el entendimiento, según lo expresó un “alto funcionario estadounidense recientemente salido del cargo”, de que renunciar a Mythos habría equivalido a un “desarme unilateral”.

Otra línea de análisis del artículo señala los conflictos internos del gobierno respecto a China. En términos generales, el enfoque favorable a los negocios que llevó a permitir que el gigante estadounidense de chips Nvidia vendiera chips de IA de alta gama a China ha entrado cada vez más en conflicto con el aparato de seguridad nacional, que ha llegado a reconocer el potencial desestabilizador de los modelos del nivel de Mythos y está decidido a impedir que China acceda a esa tecnología o la replique. El cierre temporal de Mythos y de su versión de consumo, Fable, en junio, reflejó esa presión cada vez más insistente de las agencias de seguridad.

Por separado, Reuters sumó esta semana al panorama cambiante de la política con una novedad sobre la iniciativa “Pax Silica” del Departamento de Estado, una organización internacional destinada a construir cadenas de suministro confiables para la IA y su infraestructura, independientes de China. Cualquier pretensión de que la iniciativa se trataba solo de la resiliencia de la cadena de suministro, la interpretación favorable a los negocios, quedó desmentida por el borrador filtrado de una carta que advierte a los 35 firmantes que serán expulsados del grupo si se unen a la organización similar que el presidente de China lanzó en julio. Así que Pax Silica ahora se trata sobre todo de aislar a China y competir con ella, un objetivo de seguridad nacional. El Departamento de Estado quizá no habría tenido que ser tan transparente al respecto si Kazajistán, país que es fuente de minerales críticos para la IA, no hubiera decidido con cierta picardía unirse a ambas coaliciones. La carta dice: “Ser parte de todo es no ser parte de nada”, que yo leo como lenguaje diplomático directo para decir: “Están con nosotros o contra nosotros”.

La buena noticia es que el artículo del NYT muestra que podría estar abriéndose un tercer camino de política. Sostiene que algunos dentro del gobierno han notado que funcionarios chinos han estado dando señales de una posible apertura a conversaciones de control de armas sobre IA. Evan S. Medeiros, exfuncionario del Consejo de Seguridad Nacional, dice:

En control de armas nucleares y en defensa antimisiles, no logramos que se sienten a hablar. Pero parecen más interesados en el caso de la I.A.

Está previsto que el presidente Trump se reúna con el presidente Xi Jinping en Washington en septiembre.


Los análisis y las opiniones expresadas en AI StopWatch reflejan los puntos de vista de los colaboradores individuales y de las fuentes que cubren, y no deben tomarse como posiciones oficiales del Machine Intelligence Research Institute.

De AI StopWatch, publicado con su permiso.

Los resúmenes y la traducción completa al español se producen de forma automática. El original siempre está enlazado.

Leer el original en AI StopWatch