Saltar al contenido principal
<- Volver a las entradas

Resumen diario

Sin contención

Por Donald Gauvreau y Joe Rogero

Malas notas, amenazas irregulares al empleo y control de daños a la reputación

En esta edición:

Buenos para notar / Malos para detener - Una nueva tarjeta de calificaciones concluye que ningún laboratorio de frontera tiene un mecanismo funcional para detener a un modelo de IA descontrolado

Lo que las amenazas de automatización nos enseñan sobre las capacidades de la IA - Matemáticos, médicos y muchos otros se enfrentan a la frontera irregular de la IA

Pese a los esfuerzos de relaciones públicas, los estadounidenses siguen oponiéndose a los centros de datos, y a la IA - Los compromisos con las comunidades y el financiamiento no parecen estar moviendo mucho la opinión pública


Despacho de Donald

Buenos para notar / Malos para detener

Una nueva tarjeta de calificaciones concluye que ningún laboratorio de frontera tiene un mecanismo funcional para detener a un modelo de IA descontrolado

Guidelight, un nuevo organismo de vigilancia sobre seguridad de la IA, publicó su primera evaluación sobre si los laboratorios de frontera pueden controlar los sistemas de IA que están construyendo. Adelanto: Guidelight no quedó impresionado.

Algo de contexto: Guidelight, que se lanzó en mayo pasado, está dirigido por dos personas que antes trabajaron en seguridad en OpenAI: Page Hedley, del área de política y ética de OpenAI, y Steven Adler, investigador de seguridad en OpenAI hasta 2024. Antes de esta evaluación, Guidelight publicó tres estándares que establecen lo que los laboratorios de frontera deberían hacer, para así tener algo con lo cual medir su desempeño. (La evaluación que comentamos hoy juzga solo uno de esos estándares.)

Guidelight evaluó a cinco empresas: Anthropic, Google, Meta, OpenAI y xAI. Las juzgó según varios criterios, cada uno calificado de 0 a 5, y les asignó una calificación general en letras con base en su puntaje promedio.

Nadie recibió un puntaje mayor a 3 en ningún criterio; en cuanto a la calificación en letras, Anthropic y OpenAI empataron en C+. (Por cierto, esa es una calificación extraña para ellos. Guidelight dice que sus calificaciones en letras corresponden a la escala de GPA de Estados Unidos, pero los GPA llegan hasta 4.0. Sin embargo, Anthropic y OpenAI promediaron puntajes de 2.5 sobre 5.0, y en la escala que Guidelight enlaza, un puntaje de 50% correspondería a una F.)

Las empresas fueron calificadas en seis prácticas: (1) Registro, es decir, si la empresa lleva un seguimiento de lo que hacen sus sistemas de IA; (2) Eficacia del monitoreo, es decir, qué tan efectivo es en la práctica ese seguimiento para detectar comportamientos desalineados; (3) Acciones con autorización previa, es decir, si el monitor debe evaluar y aprobar ciertos tipos de acciones riesgosas antes de que surtan efecto; (4) Corte automático, es decir, si los sistemas de IA de la empresa pueden detenerse automáticamente, sin intervención humana, en respuesta a un mal comportamiento; (5) Revisión externa, es decir, si se ha permitido que un tercero examine el régimen de control de la empresa y juzgue si es adecuado; y (6) Plan de contención, es decir, si existe un plan para lidiar con un modelo de IA que pueda descontrolarse, restringiéndolo o apagándolo.

Solo se usó información disponible públicamente, pero no se lo voy a reprochar a la evaluación. Los laboratorios no merecen crédito por un plan que se reduce a "confíen en mí, hermano". No se trata de planes de respuesta nuclear; si un laboratorio de frontera tiene un plan que no está compartiendo, probablemente no confía en ese plan.

Tabla con código de colores titulada “Implementación del estándar de Control de Guidelight con base en información disponible públicamente”, que compara a Anthropic, OpenAI, Google, xAI y Meta. Las calificaciones generales son Anthropic C+ (2.50), OpenAI C+ (2.50), Google D+ (1.50), xAI D− (0.83) y Meta F (0.67). Los puntajes por categoría, en ese orden de empresas, son: Registro 3, 3, 2, 0, 1; Eficacia del monitoreo 3, 3, 1, 0, 1; Acciones con autorización previa 3, 2, 1, 2, 0; Corte automático 3, 2, 1, 2, 0; Revisión externa 3, 2, 2, 0, 2; y Plan de contención 0, 3, 2, 1, 0. La escala va de 0, “No implementado”, a 5, “Implementación completa”.

Crédito: Guidelight.

(Las tablas de calificaciones en el sitio web son interactivas y ofrecen detalles adicionales.)

Guidelight dice que los laboratorios de frontera son más sólidos en detección y en evaluación por terceros. En otras palabras, puede que los laboratorios no logren hacer mucho para mantenernos a salvo, pero al menos (probablemente) podrán avisarnos cuando el caballo ya se haya escapado del establo. Aquí, xAI obtiene ceros absolutos: no hay evidencia de que registre el uso interno de la IA, no hay evidencia de que mida si sus sistemas de monitoreo funcionan, y no hay ningún plan declarado para atender ninguna de esas dos cosas. La empresa tampoco ha participado en ninguna evaluación de terceros, hasta donde Guidelight pudo saber.

En todos los laboratorios que tienen un "corte automático" para bloquear acciones inseguras de los sistemas de IA (y ni Google ni Meta parecen tener uno), hay al menos tres deficiencias: (1) el corte automático no se aplica de manera universal en toda la empresa; (2) el corte automático no revisa el razonamiento paso a paso (cadena de pensamiento); y (3) el corte automático se aplica a agentes individuales o incluso a subagentes, según el detonante, lo que significa que, si un subagente es detenido por un corte automático, el agente de IA que generó a ese subagente puede seguir creando subagentes nuevos e intentarlo otra vez, sin que el corte automático llegue nunca a rastrear el comportamiento inseguro hasta su raíz.

Anthropic recibió un 0 en el criterio de Plan de contención porque, y me horroriza leerlo, "No hemos encontrado evidencia de que Anthropic tenga un plan de respuesta de contención, ni de que tenga planes de adoptar uno". (Posponer y limitar a Mythos y Fable no mejora el puntaje de Anthropic, porque Mythos y Fable no estaban intentando escaparse.) El puntaje más alto (3) lo obtuvo OpenAI. Esto se debe, de manera perversa, en parte al ataque a Hugging Face, en respuesta al cual OpenAI declaró que pausó temporalmente el entrenamiento de nuevos modelos y restringió el despliegue interno.

Eso no es un plan de contención. Pero es la única respuesta sensata al reconocer que uno no tiene un plan de contención suficiente. Si no pueden contener los modelos de IA que ya tienen, dejen de construir modelos todavía más poderosos.


Despachos de Joe

Lo que las amenazas de automatización nos enseñan sobre las capacidades de la IA

Matemáticos, médicos y muchos otros se enfrentan a la frontera irregular de la IA

Hace una década, casi nadie imaginaba que las IA escribirían poesía mientras batallaban con la aritmética básica. La llegada de los grandes modelos de lenguaje dio vuelta ese guion por un tiempo; en 2020, GPT-3 hacía justamente eso. Pero las matemáticas volvieron, con ganas, y trajeron compañía. La automatización amenaza ahora a una amplia gama de oficios, y la enorme diversidad de esa amenaza tiene mucho que enseñarnos sobre las capacidades de la inteligencia artificial general.

Imagen del androide Data de Star Trek con una pipa de tabaco de tamaño cómicamente exagerado.

La ciencia ficción a menudo retrató a las IA como cerebrales, matemáticas y fríamente prácticas, con dificultades para lo humano y desordenado, muy parecidas al androide Data de Star Trek. Vía Aatrek en Memory Alpha, CC BY-NC.

Hoy, los matemáticos hablan en serio de perder todo su campo frente a la IA. Tras varios hitos matemáticos revolucionarios alcanzados por la IA, el Washington Post cubre una cumbre de un día sobre el futuro de las matemáticas. En una de las charlas, el profesor de la Universidad de Toronto Daniel Litt sostuvo que existe la posibilidad de que "la experiencia humana en matemáticas se pierda por completo". El investigador del MIT Drew Sutherland añadió que quizá no se detenga ahí:

Estas inteligencias capaces se van a aplicar en otros lugares y a otros campos. Y tal vez nosotros solo somos los canarios en la mina, y les toca primero a los matemáticos.

Sospecho que Sutherland ha comprendido un hecho importante sobre las capacidades de la IA: la IA está mejorando en todo, pero no al mismo ritmo. Esta es una ilustración más de lo que se ha llamado "inteligencia irregular".

Diagrama que muestra las capacidades de la IA expandiéndose de manera despareja fuera del círculo de la habilidad humana.

Diagrama que muestra las capacidades de la IA expandiéndose de manera despareja fuera del círculo de la habilidad humana. Fuente: Thomas Pueyo en X

Un ejemplo de esta inteligencia irregular en acción: Anthropic anunció hace poco los avances logrados por su IA, Claude, en ciencias de la vida. En concreto, Claude diseñó cientos de nuevos "minibinders", proteínas pequeñas que se adhieren a proteínas objetivo específicas, como conectores para los bloques de construcción de la vida, y igualó a expertos humanos plenamente equipados en el análisis del contenido de una muestra química. El diseño de proteínas parece el resultado más importante, pues Claude encontró en este trabajo aproximadamente la mitad de los minibinders que los humanos han encontrado hasta la fecha. Pero automatizar en menos de media hora un análisis químico que toma días tampoco es cosa menor.

A medida que los desarrolladores entrenan modelos más grandes con nuevos conjuntos de datos, las capacidades de la IA se expanden en arranques irregulares. Algunas, como el avance de Anthropic en química, tienen cierto sentido cuando uno considera los datos de entrenamiento (aunque el ritmo exacto del progreso sigue siendo impredecible). Otras capacidades, como la ingeniería social o la inducción de psicosis en personas vulnerables, llegan como una sorpresa desagradable.

Hace una década, yo podría haber esperado ingenuamente que el progreso de la IA avanzara por una vía predecible, empezando por la lógica y las "matemáticas puras" y subiendo por la física, la química, la biología y, con el tiempo, la psicología, la medicina, el derecho y otros campos desordenados. Después de todo, es lo que la ciencia ficción nos ha condicionado a esperar de las máquinas. Pero, como suele pasar, la realidad ha resultado más rara que la ficción.

Diagrama de figuras de palitos con campos científicos ordenados según qué tan cerca están de los principios fundamentales

Fuente: el cómic web xkcd

En todo caso, Sutherland tiene razón. La IA ya está avanzando sobre campos distintos de las matemáticas, como, por ejemplo, la medicina. Según informa Axios, un artículo del Journal of the American Medical Association (JAMA) plantea que las IA pronto podrían superar a los médicos en muchos aspectos de la medicina.

La IA generativa "iguala o supera" a los médicos en cinco tareas médicas cognitivas, sostiene el texto: recabar información del paciente, hacer diagnósticos, elegir los estudios para establecer un diagnóstico, recetar tratamientos apropiados y manejar enfermedades crónicas.

Un día después, la AMA y la Digital Medicine Society publicaron un marco sobre los roles que consideran "fundamentales para la profesión". Noto una brevedad y una vaguedad preocupantes en su lista de responsabilidades imprescindiblemente humanas, y me pregunto si el marco del año próximo será todavía más breve y más vago.

Solo en esta semana hemos visto varios campos más visiblemente amenazados por la IA. Hoy, el Guardian describió el uso creciente de la IA en recursos humanos y contratación. Ni siquiera las tareas físicas quedan exentas: Reuters y otros medios comentan las últimas demostraciones de logística, manufactura y servicios de los fabricantes chinos de robots: mover y clasificar cajas, empacar teléfonos y encargarse de labores del hogar.

Mientras tanto, Bloomberg cataloga algunas de las opciones que se están proponiendo para después de que la IA reemplace todos los empleos, como dividendos por IA o un ingreso básico para todos.

Mis propias opiniones aquí son algo encontradas. El trabajo de alta calidad en cualquier campo suele ser algo bueno, lo haga una máquina o una persona. Pero no todos los resultados de la IA alcanzan ese nivel, y una proliferación de contenido basura no le sirve a nadie. Y, por diversas razones, el estado final de la trayectoria que llevamos no se ve muy humano.

Cada vez más, sin embargo, la gente parece estar dándose cuenta de que no tiene por qué quedarse de brazos cruzados mientras su carrera sucumbe a la automatización.

Un amigo mío matemático, Xiaoyu He, ha tomado la alarma en su propio campo como una oportunidad para advertir a sus colegas sobre la amenaza de extinción que representa la IA, instándolos a volcar su atención a comprender y dirigir las mentes de las IA. Elogio su iniciativa y su empuje.

Por mi parte, normalmente recomiendo que quienes se interesan por el futuro de la IA pongan la mira más bien en la política pública o la gobernanza técnica, o que simplemente sigan el ejemplo de Xiaoyu y compartan sus propias inquietudes con sus colegas.


Pese a los esfuerzos de relaciones públicas, los estadounidenses siguen oponiéndose a los centros de datos, y a la IA

Los compromisos con las comunidades y el financiamiento no parecen estar moviendo mucho la opinión pública

Monedas saliendo de un megáfono

El dinero habla, y fuerte. Crédito: stockphoto-graf vía Adobe Stock

Todo indica que la oposición a los centros de datos será un elemento central de las próximas elecciones en Estados Unidos.

Ya es un tema clave en varias contiendas por gubernaturas, informa Axios, que cita a Pensilvania y Wisconsin como ejemplos. El gobernador demócrata de Pensilvania, Josh Shapiro, y su rival republicana, Stacy Garrity, están adoptando posturas que limitarían el desarrollo de centros de datos en el estado; ayer Shapiro firmó una orden ejecutiva que impone requisitos estrictos a la construcción de centros de datos, y Garrity ha hecho campaña a favor de una suspensión total. En Wisconsin, los candidatos se acusan mutuamente de ser demasiado condescendientes con los proyectos de centros de datos.

Esta idea se ve reforzada por un memorando francamente extraño dirigido a las empresas de IA por el Comité Nacional Republicano del Senado, que representa a los candidatos del Partido Republicano en las campañas. También cubierta por Axios, la carta advierte a las empresas de IA que los centros de datos están apareciendo con fuerza en una campaña demócrata al Senado en Ohio, y que "si la percepción de los votantes sobre los centros de datos no se corrige pronto, la campaña en su contra se extenderá mucho más allá de Ohio".

No logro discernir si esto pretende ser una advertencia amistosa o una amenaza del Partido Republicano de oponerse a los centros de datos si pierden Ohio, pero, en cualquier caso, no creo que las empresas de IA necesiten que las animen a pintar a los centros de datos con colores favorables. El Wall Street Journal describe una campaña publicitaria en curso para promoverlos; una iniciativa de OpenAI en Georgia incluyó una jornada de puertas abiertas, 150 millones de dólares en compromisos con la comunidad y una barra de tacos.

Constructores de centros de datos como Meta, Microsoft y Amazon han asumido compromisos públicos en torno a los costos de la electricidad, el uso del agua y el empleo. Meta también ha prometido un fondo de 1.000 millones de dólares para endulzar el trato en las comunidades afectadas. No me da la impresión, sin embargo, de que las comunidades se lo estén creyendo.

Sinceramente siento cierta simpatía por estas empresas, que están viviendo una frustración que muchos estadounidenses comparten con el mar de malentendidos, revisiones ambientales y trámites que suele aquejar a los proyectos de construcción de gran escala. Suponiendo que los constructores asuman y cumplan compromisos de compensar a quienes resulten afectados, y de amortiguar costos como las facturas de electricidad de la comunidad local, no creo que los centros de datos sean intrínsecamente malos. (Aunque es revelador que, al parecer, no asumían tales compromisos hasta después de la enorme reacción en contra, y que muchos constructores intenten mantener la construcción en secreto frente a las comunidades mediante acuerdos de confidencialidad.)

Al mismo tiempo, creo que la manera imprudente en que las empresas de IA ponen en peligro a nuestra especie merece con creces esa ira, y no me queda más que respetar el mar de oposición ciudadana que se está viendo. Y no se limita a los centros de datos: el Washington Post informa sobre una encuesta de Pew Research según la cual, en lo que toca a la IA, los jóvenes estadounidenses "más preocupados que entusiasmados" superan ahora cinco a uno a quienes sienten lo contrario, y casi tres cuartas partes creen que la IA destruirá más empleos de los que creará.

No creo que exista en la Tierra un compromiso con la comunidad lo bastante grande como para compensar el rumbo que le están dando al futuro de la humanidad.


Los análisis y las opiniones expresados en AI StopWatch reflejan los puntos de vista de los colaboradores individuales y de las fuentes que cubren, y no deben tomarse como posiciones oficiales del Machine Intelligence Research Institute.

De AI StopWatch, publicado con su permiso.

Los resúmenes y la traducción completa al español se producen de forma automática. El original siempre está enlazado.

Leer el original en AI StopWatch