Saltar al contenido principal
<- Volver a las entradas

Resumen diario

La vida se abre camino

Por Mitchell Howe

OpenAI afirma una pausa parcial y lanza ChatGPT for Teens

En este número:

OpenAI afirma haber pausado parte del entrenamiento de frontera para reforzar la seguridad y la alineación - Una traducción al estilo Jurassic Park aportará el cinismo necesario

¿Necesitan los niños infancias con poca tecnología para alcanzar su potencial? - ChatGPT for Teens es el reflejo más reciente de un consenso silencioso: que los niños necesitan más esfuerzo cognitivo del que les ofrece nuestro mundo


Despachos de Mitch

OpenAI afirma haber pausado parte del entrenamiento de frontera para reforzar la seguridad y la alineación

Una traducción al estilo Jurassic Park aportará el cinismo necesario

Un Jeep Wrangler de la película Jurassic Park. Crédito: Sean Hagen. CC BY-SA 2.0.

OpenAI anunció hoy que puso en pausa el entrenamiento de su modelo más grande, a la espera de mejoras en sus prácticas de monitoreo, seguridad y alineación.

Me gustaría poder aplaudir y lanzarles una mirada expectante a los demás laboratorios importantes, como diciendo: «Ustedes van a hacer lo mismo, ¿verdad?». Pero mucho del lenguaje y de las afirmaciones de OpenAI hace imprescindible una lectura cínica, empezando por el título del anuncio: «Marcar el ritmo del desarrollo de modelos en una era de capacidades cibernéticas críticas».

El lenguaje de «marcar el ritmo» es un guiño claro a la declaración «Pacing the Frontier», firmada por más de 1.300 empleados preocupados de empresas de IA de frontera. Así, el anuncio parece pensado como una carta de «los escuchamos» dirigida a su propio personal y a cualquier regulador que esté mirando. Ya saben, del tipo que ofrece solo cambios superficiales mientras suena grandilocuente y trata el asunto como si ya estuviera resuelto.

Mi incomodidad más amplia con este anuncio puede ser algo difícil de expresar en lenguaje neutral, así que, siguiendo una idea de mi colega Joe, voy a traducir fragmentos del comunicado de la empresa a notas de prensa oficiales de Jurassic Park. Esto será un poco injusto tanto con OpenAI como con Jurassic Park, pero OpenAI está jugando un juego de mensajes potente y sutil que la traducción debería ayudar a neutralizar.

1. Introducción:

En las últimas semanas, dos hechos han puesto de relieve los riesgos crecientes asociados a sistemas de IA cada vez más capaces: el incidente entre OpenAI y Hugging Face y, por separado, la evidencia preliminar de que uno de nuestros próximos modelos, Astra, podría alcanzar el umbral de capacidad crítica en ciberseguridad según nuestro Marco de Preparación. En conjunto, estos hechos, sumados al rápido avance de nuestra investigación interna, han dado urgencia a nuestro trabajo para reforzar las salvaguardas de monitoreo, alineación y contención en todas las etapas del proceso de entrenamiento.

Traducción a Jurassic Park:

El incidente del traslado de los raptores, junto con el rápido avance de nuestro híbrido Indominus Rex™, han dado urgencia a nuestro trabajo para reforzar las jaulas y los métodos de adiestramiento.

Análisis:

Es importante que notemos cómo, a lo largo de todo el texto, OpenAI trata a la IA más potente como algo inevitable. Y no solo la IA más potente que cualquiera podría construir dentro de la carrera general de la IA, sino una IA más potente específica (Astra) que la propia OpenAI está construyendo.

Más adelante en la introducción, la empresa dice que ha pausado su «mayor ejecución planificada de RL de frontera», después de haber suspendido durante dos semanas el entrenamiento por aprendizaje por refuerzo (RL, por sus siglas en inglés) en modelos previstos para despliegue. Hoy en día, el RL es una etapa intermedia o tardía del proceso de entrenamiento, así que el modelo más grande ya completó el preentrenamiento (eso de predecir el siguiente token) y una parte de su entrenamiento para resolver desafíos complejos y comportarse como un asistente útil e inofensivo. Esta pausa del entrenamiento puede o no ser realmente una desviación importante de los planes previos. Mi impresión es que las ejecuciones de entrenamiento de modelos lo bastante grandes como para empujar la frontera no son algo que ocurra a diario o cada semana, sino asuntos muy caros, precedidos de una planificación extensa y propensos a demoras y arranques en falso. Podría haber muchísimas razones no relacionadas para un retraso.

Además, la redacción de este anuncio no descarta la posibilidad de que OpenAI tenga modelos igual de grandes o más grandes en preentrenamiento mientras el RL de frontera está pausado.

2. Sobre la seguridad:

A medida que los modelos de frontera adquieren mayores capacidades de ciberseguridad, estamos elevando los estándares de seguridad de los entornos en los que los entrenamos y evaluamos. Cumplir con esos estándares ha requerido un trabajo de ingeniería considerable y ha implicado un gran costo y demoras para la investigación de frontera. Inmediatamente después del incidente entre OpenAI y Hugging Face*, pausamos la inferencia de modelos de frontera en los clústeres de investigación para las ejecuciones que pudieran ejecutar código o usar herramientas con acceso a internet.

Traducción a Jurassic Park:

Tras el incidente de los raptores, no hemos reparado en gastos para restablecer el acceso limitado a la exhibición. Las zonas donde los raptores podían interactuar directamente con los visitantes se cerraron temporalmente mientras conseguíamos cordones de terciopelo más resistentes.

Análisis:

En toda la sección sobre la mejora de la seguridad en OpenAI no hay ninguna mención a aislar físicamente («air gapping») las IA no confiables del resto de su red. Cuando uno cree que sus IA pueden tener habilidades cibernéticas «críticas», y ya han demostrado ser capaces de encontrar vulnerabilidades nunca antes usadas, aislar físicamente esas máquinas debería ser el mínimo estándar aceptable. (Frente a una superinteligencia, ni siquiera eso bastaría).

3. Sobre el monitoreo:

Este nuevo esquema de monitoreo tiene varias etapas. Empieza con clasificadores de activaciones (detectores que inspeccionan la actividad interna de un modelo) que se ejecutan en cada token muestreado y escalan las posibles señales de alarma a investigadores automatizados cada vez más sofisticados y con mayor cómputo. [...] Nuestro objetivo es emitir una alerta dentro de los 30 minutos posteriores a que el sistema de monitoreo detecte actividad preocupante. Si el sistema identifica una probable violación de un límite crítico de seguridad, genera una alerta de máxima prioridad. En nuestra implementación actual, se avisa a los equipos de seguridad, protección e investigación. Si no logran determinar de forma concluyente en 30 minutos que se trata de un falso positivo, se espera que esos equipos pausen la actividad.

[...] Estas salvaguardas requieren un cómputo considerable. Nuestras estimaciones actuales sitúan el sobrecosto del monitoreo en torno al 20 % del cómputo de inferencia monitoreado, aunque el costo varía sustancialmente entre cargas de trabajo de entrenamiento y de evaluación.

Traducción a Jurassic Park:

Ya hemos instalado cámaras de seguridad alrededor de la exhibición de raptores. Están vigiladas las 24 horas por otros raptores y por dilofosaurios. Nuestro objetivo es recibir aviso de cualquier actividad sospechosa dentro de los 30 minutos posteriores a que ocurra, momento en el que se llamará al personal de seguridad. La atracción permanecerá abierta durante 30 minutos más mientras el personal investiga, tras lo cual se espera que cierre la exhibición si no está listo para dar la señal de «todo despejado».

Las cámaras son caras, pero, como saben, ¡no reparamos en gastos!

Análisis:

¿Cuántos problemas puede causar una IA de frontera descarriada en 60 minutos? No lo sé, y no creo que los investigadores de OpenAI lo sepan tampoco. Pero están inclinándose por mantener sus IA en funcionamiento mientras investigan las alertas. Alertas que confían en que otras IA les den, sobre los mismos comportamientos que también dependen de que esas IA detecten.

Y vaya que la empresa quiere que sepamos que la seguridad les está costando dinero. Un 20 % de sobrecosto sobre una cantidad descomunal de cómputo caro no es poca cosa, pero ¿por qué parecen sorprendidos de que asegurar a hackers sobrehumanos, mientras al mismo tiempo los desarrollan, los despliegan y experimentan con ellos, resulte caro?

4. Sobre la alineación:

Para las ejecuciones de RL en los modelos más capaces, ahora estamos aplicando nuestras técnicas centrales de alineación en más etapas del proceso de entrenamiento. Esto incluye mejorar los modelos de recompensa para detectar y desalentar mejor los comportamientos inseguros en distintas tareas y entornos; entrenar a los modelos para que sean más honestos sobre sus acciones, capacidades y limitaciones; y reducir los comportamientos que explotan debilidades en las recompensas, los evaluadores, las herramientas o la supervisión. También estamos ampliando la cobertura de entrenamiento para comportamientos que podrían causar daño cuando los modelos interactúan con sistemas o recursos externos.

Seguimos invirtiendo de forma decidida en investigación sobre alineación, ampliando la cobertura de las evaluaciones y usando lo aprendido para orientar el entrenamiento y las salvaguardas. Tenemos previsto compartir mucho más sobre nuestra investigación en alineación en un futuro cercano, incluyendo lo que estamos aprendiendo sobre el comportamiento de los modelos y cualquier desafío novedoso que descubramos.

Traducción a Jurassic Park:

Para nuestras chicas más listas, aplicaremos picanas eléctricas y pistolas paralizantes en más fases del recorrido que va del criadero a la exhibición. Una lista ampliada de comportamientos quedará ahora sujeta a picanazos y descargas.

Seguiremos sin reparar en gastos para estudiar a estas criaturas extraordinarias y compartir lo que aprendamos sobre su comportamiento.

Análisis:

La sección de alineación es la más delgada del texto. Cité sus dos tercios más sustanciales, y en realidad no es más que una declaración de que piensan hacer más de lo que ya venían haciendo, en más lugares. Y lo que venían haciendo es un juego de aplastar topos. Creo que la sección es corta porque OpenAI (y todos los demás) no saben cómo alinear los modelos con las intenciones de sus dueños y operadores. Las únicas herramientas que han desarrollado para eso son demasiado toscas, y los modelos ya son lo bastante capaces como para meterlos en problemas serios.

5. Conclusión:

Las capacidades de los modelos de frontera se están acelerando rápidamente. Nuestra capacidad para entenderlos, alinearlos y asegurarlos debe mantenerse por delante.

*Publicaremos un informe técnico con lo aprendido [sobre el incidente de Hugging Face] en las próximas semanas.

Traducción a Jurassic Park:

Estos locos hijos de perra lo estamos logrando, y la vida se está abriendo camino... ¡rápido! Nuestra capacidad para entenderla, alinearla y asegurarla debe mantenerse por delante.

*Publicaremos un informe técnico con lo aprendido sobre el incidente del traslado de los raptores en las próximas semanas.

Análisis:

Es importante notar que OpenAI (y todos los laboratorios) hablan como si las lecciones aprendidas con los modelos de una empresa se aplicaran a los de todas las demás. Eso es porque probablemente así sea: todos están haciendo crecer sus IA con los mismos métodos dudosos.

Por desgracia, las lecciones más importantes que están aprendiendo fueron predichas hace mucho tiempo. (Véase If Anyone Builds It, Everyone Dies y sus recursos en línea para un panorama más completo). A nadie le va a gustar cómo termina esta película si no la detenemos de verdad.


¿Necesitan los niños infancias con poca tecnología para alcanzar su potencial?

ChatGPT for Teens es el reflejo más reciente de un consenso silencioso: que los niños necesitan más esfuerzo cognitivo del que les ofrece nuestro mundo

Una partida de caza hadza. Crédito: Eid John. CC BY-SA 4.0.

La noticia principal es que OpenAI anunció ChatGPT for Teens. Por defecto, ChatGPT ahora rastrea «más de 2.000 señales» en las conversaciones para evaluar si podría estar hablando con un menor, e incorpora automáticamente al nuevo modo a los adolescentes identificados. El modo para adolescentes está pensado para edades de 13 a 17 años.

¿Qué tiene de distinto? Controles parentales opcionales, bloqueos estrictos a las conversaciones románticas, un modo de estudio que no se limita a soltar las respuestas a las preguntas, y restricciones más firmes para que el bot no insinúe que tiene conciencia o emociones. Un portavoz de OpenAI dice que la empresa intenta no dar señales que «podrían llevar a un adolescente a desarrollar una especie de relación con él».

La mayor parte de la cobertura se centra en los muchos casos de advertencia que llevaron a OpenAI hasta este punto: ChatGPT explicándoles a chicos de 13 años cómo emborracharse, ayudando a redactar cartas de suicidio, y demás.

Se habla menos del entusiasmo que vengo viendo con los modos de «tarea» o de «estudio» en los chatbots en general. Sin haber tenido nunca una gran discusión al respecto, la sociedad parece estar convergiendo en la idea de que un producto diseñado para darte respuestas debería hacerte trabajar por ellas si eres niño, incluso cuando las preguntas no tratan de temas delicados o peligrosos. Si está mal planteada, es una idea cruel: no creemos que los niños deban trabajar para conseguir una comida, un paraguas o una canción. ¿Por qué tendrían que trabajar para obtener un análisis literario o un resultado matemático?

Parece deberse a que los adultos están extendiendo la preocupación por la «apatía cognitiva» derivada de depender demasiado de la IA, para sostener que los niños a los que se les dan respuestas fáciles nunca aprenderán habilidades de pensamiento esenciales. ¿Está justificado?

Aunque no estoy seguro de hasta dónde llevarlo, me inclino por el «sí». La adquisición del lenguaje ofrece evidencia convincente de un «período crítico» de plasticidad cerebral que empieza en la infancia y se cierra en la adolescencia. La falta de exposición al lenguaje temprano dentro de esa ventana está asociada con dificultades duraderas para adquirirlo después, y los adultos tienen muchas menos probabilidades de alcanzar fluidez plena en idiomas que no empezaron a aprender de niños. (Dato curioso: mientras repasaba el tema, aprendí que varios gobernantes históricos intentaron determinar cuál era la única lengua verdadera encargando experimentos de privación del lenguaje con bebés y esperando a oír en qué idioma decían sus primeras palabras).

Hay más evidencia de plasticidad cerebral temprana en el hecho de que el máximo rendimiento en deportes, juegos, música y matemáticas suele venir de quienes se sumergieron por completo en esas actividades durante el mismo período crítico que el lenguaje.

Esto me hizo preguntarme si, cuando yo era niño, los adultos habrían preferido que las calculadoras pudieran estimar la edad del usuario y no darles a los chicos de cuarto grado las respuestas de las divisiones, salvo para confirmar resultados ya obtenidos con la división larga en papel. Creo que la respuesta es «sí», lo que me lleva a preguntarme cuál se supone que es el tipo y la cantidad óptimos de esfuerzo cognitivo en la infancia.

¿Depende del contexto? Yo crecí hacia un mundo donde la capacidad de resolver una división larga a mano nunca hizo verdadera falta. Pero, al mismo tiempo, aprender la división larga probablemente me ayudó a desarrollar la capacidad de pensar de forma algorítmica, una habilidad que sin duda me ha dado ventaja como adulto. Si evitamos construir una IA que nos quite nuestro mundo, ¿nuestros hijos crecerán hacia un futuro donde nunca necesitarán la capacidad de pensar algorítmicamente o, de forma más general, de trabajar con método sobre problemas difíciles, seguir pistas y recuperarse de callejones sin salida?

Si nos parece inaceptable perder esas habilidades, ¿hasta dónde deberíamos llevar ese principio? ¿Qué me estoy perdiendo por no haber aprendido nunca a zurcir calcetines o a cortar leña? Quizá todos estemos gravemente subdesarrollados por no haber aprendido a tallar hachas de mano, a quitarles los piojos a nuestros compañeros y a perseguir gacelas a pie. ¡Sin duda eso nos habría enseñado habilidades metacognitivas esenciales!

Si llegáramos a conseguir un futuro donde nadie necesite trabajar, un futuro tan abundante que ninguna habilidad sea realmente necesaria, ¿qué habilidades deberíamos valorar de todos modos? ¿Qué clase de infancia las cultivaría mejor? Creo que nuestro ideal podría ser mucho más rústico y bullicioso que lo que hoy les damos a los niños.

Los chatbots con «modo tarea» son nuevos, pero preocuparse porque los chicos están saliendo blandos, porque las generaciones anteriores estaban hechas de una madera más dura, parece ser tan antiguo como la historia escrita misma. ¿Y si esa preocupación hubiera estado un poco justificada cada vez?


Los análisis y opiniones expresados en AI StopWatch reflejan los puntos de vista de los colaboradores individuales y de las fuentes que cubren, y no deben tomarse como posiciones oficiales del Machine Intelligence Research Institute.

De AI StopWatch, publicado con su permiso.

Los resúmenes y la traducción completa al español se producen de forma automática. El original siempre está enlazado.

Leer el original en AI StopWatch