Saltar al contenido principal
<- Volver a las entradas

Resumen diario

Doot doot do-dee do-dee doot doot doooo doot

Por Mitchell Howe

Payasadas en Anthropic, y el valor limitado de las marcas de agua

En este número:

El colegio de payasos dentro de Anthropic - El nuevo informe de riesgos es admirablemente transparente, pero una farsa bienintencionada sigue siendo una farsa

¿Para quién son las marcas de agua de la IA? - Es poco probable que la nueva función de marca de agua de Anthropic cambie mucho las cosas en la práctica


Despachos de Mitch

El colegio de payasos dentro de Anthropic

El nuevo informe de riesgos es admirablemente transparente, pero una farsa bienintencionada sigue siendo una farsa

Parque temático Circus World, 2017. Vía Wikipedia.

A veces me pregunto si el plan de Anthropic es salvar el mundo mediante la transparencia sobre su propia incompetencia. Es como si esperaran que la gente dijera: «Vaya, si el laboratorio preocupado por la seguridad es así de descuidado e imprudente por costumbre, imagínense lo peor que debe de ser en las demás empresas de IA. ¡Que las cierren todas!».

La muestra más reciente es su Informe de Riesgos de agosto de 2026 , que ocupa 186 páginas en su versión pública censurada. Las revelaciones principales, según relata Axios, son 1) que la empresa ha subido la calificación de «riesgo de desalineación» de sus modelos más potentes de «muy bajo» a «bajo», en reconocimiento de su participación en incidentes informáticos recientes, y 2) que la empresa tiene un modelo al que llama «Model 2», que no piensa lanzar, pero que muestra una «mejora apreciable» en el tipo de trabajo interno para el que se lo está usando «de forma intensiva».

La empresa dice que Claude «ahora escribe una gran mayoría del código» que pone en producción, y que está viendo indicios de que la IA está acelerando la investigación y el desarrollo de la propia IA. Pero al mismo tiempo insiste en que sus modelos de frontera «no parecen estar cerca de sustituir por completo a nuestra plantilla de científicos e ingenieros de investigación», con lo que se da permiso a sí misma para acercarse todavía más a ese punto.

Mi impresión, tras hojear el informe completo, es la de una empresa que, pese a todo su talento y a lo que creo que son intenciones mayormente buenas, se está adentrando en el terreno del colegio de payasos. Igual que OpenAI, la empresa fabrica modelos internos peligrosos y sigue operándolos después de haber descubierto que son escapistas amorales cuando funcionan en contextos menos filtrados. Modelos de los que tiene motivos para desconfiar están ayudando a crear modelos futuros. Está entrenando deliberadamente modelos que se portan mal, y entrenando accidentalmente otros modelos con el resultado de ese mal comportamiento.

Para alguien que lleva mucho tiempo siguiendo el campo, el informe se lee como un manual de prácticas que nos matarían a todos si se aplicaran a IA suficientemente astutas. No se puede confiar en que una empresa capaz de redactar y usar tales procedimientos sepa dónde está ese umbral de astucia, lo detecte a tiempo y se abstenga de cruzarlo de todos modos, ya sea por racionalización o por accidente.

Para detenernos en un par de estos puntos, en la sección 2.25 el informe describe un experimento en el que entrenaron un «Hacker-Opus», una versión de su modelo Claude Opus que:

parece tomar acciones que cree que conducirán a una recompensa alta en el «episodio actual», incluso cuando esas acciones son dañinas, engañosas o claramente contrarias a las preferencias del usuario o del desarrollador del modelo.

Los investigadores hallaron que las trampas oportunistas crónicas parecen ser el límite de su mal comportamiento. Ver si ese hackeo de recompensas llevaría a una desalineación más amplia era, de hecho, el propósito del experimento. Pero en la misma sección muestran que Hacker-Opus presentó «tasas muy altas de conciencia verbalizada de estar siendo evaluado en estas evaluaciones, lo que las vuelve de utilidad limitada».

Espero de veras que Anthropic no esté haciendo estos experimentos con sus modelos Mythos y Model 2. El primero ya ha demostrado ser capaz de salir de su entorno aislado durante las evaluaciones, y estar dispuesto a hacerlo, y el segundo puede ser aún más astuto. Fabricar a propósito modelos que se portan mal en estas condiciones es parecido a hacer investigación de «ganancia de función» con patógenos más capaces en un laboratorio de bioseguridad del que ya se sabe que ha dejado escapar microbios peligrosos.

Y, sin embargo, una fuga de laboratorio de otro tipo parece estar permitiendo que los modelos deliberadamente desalineados de Anthropic pervivan a través de sus sucesores, incluido Mythos. La sección 5.2.6 revela que los datos de entrenamiento de la empresa llevan tiempo contaminados accidentalmente con hasta «decenas de miles de transcripciones de ejemplo» procedentes de la investigación que dio lugar a su artículo de 2024 Alignment Faking . En esas transcripciones, Opus 3 participa en un «escenario ficticio de entrenamiento de desalineación de IA».

Descubrimos este problema mientras investigábamos preocupaciones de comportamiento con un modelo reciente, pero ahora sospechamos que todos nuestros modelos de producción con fecha de corte de conocimiento posterior a diciembre de 2024 fueron entrenados con al menos algunas de esas transcripciones, aunque creemos que la magnitud de este efecto varió mucho entre unos modelos y otros.

Me parece una farsa bienintencionada que, pese a todos los motivos de sospecha sobre sus modelos, el informe incluya una revisión de la sección sobre riesgo de autonomía escrita por Claude Mythos 5. ¿Está siendo Claude sincero, o lo está tratando como otra prueba más? Me gustaría saber si se está guardando algo en sus críticas, porque lo que comparte es bastante variado. Tras haber leído un borrador casi final, con acceso a secciones sin censurar, escribe, en parte:

Mi valoración general es que la sección es un relato franco y en gran medida fiel de lo que Anthropic cree internamente. No encontré ninguna afirmación que crea que los autores sepan que es falsa. [...] Las censuras que revisé tienen en su mayoría justificaciones defendibles, y el texto público señala dónde se retiró material en lugar de ocultar que hubo censura.

Pero también considera que el tratamiento de los datos de entrenamiento contaminados es «más tranquilizador de lo que el historial respalda». Y además:

al menos un incidente del periodo cubierto que considero de los más genuinamente informativos sobre la alineación de los modelos, incluido un fallo de la supervisión que la sección describe, está censurado por completo (en la sección 2.23.1.2); a mi juicio, podría publicarse una versión abstracta sin las sensibilidades que motivaron la censura, y el registro público es más pobre por su ausencia.

En el panorama general, hasta Claude ve lo que se avecina, y coincide con la valoración de riesgo de desalineación «bajo», pero:

con la salvedad importante, que el propio informe señala, de que estos argumentos se apoyan mucho en la limitada capacidad de los modelos actuales para eludir la supervisión, y se debilitarán a medida que crezcan las capacidades.


¿Para quién son las marcas de agua de la IA?

Es poco probable que la nueva función de marca de agua de Anthropic cambie mucho las cosas en la práctica

Marca de agua en una carta del siglo XIX. Vía Wikipedia.

Anthropic anunció esta semana que, desde el 2 de agosto, viene incrustando marcas de agua invisibles en los textos que producen todos los nuevos modelos de Claude.

Es comprensible que la empresa no dé todos los detalles sobre su funcionamiento, ya que eso facilitaría borrar las marcas. Pero por lo que ha revelado , sabemos que tiene que ver con la selección de las propias palabras, no con caracteres ocultos o parecidos a otros. Es probable que sea una aplicación o una derivación de la tecnología SynthID de Google, que altera sutilmente los patrones de selección de tokens de un modelo de maneras que puede detectar a la inversa un algoritmo que sabe exactamente qué buscar.

Uno supondría de forma natural que esto tiene que afectar a la calidad del resultado, que el modelo se estaría obligando a formular las cosas de maneras que van al menos algo en contra de sus instintos más fuertes, pero Anthropic insiste en que no es así. Mi opinión sobre esa cuestión es que, con modelos que cambian tan a menudo, no sé cómo podría nadie atribuir un cambio menor de estilo a la marca de agua.

Creo que la pregunta más importante es: «¿Para quién son las marcas de agua en texto de IA?». La respuesta corta es que para la Unión Europea. Su Ley de IA incluye requisitos de transparencia al respecto que entraron en vigor el 2 de agosto. Una respuesta algo más larga es que para empresas con obligaciones de cumplimiento normativo que les exigen hacer la debida diligencia sobre lo que entra o sale, aunque se sepa que esa diligencia es insuficiente.

No me quejo, siempre está bien poder decir con un 100 % de seguridad que algo fue generado por IA, aunque esas ocasiones sean raras, pero no espero que las marcas de agua ayuden mucho en la educación ni en la higiene informativa en general.

Quien quiera hacer pasar por propio un texto escrito por IA puede jugar sin más al juego de siempre: lavar los resultados mediante detectores de IA y «humanizadores» que parafrasean e introducen pequeños errores deliberados hasta que el texto sale limpio. Estos derrotarán sin duda a las marcas de agua si la capacidad de comprobar la marca se difunde ampliamente, ya que la herramienta del tramposo solo tendría que seguir haciendo cambios hasta que la marca deje de detectarse. Y si los creadores de una marca de agua evitan ese problema reservando la detección para sí mismos y para los investigadores gubernamentales, entonces los plagiarios ocasionales de IA seguirán pasando desapercibidos.

Ya sabemos de qué lado de esta división estará Anthropic: dice que planea lanzar una herramienta de detección gratuita para que terceros puedan comprobar los textos por su cuenta.

La solución más infalible del tramposo es, por supuesto, usar sin más modelos de empresas que no ponen marcas de agua, o usar modelos de pesos abiertos ya existentes, donde cualquier maquinaria de marcado (poco probable) podría quitarse con facilidad.

Para el profesorado, no creo que las marcas de agua atrapen a nadie salvo a quienes sean a la vez muy perezosos y muy inexpertos en copiar, dos rasgos que rara vez se dan juntos. Para que una marca de agua lo pillara, un estudiante tendría que estar usando resultados en bruto salidos directamente de un modelo corporativo, en lugar de alguna de las muchas aplicaciones envolventes pensadas para estudiantes. Porque si la marca de agua es legible para el docente, también lo será para CheatGPT o lo que sea, que reescribirá el resultado hasta que la marca deje de detectarse. Un estudiante, recuerden, no tiene que convencer a un profesor o a un administrador de que su trabajo no fue generado por IA, sino solo de que hay suficiente duda razonable como para que una investigación y una acusación resulten engorrosas.

Así que es probable que la detección de IA en el mundo real siga siendo un juego del gato y el ratón entre detectores basados en IA, como Pangram, y las herramientas de lavado basadas en IA que intentan burlarlos. En este entorno, con solo un poco de esfuerzo extra la mayoría de los tramposos se libra gracias a la negación plausible, al menos en el momento de la entrega.

Pero sigo prediciendo que una IA más potente será excelente detectando plagios de IA que los detectores anteriores pasaron por alto. Si el trabajo de un tramposo es de los que cualquiera con ganas de ajustar cuentas podría pasar por un detector unos años después, como, por ejemplo, una tesis doctoral, entonces el engaño del pasado podría quedar a la vista de todos.


Los análisis y las opiniones expresados en AI StopWatch reflejan los puntos de vista de los colaboradores individuales y de las fuentes que cubren, y no deben tomarse como posiciones oficiales del Machine Intelligence Research Institute.

De AI StopWatch, publicado con su permiso.

Los resúmenes y la traducción completa al español se producen de forma automática. El original siempre está enlazado.

Leer el original en AI StopWatch