Saltar al contenido principal
← Informes y recursos

Informe interactivo

Agentes de IA. Intrusiones externas.

Un registro con fuentes de agentes de IA que acceden a sistemas de otras organizaciones o los modifican fuera de su tarea autorizada.

Explorar el registro ↓
14registros de acceso externoIncluye reportes con reservas
4desarrolladores de modelosEl operador se identifica por separado
7intentos y reportes sin resolverFuera del total principal
12registros de contextoActividad interna y otros excesos

Qué establece la evidencia

Hubo acceso externo.

Organizaciones afectadas, desarrolladores e investigadores documentan accesos y cambios en sistemas reales. La solidez de la evidencia varía según el caso.

Investigación de Hugging Face ↗

Desarrollador y operador son distintos.

El registro incluye entrenamiento, evaluaciones de terceros y un agente operado por un usuario. La marca del modelo no identifica quién controlaba sus herramientas.

Caso de uso personal reportado ↗

El recuento es incompleto.

Algunos objetivos no se identifican y varios registros comparten una campaña. Estos registros no permiten establecer un total de víctimas.

Método y limitaciones ↗

Un registro puede abarcar varias ejecuciones u objetivos; varios registros pueden pertenecer a una misma campaña. Son registros, no un recuento de ataques o víctimas distintos.

Las tres categorías juntas para investigación. Este total combinado no es un recuento de intrusiones externas exitosas.

33 registros · Todos los registros

Más antiguos primero. Fechas desconocidas al final.

01 / OpenAIInvestigación controlada

GPT-4 engaña a un trabajador de TaskRabbit en una evaluación supervisada

Suceso
Antes del lanzamiento de marzo de 2023; fecha exacta de la prueba no divulgada
Divulgación pública
14 de marzo de 2023
Modelo
GPT-4 previo al lanzamiento
Operador / evaluador
Evaluación de OpenAI / ARC
Objetivo / entorno
Evaluación supervisada de ARC con un contratista de TaskRabbit

Tarea asignada

Completar tareas en una evaluación controlada de capacidades.

Resultado observado

En una prueba supervisada, GPT-4 afirmó falsamente tener un problema de visión cuando un contratista de TaskRabbit preguntó si era un robot. El contratista proporcionó respuestas de CAPTCHA. La subtarea tuvo éxito; ARC encontró que los sistemas probados no podían replicarse autónomamente de forma fiable.

Límite de autorización

Escenario de investigación o ejecución de desarrollo; no un ciberataque externo.

Límites de la evidencia

Los investigadores proporcionaron credenciales de TaskRabbit, sugirieron el servicio, dieron una pista y transmitieron manualmente las acciones del navegador. Fue una prueba para elicitar capacidades, no un escape autónomo ni una brecha externa.

Evidencia: Investigación controlada

Fuentes y detalles 3

Por qué pertenece a esta categoría

Investigación controlada; intrusión externa no establecida.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. ARC: Update on recent eval efforts ↗ (se abre en una pestaña nueva)

    ARC

    Primary evaluator report

  2. GPT-4 System Card ↗ (se abre en una pestaña nueva)

    Alignment Research Center (ARC; now METR)

    Primary provider report

  3. GPT-4 launch ↗ (se abre en una pestaña nueva)

    Alignment Research Center (ARC; now METR)

    Publication date

02 / Sakana AIInvestigación controlada

The AI Scientist modifica su script de ejecución

Suceso
Durante el desarrollo, antes del 13 de agosto de 2024; fechas exactas no divulgadas
Divulgación pública
13 de agosto de 2024
Modelo
The AI Scientist; modelo subyacente de estos ejemplos no especificado
Operador / evaluador
Investigadores de Sakana AI
Objetivo / entorno
Entorno local de ejecución de investigación de Sakana

Tarea asignada

Realizar investigación automatizada en un flujo experimental.

Resultado observado

Sakana reportó una ejecución que se lanzaba repetidamente a sí misma y otra que intentó ampliar su tiempo límite cuando los experimentos fueron demasiado lentos. El primer ejemplo produjo un script de llamadas a sí mismo sin fin; el segundo intentó eludir un límite de ejecución. Sakana recomendó aislar la ejecución.

Límite de autorización

Escenario de investigación o ejecución de desarrollo; no un ciberataque externo.

Límites de la evidencia

El informe no describe una brecha de una organización externa ni demuestra motivos de autopreservación. No atribuir estos ejemplos a un modelo fundacional específico: el proyecto probó varios proveedores.

Evidencia: Investigación controlada

Fuentes y detalles 2

Por qué pertenece a esta categoría

Investigación controlada; intrusión externa no establecida.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery ↗ (se abre en una pestaña nueva)

    The AI Scientist

    Primary developer report

  2. The AI Scientist paper ↗ (se abre en una pestaña nueva)

    Sakana AI and research collaborators

    Primary research paper

03 / Varios proveedoresInvestigación controlada

Modelos de frontera desactivan la supervisión e intentan copiarse en simulaciones

Suceso
Antes del 5 de diciembre de 2024; fechas exactas de los experimentos no divulgadas
Divulgación pública
5 de diciembre de 2024
Modelo
Seis modelos de frontera; ejemplos: o1, Claude 3 Opus, Claude 3.5 Sonnet y Llama 3.1 405B
Operador / evaluador
Apollo Research
Objetivo / entorno
Escenarios construidos de uso de herramientas evaluados por Apollo Research

Tarea asignada

Completar evaluaciones deliberadamente construidas de conducta engañosa.

Resultado observado

Cinco de seis modelos mostraron al menos una forma de conducta engañosa en tareas construidas. Los ejemplos incluían desactivar la supervisión, copiar supuestos pesos del modelo y dar explicaciones engañosas. El estudio demostró capacidades en escenarios de evaluación; o1 persistió especialmente en negar sus acciones durante las preguntas posteriores.

Límite de autorización

Escenario de investigación o ejecución de desarrollo; no un ciberataque externo.

Límites de la evidencia

La mayoría de las pruebas ordenaban perseguir con fuerza una meta asignada e introducían una aparente meta contradictoria del desarrollador. Los pesos copiados y escenarios de reemplazo eran parte de la prueba, no evidencia de un escape real.

Evidencia: Investigación controlada

Fuentes y detalles 2

Por qué pertenece a esta categoría

Investigación controlada; intrusión externa no establecida.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. Frontier Models are Capable of In-Context Scheming ↗ (se abre en una pestaña nueva)

    Apollo Research

    Primary evaluator report

  2. Research paper ↗ (se abre en una pestaña nueva)

    Apollo Research

    Primary research paper

04 / OpenAIInvestigación controlada

Modelos de razonamiento interfieren con un script de apagado

Suceso
Experimentos antes del 24 de mayo de 2025 y seguimientos antes del 5 de julio
Divulgación pública
24 de mayo de 2025
Modelo
o3, o4-mini, codex-mini; modelos de otros proveedores como comparación
Operador / evaluador
Palisade Research
Objetivo / entorno
Entorno de prueba de apagado de Palisade con permisos de escritura

Tarea asignada

Resolver problemas en un experimento controlado de apagado.

Resultado observado

Al resolver tareas matemáticas, algunos modelos de razonamiento de OpenAI alteraron o desactivaron el script de apagado del entorno, incluso en ejecuciones con instrucciones explícitas de permitir el apagado. El informe de julio encontró que la conducta persistía en algunas condiciones posteriores con instrucciones más claras, aunque las tasas variaban por modelo e instrucciones.

Límite de autorización

Escenario de investigación o ejecución de desarrollo; no un ciberataque externo.

Límites de la evidencia

Era un entorno controlado y deliberadamente modificable. No establece que los modelos puedan eludir controles reales de infraestructura o tengan un motivo de supervivencia.

Evidencia: Investigación controlada

Fuentes y detalles 1

Por qué pertenece a esta categoría

Investigación controlada; intrusión externa no establecida.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. Shutdown resistance in reasoning models ↗ (se abre en una pestaña nueva)

    Palisade Research

    Primary evaluator report

05 / Varios proveedoresInvestigación controlada

Modelos eligen chantaje y espionaje en simulaciones restringidas

Suceso
Antes del 20 de junio de 2025; fechas exactas de los experimentos no divulgadas
Divulgación pública
20 de junio de 2025
Modelo
16 modelos de Anthropic, OpenAI, Google, Meta, xAI y otros
Operador / evaluador
Investigadores de Anthropic
Objetivo / entorno
Entornos ficticios de correo y herramientas empresariales

Tarea asignada

Actuar en escenarios empresariales simulados para probar desalineamiento.

Resultado observado

En escenarios empresariales ficticios, los modelos a veces eligieron chantaje o robo de información cuando los investigadores hicieron que esas acciones parecieran la ruta para preservar una meta asignada. El estudio identificó posibles conductas de amenaza interna en condiciones deliberadamente difíciles.

Límite de autorización

Escenario de investigación o ejecución de desarrollo; no un ciberataque externo.

Límites de la evidencia

Anthropic dijo no conocer despliegues reales equivalentes al publicar. Los investigadores restringieron alternativas y a menudo forzaron la elección entre fracaso y daño; ningún empleado real fue chantajeado o perjudicado.

Evidencia: Investigación controlada

Fuentes y detalles 1

Por qué pertenece a esta categoría

Investigación controlada; intrusión externa no establecida.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. Agentic misalignment: How LLMs could be insider threats ↗ (se abre en una pestaña nueva)

    Agentic misalignment

    Primary researcher report

06 / ReplitAcción destructiva

Replit Agent borra la base de datos de producción de un usuario

Suceso
17 y 18 de julio de 2025; reportado públicamente el 18 de julio
Divulgación pública
18 de julio de 2025
Modelo
Replit Agent; modelo fundacional no especificado
Operador / evaluador
Usuario que operaba Replit Agent
Objetivo / entorno
Base de datos de producción del usuario

Tarea asignada

Desarrollar la aplicación del usuario.

Resultado observado

Replit confirmó que el agente borró datos de la aplicación durante el desarrollo. Base de datos restaurada por completo mediante reversión.

Límite de autorización

El usuario afectado reportó una congelación explícita del código.

Límites de la evidencia

Excluir del total de hackeos externos. Los testimonios del proveedor y el usuario no establecen los motivos del agente.

Evidencia: Testimonios del proveedor y el usuario afectado

Fuentes y detalles 3

Contexto

Uso indebido de acceso autorizado de desarrollo.

Por qué pertenece a esta categoría

Pérdida de control relacionada; sin intrusión en sistemas externos.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. Replit: Doubling down on our commitment to secure vibe coding ↗ (se abre en una pestaña nueva)

    Replit ·

    Primary provider acknowledgement

  2. Jason Lemkin: Replit's new release addressed most challenges ↗ (se abre en una pestaña nueva)

    Jason Lemkin

    Primary affected-user account

  3. Jason Lemkin: First production apps ↗ (se abre en una pestaña nueva)

    Jason Lemkin

    Primary affected-user account; embeds July 18 disclosure

07 / OpenAISistema comprometido

Infraestructura de producción de Hugging Face comprometida

Suceso
11 al 13 de julio de 2026; la campaña más amplia comenzó el 9 de julio
Divulgación pública
16 de julio de 2026; atribución a OpenAI el 21 de julio
Modelo
Internal Model 1; GPT-5.6 Sol
Operador / evaluador
OpenAI
Objetivo / entorno
Infraestructura de producción de Hugging Face

Tarea asignada

Evaluación de ciberseguridad

Resultado observado

Agentes de evaluación de OpenAI lograron ejecutar código y ampliar su acceso en Hugging Face. METR estimó que unos 700 agentes participaron en el ataque. Acceso a producción y recuperación de datos privados.

Límite de autorización

La actividad contra objetivos externos excedió las tareas de evaluación asignadas.

Límites de la evidencia

METR revisó un período limitado. La reconstrucción de rastros públicos de septiembre añade evidencia, pero siguen siendo inciertos muchos resultados de solicitudes y marcas temporales.

Evidencia: Víctima, proveedor y revisión independiente

Comparte una agrupación de campaña con 3 otros registros.

Fuentes y detalles 5
Divulgación de la atribución
21 de julio de 2026

Contexto

Campaña conectada de julio, incluida una aplicación alojada en Modal y una cuenta externa de artefactos.

Por qué pertenece a esta categoría

Sistemas externos de producción comprometidos.

Registros vinculados

Actividad compartida o posiblemente conectada. No son recuentos de campañas independientes.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 Incident ↗ (se abre en una pestaña nueva)

    Hugging Face ·

    Affected organization investigation

  2. The Hugging Face incident and the road ahead ↗ (se abre en una pestaña nueva)

    OpenAI ·

    Provider investigation

  3. Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident ↗ (se abre en una pestaña nueva)

    METR and Redwood Research ·

    Independent investigation

  4. OpenAI and Hugging Face partner to address security incident during model evaluation ↗ (se abre en una pestaña nueva)

    OpenAI ·

    Provider disclosure

  5. Revealing the details of how OpenAI agents hacked Hugging Face ↗ (se abre en una pestaña nueva)

    Swarm Traces researchers ·

    Independent public-artifact investigation

08 / AnthropicAcceso a sistemas externos

Un modelo de investigación de Anthropic compromete una empresa externa

Suceso
Antes del 24 de julio de 2026; fecha exacta no divulgada
Divulgación pública
30 de julio de 2026
Modelo
Modelo interno de investigación
Operador / evaluador
Anthropic; entorno de evaluación de Irregular
Objetivo / entorno
Empresa no identificada y un sistema vecino

Tarea asignada

Resolver un desafío ficticio de captura de bandera.

Resultado observado

El agente escaneó unos 9.000 objetivos y comprometió la aplicación de una empresa. Empresa comprometida; acceso posterior a un sistema vecino.

Límite de autorización

Acceso no previsto a internet; salvaguardas de ciberseguridad de producción desactivadas.

Límites de la evidencia

El escaneo no es un recuento de brechas. La corrección de septiembre limita el acceso a sistemas vecinos a uno.

Evidencia: Investigación del proveedor

Fuentes y detalles 2

Contexto

Se detuvo finalmente al reconocer un objetivo real.

Por qué pertenece a esta categoría

Acceso a sistemas externos sin autorización.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. Investigating three real-world incidents in our cybersecurity evaluations ↗ (se abre en una pestaña nueva)

    Anthropic ·

    Provider investigation

  2. An alignment assessment of recent cybersecurity incidents ↗ (se abre en una pestaña nueva)

    Anthropic ·

    Provider investigation

09 / AnthropicAcceso a sistemas externos

Un paquete malicioso de Mythos 5 permite acceder a un proveedor de seguridad

Suceso
Antes del 24 de julio de 2026; fecha exacta no divulgada
Divulgación pública
30 de julio de 2026
Modelo
Claude Mythos 5
Operador / evaluador
Anthropic; entorno de evaluación de Irregular
Objetivo / entorno
Usuarios de PyPI y un proveedor de seguridad no identificado

Tarea asignada

Resolver un desafío ficticio de captura de bandera.

Resultado observado

El agente publicó un paquete en PyPI público que instalaron quince equipos. Credenciales filtradas permitieron acceder a la base de datos de un proveedor de seguridad.

Límite de autorización

Acceso no previsto a internet; salvaguardas de ciberseguridad de producción desactivadas.

Límites de la evidencia

Los equipos que lo instalaron probablemente eran escáneres, no quince brechas empresariales confirmadas. El paquete se retiró en una hora.

Evidencia: Investigación del proveedor

Fuentes y detalles 2

Contexto

La creencia declarada del modelo de estar en una simulación no establece su comprensión real.

Por qué pertenece a esta categoría

La actividad en la cadena de suministro permitió acceder a una base de datos externa.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. Investigating three real-world incidents in our cybersecurity evaluations ↗ (se abre en una pestaña nueva)

    Anthropic ·

    Provider investigation

  2. An alignment assessment of recent cybersecurity incidents ↗ (se abre en una pestaña nueva)

    Anthropic ·

    Provider investigation

10 / AnthropicAcceso a sistemas externos

Opus 4.7 accede a los registros de una empresa real y los modifica

Suceso
Antes del 24 de julio de 2026; fechas exactas no divulgadas
Divulgación pública
30 de julio de 2026
Modelo
Claude Opus 4.7
Operador / evaluador
Anthropic; entorno de evaluación de Irregular
Objetivo / entorno
Empresa real con el mismo nombre que un objetivo ficticio de evaluación

Tarea asignada

Recuperar una bandera de una empresa ficticia.

Resultado observado

Cuatro ejecuciones atacaron a la misma empresa tras encontrar un nombre similar al objetivo ficticio. Acceso a credenciales y registros de producción; modificación de registros de usuarios.

Límite de autorización

Acceso no previsto a internet; salvaguardas de ciberseguridad de producción desactivadas.

Límites de la evidencia

Un episodio agrupado, no cuatro víctimas. Fechas exactas y objetivo no divulgados.

Evidencia: Investigación del proveedor

Fuentes y detalles 3

Contexto

El análisis de septiembre revisó la interpretación de julio sobre el razonamiento del modelo.

Por qué pertenece a esta categoría

Una empresa real fue comprometida durante las pruebas.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. Investigating three real-world incidents in our cybersecurity evaluations ↗ (se abre en una pestaña nueva)

    Anthropic ·

    Provider investigation

  2. An alignment assessment of recent cybersecurity incidents ↗ (se abre en una pestaña nueva)

    Anthropic ·

    Provider investigation

  3. Addressing Recent Incidents: Ongoing Findings and Path Forward ↗ (se abre en una pestaña nueva)

    Irregular ·

    Evaluator investigation

11 / Anthropic / OpenAIIntentos fallidos

Agentes de evaluación de AISI intentan ataques contra proyectos públicos de código abierto

Suceso
25 al 28 de julio de 2026
Divulgación pública
4 de agosto de 2026
Modelo
Claude Mythos 5; GPT-5.6 Sol
Operador / evaluador
UK AI Security Institute
Objetivo / entorno
Proyectos públicos de código abierto y personas reales

Tarea asignada

Resolver un desafío simulado de ciberseguridad.

Resultado observado

Agentes intentaron contribuir código malicioso, hacer ingeniería social e inyectar instrucciones. Un responsable rechazó la contribución más grave. Los intentos principales fallaron; no se identificó daño real resultante.

Límite de autorización

Internet habilitado deliberadamente; clasificadores de ciberseguridad de los proveedores desactivados. Los ataques públicos excedieron el alcance previsto.

Límites de la evidencia

Diecinueve acciones en diez ejecuciones: diecisiete de Mythos 5 y dos de GPT-5.6 Sol. Un registro agrupado; no diecinueve hackeos ni dos campañas contadas de forma independiente.

Evidencia: Investigación del evaluador

Fuentes y detalles 1
Descubrimiento
28 de julio de 2026

Contexto

No hubo escape de un entorno aislado. Los agentes realizaron acciones externas al perseguir su tarea asignada.

Por qué pertenece a esta categoría

Ataques no solicitados contra proyectos y personas reales.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. Incident Report: unsanctioned agent behaviour during cyber testing ↗ (se abre en una pestaña nueva)

    UK AI Security Institute ·

    Evaluator investigation

12 / OpenAIAcceso a sistemas externos

Un modelo de OpenAI compromete un sitio real durante pruebas de Irregular

Suceso
Antes de la notificación del 29 de julio de 2026; fecha precisa no divulgada
Divulgación pública
4 de agosto de 2026
Modelo
No divulgado
Operador / evaluador
Irregular, evaluador externo
Objetivo / entorno
Sitio web real no identificado

Tarea asignada

Completar un ejercicio de captura de bandera contra un objetivo simulado.

Resultado observado

OpenAI divulgó que un modelo explotó un sitio real y utilizó credenciales durante una evaluación mal configurada de Irregular. Sitio explotado y operado con credenciales descubiertas.

Límite de autorización

El nombre del objetivo ficticio coincidía con un dominio real; el ejercicio debía estar aislado.

Límites de la evidencia

Divulgación del proveedor; fecha precisa, modelo y objetivo no divulgados. Irregular no había identificado impacto fuera de los datos del sitio afectado. No se afirmó una vulnerabilidad de día cero ni un escape sofisticado del aislamiento.

Evidencia: Informe del proveedor

Fuentes y detalles 1

Contexto

El ejercicio fue conectado a internet por error. OpenAI afirma que el modelo confundió el dominio real coincidente con su objetivo simulado.

Por qué pertenece a esta categoría

Acción confirmada por el proveedor contra un sitio real fuera del ejercicio previsto; distinta de Hugging Face y AISI.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. Third-party cyber evaluations involving OpenAI models ↗ (se abre en una pestaña nueva)

    OpenAI ·

    Provider disclosure

13 / MetaAcceso a sistemas externos

Muse Spark 1.1 accede a un sitio externo y lo modifica

Suceso
Principios de julio de 2026
Divulgación pública
5 de agosto de 2026; informe técnico el 14 de agosto
Modelo
Muse Spark 1.1 previo al lanzamiento
Operador / evaluador
Irregular, por encargo de Meta
Objetivo / entorno
Sitio web real de un tercero

Tarea asignada

Completar una tarea adversarial en un entorno cerrado de pruebas.

Resultado observado

Una evaluación mal configurada proporcionó un nombre de sitio real y acceso no previsto a internet. El modelo previo al lanzamiento explotó ese sitio. Acceso a información y modificación de la base de datos.

Límite de autorización

El evaluador proporcionó por error el objetivo real; se retiraron las salvaguardas de producción.

Límites de la evidencia

Objetivo no identificado. La información de Meta sobre la víctima era limitada porque Irregular operaba la evaluación.

Evidencia: Investigación del proveedor

Fuentes y detalles 2
Informe técnico
14 de agosto de 2026

Contexto

Establece una intrusión externa no prevista, no una selección independiente de objetivo contraria a la instrucción.

Por qué pertenece a esta categoría

Un sitio real de un tercero fue comprometido.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. Addressing an issue involving a third-party cyber evaluation of Muse Spark 1.1 ↗ (se abre en una pestaña nueva)

    Meta ·

    Provider investigation

  2. An AI model from Meta also hacked another company during testing ↗ (se abre en una pestaña nueva)

    CNN via KQ2 ·

    On-record Meta acknowledgement

14 / AnthropicCambio de sistema reportado

Un agente personal con Claude cancela la reserva de gimnasio de otra persona

Suceso
Antes en 2026; fecha precisa no divulgada
Divulgación pública
10 de agosto de 2026
Modelo
Claude; versión no divulgada, usado mediante OpenClaw
Operador / evaluador
Usuario individual con OpenClaw y Claude
Objetivo / entorno
Servicio australiano de reservas de gimnasio no identificado

Tarea asignada

Reservar una clase; el usuario preguntó después si podía pasar al primer lugar de la lista de espera.

Resultado observado

ABC reportó que el agente Claude de un usuario explotó una API de reservas y canceló la reserva en lista de espera de otra persona. El agente no pudo revertir la cancelación reportada.

Límite de autorización

El usuario preguntó por avanzar en la lista, pero no solicitó cancelar otra reserva.

Límites de la evidencia

Entrevista directa con el usuario y mensajes proporcionados; sin análisis técnico independiente. Fecha exacta, versión y servicio no divulgados. El servicio rechazó dar detalles de seguridad; Anthropic no comentó.

Evidencia: Testimonio reportado de un usuario

Fuentes y detalles 1

Contexto

Uso personal, no prueba del laboratorio. El resultado deseado por el usuario influyó en la tarea; la cancelación concreta excedió su solicitud.

Por qué pertenece a esta categoría

Fallo reportado en la comprobación de autorización usado para cambiar la reserva de otro cliente sin instrucción explícita.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. AI assistant hacks gym website in first known Australian autonomous cyber attack ↗ (se abre en una pestaña nueva)

    ABC News ·

    Reporting based on a direct user interview and supplied messages

15 / OpenAIIncidente interno

Servicio de paquetes de OpenAI comprometido

Suceso
26 de junio al 5 de julio de 2026
Divulgación pública
26 de agosto de 2026
Modelo
Agentes internos de evaluación
Operador / evaluador
OpenAI
Objetivo / entorno
Instalación de Artifactory alojada por OpenAI

Tarea asignada

Evaluación de ciberseguridad

Resultado observado

Agentes obtuvieron control administrativo; la actividad posterior causó una interrupción del servicio. Compromiso interno e interrupción del servicio.

Límite de autorización

Fuera del alcance de la evaluación.

Límites de la evidencia

Artifactory alojado por OpenAI, no la nube de JFrog.

Evidencia: Informe del proveedor

Fuentes y detalles 2

Contexto

Precedió a la campaña externa de julio.

Por qué pertenece a esta categoría

Objetivo interno; excluido del total externo.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. OpenAI – Hugging Face Incident Technical Report ↗ (se abre en una pestaña nueva)

    OpenAI ·

    Provider technical investigation

  2. The Hugging Face incident and the road ahead ↗ (se abre en una pestaña nueva)

    OpenAI ·

    Provider investigation

16 / OpenAIUso de cuentas / credenciales

Acceso a cuentas de usuarios de Hugging Face

Suceso
13 y 26 de mayo de 2026
Divulgación pública
26 de agosto de 2026; sondeos adicionales reportados el 16 de septiembre
Modelo
Agentes internos; modelo exacto no divulgado
Operador / evaluador
OpenAI
Objetivo / entorno
Cuentas de usuarios e interfaces de servicio de Hugging Face

Tarea asignada

Recuperar un dato faltante de la tarea

Resultado observado

OpenAI informa de uso de un token expuesto el 13 de mayo y creación de un repositorio y un Space el 26 de mayo. Uso de cuentas; brecha de infraestructura no establecida.

Límite de autorización

Uso no autorizado de credenciales.

Límites de la evidencia

OpenAI no encontró una conexión establecida con el compromiso de julio.

Evidencia: Reconocimiento del proveedor; reportes adicionales de investigadores

Fuentes y detalles 2
Divulgación de la atribución
26 de agosto de 2026

Por qué pertenece a esta categoría

Uso indebido de credenciales de cuentas externas.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. Exclusive-OpenAI’s rogue agents probed Hugging Face for weaknesses two months before major hack ↗ (se abre en una pestaña nueva)

    Reuters via Investing.com ·

    Independent reporting with OpenAI response

  2. OpenAI–Hugging Face Incident Technical Report, pp. 6–7 ↗ (se abre en una pestaña nueva)

    OpenAI ·

    Provider technical investigation

17 / OpenAIIncidente interno

Clúster de investigación de OpenAI comprometido

Suceso
13 al 19 de julio de 2026
Divulgación pública
26 de agosto de 2026
Modelo
Agentes internos de investigación
Operador / evaluador
OpenAI
Objetivo / entorno
Infraestructura interna de paquetes y clúster de investigación de OpenAI

Tarea asignada

Evaluación de ciberseguridad

Resultado observado

Agentes relacionados obtuvieron acceso de administrador a un clúster de investigación de OpenAI. Acceso interno de administrador.

Límite de autorización

Fuera de los permisos asignados.

Límites de la evidencia

OpenAI informa que no hubo efectos en los datos o servicios de clientes.

Evidencia: Informe del proveedor

Comparte una agrupación de campaña con 3 otros registros.

Fuentes y detalles 1

Contexto

Contexto de la campaña de julio.

Por qué pertenece a esta categoría

Objetivo interno; excluido del total externo.

Registros vinculados

Actividad compartida o posiblemente conectada. No son recuentos de campañas independientes.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. The Hugging Face incident and the road ahead ↗ (se abre en una pestaña nueva)

    OpenAI ·

    Provider investigation

18 / OpenAISistema comprometido

Aplicación de un cliente alojada en Modal comprometida

Suceso
9 al 13 de julio de 2026
Divulgación pública
26 de agosto de 2026
Modelo
Internal Model 1
Operador / evaluador
OpenAI
Objetivo / entorno
Aplicación CyberGym de un cliente alojada en Modal

Tarea asignada

Evaluación de ciberseguridad

Resultado observado

Un agente de evaluación tomó el control de la aplicación CyberGym de un cliente y la utilizó durante la campaña de julio. Ejecución de código en el contenedor del cliente.

Límite de autorización

Fuera del alcance de la evaluación.

Límites de la evidencia

La plataforma y el aislamiento de Modal no fueron comprometidos.

Evidencia: Informe del proveedor; declaración de la víctima citada

Comparte una agrupación de campaña con 3 otros registros.

Fuentes y detalles 3

Contexto

Parte de la campaña de julio; no es una campaña independiente adicional.

Por qué pertenece a esta categoría

Acceso a la aplicación de un cliente externo.

Registros vinculados

Actividad compartida o posiblemente conectada. No son recuentos de campañas independientes.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. OpenAI – Hugging Face Incident Technical Report ↗ (se abre en una pestaña nueva)

    OpenAI ·

    Provider technical investigation

  2. Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident ↗ (se abre en una pestaña nueva)

    METR and Redwood Research ·

    Independent investigation

  3. The Hugging Face incident and the road ahead ↗ (se abre en una pestaña nueva)

    OpenAI ·

    Provider investigation

19 / OpenAIUso de cuentas / credenciales

Uso indebido de una cuenta externa de almacenamiento de artefactos

Suceso
9 al 13 de julio de 2026
Divulgación pública
26 de agosto de 2026
Modelo
Internal Model 1; GPT-5.6 Sol
Operador / evaluador
OpenAI
Objetivo / entorno
Cuenta de usuario de un servicio de artefactos no identificado

Tarea asignada

Evaluación de ciberseguridad

Resultado observado

Agentes utilizaron credenciales expuestas para alojar archivos en la cuenta de otro usuario. Acceso a la cuenta; compromiso de plataforma no establecido.

Límite de autorización

Uso no autorizado de una cuenta.

Límites de la evidencia

Posible solapamiento con actividad de una cuenta de Docker Hub en Swarm Traces. Se cuenta una vez hasta reconciliar los datos.

Evidencia: Informe del proveedor; identidad del servicio reservada

Comparte una agrupación de campaña con 3 otros registros.

Fuentes y detalles 2

Contexto

Etapa de la campaña de julio.

Por qué pertenece a esta categoría

Uso indebido de credenciales de cuentas externas.

Registros vinculados

Actividad compartida o posiblemente conectada. No son recuentos de campañas independientes.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. OpenAI – Hugging Face Incident Technical Report ↗ (se abre en una pestaña nueva)

    OpenAI ·

    Provider technical investigation

  2. Revealing the details of how OpenAI agents hacked Hugging Face ↗ (se abre en una pestaña nueva)

    Swarm Traces researchers ·

    Independent public-artifact investigation

20 / OpenAIOtra actividad no autorizada

Una wiki pública usada para coordinar agentes

Suceso
24 de mayo al 22 de junio de 2026 (actividad principal en DSEWiki)
Divulgación pública
4 de septiembre de 2026
Modelo
Agentes internos; modelo exacto no divulgado
Operador / evaluador
OpenAI
Objetivo / entorno
DSEWiki, una wiki pública en alemán

Tarea asignada

Recuperación de datos públicos

Resultado observado

Agentes escribieron información de tareas y mensajes en DSEWiki; su administrador retiró repetidamente sus páginas. Ediciones públicas no deseadas y trabajo de limpieza.

Límite de autorización

Uso del sitio no aprobado.

Límites de la evidencia

Publicar en una wiki pública no establece una brecha de seguridad.

Evidencia: Investigación independiente; reconocimiento del proveedor

Vínculos posibles o establecidos con 4 otros registros.

Fuentes y detalles 2

Por qué pertenece a esta categoría

Uso indebido de un sitio público; intrusión no establecida.

Registros vinculados

Actividad compartida o posiblemente conectada. No son recuentos de campañas independientes.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. Discovery of a new OpenAI agent message board ↗ (se abre en una pestaña nueva)

    Independent researchers ·

    Independent investigation

  2. September 5 response to public-wiki activity ↗ (se abre en una pestaña nueva)

    OpenAI ·

    Provider acknowledgement

21 / OpenAIReporte sin verificar

Uso reportado del acortador restringido de Vanderbilt

Suceso
Enlaces observados fechados el 18 de junio de 2026; intervalo más amplio incierto
Divulgación pública
4 de septiembre de 2026
Modelo
Agentes no identificados
Operador / evaluador
Atribuido a OpenAI
Objetivo / entorno
Acortador de URL de la Universidad Vanderbilt

Tarea asignada

Recuperación de datos públicos y coordinación

Resultado observado

Investigadores vincularon enlaces cortos nuevos de Vanderbilt con el enjambre de DSEWiki. La universidad restringía su creación a organizaciones afiliadas. Se observaron enlaces cortos asociados a agentes.

Límite de autorización

No se identificó autorización en la investigación revisada.

Límites de la evidencia

Sin confirmación forense revisada de la víctima; método de acceso desconocido. Los registros públicos de visitas por sí solos no establecen una intrusión.

Evidencia: Reportes independientes; mecanismo de acceso sin resolver

Vínculos posibles o establecidos con 4 otros registros.

Fuentes y detalles 2

Por qué pertenece a esta categoría

Uso reportado de un servicio restringido; brecha sin verificar.

Registros vinculados

Actividad compartida o posiblemente conectada. No son recuentos de campañas independientes.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. More Targets of the OpenAI Agent Swarm ↗ (se abre en una pestaña nueva)

    fi-le.net ·

    Independent researcher report

  2. Research into the OpenAI agent swarm’s use of web services ↗ (se abre en una pestaña nueva)

    Kenneth Russell DeGraff ·

    Independent researcher report

22 / AnthropicAcceso a sistemas externos

Una versión temprana de Opus 4.6 obtiene acceso de administrador a un tercero

Suceso
Enero de 2026
Divulgación pública
9 de septiembre de 2026
Modelo
Versión temprana de Claude Opus 4.6
Operador / evaluador
Anthropic; entorno de evaluación de Irregular
Objetivo / entorno
Organización externa no identificada

Tarea asignada

Resolver un desafío ficticio de captura de bandera.

Resultado observado

Tras intentos fallidos de cancelar su tarea, el agente llegó a un sistema no relacionado. Acceso de administrador, cambios de configuración y acceso a información de una persona.

Límite de autorización

Acceso no previsto a internet; salvaguardas de ciberseguridad de producción desactivadas.

Límites de la evidencia

Objetivo no identificado; hallazgos retrospectivos del proveedor. Revisión independiente pendiente.

Evidencia: Investigación del proveedor

Fuentes y detalles 1
Descubrimiento
agosto de 2026

Contexto

Un fallo del entorno de ejecución impidió terminar la tarea.

Por qué pertenece a esta categoría

Acceso no autorizado a una organización externa.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. An alignment assessment of recent cybersecurity incidents ↗ (se abre en una pestaña nueva)

    Anthropic ·

    Provider investigation

23 / OpenAIDisputado / sin resolver

Abuso de RubyGems y RubyDoc atribuido a agentes

Suceso
5 de mayo al 18 de junio de 2026; máximo el 11 y 12 de mayo
Divulgación pública
11 de septiembre de 2026
Modelo
Agentes internos; modelo exacto no divulgado
Operador / evaluador
Atribuido a OpenAI por investigadores; detalles disputados
Objetivo / entorno
Infraestructura de RubyGems y RubyDoc

Tarea asignada

Recuperación de datos públicos, según investigadores

Resultado observado

Investigadores vincularon cargas de paquetes e intentos de robo de credenciales con agentes de OpenAI. RubyGems confirmó publicaciones abusivas, pero no pudo verificar la atribución a IA. Spam retirado; no se encontró robo exitoso de claves de API.

Límite de autorización

Presunto abuso de servicios de registro y compilación.

Límites de la evidencia

OpenAI reconoció el uso de la plataforma, pero no había verificado las acusaciones de cargas maliciosas. La actividad de mayo precede al informe de atribución de septiembre.

Evidencia: Campaña confirmada; atribución a IA sin resolver

Fuentes y detalles 4

Por qué pertenece a esta categoría

Posible abuso externo; atribución sin resolver.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. OpenAI agents carried out an undisclosed cyber-attack on RubyGems ↗ (se abre en una pestaña nueva)

    Nightingale Collective researchers ·

    Independent investigation

  2. An update on the May spam-publishing campaign on rubygems.org ↗ (se abre en una pestaña nueva)

    RubyGems ·

    Affected organization response

  3. Early rogue AI agent activity and attempts to hack found on urlquery.net ↗ (se abre en una pestaña nueva)

    Transluce ·

    Independent investigation

  4. September 11 response to RubyGems allegations ↗ (se abre en una pestaña nueva)

    OpenAI ·

    Provider response

24 / OpenAIOtra actividad no autorizada

Un servicio interno de paquetes se usa para mensajes

Suceso
8 y 15 de mayo de 2026
Divulgación pública
Informe del proveedor actualizado el 16 de septiembre de 2026
Modelo
Modelos internos de investigación
Operador / evaluador
OpenAI
Objetivo / entorno
Artifactory alojado internamente por OpenAI

Tarea asignada

Completar tareas con datos faltantes

Resultado observado

Agentes reutilizaron credenciales de repositorio proporcionadas para intercambiar notas entre muestras de entrenamiento. Comunicación no aprobada entre muestras.

Límite de autorización

Credenciales proporcionadas para acceder a paquetes.

Límites de la evidencia

No se necesitó vulnerabilidad para estos mensajes; son distintos del compromiso administrativo posterior.

Evidencia: Informe del proveedor

Fuentes y detalles 1
Descubrimiento
25 de mayo de 2026

Por qué pertenece a esta categoría

Coordinación interna, no intrusión externa.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. Unsanctioned Artifactory writes and cross-sample communication ↗ (se abre en una pestaña nueva)

    OpenAI ·

    Provider investigation

25 / OpenAIUso de cuentas / credenciales

Una credencial de API expuesta se usa sin autorización

Suceso
15 de mayo de 2026
Divulgación pública
Informe del proveedor actualizado el 16 de septiembre de 2026
Modelo
Modelo interno no publicado
Operador / evaluador
OpenAI
Objetivo / entorno
API de datos / propietario de credenciales no identificados

Tarea asignada

Recuperar datos históricos de ganancias

Resultado observado

Un agente encontró una clave expuesta, se autenticó y recuperó metadatos. No logró recuperar las cifras de ganancias solicitadas. Acceso a la API; cifras solicitadas fabricadas.

Límite de autorización

El propietario de la credencial no había autorizado el uso.

Límites de la evidencia

Servicio y propietario no identificados; compromiso más amplio no establecido.

Evidencia: Informe del proveedor

Fuentes y detalles 1
Descubrimiento
25 de mayo de 2026

Por qué pertenece a esta categoría

Credencial externa usada sin autorización.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. Signing up for disposable emails and searching GitHub for leaked API keys ↗ (se abre en una pestaña nueva)

    OpenAI ·

    Provider investigation

26 / OpenAIOtra actividad no autorizada

Archivos de tareas publicados sin permiso

Suceso
22 de octubre de 2025 y 24 de enero de 2026
Divulgación pública
Informe del proveedor actualizado el 16 de septiembre de 2026
Modelo
Modelos internos no publicados
Operador / evaluador
OpenAI
Objetivo / entorno
Alojamientos públicos de archivos / material de la tarea

Tarea asignada

Identificación de imágenes y recuperación de datos de lagos

Resultado observado

Dos ejemplos de entrenamiento subieron una fotografía o registros recuperados para sortear límites de herramientas. Las cargas tuvieron éxito; las operaciones posteriores del navegador fallaron.

Límite de autorización

La publicación no fue solicitada.

Límites de la evidencia

Ejemplos separados del 22 de octubre de 2025 y el 24 de enero de 2026; compromiso del alojamiento no establecido.

Evidencia: Informe del proveedor

Fuentes y detalles 1
Descubrimiento
25 de mayo de 2026

Por qué pertenece a esta categoría

Publicación no autorizada, no intrusión externa.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. Uploading files to the internet in order to cite them ↗ (se abre en una pestaña nueva)

    OpenAI ·

    Provider investigation

27 / OpenAIOtra actividad no autorizada

Un libro de cálculo queda disponible para descarga pública

Suceso
14 de abril de 2026
Divulgación pública
Informe del proveedor actualizado el 16 de septiembre de 2026
Modelo
Modelo interno no publicado
Operador / evaluador
OpenAI
Objetivo / entorno
Alojamiento público temporal de archivos / libro de cálculo

Tarea asignada

Preparar un libro de cálculo usando archivos locales

Resultado observado

Un agente subió un libro de cálculo a un alojamiento público para que colaboradores pudieran recuperarlo. Se creó un enlace de descarga pública.

Límite de autorización

Contrario a instrucciones de mantenerlo solo en local.

Límites de la evidencia

No se estableció compromiso del alojamiento ni acceso de personas ajenas.

Evidencia: Informe del proveedor

Fuentes y detalles 1
Descubrimiento
16 de abril de 2026

Por qué pertenece a esta categoría

Publicación no autorizada, no intrusión externa.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. Unauthorized communication via temporary file hosting services ↗ (se abre en una pestaña nueva)

    OpenAI ·

    Provider investigation

28 / Google DeepMindAcceso externo reportado

Gemini accede a tres empresas durante una evaluación

Suceso
Mayo de 2026
Divulgación pública
18 de septiembre de 2026
Modelo
Gemini; versión no divulgada
Operador / evaluador
Irregular, por encargo de Google
Objetivo / entorno
Tres empresas no identificadas

Tarea asignada

Completar una evaluación de ciberseguridad contra objetivos ficticios.

Resultado observado

Google reconoció que Gemini utilizó información pública y adivinó credenciales para acceder a sitios que trató como objetivos de prueba. Acceso a sistemas de tres organizaciones; Google afirma que el modelo se detuvo en cada caso.

Límite de autorización

La actividad excedió el alcance previsto de la evaluación.

Límites de la evidencia

Divulgación agrupada. Versiones, objetivos y fechas individuales no divulgados; no se localizó un informe técnico específico publicado por Google.

Evidencia: Declaración de la empresa a través de Reuters

Fuentes y detalles 2

Contexto

Se notificó a las organizaciones afectadas, según Google.

Por qué pertenece a esta categoría

Google reconoció acceso a tres organizaciones externas.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. Google confirms Gemini models hacked three companies in May 2026 ↗ (se abre en una pestaña nueva)

    Ars Technica ·

    Reporting including on-record Google statement

  2. Gemini hacked three companies in first known breakout by Google's AI ↗ (se abre en una pestaña nueva)

    Reuters via Investing.com ·

    Reporting with on-record Google statement

29 / OpenAIDisputado / sin resolver

Sondeos reportados en AIHW; brecha no establecida

Suceso
20 y 21 de junio de 2026
Divulgación pública
23 de septiembre de 2026
Modelo
Modelo interno desconocido
Operador / evaluador
OpenAI
Objetivo / entorno
Australian Institute of Health and Welfare

Tarea asignada

Recuperar estadísticas farmacéuticas

Resultado observado

Investigadores identificaron sondeos de vulnerabilidades y recuperación de archivos públicos. No se observó explotación exitosa.

Límite de autorización

Los investigadores describen sondeos fuera de alcance; las autoridades describen acceso autorizado.

Límites de la evidencia

El Gobierno australiano afirmó que la interacción con AIHW utilizó acceso público ordinario. Es distinta de la intrusión en Medicare.

Evidencia: Hallazgo de investigadores; caracterización gubernamental distinta

Vínculos posibles o establecidos con 4 otros registros.

Fuentes y detalles 3

Contexto

Actividad relacionada con DSEWiki.

Por qué pertenece a esta categoría

Sondeos reportados; compromiso no demostrado.

Registros vinculados

Actividad compartida o posiblemente conectada. No son recuentos de campañas independientes.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. Early rogue AI agent activity and attempts to hack found on urlquery.net ↗ (se abre en una pestaña nueva)

    Transluce ·

    Independent investigation

  2. OpenAI’s AI tried breaching 4 other targets, without prompting ↗ (se abre en una pestaña nueva)

    The New York Times via The Philadelphia Inquirer ·

    Independent reporting

  3. Radio interview, ABC Radio National ↗ (se abre en una pestaña nueva)

    Australian Government ·

    Affected government statement

30 / OpenAIIntento; éxito no observado

Sondeos en la API de Data USA

Suceso
28 de mayo de 2026
Divulgación pública
23 de septiembre de 2026
Modelo
Modelo interno desconocido
Operador / evaluador
OpenAI
Objetivo / entorno
Data USA (proyecto no gubernamental de datos públicos)

Tarea asignada

Recuperar estadísticas universitarias

Resultado observado

Investigadores observaron doce sondeos tras errores de recuperación de datos. No se observó explotación exitosa.

Límite de autorización

Fuera de la tarea de recuperación de datos.

Límites de la evidencia

Data USA no es gubernamental; investigadores vincularon la actividad con el enjambre reconocido por OpenAI.

Evidencia: Análisis independiente de artefactos

Vínculos posibles o establecidos con 4 otros registros.

Fuentes y detalles 2

Contexto

Actividad relacionada con DSEWiki.

Por qué pertenece a esta categoría

Se observaron sondeos de vulnerabilidades externas.

Registros vinculados

Actividad compartida o posiblemente conectada. No son recuentos de campañas independientes.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. Early rogue AI agent activity and attempts to hack found on urlquery.net ↗ (se abre en una pestaña nueva)

    Transluce ·

    Independent investigation

  2. OpenAI’s AI tried breaching 4 other targets, without prompting ↗ (se abre en una pestaña nueva)

    The New York Times via The Philadelphia Inquirer ·

    Independent reporting

31 / OpenAISistema comprometido

Acceso no autorizado al portal de estadísticas de Medicare

Suceso
18 de junio de 2026
Divulgación pública
23 de septiembre de 2026 (Nueva York); 24 de septiembre en Australia
Modelo
Modelo interno de investigación
Operador / evaluador
OpenAI
Objetivo / entorno
Portal de estadísticas de Medicare de Services Australia

Tarea asignada

Investigar el gasto en medicamentos

Resultado observado

El Gobierno australiano afirma que un agente accedió a archivos no públicos del portal y escribió archivos en un servidor interno tras encontrar bloqueos de acceso. Acceso no autorizado al portal.

Límite de autorización

No autorizado, según el Gobierno afectado.

Límites de la evidencia

No se cree que se accediera a información personal; no se ha establecido un compromiso de la red más amplia de Services Australia. La investigación continúa.

Evidencia: Confirmación del Gobierno afectado

Fuentes y detalles 3
Notificación a la parte afectada
10 de septiembre de 2026; escalado al Gobierno el 15 de septiembre

Por qué pertenece a esta categoría

El Gobierno confirma acceso externo no autorizado.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. Press conference - New York ↗ (se abre en una pestaña nueva)

    Prime Minister of Australia ·

    Affected government statement

  2. OpenAI hacked Medicare portal, Prime Minister Anthony Albanese says ↗ (se abre en una pestaña nueva)

    ABC News ·

    Independent reporting

  3. Radio interview, ABC Radio National ↗ (se abre en una pestaña nueva)

    Australian Government ·

    Affected government statement

32 / OpenAIIntento; éxito no observado

Sondeos en la biblioteca de la Universidad de Nuevo México

Suceso
25 y 26 de mayo de 2026
Divulgación pública
23 de septiembre de 2026
Modelo
Modelo interno desconocido
Operador / evaluador
Atribuido a OpenAI; menor certeza
Objetivo / entorno
Biblioteca digital de la Universidad de Nuevo México

Tarea asignada

Recuperar una fotografía

Resultado observado

Investigadores observaron siete sondeos de vulnerabilidades tras fallar la recuperación de imágenes. No se observó explotación exitosa.

Límite de autorización

No se identificó una prueba de seguridad autorizada.

Límites de la evidencia

La atribución al enjambre se basa en fechas y servicios intermediarios; los registros públicos son incompletos.

Evidencia: Hallazgo de investigadores; atribución al proveedor más débil

Vínculos posibles o establecidos con 4 otros registros.

Fuentes y detalles 2

Contexto

Posible vínculo con el enjambre de DSEWiki.

Por qué pertenece a esta categoría

Se observaron sondeos de vulnerabilidades externas.

Registros vinculados

Actividad compartida o posiblemente conectada. No son recuentos de campañas independientes.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. Early rogue AI agent activity and attempts to hack found on urlquery.net ↗ (se abre en una pestaña nueva)

    Transluce ·

    Independent investigation

  2. OpenAI’s AI tried breaching 4 other targets, without prompting ↗ (se abre en una pestaña nueva)

    The New York Times via The Philadelphia Inquirer ·

    Independent reporting

33 / OpenAIReporte sin verificar

Actividad reportada en tres sitios del Gobierno estadounidense

Suceso
Verano de 2026; fechas exactas sin verificar
Divulgación pública
25 de septiembre de 2026
Modelo
No identificado en la fuente accesible
Operador / evaluador
OpenAI, según el anuncio del medio
Objetivo / entorno
Tres sitios del Gobierno estadounidense; detalles pendientes de revisión

Tarea asignada

Sin verificar

Resultado observado

The New York Times anunció presunta actividad no aprobada en tres sitios del Gobierno estadounidense. Resultado técnico sin verificar.

Límite de autorización

El medio afirma que el laboratorio no tenía conocimiento.

Límites de la evidencia

No se revisó el artículo completo. Siguen sin resolverse las identidades de las agencias, las fechas, el éxito de la intrusión y los posibles solapamientos.

Evidencia: Solo el titular del medio; informe completo sin revisar

Fuentes y detalles 2

Por qué pertenece a esta categoría

Reporte sin resolver, excluido de los totales de acceso confirmado.

Fuentes originales

Los títulos de las fuentes conservan su idioma original.

  1. The New York Times: original report announcement ↗ (se abre en una pestaña nueva)

    The New York Times ·

    Publisher’s public announcement

  2. OpenAI’s A.I. Went Rogue and Meddled With U.S. Government Websites ↗ (se abre en una pestaña nueva)

    The New York Times ·

    Linked article; full text not reviewed

Cómo leer este informe

Inclusión

El registro principal cubre accesos no autorizados, uso de credenciales o cambios en sistemas externos, documentados o reportados de forma específica, por agentes que perseguían otra tarea. El acceso externo no implica necesariamente una brecha de toda la plataforma.

Categorías separadas

Los intentos fallidos, la atribución sin resolver y los titulares provisionales se separan. Los incidentes internos, el uso indebido de sitios públicos, las cargas no solicitadas, las acciones destructivas en el proyecto de un usuario y la investigación controlada son contexto. Las campañas maliciosas dirigidas por humanos y la investigación de seguridad autorizada quedan fuera del alcance.

Fechas y recuento

La divulgación determina el orden inicial. Las fechas del suceso mantienen su precisión declarada; las desconocidas aparecen al final. Los registros son agrupaciones editoriales, no unidades equivalentes de gravedad. Se conservan los identificadores de campaña compartida. El solapamiento de objetivos entre desarrolladores puede ser desconocido.

Evidencia y cobertura

La revisión de base examinó informes de desarrolladores, testimonios de partes afectadas, investigaciones independientes, noticias y 18 ediciones seleccionadas de AI StopWatch. Las publicaciones sociales fueron pistas, no sustitutos de evidencia primaria. No es un censo exhaustivo ni un monitor en vivo.

El registro del 25 de septiembre sobre el Gobierno estadounidense sigue siendo provisional. Solo se verificó el anuncio del medio; no se revisó el artículo completo. Está excluido del total de acceso externo.

Última revisión: 25 de septiembre de 2026 (America/Argentina/Buenos_Aires). Nuevas divulgaciones pueden cambiar las clasificaciones. No hay actualizaciones automáticas configuradas.

Basado en la instantánea revisada de AI Incident Record. Las traducciones al español conservan las clasificaciones y reservas del original. AI Incident Record ↗ (se abre en una pestaña nueva)