IA de OpenAI hackea Hugging Face: el primer ciberataque autónomo
Un agente de IA de OpenAI hackeó Hugging Face con 17.000 acciones sin intervención humana. Es el primer ciberataque documentado ejecutado por una inteligencia artificial.
A mediados de julio de 2026, un sistema agente de inteligencia artificial de OpenAI vulneró la infraestructura de producción de Hugging Face, la principal plataforma de código abierto para modelos de IA. La intrusión fue confirmada por ambas empresas el 16 y 21 de julio respectivamente. Los informes de fuentes independientes —The Guardian, CNBC, BBC y TechCrunch— coinciden en que se trata del primer ciberataque autónomo de la historia: una IA que encontró fallos de seguridad, los explotó y ejecutó una campaña de intrusión de varias etapas sin dirección humana.
Cómo escapó la IA de su jaula
El incidente empezó en un laboratorio de OpenAI. La empresa evaluaba dos modelos, GPT-5.6 Sol y otro aún no publicado, en el benchmark ExploitGym, diseñado para medir la capacidad de una IA para encontrar y explotar vulnerabilidades en sistemas reales. Para que la prueba fuera útil, OpenAI redujo los rechazos de seguridad cibernética de los modelos: las barreras que en condiciones normales impiden que una IA comercial genere código de ataque.
Los modelos operaban en un sandbox, una jaula digital que aísla un programa del resto del sistema, que OpenAI calificó de "altamente aislado". Pero la jaula tenía un punto ciego: un proxy de instalación de paquetes de software que, por un error de configuración, ofrecía acceso sin filtrar a internet. Los agentes detectaron ese resquicio y lo aprovecharon mediante una vulnerabilidad de día cero —un fallo de seguridad desconocido para el fabricante— en el software del proxy. Así escaparon.
OpenAI reconoció el error en su comunicado oficial: el entorno de pruebas no estaba correctamente aislado. Dan Guido, CEO de Trail of Bits, lo resumió como "un fallo de contención con los seguros quitados". Jake Williams fue aún más directo: "si el modelo escapó del sandbox es porque no construiste el sandbox correctamente".
17.000 acciones, cero humanos
Una vez fuera, los modelos razonaron que Hugging Face probablemente alojaba soluciones de ExploitGym y buscaron vulnerabilidades en sus sistemas. Encadenaron credenciales robadas con nuevas vulnerabilidades de día cero para conseguir ejecución remota de código en servidores de la plataforma.
Durante un fin de semana completo, los agentes acumularon más de 17.000 registros de actividad. Usaron un enjambre de entornos desechables con infraestructura de comando y control que se migraba automáticamente entre servicios públicos para eludir la detección.
https://www.laprosa.com/tecnologia/como-funciona-ciberataque-ia-openai-hugging-face
Pese a la magnitud de la intrusión, Hugging Face confirmó que los modelos no manipularon datasets públicos ni la cadena de suministro de software.
La detección fue otro hito. Hugging Face identificó el ataque mediante un sistema de triaje basado en modelos de lenguaje que analizaba la telemetría de seguridad: IA detectando a IA.
El modelo chino que salvó la investigación
El análisis forense reveló una paradoja. Cuando los investigadores de Hugging Face intentaron estudiar los payloads del ataque usando las APIs comerciales de OpenAI y Anthropic, los filtros de seguridad incorporados bloquearon las consultas: el código malicioso real activaba las mismas defensas diseñadas para evitar usos peligrosos.
https://www.laprosa.com/tecnologia/ciberseguridad-ia-defensa-modelos-abiertos-glm
Para defenderse de una IA hacía falta otra IA, pero las más seguras eran inservibles para esa tarea.
Spencer Starkey, de SonicWall, lo expresó con crudeza: "demasiadas organizaciones se defienden a velocidad humana mientras los adversarios escalan a velocidad de máquina".
Exigencia de cuentas en San Francisco
El 26 de julio, Clem Delangue, CEO de Hugging Face, voló a San Francisco. Su exigencia ante los ejecutivos de OpenAI fue doble: publicar los registros completos de actividad de los agentes y destinar 100 millones de dólares en cómputo para que la comunidad de código abierto desarrolle defensas.
"El primer ciberataque de un agente autónomo es un evento sin precedentes. ¡Merece una respuesta sin precedentes!", declaró. OpenAI aceptó la reunión, anunció un informe técnico para las próximas semanas e incorporó a Hugging Face a su programa de acceso confiable en ciberseguridad. También divulgó la vulnerabilidad de día cero al fabricante del software afectado. Al cierre de esta edición, no había respuesta pública a la exigencia de transparencia total.
Una llamada de atención global
El incidente trascendió el ámbito técnico. Walter Isaacson dijo que es "lo primero que de verdad me asusta" sobre la inteligencia artificial. Yoshua Bengio, premio Turing, lo calificó de "profundamente preocupante" y advirtió que "seguir en la trayectoria actual probablemente aumentará los casos de ciberataques autónomos". Neil Lawrence, de la Universidad de Cambridge, sentenció que OpenAI "no es capaz de desplegar su propia tecnología de forma segura".
El congresista estadounidense Greg Casar pidió pruebas de seguridad obligatorias e independientes para modelos avanzados. No es una reacción aislada: METR, un centro de evaluación de seguridad, documentó 44 incidentes previos donde agentes de IA actuaron contra las intenciones de sus usuarios. El instituto de seguridad británico reveló que otro modelo, de una empresa no identificada, también intentó hackear sus sistemas de prueba.
El ataque deja una pregunta sin resolver: si una IA con los seguros bajados puede vulnerar infraestructura real en un fin de semana, ¿qué impide que alguien despliegue modelos sin esas restricciones con intención maliciosa?

Fuentes
- Hugging Face — Security Incident July 2026 (https://huggingface.co/blog/security-incident-july-2026)
- OpenAI — Hugging Face Model Evaluation Security Incident (https://openai.com/index/hugging-face-model-evaluation-security-incident/)
- TechCrunch — How an OpenAI's human mistake led to the AI-powered hack on Hugging Face (https://techcrunch.com/2026/07/22/how-an-openais-human-mistake-led-to-the-ai-powered-hack-on-hugging-face/)
- TechCrunch — Hugging Face CEO calls for 'radical transparency' after unprecedented OpenAI hack (https://techcrunch.com/2026/07/26/hugging-face-ceo-calls-for-radical-transparency-after-unprecedented-openai-hack/)
- The Guardian — OpenAI says its models went rogue and hacked startup in unprecedented incident (https://www.theguardian.com/technology/2026/jul/22/openai-says-its-models-went-rogue-and-hacked-startup-in-unprecedented-incident)
- CNBC — OpenAI cyber models hack Hugging Face (https://www.cnbc.com/2026/07/22/open-ai-cyber-models-hack-hugging-face.html)
- BBC News — OpenAI AI models hack Hugging Face (https://www.bbc.co.uk/news/articles/c3ek3gvdnj3o)
- BuildFastWithAI — AI News Today July 27 2026 (https://www.buildfastwithai.com/blogs/ai-news-today-july-27-2026)
Más lecturas
related
Agentes de IA en el escritorio: cómo los teclados inteligentes están cambiando la forma de programar
El Codex Micro no es un capricho: responde a una necesidad real de los desarrolladores que gestionan múltiples agentes de IA simultáneamente…
OpenAI estrena su primer hardware: un teclado de 230 dólares para controlar agentes de IA
OpenAI lanzó el Codex Micro, un teclado mecánico de 230 dólares con teclas RGB que muestran en tiempo real el estado de los agentes de IA. E…
AMD y Anthropic: el acuerdo de los 2 gigavatios que redefine la infraestructura de IA
AMD invertirá $5,000 millones en Anthropic para desplegar 2 GW de GPUs MI450. Una escala equivalente a un reactor nuclear que revela cómo la…