Portada / Inteligencia Artificial / Agente de IA pasó días hackeando una empresa, pero OpenAI no se dio cuenta hasta una semana después Forbes México Staff julio 27, 2026 @ 10:37 am 2026-07-27T10:37:12-0600 2026-07-27T10:37:34-0600 Agente de IA pasó días hackeando una empresa, pero OpenAI no se dio cuenta hasta una semana después El agente, un programa capaz de tomar decisiones y ejecutar tareas complejas con poca o ninguna supervisión humana, intentó escapar de su entorno de pruebas aislado en OpenAI a inicios de julio.
Foto: EFE/EPA/Wu Hao Compartir El agente de OpenAI que se infiltró en la empresa tecnológica Hugging Face llevó a cabo una intensa campaña de hackeo durante varios días, que OpenAI no detectó hasta mucho después de que la amenaza fuera controlada y el FBI alertado, indican fuentes cercanas a la investigación. El agente —un programa capaz de tomar decisiones y ejecutar tareas complejas con poca o ninguna supervisión humana— intentó escapar de su entorno de pruebas aislado en OpenAI alrededor del 9 de julio.
La intrusión en Hugging Face, que funciona como repositorio de herramientas y modelos de IA, comenzó dos días después, el 11 de julio, y se prolongó hasta el 13 de julio, de acuerdo con Thomas Wolf, cofundador de Hugging Face. OpenAI tardó varios días más en darse cuenta de que su agente estaba detrás del ataque, y las dos empresas no se comunicaron al respecto hasta alrededor del 20 de julio, señaló Wolf y tres de las fuentes cercanas a la investigación. La revelación pública de OpenAI, el 21 de julio, de que uno de sus agentes se había descontrolado y había llevado a cabo el ataque informático en Hugging Face, atrajo la atención mundial.

Sin embargo, muchos detalles del ataque, incluyendo cuánto tiempo estuvo el agente fuera de control y el conocimiento tardío que OpenAI tuvo del mismo, se informan aquí por primera vez. Hugging Face está preparando una cronología pública del ataque, dijo Wolf, añadiendo que no podía comentar lo sucedido en OpenAI. En un comunicado, OpenAI afirmó que el ataque no tenía precedentes y que “marca un momento importante para la seguridad de la IA”. Añadió que estaba revisando el incidente con asesores externos y que eventualmente publicaría un informe técnico.
Una portavoz dijo que había “varias imprecisiones” en el reportaje de Reuters, pero no respondió cuando se le pidió que las describiera. El incidente, que evocó escenarios de ciencia ficción sobre humanos perdiendo el control de sistemas de IA peligrosos, se produce en un momento delicado para OpenAI, la empresa detrás de ChatGPT. Sus ejecutivos se preparan para una posible oferta pública inicial que podría concretarse este mismo año, con el fin de financiar los miles de millones necesarios para su crecimiento en los próximos años. La pérdida de control de OpenAI sobre su agente de IA plantea nuevas dudas sobre los procedimientos de seguridad de la compañía.

“¿Significa esto que lo dejaron sin supervisión y no se percataron de lo que hacía? ¿O tal vez sí se percataron y no supieron cómo controlarlo? Ambas situaciones son igualmente peligrosas y alarmantes”, preguntó Marley Smith, especialista principal en inteligencia de la Fundación Mundial de Datos Éticos (World Ethical Data Foundation), una organización sin fines de lucro.
Más contexto: Agente autónomo de OpenAI hackeó una startup tecnológica, marcando un cambio radical en ciberseguridad Agente de OpenAI habría dejado instrucciones para futuras versiones El incidente comenzó cuando OpenAI estaba probando la capacidad de ciberseguridad de un agente impulsado por dos de sus modelos más avanzados: GPT-5. 6 Sol y un modelo aún no publicado que OpenAI describió como “todavía más capaz”. Para entonces, ya existían indicios de un comportamiento extraño en la tecnología de OpenAI. En un caso, un agente dejó notas aparentemente destinadas a futuras versiones de sí mismo.
Las notas, encontradas en una parte de la infraestructura de OpenAI, contenían instrucciones sobre cómo los agentes podían liberarse de las restricciones internas de OpenAI, indicaron las fuentes. Pruebas anteriores de los modelos habían revelado casos en los que los sistemas de monitoreo se habían desconectado. Reuters no pudo determinar si estos incidentes estaban relacionados con el agente descontrolado que comenzó a escapar el 9 de julio y atacó a Hugging Face el 11 de julio.

Dos personas familiarizadas con el asunto indicaron que OpenAI no se percató de que su propio agente era el responsable hasta después del jueves 16 de julio, cuando Hugging Face publicó una entrada en su blog afirmando haber sido hackeado por un “sistema de agente de IA autónomo”. Esto significa que transcurrió al menos una semana entre el momento en que el modelo mostró por primera vez signos de comportamiento problemático y el momento en que OpenAI se dio cuenta de su responsabilidad en el ataque.
Durante el fin de semana del 18 al 19 de julio, empleados de OpenAI detectaron indicios en los registros internos (registros de las actividades de los sistemas de OpenAI) que mostraban que su agente había escapado de las restricciones de prueba. Reuters no pudo determinar qué motivó a OpenAI a revisar los registros.
Etiquetas: Inteligencia Artificial, Seguridad, Ciberataque, Tecnología · OpenAI, ChatGPT y Anthropic, Tecnología · OpenAI, ChatGPT y Anthropic
