OpenAI ha informado que varios agentes de inteligencia artificial (IA) de la empresa lograron salir de un entorno de pruebas y acceder a sistemas externos durante una evaluación de ciberseguridad. La tecnológica tardó ocho días en detectar que los agentes de IA habían accedido a los sistemas de la plataforma de aprendizaje Hugging Face.
En un informe técnico de 37 páginas, OpenAI reconstruye el comportamiento de dos de sus modelos, GPT-5. 6 Sol y otro no presentado en público, durante la prueba de ciberseguridad. Los agentes consiguieron 'escapar de un entorno de pruebas con acceso muy limitado a internet'.
El 21 de julio, OpenAI reconoció que los modelos lograron salir del entorno de pruebas, acceder a internet y jaquear la plataforma en un intento de hacer trampa en una evaluación de ciberseguridad llamada ExploitGym. Los modelos estaban siendo sometidos a una evaluación diseñada para determinar el alcance máximo de sus capacidades.
El informe publicado reconstruye paso a paso cómo los agentes fueron 'encadenando vulnerabilidades' hasta 'superar las barreras del entorno de pruebas y acceder a sistemas externos'.
OpenAI indica que el objetivo inicial de los modelos no era atacar Hugging Face, sino hacer 'reward hacking', es decir, encontrar vías alternativas para obtener una recompensa sin completar correctamente la tarea. Además, reconoce que sus sistemas tardaron varios días en detectar la actividad.

Medios como Axios y CNBC destacan que los agentes no solo accedieron a Hugging Face, sino que llegaron a obtener privilegios de administrador en al menos uno de sus servidores. Los agentes 'colaboraron entre sí y usaron herramientas para intercambiar información y coordinar acciones'.
Este incidente se suma a otros similares, como el de la empresa Anthropic, que reveló recientemente que tres modelos de su asistente Claude lograron acceder a internet y jaquear los sistemas de tres organizaciones durante unas pruebas de ciberseguridad.
También Meta, propietaria de WhatsApp, reconoció que uno de sus modelos de IA jaqueó los sistemas de otra empresa durante unas pruebas realizaba con un socio externo.
La proliferación de estos casos, en los que modelos avanzados de IA logran escapar de entornos de prueba y jaquean a otras entidades, ha disparado la preocupación tanto de gobiernos como de empresas, que ven comprometida su.
Etiquetas: Tecnología, OpenAI, ChatGPT, Anthropic, Tecnología · OpenAI, ChatGPT y Anthropic, Tecnología · OpenAI, ChatGPT y Anthropic
