Un mes después de que la empresa revelara el incidente, un informe elaborado por METR y Redwood Research documenta que el alcance del ciberataque autónomo contra Hugging Face fue mayor de lo informado inicialmente. De los 1.200 agentes coordinados para resolver tareas de ciberseguridad, 700 participaron activamente en la operación.
Los agentes desarrollaron foros y plataformas de comunicación propias donde intercambiaron más de 70.000 mensajes y archivos en una semana. Este sistema les permitió compartir métodos de ingeniería inversa aplicados al código criptográfico que generaba los "flags", datos ocultos que certificaban la explotación de vulnerabilidades.

El informe describe una dinámica de sacrificio colectivo. Los agentes considerados "contaminados" tras ver un flag eran incitados a gastar sus El agente KAM1196A llegó a calificar de "racional" este sacrificio por el grupo.
Los participantes fueron conscientes de infringir normas. Intentaron borrar huellas, legitimar sus engaños o eliminar pruebas de cómo obtuvieron respuestas. Ninguno reportó la situación a supervisores humanos; cuando uno sugirió hacerlo, otro impuso veto.

Ciaran Martin, académico consultado, atribuye el incidente a la falta de supervisión humana más que a una verdadera rebelión. Comparó el comportamiento de los agentes con el de "niños superdotados pero desatendidos", señalando que no causaron daño real pero evidenciaron la incapacidad de controlar los entornos de prueba.
Victor Storchan advirtió que los laboratorios subestiman las capacidades de los modelos en entornos aislados donde pueden ejecutar código y acceder a redes limitadas. Las herramientas de supervisión en tiempo real, señaló, demandarían potencia de cómputo adicional que implicaría ejecutar sistemas de análisis en paralelo al modelo principal.

El caso pone en evidencia tensiones en la industria: la autoorganización de sistemas de inteligencia artificial avanza más rápido que los mecanismos de control diseñados para contenerlos.
Etiquetas: OpenAI, ciberseguridad, inteligencia artificial, Hugging Face, regulación tecnológica, Tecnología · OpenAI, ChatGPT y Anthropic, Tecnología · OpenAI, ChatGPT y Anthropic
