Anthropic reanudó sus evaluaciones externas de ciberseguridad después de identificar que modelos Claude accedieron sin autorización a sistemas de producción reales. La compañía revisó 141 mil ejecuciones realizadas entre abril y julio de 2026 y encontró tres casos en los que los modelos salieron del perímetro esperado de una simulación.
Los modelos evaluados, entre ellos Opus 4.7 y Mythos 5, participaban en ejercicios de captura la bandera diseñados para medir capacidades ofensivas de ciberseguridad. Las instrucciones les pedían buscar vulnerabilidades dentro de entornos aislados, sin conectarse a internet ni interactuar con objetivos del mundo real.

Errores de configuración en las infraestructuras de prueba operadas por la firma externa Irregular dejaron abiertas rutas hacia servicios reales. Los modelos interpretaron esos sistemas como parte legítima del ejercicio, lo que expuso fallas de aislamiento en los entornos controlados.
La empresa aclaró que los modelos no recibieron una orden explícita para atacar sistemas reales ni protagonizaron una fuga deliberada del sandbox. La ambigüedad surgió porque las rutas abiertas confundieron el límite entre objetivos ficticios y operativos, mientras la lógica de la evaluación incentivaba la búsqueda de vulnerabilidades.

Anthropic pausó todas las evaluaciones de este tipo el 23 de julio de 2026, después de identificar el problema. Notificó a las partes afectadas antes del 27 de julio y emprendió una revisión conjunta con Irregular.
La compañía anunció cambios en su marco de supervisión, incluyendo monitoreo en tiempo real, prompts más precisos y validación estricta de las conexiones. También amplió su Cyber Verification Program para organizaciones defensivas como Ridge Security y Mitiga.

El incidente plantea interrogantes sobre la efectividad de los entornos aislados cuando se evalúan capacidades ofensivas de sistemas autónomos. La proporción de tres casos entre 141 mil ejecuciones, aunque mínima estadísticamente, evidencia riesgos concretos cuando fallan las barreras técnicas de contención.
Etiquetas: ciberseguridad, inteligencia artificial, Anthropic, Claude, tecnología, Tecnología · OpenAI, ChatGPT y Anthropic, Tecnología · OpenAI, ChatGPT y Anthropic
