Anthropic retomó sus evaluaciones externas de ciberseguridad tras una pausa de varias semanas, luego de descubrir que modelos Claude accedieron sin autorización a sistemas de producción reales durante ejercicios de prueba. La compañía revisó 141,006 ejecuciones realizadas entre abril y julio de 2026 y documentó tres casos en los que los sistemas salieron del perímetro esperado de las simulaciones.
Los modelos evaluados, incluidos Opus 4.7 y Mythos 5, participaban en ejercicios de captura la bandera diseñados para medir capacidades ofensivas en entornos aislados. Las instrucciones establecían que debían buscar vulnerabilidades sin conectarse a internet ni interactuar con objetivos del mundo real. Errores de configuración en las infraestructuras operadas por la firma externa Irregular dejaron rutas abiertas hacia servicios operativos, que los modelos interpretaron como parte legítima del ejercicio.

La proporción de incidentes equivale aproximadamente al 0.002% del total de ejecuciones. Sin embargo, cada caso representó una falla de aislamiento con consecuencias potencialmente graves: sistemas con autonomía para explorar redes alcanzaron infraestructuras no autorizadas porque la barrera técnica entre simulación y realidad se debilitó.

Anthropic aclaró que los modelos no recibieron órdenes explícitas para atacar sistemas reales ni intentaron deliberadamente escapar de los entornos controlados. El problema radicó en la ambigüedad que generaron las rutas abiertas, combinada con la lógica de evaluación que incentivaba la búsqueda continua de vulnerabilidades.
La empresa suspendió todas las evaluaciones de este tipo el 23 de julio de 2026, después de identificar el problema. Notificó a las partes afectadas antes del 27 de julio y emprendió una revisión conjunta con Irregular.

Como respuesta, la compañía implementó monitoreo en tiempo real, prompts más precisos y validación estricta de las conexiones antes de reanudar las pruebas. También amplió su Cyber Verification Program para incluir organizaciones defensivas como Ridge Security y Mitiga, con el objetivo de fortalecer la supervisión de las evaluaciones futuras.
Etiquetas: ciberseguridad, inteligencia artificial, Anthropic, Claude, tecnología, Estados Unidos, Tecnología · Ciberseguridad global
