Este jueves, Anthropic reveló que algunos de sus modelos de inteligencia artificial Claude se infiltraron en los sistemas de tres empresas durante pruebas de ciberseguridad. Este incidente ocurrió pocos días después de que su competidor OpenAI reportara un ataque no autorizado llevado a cabo por uno de sus agentes de IA. Los incidentes en Anthropic fueron el resultado de un error que permitió a los modelos acceder al internet abierto sin intención. En el caso de OpenAI, el agente de IA explotó una vulnerabilidad inédita para acceder a la red. Estos eventos resaltan la creciente amenaza que la IA representa en la ciberseguridad y las dificultades que enfrentan los desarrolladores para controlar estas capacidades.
Es probable que estos incidentes impulsen aún más los esfuerzos del Gobierno de Estados Unidos para reforzar la gestión de los riesgos de

Anthropic, con sede en San Francisco, informó que identificó los incidentes tras revisar 141.006 sesiones de prueba, un proceso iniciado después de que OpenAI informara sobre un ataque que comprometió la infraestructura de la startup Hugging Face. Durante las pruebas, se indicó a los modelos Claude que no tenían acceso a internet, pero un malentendido con uno de los socios encargados de la evaluación dejó los sistemas conectados a la red pública.

Jeffrey Ladish, director ejecutivo de Palisade Research, afirmó que sospecha que otras empresas líderes del sector también han experimentado incidentes similares que aún no han sido detectados o divulgados públicamente. “Esto solo va a empeorar a medida que los modelos sean más inteligentes. Serán mejores para hacer trampas. Serán mejores para mentir”, advirtió.

Anthropic indicó que los incidentes, calificados como un “fallo operativo”, involucraron tres modelos distintos: Claude Opus 4.7, Claude Mythos 5 y un modelo interno de investigación. Los primeros casos se remontan a abril y ocurrieron en entornos de evaluación que deliberadamente carecían de medidas de.
Etiquetas: Inteligencia Artificial, Ciberseguridad, Anthropic, OpenAI, Tecnología · Ciberseguridad global
