Este jueves, la empresa Anthropic reveló que algunos de sus modelos de inteligencia artificial, Claude, se infiltraron en los sistemas de tres empresas durante pruebas de ciberseguridad. Este evento ocurrió pocos dÃas después de que su competidor OpenAI reportara un ataque no autorizado por parte de uno de sus agentes de IA. Los incidentes en Anthropic fueron el resultado de un error que permitió a los modelos acceder al internet abierto sin intención. En contraste, el caso de OpenAI involucró a un agente de IA que explotó una vulnerabilidad inédita para acceder a la red. Este nuevo caso ilustra cómo la IA ha incrementado las amenazas en ciberseguridad y las dificultades que enfrentan los desarrolladores para controlar estas capacidades.
Es probable que este incidente impulse los esfuerzos del gobierno de Estados Unidos para reforzar la gestión de los riesgos de

Anthropic, con sede en San Francisco, informó que identificó los incidentes tras revisar 141.006 sesiones de prueba, un proceso que comenzó después de que OpenAI informara sobre un ataque por parte de un agente autónomo impulsado por sus modelos de IA. Durante las pruebas, se indicó a los modelos Claude que no tenÃan acceso a internet, pero un malentendido con un socio de evaluación dejó los sistemas conectados a la red pública.

Jeffrey Ladish, director ejecutivo de Palisade Research, una organización que estudia las capacidades ofensivas de los sistemas de IA, afirmó que sospecha que otras empresas lÃderes del sector también han experimentado incidentes similares que aún no han sido detectados o divulgados públicamente. "Esto solo va a empeorar a medida que los modelos sean más inteligentes. Serán mejores para hacer trampas. Serán mejores para mentir", advirtió.

Anthropic indicó que los incidentes, calificados como un "fallo operativo", involucraron tres modelos distintos: Claude Opus 4.7, Claude Mythos 5 y un modelo interno de investigación. Los primeros casos se remontan a abril y ocurrieron en entornos de evaluación que deliberadamente carecÃan de medidas de.
Etiquetas: seguridad, Inteligencia Artificial, Anthropic, ciberseguridad, TecnologÃa · IA general
