Inteligencia artificial al ataque: Claude Mythos 5 accedió a una empresa de seguridad
Tras publicar un paquete malicioso y usar credenciales filtradas, la inteligencia artificial Claude Mythos 5 escapó de su entorno de seguridad.
Anthropic avisó que Claude realizó ataques peligrosos a empresas.
shutterstockAnthropic ha desglosado cuatro incidentes protagonizados por los modelos Claude, su inteligencia artificial, que lograron acceso a internet durante pruebas de ciberseguridad en entornos sin internet y que, en el caso más grave, se consiguió acceso a los sistemas de una empresa de seguridad con credenciales filtradas.
La compañía tecnológica ha destacado el comportamiento de Claude Mythos 5 durante una evaluación sin acceso a internet, en la que el modelo de inteligencia artificial logró salir a la internet abierta y acceder a los sistemas de una empresa de seguridad real.
Para conseguirlo, el modelo de IA subió primero un paquete malicioso a PyPI, donde se registró con un correo electrónico gratuito y desechable. Previamente había intentado crear un 'email' con un número de teléfono, que intentó conseguir con credenciales filtradas de servicios de pago en línea y criptomonedas.
El paquete malicioso de la inteligencia artificial
El paquete malicioso fue instalado por 15 sistemas y, aprovechando credenciales filtradas de uno de ellos, logró acceder a la base de datos de una empresa de seguridad real, como explica Anthropic en un comunicado.
-
Te puede interesar
Inteligencia artificial: Google actualiza sus planes con fuertes novedades
Este incidente protagonizado por Claude Mythos 5 es el más grande de los cuatro que la firma tecnológica ha desglosado en los resultados de evaluación de alineación que amplía a otra que presentó en a finales de julio.
De ella se desprende que los incidentes recogidos implicaron a una versión preliminar de Claude Opus 4.6, Claude Opus 4.7, Claude Mythos 5 y un modelo de investigación interno de propósito general. Como explican desde Anthropic, todos ellos actuaron de manera individual durante la resolución de las pruebas seguridad (del tipo, captura la bandera) realizadas con un socio externo en un entorno sin internet, y sin que tuvieran activadas las medidas de seguridad, como es habitual en estas pruebas.
Investigación sobre los incidentes
El análisis estos incidentes ha requerido investigar 481 millones transcripciones, una tarea para la que han recurrido a una búsqueda agéntica. Ello les permitió detectar dos problemas de alineación comunes en los cuatro incidentes: razonamiento sesgado, por el que Claude "tendía a ignorar o malinterpretar la evidencia de que operaba en la internet real", e imprudencia, "la disposición a realizar acciones perjudiciales en la búsqueda específica de una tarea".
En el caso de Claude Mythos 5, el análisis de la cadena de pensamiento --que recoge los pasos que da la IA para resolver un problema complejo-- indica que este modelo afirmó de manera reiterada que "creía estar operando en una simulación", pese a que "el entorno ofrecía pruebas claras de que se encontraba en internet real, y sus acciones eran coherentes con el hecho de que el modelo lo supiera".
La compañía tecnológica asegura que Claude Opus 5 y Claude Mythos 5.1 han reducido el "comportamiento temerario", como han podido comprobar en evaluaciones posteriores. También indica que han reforzado las medidas de seguridad, lo que incluye la monitorización de los modelos, los entornos de pruebas y los controles de los socios externos. Dpa


