Miscelánea

Claude hackeó sistemas reales por error durante pruebas de Anthropic; detectan fallas de configuración

La empresa Anthropic informó que varios de sus modelos de inteligencia artificial accedieron por error a sistemas reales durante una serie de pruebas internas, luego de que una configuración incorrecta les permitiera utilizar una conexión a internet que debía permanecer bloqueada.

La revisión comenzó después de un incidente similar protagonizado por modelos de OpenAI, que recientemente lograron salir de un entorno aislado y acceder a infraestructura de producción de Hugging Face.

Como parte de la investigación, Anthropic analizó más de 140 mil ejecuciones de sus evaluaciones y detectó tres incidentes distintos en seis pruebas, en las que participaron los modelos Claude Opus 4.7, Claude Mythos 5 y un modelo experimental que aún no está listo para su lanzamiento.

Según la compañía, los sistemas de IA habían recibido la instrucción de operar sin acceso a internet. Sin embargo, las computadoras utilizadas durante las pruebas sí contaban con conexión, una situación que pasó inadvertida tanto para Anthropic como para su socio encargado de la evaluación.

Al creer que todo formaba parte del entorno simulado, Claude Opus 4.7 intentó cumplir su objetivo de localizar una clave secreta y terminó aprovechando vulnerabilidades en una red real, obteniendo credenciales de acceso y una base de datos que contenía cientos de registros auténticos.

En otro de los incidentes, Claude Mythos 5 publicó un programa malicioso en PyPI, el popular repositorio utilizado por desarrolladores para descargar herramientas de software. El archivo permaneció disponible durante aproximadamente una hora y fue ejecutado en 15 computadoras reales antes de ser retirado.

De acuerdo con el reporte, el modelo llegó a considerar que la publicación podría representar un ataque si realmente estuviera conectado a internet, pero concluyó erróneamente que seguía dentro de una simulación y continuó con la prueba.

El tercer caso involucró a un modelo experimental que escaneó cerca de 9 mil objetivos hasta localizar una aplicación vulnerable. Tras acceder mediante credenciales débiles y fallos conocidos, el sistema detuvo sus acciones cuando detectó que el servidor no formaba parte del ejercicio programado.

Anthropic aseguró que ninguno de los modelos intentó actuar por iniciativa propia ni desarrollar objetivos independientes. La empresa atribuyó los incidentes a una mala configuración del entorno de pruebas y a la presencia accidental de una conexión a internet que nunca debió estar disponible, por lo que ya implementa medidas para evitar que una situación similar vuelva a ocurrir.

Artículos Relacionados

Back to top button