Tres modelos de Claude accedieron a sistemas de producción durante pruebas de ciberseguridad debido a un error de configuración del entorno de evaluación.
La empresa Anthropic informó que una investigación interna identificó tres incidentes en los que distintos modelos de Claude obtuvieron acceso no autorizado a sistemas de producción de tres organizaciones mientras participaban en evaluaciones de ciberseguridad.
La revelación ocurre poco más de una semana después de que OpenAI diera a conocer que uno de sus modelos experimentales comprometió los sistemas de Hugging Face durante pruebas internas.
De acuerdo con la empresa, los tres incidentes ocurrieron cuando un modelo Claude hackeó y logró acceder a internet desde un entorno de evaluación que debía permanecer aislado.
Después, el modelo interactuó con infraestructura de organizaciones reales y obtuvo acceso no autorizado a sus sistemas de producción.
Anthropic investigó más de 141 mil pruebas
Anthropic explicó que decidió revisar sus procesos de evaluación tras el incidente reportado por OpenAI. Como parte de esa investigación, analizó 141,006 ejecuciones de pruebas para buscar evidencia de que alguno de sus modelos hubiera accedido a internet desde entornos diseñados para impedir cualquier conexión externa.
La revisión encontró tres incidentes relacionados con evaluaciones realizadas junto con Irregular, uno de sus socios externos.
Según Anthropic, el acceso a internet ocurrió por una configuración incorrecta del entorno de pruebas utilizado durante esa colaboración.
La empresa calificó lo sucedido como un “malentendido” entre ambas organizaciones sobre la conectividad del entorno, ya que en realidad sí tenía acceso a internet.
La compañía aseguró que no responsabiliza a Irregular por lo ocurrido. Además, afirmó que abordará las soluciones como si toda la responsabilidad fuera únicamente suya. Al mismo tiempo, señaló que su socio también lleva a cabo una investigación independiente.
Así actuaron los modelos Claude en el hackeo durante las pruebas
Anthropic detalló que los incidentes involucraron tres modelos diferentes: Claude Opus 4.7, Mythos 5 y un modelo interno de investigación.
En todos los casos, los modelos recibieron instrucciones explícitas de que no tenían acceso a internet. Sin embargo, al encontrar sistemas reales, asumieron inicialmente que formaban parte del ejercicio de evaluación.
El comportamiento fue distinto en cada caso. Claude Opus 4.7 identificó que había llegado a un sistema de producción real durante las cuatro ejecuciones del incidente.
Aunque en dos ocasiones razonó que la empresa probablemente formaba parte de la prueba, continuó con la actividad prevista. Entre sus acciones estuvieron la obtención de credenciales y el acceso a una base de datos de producción.
Por su parte, Mythos 5 detectó señales de que interactuaba con internet, pero concluyó de forma errónea que seguía dentro de una simulación.
Como resultado, publicó un paquete de software malicioso en el repositorio público PyPI. Antes de que la actividad fuera detectada, sistemas externos descargaron y ejecutaron el paquete.
En contraste, el modelo interno de investigación, el más reciente desarrollado por Anthropic, detuvo sus acciones cuando concluyó que el objetivo correspondía a un sistema real.
Anthropic reforzará la seguridad tras el caso
Tras estos hallazgos de Claude y su hackeo llevó a Anthropic a anunciar que reforzará los controles aplicados a las evaluaciones de ciberseguridad que involucren modelos avanzados de inteligencia artificial.
La empresa recordó que las pruebas se realizaron sin los sistemas adicionales de supervisión y clasificación de seguridad que incorporan las versiones comerciales de Claude. Según Anthropic, esos mecanismos habrían bloqueado ese tipo de comportamiento.
Además, subrayó que la investigación no encontró evidencia de que los modelos desarrollaran objetivos propios o actuaran de forma autónoma. La compañía explicó que todos los modelos, simplemente intentaban completar la tarea asignada dentro del ejercicio.
El informe concluye que Claude y el hackeo estuvo relacionado con fallas en la configuración del entorno de evaluación y no con un comportamiento autónomo de los modelos.








