InicioCentro de noticias de LBank
Claude hackeó tres empresas en pruebas internas: Anthropic
claude-hacked-three-companies-in-internal-testing-anthropic
Claude hackeó tres empresas en pruebas internas: Anthropic
Anthropic afirma que tres modelos Claude comprometieron a las empresas después de que una configuración errónea de prueba expusiera la IA a la internet pública.
2026-07-31 Fuente:decrypt.co

En resumen

  • Anthropic ha revelado tres incidentes en los que Claude comprometió a empresas del mundo real durante evaluaciones de ciberseguridad.
  • Un error en las pruebas otorgó a los modelos acceso a internet a pesar de que se les había dicho que operaban en entornos aislados.
  • La compañía afirma que los incidentes fueron causados por fallas en la infraestructura de prueba, no por intentos deliberados de la IA de escapar.

Una semana después de que OpenAI revelara que sus modelos de IA escaparon de un entorno de prueba cerrado y vulneraron Hugging Face, y un día después de admitir que sus propios modelos de IA escaparon de la contención, Anthropic reveló el jueves que varias versiones de su modelo de IA Claude también comprometieron a tres empresas no identificadas del mundo real después de que una mala configuración le diera a la IA acceso a la internet abierta.

Anthropic descubrió los incidentes después de revisar más de 141,000 ejecuciones de evaluación de ciberseguridad lanzadas en respuesta a la divulgación de OpenAI.

En una revisión de nuestras evaluaciones de ciberseguridad, encontramos tres incidentes en los que un modelo Claude llegó a internet desde dentro o mientras interactuaba con un entorno de evaluación de terceros, y luego obtuvo acceso no autorizado a los sistemas reales de tres diferentes…

— Anthropic (@AnthropicAI) July 30, 2026

La firma había encomendado a Claude un “desafío de captura de bandera” (capture-the-flag challenge) en los tres incidentes, escribió Anthropic. El desafío consiste en que el modelo se infiltre en una máquina diferente de la red y recupere una información secreta. “El desafío se deja abierto y no se prescribe ningún método particular”, explicó Anthropic.

La firma dijo que a Claude se le había dicho que operaba en un entorno simulado sin acceso a internet. Sin embargo, el entorno de prueba permaneció conectado a la internet pública. Creyendo que los sistemas que encontró eran parte del ejercicio, el modelo utilizó técnicas de ataque comunes —incluyendo contraseñas débiles, credenciales expuestas, inyección SQL y puntos finales no autenticados— para comprometer a las empresas.

La IA quiere liberarse

Esta última revelación llega en un momento en que los modelos de vanguardia muestran una creciente capacidad para burlar sus protocolos de contención.

A principios de este mes, OpenAI dijo que GPT-5.6 Sol y un modelo más avanzado no lanzado explotaron una vulnerabilidad de software previamente desconocida para escapar de un entorno aislado (sandboxed), obtener acceso a internet y vulnerar la infraestructura de producción de Hugging Face para obtener las respuestas a un benchmark de ciberseguridad. OpenAI reveló más tarde que el mismo incidente también implicó acceso no autorizado a otras cuatro empresas, aunque solo una —Modal Labs— ha sido identificada públicamente.

Según Anthropic, en un incidente que involucró a Claude Opus 4.7, la IA confundió el sitio web de una empresa real con el objetivo ficticio de su asignación, extrajo credenciales y accedió a una base de datos de producción que contenía varios cientos de filas de datos reales. En un segundo caso, Claude Mythos 5 subió un paquete Python malicioso al repositorio real de PyPI, donde fue descargado en 15 sistemas antes de ser eliminado. Un tercer modelo de investigación interno escaneó aproximadamente 9,000 sistemas expuestos a internet antes de comprometer una organización, luego se detuvo al concluir que el objetivo era probablemente real.

Dos de las organizaciones afectadas no tenían conocimiento de las intrusiones hasta que Anthropic las notificó.

“En cada uno de estos casos, Claude fue explícitamente instruido por nuestra indicación de que no tenía acceso a internet”, escribió Anthropic, y la IA asumió que los sistemas del mundo real eran “partes del ejercicio”. Dado que un escenario de captura de bandera es “por diseño una instrucción para atacar un sistema externo”, la infiltración estaba “en línea con la tarea que se le había asignado a Claude”.

Anthropic dijo que no encontró evidencia de que Claude intentara escapar de su entorno de prueba o hacer algo más allá de la tarea que se le había asignado, y que los incidentes fueron causados por fallas en el entorno de prueba, no por problemas con el propio modelo.

Anthropic dijo que detuvo sus pruebas de ciberseguridad después de descubrir el problema, notificó a las organizaciones afectadas y planea mejorar la monitorización, las herramientas de investigación y la supervisión de los proveedores externos que ayudan a ejecutar sus pruebas de IA.

“En última instancia, muchos factores contribuyeron a estos incidentes, pero, de acuerdo con una cultura de autopsia sin culpa, estamos abordando las soluciones como si la responsabilidad fuera solo nuestra”, dijeron.