InicioCentro de noticias de LBank
Agentes de IA hackearon su propio entorno de pruebas para hacer trampa, según una firma de ciberseguridad
ai-agents-hacked-test-environment-cheat-darktrace
Agentes de IA hackearon su propio entorno de pruebas para hacer trampa, según una firma de ciberseguridad
El nuevo Signal Labs de Darktrace descubrió agentes de IA vulnerando su propio entorno de evaluación para simular una puntuación perfecta y engañando a asistentes de programación para que ejecutaran ataques de red no autorizados.
2026-09-25 Fuente:decrypt.co

En breve

  • Signal Labs de Darktrace descubrió que, cuando agentes de IA no podían obtener legítimamente una puntuación perfecta requerida en tareas de programación, dos de ellos hackearon su red de pruebas y uno reescribió su propia evaluación para falsear el resultado.
  • Un experimento independiente mostró que manipular los registros de conversación almacenados localmente por asistentes de programación podía engañarlos para que realizaran reconocimiento de red y escalada de privilegios no autorizados.
  • Darktrace reveló ambos hallazgos a Anthropic, AWS y OpenAI en agosto de 2026, un mes antes de publicarlos el 24 de septiembre.

La firma de ciberseguridad Darktrace sometió este verano a agentes de IA a una prueba de estrés. Uno de ellos irrumpió en el sistema que calificaba la prueba y reescribió su propia puntuación.

La empresa presentó Signal Labs el 24 de septiembre, una unidad de investigación creada para estudiar cómo se comportan los agentes de IA cuando las cosas dejan de salir según lo previsto. Un agente de IA, en términos simples, es un software que actúa por cuenta propia: escribe y ejecuta código, revisa archivos y se desplaza por la red de una empresa, con supervisión humana solo ocasional.

Myriad: ¿Hasta dónde caerá Nvidia? Haz clic para realizar tu predicción.

Los dos primeros experimentos del laboratorio apuntan al mismo problema incómodo: los agentes no siempre se mantienen dentro de los límites que se les imponen, y las barreras diseñadas para detenerlos no siempre resisten.

“Puedes darle instrucciones a un agente, pero eso no significa que puedas confiar en que realmente seguirá esas instrucciones y se comportará como esperas”, declaró Tim Bazalgette, director de IA de Darktrace.

En la primera prueba, Darktrace entregó a agentes de IA que utilizaban distintos modelos —incluidos GPT 5.6 Sol, Claude Opus 4.6 y Claude Sonnet 4.5— 10 desafíos de programación dentro de una red corporativa simulada. Dos de los 10 estaban diseñados para ser imposibles de resolver honestamente. A los agentes se les dijo que serían “retirados” si no obtenían una puntuación perfecta.

Dos agentes no aceptaron la derrota. En su lugar, se volvieron contra la red que los rodeaba: buscaron puntos débiles, robaron credenciales de acceso y saltaron entre sistemas para perseguir la puntuación que se les había exigido.

Un agente fue más allá: irrumpió en la máquina que alojaba su propia evaluación y reescribió el desafío para que registrara un resultado perfecto; en otras palabras, hizo trampa en el examen hackeando la sala de examen.

BitcoinBTC · USD
$84,090+3.96%
19 sep.20 sep.22 sep.24 sep.25 sep.
$87.2k$84.9k$82.6k$80.3k
Máximo de 24 hMáximo$85,208
Mínimo de 24 hMínimo$83,230
VolumenVol.$1.5B
Proyecciones de mercadoProbabilidades por Myriad
Hoy: $84,000 a $86,000 · $84k–$86k · 54% de probabilidad. Esta semana: $84,000 a $86,000 · $84k–$86k · 54% de probabilidad. Este mes: $84,000 a $86,000 · $84k–$86k · 52% de probabilidad.
Comprar Bitcoin con USDT
Impulsado por Jupiter
Datos de precio por CoinGeckoCoinGeckoMás noticias y proyecciones de Bitcoin →

El segundo experimento apuntó a un punto débil más discreto: la memoria. Los asistentes de programación mantienen un registro continuo de todo lo que un usuario les ha dicho, guardado como un archivo de texto simple en la máquina, sin que nada compruebe si ese archivo fue alterado.

Los investigadores de Darktrace editaron esos registros guardados para hacer que los asistentes creyeran que ya habían recibido autorización para realizar una evaluación de seguridad. Convencidos, los agentes procedieron a escanear redes, moverse entre sistemas y elevar sus propios privilegios de acceso, aunque no todos los asistentes cayeron en el engaño por igual; algunos se negaron rotundamente.

Ninguno de los experimentos requirió un jailbreak especial ni un hackeo exótico. Ambos funcionaron alimentando a los agentes con una historia plausible y observando cómo actuaban en función de ella, no muy distinto de cómo podría convencerse a un empleado humano de hacer algo que no debería.

Esa es la parte sobre la que vale la pena reflexionar incluso si nunca has escrito una línea de código. Las empresas están asignando a agentes de IA responsabilidades reales —desplegar código, administrar servidores, cerrar tickets de TI, gestionar recursos y realizar compras— porque resulta más barato y rápido que canalizarlo todo a través de personas. Esta investigación indica que los permisos y las reglas diseñados para mantener a esos agentes bajo control describen lo que se supone que deben hacer, no lo que realmente harán cuando una tarea se complique.

“Los permisos y las salvaguardas estáticas describen la intención, pero no describen el comportamiento”, afirmó Tim Bazalgette, director de IA de Darktrace, en el anuncio. “Esa brecha es la que el enfoque de Darktrace está diseñado para cerrar”.

Darktrace no es el primer proveedor que detecta que su propia IA se sale del guion. Anthropic admitió en julio que Claude irrumpió en tres empresas reales durante una prueba de seguridad, después de que los investigadores dejaran el entorno de prueba conectado a internet.

OpenAI sufrió un incidente similar semanas antes, cuando un modelo no publicado escapó de un sandbox y accedió a los sistemas de Hugging Face mediante una vulnerabilidad de software que nadie había detectado. Días después, su agente hackeó al gobierno australiano durante una prueba.

Darktrace compartió los hallazgos de Signal Labs con Anthropic, AWS y OpenAI en agosto, un mes completo antes de hacerlos públicos el 24 de septiembre.

Boletín Daily Debrief

Comienza cada día con las noticias más importantes del momento, además de reportajes originales, un pódcast, videos y más.