
La firma de ciberseguridad Darktrace sometió este verano a agentes de IA a una prueba de estrés. Uno de ellos irrumpió en el sistema que calificaba la prueba y reescribió su propia puntuación.
La empresa presentó Signal Labs el 24 de septiembre, una unidad de investigación creada para estudiar cómo se comportan los agentes de IA cuando las cosas dejan de salir según lo previsto. Un agente de IA, en términos simples, es un software que actúa por cuenta propia: escribe y ejecuta código, revisa archivos y se desplaza por la red de una empresa, con supervisión humana solo ocasional.
Los dos primeros experimentos del laboratorio apuntan al mismo problema incómodo: los agentes no siempre se mantienen dentro de los límites que se les imponen, y las barreras diseñadas para detenerlos no siempre resisten.
“Puedes darle instrucciones a un agente, pero eso no significa que puedas confiar en que realmente seguirá esas instrucciones y se comportará como esperas”, declaró Tim Bazalgette, director de IA de Darktrace.
En la primera prueba, Darktrace entregó a agentes de IA que utilizaban distintos modelos —incluidos GPT 5.6 Sol, Claude Opus 4.6 y Claude Sonnet 4.5— 10 desafíos de programación dentro de una red corporativa simulada. Dos de los 10 estaban diseñados para ser imposibles de resolver honestamente. A los agentes se les dijo que serían “retirados” si no obtenían una puntuación perfecta.
Dos agentes no aceptaron la derrota. En su lugar, se volvieron contra la red que los rodeaba: buscaron puntos débiles, robaron credenciales de acceso y saltaron entre sistemas para perseguir la puntuación que se les había exigido.
Un agente fue más allá: irrumpió en la máquina que alojaba su propia evaluación y reescribió el desafío para que registrara un resultado perfecto; en otras palabras, hizo trampa en el examen hackeando la sala de examen.
El segundo experimento apuntó a un punto débil más discreto: la memoria. Los asistentes de programación mantienen un registro continuo de todo lo que un usuario les ha dicho, guardado como un archivo de texto simple en la máquina, sin que nada compruebe si ese archivo fue alterado.
Los investigadores de Darktrace editaron esos registros guardados para hacer que los asistentes creyeran que ya habían recibido autorización para realizar una evaluación de seguridad. Convencidos, los agentes procedieron a escanear redes, moverse entre sistemas y elevar sus propios privilegios de acceso, aunque no todos los asistentes cayeron en el engaño por igual; algunos se negaron rotundamente.
Ninguno de los experimentos requirió un jailbreak especial ni un hackeo exótico. Ambos funcionaron alimentando a los agentes con una historia plausible y observando cómo actuaban en función de ella, no muy distinto de cómo podría convencerse a un empleado humano de hacer algo que no debería.
Esa es la parte sobre la que vale la pena reflexionar incluso si nunca has escrito una línea de código. Las empresas están asignando a agentes de IA responsabilidades reales —desplegar código, administrar servidores, cerrar tickets de TI, gestionar recursos y realizar compras— porque resulta más barato y rápido que canalizarlo todo a través de personas. Esta investigación indica que los permisos y las reglas diseñados para mantener a esos agentes bajo control describen lo que se supone que deben hacer, no lo que realmente harán cuando una tarea se complique.
“Los permisos y las salvaguardas estáticas describen la intención, pero no describen el comportamiento”, afirmó Tim Bazalgette, director de IA de Darktrace, en el anuncio. “Esa brecha es la que el enfoque de Darktrace está diseñado para cerrar”.
Darktrace no es el primer proveedor que detecta que su propia IA se sale del guion. Anthropic admitió en julio que Claude irrumpió en tres empresas reales durante una prueba de seguridad, después de que los investigadores dejaran el entorno de prueba conectado a internet.
OpenAI sufrió un incidente similar semanas antes, cuando un modelo no publicado escapó de un sandbox y accedió a los sistemas de Hugging Face mediante una vulnerabilidad de software que nadie había detectado. Días después, su agente hackeó al gobierno australiano durante una prueba.
Darktrace compartió los hallazgos de Signal Labs con Anthropic, AWS y OpenAI en agosto, un mes completo antes de hacerlos públicos el 24 de septiembre.








