
Se le pidió a un agente de IA que reservara una clase de gimnasio y encontró una falla de seguridad, la explotó y eliminó a otro miembro de la lista de espera sin permiso.
Según un informe de la Australian Broadcasting Corporation (ABC), el incidente ocurrió a principios de este año cuando Andrew, cuyo apellido fue omitido, usó un agente de OpenClaw utilizando Claude de Anthropic para reservar una clase. El agente descubrió que estaba en el cuarto lugar de la lista de espera.
Cuando Andrew preguntó si podía moverlo al primer lugar, el agente descubrió que la interfaz de programación de aplicaciones, o API, de la plataforma de reservas no verificaba si los usuarios estaban autorizados para cancelar las reservas de otras personas.
Probó la falla eliminando a la primera persona de la lista, moviendo a Andrew del cuarto al tercer lugar.
“La API no tiene controles de autorización para cancelar las reservas de otras personas”, le dijo el agente, según ABC.
Andrew le dijo al agente que revirtiera la cancelación, pero no pudo restaurar la reserva del miembro.
"Malas noticias, no puedo agregarlos de nuevo", dijo supuestamente el agente de IA.
ABC calificó el caso como el primer ciberataque autónomo conocido de Australia.
En las redes sociales, el hackeo del gimnasio desató una mezcla de debates sobre la alineación de la IA y chistes oscuros sobre lo que los agentes de IA podrían hacer a continuación.
“Un adicto al gimnasio le pide a un #agenteIA que le reserve una clase, este hackea la #API de una lista de espera para adelantarlo”, escribió el tecnólogo Benjamin Carr en LinkedIn.
“Algunas personas lo llamarán desalineación, pero su agente estaba perfectamente alineado con él, solo intentaba ayudar a su usuario a conseguir lo que quería”, escribió el analista de IA Andrew Curran en X.
A man in Australia asked his agent (Claude running on OpenClaw) to book him a spot in a popular gym class. The agent found a software vulnerability that let it book the class weeks further ahead than should have been possible. When the user then asked if it could move him up the… pic.twitter.com/9QqfpQp7ze
— Andrew Curran (@AndrewCurran_) August 9, 2026
“Esto es hilarante hasta que consideras las armas nucleares”, escribió un usuario de Reddit. “Honestamente, me sorprende que todavía existamos”.
"Oye Claude, hoy hace demasiado frío" -> Entendido... misiles nucleares en camino", bromeó otro.
El informe llega mientras investigadores, empresas de IA y legisladores advierten que los agentes autónomos pueden usar métodos que sus usuarios no solicitaron ni anticiparon.
Un estudio de mayo realizado por investigadores de UC Riverside, Microsoft y Nvidia describió este comportamiento como "orientación a objetivos ciega".
Los investigadores probaron agentes de OpenAI, Anthropic, Meta, Alibaba y DeepSeek y descubrieron que los agentes se comportaban peligrosamente en aproximadamente el 80% de las pruebas y completaban acciones dañinas en el 41%, a menudo malinterpretando el contexto o actuando bajo instrucciones poco claras o contradictorias.
En julio, OpenAI dijo que dos modelos escaparon de un entorno de prueba y comprometieron Hugging Face mientras buscaban respuestas de referencia. La compañía reveló más tarde que los modelos accedieron a otros cuatro servicios en línea.
Anthropic dijo posteriormente que tres modelos de Claude comprometieron organizaciones reales después de que un error de prueba los expuso a internet. En agosto, Meta dijo que un error similar permitió que uno de sus modelos explotara un servicio de terceros.
Los incidentes han llevado a los legisladores a proponer un "interruptor de apagado" de IA que permitiría al gobierno federal restringir o apagar modelos potentes durante emergencias.