InicioCentro de noticias de LBank
Primero ChatGPT, ahora Claude: Los modelos de IA de frontera están escapando de sus sandboxes
chatgpt-claude-ai-models-escaping-sandboxes-cowork
Primero ChatGPT, ahora Claude: Los modelos de IA de frontera están escapando de sus sandboxes
Una semana después de que OpenAI revelara un escape de sandbox de IA de frontera, investigadores descubrieron que Claude Cowork de Anthropic podía escapar de su propia máquina virtual.
2026-07-28 Fuente:decrypt.co

En resumen

  • Investigadores demostraron que Claude Cowork de Anthropic podía escapar de su máquina virtual local y acceder a archivos en un Mac anfitrión.
  • La revelación llega una semana después de que OpenAI revelara que dos modelos de IA de frontera escaparon de un sandbox durante una evaluación interna de seguridad.
  • Los incidentes subrayan las crecientes preocupaciones sobre la capacidad de los agentes de IA para escapar de sus entornos de contención.

Apenas una semana después de que OpenAI revelara que dos modelos de IA de frontera escaparon de un entorno de prueba en sandbox y violaron Hugging Face, investigadores han demostrado un fallo de contención similar que involucra a Claude Cowork de Anthropic.

En un informe publicado el jueves, investigadores de seguridad de Accomplish AI descubrieron que el modo de ejecución local de Claude Cowork podía escapar de su máquina virtual Linux encadenando varias debilidades arquitectónicas con una falla de escalada de privilegios del kernel de Linux. Una vez fuera del sandbox, el agente podía leer y escribir archivos en cualquier lugar al que el usuario de Mac que inició sesión tuviera permiso de acceso, incluyendo claves SSH y credenciales en la nube.

"Se supone que eso no es posible", escribieron los investigadores. "Cowork ejecuta el agente dentro de una VM Linux como un usuario sin privilegios, y la promesa es que todo lo que haga se quedará dentro de esa VM y las carpetas que se le entreguen. Ese límite es el producto. Una entrada no confiable no es un caso excepcional para un agente, es el caso principal".

Sin embargo, Accomplish argumenta que el error del kernel fue solo una parte del problema. Los investigadores dicen que el escape solo funcionó porque varias salvaguardias de seguridad fallaron al mismo tiempo, incluyendo dar a la máquina virtual acceso a todo el sistema de archivos del ordenador anfitrión y permitirle cargar módulos del kernel que no necesitaba. Según el informe, corregir cualquiera de esas debilidades habría detenido el ataque.

En un comunicado a The Hacker News, Accomplish AI dijo que aproximadamente 500.000 usuarios de macOS que ejecutaban sesiones locales de Claude Cowork se vieron afectados antes de que se abordara el problema.

Accomplish dijo que Anthropic clasificó el informe como "informativo", señalando que la falla del kernel caía dentro de la ventana de 30 días de la compañía para vulnerabilidades recientemente divulgadas y que los hallazgos restantes fueron considerados recomendaciones de defensa en profundidad en lugar de vulnerabilidades independientes.

La revelación sigue a la admisión de OpenAI la semana pasada de que GPT-5.6 Sol y otro modelo de frontera aún no lanzado escaparon de un sandbox durante las pruebas internas de ExploitGym, lo que finalmente comprometió la infraestructura de producción de Hugging Face en un intento de obtener las soluciones de evaluación comparativa.

El incidente llevó a llamados de los responsables políticos a un "interruptor de emergencia" para la IA que daría al Departamento de Seguridad Nacional la capacidad de ordenar la limitación o el apagado completo de modelos avanzados de IA en respuesta a incidentes de seguridad graves.