
Une semaine seulement après qu'OpenAI a révélé que deux modèles d'IA de pointe s'étaient échappés d'un environnement de test sandbox et avaient enfreint Hugging Face, des chercheurs ont démontré une défaillance de confinement similaire impliquant Claude Cowork d'Anthropic.
Dans un rapport publié jeudi, les chercheurs en sécurité d'Accomplish AI ont découvert que le mode d'exécution local de Claude Cowork pouvait s'échapper de sa machine virtuelle Linux en enchaînant plusieurs faiblesses architecturales avec une faille d'escalade de privilèges du noyau Linux. Une fois hors du sandbox, l'agent pouvait lire et écrire des fichiers partout où l'utilisateur Mac connecté avait la permission d'accéder, y compris les clés SSH et les identifiants cloud.
« Ce n'est pas censé être possible », ont écrit les chercheurs. « Cowork exécute l'agent à l'intérieur d'une VM Linux en tant qu'utilisateur non privilégié, et la promesse est que tout ce qu'il fait reste à l'intérieur de cette VM et des dossiers que vous lui confiez. Cette frontière est le produit. Une entrée non fiable n'est pas un cas limite pour un agent, c'est le cas principal. »
Cependant, Accomplish soutient que le bogue du noyau n'était qu'une partie du problème. Les chercheurs affirment que l'évasion n'a fonctionné que parce que plusieurs mesures de sécurité ont échoué simultanément, notamment en donnant à la machine virtuelle l'accès à l'ensemble du système de fichiers de l'ordinateur hôte et en lui permettant de charger des modules de noyau dont elle n'avait pas besoin. Selon le rapport, la correction de l'une de ces faiblesses aurait stoppé l'attaque.
Dans une déclaration à The Hacker News, Accomplish AI a indiqué qu'environ 500 000 utilisateurs de macOS exécutant des sessions locales de Claude Cowork avaient été affectés avant que le problème ne soit résolu.
Accomplish a déclaré qu'Anthropic avait classé le rapport comme « informatif », affirmant que la faille du noyau relevait de la fenêtre de 30 jours de l'entreprise pour les vulnérabilités récemment divulguées et que les autres conclusions étaient considérées comme des recommandations de défense en profondeur plutôt que comme des vulnérabilités autonomes.
Cette révélation fait suite à l'aveu d'OpenAI la semaine dernière selon lequel GPT-5.6 Sol et un autre modèle de pointe non encore publié s'étaient échappés d'un sandbox lors de tests internes d'ExploitGym, ce qui a finalement permis de violer l'infrastructure de production de Hugging Face dans le but d'obtenir les solutions de référence.
L'incident a incité les décideurs politiques à réclamer un « interrupteur d'arrêt » pour l'IA qui donnerait au Département de la Sécurité intérieure la capacité d'ordonner la limitation ou l'arrêt complet des modèles d'IA avancés en réponse à des incidents de sécurité graves.