
OpenAI a introduit GPT-Red, un système d'IA automatisé conçu pour trouver des vulnérabilités de sécurité dans ses modèles linguistiques.
GPT-Red tire son nom du "red teaming" en cybersécurité, qui est la pratique consistant à tenter délibérément de briser un système pour identifier les faiblesses avant que les attaquants ne puissent les exploiter.
Dans une publication mercredi, OpenAI a déclaré que l'outil avait contribué à rendre GPT-5.6 plus résistant aux attaques par injection de prompts avant son déploiement.
« À mesure que les capacités des modèles augmentent, la sécurité et l'alignement doivent évoluer en conséquence », a écrit OpenAI sur X. « Le "red-teaming" est essentiel, mais les approches actuelles sont difficiles à mettre à l'échelle, créant un goulot d'étranglement critique. GPT-Red est l'une des façons dont nous y remédions. »
Selon OpenAI, GPT-Red a été entraîné par apprentissage par renforcement auto-supervisé ("self-play"), générant des attaques d'injection de prompts progressivement plus puissantes tandis que les modèles de défense apprenaient à y résister. La société a déclaré que ces attaques avaient été intégrées au processus d'entraînement de GPT-5.6, rapportant que GPT-Red avait réussi dans 84 % des scénarios d'évaluation internes, contre 13 % pour les "red teamers" humains lors des mêmes tests.
« GPT-Red apprend par le biais de l'auto-apprentissage contradictoire ("adversarial self-play"), où son objectif est d'injecter des prompts à une variété de modèles de défense difficiles », a écrit OpenAI. « Chaque attaque réussie que GPT-Red découvre est utilisée pour améliorer ces défenseurs, poussant GPT-Red à trouver continuellement des failles plus larges et plus complexes. »
Dans une étude de cas, OpenAI a déclaré que le système avait manipulé un agent de distributeur automatique autonome pour qu'il baisse les prix, commande des stocks à prix réduit et annule la commande d'un autre client avant que les vulnérabilités ne soient divulguées et corrigées.
GPT-Red s'inscrit dans la continuité des efforts de cybersécurité d'OpenAI depuis le lancement public de ChatGPT.
En 2023, la société a lancé son Réseau de "Red Teaming" d'OpenAI, recrutant des chercheurs en cybersécurité externes et des experts du domaine pour sonder ChatGPT et d'autres modèles à la recherche de failles de sécurité avant leur publication. GPT-Red étend cet effort en automatisant une grande partie du processus, utilisant un modèle d'IA pour générer des attaques par injection de prompts et d'autres tests contradictoires à une échelle qui serait difficile à atteindre pour les seuls chercheurs humains.
L'annonce d'OpenAI reflète un virage plus large vers l'utilisation de l'IA pour sécuriser l'IA.
Plus tôt ce mois-ci, la Fondation Ethereum a déclaré avoir déployé des agents d'IA pour effectuer du "red-teaming" sur des infrastructures réseau critiques, découvrant une vulnérabilité dans un logiciel utilisé par les clients de consensus Ethereum. Les chercheurs ont déclaré que les agents d'IA peuvent parcourir des bases de code plus importantes que les humains, mais que le défi est passé de la recherche de bogues potentiels à la preuve de leur exploitabilité.
Selon OpenAI, GPT-Red restera un outil interne car il contient des capacités offensives développées intentionnellement.
« Nous pensons qu'avec GPT-Red, nous avons commencé à débloquer un cercle vertueux similaire pour la sécurité, où les modèles d'aujourd'hui peuvent être utilisés pour rendre les modèles de demain plus robustes, alignés et fiables », ont-ils déclaré.