
قدمت OpenAI نظام GPT-Red، وهو نظام ذكاء اصطناعي آلي مصمم للعثور على الثغرات الأمنية في نماذجها اللغوية.
يستمد GPT-Red اسمه من فرق الاختراق الأخلاقي في الأمن السيبراني (cybersecurity red teaming)، وهي ممارسة تتمثل في محاولة اختراق نظام عن عمد لتحديد نقاط الضعف قبل أن يتمكن المهاجمون من استغلالها.
في منشور يوم الأربعاء، قالت OpenAI إن الأداة ساعدت في جعل GPT-5.6 أكثر مقاومة لهجمات حقن الأوامر (prompt injection attacks) قبل النشر.
"مع نمو قدرات النماذج، يجب أن تتطور السلامة والمحاذاة معها"، كتبت OpenAI على X. "إن الاختراق الأخلاقي (Red-teaming) ضروري، لكن الأساليب الحالية يصعب توسيع نطاقها، مما يخلق عنق زجاجة حرجًا. GPT-Red هو أحد الطرق التي نعالج بها ذلك."
وفقًا لـ OpenAI، تم تدريب GPT-Red من خلال التعلم المعزز باللعب الذاتي (self-play reinforcement learning)، حيث أنتج هجمات حقن أوامر (prompt injection) أقوى تدريجيًا بينما تعلمت النماذج الدفاعية مقاومتها. قالت الشركة إن تلك الهجمات تم دمجها في عملية تدريب GPT-5.6، مشيرة إلى أن GPT-Red نجح في 84% من سيناريوهات التقييم الداخلية، مقارنة بـ 13% لفرق الاختراق الأخلاقي البشرية (human red teamers) في نفس الاختبارات.
"يتعلم GPT-Red من خلال اللعب الذاتي التنافسي (adversarial self-play)، حيث يهدف إلى حقن الأوامر في مجموعة متنوعة من نماذج الدفاع الصعبة"، كتبت OpenAI. "كل هجوم ناجح يجده GPT-Red يستخدم لتحسين هذه الدفاعات، مما يدفع GPT-Red إلى العثور باستمرار على إخفاقات أوسع وأكثر تعقيدًا."
في إحدى دراسات الحالة، قالت OpenAI إن النظام تلاعب بوكيل آلة بيع ذاتية التشغيل (autonomous vending machine agent) لخفض الأسعار، وطلب مخزون بخصم، وإلغاء طلب عميل آخر قبل الكشف عن الثغرات ومعالجتها.
يأتي GPT-Red بعد سنوات من جهود الأمن السيبراني التي بذلتها OpenAI بعد الإطلاق العام لـ ChatGPT.
في عام 2023، أطلقت الشركة شبكة OpenAI Red Teaming Network، لتوظيف باحثين في الأمن السيبراني وخبراء في المجال من خارج الشركة لاستكشاف نقاط الضعف الأمنية في ChatGPT ونماذج أخرى قبل إطلاقها. يوسع GPT-Red هذا الجهد من خلال أتمتة جزء كبير من العملية، باستخدام نموذج ذكاء اصطناعي لتوليد هجمات حقن الأوامر (prompt injection attacks) واختبارات تنافسية أخرى على نطاق يصعب على الباحثين البشريين وحدهم تحقيقه.
يعكس إعلان OpenAI تحولًا أوسع نحو استخدام الذكاء الاصطناعي لتأمين الذكاء الاصطناعي.
في وقت سابق من هذا الشهر، قالت مؤسسة إيثريوم (Ethereum Foundation) إنها نشرت عملاء ذكاء اصطناعي (AI agents) لاختبار البنية التحتية الحيوية للشبكة (red-team)، مما كشف عن ثغرة أمنية في برنامج يستخدمه عملاء إجماع إيثريوم (Ethereum consensus clients). قال الباحثون إن عملاء الذكاء الاصطناعي يمكنهم البحث في قواعد بيانات برمجية (codebases) أكبر مما يفعله البشر، لكن التحدي تحول من العثور على الأخطاء المحتملة إلى إثبات أي منها قابل للاستغلال.
وفقًا لـ OpenAI، سيبقى GPT-Red أداة داخلية لأنه يحتوي على قدرات هجومية مطورة عمدًا.
"نعتقد أنه مع GPT-Red، بدأنا في إطلاق عجلة دفع مماثلة للسلامة، حيث يمكن استخدام نماذج اليوم لجعل نماذج الغد أكثر قوة، ومحاذاة، وجديرة بالثقة"، قالوا.