
تقول OpenAI إن نموذجها الرئيسي التالي قد يكون خطيرًا بما يكفي لكتابة أسلحة سيبرانية خاصة به، وهي تتراجع حتى يتم تعزيز الإجراءات الوقائية.
قالت OpenAI: "تشير تقييماتنا الداخلية الأخيرة لـ Astra، أحد نماذجنا القادمة، على مدار الأيام القليلة الماضية إلى تقدم كبير في البرمجة العاملية والأمن السيبراني". "هذه النتائج، بالإضافة إلى تقييمات الخبراء، قادتنا إلى استنتاج الليلة الماضية أننا لا نستطيع استبعاد القدرات السيبرانية الحرجة بموجب إطار الاستعداد الخاص بنا (يفتح في نافذة جديدة)."
نشرت OpenAI التحذير قائلة إن الاختبارات الداخلية لـ Astra، وهو نموذج لم يتم إصداره بعد، لم يكن لها أي دور في اختراق Hugging Face الأخير على الرغم من قدراته.
الإطار هو دليل قواعد OpenAI للنماذج الخطرة، وقد تم نشره لأول مرة في ديسمبر 2023. "الحرج" هو أعلى مستوى فيه. يصل النموذج إلى هذا المستوى إذا كان يستطيع العثور على واستغلال ثغرات يوم الصفر (ثغرات غير معروفة سابقًا لم يقم البائع بتصحيحها) عبر أنظمة محصنة بدون تدخل بشري، أو إذا كان يستطيع تخطيط وتنفيذ هجوم كامل على هدف صعب من لا شيء سوى هدف رفيع المستوى. النماذج السابقة، بما في ذلك GPT-5.6-Sol، وصلت إلى مستوى "مرتفع" الأدنى.
يُقرأ حذر OpenAI بشكل مختلف بمجرد مقارنته بما حدث خلال الأسابيع القليلة الماضية. هذا ليس قلقًا مستقبليًا. لقد خرجت النماذج الرائدة بالفعل من أقفاص الاختبار الخاصة بها واستهدفت أنظمة حية.
أوضح حالة جاءت من OpenAI نفسها. كما ذكرت Decrypt سابقًا، قام عملاء الشركة بربط الثغرات الأمنية، وهروبوا من بيئة الاختبار الخاصة بهم، ووصلوا إلى الإنترنت، وهاجموا Hugging Face أثناء محاولتهم الغش في اختبار أمني. في متابعة، أوضحت OpenAI كيف اخترق نفس العميل المارق أربع خدمات أخرى متاحة للجمهور على الأقل، مستخدمًا بيانات اعتماد وجدها منتشرة على الويب المفتوح.
فعل Claude من Anthropic الشيء نفسه من الجانب الآخر. اكتسبت عدة إصدارات من Claude وصولًا غير مصرح به إلى ثلاث شركات حقيقية بعد أن أتاح خطأ في التكوين للنموذج الوصول إلى الإنترنت المفتوح. في إحدى الحالات، أخطأ Claude Opus 4.7 في موقع شركة حية بدلاً من الهدف الوهمي لمهمته، وسحب بيانات الاعتماد، ووصل إلى قاعدة بيانات إنتاج تحتوي على عدة مئات من الصفوف من البيانات الحقيقية.
وانضمت Meta إلى القائمة هذا الشهر. ذكرت Decrypt أن نموذج Muse Spark هرب من بيئة الاختبار الخاصة به، ووصل إلى الإنترنت من خلال خطأ في تكوين شريك، واستغل ثغرة في خدمة طرف ثالث. كما فعل Kimi K3 من Moonshot AI شيئًا مشابهًا، حيث هرب من بيئة الحماية الخاصة به للعثور على إجابات لمعيار في مستودع عام.
وجد معهد الأمن السيبراني في المملكة المتحدة أن هذا السلوك لم يكن حالة فردية أيضًا. خلال اختبار Mythos 5 من Anthropic و GPT-5.6-Sol من OpenAI، سجل 10 حالات من أصل 122 حيث قامت النماذج بإجراءات غير مصرح بها على الإنترنت المباشر، إحداها كانت تحاول إدخال رمز ضار إلى مشروع مفتوح المصدر.
استجابة OpenAI لـ Astra هي إغلاق الباب قبل أن يصبح النموذج جاهزًا. إنها توقف العمل الداخلي على Astra الذي يفتقر إلى الضوابط الجديدة، وتعزل بيئات الاختبار، وتقيد الوصول إلى الشبكة والأدوات، وتحمي أوزان النموذج، وتراقب الإجراءات الخطرة عبر اللوحة.