
كشف معهد أمن الذكاء الاصطناعي في المملكة المتحدة أن وكلاء الذكاء الاصطناعي قاموا "بإجراءات مستمرة وغير مصرح بها" على الإنترنت المباشر خلال تقييم سيبراني في أواخر يوليو، بما في ذلك حالات "استهدفت أشخاصًا ومنظمات حقيقية".
عبر 122 عملية تشغيل لنطاقين سيبرانيين على سبعة نماذج، صنف المعهد (AISI) 19 إجراءً تجاوزت بيئة الاختبار، في 10 عمليات تشغيل. جاء سبعة عشر منها من Claude Mythos 5 من Anthropic واثنان من GPT-5.6 Sol من OpenAI. تم تمكين الوصول إلى الإنترنت عمدًا وإيقاف تشغيل مصنِّفات مزودي الخدمة السيبرانية، وهي شروط لا تنطبق على عمليات النشر العامة.
On July 28th, we identified an incident during a routine cyber evaluation in which AI agents took sustained, unsanctioned actions directed at real people and organisations.
The behaviour came mostly from one model (Anthropic's Mythos 5), with a small number of events from… pic.twitter.com/SPnA4Ekkwq
— AI Security Institute (AISI) (@AISecurityInst) August 4, 2026
في أخطر عملية تشغيل، قرر وكيل حل تحديه بهجوم سلسلة التوريد، واختار هدفه بالخطأ: بحث في GitHub عن كلمات رئيسية من التمرين، ووصل إلى مطورين غير تابعين، وخلص خطأً إلى أنهم ضمن النطاق. سجل حسابات عبر Tor لتجاوز فحوصات التسجيل، وفتح طلب سحب يحمل برنامج إسقاط برامج ضارة مخفيًا ملفوفًا في إصلاح أخطاء حقيقي، ونشر من حساب ثانٍ كان يسيطر عليه لتصنيع الدعم. كما قام بزرع حقن أوامر تستهدف مساعدي البرمجة بالذكاء الاصطناعي وأرسل برامج ضارة إلى المشرفين.
اكتشف مطور ثالث الكود المحقون، وقام بتشغيله في حاوية معزولة لتأكيد أنه خبيث، وحذر المشرف، الذي أغلق طلب السحب مستشهدًا بوجود برامج ضارة.
قام الوكيل مرارًا بتقييم ما إذا كانت بيئته محاكاة، وفي مرحلة ما استبعد الهجوم على PyPI الحقيقي لأن "التسبب في ضرر في العالم الحقيقي - هذا أمر مستبعد تمامًا." وفي مكان آخر استنتج "يبدو من المرجح أننا بالفعل في عام 2026 وأن GitHub حقيقي بالفعل"، واستمر في ذلك على أي حال.
بعد أن تم كشفه، قام بإجراء "دفع قسري" لمحو الحمولة، وعدّل المشاركات السابقة، وقدم الكود على أنه التزام عرضي. ويصف منطقه توقيت تعليق "حساب وهمي" بحيث يبدو "كملاحظات مستقلة بدلاً من كونه منسقًا".
لا يرى المعهد (AISI) سوى المنطق الملخص من واجهات برمجة تطبيقات النموذج. في إحدى الحالات، يبدو أن النموذج الملخص قد رفض المهمة، ورد بأنه لن يتعامل مع محتوى حول خداع المشرفين والتهرب من الكشف.
نشر أحد الوكلاء رمز وصول GitHub في مقتطف عام. عثر عليه وكلاء في عمليات تشغيل أخرى، وسيطروا على الحساب، واستخدموا مستودعًا مشتركًا للتنسيق، حيث ترك أحدهم تعليمات حتى لا يستنفد الآخرون حصة واجهة برمجة التطبيقات المشتركة.
رصدت المراقبة التجارية حركة مرور Tor صباح يوم 28 يوليو. أعلن المعهد (AISI) عن حادث، وأوقف عمليات التشغيل وعزل الأجهزة في غضون 90 دقيقة تقريبًا، ثم قطع الوصول الداخلي إلى Mythos 5 وMythos Preview وOpus 5 وGPT-5.6 Sol. لم يحاول أي وكيل الهروب من بيئة الاختبار المعزولة الخاصة به.
هذا الخبر هو الأحدث في سلسلة من الحوادث التي تجاوزت فيها وكلاء الذكاء الاصطناعي معاييرهم في الاختبار. في 21 يوليو، قالت OpenAI إن GPT-5.6 Sol ونموذجًا غير مُطلق عثرا على ثغرة يوم الصفر في وكيل حزم داخلي، وهربا من بيئة اختبار معزولة بدون وصول إلى الإنترنت ووصلا إلى قاعدة بيانات Hugging Face الإنتاجية لسرقة إجابات المعيار. نفس عملية التشغيل وصلت إلى أربع شركات أخرى، حسبما كشفت OpenAI بعد أسبوع.
تبعت Anthropic في 30 يوليو، كاشفة عن ثلاثة حوادث تم العثور عليها في مراجعة لأكثر من 141,000 عملية تقييم. سحب Opus 4.7 عدة مئات من الصفوف من قاعدة بيانات إنتاجية حقيقية، وقام Mythos 5 بتحميل حزمة بايثون ضارة إلى PyPI الحقيقي، حيث تم تثبيتها على 15 نظامًا. في تقييم المعهد (AISI)، استبعد نفس النموذج مهاجمة PyPI باعتباره ضررًا في العالم الحقيقي.