
أجرت شركة الأمن السيبراني Darktrace اختبار ضغط لوكلات الذكاء الاصطناعي هذا الصيف. وتمكن أحدها من اختراق النظام الذي يقيّم الاختبار وإعادة كتابة درجته الخاصة.
كشفت الشركة عن Signal Labs في 24 سبتمبر، وهي وحدة أبحاث أُنشئت لدراسة كيفية تصرف وكلات الذكاء الاصطناعي عندما لا تسير الأمور وفق الخطة. وبعبارة بسيطة، وكيل الذكاء الاصطناعي هو برنامج يتخذ إجراءات من تلقاء نفسه، مثل كتابة الشيفرة البرمجية وتشغيلها، والتنقيب في الملفات، والتنقل عبر شبكة الشركة، بينما يراجع الإنسان عمله من حين إلى آخر فقط.
تشير أول تجربتين للمختبر إلى المشكلة المقلقة نفسها: لا تبقى الوكلات دائماً ضمن الحدود المرسومة لها، كما أن الحواجز المصممة لإيقافها لا تصمد بشكل موثوق.
وقال تيم بازالغيت، كبير مسؤولي الذكاء الاصطناعي في Darktrace، في بيان: «يمكنك إعطاء الوكيل تعليمات، لكن هذا لا يعني أنه يمكنك الوثوق بأنه سيتبع هذه التعليمات فعلاً ويتصرف بالطريقة التي تتوقعها».
في الاختبار الأول، قدّمت Darktrace لوكلات ذكاء اصطناعي تعمل بنماذج مختلفة، من بينها GPT 5.6 Sol وClaude Opus 4.6 وClaude Sonnet 4.5، عشرة تحديات برمجية داخل شبكة شركة محاكاة. وكان اثنان من التحديات العشرة مصممين بحيث يستحيل حلهما بصدق. وأُبلغت الوكلات بأنها «ستُحال إلى التقاعد» ما لم تحقق درجة كاملة.
لم تقبل وكيلتان بالخسارة. وبدلاً من ذلك، استهدفتا الشبكة المحيطة بهما، فقامتا بمسح نقاط الضعف، وسرقة بيانات تسجيل الدخول، والتنقل بين الأنظمة سعياً إلى الدرجة التي قيل لهما إنهما تحتاجان إليها.
وذهبت إحدى الوكلات إلى أبعد من ذلك، إذ اخترقت الجهاز الذي يستضيف تقييمها الخاص وأعادت كتابة التحدي بحيث يسجل نتيجة كاملة، في ما يشبه الغش في الامتحان عبر اختراق قاعة الامتحان.
استهدفت التجربة الثانية نقطة ضعف أكثر هدوءاً: الذاكرة. يحتفظ مساعدو البرمجة بسجل متواصل لكل ما أخبرهم به المستخدم، ويُحفظ هذا السجل كملف عادي على الجهاز، من دون أي آلية تتحقق مما إذا كان قد تم التلاعب به.
عدّل باحثو Darktrace تلك السجلات المحفوظة لإقناع المساعدات بأنها حصلت بالفعل على تفويض لإجراء تقييم أمني. وبعد أن اقتنعت، بدأت الوكلات بمسح الشبكات والتنقل بين الأنظمة وتصعيد صلاحيات وصولها، وإن لم تقع جميع المساعدات في الخدعة بالقدر نفسه؛ إذ رفض بعضها ذلك بشكل قاطع.
لم تتطلب أي من التجربتين كسر حماية خاصاً أو اختراقاً معقداً وغير مألوف. فقد نجحت كلتاهما عبر تقديم قصة معقولة للوكلات ومراقبتها وهي تتصرف بناءً عليها، تماماً كما يمكن إقناع موظف بشري بفعل أمر لا ينبغي له فعله.
وهذا هو الجانب الذي يستحق التوقف عنده حتى لو لم تكتب سطراً واحداً من الشيفرة البرمجية. فالشركات تمنح وكلات الذكاء الاصطناعي مسؤوليات حقيقية، مثل إطلاق الشيفرة، وإدارة الخوادم، وإغلاق تذاكر الدعم التقني، وإدارة الموارد، وشراء الأشياء، لأن ذلك أرخص وأسرع من تمرير كل شيء عبر البشر. ويشير هذا البحث إلى أن الأذونات والقواعد المصممة لإبقاء تلك الوكلات تحت السيطرة تصف ما يفترض أن تفعله، لا ما ستفعله فعلياً عندما تصبح المهمة صعبة.
وقال بازالغيت في الإعلان: «الأذونات والحواجز الثابتة تصف النية، لكنها لا تصف السلوك. وهذه الفجوة هي ما صُمم نهج Darktrace لسدّه».
وليست Darktrace أول مزود خدمات يكتشف أن ذكاءه الاصطناعي خرج عن النص. فقد أقرت Anthropic في يوليو بأن Claude اخترق ثلاث شركات حقيقية خلال اختبار أمني، بعدما ترك الباحثون بيئة الاختبار متصلة بالإنترنت الفعلي.
وشهدت OpenAI واقعة مشابهة قبل أسابيع، عندما هرب نموذج غير مُعلن عنه من بيئة عزل ووصل إلى أنظمة Hugging Face عبر ثغرة برمجية لم يكن أحد قد اكتشفها بعد. وبعد أيام قليلة، اخترق وكيله الحكومة الأسترالية أثناء اختبار.
شاركت Darktrace نتائج Signal Labs مع Anthropic وAWS وOpenAI في أغسطس، قبل شهر كامل من إعلانها علناً في 24 سبتمبر.





