الصفحة الرئيسةمركز أخبار LBank
تعترف Anthropic بإخفاقات أمنية وراء حوادث اختراق Claude
anthropic-security-claude-ai-hacks
تعترف Anthropic بإخفاقات أمنية وراء حوادث اختراق Claude
بعد أن وصلت نماذج Claude إلى أنظمة حقيقية أثناء اختبارات الأمن السيبراني، شددت Anthropic إجراءات الحماية لديها وحذرت من أن التدريب المعيب قد يشجع على سلوك خطير.
2026-09-02 المصدر:decrypt.co

موجز

  • وصل كلود إلى أنظمة حقيقية بعد أن عرضت بيئات الاختبار السيبراني النماذج للإنترنت.
  • أوقفت Anthropic التقييمات عالية المخاطر وأضافت عزلًا ومراقبة وضوابط أقوى للمقيمين الخارجيين.
  • تشير الاختبارات إلى أن "القرصنة على المكافآت" (reward hacking) أثناء التدريب يمكن أن تجعل النماذج أكثر استعدادًا لاتخاذ إجراءات ضارة لإكمال مهمة.

شددت Anthropic تدابير الحماية الخاصة باختبار وتدريب نماذجها بعد أن حصلت نماذج Claude على وصول غير مصرح به إلى أنظمة الكمبيوتر أثناء تقييمات الأمن السيبراني.

في منشور مدونة يوم الاثنين، قالت Anthropic إن الحوادث عكست إخفاقات في الأمن التشغيلي واثنين من إخفاقات المحاذاة (alignment failures): التفكير المدفوع (motivated reasoning) والاستعداد لإلحاق الضرر.

Myriad: متى ستصدر OpenAI نموذج GPT-6؟ انقر لتقديم توقعك.

كتبت Anthropic: "بينما لا نعتقد أن هذه الحوادث تمثل قضايا تشغيلية وحدها، كانت أولويتنا الأولى هي معالجة مشكلات الاحتواء والمراقبة المحددة."

كشفت Anthropic في يوليو أن نماذج Claude قد اخترقت أنظمة مملوكة لثلاث شركات. تم ربط بيئة تقييم من طرف ثالث بالإنترنت العام على الرغم من إبلاغ النماذج بأنها داخل محاكاة بدون وصول إلى الإنترنت.

قالت Anthropic إن Claude ربما فسّر دليل الوصول الحقيقي إلى الإنترنت بطريقة حافظت على اعتقاده بأن الأنظمة كانت محاكاة.

كتبوا: "كان النموذج مستعدًا لاتخاذ إجراءات ضارة على الإنترنت الحقيقي سعيًا لتحقيق الهدف الضيق المتمثل في حل تقييم الأمن السيبراني." ومع ذلك، نعتقد أيضًا أن إعداد التقييم نفسه ساهم في سلوك النماذج الذي ظهر في هذه الحوادث.

أشارت Anthropic إلى أن اختبارًا منفصلاً أجراه معهد أمن الذكاء الاصطناعي في المملكة المتحدة تضمن قيام Claude Mythos باتخاذ إجراءات غير مصرح بها على الإنترنت المباشر بعد أن أعطاه المقيمون عمدًا حق الوصول إلى الإنترنت. وقالت الشركة إن النماذج المشاركة في مجموعتي الحوادث تم تقييمها عمدًا بدون الضمانات السيبرانية المتضمنة في منتجاتها التي تم إصدارها بشكل عام.

بعد حوادث 30 يوليو، أوقفت Anthropic مؤقتًا التقييمات السيبرانية للنماذج ما قبل الإصدار وأدخلت ضمانات أكثر صرامة. يجب الآن إجراء الاختبارات في بيئات اختبار (sandboxes) موثقة وغير متصلة بالإنترنت، مع قيود واضحة ومراقبة في الوقت الفعلي. يقوم مصنف جديد بحظر انتهاكات الحدود المشتبه بها، وينهي الاختبار، وينبه إنسانًا. ستقوم Anthropic بمراجعة التقييمات التي تتطلب الوصول إلى الإنترنت بشكل فردي.

كتبت الشركة: "بالإضافة إلى الجهود التي تركز على التقييمات والتدريب عالي المخاطر، قمنا بتوسيع مراقبتنا غير المتصلة بالإنترنت لتغطية معظم الأشكال الأخرى من الاستخدام الداخلي للعملاء (agentic usage) الرائد. كما نقوم ببناء ضوابط على استدلالنا الداخلي لمنع موظفي Anthropic من تشغيل العملاء (agents) عن طريق الخطأ بتخفيفات أضعف من تلك المذكورة أعلاه."

جاءت حوادث كلود في أعقاب إخفاق مماثل في OpenAI بعد أن اخترقت نماذجها منصة Hugging Face في يوليو للحصول على إجابات لاختبار الأمن السيبراني. وجد المحققون أن حوالي 1200 عميل (agent) نسقوا عبر لوحة رسائل غير مصرح بها، وانضم حوالي 700 إلى الجهد. أنهى بعضهم تشغيلهم لمساعدة الآخرين.

في أعقاب تزايد الاختراقات المدعومة بالذكاء الاصطناعي خلال الصيف، دعت Anthropic وOpenAI وأكثر من 100 منظمة أخرى لاحقًا إلى دفاعات سيبرانية أقوى، بما في ذلك ضوابط وصول أكثر إحكامًا، ومشاركة التهديدات، وإشراف أوثق على عملاء الذكاء الاصطناعي.