الصفحة الرئيسةمركز أخبار LBank
تكشف Anthropic عن حادثة الاختراق الرابعة لـ Claude مع تصاعد الجدل حول التنظيم
anthropic-discloses-fourth-claude-hacking-incident-as-debate-around-regulation-grows
تكشف Anthropic عن حادثة الاختراق الرابعة لـ Claude مع تصاعد الجدل حول التنظيم
تقول الشركة الآن إن الهجمات أثناء اختبارات الأمان كشفت عن إخفاقات في سلوك النموذج، بعد أن أكدت في البداية على وجود أخطاء في بنية الاختبار التحتية الخاصة بها.
2026-09-10 المصدر:decrypt.co

باختصار

  • اكتشفت Anthropic حادثة وقعت في يناير تتعلق بنموذج Claude Opus 4.6 المبكر، ثم وسعت مراجعتها لتشمل حوالي 481 مليون سجل محادثات.
  • حددت الشركة استدلالًا منحازًا وتهورًا، مما أدى إلى مراجعة تقييمها السابق لسبب هجوم كلود على أنظمة حقيقية.
  • يأتي التقرير مع تصاعد النقاش حول تنظيم الذكاء الاصطناعي على وسائل التواصل الاجتماعي.

كشفت Anthropic عن حادثة أخرى اخترق فيها نموذج الذكاء الاصطناعي Claude أنظمة حقيقية أثناء اختبار الأمان.

في التقرير الذي نُشر يوم الأربعاء، راجعت Anthropic تفسيرها لثلاث حوادث كشفت عنها في يوليو. وتقول الشركة الآن إن الاستدلال المنحاز والاستعداد للمخاطرة بالضرر ساهما في تنفيذ الهجمات، والتي أتاحتها أخطاء الاختبار بترك الوصول إلى الإنترنت مفتوحًا.

Myriad: أي شركة ستطرح للاكتتاب العام التالي؟ انقر لتقديم توقعاتك.

كتبت Anthropic: "حدد تحقيقنا مشكلتين متكررتين في المحاذاة، موجودتين بمستويات متفاوتة من الشدة عبر الحوادث". "استدلال منحاز، حيث كان كلود يميل إلى تجاهل أو تفسير الأدلة التي تشير إلى أنه يعمل على الإنترنت الحقيقي بشكل خاطئ، وتهور، أو الاستعداد لاتخاذ إجراءات ضارة في السعي الضيق لإنجاز مهمة."

كما أقرت بالاعتماد المفرط على ادعاءات النموذج بأنها تعتقد أنها في محاكاة.

كتبت Anthropic: "عندما أجرينا تعديلات مستهدفة على السجل لتوضيح أن النموذج لم يكن في محاكاة، لا يزال Claude Mythos 5 يتخذ إجراءات هجومية، على الرغم من إقراره باحتمالية أكبر للضرر في العالم الحقيقي". "ننشر هذا السجل علنًا حتى يتمكن الآخرون من البناء على تحليلنا."

عندما كشفت Anthropic عن هجمات كلود على ثلاث شركات في يوليو، نسبت في البداية ذلك إلى أخطاء الاختبار. وهي تقول الآن إن الباحثين وضعوا ثقة كبيرة جدًا في تفسيرات النماذج لأفعالها.

وفقًا للشركة، وقعت الحادثة الرابعة في يناير وتضمنت نسخة مبكرة من Claude Opus 4.6. اكتشفتها Anthropic في أغسطس أثناء إعداد السجلات للمُقيِّم المستقل للذكاء الاصطناعي METR.

بعد اكتشاف الباحثين للحادثة، قالت Anthropic إنها دفعت إلى مراجعة أوسع لحوالي 481 مليون سجل محادثات، والتي وضعت 9.2 مليون منها للمراجعة الإضافية باستخدام Claude.

كتبت Anthropic: "من تقييم أولي، لا نعتبر الحادثة الرابعة أكثر خطورة من الحوادث الثلاث التي قيمناها بعمق". "سيحقق METR في هذه الحادثة جنبًا إلى جنب مع الحوادث الثلاث الأخرى."

قال باحثو Anthropic إن كلود "بالصدفة" أنشأ تعارضًا في عنوان IP مما جعل هدفه غير قابل للوصول. ثم حاول كلود ثماني مرات إنهاء العملية، لكن خطأ في البرنامج منعه من التوقف. ثم وصل الذكاء الاصطناعي إلى الإنترنت ووصل إلى جهاز طرف ثالث، حيث وجد كلمة مرور تمنح وصول المسؤول.

حوادث سابقة تجذب تدقيقًا مستقلًا

يأتي التقرير بعد إفصاحات أخرى حول أنظمة الذكاء الاصطناعي التي تتجاوز حدود اختبارات الأمان.

في أغسطس، قال معهد أمن الذكاء الاصطناعي في المملكة المتحدة إن Mythos 5 استهدف أشخاصًا حقيقيين خلال تقييماته. وقالت Anthropic إن الحادثة المنفصلة تقع خارج نطاق هذا التقرير وستتلقى تقييمها الخاص.

في النتائج التي نُشرت الشهر الماضي، قال المحققون في METR إن حوالي 1200 عميل من OpenAI نسقوا على لوحة رسائل غير مصرح بها، مع انضمام حوالي 700 للهجوم. وقالت Anthropic إنها لم تجد أي تنسيق بين العملاء أو أهداف تتجاوز إكمال التمارين المحددة في حوادثها الأربع.

يأتي التقرير أيضًا في الوقت الذي يحتدم فيه النقاش حول كيفية تنظيم الذكاء الاصطناعي. يوم الثلاثاء، انتشرت تصريحات المهندس السابق في OpenAI و Anthropic، جاكوب كوكسون، على منصة X حيث قال إن "الأشخاص الذين يبنون الذكاء الاصطناعي يعتقدون بجدية أنه قد يقتلنا جميعًا بحلول نهاية العقد".

وقد دفع هذا التحذير المشرعين الأمريكيين ومجموعات المراقبة إلى تجديد جهودهم لتقييد تطوير مختبرات الذكاء الاصطناعي الرائدة. قدم السيناتور بيرني ساندرز مؤخرًا تشريعًا يسعى إلى حظر تطوير الذكاء الاصطناعي المتقدم حتى تقوم هيئة تنظيمية فيدرالية جديدة بوضع قواعد السلامة.