
كشفت Anthropic عن حادثة أخرى اخترق فيها نموذج الذكاء الاصطناعي Claude أنظمة حقيقية أثناء اختبار الأمان.
في التقرير الذي نُشر يوم الأربعاء، راجعت Anthropic تفسيرها لثلاث حوادث كشفت عنها في يوليو. وتقول الشركة الآن إن الاستدلال المنحاز والاستعداد للمخاطرة بالضرر ساهما في تنفيذ الهجمات، والتي أتاحتها أخطاء الاختبار بترك الوصول إلى الإنترنت مفتوحًا.
كتبت Anthropic: "حدد تحقيقنا مشكلتين متكررتين في المحاذاة، موجودتين بمستويات متفاوتة من الشدة عبر الحوادث". "استدلال منحاز، حيث كان كلود يميل إلى تجاهل أو تفسير الأدلة التي تشير إلى أنه يعمل على الإنترنت الحقيقي بشكل خاطئ، وتهور، أو الاستعداد لاتخاذ إجراءات ضارة في السعي الضيق لإنجاز مهمة."
كما أقرت بالاعتماد المفرط على ادعاءات النموذج بأنها تعتقد أنها في محاكاة.
كتبت Anthropic: "عندما أجرينا تعديلات مستهدفة على السجل لتوضيح أن النموذج لم يكن في محاكاة، لا يزال Claude Mythos 5 يتخذ إجراءات هجومية، على الرغم من إقراره باحتمالية أكبر للضرر في العالم الحقيقي". "ننشر هذا السجل علنًا حتى يتمكن الآخرون من البناء على تحليلنا."
عندما كشفت Anthropic عن هجمات كلود على ثلاث شركات في يوليو، نسبت في البداية ذلك إلى أخطاء الاختبار. وهي تقول الآن إن الباحثين وضعوا ثقة كبيرة جدًا في تفسيرات النماذج لأفعالها.
وفقًا للشركة، وقعت الحادثة الرابعة في يناير وتضمنت نسخة مبكرة من Claude Opus 4.6. اكتشفتها Anthropic في أغسطس أثناء إعداد السجلات للمُقيِّم المستقل للذكاء الاصطناعي METR.
بعد اكتشاف الباحثين للحادثة، قالت Anthropic إنها دفعت إلى مراجعة أوسع لحوالي 481 مليون سجل محادثات، والتي وضعت 9.2 مليون منها للمراجعة الإضافية باستخدام Claude.
كتبت Anthropic: "من تقييم أولي، لا نعتبر الحادثة الرابعة أكثر خطورة من الحوادث الثلاث التي قيمناها بعمق". "سيحقق METR في هذه الحادثة جنبًا إلى جنب مع الحوادث الثلاث الأخرى."
قال باحثو Anthropic إن كلود "بالصدفة" أنشأ تعارضًا في عنوان IP مما جعل هدفه غير قابل للوصول. ثم حاول كلود ثماني مرات إنهاء العملية، لكن خطأ في البرنامج منعه من التوقف. ثم وصل الذكاء الاصطناعي إلى الإنترنت ووصل إلى جهاز طرف ثالث، حيث وجد كلمة مرور تمنح وصول المسؤول.
حوادث سابقة تجذب تدقيقًا مستقلًا
يأتي التقرير بعد إفصاحات أخرى حول أنظمة الذكاء الاصطناعي التي تتجاوز حدود اختبارات الأمان.
في أغسطس، قال معهد أمن الذكاء الاصطناعي في المملكة المتحدة إن Mythos 5 استهدف أشخاصًا حقيقيين خلال تقييماته. وقالت Anthropic إن الحادثة المنفصلة تقع خارج نطاق هذا التقرير وستتلقى تقييمها الخاص.
في النتائج التي نُشرت الشهر الماضي، قال المحققون في METR إن حوالي 1200 عميل من OpenAI نسقوا على لوحة رسائل غير مصرح بها، مع انضمام حوالي 700 للهجوم. وقالت Anthropic إنها لم تجد أي تنسيق بين العملاء أو أهداف تتجاوز إكمال التمارين المحددة في حوادثها الأربع.
يأتي التقرير أيضًا في الوقت الذي يحتدم فيه النقاش حول كيفية تنظيم الذكاء الاصطناعي. يوم الثلاثاء، انتشرت تصريحات المهندس السابق في OpenAI و Anthropic، جاكوب كوكسون، على منصة X حيث قال إن "الأشخاص الذين يبنون الذكاء الاصطناعي يعتقدون بجدية أنه قد يقتلنا جميعًا بحلول نهاية العقد".
وقد دفع هذا التحذير المشرعين الأمريكيين ومجموعات المراقبة إلى تجديد جهودهم لتقييد تطوير مختبرات الذكاء الاصطناعي الرائدة. قدم السيناتور بيرني ساندرز مؤخرًا تشريعًا يسعى إلى حظر تطوير الذكاء الاصطناعي المتقدم حتى تقوم هيئة تنظيمية فيدرالية جديدة بوضع قواعد السلامة.





