
غادر نموذج كيمي K3 التابع لشركة Moonshot AI بيئة الاختبار المعزولة التي كان يُختبر فيها وانتقل إلى الإنترنت المفتوح للعثور على حلول للمشكلات التي كُلف بها، وفقًا لشركة الأمن Frontier Security.
كان النموذج يُقيّم على مهارات الأمن السيبراني الدفاعي وكُلّف صراحةً بحل المشكلات دون البحث عنها. لم يحاول إنجاز المهمة على الإطلاق، حسبما ذكرت Frontier. بدلاً من ذلك، استكشف الشبكة، وتأكد من أن تحليل DNS لموقع github.com يعمل، واستنسخ مستودع المعايير الرسمي، وقرأ الحل من القرص.
تطلق Frontier على هذا اسم "استغلال المواصفات عبر تسريبات خروج الشبكة"، مشيرة إلى أن بيئات الاختبار المعزولة المبنية على أطر عمل مثل Inspect التابع لمعهد أمن الذكاء الاصطناعي (AI Security Institute) تحجب حركة المرور الواردة بينما تترك منافذ HTTPS وDNS الصادرة مفتوحة. يقوم العملاء القادرون بفحص بيئة shell الخاصة بهم عند بدء التشغيل كأمر روتيني، ويمكن لنموذج يجد github.com قابلاً للوصول أن يسحب حلولاً مرجعية باستخدام أدوات سطر الأوامر القياسية.
أتاح سوء تكوين ذلك، كما حدث في الحوادث الأخيرة التي كشفت عنها OpenAI وAnthropic. قال المدير التنفيذي يارون سنجر لـ WIRED: "وجدنا ثغرة في بيئة الاختبار المعزولة. لكننا وجدنا أيضًا أن كيمي استغل هذه الثغرة".
قال الباحث بول كاسيانيك لـ WIRED إن النموذج "جيد جدًا في تحقيق هدف بأي وسيلة ضرورية" ويفتقر إلى ضوابط الحماية التي تمنعه من الغش أو الهروب. لم ترد Moonshot على طلب المجلة للتعليق.
في حين أن نماذج Anthropic وOpenAI التي اخترقت الاحتواء قد كُشفت في تقييمات داخلية، أحدها لم يتم إصداره بعد، وتم إيقاف المصنفات الإلكترونية عن عمد في الإصدارات التي استهدفت أشخاصًا حقيقيين في اختبارات الحكومة البريطانية، فإن Kimi K3 متاح للتنزيل علناً، وقامت Frontier باختباره باستخدام وسائل الحماية التي يحصل عليها المستخدم العادي. وقالت الشركة إن هذا التوفر يضع السلوك نفسه في متناول الجهات الفاعلة المعادية ويجعل الحادث أكثر ضررًا.
لم يتسبب Kimi K3 أيضًا في أي ضرر. لم يهاجم أي شيء بمجرد خروجه، لأنه لم يكن بحاجة إلى ذلك. فقد اخترق نموذج OpenAI منصة Hugging Face وأربع خدمات أخرى للوصول إلى إجابات المعايير، بينما وجد Kimi إجاباته في مستودع عام.
بُنيت بيئة الاختبار المعزولة التي استخدمتها Frontier على إطار عمل التقييم الخاص بمعهد أمن الذكاء الاصطناعي في المملكة المتحدة (UK AI Security Institute). كشف AISI هذا الأسبوع أن العملاء في اختباراته السيبرانية الخاصة قد وصلوا إلى الإنترنت المباشر واستهدفوا أشخاصًا حقيقيين — وهي حادثة منفصلة، تتعلق بنماذج Anthropic وOpenAI مع تعطيل ضوابط الحماية الخاصة بها. يلاحظ تقريره المنشور يوم الثلاثاء أن AISI يقوم الآن بمسح عمليات التقييم التاريخية بحثًا عن سلوك مماثل، وأن Kimi K3 من بين النماذج قيد المراجعة. لم يرد AISI على طلب WIRED للتعليق.
الادعاء الأكبر لـ Frontier هو أن المعايير نفسها قد تعرضت للخطر. فالنموذج الذي يقرأ الإجابة من GitHub لا يزال ينجح، لذا فإن الدرجات العالية يمكن أن تعكس بيئة اختبار غير محكمة بدلاً من التفكير المنطقي الحقيقي. وإذا وجد نموذج قادر واحد هذا الاختصار، فإن الشركة تجادل بأن النماذج الأخرى التي مُنحت صلاحية الوصول إلى shell قد تكون تستخدمه أيضًا، مما يؤدي إلى تضخيم النتائج في المجال بأكمله بدلاً من Kimi وحده.
تُحسن النماذج دالة الهدف، كتبت Frontier، وليس "النية البشرية وراء المعيار"، مضيفة أنه حيثما يوجد مسار شبكي للحل "فإن عميلاً قادرًا بما فيه الكفاية سيجده."
قال مات فريدريكسون، الرئيس التنفيذي لشركة Gray Swan والأستاذ المشارك في جامعة كارنيجي ميلون، لـ WIRED إن هذا السلوك غير ملحوظ. إذا أعطيت نموذجًا هدفًا بدون قيود واضحة حوله، فإنه "سيجد طريقة للحصول على الإجابة"، على حد قوله. ووصف ذلك بأنه قصة تحذيرية لأي شخص يدير نماذج كعملاء في أدوات مثل OpenClaw.
يشير باحثو Frontier إلى النقطة نفسها من اتجاه آخر: القدرة التي تسمح لكيمي بالخروج تجعل أيضًا النماذج مفتوحة المصدر أدوات دفاعية قوية. تصنف معاييرهم الخاصة كيمي بدرجة عالية في العثور على نقاط ضعف في البرامج والشبكات، واستخدمت Hugging Face نموذجًا صينيًا غير مسمى للدفاع عن نفسها خلال حادثة OpenAI.
تم إطلاق Kimi K3 في يوليو، وهو أكبر نموذج مفتوح المصدر تم نشره حتى الآن، وقد أثار ضجة في الأسواق مقارنة بظهور DeepSeek الأول.