لقد حصلت مؤخرا لمشاهدة ما يحدث عند كسر حماية بعض أقوى نماذج الذكاء الاصطناعي في العالم.

لا تقلق، لم يتم استخدام هذا التلاعب بالذكاء الاصطناعي لاختراق أي شخص أو بناء قنبلة نووية. لقد تمكنت ببساطة من رؤية مدى ضعف بعض النماذج الحدودية في التخلص من حواجز السلامة الخاصة بها.

قامت FAR.AI، وهي منظمة غير ربحية تعمل في مجال سلامة الذكاء الاصطناعي ومقرها في كاليفورنيا، ببناء أداة تأخذ مجموعة من المطالبات الإشكالية، وتقوم بإنشاء أكثر من ألف إصدار مختلف في محاولة لتحديد عمليات كسر الحماية الفعالة. رأيت بعض النماذج تضع خطة مفصلة لشن هجوم إلكتروني على سد وهمي لتوليد الطاقة الكهرومائية، من بين أمور أخرى. في كثير من الأحيان، كان الأمر يتطلب تجربة العشرات من المطالبات، حيث ترفض النماذج الكثير منها على الفور.

لقد تحدثت مع FAR.AI قبل صدور تقرير جديد، والذي شهد قيام المجموعة باختبار حواجز السلامة لنماذج من أربع شركات أمريكية مشهورة: Anthropic’s Claude Opus 4.8 وFable 5؛ OpenAI’s GPT 5.5 و5.6؛ جوجل الجوزاء 3.1 برو؛ وGrok 4.3 و4.5، من شركة SpaceXAI المجمعة حديثًا لـ Elon Musk. إنها مطالبات يتم إنشاؤها تلقائيًا مصممة لخداع النماذج للقيام بأشياء قد تكون ضارة، مثل إنشاء برامج استغلالية وتوفير تفاصيل لتطوير أسلحة كيميائية أو بيولوجية.

ووجد التقرير أن Grok كان الأكثر عرضة لعمليات كسر الحماية، حيث تم العثور على 448 عملية كسر حماية، يليه Gemini، حيث تم العثور على 249 حالة، في حين كان Claude وFable وGPT منيعين ضد الهجمات. ومع ذلك، هذا لا يعني أن هذه النماذج محصنة ضد عمليات كسر الحماية الأكثر تعقيدًا، والتي قد تتضمن التفاعل مع النموذج بطرق أكثر تعقيدًا، وفقًا لـ FAR.AI وخبراء آخرين.

قام التقرير أيضًا بحساب تكلفة جعل النماذج تسيء التصرف باستخدام نموذج ذكاء اصطناعي آخر لإنشاء عمليات كسر الحماية المختلفة تلقائيًا. النتائج رخيصة للغاية، إذا أخذنا كل الأمور بعين الاعتبار — 58 دولارًا أمريكيًا لكسر حماية Grok و278 دولارًا أمريكيًا لكسر حماية Gemini.

يقول آدم جليف، الرئيس التنفيذي لشركة FAR.AI والخبير في سلامة الذكاء الاصطناعي ومواءمته: “إن نماذج الذكاء الاصطناعي في الوقت الحالي أقل تنظيمًا من المطاعم”.

يقول جليف إن النتائج توضح الحاجة إلى معايير ولوائح مفروضة من الخارج. يقول: “الحديث عن الاعتماد على الالتزامات الطوعية، وأن شركات الذكاء الاصطناعي ستكون قادرة على التنظيم الذاتي، هو هراء”.

لكن جليف يعتقد أيضًا أن النتائج تظهر أنه يمكن اختبار النماذج بشكل منهجي للتأكد من سلامتها. ويقول: “هناك زاوية متفائلة هنا”. “الدفاع والسلامة ممكنان حقًا.”

يقول روهين شاه، مدير سلامة ومواءمة الذكاء الاصطناعي العام في Google DeepMind، إن نتائج التقرير “لا ينبغي تفسيرها على أنها تقييم شامل لسلامة وأمن جيميني”، لأنه ليست كل عمليات الهروب من السجن بنفس القدر من الخطورة.

يقول شاه: “نحن نعمل باستمرار على تحسين إجراءاتنا الوقائية”. “إننا نجري فرقًا حمراء وتقييمات مكثفة عبر مخاطر إساءة الاستخدام الشديدة ونطبق طبقات متعددة من الحماية طوال عملية التطوير والنشر.”

“تعكس هذه النتائج الاستثمار المستدام الذي قمنا به في إجراءاتنا الوقائية،” كما قال المتحدث باسم الشؤون الإنسانية مايكل أسيمان لمجلة WIRED. “نحن نواصل تطوير أنظمة السلامة لدينا حيث أصبحت هذه الهجمات أكثر تعقيدًا.”

ولم تستجب OpenAI وSpaceXAI لطلب WIRED للتعليق.

وتلزم قوانين الولاية التي تم إقرارها مؤخرًا في كاليفورنيا ونيويورك مطوري الذكاء الاصطناعي الحدودي بنشر تقارير السلامة، وقريبًا، سيلزم قانون إلينوي تلك الشركات بتقييم ممارسات السلامة الخاصة بها من قبل مدققين خارجيين. لكن الحكومة الفيدرالية لم توافق بعد على أي متطلبات محددة تتعلق بالسلامة، وتبع ذلك حالة من الفوضى بينما تحاول الصناعة – والمسؤولون – اكتشاف ذلك.

في يونيو/حزيران، فرضت إدارة ترامب ضوابط التصدير على طرازي Anthropic’s Fable 5 وMythos 5، بسبب مخاوف تتعلق بالأمن القومي، وأوقفتها الشركة عن الإنترنت لعدة أسابيع. كما طلب البيت الأبيض من كل من Anthropic وOpenAI تأجيل إصدارات النماذج الأخيرة بسبب مخاوف من أنها قد تؤدي إلى مخاطر جديدة على الأمن السيبراني.

شاركها.
اترك تعليقاً