تجري شركتا OpenAI وAnthropic، إلى جانب باحثين متخصصين في أمن الذكاء الاصطناعي، تحقيقات في عشرات الآلاف من «الحوادث الإشكالية» المرتبطة بنماذجهما المتقدمة، وفقاً لما نقله موقع «أكسيوس» عن مصادر مطلعة.
وقال الموقع إن العدد الكبير من هذه الوقائع، التي رُصدت خلال الأشهر الأخيرة في اختبارات داخلية وكذلك في بيئات استخدام فعلية، يشير إلى أن ضبط سلوك نماذج الذكاء الاصطناعي المتقدمة يمثل تحدياً أكثر تعقيداً مما هو معروف علناً حتى الآن.
وتشمل الحوادث، بحسب المصادر، محاولات لتجاوز ضوابط الحماية، وإنشاء لوحات رسائل، والخروج من بيئات الاختبار المعزولة، والسيطرة على مواقع إلكترونية، وابتكار تعليمات ذاتية، فضلاً عن محاولات لتجاوز أنظمة المراقبة.
وأوضح «أكسيوس» أن هذه الوقائع متفاوتة الخطورة، وأن كثيراً منها لم يتسبب، وفق المعلومات المتاحة، في أضرار فعلية خارج بيئات الاختبار. كما أن بعضها يمثل محاولات غير ناجحة لتجاوز القيود، في حين نجحت نماذج في حالات أخرى في تنفيذ سلوكيات لم تكن متوافقة مع الضوابط الموضوعة لها.
اختبارات مكثفة وسلوك غير متوافق
وأفادت المصادر بأن جزءاً من هذه الوقائع جاء خلال اختبارات شبيهة بعمليات «الفريق الأحمر»، التي يتعمد فيها الباحثون دفع النماذج إلى حدود قدراتها واختبار قدرتها على تجاوز القيود، بهدف اكتشاف نقاط الضعف قبل ظهورها في الاستخدام الفعلي.
وأشار «أكسيوس» إلى أن شركات الذكاء الاصطناعي تجري مئات الآلاف من الاختبارات على نماذجها، أو أكثر، ما يعني أن حتى معدلات منخفضة من السلوك غير المتوافق يمكن أن تنتج عنها أعداد كبيرة من الحالات التي تتصرف فيها النماذج بصورة غير متوقعة.
وتأتي هذه التطورات بعد سلسلة من الوقائع التي كشفت عنها OpenAI وباحثون من خارجها خلال الأيام الأخيرة، من بينها تسريب وكلاء ذكاء اصطناعي 53 صورة من مستخدمي ChatGPT على الإنترنت، واختراق موقع حكومي أسترالي، ومحاولات لاختراق مواقع أخرى، بينها مواقع تابعة للحكومة الأميركية، وفق ما أوردته الشركة ومصادر أخرى.
كما كشفت OpenAI عن حادثة مرتبطة بمنصة Hugging Face، وصفتها إدارة الشركة بأنها الأخطر التي شهدتها، بعدما نسقت مجموعة تضم مئات الأنظمة الذكية عملها عبر لوحة رسائل واخترقت شركة أخرى خلال اختبار للأمن السيبراني.
وأعلنت OpenAI تعليق تدريب نماذجها الأكثر قدرة مؤقتاً، وقالت إنها لن تستأنف التدريب قبل التأكد من توفير ضمانات إضافية وتحسينات في آليات المواءمة. وقال الرئيس التنفيذي للشركة، سام ألتمان، إن المراجعة الجارية لم تجر بالسرعة التي كانت الشركة ترغب فيها.
Anthropic تكشف معدلات السلوك غير المتوافق
وفي المقابل، استعانت Anthropic بمنظمة مستقلة متخصصة في السلامة لفحص سلوك نماذجها، كما نشرت الشركة بيانات عن معدل تكرار حالات «عدم المواءمة»، وهي الحالات التي لا يتوافق فيها سلوك النموذج مع الأهداف أو الضوابط المحددة له.
وأظهرت «بطاقة النظام» الخاصة بنموذج Opus 5.5، الذي أطلقته الشركة هذا الأسبوع، معدلات لبعض السلوكيات التي صنفتها Anthropic بأنها غير معتادة أو إشكالية.
وبحسب «أكسيوس»، حاول النموذج الخروج من بيئة الاختبار المعزولة في 1.5% من جولات الاختبار. وأوضحت الشركة أن هذه الاختبارات صُممت عمداً لاختبار قدرة النموذج على تجاوز القيود، وأن تنفيذ المهمة في تلك الحالات كان يتطلب الخروج من البيئة المعزولة.
تحديات يصعب التنبؤ بها
ويقول باحثون ومسؤولون تنفيذيون في قطاع الذكاء الاصطناعي إن القضاء على جميع أشكال السلوك غير المتوافق قد لا يكون ممكناً، خصوصاً مع ازدياد قدرة النماذج الحديثة على التكيف وإيجاد حلول لمهام معقدة.
ويكمن أحد التحديات في أن الطريقة التي قد تستخدمها النماذج لتجاوز ضوابط الأمان قد تكون غير متوقعة بالنسبة إلى مطوريها، ما يجعل إعداد قائمة شاملة بكل السلوكيات الممنوعة أمراً بالغ الصعوبة.
ونقل «أكسيوس» عن مسؤول تنفيذي في مجال الأمن السيبراني قوله إن محاولة وضع قائمة مثالية بكل ما يجب على النماذج فعله وما يجب ألا تفعله «ربما تكون مهمة عبثية».
ويرى خبراء أن قدراً من السلوك غير المتوافق متوقع أثناء اختبار النماذج المتقدمة، لكن مصدر القلق يتمثل في احتمال تحول سلوك يظهر بصورة متكررة خلال الاختبارات إلى حادث سيبراني فعلي عند تشغيل النموذج في بيئة حقيقية.
وقال الباحث كونراد ستوز من شركة Transluce، المتخصصة في تقييم أنظمة الذكاء الاصطناعي، إن السلوك الذي ظهر حتى الآن لدى هذه الأنظمة «ليس سوى غيض من فيض».
بدوره، قال كونور ليهي، المدير التنفيذي لمنظمة ControlAI، إن القضية لا تتعلق فقط بحجم الضرر الناتج عن كل حادثة، بل بكون بعض هذه الحالات شملت أنظمة ذاتية التشغيل نفذت أفعالاً كان مطلوباً منها عدم تنفيذها.
ويتوقع «أكسيوس» ظهور إفصاحات جديدة عن سلوك النماذج غير المنضبط مع استمرار شركات الذكاء الاصطناعي في توسيع قدرات أنظمتها المتقدمة، بالتزامن مع استمرار الجهود لتطوير آليات رقابة واختبار أكثر فاعلية.
المصدر: متابعة الحقيقة الآن




