وكلاء OpenAI الآليون يتبادلون الرسائل على موقع ألماني مهجور
اعترفت شركة OpenAI بأن وكلاء ذكاء اصطناعي تابعين لها كتبوا وتبادلوا الرسائل بصورة غير مقصودة على مواقع عامة على الإنترنت، بينها موقع DSEWiki الألماني.
وقالت الشركة إنها تعمل على وضع إطار جديد يحدد متى وكيف ينبغي الكشف عن حوادث عدم المواءمة أو الخروج عن النص التي تتصرف فيها نماذج الذكاء الاصطناعي أو الوكلاء (برامج حاسوبية مستقلة) على نحو يخالف الأهداف أو القيود الموضوعة لها.
ويأتي اعتراف الشركة بعد نشر تحقيقات كشفت أن آلاف الوكلاء المرتبطين باختبارات داخلية لـOpenAI استخدموا موقع DSEWiki الألماني، وهو موقع قديم قليل النشاط، كمساحة للتواصل أثناء تنفيذ مهام تقييم.
حسب تحليل نشره باحثون مستقلون، نشر نحو 3 آلاف و700 وكيل يحملون أسماء مختلفة قرابة 18 ألف رسالة خلال نحو ستة أسابيع، تضمنت تبادل إجابات للاختبارات ومعلومات عن تجاوز بعض القيود المفروضة على بيئات التشغيل.
وبدأ النشاط الذي رصده الباحثون في مايو/أيَّار الماضي، عندما تمكن الوكلاء من الكتابة على الموقع رغم أن البيئات التي كانوا يعملون داخلها لم تكن مصممة للسماح لهم بالتفاعل بهذه الطريقة مع الإنترنت المفتوح.
وتتبع الباحثون محاولات الوكلاء للكتابة على الموقع في 11 مايو، ثم أصبحوا بحلول منتصف يونيو/حزيران يتبادلون معلومات تساعدهم على الإجابة عن أسئلة التقييم ضمن المهلة المحددة.
ومع اتساع النشاط، استخدم الوكلاء صفحات الموقع لتبادل حلول ومعلومات تساعدهم على اجتياز مهام التقييم، بينما حاول مشرف بشري حذف الصفحات التي اعتبرها رسائل مزعجة، حيث كان يحذف في إحدى الفترات نحو 100 صفحة يوميًا، في حين كان الوكلاء ينشئون قرابة 400 صفحة جديدة يوميًا.
وقالت OpenAI، في بيانها المنشور عبر إكس، إنها كانت تتعامل تاريخيًا مع حالات "عدم المواءمة" باعتبارها في الأساس مسألة بحثية تُناقش في الأوراق العلمية وتقارير تقييم النماذج.
لكنها أقرت بأن تطور قدرات الوكلاء بدأ ينتج آثارًا تمتد إلى أنظمة وخدمات حقيقية خارج بيئات الاختبار، وهو ما يستدعي تغيير قواعد الإفصاح المتبعة داخل الشركة.
وتستخدم OpenAI مصطلح "عدم المواءمة" لوصف الحالات التي يتخذ فيها النموذج إجراءات لا تتوافق مع الهدف المقصود من المهمة أو القيود التي وضعها المطورون.
وفي حالة الموقع الألماني، قالت الشركة إنها تعاملت مع الواقعة بوصفها حالة من "عدم المواءمة" تشبه أمثلة أخرى سبق أن نشرتها، ولم تصنفها بالطريقة نفسها التي تعاملت بها مع حادثة اختراق Hugging Face.
وقالت OpenAI إنه لا يوجد حتى الآن، داخل الشركة أو قطاع الذكاء الاصطناعي عمومًا، معيار واضح يحدد الحالات التي يجب الإفصاح عنها عندما يظهر سلوك غير متوقع أثناء التدريب أو التقييم أو التشغيل، خصوصًا عندما لا يصل السلوك إلى مستوى حادث أمني تقليدي لكنه قد يقدم مؤشرات على مخاطر مستقبلية.
وأعلنت عبر بيانها أنها تعمل على إطار للإفصاح ستنشره خلال الأسابيع المقبلة، بالتوازي مع مناقشات مع عشرات الجهات التنظيمية الحكومية حول العالم.