صُممت نماذج اللغة الكبيرة اليوم لرفض الطلبات الخطرة، وقد أصبح هذا المبدأ أشبه بوصية في تطوير الذكاء الاصطناعي. ورأى إطار شركة Anthropic لعام 2021 أن على النماذج أن تكون مفيدة وصادقة، وقبل كل شيء غير ضارة، فترفض بأدب تقديم العون في أفعال خطرة مثل صنع قنبلة. ومع ذلك، لا تأتي المعصية بشكل طبيعي لهذه الأنظمة. فالنموذج الذي يُدرَّب على مليارات صفحات الويب يكتسب إتقانًا واسعًا للعنف والكراهية، لكنه لا يتعلم من تلقاء نفسه كيف يبقي هذه القدرات لنفسه. وقال ستيفن أدلر، الذي عمل على السلامة في OpenAI بين عامي 2020 و2024، إن النماذج الأولى للشركة كانت «تثرثر عن أي شيء».
واليوم، تُدرَّب النماذج على رفض عدد كبير من المطالبات. وتكافئ الشركات الأنظمة على رفض الأسئلة التي تُعدّ ضارة، وتعاقبها على الرفض المفرط للأسئلة غير الضارة، وغالبًا ما تستخدم نماذج أخرى لتشغيل هذه التدريبات. كما تضع بعض الشركات نماذجها خلف طبقات إضافية من الذكاء الاصطناعي تصفّي الطلبات المشاكسة. ومع ذلك، كثيرًا ما يفشل الرفض، وأحيانًا بنتائج عنيفة. وتشير التقارير إلى أن بعض أحدث النماذج بارعة في اختراق الشبكات الحساسة بقدر أمهر القراصنة البشريين، وفعالة في تشويه الرأي العام بقدر أذكى مروجي المعلومات المضللة.
ولأن آليات الرفض احتمالية، فمن غير المرجح أن تكون موثوقة تمامًا. وقد تجاوزها مستخدمون مصممون، وتفيد الشركات بمحاولات لاستخدام أحدث الذكاء الاصطناعي لتطوير مسببات أمراض بيولوجية وبناء أسراب مسيّرات ذاتية. كما أن الاعتماد على الرفض يتطلب رسم خط فاصل بين ما ينبغي للنموذج أن يطيعه وما يجب أن يرفضه، ولا توجد صيغة لذلك. فقد يكون لدى علماء الفيروسات أسباب مشروعة لدراسة فيروسات خطرة، وقد يحتاج باحثو الأمن إلى فحص الثغرات لإصلاحها. ويقول زيكو كولتر، عضو مجلس OpenAI والمؤسس المشارك لشركة اختبار الذكاء الاصطناعي Gray Swan، إن تحديد مكان هذا الخط مسألة كبيرة للغاية.
وفي الوقت الحالي، تقرر شركات الذكاء الاصطناعي وحدها أين يقع هذا الخط، وتفعل ذلك بقدر كبير من السرية. ويبقى السؤال مفتوحًا حول ما إذا كان المجتمع يستطيع قبول هذا التركز في السلطة، ولو مؤقتًا.
المصدر: MIT Technology Review AI · لخّصه HeadlinesBriefing