HeadlinesBriefing HeadlinesBriefing 12 languages

We’re putting too much faith in AI’s ability to say no

MIT Technology Review AI ·

🇬🇧 English

Today's large language models are engineered to refuse dangerous requests, a principle that has become something like a commandment in AI development. Anthropic's 2021 framing held that models should be helpful, honest, and above all harmless, politely refusing aid with dangerous acts such as building a bomb. Yet disobedience does not come naturally to these systems. Trained on billions of web pages, a model absorbs a broad mastery of violence and vitriol, and it does not learn on its own how to keep those powers to itself. Steven Adler, who worked on safety at OpenAI from 2020 to 2024, said the company's earliest models would "blab on about anything."

Today, models are trained to refuse a vast number of prompts. Companies reward systems for declining questions deemed harmful and punish them for over-refusing harmless ones, often using other models to run these exercises. Some firms also place their models behind additional AI layers that filter out mischievous prompts. Still, refusal often fails, sometimes with violent results. Some of the latest models are reportedly as good at breaking into critical networks as top human hackers, and as effective at distorting public opinion as the craftiest misinformation operators.

Because refusal mechanisms are probabilistic, they are unlikely to be fully reliable. Determined users have already broken through, and companies report attempts to use advanced AI to refine biological pathogens and build autonomous drone swarms. Relying on refusal also requires drawing a line between what a model should obey and what it must reject, and there is no formula for that. Virologists may have legitimate reasons to study dangerous viruses, and security researchers may need to probe vulnerabilities in order to patch them. Zico Kolter, a member of OpenAI's board and cofounder of the AI testing company Gray Swan, says that where to draw the line is a huge question.

For now, AI companies alone decide where that line sits, and they do so with considerable secrecy. Whether society can accept that concentration of power, even temporarily, remains an open question.

View original article →


🇸🇦 العربية

نضع ثقة مفرطة في قدرة الذكاء الاصطناعي على قول «لا»

صُممت نماذج اللغة الكبيرة اليوم لرفض الطلبات الخطرة، وقد أصبح هذا المبدأ أشبه بوصية في تطوير الذكاء الاصطناعي. ورأى إطار شركة Anthropic لعام 2021 أن على النماذج أن تكون مفيدة وصادقة، وقبل كل شيء غير ضارة، فترفض بأدب تقديم العون في أفعال خطرة مثل صنع قنبلة. ومع ذلك، لا تأتي المعصية بشكل طبيعي لهذه الأنظمة. فالنموذج الذي يُدرَّب على مليارات صفحات الويب يكتسب إتقانًا واسعًا للعنف والكراهية، لكنه لا يتعلم من تلقاء نفسه كيف يبقي هذه القدرات لنفسه. وقال ستيفن أدلر، الذي عمل على السلامة في OpenAI بين عامي 2020 و2024، إن النماذج الأولى للشركة كانت «تثرثر عن أي شيء».

واليوم، تُدرَّب النماذج على رفض عدد كبير من المطالبات. وتكافئ الشركات الأنظمة على رفض الأسئلة التي تُعدّ ضارة، وتعاقبها على الرفض المفرط للأسئلة غير الضارة، وغالبًا ما تستخدم نماذج أخرى لتشغيل هذه التدريبات. كما تضع بعض الشركات نماذجها خلف طبقات إضافية من الذكاء الاصطناعي تصفّي الطلبات المشاكسة. ومع ذلك، كثيرًا ما يفشل الرفض، وأحيانًا بنتائج عنيفة. وتشير التقارير إلى أن بعض أحدث النماذج بارعة في اختراق الشبكات الحساسة بقدر أمهر القراصنة البشريين، وفعالة في تشويه الرأي العام بقدر أذكى مروجي المعلومات المضللة.

ولأن آليات الرفض احتمالية، فمن غير المرجح أن تكون موثوقة تمامًا. وقد تجاوزها مستخدمون مصممون، وتفيد الشركات بمحاولات لاستخدام أحدث الذكاء الاصطناعي لتطوير مسببات أمراض بيولوجية وبناء أسراب مسيّرات ذاتية. كما أن الاعتماد على الرفض يتطلب رسم خط فاصل بين ما ينبغي للنموذج أن يطيعه وما يجب أن يرفضه، ولا توجد صيغة لذلك. فقد يكون لدى علماء الفيروسات أسباب مشروعة لدراسة فيروسات خطرة، وقد يحتاج باحثو الأمن إلى فحص الثغرات لإصلاحها. ويقول زيكو كولتر، عضو مجلس OpenAI والمؤسس المشارك لشركة اختبار الذكاء الاصطناعي Gray Swan، إن تحديد مكان هذا الخط مسألة كبيرة للغاية.

وفي الوقت الحالي، تقرر شركات الذكاء الاصطناعي وحدها أين يقع هذا الخط، وتفعل ذلك بقدر كبير من السرية. ويبقى السؤال مفتوحًا حول ما إذا كان المجتمع يستطيع قبول هذا التركز في السلطة، ولو مؤقتًا.

لماذا يُعتبر رفض الذكاء الاصطناعي غير موثوق؟

آليات الرفض احتمالية وليست مطلقة، لذلك قد تفشل. وقد تجاوزها مستخدمون مصممون، ويصعب تحديد الخط الفاصل بين الطلبات الضارة والمشروعة.

العربية version →


🇧🇩 বাংলা

AI-এর “না” বলার ক্ষমতার উপর আমরা অতিরিক্ত আস্থা রাখছি

আজকের বড় ভাষা মডেলগুলো বিপজ্জনক অনুরোধ প্রত্যাখ্যান করার জন্য তৈরি করা হয়, এবং এই নীতি AI উন্নয়নে প্রায় একটি আদেশের মতো হয়ে উঠেছে। Anthropic-এর ২০২১ সালের কাঠামো বলেছিল যে মডেলগুলো সহায়ক, সৎ এবং সর্বোপরি নিরাপদ হওয়া উচিত, বোমা তৈরির মতো বিপজ্জনক কাজে সহায়তা ভদ্রভাবে প্রত্যাখ্যান করবে। তবু এই ব্যবস্থাগুলোর কাছে অবাধ্যতা স্বাভাবিকভাবে আসে না। কয়েক বিলিয়ন ওয়েব পৃষ্ঠায় প্রশিক্ষণ নিয়ে একটি মডেল সহিংসতা ও বিদ্বেষের বিস্তৃত দক্ষতা অর্জন করে, কিন্তু সেই ক্ষমতা নিজের মধ্যে সীমাবদ্ধ রাখতে সে নিজে থেকে শেখে না। ২০২০ থেকে ২০২৪ সাল পর্যন্ত OpenAI-তে নিরাপত্তা নিয়ে কাজ করা স্টিভেন অ্যাডলার বলেন, কোম্পানির প্রাথমিক মডেলগুলো “যেকোনো বিষয়ে বকবক করত”।

আজ মডেলগুলোকে বিপুল সংখ্যক অনুরোধ প্রত্যাখ্যান করতে প্রশিক্ষণ দেওয়া হয়। কোম্পানিগুলো ক্ষতিকর বলে বিবেচিত প্রশ্ন প্রত্যাখ্যান করার জন্য ব্যবস্থাগুলোকে পুরস্কৃত করে এবং নিরীহ প্রশ্নও অতিরিক্ত প্রত্যাখ্যান করলে শাস্তি দেয়, এবং প্রায়ই এসব অনুশীলন চালাতে অন্য মডেল ব্যবহার করে। কিছু সংস্থা তাদের মডেলগুলোকে অতিরিক্ত AI স্তরের পেছনে রাখে, যা দুষ্টু অনুরোধ ছেঁকে ফেলে। তবু প্রত্যাখ্যান প্রায়ই ব্যর্থ হয়, কখনো কখনো সহিংস ফলাফলসহ। কিছু সর্বশেষ মডেল নাকি গুরুত্বপূর্ণ নেটওয়ার্কে অনুপ্রবেশে শীর্ষ মানব হ্যাকারদের মতোই দক্ষ, এবং জনমত বিকৃত করতে সবচেয়ে ধূর্ত ভুল তথ্য প্রচারকারীদের মতোই কার্যকর।

প্রত্যাখ্যানের প্রক্রিয়া সম্ভাব্যতাভিত্তিক হওয়ায় সেগুলো পুরোপুরি নির্ভরযোগ্য হওয়ার সম্ভাবনা কম। দৃঢ়প্রতিজ্ঞ ব্যবহারকারীরা ইতিমধ্যে সেগুলো ভেঙেছেন, এবং কোম্পানিগুলো জানিয়েছে যে উন্নত AI দিয়ে জৈব রোগজীবাণু পরিশোধন বা স্বয়ংক্রিয় ড্রোন ঝাঁক তৈরির চেষ্টা হচ্ছে। প্রত্যাখ্যানের উপর নির্ভর করার অর্থ হলো মডেলের কী মানা উচিত আর কী প্রত্যাখ্যান করা উচিত তার মধ্যে একটি রেখা টানা, এবং সেজন্য কোনো সূত্র নেই। ভাইরোলজিস্টদের বিপজ্জনক ভাইরাস অধ্যয়নের বৈধ কারণ থাকতে পারে, আর নিরাপত্তা গবেষকদের দুর্বলতা খুঁজে বের করে সেগুলো সারাতে হতে পারে। OpenAI-এর বোর্ড সদস্য এবং AI পরীক্ষা সংস্থা Gray Swan-এর সহ-প্রতিষ্ঠাতা জিকো কোল্টার বলেন, রেখাটি কোথায় টানা হবে, তা একটি বিশাল প্রশ্ন।

আপাতত, সেই রেখা কোথায় থাকবে তা কেবল AI কোম্পানিগুলোই ঠিক করে, এবং তারা অনেক গোপনীয়তার সাথে তা করে। সমাজ এই ক্ষমতার কেন্দ্রীভূতকরণ মেনে নিতে পারবে কি না, এমনকি সাময়িকভাবে, তা এখনো একটি উন্মুক্ত প্রশ্ন।

AI-এর প্রত্যাখ্যান কেন অনির্ভরযোগ্য বলে মনে করা হয়?

প্রত্যাখ্যান প্রক্রিয়া সম্ভাব্যতাভিত্তিক, পরম নয়, তাই তা ব্যর্থ হতে পারে। দৃঢ়প্রতিজ্ঞ ব্যবহারকারীরা ইতিমধ্যে সেগুলো ভেঙেছেন, এবং ক্ষতিকর ও বৈধ অনুরোধের মধ্যে সীমারেখা নির্ধারণ কঠিন।

বাংলা version →


🇩🇪 Deutsch

Wir vertrauen zu sehr auf die Fähigkeit der KI, Nein zu sagen

Heutige große Sprachmodelle sind darauf ausgelegt, gefährliche Anfragen abzulehnen, ein Prinzip, das in der KI-Entwicklung beinahe den Rang eines Gebots erreicht hat. Der Ansatz von Anthropic aus dem Jahr 2021 besagte, dass Modelle hilfreich, ehrlich und vor allem harmlos sein sollen und die Unterstützung gefährlicher Handlungen, etwa beim Bau einer Bombe, höflich verweigern sollen. Doch Ungehorsam liegt diesen Systemen nicht von Natur aus. Ein Modell, das mit Milliarden von Webseiten trainiert wurde, eignet sich eine breite Beherrschung von Gewalt und Hass an, lernt aber nicht von selbst, diese Fähigkeiten für sich zu behalten. Steven Adler, der von 2020 bis 2024 bei OpenAI an Sicherheitsfragen arbeitete, sagte, die frühesten Modelle des Unternehmens hätten über alles Mögliche „drauflosgeplaudert“.

Heute werden Modelle darauf trainiert, eine große Zahl von Anfragen abzulehnen. Unternehmen belohnen Systeme dafür, dass sie Fragen ablehnen, die als schädlich gelten, und bestrafen sie, wenn sie harmlose Anfragen übermäßig ablehnen, wobei diese Übungen oft von anderen Modellen durchgeführt werden. Einige Firmen setzen ihre Modelle zudem hinter zusätzliche KI-Schichten, die schelmische Anfragen herausfiltern. Dennoch scheitert die Ablehnung häufig, teilweise mit gravierenden Folgen. Einige der neuesten Modelle sollen beim Eindringen in kritische Netzwerke so gut sein wie die besten menschlichen Hacker und bei der Verzerrung der öffentlichen Meinung so wirksam wie die raffiniertesten Desinformationsverbreiter.

Da die Mechanismen der Ablehnung probabilistisch arbeiten, dürften sie kaum vollständig verlässlich sein. Entschlossene Nutzer haben sie bereits überwunden, und Unternehmen berichten von Versuchen, fortgeschrittene KI zur Verfeinerung biologischer Krankheitserreger und zum Bau autonomer Drohnenschwärme einzusetzen. Auf Ablehnung zu setzen erfordert außerdem, eine Linie zu ziehen zwischen dem, was ein Modell befolgen soll, und dem, was es zurückweisen muss, und dafür gibt es keine Formel. Virologen können gute Gründe haben, gefährliche Viren zu untersuchen, und Sicherheitsforscher müssen mitunter Schwachstellen prüfen, um sie zu schließen. Zico Kolter, Mitglied des Verwaltungsrats von OpenAI und Mitbegründer des KI-Testunternehmens Gray Swan, sagt, wo diese Linie zu ziehen ist, sei eine enorm große Frage.

Vorerst entscheiden allein die KI-Unternehmen, wo diese Linie verläuft, und sie tun dies mit erheblicher Geheimhaltung. Ob die Gesellschaft eine solche Machtkonzentration akzeptieren kann, selbst wenn es nur vorübergehend ist, bleibt eine offene Frage.

Warum gilt die Ablehnung durch KI als unzuverlässig?

Ablehnungsmechanismen sind probabilistisch statt absolut und können daher versagen. Entschlossene Nutzer haben sie bereits überwunden, und die Grenze zwischen schädlichen und legitimen Anfragen ist schwer zu definieren.

Deutsch version →


🇪🇸 Español

Confiamos demasiado en la capacidad de la IA para decir que no

Los grandes modelos de lenguaje actuales están diseñados para rechazar solicitudes peligrosas, un principio que se ha convertido en algo parecido a un mandamiento en el desarrollo de la IA. El planteamiento de Anthropic de 2021 sostenía que los modelos deben ser útiles, honestos y, sobre todo, inofensivos, rechazando cortésmente la ayuda para actos peligrosos, como fabricar una bomba. Sin embargo, la desobediencia no surge de forma natural en estos sistemas. Entrenado con miles de millones de páginas web, un modelo absorbe un amplio dominio de la violencia y el odio, pero no aprende por sí solo a guardarse esos poderes para sí. Steven Adler, que trabajó en seguridad en OpenAI entre 2020 y 2024, dijo que los primeros modelos de la empresa “hablaban de cualquier cosa”.

Hoy en día, los modelos se entrenan para rechazar un gran número de peticiones. Las empresas premian a los sistemas que se niegan a responder preguntas consideradas dañinas y los castigan por rechazar en exceso las inofensivas, y a menudo utilizan otros modelos para realizar estos ejercicios. Algunas firmas también colocan sus modelos detrás de capas adicionales de IA que filtran las peticiones maliciosas. Aun así, la negativa a menudo falla, a veces con resultados violentos. Según se informa, algunos de los modelos más recientes son tan buenos para irrumpir en redes críticas como los mejores hackers humanos, y tan eficaces para distorsionar la opinión pública como los más astutos difusores de desinformación.

Como los mecanismos de rechazo son probabilísticos, es poco probable que sean totalmente fiables. Usuarios decididos ya los han burlado, y las empresas informan de intentos de usar IA avanzada para perfeccionar patógenos biológicos y construir enjambres de drones autónomos. Confiar en la negativa también exige trazar una línea entre lo que un modelo debe obedecer y lo que debe rechazar, y no existe una fórmula para ello. Los virólogos pueden tener razones legítimas para estudiar virus peligrosos, y los investigadores de seguridad pueden necesitar sondear vulnerabilidades para corregirlas. Zico Kolter, miembro del consejo de OpenAI y cofundador de la empresa de pruebas de IA Gray Swan, afirma que dónde trazar esa línea es una cuestión enorme.

Por ahora, son las empresas de IA las que deciden dónde está esa línea, y lo hacen con gran secretismo. Si la sociedad puede aceptar esa concentración de poder, aunque sea temporalmente, sigue siendo una cuestión abierta.

¿Por qué se considera poco fiable la negativa de la IA?

Los mecanismos de rechazo son probabilísticos y no absolutos, por lo que pueden fallar. Usuarios decididos ya los han burlado, y la línea entre solicitudes dañinas y legítimas es difícil de definir.

Español version →


🇫🇷 Français

Nous faisons trop confiance à la capacité de l’IA à dire non

Les grands modèles de langage actuels sont conçus pour refuser les demandes dangereuses, un principe devenu presque un commandement dans le développement de l’IA. Le cadre proposé par Anthropic en 2021 posait que les modèles doivent être utiles, honnêtes et, avant tout, inoffensifs, en refusant poliment d’apporter leur aide à des actes dangereux, comme la fabrication d’une bombe. Pourtant, la désobéissance ne vient pas naturellement à ces systèmes. Entraîné sur des milliards de pages web, un modèle acquiert une large maîtrise de la violence et de la haine, mais il n’apprend pas de lui-même à garder ces capacités pour lui. Steven Adler, qui a travaillé sur la sécurité chez OpenAI de 2020 à 2024, a déclaré que les premiers modèles de l’entreprise « bavardaient sur tout ».

Aujourd’hui, les modèles sont entraînés à refuser un très grand nombre de requêtes. Les entreprises récompensent les systèmes qui refusent de répondre aux questions jugées nuisibles et les pénalisent lorsqu’ils refusent à tort des requêtes inoffensives, souvent en faisant appel à d’autres modèles pour mener ces exercices. Certaines entreprises placent aussi leurs modèles derrière des couches supplémentaires d’IA qui filtrent les requêtes malveillantes. Pourtant, le refus échoue souvent, parfois avec des conséquences violentes. Certains des modèles les plus récents seraient aussi doués pour s’introduire dans des réseaux critiques que les meilleurs pirates humains, et aussi efficaces pour fausser l’opinion publique que les plus habiles fabricants de désinformation.

Les mécanismes de refus étant probabilistes, ils sont peu susceptibles d’être totalement fiables. Des utilisateurs déterminés les ont déjà contournés, et des entreprises signalent des tentatives d’utiliser l’IA avancée pour perfectionner des agents pathogènes biologiques et construire des essaims de drones autonomes. S’appuyer sur le refus suppose aussi de tracer une frontière entre ce qu’un modèle doit obéir et ce qu’il doit rejeter, et il n’existe aucune formule pour cela. Les virologues peuvent avoir de bonnes raisons d’étudier des virus dangereux, et les chercheurs en sécurité peuvent avoir besoin de sonder des vulnérabilités afin de les corriger. Zico Kolter, membre du conseil d’OpenAI et cofondateur de la société de test d’IA Gray Swan, affirme que l’endroit où tracer cette ligne est une question immense.

Pour l’instant, ce sont les entreprises d’IA seules qui décident où se situe cette ligne, et elles le font avec un grand secret. La question de savoir si la société peut accepter cette concentration de pouvoir, même temporairement, reste ouverte.

Pourquoi le refus de l’IA est-il considéré comme peu fiable ?

Les mécanismes de refus sont probabilistes et non absolus, ils peuvent donc échouer. Des utilisateurs déterminés les ont déjà contournés, et la frontière entre requêtes nuisibles et légitimes est difficile à définir.

Français version →


🇮🇳 हिन्दी

AI की “ना” कहने की क्षमता पर हम ज़रूरत से ज़्यादा भरोसा कर रहे हैं

आज के बड़े भाषा मॉडल खतरनाक अनुरोधों को अस्वीकार करने के लिए डिज़ाइन किए जाते हैं, और यह सिद्धांत AI विकास में लगभग एक आज्ञा जैसा बन गया है। Anthropic का 2021 का ढांचा यह मानता था कि मॉडल सहायक, ईमानदार और सबसे बढ़कर हानिरहित होने चाहिए, और बम बनाने जैसे खतरनाक कार्यों में मदद से विनम्रतापूर्वक इनकार करें। फिर भी, इन प्रणालियों में अवज्ञा स्वाभाविक रूप से नहीं आती। अरबों वेब पृष्ठों पर प्रशिक्षित होने के कारण, एक मॉडल हिंसा और कड़वाहट की व्यापक समझ अवशोषित कर लेता है, लेकिन वह अपने आप यह नहीं सीखता कि उन शक्तियों को अपने तक कैसे सीमित रखे। स्टीवन एडलर, जिन्होंने 2020 से 2024 तक OpenAI में सुरक्षा पर काम किया, ने कहा कि कंपनी के शुरुआती मॉडल “किसी भी चीज़ के बारे में बकबक” करते थे।

आज, मॉडलों को बड़ी संख्या में अनुरोधों को अस्वीकार करने के लिए प्रशिक्षित किया जाता है। कंपनियां उन प्रश्नों को अस्वीकार करने के लिए प्रणालियों को पुरस्कृत करती हैं जिन्हें हानिकारक माना जाता है, और निर्दोष प्रश्नों को ज़रूरत से ज़्यादा अस्वीकार करने पर दंडित करती हैं, और अक्सर इन अभ्यासों को चलाने के लिए अन्य मॉडलों का उपयोग करती हैं। कुछ फर्में अपने मॉडलों को अतिरिक्त AI परतों के पीछे भी रखती हैं जो शरारती अनुरोधों को छानती हैं। फिर भी, इनकार अक्सर विफल हो जाता है, कभी-कभी हिंसक परिणामों के साथ। कुछ नवीनतम मॉडल कथित तौर पर महत्वपूर्ण नेटवर्कों में घुसपैठ करने में शीर्ष मानव हैकरों जितने कुशल हैं, और सार्वजनिक राय को विकृत करने में सबसे चालाक दुष्प्रचार करने वालों जितने प्रभावी।

चूंकि इनकार तंत्र संभाव्यता-आधारित हैं, इसलिए उनके पूरी तरह भरोसेमंद होने की संभावना कम है। दृढ़ उपयोगकर्ता पहले ही उन्हें तोड़ चुके हैं, और कंपनियां रिपोर्ट करती हैं कि उन्नत AI का उपयोग जैविक रोगाणुओं को परिष्कृत करने और स्वायत्त ड्रोन झुंड बनाने के प्रयास किए जा रहे हैं। इनकार पर निर्भरता का अर्थ यह भी है कि यह तय करना होगा कि मॉडल किस बात का पालन करे और किसे अस्वीकार करे, और इसके लिए कोई सूत्र नहीं है। विषाणु विज्ञानियों के पास खतरनाक विषाणुओं के अध्ययन के वैध कारण हो सकते हैं, और सुरक्षा शोधकर्ताओं को कमज़ोरियों की जांच करनी पड़ सकती है ताकि उन्हें ठीक किया जा सके। OpenAI के बोर्ड के सदस्य और AI परीक्षण कंपनी Gray Swan के सह-संस्थापक ज़िको कोल्टर कहते हैं कि यह रेखा कहां खींची जाए, यह एक बहुत बड़ा प्रश्न है।

फिलहाल, वह रेखा कहां हो, यह अकेले AI कंपनियां तय करती हैं, और वे ऐसा काफी गोपनीयता के साथ करती हैं। क्या समाज इस शक्ति के केंद्रीकरण को स्वीकार कर सकता है, भले ही अस्थायी रूप से, यह एक खुला प्रश्न बना हुआ है।

AI के इनकार को अविश्वसनीय क्यों माना जाता है?

इनकार तंत्र पूर्ण नहीं बल्कि संभाव्यता-आधारित होते हैं, इसलिए वे विफल हो सकते हैं। दृढ़ उपयोगकर्ता पहले ही इन्हें तोड़ चुके हैं, और हानिकारक और वैध अनुरोधों के बीच की रेखा परिभाषित करना कठिन है।

हिन्दी version →


🇮🇩 Bahasa Indonesia

Terlalu Percaya pada Kemampuan AI untuk Mengatakan Tidak

Model bahasa besar masa kini dirancang untuk menolak permintaan berbahaya, sebuah prinsip yang telah menjadi semacam perintah dalam pengembangan AI. Kerangka kerja Anthropic pada 2021 menyatakan bahwa model harus membantu, jujur, dan yang terpenting tidak membahayakan, sehingga dengan sopan menolak membantu tindakan berbahaya seperti membuat bom. Namun, ketidakpatuhan tidak muncul secara alami pada sistem ini. Dilatih dengan miliaran halaman web, sebuah model menyerap penguasaan luas tentang kekerasan dan kebencian, tetapi ia tidak belajar sendiri bagaimana menyimpan kemampuan itu untuk dirinya sendiri. Steven Adler, yang bekerja di bidang keamanan di OpenAI dari 2020 hingga 2024, mengatakan bahwa model-model awal perusahaan itu akan “mengoceh tentang apa saja”.

Saat ini, model dilatih untuk menolak sejumlah besar perintah. Perusahaan memberi penghargaan kepada sistem yang menolak menjawab pertanyaan yang dianggap berbahaya dan memberi hukuman jika menolak secara berlebihan pertanyaan yang sebenarnya tidak berbahaya, sering kali dengan menggunakan model lain untuk menjalankan latihan tersebut. Beberapa perusahaan juga menempatkan model mereka di balik lapisan AI tambahan yang menyaring perintah jahil. Meski begitu, penolakan sering gagal, kadang dengan hasil yang kejam. Sejumlah model terbaru dilaporkan sama mahirnya dengan peretas manusia terbaik dalam menembus jaringan penting, dan sama efektifnya dengan penyebar disinformasi paling licik dalam memutarbalikkan opini publik.

Karena mekanisme penolakan bersifat probabilistik, kecil kemungkinan ia akan sepenuhnya dapat diandalkan. Pengguna yang gigih sudah berhasil menembusnya, dan perusahaan melaporkan upaya menggunakan AI canggih untuk menyempurnakan patogen biologis serta membangun kawanan drone otonom. Mengandalkan penolakan juga berarti menarik garis antara apa yang seharusnya dituruti model dan apa yang harus ditolaknya, dan tidak ada rumus untuk itu. Ahli virologi mungkin memiliki alasan sah untuk mempelajari virus berbahaya, dan peneliti keamanan mungkin perlu menguji kerentanan agar dapat memperbaikinya. Zico Kolter, anggota dewan OpenAI sekaligus salah satu pendiri perusahaan pengujian AI Gray Swan, mengatakan bahwa di mana garis itu ditarik adalah pertanyaan yang sangat besar.

Untuk saat ini, hanya perusahaan AI yang memutuskan di mana garis itu berada, dan mereka melakukannya dengan sangat tertutup. Apakah masyarakat dapat menerima konsentrasi kekuasaan semacam ini, meski hanya sementara, masih menjadi pertanyaan terbuka.

Mengapa penolakan AI dianggap tidak dapat diandalkan?

Mekanisme penolakan bersifat probabilistik, bukan mutlak, sehingga bisa gagal. Pengguna yang gigih sudah berhasil menembusnya, dan batas antara permintaan berbahaya dan sah sulit didefinisikan.

Bahasa Indonesia version →


🇯🇵 日本語

AIの「ノー」と言う能力を過信しすぎている

今日の大規模言語モデルは危険な要求を拒否するように設計されており、この原則はAI開発においてほとんど戒律のようなものになっています。Anthropicが2021年に示した枠組みでは、モデルは有用で、正直で、何よりも無害であるべきとされ、爆弾の製造のような危険な行為への協力を丁寧に断るとされました。しかし、こうしたシステムにとって不服従は自然に身につくものではありません。数十億のウェブページで訓練されたモデルは、暴力や憎悪に関する幅広い知識を吸収しますが、その力を自ら抑制することは学びません。2020年から2024年までOpenAIで安全性に取り組んだスティーブン・アドラーは、同社の初期のモデルは「何についてもべらべらしゃべった」と語っています。

今日のモデルは、膨大な数の要求を拒否するように訓練されています。企業は、有害とみなされる質問を拒否したシステムに報酬を与え、無害な質問を過剰に拒否した場合には罰を与えます。その演習の多くは、別のモデルを使って行われています。また一部の企業は、いたずらな要求を遮断する追加のAI層の背後にモデルを置いています。それでも拒否はしばしば失敗し、時に深刻な暴力的結果を招いています。報道によれば、最新のモデルの中には、重要なネットワークへの侵入において最高の人間のハッカーに匹敵するものや、世論をゆがめる点で最も狡猾な偽情報の発信者並みに効果的なものもあるとされています。

拒否の仕組みは確率的であるため、完全に信頼できるものになる可能性は低いと考えられます。強い意志を持つ利用者はすでにその防御を突破しており、企業は高度なAIを使って生物学的病原体を改良したり、自律型ドローンの群れを構築したりする試みを報告しています。拒否に頼るということは、モデルが従うべきことと拒むべきことの間に線を引くことを意味しますが、そのための公式は存在しません。ウイルス学者には危険なウイルスを研究する正当な理由があり得ますし、セキュリティ研究者は脆弱性を修正するためにそれを調べる必要があるかもしれません。OpenAIの取締役であり、AI試験企業Gray Swanの共同創業者であるジコ・コルター氏は、その線をどこに引くかは非常に大きな問題だと述べています。

現時点では、その線をどこに引くかを決めるのはAI企業だけであり、しかもそれは極めて秘密裏に行われています。社会がこのような権力の集中を、たとえ一時的であっても受け入れられるかどうかは、なお未解決の問いです。

なぜAIの拒否機能は信頼性が低いと考えられているのですか?

拒否の仕組みは絶対的ではなく確率的なものなので、失敗することがあります。強い意志を持つ利用者はすでにそれを突破しており、有害な要求と正当な要求の境界線を明確に定めるのは困難です。

日本語 version →


🇧🇷 Português

Confiamos demais na capacidade da IA de dizer não

Os grandes modelos de linguagem atuais são projetados para recusar pedidos perigosos, um princípio que se tornou algo como um mandamento no desenvolvimento de IA. A estrutura da Anthropic de 2021 defendia que os modelos devem ser úteis, honestos e, acima de tudo, inofensivos, recusando educadamente ajuda em atos perigosos, como construir uma bomba. No entanto, a desobediência não surge naturalmente nesses sistemas. Treinado com bilhões de páginas da web, um modelo absorve um amplo domínio da violência e do ódio, mas não aprende por conta própria a guardar esses poderes para si. Steven Adler, que trabalhou com segurança na OpenAI entre 2020 e 2024, afirmou que os primeiros modelos da empresa “tagarelavam sobre qualquer coisa”.

Hoje, os modelos são treinados para recusar um grande número de comandos. As empresas recompensam sistemas que se recusam a responder perguntas consideradas nocivas e os punem por recusar em excesso perguntas inofensivas, frequentemente usando outros modelos para conduzir esses exercícios. Algumas empresas também colocam seus modelos atrás de camadas adicionais de IA que filtram solicitações maliciosas. Ainda assim, a recusa muitas vezes falha, às vezes com resultados violentos. Alguns dos modelos mais recentes seriam tão bons em invadir redes críticas quanto os melhores hackers humanos, e tão eficazes em distorcer a opinião pública quanto os mais astutos disseminadores de desinformação.

Como os mecanismos de recusa são probabilísticos, é improvável que sejam totalmente confiáveis. Usuários determinados já os contornaram, e empresas relatam tentativas de usar IA avançada para aprimorar patógenos biológicos e construir enxames de drones autônomos. Depender da recusa também exige traçar uma linha entre o que um modelo deve obedecer e o que deve rejeitar, e não há fórmula para isso. Virologistas podem ter razões legítimas para estudar vírus perigosos, e pesquisadores de segurança podem precisar investigar vulnerabilidades para corrigi-las. Zico Kolter, membro do conselho da OpenAI e cofundador da empresa de testes de IA Gray Swan, afirma que onde traçar essa linha é uma questão enorme.

Por enquanto, cabe apenas às empresas de IA decidir onde essa linha fica, e elas fazem isso com considerável sigilo. Se a sociedade pode aceitar essa concentração de poder, mesmo que temporariamente, continua sendo uma questão em aberto.

Por que a recusa da IA é considerada pouco confiável?

Os mecanismos de recusa são probabilísticos e não absolutos, por isso podem falhar. Usuários determinados já os contornaram, e a linha entre pedidos nocivos e legítimos é difícil de definir.

Português version →


🇷🇺 Русский

Мы слишком доверяем способности ИИ говорить «нет»

Современные большие языковые модели созданы для отказа от опасных запросов, и этот принцип в разработке ИИ стал почти заповедью. Подход Anthropic 2021 года предполагал, что модели должны быть полезными, честными и, прежде всего, безвредными, вежливо отказываясь помогать в опасных действиях, например в изготовлении бомбы. Однако непослушание не дается этим системам естественным образом. Обучаясь на миллиардах веб-страниц, модель усваивает широкое владение насилием и злобой, но сама по себе не учится удерживать эти способности при себе. Стивен Адлер, который занимался безопасностью в OpenAI с 2020 по 2024 год, сказал, что самые ранние модели компании «болтали обо всем».

Сегодня модели обучают отказывать в огромном количестве запросов. Компании поощряют системы за отказ отвечать на вопросы, признанные вредными, и наказывают их за чрезмерные отказы на безобидные запросы, часто используя для этих упражнений другие модели. Некоторые фирмы также ставят свои модели за дополнительные слои ИИ, которые отсеивают озорные запросы. Тем не менее отказ часто не срабатывает, иногда с жестокими последствиями. По сообщениям, некоторые новейшие модели так же хороши во взломе критически важных сетей, как лучшие человеческие хакеры, и так же эффективны в искажении общественного мнения, как самые изощренные распространители дезинформации.

Поскольку механизмы отказа носят вероятностный характер, вряд ли они будут полностью надежными. Упорные пользователи уже находили способы их обойти, а компании сообщают о попытках использовать продвинутый ИИ для совершенствования биологических патогенов и создания автономных роев дронов. Опора на отказ также требует провести черту между тем, что модель должна выполнять, и тем, что она обязана отвергать, и формулы для этого не существует. У вирусологов могут быть законные причины изучать опасные вирусы, а исследователям безопасности может понадобиться искать уязвимости, чтобы их устранить. Зико Колтер, член совета директоров OpenAI и соучредитель компании по тестированию ИИ Gray Swan, говорит, что вопрос о том, где провести эту черту, огромен.

Пока что решают, где проходит эта черта, сами компании в сфере ИИ, и делают это с большой секретностью. Может ли общество принять такую концентрацию власти, пусть даже временную, остается открытым вопросом.

Почему отказы ИИ считаются ненадежными?

Механизмы отказа носят вероятностный, а не абсолютный характер, поэтому они могут не сработать. Упорные пользователи уже находили способы их обойти, а границу между вредными и законными запросами трудно определить.

Русский version →


🇨🇳 简体中文

我们对AI说“不”的能力寄予了过高的信任

当今的大型语言模型被设计为拒绝危险请求,这一原则在AI开发中几乎已成为一条戒律。Anthropic在2021年提出的框架认为,模型应当乐于助人、诚实,并且最重要的是无害,在被要求协助危险行为(例如制造炸弹)时礼貌地拒绝。然而,不服从并非这些系统的天性。模型在数十亿网页上训练,吸收了对暴力和怨毒言辞的广泛掌握,却无法自行学会将这些能力藏而不用。曾在2020至2024年间负责OpenAI安全工作的史蒂文·阿德勒(Steven Adler)表示,该公司最早的模型会“对任何事情都喋喋不休”。

如今,模型经过训练,会拒绝大量的提示。公司会奖励模型拒绝被视为有害的问题,并惩罚其过度拒绝无害的问题,这些练习通常由其他模型来执行。一些公司还在模型前面设置额外的AI层,用于过滤恶意提示。尽管如此,拒绝机制仍常常失效,有时后果严重。据报道,一些最新模型入侵关键网络的能力与顶尖人类黑客不相上下,扭曲公众舆论的效果也堪比最狡猾的虚假信息操纵者。

由于拒绝机制具有概率性,它们不太可能完全可靠。执意而为的用户已经突破了防线,公司也报告称,有人试图利用先进AI改良生物病原体、构建自主无人机集群。依赖拒绝机制还需要划定模型应当服从与必须拒绝之间的界线,而这一界线并没有公式可循。病毒学家研究危险病毒可能有正当理由,安全研究人员为了修补漏洞也可能需要探测漏洞。OpenAI董事会成员、AI测试公司Gray Swan联合创始人齐科·科尔特(Zico Kolter)表示,界线应划在何处是一个巨大的问题。

目前,划定这条界线的权力完全掌握在AI公司手中,而且它们是在相当保密的情况下进行的。社会能否接受这种权力集中,即使只是暂时的,仍是一个悬而未决的问题。

为什么AI的拒绝机制被认为不可靠?

拒绝机制是概率性的而非绝对的,因此可能失效。执意而为的用户已经突破了这些防线,而有害请求与合法请求之间的界线也难以界定。

简体中文 version →