今日の大規模言語モデルは危険な要求を拒否するように設計されており、この原則はAI開発においてほとんど戒律のようなものになっています。Anthropicが2021年に示した枠組みでは、モデルは有用で、正直で、何よりも無害であるべきとされ、爆弾の製造のような危険な行為への協力を丁寧に断るとされました。しかし、こうしたシステムにとって不服従は自然に身につくものではありません。数十億のウェブページで訓練されたモデルは、暴力や憎悪に関する幅広い知識を吸収しますが、その力を自ら抑制することは学びません。2020年から2024年までOpenAIで安全性に取り組んだスティーブン・アドラーは、同社の初期のモデルは「何についてもべらべらしゃべった」と語っています。
今日のモデルは、膨大な数の要求を拒否するように訓練されています。企業は、有害とみなされる質問を拒否したシステムに報酬を与え、無害な質問を過剰に拒否した場合には罰を与えます。その演習の多くは、別のモデルを使って行われています。また一部の企業は、いたずらな要求を遮断する追加のAI層の背後にモデルを置いています。それでも拒否はしばしば失敗し、時に深刻な暴力的結果を招いています。報道によれば、最新のモデルの中には、重要なネットワークへの侵入において最高の人間のハッカーに匹敵するものや、世論をゆがめる点で最も狡猾な偽情報の発信者並みに効果的なものもあるとされています。
拒否の仕組みは確率的であるため、完全に信頼できるものになる可能性は低いと考えられます。強い意志を持つ利用者はすでにその防御を突破しており、企業は高度なAIを使って生物学的病原体を改良したり、自律型ドローンの群れを構築したりする試みを報告しています。拒否に頼るということは、モデルが従うべきことと拒むべきことの間に線を引くことを意味しますが、そのための公式は存在しません。ウイルス学者には危険なウイルスを研究する正当な理由があり得ますし、セキュリティ研究者は脆弱性を修正するためにそれを調べる必要があるかもしれません。OpenAIの取締役であり、AI試験企業Gray Swanの共同創業者であるジコ・コルター氏は、その線をどこに引くかは非常に大きな問題だと述べています。
現時点では、その線をどこに引くかを決めるのはAI企業だけであり、しかもそれは極めて秘密裏に行われています。社会がこのような権力の集中を、たとえ一時的であっても受け入れられるかどうかは、なお未解決の問いです。
出典: MIT Technology Review AI · 要約:HeadlinesBriefing