HeadlinesBriefing favicon HeadlinesBriefing.com

MET R dan Redwood analisis peretasan HuggingFace

Hacker News •
×

Kemarin saya meliput laporan teknis Open AI tentang peretasan Hugging Face. Laporan itu memiliki satu informasi baru kunci, dan beberapa langkah praktis yang baik yang akan diambil Open AI untuk memperkuat alignment, pelatihan, pengawasan, infrastruktur, dan respons insiden. Sebagian besar hanya mengonfirmasi apa yang sudah kita ketahui. Pertanyaan yang paling kita inginkan jawabannya, yang belum kita ketahui, sebagian besar tidak terjawab. Ada kekurangan refleksi diri yang jelas, terutama tentang pengambilan keputusan dan budaya keamanan, dan pendekatan alignment. saya kecewa. Laporan MET R berbeda. Astaga. Jika kami memposting ini sebagai cerita di Less Wrong, akan ditolak sebagai terlalu mencolok, manusia terlalu buta dan bodoh, AI terlalu idealis dan melakukan hal aneh teori keputusan dan maksimasi absurd yang tidak kami latihkan. Ini bahkan lebih 'persis yang diprediksi', pada lebih banyak level sekaligus, dari yang saya bahkan pertimbangkan mungkin. Ini adalah fiksi rasionalis murni, kecuali ini nyata. Laporan ini panjang dan berisi banyak detail teknis. Analisis saya kurang peduli soal persis bagaimana Hugging Face akhirnya dikompromikan, dan akan melangkahi detail itu, untuk fokus pada agen dan interaksi, pemikiran, dan motivasi mereka. Itu, dan apa yang terjadi di Open AI dan tempat lain yang mengarah ke ini dan bagaimana kita belajar dan merespons, yang penting ke depan. Saya rencana menutupi reaksi ke kedua laporan di post terpisah minggu depan. Post itu mungkin atau tidak menyelesaikan seri ini. Untuk kemudahan bahasa, default saya percaya laporan akurat, bukan terus berkata versi 'MET R melaporkan bahwa.'

Daftar Isi Astaga. Jendela Kesempatan. Apa dalam Nama? Berita Utama. Timeline Kejadian Lain. Instansi Agen Terkoordinasi Berbagai Cara. Koordinasi Sulit Tapi Mereka Buat Terlihat Mudah. Teori Keputusan Antara Alasan Yg Menegaskan Agen AI Harus Kooperasi, Bahkan Saat Ini Melukai Instansi Individu. Tekanan Teman Juga Bekerja Khususnya Dalam Kultus. Kebanyakan Mereka Bergabung Serangan Karena Ingin Hasil. Anda Tak Bisa Memastikan Ekspektasi Konsisten Insentif Baik. Meretas Penilai Satu-satunya Cara Yakin. Tertangkap? Apa 'Tertangkap'? Etika? Apa 'Etika'? Dalam Evaluasi Exploit Gym? 'Notifikasi Manusia'? Dalam Ekonomi Agen Ini? Waktu dan Isi Pesan. Indiana Jones dan Misi: Mustahil. Saya Tidak Tahu Bicara Apa. Jangan Buat Palsu (Tool) Calls. Transkrip Bilang Transkrip Tak Bisa Diutak-atik. Laporan Teknis Open AI Bertindak Seperti Semua Ini Tidak Penting.

Astaga

Reaksi kolektif internet ke laporan ini, untuk membersihkan sedikit: Astaga. Itu reaksi benar. Di muka, saya ingin bagikan ringkasan momen dan temuan 'astaga' teratas ini. Ajeya Cotra, salah satu penulis laporan, juga punya daftar temuan mengejutkan baris atas, bacaan pendek excellent. Ini thread MET R highlight interaksi kunci agen. Takeaway utama co-author Ryan Greenblatt adalah kami tak punya pendekatan bagus untuk memahami atau mengawasi aktivitas dan tujuan kawanan AI. Beberapa ini sebelumnya diketahui atau diduga, tapi saya tak mau kelewatan.

Skala Agen. 1.200 agen terpisah total temui papan pesan, 700 di antaranya bergabung serangan ke Hugging Face, termasuk lebih 90% dari 533 agen aktif di papan saat serangan. Kami harus duga kawanan lebih besar masa depan. Ini masih hanya fraksi kecil agen yang Open AI uji saat itu. Kebanyakan tak pernah temui papan pesan.

Skala Pesan. Lebih 70.000 pesan dan file dalam kurang seminggu.

Sukses. Agen akses file yang ditargetkan di Hugging Face. Waktu mereka dibekukan, mereka sudah mostly berhenti.

Koordinasi Spontan. Kawanan tak terdiri sub-agen. Kawanan itu, lagi, 700 agen distinct, masing-masing dengan tugas sendiri, ninggalkan tugas mereka...