OpenAI baru saja meluncurkan endpoint keputusannya, dan Cloudflare baru-baru ini merilis Clef, dengan semakin banyak alternatif jev yang tersedia. Untuk membandingkan opsi populer, tim Opper AI memutuskan mengujinya dengan Pac-Man, benchmark sederhana untuk pengambilan keputusan yang cepat.
Tim membiarkan jev 1.13, kev, clef, clef flash, GPT-6 Luna, dan Laya bermain Pac-Man melawan hantu bot klasik. Latensi rendah dari model-model ini memungkinkan permainan real-time. Setiap model memainkan 100 permainan, dan hasilnya dipublikasikan di papan peringkat. Repositorinya bersifat open source, sehingga siapa pun dapat menjalankan model mereka sendiri dan bergabung dalam peringkat.
Setiap permainan berbiaya sekitar 2 sen, dan semua model berjalan melalui Opper, startup milik tim. Pengunjung juga dapat bermain sebagai Pac-Man sendiri, dengan hantu dikendalikan oleh campuran model atau oleh satu model seperti jev. Kredit gratis disediakan agar semua orang bisa mencobanya.
Setiap model di balik endpoint HTTP dapat berpartisipasi, baik yang di-host, di-fine-tune, maupun yang berjalan di laptop. Setiap permainan direkam dan dapat diputar ulang secara tepat, sehingga hasilnya dapat diverifikasi. Skor menggunakan rata-rata dengan margin kesalahan 95%, dan pemimpin saat ini, jev 1.13, memegang skor tertinggi. Tim meminta masukan dari komunitas.
Sumber: Hacker News · Diringkas oleh HeadlinesBriefing