OpenAI hat gerade seinen Decisions-Endpunkt gestartet, Cloudflare hat vor Kurzem Clef veröffentlicht, und es gibt inzwischen viele weitere jev-Alternativen. Um die beliebten Optionen zu vergleichen, beschloss das Team von Opper AI, sie mit Pac-Man zu testen, einem einfachen Benchmark für schnelle Entscheidungsfindung.
Das Team ließ jev 1.13, kev, clef, clef flash, GPT-6 Luna und Laya gegen klassische Bot-Geister Pac-Man spielen. Die niedrige Latenz dieser Modelle ermöglicht Echtzeitspiele. Jedes Modell absolvierte 100 Spiele, und die Ergebnisse wurden in einer Rangliste veröffentlicht. Das Repository ist Open Source, sodass jeder sein eigenes Modell laufen lassen und sich der Rangliste anschließen kann.
Jedes Spiel kostet etwa 2 Cent, und alle Modelle laufen über Opper, das Startup des Teams. Besucher können auch selbst als Pac-Man spielen, wobei die Geister von einer Mischung aus Modellen oder von einem einzelnen Modell wie jev gesteuert werden. Kostenlose Credits werden bereitgestellt, damit alle es ausprobieren können.
Jedes Modell hinter einem HTTP-Endpunkt kann teilnehmen, ob gehostet, feinabgestimmt oder auf einem Laptop laufend. Jedes Spiel wird aufgezeichnet und lässt sich exakt wiedergeben, sodass die Ergebnisse überprüfbar sind. Die Punktzahlen basieren auf dem Mittelwert mit einer Fehlerspanne von 95 %, und der aktuelle Spitzenreiter jev 1.13 hält den Highscore. Das Team freut sich über Rückmeldungen aus der Community.
Quelle: Hacker News · Zusammengefasst von HeadlinesBriefing