OpenAI vient de lancer son endpoint de décisions, Cloudflare a récemment publié Clef, et de nombreuses autres alternatives à jev sont désormais disponibles. Pour comparer les options les plus populaires, l'équipe d'Opper AI a décidé de les tester avec Pac-Man, un benchmark simple pour la prise de décision rapide.
L'équipe a fait jouer jev 1.13, kev, clef, clef flash, GPT-6 Luna et Laya à Pac-Man contre des fantômes robots classiques. La faible latence de ces modèles permet un jeu en temps réel. Chaque modèle a joué 100 parties, et les résultats ont été publiés dans un classement. Le dépôt est open source, de sorte que chacun peut exécuter son propre modèle et rejoindre le classement.
Chaque partie coûte environ 2 centimes, et tous les modèles fonctionnent via Opper, la startup de l'équipe. Les visiteurs peuvent aussi jouer eux-mêmes Pac-Man, les fantômes étant contrôlés par un mélange de modèles ou par un seul modèle comme jev. Des crédits gratuits sont proposés pour que chacun puisse essayer.
Tout modèle derrière un endpoint HTTP peut participer, qu'il soit hébergé, affiné ou exécuté sur un ordinateur portable. Chaque partie est enregistrée et peut être rejouée à l'identique, ce qui permet de vérifier les résultats. Les scores utilisent la moyenne avec une marge d'erreur de 95 %, et le leader actuel, jev 1.13, détient le meilleur score. L'équipe sollicite les retours de la communauté.
Source: Hacker News · Résumé par HeadlinesBriefing