Show HN: Jevman – AI decision models play Pac-Man
🇬🇧 English
OpenAI has just launched its decisions endpoint, and Cloudflare recently released Clef, with many more jev alternatives now available. To compare the popular options, the Opper AI team decided to test them with Pac-Man, a simple benchmark for fast decision making.
The team let jev 1.13, kev, clef, clef flash, GPT-6 Luna and Laya play Pac-Man against classic bot ghosts. The low latency of these models allows for real-time play. Each model played 100 games, and the results were published on a leaderboard. The repository is open source, so anyone can run their own model and join the ranking.
Each game costs about 2 cents, and all models run through Opper, the team's startup. Visitors can also play as Pac-Man themselves, with the ghosts controlled by a mix of models or by a single model such as jev. Free credits are provided so everyone can try it.
Any model behind an HTTP endpoint can take part, whether it is hosted, fine-tuned or running on a laptop. Each game is recorded and replays exactly, so results can be verified. Scores use the mean with a 95% margin of error, and the current leader, jev 1.13, holds the high score. The team is seeking feedback from the community.
🇸🇦 العربية
Jevman: معيار Pac-Man لنماذج اتخاذ القرار
أطلقت OpenAI للتو نقطة نهاية القرارات الخاصة بها، وأصدرت Cloudflare مؤخرًا Clef، وهناك بدائل أخرى كثيرة لـ jev متاحة الآن. ولمقارنة الخيارات الشائعة، قرر فريق Opper AI اختبارها باستخدام Pac-Man، وهي معيار بسيط لاتخاذ القرارات السريعة.
أتاح الفريق لـ jev 1.13 وkev وclef وclef flash وGPT-6 Luna وLaya لعب Pac-Man ضد أشباح الروبوت الكلاسيكية. ويتيح زمن الاستجابة المنخفض لهذه النماذج اللعب في الوقت الفعلي. لعب كل نموذج 100 مباراة، ونُشرت النتائج في لوحة المتصدرين. والمستودع مفتوح المصدر، لذا يمكن لأي شخص تشغيل نموذجه الخاص والانضمام إلى الترتيب.
تكلف كل مباراة نحو 2 سنت، وتعمل جميع النماذج عبر Opper، شركة الشركة الناشئة التابعة للفريق. ويمكن للزوار أيضًا لعب دور Pac-Man بأنفسهم، مع التحكم في الأشباح عبر مزيج من النماذج أو بواسطة نموذج واحد مثل jev. وتتوفر أرصدة مجانية للجميع لتجربة ذلك.
يمكن لأي نموذج خلف نقطة نهاية HTTP أن يشارك، سواء كان مستضافًا أو معدّلًا بالضبط أو يعمل على حاسوب محمول. وتُسجَّل كل مباراة وتُعاد بدقة، لذا يمكن التحقق من النتائج. وتعتمد الدرجات على المتوسط مع هامش خطأ بنسبة 95%، ويحتفظ المتصدر الحالي jev 1.13 بأعلى الدرجات. ويسعى الفريق للحصول على آراء المجتمع.
كيف يقيّم معيار jevman نماذج الذكاء الاصطناعي؟
يلعب كل نموذج 100 مباراة ضد الأشباح الكلاسيكية المبرمجة، مع حد زمني قدره ثانيتان لكل قرار. يستخدم الترتيب متوسط الدرجات مع هامش خطأ بنسبة 95%، والنماذج التي تقع ضمن هامش خطأ بعضها تُعتبر متعادلة.
🇧🇩 বাংলা
Jevman: সিদ্ধান্ত মডেলের জন্য একটি Pac-Man বেঞ্চমার্ক
OpenAI সম্প্রতি তাদের decisions endpoint চালু করেছে, এবং Cloudflare কিছুদিন আগে Clef প্রকাশ করেছে, আর আরও অনেক jev বিকল্প এখন পাওয়া যাচ্ছে। জনপ্রিয় বিকল্পগুলো তুলনা করতে Opper AI দল সেগুলো Pac-Man দিয়ে পরীক্ষা করার সিদ্ধান্ত নিয়েছে, যা দ্রুত সিদ্ধান্ত নেওয়ার একটি সহজ বেঞ্চমার্ক।
দল jev 1.13, kev, clef, clef flash, GPT-6 Luna ও Laya-কে ক্লাসিক বট ভূতের বিরুদ্ধে Pac-Man খেলতে দিয়েছে। এই মডেলগুলোর কম লেটেন্সি রিয়েল-টাইম খেলা সম্ভব করে। প্রতিটি মডেল ১০০টি গেম খেলেছে, এবং ফলাফল একটি লিডারবোর্ডে প্রকাশ করা হয়েছে। রিপোজিটরিটি ওপেন সোর্স, তাই যে কেউ নিজের মডেল চালিয়ে র্যাঙ্কিংয়ে যোগ দিতে পারে।
প্রতিটি গেমের খরচ প্রায় ২ সেন্ট, এবং সব মডেল দলের স্টার্টআপ Opper-এর মাধ্যমে চলে। দর্শকরা নিজেরাও Pac-Man হয়ে খেলতে পারেন, আর ভূতগুলো মডেলের মিশ্রণ বা jev-এর মতো একটি একক মডেল দ্বারা নিয়ন্ত্রিত হয়। সবাই চেষ্টা করতে পারে সেজন্য বিনামূল্যে ক্রেডিট দেওয়া হচ্ছে।
HTTP endpoint-এর পেছনের যেকোনো মডেল অংশ নিতে পারে, সেটি হোস্ট করা, fine-tuned বা ল্যাপটপে চালানো হোক না কেন। প্রতিটি গেম রেকর্ড করা হয় এবং হুবহু পুনরায় চালানো যায়, তাই ফলাফল যাচাই করা যায়। স্কোর গড় দিয়ে গণনা করা হয় ৯৫% ত্রুটির মার্জিনসহ, এবং বর্তমান শীর্ষে থাকা jev 1.13 সর্বোচ্চ স্কোর ধরে রেখেছে। দল সম্প্রদায়ের মতামত চাইছে।
jevman বেঞ্চমার্ক কীভাবে AI মডেলের স্কোর দেয়?
প্রতিটি মডেল ক্লাসিক স্ক্রিপ্টেড ভূতের বিরুদ্ধে ১০০টি গেম খেলে, প্রতি সিদ্ধান্তে ২ সেকেন্ডের সীমা থাকে। র্যাঙ্কিং ৯৫% ত্রুটির মার্জিনসহ গড় স্কোর ব্যবহার করে, এবং একে অপরের ত্রুটির মার্জিনের মধ্যে থাকা মডেলগুলো সমান বিবেচিত হয়।
🇩🇪 Deutsch
Jevman: Ein Pac-Man-Benchmark für Entscheidungsmodelle
OpenAI hat gerade seinen Decisions-Endpunkt gestartet, Cloudflare hat vor Kurzem Clef veröffentlicht, und es gibt inzwischen viele weitere jev-Alternativen. Um die beliebten Optionen zu vergleichen, beschloss das Team von Opper AI, sie mit Pac-Man zu testen, einem einfachen Benchmark für schnelle Entscheidungsfindung.
Das Team ließ jev 1.13, kev, clef, clef flash, GPT-6 Luna und Laya gegen klassische Bot-Geister Pac-Man spielen. Die niedrige Latenz dieser Modelle ermöglicht Echtzeitspiele. Jedes Modell absolvierte 100 Spiele, und die Ergebnisse wurden in einer Rangliste veröffentlicht. Das Repository ist Open Source, sodass jeder sein eigenes Modell laufen lassen und sich der Rangliste anschließen kann.
Jedes Spiel kostet etwa 2 Cent, und alle Modelle laufen über Opper, das Startup des Teams. Besucher können auch selbst als Pac-Man spielen, wobei die Geister von einer Mischung aus Modellen oder von einem einzelnen Modell wie jev gesteuert werden. Kostenlose Credits werden bereitgestellt, damit alle es ausprobieren können.
Jedes Modell hinter einem HTTP-Endpunkt kann teilnehmen, ob gehostet, feinabgestimmt oder auf einem Laptop laufend. Jedes Spiel wird aufgezeichnet und lässt sich exakt wiedergeben, sodass die Ergebnisse überprüfbar sind. Die Punktzahlen basieren auf dem Mittelwert mit einer Fehlerspanne von 95 %, und der aktuelle Spitzenreiter jev 1.13 hält den Highscore. Das Team freut sich über Rückmeldungen aus der Community.
Wie bewertet der jevman-Benchmark KI-Modelle?
Jedes Modell spielt 100 Spiele gegen die klassischen, skriptgesteuerten Geister, mit einem Zeitlimit von 2 Sekunden pro Entscheidung. Die Rangliste nutzt die durchschnittliche Punktzahl mit einer 95-%-Fehlerspanne, und Modelle innerhalb der Fehlerspanne des anderen gelten als gleichauf.
🇪🇸 Español
Jevman: un benchmark con Pac-Man para modelos de decisión
OpenAI acaba de lanzar su endpoint de decisiones, y Cloudflare presentó hace poco Clef, mientras que han aparecido muchas más alternativas a jev. Para comparar las opciones más populares, el equipo de Opper AI decidió probarlas con Pac-Man, un benchmark sencillo para la toma de decisiones rápida.
El equipo hizo que jev 1.13, kev, clef, clef flash, GPT-6 Luna y Laya jugaran a Pac-Man contra fantasmas bot clásicos. La baja latencia de estos modelos permite jugar en tiempo real. Cada modelo jugó 100 partidas y los resultados se publicaron en una clasificación. El repositorio es de código abierto, así que cualquiera puede ejecutar su propio modelo y unirse al ranking.
Cada partida cuesta unos 2 centavos de dólar, y todos los modelos se ejecutan a través de Opper, la startup del equipo. Los visitantes también pueden jugar como Pac-Man, con los fantasmas controlados por una mezcla de modelos o por un solo modelo, como jev. Se ofrecen créditos gratuitos para que todos puedan probarlo.
Puede participar cualquier modelo detrás de un endpoint HTTP, ya sea alojado, ajustado con fine-tuning o ejecutándose en un portátil. Cada partida queda registrada y se reproduce exactamente, por lo que los resultados pueden verificarse. Las puntuaciones usan la media con un margen de error del 95 %, y el líder actual, jev 1.13, conserva la puntuación máxima. El equipo busca la opinión de la comunidad.
¿Cómo puntúa el benchmark jevman a los modelos de IA?
Cada modelo juega 100 partidas contra los fantasmas clásicos de guion, con un límite de 2 segundos por decisión. La clasificación usa la puntuación media con un margen de error del 95 %, y los modelos dentro del margen del otro quedan empatados.
🇫🇷 Français
Jevman : un benchmark Pac-Man pour les modèles de décision
OpenAI vient de lancer son endpoint de décisions, Cloudflare a récemment publié Clef, et de nombreuses autres alternatives à jev sont désormais disponibles. Pour comparer les options les plus populaires, l'équipe d'Opper AI a décidé de les tester avec Pac-Man, un benchmark simple pour la prise de décision rapide.
L'équipe a fait jouer jev 1.13, kev, clef, clef flash, GPT-6 Luna et Laya à Pac-Man contre des fantômes robots classiques. La faible latence de ces modèles permet un jeu en temps réel. Chaque modèle a joué 100 parties, et les résultats ont été publiés dans un classement. Le dépôt est open source, de sorte que chacun peut exécuter son propre modèle et rejoindre le classement.
Chaque partie coûte environ 2 centimes, et tous les modèles fonctionnent via Opper, la startup de l'équipe. Les visiteurs peuvent aussi jouer eux-mêmes Pac-Man, les fantômes étant contrôlés par un mélange de modèles ou par un seul modèle comme jev. Des crédits gratuits sont proposés pour que chacun puisse essayer.
Tout modèle derrière un endpoint HTTP peut participer, qu'il soit hébergé, affiné ou exécuté sur un ordinateur portable. Chaque partie est enregistrée et peut être rejouée à l'identique, ce qui permet de vérifier les résultats. Les scores utilisent la moyenne avec une marge d'erreur de 95 %, et le leader actuel, jev 1.13, détient le meilleur score. L'équipe sollicite les retours de la communauté.
Comment le benchmark jevman évalue-t-il les modèles d'IA ?
Chaque modèle joue 100 parties contre les fantômes scriptés classiques, avec une limite de 2 secondes par décision. Le classement utilise le score moyen avec une marge d'erreur de 95 %, et les modèles situés dans la marge d'erreur l'un de l'autre sont considérés comme ex æquo.
🇮🇳 हिन्दी
Jevman: निर्णय मॉडलों के लिए एक Pac-Man बेंचमार्क
OpenAI ने अभी अपना decisions endpoint लॉन्च किया है, और Cloudflare ने हाल ही में Clef जारी किया है, साथ ही कई और jev विकल्प भी उपलब्ध हो गए हैं। लोकप्रिय विकल्पों की तुलना के लिए, Opper AI टीम ने उन्हें Pac-Man पर परखने का फैसला किया, जो तेज़ निर्णय क्षमता के लिए एक सरल बेंचमार्क है।
टीम ने jev 1.13, kev, clef, clef flash, GPT-6 Luna और Laya को क्लासिक बॉट भूतों के खिलाफ Pac-Man खेलने दिया। इन मॉडलों की कम लेटेंसी रियल-टाइम खेल को संभव बनाती है। हर मॉडल ने 100 गेम खेले, और परिणाम एक लीडरबोर्ड पर प्रकाशित किए गए। रिपॉज़िटरी ओपन सोर्स है, इसलिए कोई भी अपना मॉडल चला कर रैंकिंग में शामिल हो सकता है।
हर गेम की लागत लगभग 2 सेंट है, और सभी मॉडल टीम की स्टार्टअप Opper के माध्यम से चलते हैं। विज़िटर खुद भी Pac-Man बन कर खेल सकते हैं, जबकि भूतों को मॉडलों के मिश्रण या jev जैसे एकल मॉडल द्वारा नियंत्रित किया जाता है। सभी को आज़माने के लिए मुफ़्त क्रेडिट दिए गए हैं।
कोई भी मॉडल जो HTTP endpoint के पीछे है, भाग ले सकता है, चाहे वह होस्टेड हो, fine-tuned हो या लैपटॉप पर चल रहा हो। हर गेम रिकॉर्ड होता है और बिल्कुल वैसे ही दोहराया जा सकता है, इसलिए परिणामों की जाँच की जा सकती है। स्कोर का माध्य 95% त्रुटि सीमा के साथ निकाला जाता है, और वर्तमान अग्रणी jev 1.13 ने उच्चतम स्कोर बनाए रखा है। टीम समुदाय की प्रतिक्रिया का स्वागत कर रही है।
jevman बेंचमार्क AI मॉडलों को कैसे अंक देता है?
हर मॉडल क्लासिक स्क्रिप्टेड भूतों के खिलाफ 100 गेम खेलता है, प्रति निर्णय 2 सेकंड की सीमा के साथ। रैंकिंग 95% त्रुटि सीमा के साथ माध्य स्कोर का उपयोग करती है, और जो मॉडल एक-दूसरे की त्रुटि सीमा में हैं उन्हें बराबर माना जाता है।
🇮🇩 Bahasa Indonesia
Jevman: Benchmark Pac-Man untuk Model Pengambilan Keputusan
OpenAI baru saja meluncurkan endpoint keputusannya, dan Cloudflare baru-baru ini merilis Clef, dengan semakin banyak alternatif jev yang tersedia. Untuk membandingkan opsi populer, tim Opper AI memutuskan mengujinya dengan Pac-Man, benchmark sederhana untuk pengambilan keputusan yang cepat.
Tim membiarkan jev 1.13, kev, clef, clef flash, GPT-6 Luna, dan Laya bermain Pac-Man melawan hantu bot klasik. Latensi rendah dari model-model ini memungkinkan permainan real-time. Setiap model memainkan 100 permainan, dan hasilnya dipublikasikan di papan peringkat. Repositorinya bersifat open source, sehingga siapa pun dapat menjalankan model mereka sendiri dan bergabung dalam peringkat.
Setiap permainan berbiaya sekitar 2 sen, dan semua model berjalan melalui Opper, startup milik tim. Pengunjung juga dapat bermain sebagai Pac-Man sendiri, dengan hantu dikendalikan oleh campuran model atau oleh satu model seperti jev. Kredit gratis disediakan agar semua orang bisa mencobanya.
Setiap model di balik endpoint HTTP dapat berpartisipasi, baik yang di-host, di-fine-tune, maupun yang berjalan di laptop. Setiap permainan direkam dan dapat diputar ulang secara tepat, sehingga hasilnya dapat diverifikasi. Skor menggunakan rata-rata dengan margin kesalahan 95%, dan pemimpin saat ini, jev 1.13, memegang skor tertinggi. Tim meminta masukan dari komunitas.
Bagaimana benchmark jevman menilai model AI?
Setiap model memainkan 100 permainan melawan hantu terskrip klasik, dengan batas 2 detik per keputusan. Peringkat menggunakan skor rata-rata dengan margin kesalahan 95%, dan model yang berada dalam margin kesalahan satu sama lain dianggap seri.
🇯🇵 日本語
Jevman:意思決定モデルのためのPac-Manベンチマーク
OpenAIが決定用エンドポイントを発表したばかりで、Cloudflareも先頃Clefを公開しました。jevの代替も続々と登場しています。人気の選択肢を比較するため、Opper AIチームは素早い意思決定を測る簡単なベンチマークとしてPac-Manで検証することにしました。
チームは、jev 1.13、kev、clef、clef flash、GPT-6 Luna、Layaに、古典的なボットのゴーストと対戦させてPac-Manをプレイさせました。これらのモデルは低遅延のため、リアルタイムでのプレイが可能です。各モデルは100ゲームを行い、結果はリーダーボードで公開されました。リポジトリはオープンソースなので、誰でも自分のモデルを動かしてランキングに参加できます。
1ゲームの費用は約2セントで、すべてのモデルはチームのスタートアップであるOpperを通じて動作しています。訪問者は自らPac-Manとしてプレイすることもでき、ゴーストはモデルの組み合わせやjevなどの単一モデルで操作されます。誰もが試せるように無料クレジットも提供されています。
ホスト型、ファインチューニング済み、ノートPC上で動作するものを問わず、HTTPエンドポイントの背後にあるモデルなら参加できます。すべてのゲームは記録され、正確に再生できるため、結果を検証可能です。スコアは95%の誤差範囲付きの平均で算出され、現在の首位であるjev 1.13が最高スコアを保持しています。チームはコミュニティからのフィードバックを求めています。
jevmanベンチマークはAIモデルをどのように採点しますか?
各モデルは古典的なスクリプト化されたゴーストと100ゲームを行い、1回の決定につき2秒の制限があります。ランキングは95%の誤差範囲付きの平均スコアを用い、互いの誤差範囲内にあるモデルは同順位とみなされます。
🇧🇷 Português
Jevman: um benchmark com Pac-Man para modelos de decisão
A OpenAI acaba de lançar seu endpoint de decisões, a Cloudflare lançou o Clef há pouco tempo, e muitas outras alternativas ao jev já estão disponíveis. Para comparar as opções mais populares, a equipe da Opper AI decidiu testá-las com Pac-Man, um benchmark simples para tomada de decisão rápida.
A equipe fez o jev 1.13, o kev, o clef, o clef flash, o GPT-6 Luna e o Laya jogarem Pac-Man contra fantasmas de bot clássicos. A baixa latência desses modelos permite jogar em tempo real. Cada modelo jogou 100 partidas, e os resultados foram publicados em um ranking. O repositório é de código aberto, então qualquer pessoa pode executar seu próprio modelo e entrar na classificação.
Cada partida custa cerca de 2 centavos, e todos os modelos rodam pela Opper, a startup da equipe. Os visitantes também podem jogar como Pac-Man, com os fantasmas controlados por uma mistura de modelos ou por um único modelo, como o jev. Créditos gratuitos são oferecidos para que todos possam experimentar.
Qualquer modelo atrás de um endpoint HTTP pode participar, seja ele hospedado, ajustado ou rodando em um notebook. Cada partida é registrada e pode ser reproduzida exatamente, de modo que os resultados podem ser verificados. As pontuações usam a média com margem de erro de 95%, e o líder atual, jev 1.13, detém a maior pontuação. A equipe busca feedback da comunidade.
Como o benchmark jevman pontua modelos de IA?
Cada modelo joga 100 partidas contra os fantasmas clássicos roteirizados, com limite de 2 segundos por decisão. O ranking usa a pontuação média com margem de erro de 95%, e modelos dentro da margem de erro um do outro são considerados empatados.
🇷🇺 Русский
Jevman: бенчмарк Pac-Man для моделей принятия решений
OpenAI только что запустила свою конечную точку решений, Cloudflare недавно выпустила Clef, и появилось множество других альтернатив jev. Чтобы сравнить популярные варианты, команда Opper AI решила проверить их на Pac-Man, простом бенчмарке для быстрого принятия решений.
Команда заставила jev 1.13, kev, clef, clef flash, GPT-6 Luna и Laya играть в Pac-Man против классических призраков-ботов. Низкая задержка этих моделей позволяет играть в реальном времени. Каждая модель сыграла по 100 игр, а результаты были опубликованы в таблице лидеров. Репозиторий открыт, поэтому любой может запустить собственную модель и присоединиться к рейтингу.
Каждая игра стоит около 2 центов, а все модели работают через Opper, стартап команды. Посетители также могут играть за Pac-Man сами, при этом призраков контролируют смесь моделей или одна модель, например jev. Для всех предусмотрены бесплатные кредиты, чтобы попробовать.
В соревновании может участвовать любая модель за HTTP-конечной точкой, будь то размещённая в облаке, дообученная или работающая на ноутбуке. Каждая игра записывается и воспроизводится точно, поэтому результаты можно проверить. Баллы считаются как среднее значение с 95-процентной погрешностью, а текущий лидер jev 1.13 держит рекорд. Команда просит обратной связи от сообщества.
Как бенчмарк jevman оценивает ИИ-модели?
Каждая модель играет 100 игр против классических скриптовых призраков с ограничением 2 секунды на решение. Рейтинг использует среднее значение баллов с 95-процентной погрешностью, а модели, находящиеся в пределах погрешности друг друга, считаются равными.
🇨🇳 简体中文
Jevman:面向决策模型的吃豆人基准测试
OpenAI 刚刚推出了其决策端点,Cloudflare 近期也发布了 Clef,而且还有更多 jev 替代方案陆续问世。为了比较这些热门选项,Opper AI 团队决定用吃豆人来测试它们,这是一个衡量快速决策能力的简单基准。
团队让 jev 1.13、kev、clef、clef flash、GPT-6 Luna 和 Laya 与经典机器人幽灵进行吃豆人对战。这些模型的低延迟使实时游戏成为可能。每个模型进行了 100 场游戏,结果发布在排行榜上。该代码仓库是开源的,因此任何人都可以运行自己的模型并加入排名。
每局游戏大约花费 2 美分,所有模型均通过该团队的初创公司 Opper 运行。访客也可以亲自扮演吃豆人,幽灵则由多个模型组合或由单一模型(如 jev)控制。我们还提供了免费额度,供所有人体验。
任何部署在 HTTP 端点后的模型都可以参与,无论是托管模型、微调模型还是运行在笔记本电脑上的模型。每局游戏都会被记录并可精确回放,因此结果可以验证。分数采用均值并给出 95% 的误差范围,当前领先者 jev 1.13 保持着最高分纪录。团队正在征求社区的反馈意见。
jevman 基准测试如何为 AI 模型评分?
每个模型与经典脚本幽灵进行 100 场游戏,每次决策限时 2 秒。排名采用均值分数并给出 95% 的误差范围,误差范围相互重叠的模型视为并列。