A OpenAI acaba de lançar seu endpoint de decisões, a Cloudflare lançou o Clef há pouco tempo, e muitas outras alternativas ao jev já estão disponíveis. Para comparar as opções mais populares, a equipe da Opper AI decidiu testá-las com Pac-Man, um benchmark simples para tomada de decisão rápida.
A equipe fez o jev 1.13, o kev, o clef, o clef flash, o GPT-6 Luna e o Laya jogarem Pac-Man contra fantasmas de bot clássicos. A baixa latência desses modelos permite jogar em tempo real. Cada modelo jogou 100 partidas, e os resultados foram publicados em um ranking. O repositório é de código aberto, então qualquer pessoa pode executar seu próprio modelo e entrar na classificação.
Cada partida custa cerca de 2 centavos, e todos os modelos rodam pela Opper, a startup da equipe. Os visitantes também podem jogar como Pac-Man, com os fantasmas controlados por uma mistura de modelos ou por um único modelo, como o jev. Créditos gratuitos são oferecidos para que todos possam experimentar.
Qualquer modelo atrás de um endpoint HTTP pode participar, seja ele hospedado, ajustado ou rodando em um notebook. Cada partida é registrada e pode ser reproduzida exatamente, de modo que os resultados podem ser verificados. As pontuações usam a média com margem de erro de 95%, e o líder atual, jev 1.13, detém a maior pontuação. A equipe busca feedback da comunidade.
Fonte: Hacker News · Resumido por HeadlinesBriefing