OpenAI acaba de lanzar su endpoint de decisiones, y Cloudflare presentó hace poco Clef, mientras que han aparecido muchas más alternativas a jev. Para comparar las opciones más populares, el equipo de Opper AI decidió probarlas con Pac-Man, un benchmark sencillo para la toma de decisiones rápida.
El equipo hizo que jev 1.13, kev, clef, clef flash, GPT-6 Luna y Laya jugaran a Pac-Man contra fantasmas bot clásicos. La baja latencia de estos modelos permite jugar en tiempo real. Cada modelo jugó 100 partidas y los resultados se publicaron en una clasificación. El repositorio es de código abierto, así que cualquiera puede ejecutar su propio modelo y unirse al ranking.
Cada partida cuesta unos 2 centavos de dólar, y todos los modelos se ejecutan a través de Opper, la startup del equipo. Los visitantes también pueden jugar como Pac-Man, con los fantasmas controlados por una mezcla de modelos o por un solo modelo, como jev. Se ofrecen créditos gratuitos para que todos puedan probarlo.
Puede participar cualquier modelo detrás de un endpoint HTTP, ya sea alojado, ajustado con fine-tuning o ejecutándose en un portátil. Cada partida queda registrada y se reproduce exactamente, por lo que los resultados pueden verificarse. Las puntuaciones usan la media con un margen de error del 95 %, y el líder actual, jev 1.13, conserva la puntuación máxima. El equipo busca la opinión de la comunidad.
Fuente: Hacker News · Resumido por HeadlinesBriefing