OpenAI только что запустила свою конечную точку решений, Cloudflare недавно выпустила Clef, и появилось множество других альтернатив jev. Чтобы сравнить популярные варианты, команда Opper AI решила проверить их на Pac-Man, простом бенчмарке для быстрого принятия решений.
Команда заставила jev 1.13, kev, clef, clef flash, GPT-6 Luna и Laya играть в Pac-Man против классических призраков-ботов. Низкая задержка этих моделей позволяет играть в реальном времени. Каждая модель сыграла по 100 игр, а результаты были опубликованы в таблице лидеров. Репозиторий открыт, поэтому любой может запустить собственную модель и присоединиться к рейтингу.
Каждая игра стоит около 2 центов, а все модели работают через Opper, стартап команды. Посетители также могут играть за Pac-Man сами, при этом призраков контролируют смесь моделей или одна модель, например jev. Для всех предусмотрены бесплатные кредиты, чтобы попробовать.
В соревновании может участвовать любая модель за HTTP-конечной точкой, будь то размещённая в облаке, дообученная или работающая на ноутбуке. Каждая игра записывается и воспроизводится точно, поэтому результаты можно проверить. Баллы считаются как среднее значение с 95-процентной погрешностью, а текущий лидер jev 1.13 держит рекорд. Команда просит обратной связи от сообщества.
Источник: Hacker News · Сводку подготовил HeadlinesBriefing