HeadlinesBriefing favicon HeadlinesBriefing.com

Почему локальные LMM отстают от бенчмарков

Hacker News •
×

Мы все скачиваем модель «AMAZEBALLZ» в ожидании высокой производительности, но обнаруживаем, что наша локальная установка работает плохо. Этот разрыв возникает из-за специфических рисков реализации во время инференса. Оборудование и ПО лабораторий-референсов кардинально отличаются от домашних сборок. Каждое поколение GPU вычисляет следующий токен по-своему, что естественно расходятся с опубликованными заявлениями.

Чтобы оценить реальную мощность, запустите стандартные бенчмарки вроде terminal bench, hle, SWEthis, HELLAthat или MMLU-whatever. Пропустите zero-shot тесты; агентные задачи требуют вызова инструментов через длинный контекст. Точно совпадите настройки сэмплера. Как отметил @wendell, математика есть математика. Используйте значения по умолчанию из карточки модели: обычно temp 1.0 и top-p 0.95. Неправильная температура вызывает бесконечные циклы, а рассинхронизированные сэмплеры искажают распределения вероятностей, делая вывод неестественным.

Математически отслеживайте KLD (расстояние Кульбака-Лейблера). Преобразуйте логи в вероятностные распределения и измерьте отклонение от базовой линии. Более низкий KLD означает лучшее выравнивание, а не высокий интеллект. Остерегайтесь нереально низких оценок на квантованных моделях HF без открытых контрольных точек. Не ведитесь на низкие баллы без полных сред выполнения. Запустите репрезентативные тесты, синхронизируйте шаблоны чата и примите тот факт, что каждый современный LLM работает с небольшими вариациями.