HeadlinesBriefing HeadlinesBriefing.com

GLM 5.3 Flash кодинг месяц | Wagtail CMS

Hacker News •
×

Сосредоточившись конкретно на разделении моделей: Целью было провести весь месяц на GLM 5.3 Flash (бирюзовый). Вот что прошло хорошо: Успешно провели первую половину месяца только на этой модели. Использование этой модели было в пределах нашего бюджета ($68, около 4 кВт·ч использования энергии / 365 граммов выбросов углерода). Вторая половина месяца прошла не так хорошо: 1 млрд токенов ушло на другие модели.

Мы выбрали «неправильную» модель для прототипа и потратили 450 млн токенов / $150 / 5 кВт·ч использования энергии почти за одну ночь. Мы могли бы достичь аналогичных результатов, скорее всего, с затратами в 5 раз меньше. Еще одним неожиданным препятствием были проблемы с доступностью инфраструктуры. Мы заметили деградацию производительности GLM 5.3 Flash, пришлось переключиться на другие модели, такие как Deep Seek V4.1 Flash и Qwen 3.8 Flash.

Так что технически этот вызов провалился. Только 50% использования целевой модели, 1 млрд из 2 млрд токенов. Около 35 кВт·ч использования энергии вместо 10. Но мы многому научились. Размышляя об этом для октября, вот что заставит это работать: Постоянное локальное измерение и отчетность об использовании. Бюджет на эксперименты. Более согласованные решения о том, какие прототипы стоит создавать.

Для повседневной работы разработчика вполне реально сосредоточиться на одной или двух дешевых моделях flash-уровня. Реалистичная цель — чтобы большинство работы по инференсу ИИ выполнялось с помощью таких эффективных моделей, измеряемых по стоимости или использованию энергии, а не по бессмысленным токенам. Это цель на октябрь!

Источник: Hacker News · Сводку подготовил HeadlinesBriefing