HeadlinesBriefing HeadlinesBriefing 12 languages

One month coding with GLM 5.3 Flash

Hacker News ·

🇬🇧 English

Zooming in on the models split specifically: The goal was to spend the whole month on GLM 5.3 Flash pictured in teal. Here’s what went well: Successfully spent the first half of the month on just that model. That model’s usage was well within our budget ($68, about 4k Wh of energy use / 365 grams of carbon emissions). The second half of the month didn’t go so well, with 1B tokens going to other models.

We chose the 'wrong' model for the prototype, and spent 450M tokens / $150 / 5k Wh of energy use almost overnight. We could have achieved similar results for most likely 5x less cost. Another unexpected hurdle was infrastructure availability issues. We noted degradation with the performance of GLM 5.3 Flash, having to switch to other models like Deep Seek V4.1 Flash and Qwen 3.8 Flash.

So technically this challenge was a failure. Only 50% usage on the target model, 1B out of 2B tokens. About 35 k Wh of energy use instead of 10. But we did learn a lot. Reflecting on this for October, here’s what will make it work: Constant, local usage measurement and reporting. Budgeting for experimentation. Making more concerted decisions about which prototypes are worth building.

For day-to-day developer work, it’s totally viable to focus on one or two flash-tier cheap models. A viable target is that the majority of AI inference work should be done with such efficient models, measured in cost or energy use rather than meaningless tokens. That’s the goal for October!

View original article →


🇸🇦 العربية

شهر من البرمجة مع GLM 5.3 Flash | Wagtail CMS

بالتركيز على تقسيم النماذج تحديدًا: كان الهدف قضاء الشهر بأكمله على GLM 5.3 Flash (باللون التركوازي). إليك ما سار بشكل جيد: قضينا بنجاح النصف الأول من الشهر على هذا النموذج فقط. كان استخدام هذا النموذج ضمن ميزانيتنا (68 دولارًا، حوالي 4 كيلوواط ساعة من استخدام الطاقة / 365 جرامًا من انبعاثات الكربون). لم يسير النصف الثاني من الشهر بشكل جيد، حيث ذهبت 1 مليار رمز إلى نماذج أخرى.

اخترنا النموذج 'الخاطئ' للنموذج الأولي، وأنفقنا 450 مليون رمز / 150 دولارًا / 5 كيلوواط ساعة من استخدام الطاقة بين عشية وضحاها تقريبًا. كان بإمكاننا تحقيق نتائج مماثلة على الأرجح بتكلفة أقل 5 مرات. كانت عقبة أخرى غير متوقعة هي مشكلات توفر البنية التحتية. لاحظنا تدهورًا في أداء GLM 5.3 Flash، مما اضطرنا إلى التبديل إلى نماذج أخرى مثل Deep Seek V4.1 Flash و Qwen 3.8 Flash.

لذا من الناحية الفنية، كان هذا التحدي فشلًا. فقط 50% من الاستخدام على النموذج المستهدف، 1 مليار من 2 مليار رمز. حوالي 35 كيلوواط ساعة من استخدام الطاقة بدلاً من 10. لكننا تعلمنا الكثير. بالتفكير في هذا لشهر أكتوبر، إليك ما سيجعله يعمل: قياس وإبلاغ الاستخدام المحلي المستمر. الميزانية للتجريب. قرارات أكثر تنسيقًا حول النماذج الأولية التي تستحق البناء.

بالنسبة للعمل اليومي للمطورين، من الممكن تمامًا التركيز على نموذج أو اثنين من النماذج الرخيصة من فئة الفلاش. الهدف القابل للتطبيق هو أن معظم أعمال استدلال الذكاء الاصطناعي يجب أن تتم باستخدام هذه النماذج الفعالة، مقاسة بالتكلفة أو استخدام الطاقة بدلاً من الرموز التي لا معنى لها. هذا هو هدف أكتوبر!

ما هي العقبات غير المتوقعة الرئيسية خلال شهر البرمجة مع GLM 5.3 Flash؟

شملت العقبات غير المتوقعة الرئيسية اختيار النموذج 'الخاطئ' للنموذج الأولي، مما أدى إلى استخدام عالي للرموز وتكلفة، ومشكلات توفر البنية التحتية بسبب الطلب المرتفع على موفري الاستدلال المشهورين، مما تسبب في تدهور أداء GLM 5.3 Flash.

العربية version →


🇧🇩 বাংলা

GLM 5.3 Flash দিয়ে এক মাস কোডিং | Wagtail CMS

মডেল বিভাজনে বিশেষভাবে মনোযোগ দিয়ে: লক্ষ্য ছিল পুরো মাস GLM 5.3 Flash (টিল রঙে) ব্যবহার করা। এখানে যা ভালো হয়েছে: সফলভাবে মাসের প্রথমার্ধ শুধুমাত্র সেই মডেলে কাটিয়েছি। সেই মডেলের ব্যবহার আমাদের বাজেটের ($68, প্রায় 4 kWh শক্তি ব্যবহার / 365 গ্রাম কার্বন নির্গমন) মধ্যে ছিল। মাসের দ্বিতীয়ার্ধ তেমন ভালো যায়নি, 1B টোকেন অন্যান্য মডেলে গেছে।

আমরা প্রোটোটাইপের জন্য 'ভুল' মডেল বেছে নিয়েছিলাম, এবং প্রায় রাতারাতি 450M টোকেন / $150 / 5 kWh শক্তি ব্যবহার খরচ করেছি। আমরা সম্ভবত 5 গুণ কম খরচে অনুরূপ ফলাফল অর্জন করতে পারতাম। আরেকটি অপ্রত্যাশিত বাধা ছিল অবকাঠামো প্রাপ্যতা সমস্যা। আমরা GLM 5.3 Flash এর কর্মক্ষমতা হ্রাস লক্ষ্য করেছি, Deep Seek V4.1 Flash এবং Qwen 3.8 Flash এর মতো অন্যান্য মডেলে স্যুইচ করতে হয়েছে।

তাই প্রযুক্তিগতভাবে এই চ্যালেঞ্জটি ব্যর্থ ছিল। লক্ষ্য মডেলে মাত্র 50% ব্যবহার, 2B এর মধ্যে 1B টোকেন। প্রায় 35 kWh শক্তি ব্যবহার 10 এর পরিবর্তে। কিন্তু আমরা অনেক কিছু শিখেছি। অক্টোবরের জন্য এটি প্রতিফলিত করে, এখানে যা এটিকে কাজ করবে: ধ্রুবক, স্থানীয় ব্যবহার পরিমাপ এবং রিপোর্টিং। পরীক্ষা-নিরীক্ষার জন্য বাজেট। কোন প্রোটোটাইপ তৈরি করার যোগ্য তা নিয়ে আরও সমন্বিত সিদ্ধান্ত।

দৈনন্দিন ডেভেলপার কাজের জন্য, এক বা দুটি ফ্ল্যাশ-স্তরের সস্তা মডেলে ফোকাস করা সম্পূর্ণ সম্ভব। একটি সম্ভাব্য লক্ষ্য হল যে বেশিরভাগ AI ইনফারেন্স কাজ এই ধরনের দক্ষ মডেল দিয়ে করা উচিত, খরচ বা শক্তি ব্যবহারে পরিমাপ করা, অর্থহীন টোকেনের পরিবর্তে। অক্টোবরের জন্য এটাই লক্ষ্য!

GLM 5.3 Flash দিয়ে কোডিংয়ের মাসে প্রধান অপ্রত্যাশিত বাধাগুলি কী ছিল?

প্রধান অপ্রত্যাশিত বাধাগুলির মধ্যে ছিল প্রোটোটাইপের জন্য 'ভুল' মডেল বেছে নেওয়া, যার ফলে উচ্চ টোকেন ব্যবহার এবং খরচ, এবং জনপ্রিয় ইনফারেন্স প্রদানকারীদের উচ্চ চাহিদার কারণে অবকাঠামো প্রাপ্যতা সমস্যা, যা GLM 5.3 Flash এর কর্মক্ষমতা হ্রাস করেছে।

বাংলা version →


🇩🇪 Deutsch

Ein Monat Programmieren mit GLM 5.3 Flash | Wagtail CMS

Konkret auf die Modellaufteilung fokussiert: Das Ziel war, den ganzen Monat mit GLM 5.3 Flash (in Türkis) zu verbringen. Hier ist, was gut lief: Wir verbrachten erfolgreich die erste Hälfte des Monats nur mit diesem Modell. Die Nutzung dieses Modells lag gut innerhalb unseres Budgets (68 $, etwa 4 kWh Energieverbrauch / 365 Gramm Kohlenstoffemissionen). Die zweite Hälfte des Monats lief nicht so gut, mit 1B Token, die an andere Modelle gingen.

Wir wählten das 'falsche' Modell für den Prototyp und gaben fast über Nacht 450M Token / 150 $ / 5 kWh Energieverbrauch aus. Wir hätten ähnliche Ergebnisse wahrscheinlich mit 5-mal weniger Kosten erzielen können. Ein weiteres unerwartetes Hindernis waren Infrastrukturverfügbarkeitsprobleme. Wir stellten eine Verschlechterung der Leistung von GLM 5.3 Flash fest und mussten auf andere Modelle wie Deep Seek V4.1 Flash und Qwen 3.8 Flash umsteigen.

Technisch gesehen war diese Herausforderung also ein Fehlschlag. Nur 50% Nutzung des Zielmodells, 1B von 2B Token. Etwa 35 kWh Energieverbrauch statt 10. Aber wir haben viel gelernt. Wenn wir für Oktober darüber nachdenken, hier ist, was es zum Funktionieren bringen wird: Ständige lokale Nutzungsmessung und Berichterstattung. Budget für Experimente. Abgestimmtere Entscheidungen darüber, welche Prototypen es wert sind, gebaut zu werden.

Für die tägliche Entwicklerarbeit ist es völlig machbar, sich auf ein oder zwei günstige Flash-Level-Modelle zu konzentrieren. Ein realistisches Ziel ist, dass der Großteil der KI-Inferenzarbeit mit solchen effizienten Modellen durchgeführt wird, gemessen an Kosten oder Energieverbrauch statt an bedeutungslosen Token. Das ist das Ziel für Oktober!

Was waren die wichtigsten unerwarteten Hindernisse während des Monats Programmieren mit GLM 5.3 Flash?

Zu den wichtigsten unerwarteten Hindernissen gehörten die Wahl des 'falschen' Modells für den Prototyp, was zu hohem Token-Verbrauch und Kosten führte, sowie Infrastrukturverfügbarkeitsprobleme aufgrund der hohen Nachfrage nach beliebten Inferenzanbietern, was eine Verschlechterung der Leistung von GLM 5.3 Flash verursachte.

Deutsch version →


🇪🇸 Español

Un mes programando con GLM 5.3 Flash | Wagtail CMS

Centrándonos en la división de modelos específicamente: El objetivo era pasar todo el mes en GLM 5.3 Flash (en teal). Lo que salió bien: Pasamos con éxito la primera mitad del mes solo en ese modelo. El uso de ese modelo estuvo dentro de nuestro presupuesto ($68, aproximadamente 4 kWh de uso de energía / 365 gramos de emisiones de carbono). La segunda mitad del mes no fue tan bien, con 1B tokens yendo a otros modelos.

Elegimos el modelo 'incorrecto' para el prototipo, y gastamos 450M tokens / $150 / 5 kWh de uso de energía casi de la noche a la mañana. Podríamos haber logrado resultados similares probablemente con 5 veces menos costo. Otro obstáculo inesperado fue la disponibilidad de infraestructura. Notamos degradación en el rendimiento de GLM 5.3 Flash, teniendo que cambiar a otros modelos como Deep Seek V4.1 Flash y Qwen 3.8 Flash.

Así que técnicamente este desafío fue un fracaso. Solo 50% de uso en el modelo objetivo, 1B de 2B tokens. Alrededor de 35 kWh de uso de energía en lugar de 10. Pero aprendimos mucho. Reflexionando sobre esto para octubre, esto es lo que lo hará funcionar: Medición y reporte de uso local constante. Presupuesto para experimentación. Decisiones más concertadas sobre qué prototipos vale la pena construir.

Para el trabajo diario de desarrollo, es totalmente viable centrarse en uno o dos modelos baratos de nivel flash. Un objetivo viable es que la mayoría del trabajo de inferencia de IA se haga con tales modelos eficientes, medidos en costo o uso de energía en lugar de tokens sin sentido. ¡Ese es el objetivo para octubre!

¿Cuáles fueron los principales obstáculos inesperados durante el mes de programación con GLM 5.3 Flash?

Los principales obstáculos inesperados incluyeron elegir el modelo 'incorrecto' para el prototipo, lo que llevó a un alto uso de tokens y costo, y problemas de disponibilidad de infraestructura debido a la alta demanda de proveedores de inferencia populares, causando degradación en el rendimiento de GLM 5.3 Flash.

Español version →


🇫🇷 Français

Un mois de codage avec GLM 5.3 Flash | Wagtail CMS

En se concentrant spécifiquement sur la répartition des modèles : L'objectif était de passer tout le mois sur GLM 5.3 Flash (en teal). Voici ce qui a bien fonctionné : Nous avons passé avec succès la première moitié du mois uniquement sur ce modèle. L'utilisation de ce modèle était bien dans notre budget (68 $, environ 4 kWh d'utilisation d'énergie / 365 grammes d'émissions de carbone). La deuxième moitié du mois ne s'est pas aussi bien passée, avec 1B jetons allant à d'autres modèles.

Nous avons choisi le 'mauvais' modèle pour le prototype, et avons dépensé 450M jetons / 150 $ / 5 kWh d'utilisation d'énergie presque du jour au lendemain. Nous aurions pu obtenir des résultats similaires probablement avec 5 fois moins de coût. Un autre obstacle inattendu était les problèmes de disponibilité de l'infrastructure. Nous avons noté une dégradation des performances de GLM 5.3 Flash, devant passer à d'autres modèles comme Deep Seek V4.1 Flash et Qwen 3.8 Flash.

Donc techniquement, ce défi était un échec. Seulement 50% d'utilisation sur le modèle cible, 1B sur 2B jetons. Environ 35 kWh d'utilisation d'énergie au lieu de 10. Mais nous avons beaucoup appris. En réfléchissant à cela pour octobre, voici ce qui le fera fonctionner : Mesure et rapport d'utilisation locale constants. Budget pour l'expérimentation. Décisions plus concertées sur les prototypes qui valent la peine d'être construits.

Pour le travail quotidien des développeurs, il est tout à fait viable de se concentrer sur un ou deux modèles bon marché de niveau flash. Un objectif viable est que la majorité du travail d'inférence IA soit effectuée avec de tels modèles efficaces, mesurés en coût ou en utilisation d'énergie plutôt qu'en jetons sans signification. C'est l'objectif pour octobre !

Quels ont été les principaux obstacles inattendus pendant le mois de codage avec GLM 5.3 Flash ?

Les principaux obstacles inattendus comprenaient le choix du 'mauvais' modèle pour le prototype, entraînant une utilisation élevée de jetons et des coûts, et des problèmes de disponibilité de l'infrastructure en raison de la forte demande pour les fournisseurs d'inférence populaires, provoquant une dégradation des performances de GLM 5.3 Flash.

Français version →


🇮🇳 हिन्दी

GLM 5.3 Flash के साथ एक महीने की कोडिंग | Wagtail CMS

मॉडल विभाजन पर विशेष रूप से ध्यान केंद्रित करते हुए: लक्ष्य पूरे महीने GLM 5.3 Flash (टील रंग में) पर बिताना था। यहाँ अच्छा रहा: सफलतापूर्वक महीने का पहला भाग केवल उस मॉडल पर बिताया। उस मॉडल का उपयोग हमारे बजट ($68, लगभग 4 kWh ऊर्जा उपयोग / 365 ग्राम कार्बन उत्सर्जन) के भीतर था। महीने का दूसरा भाग उतना अच्छा नहीं रहा, 1B टोकन अन्य मॉडलों में गए।

हमने प्रोटोटाइप के लिए 'गलत' मॉडल चुना, और लगभग रातोंरात 450M टोकन / $150 / 5 kWh ऊर्जा उपयोग खर्च किया। हम संभवतः 5 गुना कम लागत पर समान परिणाम प्राप्त कर सकते थे। एक और अप्रत्याशित बाधा बुनियादी ढांचे की उपलब्धता थी। हमने GLM 5.3 Flash के प्रदर्शन में गिरावट देखी, जिससे Deep Seek V4.1 Flash और Qwen 3.8 Flash जैसे अन्य मॉडलों पर स्विच करना पड़ा।

तो तकनीकी रूप से यह चुनौती विफल रही। लक्ष्य मॉडल पर केवल 50% उपयोग, 2B में से 1B टोकन। लगभग 35 kWh ऊर्जा उपयोग 10 के बजाय। लेकिन हमने बहुत कुछ सीखा। अक्टूबर के लिए इस पर विचार करते हुए, यहाँ वह है जो इसे काम करेगा: निरंतर, स्थानीय उपयोग माप और रिपोर्टिंग। प्रयोग के लिए बजट। इस बारे में अधिक ठोस निर्णय कि कौन से प्रोटोटाइप बनाने लायक हैं।

दैनिक डेवलपर कार्य के लिए, एक या दो फ्लैश-स्तरीय सस्ते मॉडल पर ध्यान केंद्रित करना पूरी तरह से व्यवहार्य है। एक व्यवहार्य लक्ष्य यह है कि अधिकांश AI अनुमान कार्य ऐसे कुशल मॉडलों के साथ किया जाना चाहिए, जिसे लागत या ऊर्जा उपयोग में मापा जाए, न कि अर्थहीन टोकन में। अक्टूबर के लिए यही लक्ष्य है!

GLM 5.3 Flash के साथ कोडिंग के महीने के दौरान मुख्य अप्रत्याशित बाधाएं क्या थीं?

मुख्य अप्रत्याशित बाधाओं में प्रोटोटाइप के लिए 'गलत' मॉडल चुनना शामिल था, जिससे उच्च टोकन उपयोग और लागत हुई, और लोकप्रिय अनुमान प्रदाताओं की उच्च मांग के कारण बुनियादी ढांचे की उपलब्धता के मुद्दे, जिससे GLM 5.3 Flash के प्रदर्शन में गिरावट आई।

हिन्दी version →


🇮🇩 Bahasa Indonesia

Satu Bulan Coding dengan GLM 5.3 Flash | Wagtail CMS

Berfokus secara khusus pada pembagian model: Tujuannya adalah menghabiskan seluruh bulan dengan GLM 5.3 Flash (berwarna teal). Inilah yang berjalan baik: Berhasil menghabiskan paruh pertama bulan hanya dengan model itu. Penggunaan model tersebut berada dalam anggaran kami ($68, sekitar 4 kWh penggunaan energi / 365 gram emisi karbon). Paruh kedua bulan tidak berjalan baik, dengan 1B token digunakan untuk model lain.

Kami memilih model yang 'salah' untuk prototipe, dan menghabiskan 450M token / $150 / 5 kWh penggunaan energi hampir dalam semalam. Kami mungkin bisa mencapai hasil serupa dengan biaya 5 kali lebih murah. Hambatan tak terduga lainnya adalah masalah ketersediaan infrastruktur. Kami melihat penurunan kinerja GLM 5.3 Flash, sehingga harus beralih ke model lain seperti Deep Seek V4.1 Flash dan Qwen 3.8 Flash.

Jadi secara teknis tantangan ini gagal. Hanya 50% penggunaan pada model target, 1B dari 2B token. Sekitar 35 kWh penggunaan energi, bukan 10. Tapi kami banyak belajar. Merefleksikan ini untuk Oktober, inilah yang akan membuatnya berhasil: Pengukuran dan pelaporan penggunaan lokal yang konstan. Anggaran untuk eksperimen. Keputusan yang lebih terkoordinasi tentang prototipe mana yang layak dibangun.

Untuk pekerjaan pengembang sehari-hari, sangat layak untuk fokus pada satu atau dua model murah tingkat flash. Target yang layak adalah mayoritas pekerjaan inferensi AI dilakukan dengan model efisien seperti itu, diukur dengan biaya atau penggunaan energi, bukan token yang tidak berarti. Itulah tujuan untuk Oktober!

Apa hambatan tak terduga utama selama bulan coding dengan GLM 5.3 Flash?

Hambatan tak terduga utama termasuk memilih model yang 'salah' untuk prototipe, yang menyebabkan penggunaan token dan biaya tinggi, serta masalah ketersediaan infrastruktur karena tingginya permintaan untuk penyedia inferensi populer, menyebabkan penurunan kinerja GLM 5.3 Flash.

Bahasa Indonesia version →


🇯🇵 日本語

GLM 5.3 Flash で1か月コーディング | Wagtail CMS

モデルの分割に特に焦点を当てると、目標は月全体を GLM 5.3 Flash(ティール色)に費やすことでした。うまくいった点は、月の前半をそのモデルだけで過ごせたことです。そのモデルの使用量は予算内(68ドル、約4 kWhのエネルギー使用 / 365グラムの炭素排出)でした。月の後半はあまりうまくいかず、10億トークンが他のモデルに流れました。

プロトタイプに「間違った」モデルを選び、ほぼ一晩で4億5,000万トークン / 150ドル / 5 kWhのエネルギー使用を費やしました。おそらく5分の1のコストで同様の結果を得られたでしょう。もう一つの予期せぬ障害は、インフラストラクチャの可用性問題でした。GLM 5.3 Flashのパフォーマンス低下に気づき、Deep Seek V4.1 FlashやQwen 3.8 Flashなどの他のモデルに切り替える必要がありました。

技術的には、このチャレンジは失敗でした。ターゲットモデルの使用率はわずか50%、20億トークンのうち10億トークン。エネルギー使用は10ではなく約35 kWhでした。しかし、多くを学びました。10月に向けて振り返ると、成功させるためのポイントは次のとおりです:継続的なローカル使用量の測定とレポート。実験のための予算。どのプロトタイプを構築する価値があるかについて、より協調的な決定。

日常の開発作業では、1つか2つのフラッシュ層の安価なモデルに焦点を当てることは完全に実行可能です。実行可能な目標は、AI推論作業の大部分をこのような効率的なモデルで行い、無意味なトークンではなくコストやエネルギー使用量で測定することです。それが10月の目標です!

GLM 5.3 Flash でのコーディングの1か月間に、主な予期せぬ障害は何でしたか?

主な予期せぬ障害には、プロトタイプに「間違った」モデルを選んだことが含まれ、高いトークン使用量とコストにつながり、また人気のある推論プロバイダーの需要が高いためのインフラストラクチャ可用性問題により、GLM 5.3 Flash のパフォーマンスが低下しました。

日本語 version →


🇧🇷 Português

Um mês programando com GLM 5.3 Flash | Wagtail CMS

Focando especificamente na divisão de modelos: O objetivo era passar o mês inteiro no GLM 5.3 Flash (em teal). Aqui está o que deu certo: Passamos com sucesso a primeira metade do mês apenas nesse modelo. O uso desse modelo estava bem dentro do nosso orçamento ($68, cerca de 4 kWh de uso de energia / 365 gramas de emissões de carbono). A segunda metade do mês não foi tão bem, com 1B tokens indo para outros modelos.

Escolhemos o modelo 'errado' para o protótipo e gastamos 450M tokens / $150 / 5 kWh de uso de energia quase da noite para o dia. Poderíamos ter alcançado resultados semelhantes provavelmente com 5 vezes menos custo. Outro obstáculo inesperado foi a disponibilidade de infraestrutura. Notamos degradação no desempenho do GLM 5.3 Flash, tendo que mudar para outros modelos como Deep Seek V4.1 Flash e Qwen 3.8 Flash.

Então, tecnicamente, esse desafio foi um fracasso. Apenas 50% de uso no modelo alvo, 1B de 2B tokens. Cerca de 35 kWh de uso de energia em vez de 10. Mas aprendemos muito. Refletindo sobre isso para outubro, aqui está o que fará funcionar: Medição e relatório de uso local constantes. Orçamento para experimentação. Decisões mais concertadas sobre quais protótipos valem a pena construir.

Para o trabalho diário de desenvolvimento, é totalmente viável focar em um ou dois modelos baratos de nível flash. Um alvo viável é que a maioria do trabalho de inferência de IA seja feita com esses modelos eficientes, medidos em custo ou uso de energia em vez de tokens sem sentido. Esse é o objetivo para outubro!

Quais foram os principais obstáculos inesperados durante o mês de programação com GLM 5.3 Flash?

Os principais obstáculos inesperados incluíram escolher o modelo 'errado' para o protótipo, levando a alto uso de tokens e custo, e problemas de disponibilidade de infraestrutura devido à alta demanda por provedores de inferência populares, causando degradação no desempenho do GLM 5.3 Flash.

Português version →


🇷🇺 Русский

Один месяц кодинга с GLM 5.3 Flash | Wagtail CMS

Сосредоточившись конкретно на разделении моделей: Целью было провести весь месяц на GLM 5.3 Flash (бирюзовый). Вот что прошло хорошо: Успешно провели первую половину месяца только на этой модели. Использование этой модели было в пределах нашего бюджета ($68, около 4 кВт·ч использования энергии / 365 граммов выбросов углерода). Вторая половина месяца прошла не так хорошо: 1 млрд токенов ушло на другие модели.

Мы выбрали «неправильную» модель для прототипа и потратили 450 млн токенов / $150 / 5 кВт·ч использования энергии почти за одну ночь. Мы могли бы достичь аналогичных результатов, скорее всего, с затратами в 5 раз меньше. Еще одним неожиданным препятствием были проблемы с доступностью инфраструктуры. Мы заметили деградацию производительности GLM 5.3 Flash, пришлось переключиться на другие модели, такие как Deep Seek V4.1 Flash и Qwen 3.8 Flash.

Так что технически этот вызов провалился. Только 50% использования целевой модели, 1 млрд из 2 млрд токенов. Около 35 кВт·ч использования энергии вместо 10. Но мы многому научились. Размышляя об этом для октября, вот что заставит это работать: Постоянное локальное измерение и отчетность об использовании. Бюджет на эксперименты. Более согласованные решения о том, какие прототипы стоит создавать.

Для повседневной работы разработчика вполне реально сосредоточиться на одной или двух дешевых моделях flash-уровня. Реалистичная цель — чтобы большинство работы по инференсу ИИ выполнялось с помощью таких эффективных моделей, измеряемых по стоимости или использованию энергии, а не по бессмысленным токенам. Это цель на октябрь!

Каковы были основные неожиданные препятствия в течение месяца кодинга с GLM 5.3 Flash?

Основные неожиданные препятствия включали выбор «неправильной» модели для прототипа, что привело к высокому использованию токенов и затратам, а также проблемы с доступностью инфраструктуры из-за высокого спроса на популярных провайдеров инференса, что вызвало деградацию производительности GLM 5.3 Flash.

Русский version →


🇨🇳 简体中文

使用 GLM 5.3 Flash 编码一个月 | Wagtail CMS

具体来看模型拆分:目标是将整个月用于 GLM 5.3 Flash(以青色显示)。进展顺利的部分:成功地将上半月仅用于该模型。该模型的使用完全在我们的预算之内(68美元,约4千瓦时能源使用 / 365克碳排放)。下半月进展不太顺利,10亿个令牌流向了其他模型。

我们为原型选择了“错误”的模型,几乎一夜之间花费了4.5亿个令牌 / 150美元 / 5千瓦时的能源。我们很可能可以用少5倍的成本实现类似的结果。另一个意外障碍是基础设施可用性问题。我们注意到 GLM 5.3 Flash 的性能下降,不得不切换到其他类似模型,如 Deep Seek V4.1 Flash 和 Qwen 3.8 Flash。

所以从技术上讲,这次挑战是失败的。目标模型的使用率仅为50%,20亿个令牌中只有10亿个。能源使用约为35千瓦时,而不是10千瓦时。但我们确实学到了很多。反思十月,以下将使其成功:持续、本地的使用测量和报告。为实验做预算。更协调地决定哪些原型值得构建。

对于日常开发工作,专注于一两个闪级廉价模型是完全可行的。一个可行的目标是,大多数AI推理工作应该使用这种高效模型,以成本或能源使用来衡量,而不是无意义的令牌。这就是十月的目标!

使用 GLM 5.3 Flash 编码一个月期间的主要意外障碍是什么?

主要意外障碍包括为原型选择了“错误”的模型,导致高令牌使用和成本,以及由于热门推理提供商的高需求导致的基础设施可用性问题,造成 GLM 5.3 Flash 性能下降。

简体中文 version →