HeadlinesBriefing favicon HeadlinesBriefing.com

छोटे मॉडल: AI में नई सीमा

Hacker News •
×

पिछले कुछ हफ्तों से, मैं gpt-5.6-luna के साथ खेल रहा हूं। यह आश्चर्यजनक रूप से सक्षम, तेज़ और स्मार्ट है। मैं नियमित रूप से इसे ~100 tps करते हुए देखता हूं, और मेरे कोडबेस, ईमेल और ज्ञान आधार के आसपास घूमता हुआ। बेशक, luna के साथ सबसे बड़ी चीज़ लागत है। मैंने कुछ काफी जटिल शोध थ्रेड चलाने की कोशिश की है, और बड़ा बिल चढ़ाना काफी मुश्किल है। यहां तक कि इसे हजारों ईमेल खोजने पर भी, मैं दसियों सेंट की API लागत पर समाप्त होता हूं। GLM 5.3 के साथ, हमारे पास पेरेटो फ्रंटियर पर एक नया विकल्प भी है।

कोडिंग कार्य करते समय, मैं लगभग हमेशा सबसे महंगे और सक्षम मॉडल (Fable 5, 5.6 Sol) तक पहुंचता हूं। इसलिए छोटे तेज़ मॉडलों द्वारा की गई प्रगति को याद करना आसान रहा है। कुछ निवेशकों ने जिनसे मैंने बात की है, उन्होंने उल्लेख किया: "यह अजीब है कि हम अधिक उपभोक्ता AI कंपनियां नहीं देख रहे हैं। ऐसा क्यों है?" इसका एक सीधा जवाब है: टोकन लागत।

AI से पहले के समय में, बड़े उपभोक्ता ऐप्स के लिए प्लेबुक इस तरह दिखती थी: किसी प्रकार की आकर्षक वेबसाइट बनाएं जो चलाने के लिए काफी सस्ती हो, बहुत सारे उपयोगकर्ताओं को आकर्षित करें (आमतौर पर कुछ वायरलिटी के साथ), पैसे जुटाएं, अधिक उपयोगकर्ताओं तक स्केल करें, एक विज्ञापन बाज़ार बनाएं। यह मोटे तौर पर अधिकांश बड़ी उपभोक्ता कंपनियों (Google, Facebook, Snapchat, आदि) का वर्णन करता है। लेकिन क्या होगा यदि आप अपने उत्पाद में AI जोड़ना चाहते हैं? खैर, अब आपके पास हर अनुरोध पर वास्तविक अनुमान लागत है! अचानक आवश्यक पूंजी की मात्रा नाटकीय रूप से बढ़ जाती है।

मेरा एक पालतू मूल्यांकन एक दैनिक समाचार साइट बनाना है, जो मेरे लिए व्यक्तिगत हो: इंटरनेट पर @calvinfo पर शोध करें, पता लगाएं कि उन्हें कौन सी खबरें पसंद आ सकती हैं, आज की शीर्ष कहानियों के साथ एक माइक्रो-साइट बनाएं, उनके लिए व्यक्तिगत, hn, reddit, twitter आदि खोजें। पिछली पीढ़ी के मॉडल (Sonnet वर्ग) के साथ, आप कहीं भी पहुंचने के लिए ~$1 खर्च करते। उपभोक्ता ऐप के लिए $30/माह चार्ज करना अस्थिर है। यहां हम बहुत कुछ अनुकूलित कर सकते हैं, लेकिन यदि आप WSJ या The Economist जो चार्ज करते हैं वह चार्ज कर रहे हैं, तो आप बेहतर होगा कि आप समान मूल्य प्रदान करें। लेकिन luna को देखते हुए, परिणाम काफी अच्छे हैं, और औसत लागत ~$0.10 है। अब हम बात कर रहे हैं!

जहां मुझे लगता है कि यह और भी दिलचस्प हो जाता है वह व्यापार की दुनिया में है। मेरे Segment सह-संस्थापक Peter और मैंने हाल ही में एक पैदल यात्रा पर नोट्स की तुलना की। अपनी विभिन्न स्टार्टअप्स में, Peter ने दो तरह के काम देखे हैं: "IQ 180" काम (किसी प्रकार का पागल वैज्ञानिक प्रतिभा प्रकार जो कुछ पागल समाधान लेकर आता है जिसके बारे में आपने कभी नहीं सोचा) और "टोकन थूकने वाला" काम (अति उत्तरदायी होना, दर्जनों विभिन्न मोर्चों पर गेंद को आगे बढ़ाना)। Peter कई कंपनियां चलाते हैं। Segment के अलावा, उन्होंने Charm Industrial के लिए $100m+ जुटाए हैं, और हाल ही में Revoy के लिए एक सीरीज A बंद की है। वह अविश्वसनीय रूप से संगठित और अपने समय के साथ कुशल है। और फिर भी, Peter ने उल्लेख किया कि ~95% काम जो वह करता है वह बकेट 2 में आता है। यह कॉल पर कूदना, लोगों को धक्का देना, ब्लॉक और टैकल करना है। स्पष्ट होने के लिए, Peter कहते हैं कि उनकी कंपनियां आज गहरी समस्याओं को हल करने वाले IQ 180 तकनीकी दिमाग के बिना पानी में मृत होंगी। बस उनका अधिकांश काम बकेट 2 में आता है।

मुझे लगता है कि "फ्रंटियर-स्तर" मॉडल की मांग बढ़ती रहेगी, विशेष रूप से उन क्षेत्रों के लिए जिन्हें नवीन सफलताओं या खोज की आवश्यकता होती है (इंजीनियरिंग, कठोर विज्ञान, मॉडल प्रशिक्षण)। लेकिन मुझे यह भी लगता है कि "तेज़/सस्ता/पर्याप्त-अच्छा" मॉडल की मांग अभी शुरू होने वाली है। उन लोगों के बारे में सोचें जिनके साथ आप दैनिक आधार पर बातचीत करते हैं: सहकर्मी, विक्रेता और ग्राहक। दस में से नौ बार, आप किसी ऐसे व्यक्ति को चाहते हैं जो अति उत्तरदायी हो और आपके लिए चीजों को संभालता हो। आज कंपनियों में अधिकांश "मानव टोकन" इसी तरह खर्च किए जाते हैं — भर्ती भारी रूप से तेज़/सस्ता/पर्याप्त-अच्छा आदर्श की ओर झुकती है। व्यवसाय के लिए तेज़/सस्ता/पर्याप्त-अच्छा मॉडल को वास्तविकता बनाने के लिए बहुत काम करने की आवश्यकता है: नए हार्नेस, प्रॉम्प्ट इंजेक्शन सुरक्षा, भूमिकाएं और अनुमतियां। लेकिन मुझे विश्वास है कि हम इसे समझ लेंगे। यदि आप भी छोटे मॉडल को उपयोगी बनाने के साथ प्रयोग कर रहे हैं, तो कृपया मुझे एक पंक्ति भेजें। Amazon और Netflix उल्लेखनीय अपवाद हैं। Peter यहां भी विनम्र है; वह बहुत तेज है।