HeadlinesBriefing favicon HeadlinesBriefing.com

डिफ्यूजन लैंग्वेज मॉडल्स

Hacker News •
×

आज के दो बड़े पीढ़ी के जनरेटिव एआई एल्गोरिदम परिवारों का बोलबाला है: छवि जैसे निरंतर डेटा के लिए डिफ्यूजन मॉडल और पाठ जैसे डिस्क्रीट डेटा के लिए ऑटो-रिग्रेसिव मॉडल। डिफ्यूजन मॉडल एक साथ पूरे अनुक्रम को उत्पन्न करते हैं, एक खराब ड्राफ्ट से शुरू करके कई चरणों में समानांतर में प्रत्येक स्थिति को सुधारते हैं। यह दृष्टिकोण गति और गुणवत्ता के समझौते, इनबिल्ट एरर कॉरेक्शन और बिडायरेक्शनल कॉन्टेक्स्ट की अनुमति देता है। ऑटो-रिग्रेसिव एलएलएम एक-एक टोकन उत्पन्न करते हैं, बाईं से दाईं ओर, टोकन की संख्या के बराबर कदम लेते हैं। डिफ्यूजन एलएलएम इसके विपरीत एक पूरे लंबाई के ड्राफ्ट से शुरू करते हैं और प्रत्येक चरण में पूरे अनुक्रम को पुनःलिखित करते हैं। 2024 तक, डिफ्यूजन मॉडल की गुणवत्ता के लिहाज से ऑटो-रिग्रेसिव मॉडल के साथ प्रतिस्पर्धा करने लगे थे, और 2026 में, डिफ्यूजन एलएलएम एक वास्तविकता बन गए, जिसमें इनसाइट लैब्स के मर्क्युरी 2 (Mercury 2), गूगल के जैम्मा डिफ्यूजन (Gemma Diffusion) और एनवीडिया के नेमोट्रॉन डिफ्यूजन (Nemotron Diffusion) जैसे अग्रणी उद्योग प्रयोगशालाओं के रिलीज़ शामिल हैं। डिफ्यूजन मॉडल का मूल अवधारणा डिनोइजिंग है: शुद्ध यादृच्छिक शोर से शुरू करके, हर चरण में थोड़ा सा शोर हटाकर एक समझदार छवि उभरती है। आगे की प्रक्रिया एक साफ प्रशिक्षण छवि को और अधिक शोर वाली छवियों में बदलती है, जबकि रिवर्स प्रोसेस इस ट्रांसफॉर्मेशन को उलटने का सीखती है, जिससे शोर फिर से छवि में बदल जाता है।

डिफ्यूजन मॉडल शोर को धीरे-धीरे छवि में बदलने के उदाहरणों पर प्रशिक्षित होते हैं। आगे की प्रक्रिया एक साफ छवि में शोर को एक चरण में एक बार जोड़ती है, जबकि रिवर्स प्रोसेस इस ट्रांसफॉर्मेशन को उलटने का सीखती है।

आधुनिक डिफ्यूजन भाषा मॉडल इन मूल सिद्धांतों पर आधारित हैं, जिन्हें डिस्क्रीट डेटा जैसे पाठ के लिए अनुकूलित किया गया है।

मुख्य संस्थाएं: कंपनियां: Inception Labs, Google, NVIDIA