HeadlinesBriefing favicon HeadlinesBriefing.com

ML मॉडल में मौन प्रसारण बग

Towards Data Science •
×

PyTorch और TensorFlow टेंसर प्रसारण से मॉडल में बड़े बग हो सकते हैं, जिससे हजारों कंप्यूटिंग संसाधन बर्बाद होते हैं। जब टेंसर आयाम ठीक से मैच न करें, तो फ्रेमवर्क आकार 1 के आयामों को अन्य आयामों में फैलाकर 'प्रसारण' करते हैं, जिससे अभिप्रेत वेक्टर ऑपरेशन के बजाय अनजाने मैट्रिक्स ऑपरेशन बनते हैं। उदाहरण के लिए, (N, 1) कॉलम वेक्टर को (N,) समतल वेक्टर में जोड़ने से (N, N) मैट्रिक्स बनता है rather than N elementwise अंतर। इससे रिग्रेशन मॉडल बैच माध्य के लिए ऑप्टिमाइज़ करता है rather than सीखना वास्तविक इनपुट-आउटपुट संबंध, जिससे loss वक्र normal दिखते हैं जबकि प्रशिक्षण की ओर कचरा हो रहा है। लेखक का अनुमान है कि इस बग के कारण 4,000 डॉलर के कंप्यूटिंग संसाधन बर्बाद हुए। रोकथाम के लिए सावधानीपूर्वक टेंसर आकार मान्यता और प्रसारण नियमों की समझ आवश्यक है ताकि आयाम अपेक्षित रूप से मैच करें।