हमने हाल ही में एक समन्वित अभियान की पहचान की और उसे बाधित किया, जो हमारे मॉडलों से संरक्षित तर्क निकालने के लिए डिज़ाइन किया गया था, जिसमें सबसे पहली देखी गई गतिविधि जुलाई के पहले सप्ताह में हुई थी। यह गतिविधि प्रतिकूल आसवन के अनुरूप है: किसी अन्य मॉडल को प्रशिक्षित, पुनरुत्पादित या सुधारने में मदद करने के लिए एक मॉडल के आउटपुट या तर्क का व्यवस्थित और अनधिकृत उपयोग। ऑपरेटरों ने मॉडल इंटरैक्शन में हेरफेर किया ताकि संरक्षित तर्क को अनुरोधकर्ता को दृश्यमान रूपों में समन्वित, बड़े पैमाने पर पुन: प्रस्तुत किया जा सके, जिसने हमारी सेवा की शर्तों का उल्लंघन किया।
हमने देखा कि ऑपरेटरों ने नए तरीकों से संरक्षित तर्क निकालने का प्रयास किया, जिसमें एक बातचीत से एन्क्रिप्टेड तर्क को कॉपी करना और दूसरी बातचीत में एक मॉडल से छिपी तर्क सामग्री को डिक्रिप्ट और ट्रांसक्राइब करने के लिए कहना शामिल है। यह गतिविधि 1 जुलाई को शुरू हुई, जिसमें 24 और 25 जुलाई को उच्च-मात्रा स्पाइक्स थे, जिसमें 4,000 से अधिक उपयोगकर्ताओं से 16,000 अनुरोध शामिल थे। आगे की जांच ने 15,000 से अधिक उपयोगकर्ताओं के एक समूह में संबंधित प्रॉम्प्ट-पैटर्न गतिविधि की पहचान की, जिसे हमने 28 जुलाई तक पूरी तरह से बाधित कर दिया।
हम गतिविधि के एक मुख्य समूह को Moonshot AI (Kimi के डेवलपर) से जुड़े व्यक्तियों के लिए जिम्मेदार ठहराते हैं। प्रतिकूल आसवन सुरक्षा और राष्ट्रीय सुरक्षा जोखिम पैदा करता है। निकाला गया तर्क मूल मॉडल के उपयोगकर्ता-सामना वाले आउटपुट पर लागू सुरक्षा उपायों को संरक्षित किए बिना किसी अन्य मॉडल को प्रशिक्षित करने के लिए उपयोग किया जा सकता है।
हमने खाता प्रवर्तन, तकनीकी नियंत्रण और भागीदार समन्वय के संयोजन के माध्यम से इस हालिया आसवन अभियान को कम किया। हमने उपयोगकर्ताओं, कार्यक्षेत्रों, संगठनों और मॉडल परिवारों में छिपे तर्क के लिए सुरक्षा को भी मजबूत किया।
स्रोत: OpenAI Blog · HeadlinesBriefing द्वारा सारांशित