HeadlinesBriefing HeadlinesBriefing.com

OpenAI、モデル蒸留キャンペーンを妨害

OpenAI Blog •
×

当社は最近、モデルから保護された推論を抽出するために設計された協調キャンペーンを特定し、妨害しました。最も初期に観測された活動は7月の第1週に発生しました。この活動は、敵対的蒸留(別のモデルのトレーニング、複製、または改善を支援するために、あるモデルの出力や推論を体系的かつ無許可で使用すること)と一致しています。オペレーターはモデルの相互作用を操作し、保護された推論が要求者に可視的な形で、協調的かつ大規模な方法で再現されるようにしました。これは当社の利用規約に違反しています。

オペレーターは、ある会話から暗号化された推論をコピーし、別の会話のモデルに隠された推論コンテンツを復号して書き写すよう要求するなど、新しい方法で保護された推論を抽出しようと試みました。活動は7月1日に始まり、7月24日と25日には高ボリュームのスパイクが発生し、4,000人以上のユーザーから16,000件のリクエストがありました。さらなる調査により、15,000人以上のユーザーのクラスター全体で関連するプロンプトパターン活動が特定され、当社は7月28日までに完全に妨害しました。

当社は、活動の核となるクラスターを、Kimiの開発者であるMoonshot AIに関連する個人に帰属させます。敵対的蒸留は、安全性と国家安全保障上のリスクをもたらします。抽出された推論は、元のモデルのユーザー向け出力に適用されたセーフガードを保持せずに、別のモデルをトレーニングするために使用される可能性があります。

当社は、アカウントの執行、技術的管理、パートナーとの連携を組み合わせて、この最近の蒸留キャンペーンを緩和しました。また、ユーザー、ワークスペース、組織、モデルファミリー全体で、隠された推論の保護を強化しました。

出典: OpenAI Blog · 要約:HeadlinesBriefing