HeadlinesBriefing favicon HeadlinesBriefing.com

تأثير العلامة المائية للـ LLM على الوكلاء الذهنيين

Hacker News •
×

أعلنت Anthropic أن نماذج Claude未来将嵌入基于Google DeepMind的Synth ID-Text的隐形水印。 هذه العلامة المائية، المطلوبة بموجب Article 50(2) من EU AI Act للنص الاصطناعي، تغير عملية توليد الرموز للنمودج. على مستوى النمودج، يمكن أن تتغير سلوكات الأمان، مثل رفض طلبات ضارة، وتصبح عرضة لحقن الموجهات. على مستوى الوكيل، تحدد الرموز الم Samplingة التي أُ取ت أي أداة يتم استدعاؤها وأي معطيات تُمرر. يُسمى هذا التأثير السلوكي "انزياح العينات"، وتم تأكيده في كل من سلوك رفض النمودج واستcalls الأدوات من الوكيل. هذا التأثير يعتمد على النمودج والمفتاح، وي يمكن أن يُخفى بالدرجات التراكمية. ي discusses المقال implications for AI safety and security and what developers should do. تطبيقات Anthropic تطبق العلامة المائية على مستوى النمودج، وتغطي النماذج المدعم accessed من خلال Claude Platform API وviders cloud، مما يجعل تأثيرات سلوك النمودج على مستوى النمودج ذات ص relevance للوكلاء المبنيين حول هذه النماذج. عينات المباريات، المستخدمة في Synth ID-Text، لها فرصة أكبر لتغيير اختيار الرموز حيث يكون النمودج غير مطمئن، مما قد يغير المعطيات التي ي executes الوكيل.