HeadlinesBriefing favicon HeadlinesBriefing.com

وحدة التحكم في الانتشار

Google AI Blog •
×

التقدم السريع لنماذج الذكاء الاصطناعي لتحويل النص إلى صورة، مثل Nano Banana وStable Diffusion وFlux، قد غيّر التصميم الإبداعي، لكن توجيه هذه النماذج لتلبية نية المستخدم الدقيقة لا يزال عملاً متوازناً. على سبيل المثال، قد يؤدي طلب "سحلية ترتدي نظارات شمسية" إلى توليد سحلية واقعية بدون نظارات، أو تشويه وجه السحلية إذا تم فرض ذلك. المنهجيات الحالية غير مترابطة: يستخدم المطورون تقنيات وقت الاستدلال مثل التوجيه الخالي من المصنف، أو الضبط الدقيق الثقيل مع محولات فعالة مثل LoRA، أو الانحدارات المرجحة بالمكافأة، أو تدرجات السياسة. نظرًا لأن هذه الأدوات تُعامل كإصلاحات منفصلة، يفتقر المجال إلى لغة رياضية موحدة للتحكم.

إطار وحدة التحكم في الانتشار يحل هذا من خلال إعادة صياغة عملية إزالة الضوضاء كمشكلة تحكم سلسة. شبكته الإضافية خفيفة الوزن تفوقت على المعيار الصناعي لمطابقة تفضيلات البشر، ونسخته المفتوحة بالكامل حققت معدل فوز 90% على خط الأساس. يعامل الإطار التوليد كرحلة خاضعة للتحكم، مع نموذج أساسي مجمد ومخمد توجيه يضبط المسار.

هذا النهج يعيد معايرة سلوك النموذج ديناميكيًا، مع إعطاء وزن أكبر للأهداف المحددة من قبل المستخدم مع الحفاظ على جودة الصورة. في مثال السحلية، يضمن المخمد تضمين النظارات، لكن حاجز العقوبة يمنع التشويه. يربط الإطار بين النظرية والتطبيق بطريقتين للضبط الدقيق تعتمدان على درجة مكافأة نهائية، بما في ذلك تدرج السياسة وPPO، والتي توجه النموذج بشكل متكرر مع قاعدة قص مدمجة.