پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

دیفیوژن کنترلر گوگل وارد میدان شد؛ شکست سنگین LoRA و پیروزی در ۹۰ درصد رقابت‌های کیفیت تصویر

انتشار:۸ مهر ۱۴۰۵(۱ ساعت پیش)
۵ دقیقه زمان مطالعه
۰ دیدگاه

محققان گوگل ریسرچ با معرفی معماری «دیفیوژن کنترلر» (Diffusion Controller)، روش تازه‌ای برای هدایت مدل‌های تبدیل متن به تصویر ابداع کردند که بدون دست‌زدن به وزن‌های اصلی مدل، کیفیت خروجی را دگرگون می‌کند. این شبکه جانبی در آزمایش‌ها توانسته رقیب نام‌آشنای خود یعنی LoRA را پشت سر بگذارد و در ۹۰ درصد بررسی‌های کیفی پیروز میدان شود. این دستاورد می‌تواند نحوه شخصی‌سازی و کنترل دقیق مدل‌های تصویری را برای همیشه متحول کند.

دیفیوژن کنترلر گوگل وارد میدان شد؛ شکست سنگین LoRA و پیروزی در ۹۰ درصد رقابت‌های کیفیت تصویر

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • گوگل ریسرچ با چارچوب Diffusion Controller فرایند تولید تصویر را مثل یک سیستم کنترل هوشمند می‌بیند؛ یک شبکه کمکی که در هر مرحله نویززدایی مسیر ساخت عکس را اصلاح می‌کند تا مدل دقیقاً همان چیزی را بسازد که کاربر خواسته است.
  • این روش هوشمندانه مدل پایه را کاملاً دست‌نخورده (فریز) نگه می‌دارد، اما در عمل توانسته روش محبوب LoRA را شکست دهد و در ۹۰ درصد ارزیابی‌های کیفی کاربران (معیار HPS-v2) سربلند بیرون بیاید.
  • بزرگ‌ترین چالش استفاده از این فناوری در حال حاضر، نیاز به دسترسی مستقیم به مراحل میانی سمپلر (رویکرد جعبه‌خاکستری) است؛ یعنی پلتفرم‌های ابری برای استفاده از آن باید سیستم‌های پردازش تصویر خودشان را از پایه بازطراحی کنند.

گوگل مسیر هدایت مدل‌های دیفیوژن را به چشم یک «مسئله کنترل» می‌بیند

تیم تحقیقاتی گوگل ریسرچ (Google Research) به‌تازگی از چارچوب جدیدی به نام «دیفیوژن کنترلر» (Diffusion Controller) رونمایی کرده است؛ روشی نوآورانه برای هدایت مدل‌های تبدیل متن به تصویر با کمک یک شبکه کم‌حجم که دوشادوش فرایند نویززدایی فعالیت می‌کند. این کنترل‌کننده بدون آنکه به وزن‌های مدل پایه دست بزند یا آن‌ها را تغییر دهد (فریز بودن مدل پایه)، در هر مرحله از نمونه‌برداری مسیر تولید تصویر را به سمت پاداش دلخواه تنظیم و هدایت می‌کند.

آزمایش‌های گزارش‌شده روی مدل محبوب «استیبل دیفیوژن» (Stable Diffusion v1.4) نشان می‌دهد که قدرتمندترین نسخه جعبه‌سفید (White-box) این کنترلر توانسته در معیار سنجش ترجیح انسانی (HPS-v2) به نرخ پیروزی خیره‌کننده ۹۰ درصدی در برابر مدل پیش‌فرض برسد. نسخه جعبه‌خاکستری (Gray-box) هم در فاین‌تیونینگ نظارت‌شده و هم در آموزش مبتنی بر پاداش، عملکردی بسیار بهتر از LoRA به نمایش گذاشته است. این دستاورد یک چارچوب یکپارچه در اختیار توسعه‌دهندگان می‌گذارد؛ در حالی که قبلاً دنیای هدایت مدل‌ها میان «تنظیمات زمان استنتاج» و «فاین‌تیونینگ مدل» دوپاره شده بود.

اصلاحات لحظه‌ای درون چرخه نویززدایی

مدل‌های دیفیوژن کار خود را با نویز خالص آغاز می‌کنند و با پیش‌بینی مکرر نمایش‌های نهفته پاک‌تر، کم‌کم تصویر نهایی را شکل می‌دهند. حالا دیفیوژن کنترلر این توالی مرحله‌به‌مرحله را شبیه یک سیستم پویا (دینامیکی) می‌داند که مسیر حرکت آن در تک‌تک گام‌ها قابل اصلاح و تنظیم است.

در طول فرایند نمونه‌برداری، این شبکه جانبی وضعیت نهفته میانی را با دقت رصد می‌کند و بر اساس هدفی مشخص مانند همخوانی دقیق با پرامپت، زیبایی‌شناسی بصری، سبک نقاشی یا هر ترجیح یادگرفته‌شده دیگر، یک تصحیح فوری اعمال می‌نماید. این تصحیح، انتقال گام بعدی نویززدایی را جهت‌دهی می‌کند، بدون اینکه کوچک‌ترین تغییری در وزن‌های اصلی مدل ایجاد شود.

مقایسه تصویری خروجی‌های تولیدشده با مدل پایه، روش LoRA و دیفیوژن کنترلر
گوگل در این آزمایش، خروجی‌های به‌دست‌آمده از مدل پیش‌فرض، روش LoRA و معماری دیفیوژن کنترلر را در چندین پرامپت مختلف با هم مقایسه کرده است.

یک نگاه کنترلی یکپارچه برای جعبه‌ابزاری چندتکه

تا پیش از این، روش هدایت بدون طبقه‌بندی‌کننده (Classifier-free guidance یا همان CFG) تعیین می‌کرد که سمپلر دیفیوژن در زمان استنتاج چقدر سفت‌وسخت از پرامپت پیروی کند. از آن طرف، LoRA مسیر دیگری را می‌رفت و با تزریق ماتریس‌های رتبه‌پایین و قابل‌آموزش به لایه‌های خاصی از مدل، آن را شخصی‌سازی می‌کرد. علاوه بر این‌ها، روش‌های رگرسیون وزن‌دار با پاداش و گرادیان خط‌مشی هم راه‌های دیگری برای بهینه‌سازی خروجی‌ها بر اساس سیگنال‌های ترجیحی بودند.

دیفیوژن کنترلر تمام این ابزار‌های پراکنده را زیر چتر یک فرمول‌بندی مشترک در «نظریه کنترل» جمع کرده است. در این دیدگاه، وضعیت نویززدایی به عنوان وضعیت سیستم، اصلاحات کنترلر به عنوان اکشن (Action) و پاداش تصویر نهایی به عنوان هدف بهینه‌سازی تعریف می‌شوند. چنین فرمول‌بندی دقیقی یک زبان و بستر مشترک به پژوهشگران می‌دهد تا اهداف آموزشی، رفتار نمونه‌برداری و میزان انحراف از مدل پیش‌فرض را به بهترین شکل تجزیه و تحلیل کنند.

دو مسیر مستقیم از پاداش تا کنترل خروجی

مقاله پژوهشی گوگل دو روش کاربردی برای آموزش این کنترلر بر اساس پاداش دریافتی در پایان تولید تصویر معرفی کرده است:

  • بهینه‌سازی پروگزیمال خط‌مشی (PPO): این الگوریتم مسیرهای نویززدایی را نمونه‌برداری می‌کند، به تصویر نهایی آن‌ها امتیاز می‌دهد و سپس با تغییرات برش‌خورده و کنترل‌شده در خط‌مشی، کنترلر را آپدیت می‌کند تا فرایند آموزش پایدار و بدون نوسان باقی بماند.
  • تابع زیان وزن‌دار با پاداش (RWL): در این روش، وزن بیشتری به مسیرهایی داده می‌شود که پاداش بالاتری گرفته‌اند؛ بدین ترتیب کنترلر می‌تواند مستقیماً از طریق یک تابع رگرسیون ساده و سرراست، از تولیدات موفق تصویر درس بگیرد.

هر دو روش می‌توانند از بازخوردهای انسانی، مدل‌های یادگیرنده پاداش یا توابع امتیازدهی مشتق‌پذیر استفاده کنند. البته میزان کارآمدی آن‌ها کاملاً به این بستگی دارد که آیا سیگنال پاداش واقعاً رفتار مطلوب را تشخیص می‌دهد یا به اشتباه به ناهنجاری‌های تصویری و میان‌بُرهای گمراه‌کننده امتیاز بالا می‌دهد.

مرز دسترسی: کنترلر کجا و چگونه کار می‌کند؟

سطح دسترسی به چرخه نویززدایی نقشی حیاتی در تعیین محل پیاده‌سازی این چارچوب دارد. در استقرار جعبه‌خاکستری، وزن‌های اصلی مدل می‌توانند کاملاً محرمانه باقی بمانند، اما سیستم حتماً باید وضعیت‌های میانی نمونه‌برداری را در دسترس بگذارد و اجازه دهد در میان گام‌ها اصلاحاتی انجام شود. بنابراین، رابط‌های برنامه‌نویسی (API) معمولی که صرفاً یک پرامپت متنی می‌گیرند و یک عکس تحویل می‌دهند، دسترسی لازم برای اجرای چنین کنترلی را ندارند.

محققان گوگل در این پژوهش چهار نسخه مختلف را زیر ذره‌بین برده‌اند:

نسخه مدل
سطح دسترسی
طراحی و معماری
دیفیوژن کنترلر (Diffusion Controller)
جعبه‌خاکستری
از میانگین معکوس میانی و جریان آداپتور جانبی استفاده می‌کند؛ در حالی که مدل پایه کاملاً فریز و دست‌نخورده باقی می‌ماند.
دیفیوژن کنترلر ساده (Naive)
جعبه‌خاکستری
ورودی میانگین معکوس و جریان آداپتور را حذف می‌کند تا میزان تأثیرگذاری آن‌ها را بسنجد.
دیفیوژن کنترلر مشترک (Diffusion Controller-J)
جعبه‌سفید
کنترلر و مدل پایه را به‌صورت هم‌زمان و مشترک آموزش می‌دهد.
دیفیوژن کنترلر مستقل (Diffusion Controller-S)
جعبه‌سفید
کنترلر و مدل پایه را به شکل کاملاً جداگانه آموزش می‌دهد.

همین تفاوت‌ها باعث می‌شود که استفاده از این فناوری روی سرویس‌های ابری و میزبانی‌شده فعلی با محدودیت روبه‌رو شود؛ چرا که ارائه‌دهندگان خدمات یا باید هوک‌های سطح سمپلر را باز کنند یا این کنترلر را مستقیماً درون زیرساخت‌های پردازشی خود بگنجانند.

نتایج خیره‌کننده: پیروزی‌های پیاپی در ارزیابی‌ها

آزمایش‌ها روی بدنه اصلی مدل Stable Diffusion v1.4 و با استفاده از فاین‌تیونینگ نظارت‌شده، تابع زیان وزن‌دار با پاداش و PPO انجام شده است. برای سنجش کیفیت، محققان هم از شاخص HPS-v2 (معیار سنجش ترجیح انسانی) و هم از قضاوت مستقیم کاربران روی پرامپت‌های پیچیده کمک گرفته‌اند.

یافته گزارش‌شده
مقایسه عملکرد
دامنه و شرایط
۹۰ درصد نرخ پیروزی HPS-v2
نسخه مشترک (Diffusion Controller-J) در برابر مدل پایه پیش‌فرض
قدرتمندترین پیکربندی جعبه‌سفید
نرخ پیروزی بالا‌تر در HPS-v2
نسخه جعبه‌خاکستری دیفیوژن کنترلر در مقایسه با LoRA
آموزش نظارت‌شده و آموزش مبتنی بر پاداش
بیش‌ترین انتخاب و ترجیح کاربران
نسخه‌های مختلف کنترلر در ارزیابی انسانی
پرامپت‌های پیچیده با چندین ویژگی هم‌زمان

آمار پیروزی ۹۰ درصدی حاصل رقابت رودررو با مدل پایه این آزمایش بوده است. با این حال، نتیجه نسخه جعبه‌خاکستری برای توسعه‌دهندگانی جذاب‌تر و کاربردی‌تر است که می‌توانند خط لوله نمونه‌برداری را دستکاری کنند، اما اجازه بازبینی یا دستکاری وزن‌های اصلی مدل را ندارند.

در زمان استنتاج، همه‌چیز بسیار ساده مدیریت می‌شود: تنها یک پارامتر شدت هدایت، میزان تصحیحات کنترلر را مشخص می‌کند. توسعه‌دهندگان می‌توانند درست مثل ضریب CFG که قدرت پرامپت را کم و زیاد می‌کند، با تنظیم این پارامتر، تعادل دلخواه خود میان اطاعت از پاداش و حفظ رفتار طبیعی مدل پایه را برقرار کنند.

چک‌لیست کاربردی برای پیاده‌سازی و به‌کارگیری

تیم‌هایی که قصد دارند دیفیوژن کنترلر را در پروژه‌های واقعی خود پیاده‌سازی کنند، باید این پنج شرط و نیاز فنی را مد نظر قرار دهند:

  1. دسترسی به سمپلر: باید وضعیت‌های نهفته میانی در دسترس باشند و امکان اعمال تصحیح در هر گام از نویززدایی فراهم شود.
  2. یک سیستم پاداش قابل‌اعتماد: باید سیستمی برای امتیازدهی تعریف شود که سبک، سلیقه بصری، خط‌مشی یا نتیجه نهایی مدنظر را به‌درستی بازتاب دهد.
  3. داده‌های آموزشی: جمع‌آوری مسیرهای تولیدشده تصاویر همراه با پاداش آن‌ها، امتیازهای کاربران انسانی یا اهداف نظارت‌شده ضروری است.
  4. تست عملکرد در زمان اجرا: سنجش میزان تأخیر (Latency) و مصرف حافظه تحمیل‌شده توسط شبکه جانبی در تمام طول نمونه‌برداری باید با دقت اندازه‌گیری شود.
  5. ارزیابی مستقل و بی‌طرفانه: میزان پایبندی به پرامپت، کیفیت بصری، تنوع تصاویر و احتمال تقلب در دریافت پاداش (Reward Hacking) باید روی توزیع پرامپت‌های واقعی تست شود.

این چارچوب نوین می‌تواند بدون نیاز به کپی‌کردن یا تغییر مدل اصلی، امکاناتی مانند شخصی‌سازی، هماهنگی با هویت بصری برندها و نظارت بر رعایت خط‌مشی‌ها را فراهم آورد. البته در زمینه ایمنی هوش مصنوعی به بررسی‌های موشکافانه‌تری نیاز است؛ زیرا صرف بهینه‌سازی بر اساس مدل پاداش، تضمین صددرصدی برای مسدودسازی تمام خروجی‌های نامناسب یا خطرناک ایجاد نمی‌کند.

شایان ذکر است که تمام یافته‌های فعلی روی مدل نسبتاً قدیمی Stable Diffusion v1.4 آزمایش شده‌اند؛ بنابراین عملکرد آن روی معماری‌های مدرن‌تر، سیستم‌های اختصاصی و مدل‌های دیفیوژن ویدیویی هنوز در هاله‌ای از ابهام است. علاوه بر این، گوگل هنوز کد منبع عمومی این پژوهش را منتشر نکرده و تیم‌ها برای تست آن روی مدل‌ها و سیگنال‌های پاداش خود، در حال حاضر باید این معماری را از روی مقاله بازپیاده‌سازی کنند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

ترفند ۳.۹ میلیارد دلاری متا؛ تبدیل دیتاسنترهای هوش مصنوعی به تخفیف مالیاتی نجومی!
آخرین اخبار

ترفند ۳.۹ میلیارد دلاری متا؛ تبدیل دیتاسنترهای هوش مصنوعی به تخفیف مالیاتی نجومی!

شرکت متا با یک ترفند حسابداری زیرکانه و ثبت رک‌های سرور هوش مصنوعی به عنوان «تجهیزات آزمایشی»، توانسته معافیت مالیاتی پژوهشی خود را به رقم سرسام‌آور ۳.۹ میلیارد دلار برساند. کارشناسان مالیاتی این اقدام را از نظر قانونی بسیار پرریسک و مشکوک می‌دانند، اما در صورت تأیید، راه برای معافیت‌های مالیاتی نجومی سایر غول‌های هوش مصنوعی نیز هموار خواهد شد.

۴ دقیقه مطالعه
۰
۸ مهر
رونمایی AMD از ایجنت هوش مصنوعی Ross؛ انقلابی در طراحی سخت‌افزار و سیستم‌های امبدد
آخرین اخبار

رونمایی AMD از ایجنت هوش مصنوعی Ross؛ انقلابی در طراحی سخت‌افزار و سیستم‌های امبدد

شرکت AMD با رونمایی از ایجنت هوش مصنوعی Ross، به سراغ دگرگون‌کردن چرخه توسعه سیستم‌های امبدد و سخت‌افزارهای پیشرفته رفته است. این دستیار هوشمند با اتصال مستقیم به زنجیره ابزار‌های مهندسی، فرآیندهای چندهفته‌ای طراحی و بستن زمان‌بندی تراشه‌ها را به چند ساعت کاهش می‌دهد و همکاری بین مهندسان سخت‌افزار و نرم‌افزار را از همیشه ساده‌تر می‌کند.

۶ دقیقه مطالعه
۰
۸ مهر
آموزش فیزیک واقعی به هوش مصنوعی ویدیوساز؛ فریم‌ورک Physis-Lang انویدیا مدل Veo 3.1 گوگل را شکست داد
آخرین اخبار

آموزش فیزیک واقعی به هوش مصنوعی ویدیوساز؛ فریم‌ورک Physis-Lang انویدیا مدل Veo 3.1 گوگل را شکست داد

انویدیا با معرفی فریم‌ورک متن‌باز Physis-Lang، یکی از بزرگ‌ترین نقطه‌ضعف‌های هوش مصنوعی در تولید ویدیو را هدف گرفته و قوانین دنیای واقعی مثل جاذبه و گرما را به مدل‌ها آموزش می‌دهد. این سیستم با غنی‌سازی پرامپت‌ها و داده‌های آموزشی بر اساس علت و معلول، توانسته حتی از مدل قدرتمند Veo 3.1 گوگل هم در درک فیزیک پیشی بگیرد.

۵ دقیقه مطالعه
۰
۸ مهر