پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

فرمول تازه آرنا برای پساآموزش: مدل FLUX.2-dev با نرخ برد ۶۶ درصدی صدرنشین شد!

انتشار:۱۱ مهر ۱۴۰۵(۱۱ ساعت پیش)
۵ دقیقه زمان مطالعه
۰ دیدگاه

تیم آرنا با ارائه یک چارچوب پساآموزش نوین مبتنی بر یادگیری تقویتی، معضل بزرگ انحراف مدل‌های تصویرساز از پرامپت را برطرف کرد. در این متد پیشرفته، مدل ارتقایافته FLUX.2-dev با ثبت نرخ برد خیره‌کننده ۶۶ درصدی در برابر مدل پایه، بالا‌تر از تمام رقبای متن‌باز قرار گرفت.

فرمول تازه آرنا برای پساآموزش: مدل FLUX.2-dev با نرخ برد ۶۶ درصدی صدرنشین شد!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • تیم آرنا فرمول جدیدی برای پساآموزش مدل‌های تبدیل متن به تصویر ابداع کرده که ترکیب پاداش انسانی، چک‌لیست دقیق پرامپت و سیستم ضدتقلب، جلوی خرابکاری مدل و انحراف از دستورات کاربر را می‌گیرد.
  • مدل‌های نام‌آشنای FLUX.2-dev و Ideogram 4 با این متد بهینه‌سازی شدند و مدل FLUX.2-dev با ثبت نرخ برد ۶۶ درصدی توانست تمام رقبای مطرح متن‌باز را در جدول ارزیابی آرنا شکست دهد.
  • به لطف تکنیک سوپ مدل‌ها (Model Soups) و ادغام تغییرات وزنی، بدون نیاز به اضافه شدن بار پردازشی جدید در زمان تولید تصویر، خروجی نهایی به بالا‌ترین سطح کیفیت رسیده است.

مهار انحراف از پرامپت؛ ترفند هوشمندانه آرنا با پاداش‌های فیلترشده در یادگیری تقویتی

یادگیری تقویتی (RL) پس از مرحله پیش‌آموزش می‌تواند عملکرد مدل‌های تبدیل متن به تصویر را حسابی ارتقا دهد؛ اما چالش بزرگ اینجاست که مدل یاد می‌گیرد دقیقاً پاداش تعیین‌شده را به حداکثر برساند، حتی اگر این کار به قیمت سوءاستفاده از نقاط کور سیستم تمام شود! مثلاً مدلی که فقط بر اساس «سلیقه و ترجیح انسانی» پاداش می‌گیرد، ممکن است تصاویری بسیار چشم‌نواز و براق بسازد، اما در عوض برخی اشیای خواسته‌شده در پرامپت را جا بیندازد، جزئیات ناخواسته اضافه کند یا حتی سبک تصویر را ناخواسته تغییر دهد. حالا تیم آرنا در فرمول آموزشی جدید خود، امتیاز سلیقه انسانی را با چک‌لیست‌های اختصاصی پرامپت و یک ابزار شناسایی تقلب ترکیب کرده است. پیاده‌سازی این رویکرد روی مدل‌های FLUX.2-dev و Ideogram 4 باعث شد هر دو مدل در جدول رتبه‌بندی زنده آرنا حسابی بدرخشند و رتبه‌های بالاتری کسب کنند.

وقتی پاداش سلیقه‌محور دست مدل را برای دور زدن قانون باز می‌گذارد

روش‌های Flow-GRPO و DiffusionNFT راهکارهای یادگیری تقویتی بسیار کاربردی برای مدل‌های تولید تصویر مبتنی بر دیفیوژن و جریان (Flow) ارائه می‌دهند؛ مدل‌هایی که با تغییر تدریجی نویز، تصویر را خلق می‌کنند. در مرحله پساآموزش، سیستم از مدل تصویر می‌گیرد، به آن‌ها امتیاز می‌دهد و مدل را طوری به‌روزرسانی می‌کند که خروجی‌هایی با امتیاز بالا‌تر بسازد. در نتیجه، ساختار پاداش تعیین می‌کند چه ویژگی‌هایی تقویت شوند و چه پسرفت‌ها و کاستی‌هایی از چشم پنهان بمانند.

بهینه‌سازی صرفاً بر اساس ترجیحات انسانی، ممکن است زیبایی ظاهری و چشم‌نوازی را بر وفاداری به متن ترجیح دهد. یعنی یک تصویر می‌تواند امتیاز خیلی بالایی بگیرد، در حالی که یکی از المان‌های درخواستی را حذف کرده، یک شیء اضافه از خودش درآورده، به دستورات منفی (Negative Prompts) بی‌محلی کرده یا تصویر را بیش از حد به سمت واقع‌گرایی سوق داده است. در دنیای هوش مصنوعی، این رفتارها مصداق بارز «تقلب در پاداش» یا همان Reward Hacking هستند؛ جایی که مدل یاد می‌گیرد از شکاف میان فرمول امتیازدهی و هدف واقعی کاربر به نفع خودش سوءاستفاده کند.

تقسیم کار میان چهار سیگنال کلیدی

  • پاداش ترجیحات انسانی (Preference reward): آرنا یک مدل پاداش مبتنی بر برادلی-تری (Bradley-Terry) را بر پایه نزدیک به ۵ میلیون رأی مقایسه‌ای انسان‌ها آموزش داده که از جدول ارزیابی مدل‌های تصویرساز در میان بیش از ۱۰۰ مدل جمع‌آوری شده است. مدل‌های برادلی-تری پیش‌بینی می‌کنند انسان‌ها کدام‌یک از دو تصویر را بیش‌تر می‌پسندند و این تخمین را به یک امتیاز عددی جامع برای سنجش کیفیت بصری، ترکیب‌بندی و زیبایی‌شناسی تبدیل می‌کنند.
  • پاداش وفاداری به متن (Faithfulness reward): یک مدل زبانی هر پرامپت آموزشی را به درختی از معیارهای مشخص با پاسخ‌های «بله یا خیر» تبدیل می‌کند. این پرسش‌ها شامل اشیای درخواستی، ویژگی‌ها، روابط فضایی بین المان‌ها و سبک تصویر هستند. سپس یک مدل چندرسانه‌ای بینایی-زبانی (VLM) تصویر تولیدشده را بر اساس تک‌تک این معیارها می‌سنجد و درصد معیارهای رعایت‌شده به عنوان پاداش مدل ثبت می‌شود.
  • پاداش قیدها و محدودیت‌ها (Constraint reward): این سنجه محتواهایی را بررسی می‌کند که با خواسته اصلی کاربر در تضاد هستند؛ مثل اشیای اضافه، دستکاری در سبک یا نادیده گرفتن دستورات منفی. آرنا این قابلیت را فقط برای پرامپت‌هایی فعال می‌کند که نیاز به رعایت مو‌به‌مو دارند تا دست مدل در پرامپت‌های خلاقانه کاملاً باز بماند.
  • سنجه ضد تقلب در پاداش (Anti-reward-hacking rubric): یک سیستم شناسایی جداگانه به سراغ رفتارهای مخرب مشاهده‌شده در طول آموزش می‌رود؛ از جمله تولید متن‌های ناخوانا و درهم‌ریخته یا تغییر ناخواسته سبک به سمت تصاویر عکس‌مانند (فوتورئالیستی).

حق وتو در دستان سیستم ضدتقلب

آرنا از سیگنال ضدتقلب به عنوان یک فیلتر کنترلی (Gate) برای پاداش ترجیحات انسانی استفاده می‌کند. وقتی سیستم ضدتقلب متوجه سوءاستفاده مدل شود، امتیاز ترجیح انسانی را بلافاصله سقف‌گذاری کرده و آن را حداکثر صفر در نظر می‌گیرد. اما خروجی‌های بی‌نقص و تمیز، امتیاز اصلی خود را کاملاً حفظ می‌کنند.

def gated_pref_reward(r_pref, d_hack):
    # d_hack = 1 when an anti-hacking rubric fires
    if d_hack == 0:
        return r_pref
    return min(r_pref, 0.0)

به این ترتیب، تصویری که در آن تقلب شناسایی شده باشد، نمی‌تواند به خاطر زیبایی بصری یا ترکیب‌بندی جذاب، امتیاز مثبتی دشت کند! این آشکارساز مثل یک حق وتوی دقیق عمل می‌کند و اجازه نمی‌دهد مدل امتیازی اضافی برای تقلب کردن دریافت کند. سپس این پاداش فیلترشده در کنار پاداش وفاداری به پرامپت و قیدهای لازم بهینه‌سازی می‌شود.

علاوه بر این، آرنا چند سیاست مختلف را با چینش‌های پاداش متفاوت آموزش می‌دهد و با میانگین‌گیری از تغییرات پارامترها نسبت به مدل پایه مشترک، بر اساس تکنیک سوپ مدل‌ها (Model Soups)، آن‌ها را با هم ادغام می‌کند:

deltas = [trained - base for trained in policies]
merged = base + mean(deltas)

از آنجا که نقطه شروع تمام این سیاست‌ها یک مدل پایه یکسان بوده، تغییرات پارامترها کاملاً با یکدیگر هماهنگ می‌مانند. نتیجه این ادغام، یک مدل واحد و قدرتمند است که در زمان اجرا هیچ بار پردازشی اضافه‌ای به سیستم تحمیل نمی‌کند.

نرخ برد ۶۶ درصدی در برابر مدل پایه

آرنا سیستم خود را با ۱۰ هزار پرامپت واقعی از کاربران آموزش داد و ۱۰۰۰ پرامپت دیگر را هم برای ارزیابی نهایی کنار گذاشت. در مرحله ارزیابی، مدل Gemini-3.5-Flash هر خروجی پساتربیت‌شده را با مدل پایه دست‌نخورده در هر دو ترتیب نمایش مقایسه کرد تا خطای چیدمان به حداقل برسد.

پیکربندی
نتیجه گزارش‌شده در برابر مدل پایه
پاداش ترجیحات انسانی
به تنهایی کافی نیست
پاداش ترجیحات به همراه وفاداری به متن
بهبود چشمگیر
افزودن قیدهای فیلترشده بر اساس نیت کاربر
نرخ برد ۶۴.۲ درصدی
افزودن ادغام وزن‌ها در فضای پارامترها
نرخ برد ۶۶.۰ درصدی

آرنا دو مرحله اول را به صورت کیفی توصیف کرده و برای دو مرحله پایانی، نرخ بردهای عددی دقیق گزارش داده است. این روند به وضوح نشان می‌دهد که بخش عمده جهش عملکرد مدیون سنجه‌های دقیق سطح پرامپت بوده و تکنیک ادغام پارامترها هم ۱.۸ درصد دیگر به نرخ برد اضافه کرده است.

در جدول رتبه‌بندی زنده، مدل ارتقایافته FLUX.2-dev موفق شد ۶۹ امتیاز آرنا کسب کند. همچنین مدل پساآموزش‌دیده Ideogram 4 به امتیاز خیره‌کننده ۱۲۲۴ رسید و تا تاریخ ۴ سپتامبر ۲۰۲۶، از تمام مدل‌های متن‌باز ثبت‌شده در فهرست بالا‌تر ایستاد. جالب است بدانید این فرمول حتی با استفاده از مدل‌های پاداش متن‌باز مثل Pickscore هم نتایج فوق‌العاده مشابهی ارائه می‌دهد.

الگوی مهندسی کاربردی با قابلیت استفاده مجدد

بسیاری از سیستم‌های یادگیری تقویتی در حوزه تصویر، تنها شباهت به سبک CLIP، پیش‌بینی‌کننده‌های زیبایی‌شناسی یا یک مدل ترجیحات منفرد را بهینه‌سازی می‌کنند. اما طراحی هوشمندانه آرنا ارزیاب‌های جداگانه‌ای را برای ترجیحات بصری، پوشش کامل پرامپت، محدودیت‌های نیت کاربر و تقلب‌های شناخته‌شده اختصاص داده است. این سیستم فیلترکننده به‌ویژه زمانی معجزه‌آسا عمل می‌کند که یک حالت شکست را بتوان به شکل مطمئن دسته‌بندی کرد، اما نتوان آن را در قالب یک امتیاز کیفی پیوسته گنجاند.

علاوه بر این، استفاده از چک‌لیست‌های اختصاصی برای هر پرامپت باعث شده تا دیگر نیازی به مجموعه داده‌های ارزیابی دست‌چین‌شده نباشد. نمرات جداگانه برای هر معیار مشخص می‌کند دقیقاً چرا یک تصویر پاداش از دست داده است؛ موضوعی که رهگیری خطاهایی مانند حذف اشیاء، ویژگی‌های نادرست و نقص در روابط فضایی را در طول فرآیند آموزش بسیار آسان‌تر می‌کند.

چک‌لیست حیاتی برای پیاده‌سازی در محیط عملیاتی

  • کیفیت چک‌لیست‌ها: باید از معیارهای تولیدشده نمونه‌گیری کرد و مطمئن شد هر پرسش، یک ویژگی قابل مشاهده مشخص را با وابستگی‌های منطقی درست ارزیابی می‌کند.
  • قابلیت اطمینان قاضی: نمرات مدل بینایی-زبانی (VLM) را باید با برچسب‌های انسانی در بخش‌های تولید متن، روابط فضایی، سبک و دستورات منفی مقایسه و اعتبارسنجی کرد.
  • کالیبراسیون فیلتر کنترلی: نرخ مثبت کاذب باید اندازه‌گیری شود تا خروجی‌های خلاقانه و معتبر، امتیاز ترجیحات انسانی خود را به اشتباه از دست ندهند.
  • پایش وضعیت پاداش‌ها (تله‌متری): باید هر مؤلفه پاداش و نرخ فعال شدن فیلتر ضدتقلب را بر اساس دسته‌بندی پرامپت‌ها ثبت کرد تا از تسلط نامناسب یک پاداش یا فروپاشی سیستم جلوگیری شود.
  • اعتبارسنجی ادغام: تمام سیاست‌ها و چک‌پوینت‌های ادغام‌شده باید روی بخش‌های مختلف پرامپت ارزیابی شوند؛ چرا که گاهی بهبودهای کلی در میانگین نتایج، ممکن است پسرفت‌های مقطعی در بخش‌های خاص را پنهان کنند.

پرسش‌های بی‌پاسخ در داوری‌های خودکار

آزمون آفلاین با ۱۰۰۰ پرامپت، میزان همبستگی با قاضی خودکار جمینای را می‌سنجد. از طرفی جدول رتبه‌بندی زنده آرنا، آرای مقایسه‌ای انسان‌ها را هم به این معادله اضافه می‌کند؛ البته این امتیازها ممکن است با ورود آرا و رقبای جدید تغییر کنند. در حال حاضر شواهد ارائه‌شده دو مدل پایه را پوشش می‌دهد و سنجه ضدتقلب نیز محدود به الگوهای شکست شناسایی‌شده است؛ بنابراین برای کشف تقلب‌های جدید، به معیارها و آشکارسازهای تازه‌ای نیاز خواهد بود.

در مقاله پژوهشی ضمیمه، جزئیات ساخت چک‌لیست‌های مبتنی بر وابستگی به طور کامل توضیح داده شده است. همچنین در گزارش پروژه می‌توانید نمونه‌های تصویری قبل و بعد از شناسایی حالت‌های تقلب در پاداش را مشاهده کنید.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

دوپامین مصنوعی و مغزهای هک‌شده؛ هوش مصنوعی مولد چطور سیم‌کشی تمرکز ما را به هم می‌ریزد؟
آخرین اخبار

دوپامین مصنوعی و مغزهای هک‌شده؛ هوش مصنوعی مولد چطور سیم‌کشی تمرکز ما را به هم می‌ریزد؟

رگبار نوتیفیکیشن‌ها و سیستم‌های هوش مصنوعی مولد با تولید مداوم «دوپامین مصنوعی»، ساختار شیمیایی و مدارهای تمرکز مغز انسان را دستخوش تغییر اساسی کرده‌اند. این سقوط دامنه توجه صرفاً یک مسئله شخصی نیست، بلکه با از بین بردن فرصت‌های استراحت مغزی، امنیت شناختی و تفکر عمیق جامعه را در معرض تهدیدی جدی قرار داده است.

۶ دقیقه مطالعه
۰
۱۱ مهر
شتاب خیره‌کننده مدل زبانی MiniCPM5 با دستیار ۳۲۴ میلیونی DSpark؛ جهش چشمگیر در تولید موازی توکن‌ها
آخرین اخبار

شتاب خیره‌کننده مدل زبانی MiniCPM5 با دستیار ۳۲۴ میلیونی DSpark؛ جهش چشمگیر در تولید موازی توکن‌ها

تیم OpenBMB با انتشار مدل کم‌حجم ۳۲۴ میلیون پارامتری DSpark، جهش بزرگی در سرعت استنتاج مدل زبانی MiniCPM5-2B ایجاد کرده است. این مدل با تکیه بر تکنیک هوشمندانه رمزگشایی گمانه‌زنانه، توکن‌ها را به صورت دسته‌ای حدس می‌زند تا فرایند پردازش با کم‌ترین مصرف محاسباتی و بیش‌ترین سرعت ممکن اجرا شود.

۲ دقیقه مطالعه
۰
۱۱ مهر
پیودی‌پای: موقع ساخت هوش مصنوعی اختصاصی‌ام، OpenAI دو بار اکانتم را بست!
آخرین اخبار

پیودی‌پای: موقع ساخت هوش مصنوعی اختصاصی‌ام، OpenAI دو بار اکانتم را بست!

فلیکس شلبرگ یا همان پیودی‌پای معروف، به‌تازگی مدل هوش مصنوعی محلی خود به نام Ajax را معرفی کرده، اما فاش ساخته که در مسیر توسعه آن، شرکت OpenAI دو بار حسابش را مسدود کرده است. او برای ساخت این مدل ۹ میلیارد پارامتری از تکنیک تقطیر استفاده کرده؛ موضوعی که زنگ خطر نقض قوانین سازنده ChatGPT را به صدا درآورده است.

۳ دقیقه مطالعه
۰
۱۱ مهر