پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

شاهکار جدید علی‌بابا در دنیای تصویرسازی؛ مدل Qwen-Image-2.1 صدرنشین لیدربوردهای هوش مصنوعی شد!

انتشار:۱۰ مهر ۱۴۰۵(۱ ساعت پیش)
۵ دقیقه زمان مطالعه
۰ دیدگاه

غول فناوری چین یعنی علی‌بابا با عرضه مدل جدید Qwen-Image-2.1 حسابی سروصدا به پا کرده و موفق شده رتبه نخست لیدربوردهای تبدیل متن به تصویر و ویرایش تصویر Artificial Analysis را در دسته مدل‌های با وزن باز تصاحب کند. این هوش مصنوعی ۷ میلیارد پارامتری نه‌تنها کیفیت تصویرسازی خیره‌کننده‌ای با وضوح 2K ارائه می‌دهد، بلکه امکان تولید دارایی‌های بصری با پس‌زمینه شفاف (RGBA) و ویرایش هوشمند را در یک پکیج واحد برای توسعه‌دهندگان به ارمغان آورده است.

شاهکار جدید علی‌بابا در دنیای تصویرسازی؛ مدل Qwen-Image-2.1 صدرنشین لیدربوردهای هوش مصنوعی شد!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مدل جدید Qwen-Image-2.1 ساخت شرکت علی‌بابا با عبور از رقبای قدرتمندی مثل Ideogram 4.0 و HunyuanImage، رتبه اول مدل‌های با وزن باز را در دو بنچمارک معتبر Artificial Analysis از آنِ خود کرد.
  • این غول تصویرسازی علاوه بر خروجی نیتیو با وضوح 2K، قابلیت تولید تصاویر شفاف با کانال آلفا (RGBA) و دریافت هم‌زمان ۱۰ تصویر مرجع برای ویرایش‌های مبتنی بر استدلال را دارد.
  • با وجود دسترسی به فایل ۳۳ گیگابایتی وزن‌ها روی هاگینگ‌فیس و کامفی‌یوآی، لایسنس تحقیقاتی جدید علی‌بابا استفاده تجاری از این مدل را منوط به دریافت مجوز رسمی کرده است.

صدرنشینی Qwen-Image-2.1 در دو لیدربورد تصویرسازی مدل‌های وزن‌باز

مدل جدید Qwen-Image-2.1 از غول چینی علی‌بابا، حالا رسماً بر قله مدل‌های با وزن باز (Open-Weight) در لیدربوردهای AA-Image-T2I v2.0 (تولید تصویر از متن) و AA-Image-Editing v2.0 (ویرایش تصویر) وب‌سایت تحلیلی Artificial Analysis تکیه زده است. این شاهکار تازه موفق شده مدل مطرح Ideogram 4.0 (Quality) را در بخش تولید تصویر و مدل HunyuanImage 3.0 Instruct (متعلق به تنسنت) را در بخش ادیت تصویر کنار بزند و رتبه یک را تصاحب کند.

برای توسعه‌دهندگان، این انتشار یک خبر فوق‌العاده است؛ چون تولید تصویر، ویرایش، خروجی شفاف و هدایت با چندین تصویر مرجع همگی درون یک چک‌پوینت دانلودی گردآوری شده‌اند. البته منظور از «وزن باز» (Open-weight)، امکان دسترسی به پارامترهای مدل است؛ اما حقوق استفاده و استقرار آن تحت یک مجوز تحقیقاتی محدودکننده ارائه شده که استفاده تجاری مستقیم را محدود می‌کند.

جالب است بدانید اگر مدل‌های تجاری و اختصاصی (بسته‌منبع) را هم به این رقابت اضافه کنیم، Qwen-Image-2.1 در بنچمارک Artificial Analysis هم در تولید تصویر و هم در ویرایش به رتبه ۱۸ دنیا می‌رسد. این یک جهش چشمگیر در مقایسه با نسخه قبلی یعنی Qwen Image 2.0 است که به ترتیب رتبه‌های ۷۲ و ۵۸ را در دست داشت. افزون بر این، این مدل در ۱۶ دسته‌بندی از مجموع ۳۶ دسته توانمندی و کاربردی این بنچمارک، پیشتاز میدان است.

یک چک‌پوینت، دو مأموریت سنگین تصویرسازی

علی‌بابا در پست معرفی این مدل اعلام کرده که تنها با یک چک‌پوینت یکپارچه، هم کار تولید تصویر از روی متن انجام می‌شود و هم ویرایش تصویر بر پایه دستورات متنی کاربر (Instruction-based). این مدل تصاویری با رزولوشن نیتیو ۲,۰۴۸ در ۲,۰۴۸ پیکسل تولید می‌کند، توانایی دریافت حداکثر ۱۰ تصویر مرجع در هر درخواست را دارد و خروجی RGBA با پس‌زمینه شفاف ارائه می‌دهد.

بخش مدل
مشخصات فنی
ستون فقرات تصویرسازی (Image backbone)
ترنسفورمر دیفیوژن تک‌جریانی ۳۲ لایه‌ای با ۷ میلیارد پارامتر
انکودر پرامپت (Prompt encoder)
Qwen3-VL 8B
کدک تصویر (Image codec)
اتوانکودر متغیر (VAE) ۶۴ کاناله RGBA با فشرده‌سازی فضایی ۱۶ برابری
رزولوشن خروجی نیتیو
۲,۰۴۸ در ۲,۰۴۸ پیکسل
ورودی تصاویر مرجع
حداکثر ۱۰ تصویر در هر مرحله تولید
حجم فایل دانلودی
حدود ۳۳ گیگابایت برای تمامی اجزای مدل
مجوز (License)
توافق‌نامه مجوز تحقیقاتی Qwen (استفاده تجاری نیازمند مجوز جداگانه است)

ترنسفورمر دیفیوژن یا همان DiT، ساختار معماری ترنسفورمر را در فرایند نویززدایی مورد نیاز برای تولید تصویر به کار می‌گیرد. در این سیستم، انکودر قدرتمند Qwen3-VL وظیفه تفسیر پرامپت‌ها و تصاویر مرجع را به دوش می‌کشد، در حالی که اتوانکودر متغیر (VAE) ابتدا تصاویر را به یک نمایش نهفته (Latent) فشرده‌تر تبدیل کرده و در نهایت خروجی نهایی را دیکود و بازسازی می‌کند.

نکته جذاب اینجاست که اتوانکودر RGBA علاوه بر سه رنگ اصلی قرمز، سبز و آبی، کانال آلفا (شفافیت) را هم حفظ می‌کند. این یعنی خطوط لوله و پایپ‌لاین‌های سازگار می‌توانند مستقیماً فایل‌های شفاف PNG تولید و ذخیره کنند و دیگر هیچ نیازی به ابزار‌های جانبی برای حذف پس‌زمینه تصویر نخواهد بود.

پکیج دانلودی کامل شامل ستون فقرات تصویرسازی، انکودر و اتوانکودر است. میزان حافظه رم ویدیویی (VRAM) مورد نیاز در زمان اجرا، به دقت محاسباتی، رزولوشن خروجی، کوانتیزاسیون، آف‌لود کردن اجزا روی پردازنده اصلی (CPU Offloading) و تصمیم شما مبنی بر بارگذاری هم‌زمان همه اجزا در حافظه گرافیکی بستگی دارد.

  • وزن‌های مدل: از طریق پلتفرم‌های Hugging Face و ModelScope در دسترس است.
  • پایپ‌لاین‌های پایتون: کتابخانه Diffusers از همان روز نخست پشتیبانی کامل از این مدل را اضافه کرده است.
  • ورک‌فلوهای بصری: پلتفرم ComfyUI یک قالب آماده و اختصاصی برای کار با این مدل فراهم کرده است.
  • پشته‌های استقرار و سرویس‌دهی: فریم‌ورک‌های vLLM-Omni، SGLang و LightX2V همگی از این مدل پشتیبانی می‌کنند.

پیشتازی در ۱۶ دسته‌بندی مختلف

بنچمارک Artificial Analysis ارزیابی‌های خود را به ۹ قابلیت و ۱۰ سناریوی کاربردی در تولید تصویر از متن، و ۷ نوع ویرایش و ۱۰ سناریوی کاربردی در ویرایش تصویر تقسیم‌بندی می‌کند. مدل Qwen-Image-2.1 در میان مدل‌های با وزن باز در دسته‌های زیر در رتبه اول قرار گرفته است:

  • قابلیت‌های تولید متن به تصویر (۵ از ۹ دسته): ترکیب‌بندی‌های پیچیده (Complex Compositions)، رندر متن در تصویر (Text Rendering)، دانش و اطلاعات (Knowledge)، چینش و چیدمان (Layout) و نورپردازی (Lighting).
  • سناریوهای کاربردی تولید متن به تصویر (۳ از ۱۰ دسته): شبکه‌های اجتماعی و محتوای تولیدکنندگان (Social Media and Creator Content)، بهره‌وری و فعالیت‌های دانشی (Productivity and Knowledge Work) و محصولات مصرفی (Consumer). همچنین در بخش‌های معماری (Architecture) و مرزهای هوش مصنوعی (Frontier) نیز شانه به شانه صدرنشین حرکت می‌کند.
  • عملیات‌های ویرایش تصویر (۳ از ۷ دسته): ویرایش متنی یا نمادها (Text or Symbol Edits)، ویرایش‌های مبتنی بر استدلال (Reasoning-Based Edit) و ترکیب‌بندی و کادربندی (Composition and Framing).
  • سناریوهای کاربردی ویرایش تصویر (۵ از ۱۰ دسته): بهره‌وری و فعالیت‌های دانشی، شبکه‌های اجتماعی و تولید محتوا، خرده‌فروشی و تجارت الکترونیک (Retail and Ecommerce)، انیمیشن و بازی‌سازی (Animation and Gaming) و طراحی رابط و تجربه کاربری (UI/UX Design).
لیدربورد
امتیاز Qwen-Image-2.1
مدل بعدی
اختلاف امتیاز
AA-Image-Editing v2.0 (ویرایش تصویر)
۱,۰۷۴
HunyuanImage 3.0 Instruct با امتیاز ۱,۰۶۶
+۸
AA-Image-T2I v2.0 (تولید تصویر از متن)
۱,۰۳۴
Ideogram 4.0 (Quality) با امتیاز ۱,۰۱۱
+۲۳

سیستم رتبه‌بندی الو (Elo) ترجیحات و مقایسه‌های دو‌به‌دو میان مدل‌ها را به یک امتیاز نسبی تبدیل می‌کند. این امتیازها در درون یک لیدربورد واحد قابل مقایسه هستند و ممکن است با اضافه شدن ارزیابی‌های تازه تغییر کنند. جالب اینکه پس از دو مدل برتر در بخش ویرایش تصویر، مدل Qwen Image Edit Plus 2511 با امتیاز الو ۱,۰۲۱ در جایگاه سوم قرار دارد.

نقاط اوج و درخشش امتیازها کجاست؟

اگر نتایج این مدل را در مقایسه با تمام مدل‌های باز و بسته دنیا بسنجیم، Qwen-Image-2.1 بیش‌ترین درخشش را در بخش‌های نورپردازی (Lighting)، دانش عمومی و تخصصی (Knowledge) و استدلال (Reasoning) از خود نشان داده است. این دسته‌بندی‌ها جزئیات حساسی مثل بازتاب‌ها، شکست نور، سایه‌پردازی‌ها، بناهای مشهور، گونه‌های جانوری و گیاهی، حقایق تخصصی، روابط فضایی، مفاهیم ریاضی و ایده‌های بصری ترکیبی را زیر ذره‌بین قرار می‌دهند.

در مقایسه با نسل قبلی یعنی Qwen Image 2.0، این چک‌پوینت تازه شکاف امتیازی را در تک‌تک قابلیت‌های تبدیل متن به تصویر کم‌تر کرده است. بیش‌ترین جهش عملکردی این نسخه در بخش‌های چیدمان، نورپردازی و درک دانش دیده می‌شود.

در بخش ویرایش تصویر نیز Qwen-Image-2.1 در زمینه «ویرایش صحنه و سبک» (Scene and Style Edit) که شامل تنظیم مجدد نور، تغییر استایل و تعویض پس‌زمینه می‌شود، عملکردی بسیار نزدیک به صدرنشین مطلق جدول دارد. پس از آن، ویرایش متن یا نمادها و بهبود و بازسازی تصویر بالا‌ترین امتیازها را کسب کرده‌اند. همچنین بزرگ‌ترین جهش نسلی این مدل در مقایسه با نسخه قبلی در حوزه‌های ویرایش متنی و نمادها، ویرایش در سطح اشیاء (Object-Level) و ویرایش با حفظ هویت سوژه (Identity-Preserving) اتفاق افتاده است.

البته باید واقع‌بین بود؛ مدل‌های تجاری و متن‌بسته همچنان رهبری کلی این حوزه را در دست دارند. در پلتفرم ارزیابی LMArena، مدل Qwen-Image-2.1 در ویرایش تصویر در رتبه ۱۶ و در تولید متن به تصویر در رتبه ۱۷ ایستاده است و غول‌های هوش مصنوعی مثل اوپنای‌آی (OpenAI)، گوگل، مایکروسافت، متا و xAI رتبه‌های بالا‌تر را تصاحب کرده‌اند. بنابراین ادعای رتبه اول این مدل صرفاً به دسته‌بندی مدل‌های با وزن باز در لیدربوردهای Artificial Analysis مربوط می‌شود.

محدودیت‌های حقوقی و تجاری در استقرار مدل

توافق‌نامه مجوز تحقیقاتی علی‌بابا (Qwen Research License Agreement) استفاده از این مدل را «صرفاً برای اهداف غیرتجاری» مجاز دانسته است. این یعنی استفاده تجاری و به‌کارگیری آن در محصولات نیازمند درخواست و دریافت مجوز اختصاصی از طریق ایمیل تجاری علی‌بابا خواهد بود.

نسخه‌های قبلی Qwen-Image تحت لایسنس مشهور آپاچی ۲.۰ (Apache 2.0) عرضه شده بودند که به تیم‌ها اجازه می‌داد به راحتی استفاده تجاری داشته باشند. بنابراین تیم‌هایی که قصد مهاجرت به نسخه ۲.۱ را دارند، باید قبل از اضافه کردن این چک‌پوینت به محصولات پولی، سرویس‌های ابری یا جریان‌های کاری درآمدزا، این توافق‌نامه حقوقی جدید را مدنظر قرار دهند.

نیازمندی‌های سخت‌افزاری و جریان‌های کاری مناسب

ستون فقرات تصویرسازی ۷ میلیارد پارامتری این مدل را می‌توان با ترفندهایی مانند کاهش دقت محاسباتی (Precision)، کوانتیزاسیون، آف‌لود کردن بخشی از پردازش به CPU یا بارگذاری مرحله‌ای اجزا، روی کارت‌های گرافیک مصرفی رده‌بالا (با حافظه بالا) اجرا کرد. پکیج حدوداً ۳۳ گیگابایتی این مدل از حافظه ویدیویی (VRAM) بسیاری از کارت‌های گرافیک معمولی بازار فراتر می‌رود و تولید نیتیو تصویر با وضوح 2K نیز فشار مضاعفی به حافظه وارد می‌کند. بنابراین نیازمندی‌های دقیق سخت‌افزاری کاملاً به محیط اجرایی و تنظیمات بهینه‌سازی شما بستگی دارد.

با توجه به مشخصات و نتایج بنچمارک‌ها، این مدل بیش از همه برای وظایف زیر کاربرد ایده‌آلی دارد:

  • دارایی‌های بصری با پس‌زمینه شفاف: ساخت اسپرایت‌ها، آیکون‌ها، پنل‌های رابط کاربری، استیکرها و تصاویر برش‌خورده محصولات به همراه کانال آلفا.
  • گرافیک‌های اطلاعاتی و اینفوگرافیک: طراحی نمودارها، اینفوگرافیک‌ها، چارت‌ها و اسلایدهای ارائه‌ای که نیاز مبرمی به چیدمان دقیق و رندر صحیح متن دارند.
  • گرافیک‌های تبلیغاتی: ساخت تامبنیل‌ها، پست‌های شبکه‌های اجتماعی و کارت‌های تبلیغاتی که متن‌های شاخص روی آنها نقش مهمی دارد.
  • ترکیب‌بندی با چند تصویر مرجع: جریان‌های کاری پیچیده‌ای که نیازمند ترکیب شخصیت‌ها، محصولات، پس‌زمینه‌ها و سبک‌های مختلف بر اساس تصاویر مرجع هستند.
  • ویرایش تصویر با دستور متنی: ویرایش‌هایی که نیازمند استدلال فضایی، حفظ هویت و چهره سوژه، یا درک و اجرای پرامپت‌های پیچیده هستند.

توسعه‌دهندگان و علاقه‌مندان هم‌اکنون می‌توانند خروجی‌های این مدل را در Image Arena مقایسه کنند، وزن‌های رسمی آن را از هاگینگ‌فیس یا ModelScope دانلود نمایند یا از ورک‌فلوی پشتیبانی‌شده در ComfyUI استفاده کنند. البته به یاد داشته باشید که راه‌اندازی شخصی و میزبانی غیرتجاری نیازمند سخت‌افزار مناسب و پذیرش لایسنس تحقیقاتی است و برای عرضه هرگونه محصول تجاری به بازار، نیاز به تأییدیه رسمی علی‌بابا خواهید داشت.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

ترکیب جادویی گویندگی و موسیقی متن فقط با یک پرامپت؛ قابلیت جذاب Suno Speech از راه رسید!
آخرین اخبار

ترکیب جادویی گویندگی و موسیقی متن فقط با یک پرامپت؛ قابلیت جذاب Suno Speech از راه رسید!

استارتاپ محبوب سونو با معرفی قابلیت آزمایشی Speech، گام هیجان‌انگیز دیگری در دنیای صوت برداشته است. این مدل هوش مصنوعی می‌تواند متن شما را تحویل بگیرد و هم‌زمان نریشن را همراه با موسیقی متنی هماهنگ در قالب یک قطعه صوتی یکپارچه بسازد. با این نوآوری، دردسرهای میکس و ادیت دستی صدا برای تولیدکنندگان محتوا به حداقل خواهد رسید.

۴ دقیقه مطالعه
۰
۱۰ مهر
آزمایش جنجالی روی ۱۰ مدل هوش مصنوعی: تعصب جنسیتی همه‌جا هست، اما با نتایجی کاملاً متناقض!
آخرین اخبار

آزمایش جنجالی روی ۱۰ مدل هوش مصنوعی: تعصب جنسیتی همه‌جا هست، اما با نتایجی کاملاً متناقض!

نتایج بررسی ۱۰ مدل زبانی بزرگ از ۹ شرکت نامدار نشان می‌دهد که سوگیری جنسیتی همچنان در هوش مصنوعی موج می‌زند، اما جهت‌گیری این تعصب‌ها در هر سیستم کاملاً متفاوت است. این ناهمگونی عجیب باعث شده تا توسعه‌دهندگان نتوانند نتایج یک مدل را به سایر مدل‌ها تعمیم دهند و ناچار باشند رفتار هر ابزار را جداگانه بسنجند.

۲ دقیقه مطالعه
۰
۱۰ مهر
خرابکاری بات‌ها و دیپ‌فیک‌ها در تحقیقات کاربری؛ بحران هویت‌های تقلبی بیخ گوش تیم‌های محصول!
آخرین اخبار

خرابکاری بات‌ها و دیپ‌فیک‌ها در تحقیقات کاربری؛ بحران هویت‌های تقلبی بیخ گوش تیم‌های محصول!

ابزار‌های در دسترس هوش مصنوعی و دیپ‌فیک‌ها کار جعل هویت را آن‌قدر آسان کرده‌اند که حالا بلای جان تحقیقات کاربری شده‌اند. طبق بررسی‌های جدید، ۹۵ درصد از پژوهشگران کیفی با ورود کاربران تقلبی مواجه شده‌اند؛ مشکلی جدی که داده‌های تیم‌های توسعه را مسموم کرده و مسیر ساخت محصولات دیجیتال را به بیراهه می‌برد.

۶ دقیقه مطالعه
۰
۱۰ مهر