شاهکار جدید علیبابا در دنیای تصویرسازی؛ مدل Qwen-Image-2.1 صدرنشین لیدربوردهای هوش مصنوعی شد!
غول فناوری چین یعنی علیبابا با عرضه مدل جدید Qwen-Image-2.1 حسابی سروصدا به پا کرده و موفق شده رتبه نخست لیدربوردهای تبدیل متن به تصویر و ویرایش تصویر Artificial Analysis را در دسته مدلهای با وزن باز تصاحب کند. این هوش مصنوعی ۷ میلیارد پارامتری نهتنها کیفیت تصویرسازی خیرهکنندهای با وضوح 2K ارائه میدهد، بلکه امکان تولید داراییهای بصری با پسزمینه شفاف (RGBA) و ویرایش هوشمند را در یک پکیج واحد برای توسعهدهندگان به ارمغان آورده است.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- مدل جدید Qwen-Image-2.1 ساخت شرکت علیبابا با عبور از رقبای قدرتمندی مثل Ideogram 4.0 و HunyuanImage، رتبه اول مدلهای با وزن باز را در دو بنچمارک معتبر Artificial Analysis از آنِ خود کرد.
- این غول تصویرسازی علاوه بر خروجی نیتیو با وضوح 2K، قابلیت تولید تصاویر شفاف با کانال آلفا (RGBA) و دریافت همزمان ۱۰ تصویر مرجع برای ویرایشهای مبتنی بر استدلال را دارد.
- با وجود دسترسی به فایل ۳۳ گیگابایتی وزنها روی هاگینگفیس و کامفییوآی، لایسنس تحقیقاتی جدید علیبابا استفاده تجاری از این مدل را منوط به دریافت مجوز رسمی کرده است.
صدرنشینی Qwen-Image-2.1 در دو لیدربورد تصویرسازی مدلهای وزنباز
مدل جدید Qwen-Image-2.1 از غول چینی علیبابا، حالا رسماً بر قله مدلهای با وزن باز (Open-Weight) در لیدربوردهای AA-Image-T2I v2.0 (تولید تصویر از متن) و AA-Image-Editing v2.0 (ویرایش تصویر) وبسایت تحلیلی Artificial Analysis تکیه زده است. این شاهکار تازه موفق شده مدل مطرح Ideogram 4.0 (Quality) را در بخش تولید تصویر و مدل HunyuanImage 3.0 Instruct (متعلق به تنسنت) را در بخش ادیت تصویر کنار بزند و رتبه یک را تصاحب کند.
برای توسعهدهندگان، این انتشار یک خبر فوقالعاده است؛ چون تولید تصویر، ویرایش، خروجی شفاف و هدایت با چندین تصویر مرجع همگی درون یک چکپوینت دانلودی گردآوری شدهاند. البته منظور از «وزن باز» (Open-weight)، امکان دسترسی به پارامترهای مدل است؛ اما حقوق استفاده و استقرار آن تحت یک مجوز تحقیقاتی محدودکننده ارائه شده که استفاده تجاری مستقیم را محدود میکند.
جالب است بدانید اگر مدلهای تجاری و اختصاصی (بستهمنبع) را هم به این رقابت اضافه کنیم، Qwen-Image-2.1 در بنچمارک Artificial Analysis هم در تولید تصویر و هم در ویرایش به رتبه ۱۸ دنیا میرسد. این یک جهش چشمگیر در مقایسه با نسخه قبلی یعنی Qwen Image 2.0 است که به ترتیب رتبههای ۷۲ و ۵۸ را در دست داشت. افزون بر این، این مدل در ۱۶ دستهبندی از مجموع ۳۶ دسته توانمندی و کاربردی این بنچمارک، پیشتاز میدان است.
یک چکپوینت، دو مأموریت سنگین تصویرسازی
علیبابا در پست معرفی این مدل اعلام کرده که تنها با یک چکپوینت یکپارچه، هم کار تولید تصویر از روی متن انجام میشود و هم ویرایش تصویر بر پایه دستورات متنی کاربر (Instruction-based). این مدل تصاویری با رزولوشن نیتیو ۲,۰۴۸ در ۲,۰۴۸ پیکسل تولید میکند، توانایی دریافت حداکثر ۱۰ تصویر مرجع در هر درخواست را دارد و خروجی RGBA با پسزمینه شفاف ارائه میدهد.
بخش مدل | مشخصات فنی |
|---|---|
ستون فقرات تصویرسازی (Image backbone) | ترنسفورمر دیفیوژن تکجریانی ۳۲ لایهای با ۷ میلیارد پارامتر |
انکودر پرامپت (Prompt encoder) | Qwen3-VL 8B |
کدک تصویر (Image codec) | اتوانکودر متغیر (VAE) ۶۴ کاناله RGBA با فشردهسازی فضایی ۱۶ برابری |
رزولوشن خروجی نیتیو | ۲,۰۴۸ در ۲,۰۴۸ پیکسل |
ورودی تصاویر مرجع | حداکثر ۱۰ تصویر در هر مرحله تولید |
حجم فایل دانلودی | حدود ۳۳ گیگابایت برای تمامی اجزای مدل |
مجوز (License) | توافقنامه مجوز تحقیقاتی Qwen (استفاده تجاری نیازمند مجوز جداگانه است) |
ترنسفورمر دیفیوژن یا همان DiT، ساختار معماری ترنسفورمر را در فرایند نویززدایی مورد نیاز برای تولید تصویر به کار میگیرد. در این سیستم، انکودر قدرتمند Qwen3-VL وظیفه تفسیر پرامپتها و تصاویر مرجع را به دوش میکشد، در حالی که اتوانکودر متغیر (VAE) ابتدا تصاویر را به یک نمایش نهفته (Latent) فشردهتر تبدیل کرده و در نهایت خروجی نهایی را دیکود و بازسازی میکند.
نکته جذاب اینجاست که اتوانکودر RGBA علاوه بر سه رنگ اصلی قرمز، سبز و آبی، کانال آلفا (شفافیت) را هم حفظ میکند. این یعنی خطوط لوله و پایپلاینهای سازگار میتوانند مستقیماً فایلهای شفاف PNG تولید و ذخیره کنند و دیگر هیچ نیازی به ابزارهای جانبی برای حذف پسزمینه تصویر نخواهد بود.
پکیج دانلودی کامل شامل ستون فقرات تصویرسازی، انکودر و اتوانکودر است. میزان حافظه رم ویدیویی (VRAM) مورد نیاز در زمان اجرا، به دقت محاسباتی، رزولوشن خروجی، کوانتیزاسیون، آفلود کردن اجزا روی پردازنده اصلی (CPU Offloading) و تصمیم شما مبنی بر بارگذاری همزمان همه اجزا در حافظه گرافیکی بستگی دارد.
- وزنهای مدل: از طریق پلتفرمهای Hugging Face و ModelScope در دسترس است.
- پایپلاینهای پایتون: کتابخانه Diffusers از همان روز نخست پشتیبانی کامل از این مدل را اضافه کرده است.
- ورکفلوهای بصری: پلتفرم ComfyUI یک قالب آماده و اختصاصی برای کار با این مدل فراهم کرده است.
- پشتههای استقرار و سرویسدهی: فریمورکهای vLLM-Omni، SGLang و LightX2V همگی از این مدل پشتیبانی میکنند.
پیشتازی در ۱۶ دستهبندی مختلف
بنچمارک Artificial Analysis ارزیابیهای خود را به ۹ قابلیت و ۱۰ سناریوی کاربردی در تولید تصویر از متن، و ۷ نوع ویرایش و ۱۰ سناریوی کاربردی در ویرایش تصویر تقسیمبندی میکند. مدل Qwen-Image-2.1 در میان مدلهای با وزن باز در دستههای زیر در رتبه اول قرار گرفته است:
- قابلیتهای تولید متن به تصویر (۵ از ۹ دسته): ترکیببندیهای پیچیده (Complex Compositions)، رندر متن در تصویر (Text Rendering)، دانش و اطلاعات (Knowledge)، چینش و چیدمان (Layout) و نورپردازی (Lighting).
- سناریوهای کاربردی تولید متن به تصویر (۳ از ۱۰ دسته): شبکههای اجتماعی و محتوای تولیدکنندگان (Social Media and Creator Content)، بهرهوری و فعالیتهای دانشی (Productivity and Knowledge Work) و محصولات مصرفی (Consumer). همچنین در بخشهای معماری (Architecture) و مرزهای هوش مصنوعی (Frontier) نیز شانه به شانه صدرنشین حرکت میکند.
- عملیاتهای ویرایش تصویر (۳ از ۷ دسته): ویرایش متنی یا نمادها (Text or Symbol Edits)، ویرایشهای مبتنی بر استدلال (Reasoning-Based Edit) و ترکیببندی و کادربندی (Composition and Framing).
- سناریوهای کاربردی ویرایش تصویر (۵ از ۱۰ دسته): بهرهوری و فعالیتهای دانشی، شبکههای اجتماعی و تولید محتوا، خردهفروشی و تجارت الکترونیک (Retail and Ecommerce)، انیمیشن و بازیسازی (Animation and Gaming) و طراحی رابط و تجربه کاربری (UI/UX Design).
لیدربورد | امتیاز Qwen-Image-2.1 | مدل بعدی | اختلاف امتیاز |
|---|---|---|---|
AA-Image-Editing v2.0 (ویرایش تصویر) | ۱,۰۷۴ | HunyuanImage 3.0 Instruct با امتیاز ۱,۰۶۶ | +۸ |
AA-Image-T2I v2.0 (تولید تصویر از متن) | ۱,۰۳۴ | Ideogram 4.0 (Quality) با امتیاز ۱,۰۱۱ | +۲۳ |
سیستم رتبهبندی الو (Elo) ترجیحات و مقایسههای دوبهدو میان مدلها را به یک امتیاز نسبی تبدیل میکند. این امتیازها در درون یک لیدربورد واحد قابل مقایسه هستند و ممکن است با اضافه شدن ارزیابیهای تازه تغییر کنند. جالب اینکه پس از دو مدل برتر در بخش ویرایش تصویر، مدل Qwen Image Edit Plus 2511 با امتیاز الو ۱,۰۲۱ در جایگاه سوم قرار دارد.
نقاط اوج و درخشش امتیازها کجاست؟
اگر نتایج این مدل را در مقایسه با تمام مدلهای باز و بسته دنیا بسنجیم، Qwen-Image-2.1 بیشترین درخشش را در بخشهای نورپردازی (Lighting)، دانش عمومی و تخصصی (Knowledge) و استدلال (Reasoning) از خود نشان داده است. این دستهبندیها جزئیات حساسی مثل بازتابها، شکست نور، سایهپردازیها، بناهای مشهور، گونههای جانوری و گیاهی، حقایق تخصصی، روابط فضایی، مفاهیم ریاضی و ایدههای بصری ترکیبی را زیر ذرهبین قرار میدهند.
در مقایسه با نسل قبلی یعنی Qwen Image 2.0، این چکپوینت تازه شکاف امتیازی را در تکتک قابلیتهای تبدیل متن به تصویر کمتر کرده است. بیشترین جهش عملکردی این نسخه در بخشهای چیدمان، نورپردازی و درک دانش دیده میشود.
در بخش ویرایش تصویر نیز Qwen-Image-2.1 در زمینه «ویرایش صحنه و سبک» (Scene and Style Edit) که شامل تنظیم مجدد نور، تغییر استایل و تعویض پسزمینه میشود، عملکردی بسیار نزدیک به صدرنشین مطلق جدول دارد. پس از آن، ویرایش متن یا نمادها و بهبود و بازسازی تصویر بالاترین امتیازها را کسب کردهاند. همچنین بزرگترین جهش نسلی این مدل در مقایسه با نسخه قبلی در حوزههای ویرایش متنی و نمادها، ویرایش در سطح اشیاء (Object-Level) و ویرایش با حفظ هویت سوژه (Identity-Preserving) اتفاق افتاده است.
البته باید واقعبین بود؛ مدلهای تجاری و متنبسته همچنان رهبری کلی این حوزه را در دست دارند. در پلتفرم ارزیابی LMArena، مدل Qwen-Image-2.1 در ویرایش تصویر در رتبه ۱۶ و در تولید متن به تصویر در رتبه ۱۷ ایستاده است و غولهای هوش مصنوعی مثل اوپنایآی (OpenAI)، گوگل، مایکروسافت، متا و xAI رتبههای بالاتر را تصاحب کردهاند. بنابراین ادعای رتبه اول این مدل صرفاً به دستهبندی مدلهای با وزن باز در لیدربوردهای Artificial Analysis مربوط میشود.
محدودیتهای حقوقی و تجاری در استقرار مدل
توافقنامه مجوز تحقیقاتی علیبابا (Qwen Research License Agreement) استفاده از این مدل را «صرفاً برای اهداف غیرتجاری» مجاز دانسته است. این یعنی استفاده تجاری و بهکارگیری آن در محصولات نیازمند درخواست و دریافت مجوز اختصاصی از طریق ایمیل تجاری علیبابا خواهد بود.
نسخههای قبلی Qwen-Image تحت لایسنس مشهور آپاچی ۲.۰ (Apache 2.0) عرضه شده بودند که به تیمها اجازه میداد به راحتی استفاده تجاری داشته باشند. بنابراین تیمهایی که قصد مهاجرت به نسخه ۲.۱ را دارند، باید قبل از اضافه کردن این چکپوینت به محصولات پولی، سرویسهای ابری یا جریانهای کاری درآمدزا، این توافقنامه حقوقی جدید را مدنظر قرار دهند.
نیازمندیهای سختافزاری و جریانهای کاری مناسب
ستون فقرات تصویرسازی ۷ میلیارد پارامتری این مدل را میتوان با ترفندهایی مانند کاهش دقت محاسباتی (Precision)، کوانتیزاسیون، آفلود کردن بخشی از پردازش به CPU یا بارگذاری مرحلهای اجزا، روی کارتهای گرافیک مصرفی ردهبالا (با حافظه بالا) اجرا کرد. پکیج حدوداً ۳۳ گیگابایتی این مدل از حافظه ویدیویی (VRAM) بسیاری از کارتهای گرافیک معمولی بازار فراتر میرود و تولید نیتیو تصویر با وضوح 2K نیز فشار مضاعفی به حافظه وارد میکند. بنابراین نیازمندیهای دقیق سختافزاری کاملاً به محیط اجرایی و تنظیمات بهینهسازی شما بستگی دارد.
با توجه به مشخصات و نتایج بنچمارکها، این مدل بیش از همه برای وظایف زیر کاربرد ایدهآلی دارد:
- داراییهای بصری با پسزمینه شفاف: ساخت اسپرایتها، آیکونها، پنلهای رابط کاربری، استیکرها و تصاویر برشخورده محصولات به همراه کانال آلفا.
- گرافیکهای اطلاعاتی و اینفوگرافیک: طراحی نمودارها، اینفوگرافیکها، چارتها و اسلایدهای ارائهای که نیاز مبرمی به چیدمان دقیق و رندر صحیح متن دارند.
- گرافیکهای تبلیغاتی: ساخت تامبنیلها، پستهای شبکههای اجتماعی و کارتهای تبلیغاتی که متنهای شاخص روی آنها نقش مهمی دارد.
- ترکیببندی با چند تصویر مرجع: جریانهای کاری پیچیدهای که نیازمند ترکیب شخصیتها، محصولات، پسزمینهها و سبکهای مختلف بر اساس تصاویر مرجع هستند.
- ویرایش تصویر با دستور متنی: ویرایشهایی که نیازمند استدلال فضایی، حفظ هویت و چهره سوژه، یا درک و اجرای پرامپتهای پیچیده هستند.
توسعهدهندگان و علاقهمندان هماکنون میتوانند خروجیهای این مدل را در Image Arena مقایسه کنند، وزنهای رسمی آن را از هاگینگفیس یا ModelScope دانلود نمایند یا از ورکفلوی پشتیبانیشده در ComfyUI استفاده کنند. البته به یاد داشته باشید که راهاندازی شخصی و میزبانی غیرتجاری نیازمند سختافزار مناسب و پذیرش لایسنس تحقیقاتی است و برای عرضه هرگونه محصول تجاری به بازار، نیاز به تأییدیه رسمی علیبابا خواهید داشت.
مطالب مرتبط و پیشنهادی

ترکیب جادویی گویندگی و موسیقی متن فقط با یک پرامپت؛ قابلیت جذاب Suno Speech از راه رسید!
استارتاپ محبوب سونو با معرفی قابلیت آزمایشی Speech، گام هیجانانگیز دیگری در دنیای صوت برداشته است. این مدل هوش مصنوعی میتواند متن شما را تحویل بگیرد و همزمان نریشن را همراه با موسیقی متنی هماهنگ در قالب یک قطعه صوتی یکپارچه بسازد. با این نوآوری، دردسرهای میکس و ادیت دستی صدا برای تولیدکنندگان محتوا به حداقل خواهد رسید.

آزمایش جنجالی روی ۱۰ مدل هوش مصنوعی: تعصب جنسیتی همهجا هست، اما با نتایجی کاملاً متناقض!
نتایج بررسی ۱۰ مدل زبانی بزرگ از ۹ شرکت نامدار نشان میدهد که سوگیری جنسیتی همچنان در هوش مصنوعی موج میزند، اما جهتگیری این تعصبها در هر سیستم کاملاً متفاوت است. این ناهمگونی عجیب باعث شده تا توسعهدهندگان نتوانند نتایج یک مدل را به سایر مدلها تعمیم دهند و ناچار باشند رفتار هر ابزار را جداگانه بسنجند.

خرابکاری باتها و دیپفیکها در تحقیقات کاربری؛ بحران هویتهای تقلبی بیخ گوش تیمهای محصول!
ابزارهای در دسترس هوش مصنوعی و دیپفیکها کار جعل هویت را آنقدر آسان کردهاند که حالا بلای جان تحقیقات کاربری شدهاند. طبق بررسیهای جدید، ۹۵ درصد از پژوهشگران کیفی با ورود کاربران تقلبی مواجه شدهاند؛ مشکلی جدی که دادههای تیمهای توسعه را مسموم کرده و مسیر ساخت محصولات دیجیتال را به بیراهه میبرد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.