پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

آن‌اسلاث مدل ۶ میلیاردی Z-Image علی‌بابا را تا ۳.۶ گیگابایت فشرده کرد؛ تولید تصویر با سرعت برق روی کارت‌های گرافیک خانگی

انتشار:۱۴ مهر ۱۴۰۵(۱ ساعت پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

تیم آن‌اسلاث (Unsloth) با انتشار نسخه‌های کم‌حجم مدل Z-Image-Turbo علی‌بابا تا مرز ۳.۶۴ گیگابایت، امکان اجرای این غول تصویرساز ۶ میلیارد پارامتری را روی کارت‌های گرافیک خانگی فراهم کرد. این مدل با معماری تک‌استریم و سرعت خارق‌العاده، تصاویر را در کم‌تر از یک ثانیه خلق می‌کند و تاکنون بیش از ۸۰۰ هزار بار دانلود شده است.

آن‌اسلاث مدل ۶ میلیاردی Z-Image علی‌بابا را تا ۳.۶ گیگابایت فشرده کرد؛ تولید تصویر با سرعت برق روی کارت‌های گرافیک خانگی

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • تیم Unsloth نسخه‌های فوق‌العاده سبک GGUF مدل Z-Image-Turbo علی‌بابا را منتشر کرد تا حجم این مدل ۶ میلیارد پارامتری از ۱۲.۳ گیگابایت به ۳.۶۴ گیگابایت برسد.
  • به لطف این فشرده‌سازی، توسعه‌دهندگان می‌توانند این هوش مصنوعی را با کارت‌های گرافیک معمولی و حافظه زیر ۱۶ گیگابایت به‌راحتی اجرا کنند.
  • این مدل با معماری تک‌استریم (S3-DiT) ساخته شده و با تنها ۸ ارزیابی تابعی، در کسری از ثانیه تصاویری باکیفیت و همراه با متن‌های انگلیسی و چینی خلق می‌کند.

فشرده‌سازی مدل ۶ میلیاردی Z-Image-Turbo تا ۳.۶۴ گیگابایت

تیم آن‌اسلاث (Unsloth) نسخه‌های کوانتیزه‌شده با فرمت GGUF را برای مدل Z-Image-Turbo متعلق به آزمایشگاه Tongyi-MAI علی‌بابا منتشر کرد؛ یک ترنسفورمر دیفیوژن تقطیرشده که تصاویر را تنها با ۸ ارزیابی تابعی تولید می‌کند. وزن‌های عرضه‌شده تنوع بالایی دارند و از نسخه سبک ۳.۶۴ گیگابایتی Q2_K تا نسخه‌های ۱۲.۳ گیگابایتی BF16 و F16 را پوشش می‌دهند.

توسعه‌دهندگان با فدا کردن بخش کوچکی از دقت در ازای کاهش چشمگیر مصرف حافظه، می‌توانند به کمک کوانتیزه‌سازی و تکنیک آف‌لود روی پردازنده اصلی (CPU Offloading)، این مدل را روی کارت‌های گرافیک مصرفی و خانگی اجرا کنند. این مدل تحت مجوز آپاچی ۲.۰ (Apache 2.0) منتشر شده، توانایی رندر متن‌های انگلیسی و چینی درون تصویر را دارد و طبق گزارش‌ها، سرعت تولید تصویر آن روی پردازشگر گرافیکی H800 به زیر یک ثانیه می‌رسد. جالب است بدانید تا لحظه انتشار این گزارش، مخزن GGUF این مدل بیش از ۸۰۰ هزار بار دانلود شده است (شمارنده هاگینگ فیس تعداد دانلود فایل‌ها را ثبت می‌کند که ممکن است شامل چندین بار دانلود توسط یک کاربر هم باشد).

  • اندازه مدل: ۶ میلیارد پارامتر
  • برنامه تولید تصویر: ۸ ارزیابی تابعی در قالب ۹ گام در پایپ‌لاین اجرایی
  • کوچک‌ترین نسخه GGUF: ۳.۶۴ گیگابایت در فرمت Q2_K
  • مجوز انتشار: آپاچی ۲.۰ (Apache 2.0)
  • نسخه‌های در دست انتشار: نسخه پایه Z-Image-Base و ویرایش تصویر Z-Image-Edit

یک جریان پردازشی واحد برای تمام مدالیته‌ها

علی‌بابا معماری Z-Image را بر پایه ترنسفورمر دیفیوژن تک‌استریم مقیاس‌پذیر (معروف به S3-DiT) پیاده‌سازی کرده است. در این معماری، توکن‌های متن، توکن‌های معنایی بصری و توکن‌های تصویر فشرده‌شده با VAE همگی در یک توالی واحد قرار می‌گیرند؛ موضوعی که به لایه‌های ترنسفورمر اجازه می‌دهد اطلاعات تمام مدالیته‌ها را به‌صورت یکپارچه پردازش کنند.

این در حالی است که معماری‌های دوجریانی (Dual-stream) مانند SD3 و FLUX، شاخه‌های مجزایی از ترنسفورمر را به متن و تصویر اختصاص داده و در ادامه آن‌ها را با هم ترکیب می‌کنند. جریان مشترک Z-Image قصد دارد از بودجه پارامترهای خود به شکلی بسیار بهینه‌تر استفاده کند. در این ساختار، VAE یک نمایش فشرده از تصویر فراهم می‌آورد و توکن‌های معنایی بصری نیز اطلاعات سطح بالاتری درباره محتوای تصویر ارائه می‌دهند.

نمودار معماری S3-DiT در مدل Z-Image
مدل Z-Image توکن‌های متن، معنایی و VAE را در یک جریان مشترک ترنسفورمر پردازش می‌کند.

مدل توربو؛ هدف‌گیری سرعت با ۸ ارزیابی تابعی

مدل Z-Image-Turbo نسخه تقطیرشده و چابک این خانواده محسوب می‌شود. تنظیمات پیشنهادی کتابخانه Diffusers برای آن شامل num_inference_steps=9 و guidance_scale=0.0 است که دقیقاً با شیوه تولید ۸ ارزیابی پروژه سازگاری دارد.

تیم تانگ‌یی-ام‌ای‌آی (Tongyi-MAI) از ثبت تاخیر زیر یک ثانیه روی پردازنده سازمانی H800 خبر داده و هدفش اجرای بی‌دردسر مدل روی سخت‌افزارهای مصرفی با حافظه ویدئویی ۱۶ گیگابایت است. البته تاخیر و مصرف واقعی حافظه به عواملی مانند رزولوشن، دقت محاسباتی، شیوه پیاده‌سازی مکانیزم توجه (Attention)، آف‌لودینگ و ماندن انکودر متنی و VAE روی حافظه کارت گرافیک بستگی دارد.

نسخه برنامه‌ریزی‌شده Z-Image-Base در آینده به عنوان یک مدل پایه دست‌نخورده برای فاین‌تیونینگ عرضه خواهد شد و نسخه Z-Image-Edit قابلیت تصویر به تصویر (Image-to-Image) را اضافه خواهد کرد؛ نسخه‌هایی که هیچ‌کدام همراه با انتشار اولیه مدل توربو عرضه نشده بودند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

بازگشت باشکوه پردازنده‌ها به دنیای هوش مصنوعی؛ ایجنت‌های جدید چطور به داد AMD رسیدند؟
آخرین اخبار

بازگشت باشکوه پردازنده‌ها به دنیای هوش مصنوعی؛ ایجنت‌های جدید چطور به داد AMD رسیدند؟

با محبوبیت انفجاری ایجنت‌های هوش مصنوعی مانند Muse متا و Dots اوپن‌ای‌آی، بازار پردازنده‌های مرکزی (CPU) پس از سال‌ها سلطه کارت‌های گرافیک دوباره داغ شده است. این ایجنت‌ها ساعت‌ها در پس‌زمینه کار می‌کنند و بخش عمده بار اجرایی آن‌ها به جای پردازنده‌های گرافیکی گران‌قیمت، مستقیماً روی دوش پردازنده‌های AMD افتاده است. این تحول جذاب ارزش بازار AMD را وارد باشگاه یک تریلیون دلاری کرده و رقابتی تازه میان غول‌های تراشه‌سازی به راه انداخته است.

۶ دقیقه مطالعه
۰
۱۴ مهر
کلاهبرداری‌های هوش مصنوعی وحشتناک واقعی شده‌اند؛ ۴ زنگ خطر که نباید نادیده بگیرید!
آخرین اخبار

کلاهبرداری‌های هوش مصنوعی وحشتناک واقعی شده‌اند؛ ۴ زنگ خطر که نباید نادیده بگیرید!

این روز‌ها کلاهبرداری با هوش مصنوعی و شبیه‌سازی صدا به قدری باورپذیر شده که حتی حرفه‌ای‌های دنیای فناوری هم ممکن است فریب بخورند. از تماس‌های جعلی با صدای عزیزان گرفته تا ایمیل‌های فیشینگ بی‌نقص، مهاجمان شیوه‌های نوینی برای فریب قربانیان پیدا کرده‌اند. در این راهنما، با ۴ زنگ خطر کلیدی آشنا می‌شوید تا در دام سناریوهای فریبنده هوش مصنوعی نیفتید.

۴ دقیقه مطالعه
۰
۱۴ مهر
چرا نظارت و شفافیت تنها سپر واقعی شرکت‌ها در برابر ریسک‌های حاکمیت هوش مصنوعی است؟
آخرین اخبار

چرا نظارت و شفافیت تنها سپر واقعی شرکت‌ها در برابر ریسک‌های حاکمیت هوش مصنوعی است؟

ماجرای قطع ناگهانی دسترسی به مدل‌های پیشرفته آنتروپیک زنگ خطری جدی برای کسب‌وکارها بود؛ وابستگی شدید به چند غول فناوری و تصمیمات غیرمنتظره دولت‌ها می‌تواند در یک شب فرآیندهای تجاری را مختل کند. در چنین شرایطی، تنها راه نجات سازمان‌ها ایجاد شفافیت کامل در شناسایی ابزار‌های هوش مصنوعی فعال و تقویت نظارت داخلی برای حفظ تاب‌آوری است.

۵ دقیقه مطالعه
۰
۱۴ مهر