آناسلاث مدل ۶ میلیاردی Z-Image علیبابا را تا ۳.۶ گیگابایت فشرده کرد؛ تولید تصویر با سرعت برق روی کارتهای گرافیک خانگی
تیم آناسلاث (Unsloth) با انتشار نسخههای کمحجم مدل Z-Image-Turbo علیبابا تا مرز ۳.۶۴ گیگابایت، امکان اجرای این غول تصویرساز ۶ میلیارد پارامتری را روی کارتهای گرافیک خانگی فراهم کرد. این مدل با معماری تکاستریم و سرعت خارقالعاده، تصاویر را در کمتر از یک ثانیه خلق میکند و تاکنون بیش از ۸۰۰ هزار بار دانلود شده است.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- تیم Unsloth نسخههای فوقالعاده سبک GGUF مدل Z-Image-Turbo علیبابا را منتشر کرد تا حجم این مدل ۶ میلیارد پارامتری از ۱۲.۳ گیگابایت به ۳.۶۴ گیگابایت برسد.
- به لطف این فشردهسازی، توسعهدهندگان میتوانند این هوش مصنوعی را با کارتهای گرافیک معمولی و حافظه زیر ۱۶ گیگابایت بهراحتی اجرا کنند.
- این مدل با معماری تکاستریم (S3-DiT) ساخته شده و با تنها ۸ ارزیابی تابعی، در کسری از ثانیه تصاویری باکیفیت و همراه با متنهای انگلیسی و چینی خلق میکند.
فشردهسازی مدل ۶ میلیاردی Z-Image-Turbo تا ۳.۶۴ گیگابایت
تیم آناسلاث (Unsloth) نسخههای کوانتیزهشده با فرمت GGUF را برای مدل Z-Image-Turbo متعلق به آزمایشگاه Tongyi-MAI علیبابا منتشر کرد؛ یک ترنسفورمر دیفیوژن تقطیرشده که تصاویر را تنها با ۸ ارزیابی تابعی تولید میکند. وزنهای عرضهشده تنوع بالایی دارند و از نسخه سبک ۳.۶۴ گیگابایتی Q2_K تا نسخههای ۱۲.۳ گیگابایتی BF16 و F16 را پوشش میدهند.
توسعهدهندگان با فدا کردن بخش کوچکی از دقت در ازای کاهش چشمگیر مصرف حافظه، میتوانند به کمک کوانتیزهسازی و تکنیک آفلود روی پردازنده اصلی (CPU Offloading)، این مدل را روی کارتهای گرافیک مصرفی و خانگی اجرا کنند. این مدل تحت مجوز آپاچی ۲.۰ (Apache 2.0) منتشر شده، توانایی رندر متنهای انگلیسی و چینی درون تصویر را دارد و طبق گزارشها، سرعت تولید تصویر آن روی پردازشگر گرافیکی H800 به زیر یک ثانیه میرسد. جالب است بدانید تا لحظه انتشار این گزارش، مخزن GGUF این مدل بیش از ۸۰۰ هزار بار دانلود شده است (شمارنده هاگینگ فیس تعداد دانلود فایلها را ثبت میکند که ممکن است شامل چندین بار دانلود توسط یک کاربر هم باشد).
- اندازه مدل: ۶ میلیارد پارامتر
- برنامه تولید تصویر: ۸ ارزیابی تابعی در قالب ۹ گام در پایپلاین اجرایی
- کوچکترین نسخه GGUF: ۳.۶۴ گیگابایت در فرمت Q2_K
- مجوز انتشار: آپاچی ۲.۰ (Apache 2.0)
- نسخههای در دست انتشار: نسخه پایه Z-Image-Base و ویرایش تصویر Z-Image-Edit
یک جریان پردازشی واحد برای تمام مدالیتهها
علیبابا معماری Z-Image را بر پایه ترنسفورمر دیفیوژن تکاستریم مقیاسپذیر (معروف به S3-DiT) پیادهسازی کرده است. در این معماری، توکنهای متن، توکنهای معنایی بصری و توکنهای تصویر فشردهشده با VAE همگی در یک توالی واحد قرار میگیرند؛ موضوعی که به لایههای ترنسفورمر اجازه میدهد اطلاعات تمام مدالیتهها را بهصورت یکپارچه پردازش کنند.
این در حالی است که معماریهای دوجریانی (Dual-stream) مانند SD3 و FLUX، شاخههای مجزایی از ترنسفورمر را به متن و تصویر اختصاص داده و در ادامه آنها را با هم ترکیب میکنند. جریان مشترک Z-Image قصد دارد از بودجه پارامترهای خود به شکلی بسیار بهینهتر استفاده کند. در این ساختار، VAE یک نمایش فشرده از تصویر فراهم میآورد و توکنهای معنایی بصری نیز اطلاعات سطح بالاتری درباره محتوای تصویر ارائه میدهند.

مدل توربو؛ هدفگیری سرعت با ۸ ارزیابی تابعی
مدل Z-Image-Turbo نسخه تقطیرشده و چابک این خانواده محسوب میشود. تنظیمات پیشنهادی کتابخانه Diffusers برای آن شامل num_inference_steps=9 و guidance_scale=0.0 است که دقیقاً با شیوه تولید ۸ ارزیابی پروژه سازگاری دارد.
تیم تانگیی-امایآی (Tongyi-MAI) از ثبت تاخیر زیر یک ثانیه روی پردازنده سازمانی H800 خبر داده و هدفش اجرای بیدردسر مدل روی سختافزارهای مصرفی با حافظه ویدئویی ۱۶ گیگابایت است. البته تاخیر و مصرف واقعی حافظه به عواملی مانند رزولوشن، دقت محاسباتی، شیوه پیادهسازی مکانیزم توجه (Attention)، آفلودینگ و ماندن انکودر متنی و VAE روی حافظه کارت گرافیک بستگی دارد.
نسخه برنامهریزیشده Z-Image-Base در آینده به عنوان یک مدل پایه دستنخورده برای فاینتیونینگ عرضه خواهد شد و نسخه Z-Image-Edit قابلیت تصویر به تصویر (Image-to-Image) را اضافه خواهد کرد؛ نسخههایی که هیچکدام همراه با انتشار اولیه مدل توربو عرضه نشده بودند.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

بازگشت باشکوه پردازندهها به دنیای هوش مصنوعی؛ ایجنتهای جدید چطور به داد AMD رسیدند؟
با محبوبیت انفجاری ایجنتهای هوش مصنوعی مانند Muse متا و Dots اوپنایآی، بازار پردازندههای مرکزی (CPU) پس از سالها سلطه کارتهای گرافیک دوباره داغ شده است. این ایجنتها ساعتها در پسزمینه کار میکنند و بخش عمده بار اجرایی آنها به جای پردازندههای گرافیکی گرانقیمت، مستقیماً روی دوش پردازندههای AMD افتاده است. این تحول جذاب ارزش بازار AMD را وارد باشگاه یک تریلیون دلاری کرده و رقابتی تازه میان غولهای تراشهسازی به راه انداخته است.

کلاهبرداریهای هوش مصنوعی وحشتناک واقعی شدهاند؛ ۴ زنگ خطر که نباید نادیده بگیرید!
این روزها کلاهبرداری با هوش مصنوعی و شبیهسازی صدا به قدری باورپذیر شده که حتی حرفهایهای دنیای فناوری هم ممکن است فریب بخورند. از تماسهای جعلی با صدای عزیزان گرفته تا ایمیلهای فیشینگ بینقص، مهاجمان شیوههای نوینی برای فریب قربانیان پیدا کردهاند. در این راهنما، با ۴ زنگ خطر کلیدی آشنا میشوید تا در دام سناریوهای فریبنده هوش مصنوعی نیفتید.

چرا نظارت و شفافیت تنها سپر واقعی شرکتها در برابر ریسکهای حاکمیت هوش مصنوعی است؟
ماجرای قطع ناگهانی دسترسی به مدلهای پیشرفته آنتروپیک زنگ خطری جدی برای کسبوکارها بود؛ وابستگی شدید به چند غول فناوری و تصمیمات غیرمنتظره دولتها میتواند در یک شب فرآیندهای تجاری را مختل کند. در چنین شرایطی، تنها راه نجات سازمانها ایجاد شفافیت کامل در شناسایی ابزارهای هوش مصنوعی فعال و تقویت نظارت داخلی برای حفظ تابآوری است.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.