شاهکار فشردهسازی برای ComfyUI؛ مدل بینایی ۲۷ میلیاردی Mitsuba فقط با ۷.۳ گیگابایت حافظه!
توسعهدهندگان موفق شدند مدل بینایی ۲۷ میلیارد پارامتری Mitsuba را با تکنیک کوانتایزیشن سهتایی تا ۷.۳ گیگابایت فشرده کنند تا بهراحتی در سیستمهای محلی ComfyUI اجرا شود. این مدل تخصصی میتواند تصاویر را دقیقاً تحلیل کرده و پرامپتهای تفکیکشده و جزئی برای ابزارهای تولید تصویر و ویدیو بنویسد. با این بهینهسازی شگفتانگیز، اجرای محلی یک مدل بینایی بزرگ روی یک کارت گرافیک ۱۶ گیگابایتی به واقعیت تبدیل شده است.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- مدل بینایی ۲۷ میلیاردی Mitsuba-ComfyUI برای تبدیل تصویر به پرامپت دقیق در ورکفلوهای ComfyUI بهینهسازی شده و کارش ساخت توصیفها، پرامپتهای منفی و دستورات ویدیویی است.
- به لطف کوانتایزیشن سهتایی (Ternary)، حجم این مدل غولپیکر تا ۷.۳ گیگابایت پایین آمده تا با فرمت GGUF بهراحتی روی سیستمهای معمولی لود شود.
- این غول فشردهشده فقط با یک پردازنده گرافیکی ۱۶ گیگابایتی کار میکند و سرعت تولید متن آن روی کارت گرافیک RTX 5090 به ۱۱۹ توکن در ثانیه میرسد.
فشردهسازی مدل بینایی ۲۷ میلیاردی Mitsuba برای نوشتن پرامپت در ComfyUI
مدل Mitsuba-ComfyUI-27B-GGUF یک مدل بینایی-زبانی ۲۷ میلیارد پارامتری است که وظیفه تحلیل تصاویر و تولید پرامپتهای دقیق و بهینهسازیشده برای مدلهای تولید تصویر و ویدیو را بر عهده دارد. یک توسعهدهنده ژاپنی با نام مستعار isichan-ai، این مدل را که بر پایه Qwen3.8-27B توسعه یافته، برای ساخت تگهای استیبل دیفیوژن (Stable Diffusion)، دستورالعملهای زمانبندیشده ویدیویی، پرامپتهای منفی (Negative Prompts) و توصیفهای دقیق و پرجزئیات از تصاویر تیون کرده است.
در محیط گراف ComfyUI، میتسوبا میتواند یک تصویر و خواستههای کاربر برای پرامپت را تحویل بگیرد و متن نهایی را مستقیماً به نود تولید تصویر یا ویدیو بفرستد. به این ترتیب، پایپلاینهای محلی بدون نیاز به سرویسهای ابری یا ابزارهای کپشننویسی خارجی، به یک مرحله پرامپتنویسی هوشمند و مسلط به تصویر مجهز میشوند. البته توجه داشته باشید که کدنویسی خارج از اهداف طراحی و کاربرد این مدل است.
جای دادن یک مدل ۲۷ میلیاردی در کمتر از ۸ گیگابایت!
بخش یا شاخص اندازهگیری | مقدار اعلامشده |
|---|---|
پایه زبانی اصلی (Backbone) | Qwen3.8-27B |
وزنهای پیشنهادی | PQ2_0، ۷.۳ گیگابایت |
وزنهای فوقفشرده | PTQ1_0، ۶.۰ گیگابایت |
بخش بینایی (Vision) | mmproj-Q8_0.gguf، ۰.۶۳ گیگابایت |
سرعت تولید متن (Decode) | ۱۱۹ توکن بر ثانیه با وزن PQ2_0 روی پردازنده گرافیکی RTX 5090 |
کارت گرافیک هدف | یک کارت گرافیک با ۱۶ گیگابایت حافظه VRAM (طبق اعلام سازنده) |
مجوز استفاده (License) | Apache 2.0 |
روش کوانتایزیشن سهتایی (Ternary Quantization) هر یک از وزنهای فشردهشده را به سه مقدار تقریبی -۱، ۰ و +۱ محدود میکند. ذخیرهسازی این سه حالت از نظر تئوری فقط به حدود ۱.۵۸ بیت فضا نیاز دارد و همین موضوع راز حجم فوقالعاده کم فایلهای GGUF این مدل است. فرمت GGUF استانداردی بسیار محبوب به حساب میآید که معمولاً در محیطهای اجرایی مبتنی بر llama.cpp بارگذاری و اجرا میشود.
مطالب مرتبط و پیشنهادی

پیشبینی دویچه بانک از برندگان موج بعدی هوش مصنوعی: وقت درخشش متا و سرویسناو رسید!
تحلیلگران دویچه بانک معتقدند دوره تمرکز صرف روی سهام شرکتهای تراشهساز به سر آمده و موج بعدی سودآوری هوش مصنوعی متعلق به پلتفرمهای مجهز به ایجنتهای هوشمند و بازیگران کلیدی سختافزار است. این بانک معتبر، غولهایی مانند متا و سرویسناو را در صدر فهرست گزینههای برتر فناوری برای پیشتازی در این مسیر معرفی کرده است.

مصاحبه داغ با وینود خوسلا: از خرید ۹ میلیارد دلاری تا هشدار درباره مدلهای متنباز و آینده ایجنتها
وینود خوسلا، سرمایهگذار کهنهکار سیلیکونولی و مالک جدید تیم سیاتل سیهاکس، در گفتوگویی خواندنی از دلایل خرید غیرمنتظره این باشگاه ورزشی و دیدگاههای جنجالی خود درباره خطرات هوش مصنوعی پرده برداشته است. او با تأکید بر تهدیدات مدلهای متنباز بدون نظارت، معتقد است که جلب اعتماد کاربران برگ برنده اصلی استارتاپها در توسعه ایجنتهای هوش مصنوعی خواهد بود.

غولکشی با ۱۶۴ مگابایت؛ مدل متنباز Phonon-2 با خطای ۵ درصدی ویسپر را پشت سر گذاشت!
استارتاپ تحقیقاتی فرمیون (Fermion Research) با عرضه مدل متنباز Phonon-2 سر و صدای زیادی به پا کرده است؛ مدلی که با حجم فوقالعاده اندک ۱۶۴ مگابایتیاش، دقتی خیرهکننده در تشخیص گفتار انگلیسی ارائه میدهد. این هوش مصنوعی جمعوجور نهتنها از مدلهای بسیار سنگینتر بازار عملکرد بهتری ثبت کرده، بلکه اجرای محلی و بدون نیاز به اینترنت تبدیل گفتار به متن را روی دستگاههای معمولی هم ممکن میکند.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.