پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

شاهکار فشرده‌سازی برای ComfyUI؛ مدل بینایی ۲۷ میلیاردی Mitsuba فقط با ۷.۳ گیگابایت حافظه!

انتشار:۹ مهر ۱۴۰۵(۱ ساعت پیش)
۱ دقیقه زمان مطالعه
۰ دیدگاه

توسعه‌دهندگان موفق شدند مدل بینایی ۲۷ میلیارد پارامتری Mitsuba را با تکنیک کوانتایزیشن سه‌تایی تا ۷.۳ گیگابایت فشرده کنند تا به‌راحتی در سیستم‌های محلی ComfyUI اجرا شود. این مدل تخصصی می‌تواند تصاویر را دقیقاً تحلیل کرده و پرامپت‌های تفکیک‌شده و جزئی برای ابزار‌های تولید تصویر و ویدیو بنویسد. با این بهینه‌سازی شگفت‌انگیز، اجرای محلی یک مدل بینایی بزرگ روی یک کارت گرافیک ۱۶ گیگابایتی به واقعیت تبدیل شده است.

شاهکار فشرده‌سازی برای ComfyUI؛ مدل بینایی ۲۷ میلیاردی Mitsuba فقط با ۷.۳ گیگابایت حافظه!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مدل بینایی ۲۷ میلیاردی Mitsuba-ComfyUI برای تبدیل تصویر به پرامپت دقیق در ورک‌فلوهای ComfyUI بهینه‌سازی شده و کارش ساخت توصیف‌ها، پرامپت‌های منفی و دستورات ویدیویی است.
  • به لطف کوانتایزیشن سه‌تایی (Ternary)، حجم این مدل غول‌پیکر تا ۷.۳ گیگابایت پایین آمده تا با فرمت GGUF به‌راحتی روی سیستم‌های معمولی لود شود.
  • این غول فشرده‌شده فقط با یک پردازنده گرافیکی ۱۶ گیگابایتی کار می‌کند و سرعت تولید متن آن روی کارت گرافیک RTX 5090 به ۱۱۹ توکن در ثانیه می‌رسد.

فشرده‌سازی مدل بینایی ۲۷ میلیاردی Mitsuba برای نوشتن پرامپت در ComfyUI

مدل Mitsuba-ComfyUI-27B-GGUF یک مدل بینایی-زبانی ۲۷ میلیارد پارامتری است که وظیفه تحلیل تصاویر و تولید پرامپت‌های دقیق و بهینه‌سازی‌شده برای مدل‌های تولید تصویر و ویدیو را بر عهده دارد. یک توسعه‌دهنده ژاپنی با نام مستعار isichan-ai، این مدل را که بر پایه Qwen3.8-27B توسعه یافته، برای ساخت تگ‌های استیبل دیفیوژن (Stable Diffusion)، دستورالعمل‌های زمان‌بندی‌شده ویدیویی، پرامپت‌های منفی (Negative Prompts) و توصیف‌های دقیق و پرجزئیات از تصاویر تیون کرده است.

در محیط گراف ComfyUI، میتسوبا می‌تواند یک تصویر و خواسته‌های کاربر برای پرامپت را تحویل بگیرد و متن نهایی را مستقیماً به نود تولید تصویر یا ویدیو بفرستد. به این ترتیب، پایپ‌لاین‌های محلی بدون نیاز به سرویس‌های ابری یا ابزار‌های کپشن‌نویسی خارجی، به یک مرحله پرامپت‌نویسی هوشمند و مسلط به تصویر مجهز می‌شوند. البته توجه داشته باشید که کدنویسی خارج از اهداف طراحی و کاربرد این مدل است.

جای دادن یک مدل ۲۷ میلیاردی در کم‌تر از ۸ گیگابایت!

بخش یا شاخص اندازه‌گیری
مقدار اعلام‌شده
پایه زبانی اصلی (Backbone)
Qwen3.8-27B
وزن‌های پیشنهادی
PQ2_0، ۷.۳ گیگابایت
وزن‌های فوق‌فشرده
PTQ1_0، ۶.۰ گیگابایت
بخش بینایی (Vision)
mmproj-Q8_0.gguf، ۰.۶۳ گیگابایت
سرعت تولید متن (Decode)
۱۱۹ توکن بر ثانیه با وزن PQ2_0 روی پردازنده گرافیکی RTX 5090
کارت گرافیک هدف
یک کارت گرافیک با ۱۶ گیگابایت حافظه VRAM (طبق اعلام سازنده)
مجوز استفاده (License)
Apache 2.0

روش کوانتایزیشن سه‌تایی (Ternary Quantization) هر یک از وزن‌های فشرده‌شده را به سه مقدار تقریبی -۱، ۰ و +۱ محدود می‌کند. ذخیره‌سازی این سه حالت از نظر تئوری فقط به حدود ۱.۵۸ بیت فضا نیاز دارد و همین موضوع راز حجم فوق‌العاده کم فایل‌های GGUF این مدل است. فرمت GGUF استانداردی بسیار محبوب به حساب می‌آید که معمولاً در محیط‌های اجرایی مبتنی بر llama.cpp بارگذاری و اجرا می‌شود.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

پیش‌بینی دویچه بانک از برندگان موج بعدی هوش مصنوعی: وقت درخشش متا و سرویس‌ناو رسید!
آخرین اخبار

پیش‌بینی دویچه بانک از برندگان موج بعدی هوش مصنوعی: وقت درخشش متا و سرویس‌ناو رسید!

تحلیلگران دویچه بانک معتقدند دوره تمرکز صرف روی سهام شرکت‌های تراشه‌ساز به سر آمده و موج بعدی سودآوری هوش مصنوعی متعلق به پلتفرم‌های مجهز به ایجنت‌های هوشمند و بازیگران کلیدی سخت‌افزار است. این بانک معتبر، غول‌هایی مانند متا و سرویس‌ناو را در صدر فهرست گزینه‌های برتر فناوری برای پیشتازی در این مسیر معرفی کرده است.

۲ دقیقه مطالعه
۰
۹ مهر
مصاحبه داغ با وینود خوسلا: از خرید ۹ میلیارد دلاری تا هشدار درباره مدل‌های متن‌باز و آینده ایجنت‌ها
آخرین اخبار

مصاحبه داغ با وینود خوسلا: از خرید ۹ میلیارد دلاری تا هشدار درباره مدل‌های متن‌باز و آینده ایجنت‌ها

وینود خوسلا، سرمایه‌گذار کهنه‌کار سیلیکون‌ولی و مالک جدید تیم سیاتل سی‌هاکس، در گفت‌وگویی خواندنی از دلایل خرید غیرمنتظره این باشگاه ورزشی و دیدگاه‌های جنجالی خود درباره خطرات هوش مصنوعی پرده برداشته است. او با تأکید بر تهدیدات مدل‌های متن‌باز بدون نظارت، معتقد است که جلب اعتماد کاربران برگ برنده اصلی استارتاپ‌ها در توسعه ایجنت‌های هوش مصنوعی خواهد بود.

۵ دقیقه مطالعه
۰
۹ مهر
غول‌کشی با ۱۶۴ مگابایت؛ مدل متن‌باز Phonon-2 با خطای ۵ درصدی ویسپر را پشت سر گذاشت!
آخرین اخبار

غول‌کشی با ۱۶۴ مگابایت؛ مدل متن‌باز Phonon-2 با خطای ۵ درصدی ویسپر را پشت سر گذاشت!

استارتاپ تحقیقاتی فرمیون (Fermion Research) با عرضه مدل متن‌باز Phonon-2 سر و صدای زیادی به پا کرده است؛ مدلی که با حجم فوق‌العاده اندک ۱۶۴ مگابایتی‌اش، دقتی خیره‌کننده در تشخیص گفتار انگلیسی ارائه می‌دهد. این هوش مصنوعی جمع‌وجور نه‌تنها از مدل‌های بسیار سنگین‌تر بازار عملکرد بهتری ثبت کرده، بلکه اجرای محلی و بدون نیاز به اینترنت تبدیل گفتار به متن را روی دستگاه‌های معمولی هم ممکن می‌کند.

۲ دقیقه مطالعه
۰
۹ مهر