شاهکار مدل میتسوبا: جا دادن غول بینایی ۲۷ میلیاردی در ۷ گیگابایت حافظه روی یک کارت گرافیک معمولی!
توسعهدهندگان در دنیای متنباز با مدل جدید میتسوبا (Mitsuba) موفق شدهاند یک مدل بینایی-زبانی ۲۷ میلیارد پارامتری را تا ۷٫۳ گیگابایت فشرده کنند تا روی یک کارت گرافیک معمولی ۱۶ گیگابایتی به راحتی اجرا شود. این مدل تخصصی تصاویر مرجع را به پرامپتهای ساختاریافته و تمیز برای ابزارهایی مثل استیبل دیفیوژن و ComfyUI تبدیل میکند. به این ترتیب میتوانید بدون نیاز به سرویسهای ابری گرانقیمت، تحلیل تصاویر و تولید پرامپتهای دقیق را به صورت کاملاً محلی انجام دهید.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- مدل جدید میتسوبا (Mitsuba) با فشردهسازی ۱٫۵۸ بیتی، یک مدل بینایی ۲۷ میلیاردی را به ۷٫۳ گیگابایت رسانده تا روی کارت گرافیکهای ۱۶ گیگابایتی خانگی هم اجرا شود.
- این مدل به طور اختصاصی تصاویر ورودی را آنالیز میکند و برای ابزارهایی مانند ComfyUI، استیبل دیفیوژن و ابزارهای ساخت ویدیو، پرامپتهای مهندسیشده و ساختاریافته میسازد.
- قابلیتهایی مثل تعیین سقف کلمات، پرامپت منفی و زمانبندی زوایای دوربین پشتیبانی میشوند؛ هرچند سازندگان بررسی نهایی خروجی را پیش از استفاده توصیه میکنند.
جا دادن یک مدل بینایی ۲۷ میلیاردی در ۷٫۳ گیگابایت با جادوی میتسوبا
میتسوبا (Mitsuba) یک مدل بینایی-زبانی با کوانتیزاسیون سهتایی (Ternary) است که دقیقاً برای یک کار جذاب طراحی شده: تبدیل تصاویر مرجع به پرامپتهایتر و تمیز و ساختاریافته برای ابزارهایی مثل ComfyUI، استیبل دیفیوژن (Stable Diffusion)، Krea و سایر ابزارهای تولید تصویر. مدل پایه این سیستم ۲۷ میلیارد پارامتر دارد، اما به لطف این روش فشردهسازی، بسته به فرمت انتخابی به حجم فوقالعاده ۷٫۳ یا حتی ۶٫۰ گیگابایت رسیده است؛ به این معنی که طبق گزارش سازنده، هر دو نسخه به راحتی روی یک کارت گرافیک معمولی ۱۶ گیگابایتی بالا میآیند و اجرا میشوند.
این نسخه مخصوص توسعهدهندگانی آماده شده که به دنبال پردازش و تحلیل محلی تصاویر و تولید پرامپتهای مهندسیشده و دقیق با محدودیتهای سفتوسخت هستند. پس اگر به دنبال چت عمومی، برنامهنویسی و کدنویسی، یا خلاصهسازی اسناد طولانی هستید، روی میتسوبا حساب باز نکنید، چون این مدل اصلاً برای این کارها ساخته نشده است.
عکس تحویل بده، پرامپت آماده برای تولید تصویر تحویل بگیر!
میتسوبا یک عکس را به عنوان ورودی دریافت میکند و آن را به شکلی توصیف و بازنویسی میکند که مدلهای دیگر بتوانند مستقیماً از آن برای خلق تصاویر یا ویدیوهای جدید استفاده کنند. قابلیتها و جریانهای کاری مورد پشتیبانی این مدل عبارتند از:
- پرامپتهای استیبل دیفیوژن: رعایت دقیق سقف تعداد کلمات، اضافه کردن کلمات کلیدی الزامی، حذف اصطلاحات ممنوعه و اضافه کردن بخش پرامپت منفی با خط
Negativeدر انتهای کار. - پرامپتهای ویدیویی زمانبندیشده: تقسیمبندی ویدیو به بازههای زمانی مشخص مثل
0-3s،3-6sو6-9sهمراه با تعریف دقیق حرکت دوربین برای هر بخش از ویدیو. - توصیف همهجانبه تصاویر: پوشش دقیق جزئیات شامل اشیاء، تعداد موارد، افراد، صحنهها، نمودارها و حتی متنهای خوانای داخل تصویر.
البته در نظر داشته باشید که تولید پرامپت با محدودیتهای سختگیرانه هنوز بدون نقص نیست. طبق صفحه رسمی مدل، میتسوبا در ۶ مورد از ۱۰ تست انجامشده توانسته تمام شروط سختگیرانه را مو به مو رعایت کند؛ بنابراین اگر قصد دارید از آن در برنامهها یا پایپلاینهای خود استفاده کنید، حتماً قبل از فرستادن خروجی به مدلهای بعدی، مواردی مثل کلمات الزامی، کلمات حذفی، سقف کلمات و ساختار خروجی را بررسی و اعتبارسنجی کنید.
وزنهای سه مقداری و دو نسخه مختلف
مدل میتسوبا وزنهای رسمی مدل Qwen3.8-27B را تقریباً به ۱٫۵۸ بیت به ازای هر وزن کوانتیزه کرده است. در این روش هوشمندانه، هر وزن تنها با یکی از این سه مقدار نشان داده میشود: -1، 0 یا +1. این فایلها با استفاده از فرمتهای کوانتیزاسیون GGUF شرکت Prism ML عرضه شدهاند و امکان اجرای فوقالعاده سبک و کممصرف را برای کاربران فراهم میکنند.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

گوگل پلنهای جمینای را زیر و رو کرد: پایان دسترسی رایگان به مدلهای پیشرفته!
گوگل ساختار دسترسی به مدلهای هوش مصنوعی جمینای را تغییر داده و از این پس کاربران نسخه رایگان و پلن اقتصادی پلاس به مدلهای قدرتمند دسترسی نخواهند داشت. با این سیاست تازه، اگر خواهان استفاده از باهوشترین مدلهای جمینای باشید، چارهای جز خرید اشتراکهای گرانتر نخواهید داشت.

از بحران حریم خصوصی تا لغو عجیب عرضه اولیه؛ گجتهای پوشیدنی هوش مصنوعی در باتلاق بیاعتمادی
با وجود سرمایهگذاری سنگین غولهایی مثل متا، اپل و گوگل روی عینکها و حلقههای هوشمند، نگرانیهای فزاینده درباره نقض حریم خصوصی و ضبط پنهانی ویدیو سد راه فراگیری این فناوری شده است. ماجرای لغو ناگهانی عرضه اولیه سهام شرکت Oura و شکست گجتهایی مانند Rabbit r1 نشان میدهد که کاربران هنوز آمادگی پذیرش این سختافزارهای نظارتی را در زندگی روزمره خود ندارند.

استارتاپ Reflection با حمایت انویدیا معادلات رقابت هوش مصنوعی را به هم میریزد؛ مدلی متنباز علیه غولهای آمریکایی و چینی
استارتاپ جاهطلب Reflection با سرمایهگذاری و پشتیبانی انویدیا، در حال آمادهسازی یک مدل هوش مصنوعی قدرتمند با وزنهای باز (Open-weight) است که میتواند زنگ خطری جدی هم برای رقبای چینی و هم برای غولهای هوش مصنوعی آمریکا باشد. این مدل بومی قرار است گزینهای بسیار ارزانتر و در دسترستر در مقایسه با سرویسهای اختصاصی شرکتهایی مثل OpenAI و گوگل پیش روی کسبوکارها بگذارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.