پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

شاهکار مدل میتسوبا: جا دادن غول بینایی ۲۷ میلیاردی در ۷ گیگابایت حافظه روی یک کارت گرافیک معمولی!

انتشار:۱۲ مهر ۱۴۰۵(۱ ساعت پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

توسعه‌دهندگان در دنیای متن‌باز با مدل جدید میتسوبا (Mitsuba) موفق شده‌اند یک مدل بینایی-زبانی ۲۷ میلیارد پارامتری را تا ۷٫۳ گیگابایت فشرده کنند تا روی یک کارت گرافیک معمولی ۱۶ گیگابایتی به راحتی اجرا شود. این مدل تخصصی تصاویر مرجع را به پرامپت‌های ساختاریافته و تمیز برای ابزار‌هایی مثل استیبل دیفیوژن و ComfyUI تبدیل می‌کند. به این ترتیب می‌توانید بدون نیاز به سرویس‌های ابری گران‌قیمت، تحلیل تصاویر و تولید پرامپت‌های دقیق را به صورت کاملاً محلی انجام دهید.

شاهکار مدل میتسوبا: جا دادن غول بینایی ۲۷ میلیاردی در ۷ گیگابایت حافظه روی یک کارت گرافیک معمولی!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مدل جدید میتسوبا (Mitsuba) با فشرده‌سازی ۱٫۵۸ بیتی، یک مدل بینایی ۲۷ میلیاردی را به ۷٫۳ گیگابایت رسانده تا روی کارت گرافیک‌های ۱۶ گیگابایتی خانگی هم اجرا شود.
  • این مدل به طور اختصاصی تصاویر ورودی را آنالیز می‌کند و برای ابزار‌هایی مانند ComfyUI، استیبل دیفیوژن و ابزار‌های ساخت ویدیو، پرامپت‌های مهندسی‌شده و ساختاریافته می‌سازد.
  • قابلیت‌هایی مثل تعیین سقف کلمات، پرامپت منفی و زمان‌بندی زوایای دوربین پشتیبانی می‌شوند؛ هرچند سازندگان بررسی نهایی خروجی را پیش از استفاده توصیه می‌کنند.

جا دادن یک مدل بینایی ۲۷ میلیاردی در ۷٫۳ گیگابایت با جادوی میتسوبا

میتسوبا (Mitsuba) یک مدل بینایی-زبانی با کوانتیزاسیون سه‌تایی (Ternary) است که دقیقاً برای یک کار جذاب طراحی شده: تبدیل تصاویر مرجع به پرامپت‌های‌تر و تمیز و ساختاریافته برای ابزار‌هایی مثل ComfyUI، استیبل دیفیوژن (Stable Diffusion)، Krea و سایر ابزار‌های تولید تصویر. مدل پایه این سیستم ۲۷ میلیارد پارامتر دارد، اما به لطف این روش فشرده‌سازی، بسته به فرمت انتخابی به حجم فوق‌العاده ۷٫۳ یا حتی ۶٫۰ گیگابایت رسیده است؛ به این معنی که طبق گزارش سازنده، هر دو نسخه به راحتی روی یک کارت گرافیک معمولی ۱۶ گیگابایتی بالا می‌آیند و اجرا می‌شوند.

این نسخه مخصوص توسعه‌دهندگانی آماده شده که به دنبال پردازش و تحلیل محلی تصاویر و تولید پرامپت‌های مهندسی‌شده و دقیق با محدودیت‌های سفت‌وسخت هستند. پس اگر به دنبال چت عمومی، برنامه‌نویسی و کدنویسی، یا خلاصه‌سازی اسناد طولانی هستید، روی میتسوبا حساب باز نکنید، چون این مدل اصلاً برای این کار‌ها ساخته نشده است.

عکس تحویل بده، پرامپت آماده برای تولید تصویر تحویل بگیر!

میتسوبا یک عکس را به عنوان ورودی دریافت می‌کند و آن را به شکلی توصیف و بازنویسی می‌کند که مدل‌های دیگر بتوانند مستقیماً از آن برای خلق تصاویر یا ویدیوهای جدید استفاده کنند. قابلیت‌ها و جریان‌های کاری مورد پشتیبانی این مدل عبارتند از:

  • پرامپت‌های استیبل دیفیوژن: رعایت دقیق سقف تعداد کلمات، اضافه کردن کلمات کلیدی الزامی، حذف اصطلاحات ممنوعه و اضافه کردن بخش پرامپت منفی با خط Negative در انتهای کار.
  • پرامپت‌های ویدیویی زمان‌بندی‌شده: تقسیم‌بندی ویدیو به بازه‌های زمانی مشخص مثل 0-3s، 3-6s و 6-9s همراه با تعریف دقیق حرکت دوربین برای هر بخش از ویدیو.
  • توصیف همه‌جانبه تصاویر: پوشش دقیق جزئیات شامل اشیاء، تعداد موارد، افراد، صحنه‌ها، نمودارها و حتی متن‌های خوانای داخل تصویر.

البته در نظر داشته باشید که تولید پرامپت با محدودیت‌های سخت‌گیرانه هنوز بدون نقص نیست. طبق صفحه رسمی مدل، میتسوبا در ۶ مورد از ۱۰ تست انجام‌شده توانسته تمام شروط سخت‌گیرانه را مو به مو رعایت کند؛ بنابراین اگر قصد دارید از آن در برنامه‌ها یا پایپ‌لاین‌های خود استفاده کنید، حتماً قبل از فرستادن خروجی به مدل‌های بعدی، مواردی مثل کلمات الزامی، کلمات حذفی، سقف کلمات و ساختار خروجی را بررسی و اعتبارسنجی کنید.

وزن‌های سه مقداری و دو نسخه مختلف

مدل میتسوبا وزن‌های رسمی مدل Qwen3.8-27B را تقریباً به ۱٫۵۸ بیت به ازای هر وزن کوانتیزه کرده است. در این روش هوشمندانه، هر وزن تنها با یکی از این سه مقدار نشان داده می‌شود: -1، 0 یا +1. این فایل‌ها با استفاده از فرمت‌های کوانتیزاسیون GGUF شرکت Prism ML عرضه شده‌اند و امکان اجرای فوق‌العاده سبک و کم‌مصرف را برای کاربران فراهم می‌کنند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

گوگل پلن‌های جمینای را زیر و رو کرد: پایان دسترسی رایگان به مدل‌های پیشرفته!
آخرین اخبار

گوگل پلن‌های جمینای را زیر و رو کرد: پایان دسترسی رایگان به مدل‌های پیشرفته!

گوگل ساختار دسترسی به مدل‌های هوش مصنوعی جمینای را تغییر داده و از این پس کاربران نسخه رایگان و پلن اقتصادی پلاس به مدل‌های قدرتمند دسترسی نخواهند داشت. با این سیاست تازه، اگر خواهان استفاده از باهوش‌ترین مدل‌های جمینای باشید، چاره‌ای جز خرید اشتراک‌های گران‌تر نخواهید داشت.

۳ دقیقه مطالعه
۰
۱۲ مهر
از بحران حریم خصوصی تا لغو عجیب عرضه اولیه؛ گجت‌های پوشیدنی هوش مصنوعی در باتلاق بی‌اعتمادی
آخرین اخبار

از بحران حریم خصوصی تا لغو عجیب عرضه اولیه؛ گجت‌های پوشیدنی هوش مصنوعی در باتلاق بی‌اعتمادی

با وجود سرمایه‌گذاری سنگین غول‌هایی مثل متا، اپل و گوگل روی عینک‌ها و حلقه‌های هوشمند، نگرانی‌های فزاینده درباره نقض حریم خصوصی و ضبط پنهانی ویدیو سد راه فراگیری این فناوری شده است. ماجرای لغو ناگهانی عرضه اولیه سهام شرکت Oura و شکست گجت‌هایی مانند Rabbit r1 نشان می‌دهد که کاربران هنوز آمادگی پذیرش این سخت‌افزارهای نظارتی را در زندگی روزمره خود ندارند.

۶ دقیقه مطالعه
۰
۱۲ مهر
استارتاپ Reflection با حمایت انویدیا معادلات رقابت هوش مصنوعی را به هم می‌ریزد؛ مدلی متن‌باز علیه غول‌های آمریکایی و چینی
آخرین اخبار

استارتاپ Reflection با حمایت انویدیا معادلات رقابت هوش مصنوعی را به هم می‌ریزد؛ مدلی متن‌باز علیه غول‌های آمریکایی و چینی

استارتاپ جاه‌طلب Reflection با سرمایه‌گذاری و پشتیبانی انویدیا، در حال آماده‌سازی یک مدل هوش مصنوعی قدرتمند با وزن‌های باز (Open-weight) است که می‌تواند زنگ خطری جدی هم برای رقبای چینی و هم برای غول‌های هوش مصنوعی آمریکا باشد. این مدل بومی قرار است گزینه‌ای بسیار ارزان‌تر و در دسترس‌تر در مقایسه با سرویس‌های اختصاصی شرکت‌هایی مثل OpenAI و گوگل پیش روی کسب‌وکارها بگذارد.

۴ دقیقه مطالعه
۰
۱۲ مهر