پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

تولید ویدیوی هوش مصنوعی روی سیستم‌های معمولی ممکن شد؛ اجرای مدل MiniMax H3 با کارت‌های ۸ گیگابایتی!

انتشار:۱۲ مهر ۱۴۰۵(۱ ساعت پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

تیم توسعه‌دهنده FlashML با انتشار موتور متن‌باز FreeVideo امکانی فراهم کرده تا کاربران بتوانند مدل قدرتمند تولید ویدیو MiniMax H3 را حتی روی کارت‌های گرافیک معمولی ۸ گیگابایتی اجرا کنند. این پروژه با توزیع هوشمند بار پردازشی میان حافظه گرافیک، رم اصلی و دیسک، نیاز به سخت‌افزارهای گران‌قیمت سازمانی را دور می‌زند.

تولید ویدیوی هوش مصنوعی روی سیستم‌های معمولی ممکن شد؛ اجرای مدل MiniMax H3 با کارت‌های ۸ گیگابایتی!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • موتور متن‌باز FreeVideo با بهینه‌سازی‌های هوشمندانه، اجرای نسخه ۸ مرحله‌ای مدل ویدیوساز قدرتمند MiniMax H3 را روی کارت‌های گرافیک مصرفی با ۸ گیگابایت VRAM امکان‌پذیر کرده است.
  • برای دور زدن محدودیت حافظه گرافیک، بخش زیادی از بار پردازشی به رم ۱۶ گیگابایتی و حافظه SSD پرسرعت منتقل می‌شود که البته زمان رندر را کمی طولانی‌تر می‌کند.
  • این ابزار کاربردی از طریق افزونه ComfyUI، لانچر ویندوز و خط فرمان لینوکس قابل استفاده است و ویدیوهای ۵ تا ۱۵ ثانیه‌ای با رزولوشن حدود ۱ مگاپیکسل و صدای استریو می‌سازد.

اجرای مدل MiniMax H3 روی کارت‌های گرافیک ۸ گیگابایتی با FreeVideo

تیم FlashML-org به‌تازگی پروژه FreeVideo را تحت مجوز Apache 2.0 منتشر کرده است؛ یک موتور پردازش محلی که به کاربران اجازه می‌دهد نسخه ۸ مرحله‌ای از مدل ویدیوساز MiniMax H3 را روی سیستم‌های خانگی و سخت‌افزارهای معمولی اجرا کنند. این پروژه به‌طور ویژه برای سیستم‌هایی با ۸ گیگابایت حافظه گرافیکی (VRAM) و ۱۶ گیگابایت حافظه رم اصلی طراحی شده و این جهش را با تقسیم هوشمند لایه‌های مدل میان حافظه گرافیک، رم و دیسک ممکن کرده است.

البته کاهش این محدودیت حافظه بدون هزینه نبوده و ترافیک سنگین‌تری را روی حافظه ذخیره‌سازی می‌اندازد و زمان پردازش و رندر ویدیو را طولانی‌تر می‌کند. در حالت عادی، مدل‌های متن‌باز تولید ویدیو به حداقل یک کارت گرافیک ۲۴ گیگابایتی یا سرویس‌های ابری هزینه‌بر نیاز دارند؛ اما FreeVideo با تکنیک‌هایی مثل تخلیه لایه‌ها (Layer Offloading)، استریم داده‌ها، کاهش دقت محاسباتی و کرنل‌های توجه تطبیقی، پردازش این کار سنگین را برای کارت‌های ارزان‌تر کاملاً ممکن و دردسترس کرده است.

بخش
جزئیات
مدل
چک‌پوینت ۸ مرحله‌ای VDN-H3 توسعه‌یافته توسط OpenVDN، مبتنی بر MiniMax H3
حداقل سخت‌افزار ادعاشده
۸ گیگابایت VRAM و ۱۶ گیگابایت رم سیستم
رابط‌های کاربری
پلاگین ComfyUI، لانچر ویندوز و پشتیبانی از خط فرمان لینوکس
خروجی محلی
حدود ۱ مگاپیکسل با نرخ ۲۴ فریم در ثانیه، برای ویدیوهای ۵ تا ۱۵ ثانیه‌ای
عملکرد ذخیره‌سازی
استریم وزن‌های تخلیه‌شده از روی دیسک؛ بنابراین سرعت بالای SSD اهمیت بالایی دارد
مجوز استفاده
لایسنس آپاچی ۲.۰ (Apache 2.0) برای کدهای FreeVideo

مدل MiniMax H3 یک مدل هوش مصنوعی چندوجهی عمومی با وزن‌های باز برای ساخت ویدیو است. این مدل توانایی دریافت هم‌زمان متن، تصویر، ویدیو و صدا را در یک زمینه پردازشی واحد دارد و سپس خروجی ویدیو را همراه با صدای استریوی بومی و هماهنگ از طریق همان پایپ‌لاین تولید می‌کند؛ یعنی دیالوگ‌ها، افکت‌های صوتی و موسیقی درست هم‌گام با تصویر خلق می‌شوند و نیازی به تدوین و صداگذاری در مرحله پس‌تولید نیست.

ارجاعات نشانه‌گذاری‌شده تصویر، ویدیو و صدا راهنمای بسیار دقیقی برای مدل هستند تا شخصیت‌ها، سبک بصری، حرکت و صداها را منطبق پیاده‌سازی کند. شرکت سازنده، نسخه اصلی MiniMax H3 را با توان خروجی باکیفیت 2K توصیف می‌کند؛ این در حالی است که چک‌پوینت متن‌باز VDN-H3 در ابزار FreeVideo رزولوشنی با لبه کوتاه ۷۶۸ پیکسلی (تقریباً یک مگاپیکسل بسته به نسبت ابعاد تصویر) ارائه می‌دهد. درک این تفاوت کیفیت هنگام مقایسه نسخه‌های تحت وب ابری با اجرای محلی این نرم‌افزار نقشی کلیدی دارد.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

از بحران حریم خصوصی تا لغو عجیب عرضه اولیه؛ گجت‌های پوشیدنی هوش مصنوعی در باتلاق بی‌اعتمادی
آخرین اخبار

از بحران حریم خصوصی تا لغو عجیب عرضه اولیه؛ گجت‌های پوشیدنی هوش مصنوعی در باتلاق بی‌اعتمادی

با وجود سرمایه‌گذاری سنگین غول‌هایی مثل متا، اپل و گوگل روی عینک‌ها و حلقه‌های هوشمند، نگرانی‌های فزاینده درباره نقض حریم خصوصی و ضبط پنهانی ویدیو سد راه فراگیری این فناوری شده است. ماجرای لغو ناگهانی عرضه اولیه سهام شرکت Oura و شکست گجت‌هایی مانند Rabbit r1 نشان می‌دهد که کاربران هنوز آمادگی پذیرش این سخت‌افزارهای نظارتی را در زندگی روزمره خود ندارند.

۶ دقیقه مطالعه
۰
۱۲ مهر
شاهکار مدل میتسوبا: جا دادن غول بینایی ۲۷ میلیاردی در ۷ گیگابایت حافظه روی یک کارت گرافیک معمولی!
آخرین اخبار

شاهکار مدل میتسوبا: جا دادن غول بینایی ۲۷ میلیاردی در ۷ گیگابایت حافظه روی یک کارت گرافیک معمولی!

توسعه‌دهندگان در دنیای متن‌باز با مدل جدید میتسوبا (Mitsuba) موفق شده‌اند یک مدل بینایی-زبانی ۲۷ میلیارد پارامتری را تا ۷٫۳ گیگابایت فشرده کنند تا روی یک کارت گرافیک معمولی ۱۶ گیگابایتی به راحتی اجرا شود. این مدل تخصصی تصاویر مرجع را به پرامپت‌های ساختاریافته و تمیز برای ابزار‌هایی مثل استیبل دیفیوژن و ComfyUI تبدیل می‌کند. به این ترتیب می‌توانید بدون نیاز به سرویس‌های ابری گران‌قیمت، تحلیل تصاویر و تولید پرامپت‌های دقیق را به صورت کاملاً محلی انجام دهید.

۲ دقیقه مطالعه
۰
۱۲ مهر
استارتاپ Reflection با حمایت انویدیا معادلات رقابت هوش مصنوعی را به هم می‌ریزد؛ مدلی متن‌باز علیه غول‌های آمریکایی و چینی
آخرین اخبار

استارتاپ Reflection با حمایت انویدیا معادلات رقابت هوش مصنوعی را به هم می‌ریزد؛ مدلی متن‌باز علیه غول‌های آمریکایی و چینی

استارتاپ جاه‌طلب Reflection با سرمایه‌گذاری و پشتیبانی انویدیا، در حال آماده‌سازی یک مدل هوش مصنوعی قدرتمند با وزن‌های باز (Open-weight) است که می‌تواند زنگ خطری جدی هم برای رقبای چینی و هم برای غول‌های هوش مصنوعی آمریکا باشد. این مدل بومی قرار است گزینه‌ای بسیار ارزان‌تر و در دسترس‌تر در مقایسه با سرویس‌های اختصاصی شرکت‌هایی مثل OpenAI و گوگل پیش روی کسب‌وکارها بگذارد.

۴ دقیقه مطالعه
۰
۱۲ مهر