اجرای هوش مصنوعی ویدیویی Wan 2.1 علیبابا روی کارتهای ۶ گیگابایتی با لانچر متنباز WanGP
استارتاپها و کاربران خانگی همیشه با مشکل حافظه کم کارت گرافیک برای اجرای مدلهای ویدیویی سنگین دستوپنجه نرم میکنند. حالا ابزار متنباز WanGP با بهینهسازی هوشمند و جابهجایی بار پردازشی میان VRAM و رم سیستم، امکان اجرای مدل ویدیویی پرطرفدار Wan 2.1 علیبابا را حتی روی کارتهای گرافیک ۶ و ۸ گیگابایتی فراهم کرده است.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- ابزار متنباز و محبوب WanGP با بهینهسازی دقیق و توزیع هوشمند حافظه، بالاخره اجرای مدل سنگین و پر سر و صدای Wan 2.1 علیبابا رو روی کارتهای گرافیک اقتصادی ۶ و ۸ گیگابایتی ممکن کرد.
- این ابزار با ارائه نسخههای کوانتیزهشده GGUF (با حجم ۲.۷ تا ۵.۶ گیگابایت) و جابهجایی بخشی از پردازش به رم سیستم (Offloading)، مصرف حافظه گرافیکی رو تا حدود ۵۰ درصد کاهش میده.
- استقبال از این پروژه فوقالعاده بوده و توی ماه گذشته بیش از ۴۰۰ هزار بار دانلود شده؛ هرچند مرحله رمزگذاری فریمها با VAE هنوز به اوج مصرف حافظه (اسپایک ۱۲ گیگابایت) نیاز داره که ممکنه روی کارتهای ضعیفتر سرعت کار رو موقتاً پایین بیاره.
مدلهای هوش مصنوعی ویدیوساز Wan 2.1 علیبابا معمولاً به حافظه گرافیکی (VRAM) بسیار بیشتری نسبت به توان لپتاپهای معمولی یا کارتهای گرافیک قدیمی دسکتاپ نیاز دارند. حالا صفحه چکپوینتهای هاگینگفیس با ارائه فایلهای فشردهتر و بهینهسازیشده برای لانچر متنباز WanGP این مانع بزرگ را دور زده است؛ لانچری که بخشی از پردازشهای سنگین را به شکل هوشمندانه میان حافظه کارت گرافیک و حافظه رم (RAM) سیستم جابهجا میکند. جالب اینجاست که این مخزن فقط طی یک ماه گذشته بیش از ۴۱۹ هزار بار دانلود شده که نشاندهنده عطش بالای جامعه متنباز برای اجرای محلی مدلهای تولید ویدیو روی سیستمهای اقتصادی و معمولی است.
این مخزن در واقع حاوی چکپوینتهای بازآراییشده و آماده است، نه اینکه معماری مدل را از پایه تغییر داده باشد. فایلهای عرضهشده شامل نسخههای کوانتیزهشده GGUF با قالب Q4_K_M هستند که حجمشان بین ۲.۷ تا ۵.۶ گیگابایت متغیر است؛ در کنار فرمتهای پرکاربرد ONNX و safetensors. فرآیند کوانتیزاسیون وزنهای مدل را در دقتهای پایینتر ذخیره میکند تا حجم حافظه اشغالی به حداقل برسد، در حالی که لانچر WanGP قابلیتهای زمانبندی و انتقال داده (Offloading) را اضافه کرده تا حتی وقتی تمام وزنها و دادههای میانی مدل بهطور همزمان در VRAM جا نمیشوند، مدل بتواند بدون خطا کارش را جلو ببرد.
لانچر WanGP چطور همه قطعات پازل را کنار هم میچیند؟
پروژه WanGP مجموعهای از یک رابط وب کاربرپسند، دانلودر مدل، رانتایم استنتاج، مدیریت حافظه و ابزارهای پسپردازش را در یک پکیج واحد دور هم جمع کرده است. گزارشها نشان میدهد این سیستم در برخی پردازشها میتواند مصرف حافظه را تا نزدیک ۵۰ درصد کاهش دهد؛ حتی در سناریوهایی که وزنهای مدل با دقت اصلی اجرا میشوند! به این ترتیب، کارتهای گرافیکی مثل RTX 3060 با ۱۲ گیگابایت حافظه یا حتی RTX 2060 Super با ۸ گیگابایت حافظه میتوانند پردازشهایی را اجرا کنند که پیش از این فقط با کارتهای بسیار گرانقیمت با VRAM بالا ممکن بود؛ هرچند کاهش حافظه گرافیکی باعث میشود سیستم بیشتر به جابهجایی دادهها از طریق رم اصلی تکیه کند و سرعت کار کمی کندتر شود.
توسعهدهندگان این پروژه گزارش دادهاند که مدل ۱۴ میلیارد پارامتری Wan قادر است تا ۱۲۸ فریم (معادل حدود هشت ثانیه ویدیو) را تنها با ۱۲ گیگابایت حافظه VRAM تولید کند. برای ساخت یک ویدیوی پنج ثانیهای با رزولوشن 480p، بیشتر مراحل پردازش در یک کارت گرافیک ۸ گیگابایتی بهخوبی جا میشود؛ اما بخش رمزگذار خودکار متغیر یا همان VAE هنگام فشردهسازی و رمزگشایی فریمها ممکن است در لحظه به ۱۲ گیگابایت حافظه نیاز پیدا کند. همین جهش ناگهانی مصرف حافظه (Spike) میتواند ابتدا و انتهای فرآیند تولید ویدیو را کمی کُند کند یا در مواردی نادر به خطای کمبود حافظه (Out of Memory) منجر شود.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

مدیران ارشد دنیای فناوری: هوش مصنوعی صوتی هنوز به «لحظه شگفتانگیز ChatGPT» نرسیده است!
با وجود سرمایهگذاریهای میلیاردی روی هوش مصنوعی صوتی و معرفی مدلهای مکالمه دوطرفه، مدیران ارشد شرکتهای PolyAI و Otter معتقدند این فناوری هنوز به نقطه عطف و «لحظه ChatGPT» خود نرسیده است. به باور آنها، کندی استدلال در لحظه، خطاهای بازشناسی گفتار و نبود حس انسانی واقعی همچنان موانع اصلی اعتماد کاربران به دستیارهای صوتی به شمار میروند.

شگفتی مدل ۳۰ مگابایتی Antalia-2 Mini: شکست غولهای چند میلیاردی در تبدیل متن به گفتار ترکی!
تیم هوش مصنوعی PatientDesk با معرفی مدل Antalia-2 Mini نشان داد که برای دستیابی به خروجی صوتی باکیفیت همیشه نیازی به مدلهای سنگین نیست؛ این مدل متنباز ترکی با حجم باورنکردنی ۳۰ مگابایت حتی روی پردازندههای معمولی (CPU) اجرا میشود. نتایج بررسیها نشان میدهد که این مدل فوقالعاده سبک با کنار زدن مدلهای چند میلیارد پارامتری، دقت شگفتانگیزی را در تبدیل متن به گفتار به نمایش گذاشته است.

به پاسخهای هوش مصنوعی گوگل اعتمادی نیست؟ با این ۶ ترفند کاربردی مهارش کنید!
بخش خلاصه هوش مصنوعی گوگل (AI Overviews) چه بخواهیم و چه نخواهیم آمده است که بماند. اما بهجای کنار گذاشتن آن یا کلافه شدن از خطاهایش، با یادگیری چند ترفند ساده پرامپتنویسی میتوانید این ابزار را مهار کرده و دقیقترین اطلاعات را از دل جستوجو بیرون بکشید.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.