پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

اجرای هوش مصنوعی ویدیویی Wan 2.1 علی‌بابا روی کارت‌های ۶ گیگابایتی با لانچر متن‌باز WanGP

انتشار:۱۹ مهر ۱۴۰۵(۵۹ دقیقه پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه
اشتراک و پسندیدن

استارتاپ‌ها و کاربران خانگی همیشه با مشکل حافظه کم کارت گرافیک برای اجرای مدل‌های ویدیویی سنگین دست‌وپنجه نرم می‌کنند. حالا ابزار متن‌باز WanGP با بهینه‌سازی هوشمند و جابه‌جایی بار پردازشی میان VRAM و رم سیستم، امکان اجرای مدل ویدیویی پرطرفدار Wan 2.1 علی‌بابا را حتی روی کارت‌های گرافیک ۶ و ۸ گیگابایتی فراهم کرده است.

اجرای هوش مصنوعی ویدیویی Wan 2.1 علی‌بابا روی کارت‌های ۶ گیگابایتی با لانچر متن‌باز WanGP

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • ابزار متن‌باز و محبوب WanGP با بهینه‌سازی دقیق و توزیع هوشمند حافظه، بالاخره اجرای مدل سنگین و پر سر و صدای Wan 2.1 علی‌بابا رو روی کارت‌های گرافیک اقتصادی ۶ و ۸ گیگابایتی ممکن کرد.
  • این ابزار با ارائه نسخه‌های کوانتیزه‌شده GGUF (با حجم ۲.۷ تا ۵.۶ گیگابایت) و جابه‌جایی بخشی از پردازش به رم سیستم (Offloading)، مصرف حافظه گرافیکی رو تا حدود ۵۰ درصد کاهش میده.
  • استقبال از این پروژه فوق‌العاده بوده و توی ماه گذشته بیش از ۴۰۰ هزار بار دانلود شده؛ هرچند مرحله رمزگذاری فریم‌ها با VAE هنوز به اوج مصرف حافظه (اسپایک ۱۲ گیگابایت) نیاز داره که ممکنه روی کارت‌های ضعیف‌تر سرعت کار رو موقتاً پایین بیاره.

مدل‌های هوش مصنوعی ویدیوساز Wan 2.1 علی‌بابا معمولاً به حافظه گرافیکی (VRAM) بسیار بیشتری نسبت به توان لپ‌تاپ‌های معمولی یا کارت‌های گرافیک قدیمی دسکتاپ نیاز دارند. حالا صفحه چک‌پوینت‌های هاگینگ‌فیس با ارائه فایل‌های فشرده‌تر و بهینه‌سازی‌شده برای لانچر متن‌باز WanGP این مانع بزرگ را دور زده است؛ لانچری که بخشی از پردازش‌های سنگین را به شکل هوشمندانه میان حافظه کارت گرافیک و حافظه رم (RAM) سیستم جابه‌جا می‌کند. جالب اینجاست که این مخزن فقط طی یک ماه گذشته بیش از ۴۱۹ هزار بار دانلود شده که نشان‌دهنده عطش بالای جامعه متن‌باز برای اجرای محلی مدل‌های تولید ویدیو روی سیستم‌های اقتصادی و معمولی است.

این مخزن در واقع حاوی چک‌پوینت‌های بازآرایی‌شده و آماده است، نه اینکه معماری مدل را از پایه تغییر داده باشد. فایل‌های عرضه‌شده شامل نسخه‌های کوانتیزه‌شده GGUF با قالب Q4_K_M هستند که حجمشان بین ۲.۷ تا ۵.۶ گیگابایت متغیر است؛ در کنار فرمت‌های پرکاربرد ONNX و safetensors. فرآیند کوانتیزاسیون وزن‌های مدل را در دقت‌های پایین‌تر ذخیره می‌کند تا حجم حافظه اشغالی به حداقل برسد، در حالی که لانچر WanGP قابلیت‌های زمان‌بندی و انتقال داده (Offloading) را اضافه کرده تا حتی وقتی تمام وزن‌ها و داده‌های میانی مدل به‌طور همزمان در VRAM جا نمی‌شوند، مدل بتواند بدون خطا کارش را جلو ببرد.

لانچر WanGP چطور همه قطعات پازل را کنار هم می‌چیند؟

پروژه WanGP مجموعه‌ای از یک رابط وب کاربرپسند، دانلودر مدل، ران‌تایم استنتاج، مدیریت حافظه و ابزار‌های پس‌پردازش را در یک پکیج واحد دور هم جمع کرده است. گزارش‌ها نشان می‌دهد این سیستم در برخی پردازش‌ها می‌تواند مصرف حافظه را تا نزدیک ۵۰ درصد کاهش دهد؛ حتی در سناریوهایی که وزن‌های مدل با دقت اصلی اجرا می‌شوند! به این ترتیب، کارت‌های گرافیکی مثل RTX 3060 با ۱۲ گیگابایت حافظه یا حتی RTX 2060 Super با ۸ گیگابایت حافظه می‌توانند پردازش‌هایی را اجرا کنند که پیش از این فقط با کارت‌های بسیار گران‌قیمت با VRAM بالا ممکن بود؛ هرچند کاهش حافظه گرافیکی باعث می‌شود سیستم بیش‌تر به جابه‌جایی داده‌ها از طریق رم اصلی تکیه کند و سرعت کار کمی کندتر شود.

توسعه‌دهندگان این پروژه گزارش داده‌اند که مدل ۱۴ میلیارد پارامتری Wan قادر است تا ۱۲۸ فریم (معادل حدود هشت ثانیه ویدیو) را تنها با ۱۲ گیگابایت حافظه VRAM تولید کند. برای ساخت یک ویدیوی پنج ثانیه‌ای با رزولوشن 480p، بیش‌تر مراحل پردازش در یک کارت گرافیک ۸ گیگابایتی به‌خوبی جا می‌شود؛ اما بخش رمزگذار خودکار متغیر یا همان VAE هنگام فشرده‌سازی و رمزگشایی فریم‌ها ممکن است در لحظه به ۱۲ گیگابایت حافظه نیاز پیدا کند. همین جهش ناگهانی مصرف حافظه (Spike) می‌تواند ابتدا و انتهای فرآیند تولید ویدیو را کمی کُند کند یا در مواردی نادر به خطای کمبود حافظه (Out of Memory) منجر شود.

بازخورد و اشتراک‌گذاری این مطلب

اگر این گزارش برایتان مفید بود، با پسندیدن و اشتراک‌گذاری آن با دیگران، از محتوای تخصصی هوش مصنوعی حمایت کنید.

اشتراک‌گذاری در شبکه‌های اجتماعی:

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

مدیران ارشد دنیای فناوری: هوش مصنوعی صوتی هنوز به «لحظه شگفت‌انگیز ChatGPT» نرسیده است!
آخرین اخبار

مدیران ارشد دنیای فناوری: هوش مصنوعی صوتی هنوز به «لحظه شگفت‌انگیز ChatGPT» نرسیده است!

با وجود سرمایه‌گذاری‌های میلیاردی روی هوش مصنوعی صوتی و معرفی مدل‌های مکالمه دوطرفه، مدیران ارشد شرکت‌های PolyAI و Otter معتقدند این فناوری هنوز به نقطه عطف و «لحظه ChatGPT» خود نرسیده است. به باور آن‌ها، کندی استدلال در لحظه، خطاهای بازشناسی گفتار و نبود حس انسانی واقعی همچنان موانع اصلی اعتماد کاربران به دستیارهای صوتی به شمار می‌روند.

۴ دقیقه مطالعه
۰
۱۹ مهر
شگفتی مدل ۳۰ مگابایتی Antalia-2 Mini: شکست غول‌های چند میلیاردی در تبدیل متن به گفتار ترکی!
آخرین اخبار

شگفتی مدل ۳۰ مگابایتی Antalia-2 Mini: شکست غول‌های چند میلیاردی در تبدیل متن به گفتار ترکی!

تیم هوش مصنوعی PatientDesk با معرفی مدل Antalia-2 Mini نشان داد که برای دستیابی به خروجی صوتی باکیفیت همیشه نیازی به مدل‌های سنگین نیست؛ این مدل متن‌باز ترکی با حجم باورنکردنی ۳۰ مگابایت حتی روی پردازنده‌های معمولی (CPU) اجرا می‌شود. نتایج بررسی‌ها نشان می‌دهد که این مدل فوق‌العاده سبک با کنار زدن مدل‌های چند میلیارد پارامتری، دقت شگفت‌انگیزی را در تبدیل متن به گفتار به نمایش گذاشته است.

۲ دقیقه مطالعه
۰
۱۹ مهر
به پاسخ‌های هوش مصنوعی گوگل اعتمادی نیست؟ با این ۶ ترفند کاربردی مهارش کنید!
آخرین اخبار

به پاسخ‌های هوش مصنوعی گوگل اعتمادی نیست؟ با این ۶ ترفند کاربردی مهارش کنید!

بخش خلاصه هوش مصنوعی گوگل (AI Overviews) چه بخواهیم و چه نخواهیم آمده است که بماند. اما به‌جای کنار گذاشتن آن یا کلافه شدن از خطاهایش، با یادگیری چند ترفند ساده پرامپت‌نویسی می‌توانید این ابزار را مهار کرده و دقیق‌ترین اطلاعات را از دل جست‌وجو بیرون بکشید.

۷ دقیقه مطالعه
۰
۱۹ مهر