پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

انویدیا مدل Qwen2.5-VL را برای پردازنده‌های بلک‌ول بهینه‌سازی کرد؛ ۳.۶ برابر سبک‌تر و سریع‌تر!

انتشار:۷ مهر ۱۴۰۵(۱ ساعت پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

انویدیا نسخه بهینه‌سازی‌شده مدل بینایی-زبانی Qwen2.5-VL-7B را با فرمت فشرده NVFP4 برای پردازنده‌های گرافیکی بلک‌ول منتشر کرد. این نسخه با کاهش ۳.۶ برابری حجم لایه‌ها و بهره‌گیری از فریم‌ورک TensorRT-LLM، امکان اجرای فوق‌سریع و کم‌مصرف این مدل هوش مصنوعی قدرتمند را روی سرورها فراهم می‌کند.

انویدیا مدل Qwen2.5-VL را برای پردازنده‌های بلک‌ول بهینه‌سازی کرد؛ ۳.۶ برابر سبک‌تر و سریع‌تر!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • انویدیا نسخه بهینه‌سازی‌شده‌ای از مدل چندحالته Qwen2.5-VL-7B علی‌بابا را برای پردازنده‌های نسل جدید بلک‌ول منتشر کرد که با فرمت فشرده NVFP4 کار می‌کند.
  • با تکیه بر هسته‌های تانسور بلک‌ول، حجم لایه‌های کوانتیزه‌شده ۳.۶ برابر نسبت به BF16 سبک‌تر شده و توان پردازشی هم تا ۲ برابر نسبت به FP8 بیشتر می‌شود.
  • برای حفظ دقت و کیفیت بینایی مدل، انکودر تصویر با دقت بالا باقی مانده و تنها بخش‌های زبانی فشرده شده‌اند تا هیچ افتی در درک بصری ایجاد نشود.

بسته‌بندی مدل Qwen2.5-VL 7B توسط انویدیا برای پردازش بومی FP4 روی بلک‌ول

انویدیا نسخه از پیش کوانتیزه‌شده‌ای از مدل محبوب Qwen2.5-VL-7B-Instruct متعلق به علی‌بابا را برای پردازنده‌های گرافیکی نسل جدید بلک‌ول (Blackwell) منتشر کرد. این نسخه، مدل بینایی-زبانی را در قالب فرمت اختصاصی NVFP4 انویدیا بسته‌بندی کرده و هدف اصلی آن استقرار و اجرای فوق‌سریع از طریق فریم‌ورک TensorRT-LLM است.

هسته‌های تانسور پردازنده‌های بلک‌ول قابلیت اجرای بومی و سخت‌افزاری فرمت NVFP4 را دارند؛ قابلیتی که باعث می‌شود این مدل نسبت به نسخه‌های BF16 یا FP8، حافظه ویدیویی بسیار کمتری مصرف کند و سرعت خروجی (Throughput) به مراتب بالاتری داشته باشد. البته این جهش کارایی بیشتر مربوط به لایه‌های خطیِ کوانتیزه‌شده مدل زبانی است؛ در حالی که انکودر بینایی و برخی تانسورهای پشتیبان همچنان با دقت محاسباتی بالاتر اجرا می‌شوند تا کیفیت درک تصویر افت نکند.

فرمت NVFP4 چگونه وزن‌ها را در بلوک‌های ۱۶ مقداری فشرده می‌کند؟

فرمت NVFP4 هر مقدار کوانتیزه‌شده را در ساختار E2M1 ذخیره می‌کند: یک بیت علامت، دو بیت توان و یک بیت مانتیس. از آنجا که چهار بیت به تنهایی دامنه محدودی دارد، این فرمت دو سطح مقیاس‌بندی (Scaling) هوشمندانه به آن اضافه کرده است:

  • هر ریزبلوک (Micro-block) ۱۶ عددی، یک مقیاس FP8 با ساختار E4M3 را به اشتراک می‌گذارد.
  • علاوه بر این، هر تانسور یک مقیاس کلی با دقت FP32 نیز به همراه دارد.
  • مقیاس‌های بلوکی FP8 میانگین ذخیره‌سازی را به حدود ۴.۵ بیت به ازای هر مقدار می‌رسانند که با در نظر گرفتن هزینه ناچیز مقیاس تانسوری، فشردگی فوق‌العاده‌ای به همراه دارد.

این معماری باعث می‌شود حجم ذخیره‌سازی تانسورهای کوانتیزه‌شده حدود ۳.۶ برابر نسبت به فرمت BF16 کمتر شود. همچنین انویدیا وعده داده که حداکثر توان پردازشی هسته‌های تانسور در بلک‌ول برای فرمت FP4 تا دو برابر سریع‌تر از FP8 خواهد بود. البته عملکرد نهایی سیستم در عمل به سرعت انکودر بینایی، ترافیک حافظه KV-Cache، پردازش دسته‌ای درخواست‌ها، دسترسی به کرنل‌های بهینه و سهم بخش‌هایی که با دقت بالا اجرا می‌شوند بستگی دارد.

بخش بینایی مدل همچنان با دقت بالا اجرا می‌شود

انویدیا این نسخه بهینه‌شده را با استفاده از ابزار Model Optimizer و به روش کوانتیزه‌سازی پس از آموزش (PTQ) روی مدل پایه کیوئن پیاده کرده است. پیکربندی این نسخه به صورت زیر است:

بخش مدل
جزئیات پیکربندی
لایه‌های کوانتیزه‌شده
عملگرهای خطی در بلوک‌های ترنسفورمر مدل زبانی
لایه‌های با دقت بالا
انکودر بینایی و تانسورهای حساس به دقت محاسباتی

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

استارتاپ Wabi به پیام‌رسان هوش مصنوعی تبدیل شد؛ ایجنتی که در لحظه براتون اپلیکیشن می‌سازه!
آخرین اخبار

استارتاپ Wabi به پیام‌رسان هوش مصنوعی تبدیل شد؛ ایجنتی که در لحظه براتون اپلیکیشن می‌سازه!

استارتاپ Wabi که با ابزار ساخت اپلیکیشن از طریق پرامپت سروصدا کرده بود، حالا با معرفی نسخه ۲.۰ مسیرش رو تغییر داده و به یک پیام‌رسان هوشمند تبدیل شده است. این ایجنت شخصی جدید نه‌تنها کارهای روزمره‌تان را انجام می‌دهد، بلکه در لحظه و درست وسط چت، هر رابط کاربری یا مینی‌اپی را که نیاز داشته باشید خلق می‌کند.

۳ دقیقه مطالعه
۰
۷ مهر
ابزار متن‌باز Jevstiller معرفی شد؛ هوش مصنوعی Jev را روی سیستم خودتان و با سرعت برق‌آسا اجرا کنید!
آخرین اخبار

ابزار متن‌باز Jevstiller معرفی شد؛ هوش مصنوعی Jev را روی سیستم خودتان و با سرعت برق‌آسا اجرا کنید!

توسعه‌دهندگان با ابزار متن‌باز جدیدی به نام Jevstiller راهکاری ارائه کرده‌اند که خروجی‌های هوش مصنوعی Jev را تقطیر کرده و روی سخت‌افزار محلی شما اجرا می‌کند. با این ترفند، درخواست‌های آشنا در عرض تنها ۱۵ میلی‌ثانیه روی پردازنده سیستم پاسخ داده می‌شوند و نیازی به پرداخت هزینه توکن نخواهید داشت.

۴ دقیقه مطالعه
۰
۷ مهر
اوپن‌ای‌آی کادکس را متحول کرد: محیط‌های ابری پایدار، کدنویسی صوتی و ایجنت‌های همه‌کاره!
آخرین اخبار

اوپن‌ای‌آی کادکس را متحول کرد: محیط‌های ابری پایدار، کدنویسی صوتی و ایجنت‌های همه‌کاره!

اوپن‌ای‌آی در رویداد DevDay قابلیت‌های جدیدی را برای ایجنت مهندسی نرم‌افزار خود، کادکس (Codex)، معرفی کرد که امکان اجرای آن را در محیط‌های ابری پایدار و از طریق هر دستگاهی فراهم می‌کند. این به‌روزرسانی بزرگ شامل رابط کاربری خط فرمان با دستور صوتی، ابزار جدید بازبینی کد در نسخه دسکتاپ چت‌جی‌پی‌تی و سرویس ابری امنیتی برای اسکن و رفع خودکار آسیب‌پذیری‌ها است.

۳ دقیقه مطالعه
۰
۷ مهر