انویدیا مدل Qwen2.5-VL را برای پردازندههای بلکول بهینهسازی کرد؛ ۳.۶ برابر سبکتر و سریعتر!
انویدیا نسخه بهینهسازیشده مدل بینایی-زبانی Qwen2.5-VL-7B را با فرمت فشرده NVFP4 برای پردازندههای گرافیکی بلکول منتشر کرد. این نسخه با کاهش ۳.۶ برابری حجم لایهها و بهرهگیری از فریمورک TensorRT-LLM، امکان اجرای فوقسریع و کممصرف این مدل هوش مصنوعی قدرتمند را روی سرورها فراهم میکند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- انویدیا نسخه بهینهسازیشدهای از مدل چندحالته Qwen2.5-VL-7B علیبابا را برای پردازندههای نسل جدید بلکول منتشر کرد که با فرمت فشرده NVFP4 کار میکند.
- با تکیه بر هستههای تانسور بلکول، حجم لایههای کوانتیزهشده ۳.۶ برابر نسبت به BF16 سبکتر شده و توان پردازشی هم تا ۲ برابر نسبت به FP8 بیشتر میشود.
- برای حفظ دقت و کیفیت بینایی مدل، انکودر تصویر با دقت بالا باقی مانده و تنها بخشهای زبانی فشرده شدهاند تا هیچ افتی در درک بصری ایجاد نشود.
بستهبندی مدل Qwen2.5-VL 7B توسط انویدیا برای پردازش بومی FP4 روی بلکول
انویدیا نسخه از پیش کوانتیزهشدهای از مدل محبوب Qwen2.5-VL-7B-Instruct متعلق به علیبابا را برای پردازندههای گرافیکی نسل جدید بلکول (Blackwell) منتشر کرد. این نسخه، مدل بینایی-زبانی را در قالب فرمت اختصاصی NVFP4 انویدیا بستهبندی کرده و هدف اصلی آن استقرار و اجرای فوقسریع از طریق فریمورک TensorRT-LLM است.
هستههای تانسور پردازندههای بلکول قابلیت اجرای بومی و سختافزاری فرمت NVFP4 را دارند؛ قابلیتی که باعث میشود این مدل نسبت به نسخههای BF16 یا FP8، حافظه ویدیویی بسیار کمتری مصرف کند و سرعت خروجی (Throughput) به مراتب بالاتری داشته باشد. البته این جهش کارایی بیشتر مربوط به لایههای خطیِ کوانتیزهشده مدل زبانی است؛ در حالی که انکودر بینایی و برخی تانسورهای پشتیبان همچنان با دقت محاسباتی بالاتر اجرا میشوند تا کیفیت درک تصویر افت نکند.
فرمت NVFP4 چگونه وزنها را در بلوکهای ۱۶ مقداری فشرده میکند؟
فرمت NVFP4 هر مقدار کوانتیزهشده را در ساختار E2M1 ذخیره میکند: یک بیت علامت، دو بیت توان و یک بیت مانتیس. از آنجا که چهار بیت به تنهایی دامنه محدودی دارد، این فرمت دو سطح مقیاسبندی (Scaling) هوشمندانه به آن اضافه کرده است:
- هر ریزبلوک (Micro-block) ۱۶ عددی، یک مقیاس FP8 با ساختار E4M3 را به اشتراک میگذارد.
- علاوه بر این، هر تانسور یک مقیاس کلی با دقت FP32 نیز به همراه دارد.
- مقیاسهای بلوکی FP8 میانگین ذخیرهسازی را به حدود ۴.۵ بیت به ازای هر مقدار میرسانند که با در نظر گرفتن هزینه ناچیز مقیاس تانسوری، فشردگی فوقالعادهای به همراه دارد.
این معماری باعث میشود حجم ذخیرهسازی تانسورهای کوانتیزهشده حدود ۳.۶ برابر نسبت به فرمت BF16 کمتر شود. همچنین انویدیا وعده داده که حداکثر توان پردازشی هستههای تانسور در بلکول برای فرمت FP4 تا دو برابر سریعتر از FP8 خواهد بود. البته عملکرد نهایی سیستم در عمل به سرعت انکودر بینایی، ترافیک حافظه KV-Cache، پردازش دستهای درخواستها، دسترسی به کرنلهای بهینه و سهم بخشهایی که با دقت بالا اجرا میشوند بستگی دارد.
بخش بینایی مدل همچنان با دقت بالا اجرا میشود
انویدیا این نسخه بهینهشده را با استفاده از ابزار Model Optimizer و به روش کوانتیزهسازی پس از آموزش (PTQ) روی مدل پایه کیوئن پیاده کرده است. پیکربندی این نسخه به صورت زیر است:
بخش مدل | جزئیات پیکربندی |
|---|---|
لایههای کوانتیزهشده | عملگرهای خطی در بلوکهای ترنسفورمر مدل زبانی |
لایههای با دقت بالا | انکودر بینایی و تانسورهای حساس به دقت محاسباتی |
مطالب مرتبط و پیشنهادی

استارتاپ Wabi به پیامرسان هوش مصنوعی تبدیل شد؛ ایجنتی که در لحظه براتون اپلیکیشن میسازه!
استارتاپ Wabi که با ابزار ساخت اپلیکیشن از طریق پرامپت سروصدا کرده بود، حالا با معرفی نسخه ۲.۰ مسیرش رو تغییر داده و به یک پیامرسان هوشمند تبدیل شده است. این ایجنت شخصی جدید نهتنها کارهای روزمرهتان را انجام میدهد، بلکه در لحظه و درست وسط چت، هر رابط کاربری یا مینیاپی را که نیاز داشته باشید خلق میکند.

ابزار متنباز Jevstiller معرفی شد؛ هوش مصنوعی Jev را روی سیستم خودتان و با سرعت برقآسا اجرا کنید!
توسعهدهندگان با ابزار متنباز جدیدی به نام Jevstiller راهکاری ارائه کردهاند که خروجیهای هوش مصنوعی Jev را تقطیر کرده و روی سختافزار محلی شما اجرا میکند. با این ترفند، درخواستهای آشنا در عرض تنها ۱۵ میلیثانیه روی پردازنده سیستم پاسخ داده میشوند و نیازی به پرداخت هزینه توکن نخواهید داشت.

اوپنایآی کادکس را متحول کرد: محیطهای ابری پایدار، کدنویسی صوتی و ایجنتهای همهکاره!
اوپنایآی در رویداد DevDay قابلیتهای جدیدی را برای ایجنت مهندسی نرمافزار خود، کادکس (Codex)، معرفی کرد که امکان اجرای آن را در محیطهای ابری پایدار و از طریق هر دستگاهی فراهم میکند. این بهروزرسانی بزرگ شامل رابط کاربری خط فرمان با دستور صوتی، ابزار جدید بازبینی کد در نسخه دسکتاپ چتجیپیتی و سرویس ابری امنیتی برای اسکن و رفع خودکار آسیبپذیریها است.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.