پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

رکوردشکنی vLLM روی معماری جدید انویدیا: اجرای مدل MiniMax تا ۸ برابر سریع‌تر با تراشه‌های Vera Rubin!

انتشار:۱۸ مهر ۱۴۰۵(۱ ساعت پیش)
۵ دقیقه زمان مطالعه
۰ دیدگاه
اشتراک و پسندیدن

فریم‌ورک محبوب vLLM با انتشار بیلدهای آزمایشی، پشتیبانی از نسل آینده تراشه‌های انویدیا با معماری Vera Rubin را آغاز کرده و در بنچمارک‌های اولیه، به سرعت اعجاب‌انگیز نزدیک به ۸ برابری در اجرای مدل‌های زبانی بزرگ دست یافته است. این جهش عظیم به لطف پهنای باند خیره‌کننده حافظه‌های HBM4 و بهینه‌سازی‌های عمیق هسته‌های پردازشی رقم خورده که مسیر جدیدی را برای استنتاج ارزان‌تر و سریع‌تر هوش مصنوعی هموار می‌کند.

رکوردشکنی vLLM روی معماری جدید انویدیا: اجرای مدل MiniMax تا ۸ برابر سریع‌تر با تراشه‌های Vera Rubin!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • فریم‌ورک محبوب vLLM از همین حالا پشتیبانی آزمایشی از غول جدید انویدیا یعنی Vera Rubin NVL72 را کلید زده و موفق شده در اجرای مدل MiniMax M3 به جهش خروجی خارق‌العاده ۷.۸۴ برابری به ازای هر پردازنده گرافیکی دست پیدا کند.
  • راز این جهش چشمگیر در پهنای باند سرسام‌آور حافظه‌های نسل جدید HBM4 و قابلیت‌های نوین کوودا ۱۳.۴ نهفته است که وزن‌های مدل‌های ترکیبی از متخصصان (MoE) را درست در مجاورت هسته‌های پردازشی قرار می‌دهد.
  • البته این نتایج فعلاً روی نسخه‌های اولیه و آزمایشی به دست آمده و برای اینکه ببینیم این اعداد و ارقام در دنیای واقعی و پروژه‌های عملیاتی چقدر هزینه‌ها را کاهش می‌دهند، باید منتظر تست‌های مستقل بعدی بمانیم.

فریم‌ورک محبوب و متن‌باز vLLM در تازه‌ترین کانتینرهای آزمایشی (Nightly) خود که بر پایه CUDA 13.4 و PyTorch 2.15 توسعه یافته‌اند، پشتیبانی پیش‌نمایش از پلتفرم نسل جدید Vera Rubin NVL72 انویدیا را اضافه کرده است. این پروژه با همکاری مستقیم تیم‌های Inferact، انویدیا و رد هت (Red Hat) موفق شده مدل‌های مطرحی چون دیپ‌سیک (DeepSeek)، کیمی (Kimi)، جی‌ال‌ام (GLM) و مینی‌مکس (MiniMax) را روی سخت‌افزار پیشرفته روبین اجرا کند. در این میان، کتابخانه FlashInfer نسخه 0.7.0 نیز هسته‌های محاسباتی بهینه‌شده برای روبین از جمله مکانیزم توجه (Attention)، ضرب ماتریسی GEMM و شبکه‌های ترکیبی از متخصصان (MoE) را در اختیار این فریم‌ورک قرار می‌دهد.

نتایج اولیه منتشرشده در پیش‌نمایش رسمی vLLM نشان می‌دهد که توان خروجی و پردازش داده‌ها در مقایسه با سیستم‌های پیشین GB200 و GB300 انویدیا جهش چشمگیری داشته است. این مقایسه‌ها روی دو بار کاری (Workload) کاملاً متفاوت سنجیده شده و البته باید در نظر داشت که این آمار‌ها در حال حاضر معیارهای پیش‌نمایش هستند و هنوز به عنوان بنچمارک‌های نهایی و مستقل در محیط‌های عملیاتی تأیید نشده‌اند.

دو بار کاری متفاوت با جهش‌های اولیه چشمگیر

در نتایج بنچمارک AgentX از مدل MiniMax M3 برای سنجش استنتاج ایجنتی استفاده شده است؛ شرایطی که در آن کانتکست‌های طولانی و فراخوانی‌های مکرر مدل، فشار بسیار سنگینی به پهنای باند حافظه و اجرای معماری MoE وارد می‌کند. در طرف مقابل، تست‌های بنچمارک استنتاج MLPerf v6.1 با مدل چندحالته قدرتمند Qwen3-VL-235B-A22B انجام شده که در آن سیستم NVIDIA Dynamo درخواست‌ها را میان ورکر‌های vLLM توزیع و هدایت می‌کند.

بنچمارک
مدل و پشته نرم‌افزاری
سیستم پایه (بیس‌لاین)
شرایط آزمون
بهبود ثبت‌شده
مدل MiniMax M3 روی vLLM
انویدیا GB200
پاسخ‌دهی تعاملی یکسان (Matched Interactivity)
تا ۷.۸۴ برابر توان خروجی بیش‌تر به ازای هر پردازنده
AgentX
مدل MiniMax M3 روی vLLM
انویدیا GB200
تولید ۱۵۰ توکن بر ثانیه
۵.۱۸ برابر توان خروجی بیش‌تر
MLPerf Inference v6.1 VLM
مدل Qwen3-VL-235B-A22B با ترکیب vLLM و Dynamo
انویدیا GB300 NVL72
سناریوهای آفلاین، سرور و تعاملی
تا ۳.۷ برابر توان خروجی بیش‌تر

این اعداد و ارقام نشان‌دهنده پیکربندی‌های مجزای بنچمارک هستند و باید دقیقاً متناسب با بارهای کاری اختصاصی خودشان بررسی شوند. معیار «پاسخ‌دهی تعاملی یکسان» سرعت پاسخ‌گویی به کاربر را در یک حد ثابت نگه می‌دارد و اندازه می‌گیرد که هر سیستم در مجموع چه حجم ترافیکی را می‌تواند پردازش و پاسخ‌دهی کند.

پهنای باند فراتر از تصور برای فاز رمزگشایی (Decode)

سیستم رک‌اسکیل Vera Rubin NVL72 تعداد ۷۲ پردازنده گرافیکی روبین را در یک شبکه یکپارچه به هم متصل می‌کند. معماری روبین بخش اعظم سازگاری نرم‌افزاری خود را با مدل برنامه‌نویسی بلک‌ول (Blackwell) حفظ کرده، در حالی که تارگت کامپایل جدید sm107 را معرفی کرده و مجموعه دستورالعمل‌های هسته‌های تانسور tcgen05 را نیز ارتقا داده است. شرکت انویدیا در مقایسه روبین با سیستم GB200 NVL72، بهینه‌سازی‌های اوج پردازشی زیر را به ازای هر پردازنده گزارش می‌دهد:

  • تا ۵ برابر قدرت محاسباتی (FLOPS) بیش‌تر در استنتاج با فرمت NVFP4
  • ۲.۴ برابر پهنای باند حافظه HBM بیش‌تر با مهاجرت از حافظه‌های HBM3e به نسل پیشرفته HBM4
  • تا ۱.۷ برابر پهنای باند ارتباطی بیش‌تر میان پردازنده‌ها به لطف نسل ششم رابط NVLink
  • ۲ برابر توان عملیاتی توابع نمایی در FP32 و ۴ برابر سریع‌تر در محاسبات BF16/FP16

فرایند استنتاج مدل‌های زبانی بزرگ معمولاً با یک فاز اولیه و سنگین پردازش پرامپت (پیش‌پر کردن کش) شروع می‌شود و سپس وارد فاز تولید توکن می‌گردد که وابستگی شدیدی به سرعت و پهنای باند حافظه دارد. حافظه‌های HBM4 با جابه‌جایی بسیار سریع‌تر وزن‌های مدل و داده‌های حافظه پنهان کلید-مقدار (KV Cache)، کمک شایانی به مرحله رمزگشایی می‌کنند. علاوه بر این، سرعت محاسبات بالا‌تر در توابع نمایی باعث تسریع عملیات سافت‌مکس (Softmax) در مکانیزم توجه می‌شود؛ بخشی که در گذشته سرعت بهبود آن همواره از عملیات ضرب ماتریسی عقب‌تر مانده بود.

نمودار پلتفرم رک‌اسکیل انویدیا Vera Rubin
معماری پلتفرم رک‌اسکیل Vera Rubin انویدیا. منبع: پیش‌نمایش vLLM.

نزدیک‌تر شدن وزن‌های MoE به واحدهای پردازشی

کیت توسعه CUDA 13.4 قابلیتی موسوم به «دامنه‌های مکانی» (Locality Domains) را ارائه می‌دهد که به نرم‌افزار اجازه می‌دهد حافظه و محاسبات را درون یک پردازنده گرافیکی درست در مجاورت یکدیگر قرار دهد. از زمان معماری امپر (Ampere)، دسترسی به حافظه سراسری در پردازنده‌های گرافیکی انویدیا غیریکنواخت (Non-uniform) بوده است؛ به این معنی که یک پردازنده جریانی (Streaming Multiprocessor) می‌تواند برخی از بخش‌های حافظه HBM را با سرعتی بیش‌تر از بخش‌های دیگر بخواند. دامنه‌های مکانی به محیط‌های اجرایی امکانی می‌دهند تا مستقیماً از این توپولوژی سخت‌افزاری نهایت بهره را ببرند.

در مرحله رمزگشایی مدل‌های MoE، فریم‌ورک vLLM ماتریس‌های وزن متخصصان یعنی FC1 و FC2 را به بخش‌های ستونی (Shards) تقسیم می‌کند، هر بخش را به یک دامنه مکانی تخصیص می‌دهد و سپس از قابلیت Green Contexts در کوودا برای اجرای کرنل اختصاصی هر دامنه استفاده می‌نماید. با این ترفند، چندپردازنده‌های جریانی به جای اینکه بارها شبکه داخلی حافظه پردازنده را طی کنند، وزن‌های متخصص مجاور خود را مستقیماً فراخوانی می‌کنند.

طبق گزارش تیم vLLM، این بهینه‌سازی توانسته میانگین سرعت لایه‌های MoE در مدل MiniMax M3 را حین پاس رو به جلو (Forward Pass) توکن‌های کوتاه تا ۱.۲ برابر افزایش دهد. این نتیجه در تمام پیکربندی‌های TP2، TP4، EP2 و EP4 پایدار مانده است؛ جایی که TP نشان‌دهنده موازی‌سازی تانسور (Tensor Parallelism)، EP نشان‌دهنده موازی‌سازی متخصصان (Expert Parallelism) و اعداد معرف اندازه گروه‌های موازی است.

دریافت نسخه آزمایشی CUDA 13.4

توسعه‌دهندگانی که به سخت‌افزارهای روبین دسترسی دارند، می‌توانند ایمیج آزمایشی CUDA 13.4 این پروژه را با دستور زیر دریافت کنند:

docker pull vllm/vllm-openai:cu134-nightly

پرچم‌ها و تنظیمات اصلی برای انتخاب کرنل‌ها و مسیرهای ارتباطی سازگار با روبین به شرح زیر هستند:

  • پرچم --linear-backend flashinfer_cutedsl بک‌اند متراکم GEMM از نوع CuTe DSL NVFP4 را فعال می‌کند و به صورت پیش‌فرض برای چک‌پوینت‌های NVFP4 فعال است.
  • پرچم --moe-backend flashinfer_cutedsl هسته محاسباتی CuTe DSL NVFP4 را برای لایه‌های MoE به کار می‌اندازد.
  • تنظیم --kv-cache-dtype fp8 به همراه --attention-backend FLASHINFER یا FLASHINFER_MLA مسیر محاسباتی توجه FP8 بر پایه فناوری‌های TensorRT-LLM را فعال می‌کند.
  • پرچم‌های --enable-expert-parallel --data-parallel-size N --all2all-backend deepep_low_latency امکان موازی‌سازی متخصصان، ارتباطات با تاخیر بسیار کم DeepEP و عملیات ماتریسی Masked Grouped GEMM را برای فرمت‌های دسته‌ای متخصصان فراهم می‌آورند.

پوشش کنونی مدل‌ها شامل دیپ‌سیک، کیمی از استارتاپ مون‌شات (Moonshot AI)، مدل GLM از شرکت Z.ai و مینی‌مکس است. تراشه‌های روبین می‌توانند کرنل‌های کنونی بلک‌ول را که با تارگت روبه‌جلو و سازگار sm100f ساخته شده‌اند اجرا کنند؛ امری که پوشش اولیه گسترده‌ای را فراهم می‌سازد تا زمانی که کرنل‌های اختصاصی sm107 از راه برسند. از آنجا که ایمیج‌های نایتلی مرتباً دستخوش تغییر می‌شوند، پیشنهاد می‌شود برای ارزیابی‌های محیط عملیاتی، حتماً هش شناسه ایمیج (Digest) را ثابت نگه داشته و نسخه‌های vLLM، FlashInfer، CUDA و درایورها ثبت و مستند شوند.

محاسبات دنیای واقعی به داده‌های بیشتری نیاز دارد

در شرایط ایده‌آل و با فرض مقیاس‌پذیری کاملاً خطی، جهش ۷.۸۴ برابری توان به ازای هر پردازنده گرافیکی می‌تواند تعداد پردازنده‌های مورد نیاز برای پاسخ‌گویی به همان حجم درخواست‌های بنچمارک AgentX را به حدود ۱۳ درصد سیستم‌های GB200 کاهش دهد. همچنین نتیجه ۵.۱۸ برابری، این نیاز را به حدود ۱۹ درصد می‌رساند. با این وجود، برنامه‌ریزی واقعی برای ظرفیت سرور‌ها به عواملی نظیر نرخ بهره‌وری، تأخیرهای دم‌دراز (Tail Latency)، معماری مدل، طول کانتکست، بچینگ، مصرف برق، هزینه رک‌ها و میزان شباهت برنامه‌های کاربردی به بارهای کاری تست‌شده وابسته خواهد بود.

  • این نتایج حاصل تست‌های اولیه روی سخت‌افزار پیش‌تولید و تعداد محدودی از نودها است.
  • اندازه‌گیری‌ها توسط تیم‌های همکار پروژه منتشر شده و هنوز توسط مراجع مستقل بازتولید و راستی‌آزمایی نشده است.
  • عبارت «تا سقف» (Up to) بهترین سناریوی بهینه‌سازی را نشان می‌دهد، نه یک جهش تضمین‌شده در همه مدل‌ها و الگوهای ترافیکی گوناگون.
  • داده‌های منتشرشده جزئیات کافی از هزینه‌ها و مصرف انرژی برای تحلیل کامل هزینه کل مالکیت (TCO) را شامل نمی‌شود.
  • پشتیبانی از دامنه‌های مکانی در CUDA هنوز در مرحله توسعه و طراحی فعال قرار دارد.

نقشه راه آینده vLLM مواردی همچون پشتیبانی گسترده‌تر از دامنه‌های مکانی برای لایه‌های MoE، مسیر اختصاصی FlashInfer MegaMoE در sm107 و مگاکرنل‌های ادغام‌شده را شامل می‌شود تا سربار حافظه و راه‌اندازی کرنل در درخواست‌های حساس به تاخیر به حداقل برسد. این پروژه همچنین در تدارک ارائه هسته‌های توجه اختصاصی روبین برای مکانیزم‌های KDA، MLA، CSA و HCA برای مدل‌های Kimi K3 و DeepSeek-V4.1-Flash است. این قابلیت‌های تازه نشان خواهند داد که این پشته نرم‌افزاری تا چه حد می‌تواند فراتر از مسیرهای فعلی سازگار با بلک‌ول، از نهایت توان این غول سخت‌افزاری کار بکشد.

بازخورد و اشتراک‌گذاری این مطلب

اگر این گزارش برایتان مفید بود، با پسندیدن و اشتراک‌گذاری آن با دیگران، از محتوای تخصصی هوش مصنوعی حمایت کنید.

اشتراک‌گذاری در شبکه‌های اجتماعی:

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

نقشه اپل برای پادکست‌های هوش مصنوعی: جذب بی‌سروصدای تیم و فناوری استارتاپ Huxe
آخرین اخبار

نقشه اپل برای پادکست‌های هوش مصنوعی: جذب بی‌سروصدای تیم و فناوری استارتاپ Huxe

اپل با امضای قراردادی هوشمندانه، تیم و فناوری استارتاپ Huxe را جذب کرده تا احتمالاً قابلیت تولید پادکست‌های صوتی با هوش مصنوعی را به سرویس‌های خود بیاورد. بنیان‌گذاران این استارتاپ همان چهره‌هایی هستند که پیش از این پادکست‌های گفت‌وگومحور و پر سر و صدای NotebookLM را ساخته بودند.

۲ دقیقه مطالعه
۰
۱۸ مهر
شاهکار کم‌خرج آنتروپیک: کلود هایکو ۵.۵ با هزینه باورنکردنی ۲۴ دلار همه رقبا را جا گذاشت!
آخرین اخبار

شاهکار کم‌خرج آنتروپیک: کلود هایکو ۵.۵ با هزینه باورنکردنی ۲۴ دلار همه رقبا را جا گذاشت!

مدل چابک و جمع‌وجور کلود هایکو ۵.۵ (Claude Haiku 5.5) موفق شد با عملکرد درخشان و هزینه باورنکردنی ۲۴.۳ دلار به ازای هر ۱۰۰۰ کوئری، در صدر جدول بهره‌وری اقتصادی بنچمارک Parallel قرار بگیرد. این مدل با اختلافی اندک نسبت به برادر بزرگ‌تر و فوق‌العاده گران‌قیمت خود یعنی کلود اوپوس، هزینه‌ها را تا یک‌سی‌ونهم کاهش داده است. این جهش خیره‌کننده نشان می‌دهد که توسعه‌دهندگان می‌توانند با بودجه‌ای بسیار اقتصادی، ایجنت‌های هوش مصنوعی فوق‌العاده قدرتمندی برای جستجو و وب‌گردی بسازند.

۴ دقیقه مطالعه
۰
۱۸ مهر
اشتهای سیری‌ناپذیر هوش مصنوعی برای زمین و انرژی: دیتاسنترهایی که مزارع چند ایالت آمریکا را می‌بلعند!
آخرین اخبار

اشتهای سیری‌ناپذیر هوش مصنوعی برای زمین و انرژی: دیتاسنترهایی که مزارع چند ایالت آمریکا را می‌بلعند!

تب تند توسعه هوش مصنوعی حالا پایش به مزارع گندم و چراگاه‌های آرام آمریکا باز شده و دیتاسنترهای عظیم در حال تصاحب ده‌ها هزار هکتار از اراضی کشاورزی هستند. اما ماجرا فقط از دست رفتن زمین‌ها نیست؛ خلأهای قانونی و فرآیندهای اداری ناقص باعث شده ابعاد واقعی مصرف نجومی برق و زیرساخت‌های جانبی این غول‌های دیجیتال از دید مردم و شوراهای محلی پنهان بماند.

۵ دقیقه مطالعه
۰
۱۸ مهر