پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

اجرای مدل Qwen3.8-27B روی یک کارت گرافیک RTX 3090 با سرعت ۱۰۳۵ توکن‌بر‌ثانیه توسط HyperQwen

انتشار:۳۱ شهریور ۱۴۰۵(۶ روز پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

پروژه HyperQwen با استفاده از نسخه بهینه‌شده vLLM، امکان اجرای مدل ۲۷ میلیارد پارامتری Qwen3.8-27B را روی یک کارت گرافیک ۲۴ گیگابایتی RTX 3090 فراهم کرده است.

اجرای مدل Qwen3.8-27B روی یک کارت گرافیک RTX 3090 با سرعت ۱۰۳۵ توکن‌بر‌ثانیه توسط HyperQwen

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • اجرای مدل سنگین ۲۷ میلیارد پارامتری روی تنها یک کارت گرافیک ۲۴ گیگابایتی به کمک تکنیک‌های فشرده‌سازی و نسخه تغییریافته vLLM.
  • دستیابی به سرعت پردازش خیره‌کننده ۱۰۳۵ توکن‌بر‌ثانیه در حالت پردازش همزمان و پشتیبانی از پنجره زمینه تا ۲۴۰ هزار توکن.
  • ارائه پنج پروفایل پیکربندی متنوع برای نیازهای مختلف، از اجرای چت تک‌کاربره تا پردازش پرامپت‌های بسیار طولانی.

اجرای مدل Qwen3.8-27B روی یک کارت گرافیک RTX 3090 با HyperQwen

اجرای یک مدل ۲۷ میلیارد پارامتری روی یک کارت گرافیک ۲۴ گیگابایتی فشار زیادی به سیستم وارد می‌کند، زیرا وزن‌های مدل، فعال‌سازی‌های موقت و حافظه پنهان کلید-مقدار (KV Cache) برای استفاده از حافظه با یکدیگر رقابت می‌کنند. مخزن HyperQwen شامل یک پشته بهینه‌شده از vLLM و یک مسیر پردازشی برای کوانتایز مجدد (Requantization) است که چک‌پوینت مدل Qwen3.8-27B را به آرتیفکت‌هایی با دقت پایین‌تر تبدیل می‌کند تا امکان سرویس‌دهی آن روی یک پردازنده گرافیکی (GPU) واحد فراهم شود.

ارقام خیره‌کننده ارائه‌شده، حاصل بنچمارک‌های این پروژه روی یک کارت گرافیک RTX 3090 با محدودیت توان ۲۵۰ وات است. از آنجا که عملکرد مدل به شدت به میزان پردازش همزمان، طول زمینه و مقدار خروجیِ قابل استخراج از پرامپت بستگی دارد، تایید ادعاهای گسترده‌تر نیازمند آزمایش‌های مستقل روی سایر کارت‌های گرافیک و چک‌پوینت‌ها است.

پنج پروفایل پیکربندی برای مدیریت ترافیک

پروفایل
پیکربندی
بهترین کاربرد
نتیجه گزارش‌شده
الف: پردازش دسته‌ای (Batch)
پیش‌فرض
ترافیک همزمان API
مجموع رمزگشایی حدود ۱۰۳۵ توکن‌بر‌ثانیه در ۶۴ درخواست همزمان
ب: پیش‌فرض تکی
پیش‌فرض
یک کاربر فعال
۱۲۷ توکن‌بر‌ثانیه با زمینه ۶۴ هزار توکنی
ج: بازتولید
DFLASH_TOKENS=15
استخراج، نقل‌قول و تبدیل‌های مبتنی بر پرامپت
۳۸۱ توکن‌بر‌ثانیه در حین بازتولید متن پرامپت، با زمینه ۵۶ هزار توکنی
د: زمینه طولانی
SPEC=mtp CTX=long
پرامپت‌های بزرگ با تولید سریع‌تر
حدود ۹۵ تا ۱۰۰ توکن‌بر‌ثانیه با زمینه ۱۵۰ هزار توکنی
هـ: زمینه عظیم
CTX=huge
حداکثر زمینه بسته‌بندی‌شده
۶۷ توکن‌بر‌ثانیه در تولید ترکیبی با زمینه ۲۴۰ هزار توکنی

بک‌اند حافظه پنهان KVarN در آزمایش‌های جداگانه به حداکثر ظرفیت گزارش‌شده ۲۶۲ هزار توکن می‌رسد، در حالی که پروفایل (هـ) از تنظیمات ۲۴۰ هزار توکنی استفاده می‌کند. بر اساس اندازه‌گیری‌های این مخزن، چت‌های معمولی و باز با سرعت حدود ۱۳۳ توکن‌بر‌ثانیه اجرا می‌شوند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر