اجرای مدل Qwen3.8-27B روی یک کارت گرافیک RTX 3090 با سرعت ۱۰۳۵ توکنبرثانیه توسط HyperQwen
پروژه HyperQwen با استفاده از نسخه بهینهشده vLLM، امکان اجرای مدل ۲۷ میلیارد پارامتری Qwen3.8-27B را روی یک کارت گرافیک ۲۴ گیگابایتی RTX 3090 فراهم کرده است.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- اجرای مدل سنگین ۲۷ میلیارد پارامتری روی تنها یک کارت گرافیک ۲۴ گیگابایتی به کمک تکنیکهای فشردهسازی و نسخه تغییریافته vLLM.
- دستیابی به سرعت پردازش خیرهکننده ۱۰۳۵ توکنبرثانیه در حالت پردازش همزمان و پشتیبانی از پنجره زمینه تا ۲۴۰ هزار توکن.
- ارائه پنج پروفایل پیکربندی متنوع برای نیازهای مختلف، از اجرای چت تککاربره تا پردازش پرامپتهای بسیار طولانی.
اجرای مدل Qwen3.8-27B روی یک کارت گرافیک RTX 3090 با HyperQwen
اجرای یک مدل ۲۷ میلیارد پارامتری روی یک کارت گرافیک ۲۴ گیگابایتی فشار زیادی به سیستم وارد میکند، زیرا وزنهای مدل، فعالسازیهای موقت و حافظه پنهان کلید-مقدار (KV Cache) برای استفاده از حافظه با یکدیگر رقابت میکنند. مخزن HyperQwen شامل یک پشته بهینهشده از vLLM و یک مسیر پردازشی برای کوانتایز مجدد (Requantization) است که چکپوینت مدل Qwen3.8-27B را به آرتیفکتهایی با دقت پایینتر تبدیل میکند تا امکان سرویسدهی آن روی یک پردازنده گرافیکی (GPU) واحد فراهم شود.
ارقام خیرهکننده ارائهشده، حاصل بنچمارکهای این پروژه روی یک کارت گرافیک RTX 3090 با محدودیت توان ۲۵۰ وات است. از آنجا که عملکرد مدل به شدت به میزان پردازش همزمان، طول زمینه و مقدار خروجیِ قابل استخراج از پرامپت بستگی دارد، تایید ادعاهای گستردهتر نیازمند آزمایشهای مستقل روی سایر کارتهای گرافیک و چکپوینتها است.
پنج پروفایل پیکربندی برای مدیریت ترافیک
پروفایل | پیکربندی | بهترین کاربرد | نتیجه گزارششده |
|---|---|---|---|
الف: پردازش دستهای (Batch) | پیشفرض | ترافیک همزمان API | مجموع رمزگشایی حدود ۱۰۳۵ توکنبرثانیه در ۶۴ درخواست همزمان |
ب: پیشفرض تکی | پیشفرض | یک کاربر فعال | ۱۲۷ توکنبرثانیه با زمینه ۶۴ هزار توکنی |
ج: بازتولید | DFLASH_TOKENS=15 | استخراج، نقلقول و تبدیلهای مبتنی بر پرامپت | ۳۸۱ توکنبرثانیه در حین بازتولید متن پرامپت، با زمینه ۵۶ هزار توکنی |
د: زمینه طولانی | SPEC=mtp CTX=long | پرامپتهای بزرگ با تولید سریعتر | حدود ۹۵ تا ۱۰۰ توکنبرثانیه با زمینه ۱۵۰ هزار توکنی |
هـ: زمینه عظیم | CTX=huge | حداکثر زمینه بستهبندیشده | ۶۷ توکنبرثانیه در تولید ترکیبی با زمینه ۲۴۰ هزار توکنی |
بکاند حافظه پنهان KVarN در آزمایشهای جداگانه به حداکثر ظرفیت گزارششده ۲۶۲ هزار توکن میرسد، در حالی که پروفایل (هـ) از تنظیمات ۲۴۰ هزار توکنی استفاده میکند. بر اساس اندازهگیریهای این مخزن، چتهای معمولی و باز با سرعت حدود ۱۳۳ توکنبرثانیه اجرا میشوند.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.