انتشار نسخه ۴ بیتی Qwen3-32B؛ اجرای مدل استدلال ۳۲ میلیارد پارامتری Alibaba روی گرافیکهای ۲۴ گیگابایتی
تیم توسعهدهنده Qwen در Alibaba نسخه کوانتیزهشده رسمی ۴ بیتی مدل استدلال Qwen3-32B را با معماری متراکم منتشر کرد. این نسخه با کاهش حجم وزنها به حدود ۲۰ گیگابایت، امکان اجرای محلی این مدل هوش مصنوعی ۳۲.۸ میلیارد پارامتری را روی کارتهای گرافیک مصرفی ۲۴ گیگابایتی مانند RTX 4090 و RTX 3090 فراهم میکند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- تیم Qwen از نسخه رسمی ۴ بیتی مدل استدلال Qwen3-32B بر پایه الگوریتم AWQ رونمایی کرد.
- حجم وزنهای مدل از حدود ۶۵.۶ گیگابایت در فرمت bf16 به ۲۰ گیگابایت کاهش یافته و امکان اجرا روی پردازندههای گرافیکی مصرفی ۲۴ گیگابایتی مانند RTX 4090 و RTX 3090 را مهیا کرده است.
- افت عملکرد در ارزیابی بنچمارکها بسیار ناچیز بوده و نمرات آن بین ۲ نمره افت تا ۰.۶ نمره رشد گزارش شده است.
- پشتیبانی محلی از پنجره کانتکست ۳۲٬۷۶۸ توکنی فعال است و با تکنیک YaRN تا بیش از ۱۳۱ هزار توکن قابل ارتقا خواهد بود.
انتشار نسخه رسمی ۴ بیتی چکپوینت Qwen3-32B توسط Qwen
تیم توسعهدهنده Qwen در Alibaba از نسخه Qwen3-32B-AWQ رونمایی کرده است؛ یک کوانتیزاسیون رسمی ۴ بیتی از مدل متراکم استدلالی با ۳۲.۸ میلیارد پارامتر. این چکپوینت حجم خام موردنیاز برای ذخیرهسازی وزنهای مدل را از حدود ۶۵.۶ گیگابایت در قالب bf16 به حدود ۲۰ گیگابایت کاهش میدهد و در نتیجه، امکان استقرار آن را روی پردازندههای گرافیکی ۲۴ گیگابایتی نظیر RTX 3090، RTX 4090 و L4 فراهم میسازد. مقایسه بنچمارکهای ارائهشده از سوی تیم Qwen نشان میدهد که تغییرات عملکردی این نسخه بسیار ناچیز بوده و دامنهای بین ۲ نمره افت تا ۰.۶ نمره بهبود را به ثبت رسانده است.
استقرار وزنهای مدل ۳۲ میلیاردی روی کارت گرافیک ۲۴ گیگابایتی
مدل Qwen3-32B بزرگترین مدل متراکم (Dense) در خانواده اصلی Qwen3 به شمار میرود که در کنار مدلهای مبتنی بر ترکیبی از متخصصان (MoE) مانند 30B-A3B و 235B-A22B قرار گرفته است. مدلهای متراکم برای پردازش هر توکن تمام لایههای خود را فعال میکنند، در حالی که مدلهای MoE هر توکن را تنها از میان زیرمجموعه کوچکتری از پارامترها عبور میدهند. مدل Qwen3-32B در مجموع ۳۲.۸ میلیارد پارامتر دارد که شامل ۳۱.۲ میلیارد پارامتر غیرجایگذاریشده (non-embedding) در ۶۴ لایه است. مکانیزم توجه Grouped-Query در این مدل از ۶۴ هد پرسوجو (Query Heads) و هشت هد کلید-مقدار (Key-Value Heads) بهره میبرد.
روش کوانتیزاسیون AWQ یا همان Activation-aware Weight Quantization مقادیر ۴ بیتی را به اغلب وزنهای لایههای خطی اختصاص میدهد، در حالی که با استفاده از دادههای کالیبراسیون، کانالهایی را که بیشترین اثر را روی خروجی دارند با دقت بالاتری حفظ میکند. با این حال، مقادیر اکتیویشنها و حافظه کَش کلید-مقدار (KV Cache) با همان دقتی که توسط موتور استنتاج تعیین میشود باقی میمانند؛ به همین دلیل، کل حافظه رم گرافیکی موردنیاز در زمان اجرا از حجم فایل چکپوینت فراتر میرود. در عمل عواملی نظیر کرنلهای CUDA، بافرهای موقت، طول پرامپت، اندازه بچ (Batch Size) و پردازشهای همزمان مشخص میکنند که آیا مدل در حافظه قرار میگیرد یا خیر؛ کارتهای گرافیک ۲۴ گیگابایتی بهویژه در پردازش کانتکستهای طولانی، فضای بسیار محدودی را برای کَش کلید-مقدار باقی میگذارند.
این مدل بهصورت پیشفرض از پنجره زمینه ۳۲٬۷۶۸ توکنی پشتیبانی میکند و با استفاده از روش مقیاسپذیری مکانی YaRN، این ظرفیت تا ۱۳۱٬۰۷۲ توکن قابل افزایش است. عمده موتورهای متنباز معمولاً ضریب مقیاسگذاری استاتیک YaRN را اعمال میکنند که این موضوع میتواند کیفیت خروجی را در ورودیهای کوتاهتر کاهش دهد؛ به همین سبب، تیم Qwen توصیه میکند این قابلیت تنها برای بارهای کاری فعال شود که واقعاً به آن نیاز دارند. علاوه بر این، حافظه موردنیاز برای کَش کلید-مقدار متناسب با طول توالی افزایش مییابد و همین مسئله استفاده از کل پنجره ۱۲۸ هزار توکنی را روی بسیاری از کانفیگهای تککارته عملاً ناممکن میسازد.
یک چکپوینت، دو مسیر رمزگشایی
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.