پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

انتشار نسخه ۴ بیتی Qwen3-32B؛ اجرای مدل استدلال ۳۲ میلیارد پارامتری Alibaba روی گرافیک‌های ۲۴ گیگابایتی

انتشار:۴ مهر ۱۴۰۵(۲ روز پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

تیم توسعه‌دهنده Qwen در Alibaba نسخه کوانتیزه‌شده رسمی ۴ بیتی مدل استدلال Qwen3-32B را با معماری متراکم منتشر کرد. این نسخه با کاهش حجم وزن‌ها به حدود ۲۰ گیگابایت، امکان اجرای محلی این مدل هوش مصنوعی ۳۲.۸ میلیارد پارامتری را روی کارت‌های گرافیک مصرفی ۲۴ گیگابایتی مانند RTX 4090 و RTX 3090 فراهم می‌کند.

انتشار نسخه ۴ بیتی Qwen3-32B؛ اجرای مدل استدلال ۳۲ میلیارد پارامتری Alibaba روی گرافیک‌های ۲۴ گیگابایتی

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • تیم Qwen از نسخه رسمی ۴ بیتی مدل استدلال Qwen3-32B بر پایه الگوریتم AWQ رونمایی کرد.
  • حجم وزن‌های مدل از حدود ۶۵.۶ گیگابایت در فرمت bf16 به ۲۰ گیگابایت کاهش یافته و امکان اجرا روی پردازنده‌های گرافیکی مصرفی ۲۴ گیگابایتی مانند RTX 4090 و RTX 3090 را مهیا کرده است.
  • افت عملکرد در ارزیابی بنچمارک‌ها بسیار ناچیز بوده و نمرات آن بین ۲ نمره افت تا ۰.۶ نمره رشد گزارش شده است.
  • پشتیبانی محلی از پنجره کانتکست ۳۲٬۷۶۸ توکنی فعال است و با تکنیک YaRN تا بیش از ۱۳۱ هزار توکن قابل ارتقا خواهد بود.

انتشار نسخه رسمی ۴ بیتی چک‌پوینت Qwen3-32B توسط Qwen

تیم توسعه‌دهنده Qwen در Alibaba از نسخه Qwen3-32B-AWQ رونمایی کرده است؛ یک کوانتیزاسیون رسمی ۴ بیتی از مدل متراکم استدلالی با ۳۲.۸ میلیارد پارامتر. این چک‌پوینت حجم خام موردنیاز برای ذخیره‌سازی وزن‌های مدل را از حدود ۶۵.۶ گیگابایت در قالب bf16 به حدود ۲۰ گیگابایت کاهش می‌دهد و در نتیجه، امکان استقرار آن را روی پردازنده‌های گرافیکی ۲۴ گیگابایتی نظیر RTX 3090، RTX 4090 و L4 فراهم می‌سازد. مقایسه بنچمارک‌های ارائه‌شده از سوی تیم Qwen نشان می‌دهد که تغییرات عملکردی این نسخه بسیار ناچیز بوده و دامنه‌ای بین ۲ نمره افت تا ۰.۶ نمره بهبود را به ثبت رسانده است.

استقرار وزن‌های مدل ۳۲ میلیاردی روی کارت گرافیک ۲۴ گیگابایتی

مدل Qwen3-32B بزرگ‌ترین مدل متراکم (Dense) در خانواده اصلی Qwen3 به شمار می‌رود که در کنار مدل‌های مبتنی بر ترکیبی از متخصصان (MoE) مانند 30B-A3B و 235B-A22B قرار گرفته است. مدل‌های متراکم برای پردازش هر توکن تمام لایه‌های خود را فعال می‌کنند، در حالی که مدل‌های MoE هر توکن را تنها از میان زیرمجموعه کوچک‌تری از پارامترها عبور می‌دهند. مدل Qwen3-32B در مجموع ۳۲.۸ میلیارد پارامتر دارد که شامل ۳۱.۲ میلیارد پارامتر غیرجای‌گذاری‌شده (non-embedding) در ۶۴ لایه است. مکانیزم توجه Grouped-Query در این مدل از ۶۴ هد پرس‌وجو (Query Heads) و هشت هد کلید-مقدار (Key-Value Heads) بهره می‌برد.

روش کوانتیزاسیون AWQ یا همان Activation-aware Weight Quantization مقادیر ۴ بیتی را به اغلب وزن‌های لایه‌های خطی اختصاص می‌دهد، در حالی که با استفاده از داده‌های کالیبراسیون، کانال‌هایی را که بیشترین اثر را روی خروجی دارند با دقت بالاتری حفظ می‌کند. با این حال، مقادیر اکتیویشن‌ها و حافظه کَش کلید-مقدار (KV Cache) با همان دقتی که توسط موتور استنتاج تعیین می‌شود باقی می‌مانند؛ به همین دلیل، کل حافظه رم گرافیکی موردنیاز در زمان اجرا از حجم فایل چک‌پوینت فراتر می‌رود. در عمل عواملی نظیر کرنل‌های CUDA، بافرهای موقت، طول پرامپت، اندازه بچ (Batch Size) و پردازش‌های هم‌زمان مشخص می‌کنند که آیا مدل در حافظه قرار می‌گیرد یا خیر؛ کارت‌های گرافیک ۲۴ گیگابایتی به‌ویژه در پردازش کانتکست‌های طولانی، فضای بسیار محدودی را برای کَش کلید-مقدار باقی می‌گذارند.

این مدل به‌صورت پیش‌فرض از پنجره زمینه ۳۲٬۷۶۸ توکنی پشتیبانی می‌کند و با استفاده از روش مقیاس‌پذیری مکانی YaRN، این ظرفیت تا ۱۳۱٬۰۷۲ توکن قابل افزایش است. عمده موتورهای متن‌باز معمولاً ضریب مقیاس‌گذاری استاتیک YaRN را اعمال می‌کنند که این موضوع می‌تواند کیفیت خروجی را در ورودی‌های کوتاه‌تر کاهش دهد؛ به همین سبب، تیم Qwen توصیه می‌کند این قابلیت تنها برای بارهای کاری فعال شود که واقعاً به آن نیاز دارند. علاوه بر این، حافظه موردنیاز برای کَش کلید-مقدار متناسب با طول توالی افزایش می‌یابد و همین مسئله استفاده از کل پنجره ۱۲۸ هزار توکنی را روی بسیاری از کانفیگ‌های تک‌کارته عملاً ناممکن می‌سازد.

یک چک‌پوینت، دو مسیر رمزگشایی

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر