فشردهسازی شگفتانگیز غول ۷۵۳ میلیارد پارامتری GLM-5.3: کاهش حجم به ۲۷۳ گیگابایت برای اجرا روی ورکاستیشنها!
اینفاتوشی با انتشار نسخه فشردهشده EXL3 از مدل ۷۵۳ میلیارد پارامتری GLM-5.3، حجم این غول هوش مصنوعی را به ۲۷۳ گیگابایت رسانده است. این تکنیک کوانتایزیشن با میانگین ۳.۰۴ بیت به ازای هر وزن، اجرای این مدل عظیم را روی ورکاستیشنهای مجهز به چند کارت گرافیک ممکن میکند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- اینفاتوشی نسخه کوانتایزشده EXL3 مدل ۷۵۳ میلیارد پارامتری GLM-5.3-UNCENSORED را با میانگین ۳.۰۴ بیت به ازای هر وزن عرضه کرده که حجم آن را به ۲۷۳ گیگابایت رسانده است.
- با این فشردهسازی سنگین، امکان اجرای این مدل غولپیکر با معماری MoE روی ورکاستیشنهای حرفهای چندگرافیکه فراهم شده؛ هرچند هنوز برای یک کارت گرافیک معمولی بسیار بزرگ است.
- در این بهینهسازی از تکنیک دقت ترکیبی (Mixed-Precision) استفاده شده تا بخشهای حساسی مثل لایههای Attention با دقت بالاتری (۵ بیتی) حفظ شوند و افت کیفیت رخ ندهد.
کاهش وزنهای مدل ۷۵۳ میلیاردی GLM-5.3 به ۲۷۳ گیگابایت
توسعهدهندهای با نام اینفاتوشی (Infatoshi) بهتازگی یک نسخه مبتنی بر EXL3 از مدل GLM-5.3 منتشر کرده که به طور میانگین ۳.۰۴ بیت به ازای هر وزن (bpw) فضا میگیرد و کل حجم آن فقط ۲۷۳ گیگابایت (GiB) است. این فشردهسازی چشمگیر باعث میشود اجرای این مدل ۷۵۳ میلیارد پارامتری مبتنی بر معماری ترکیب کارشناسان (MoE)، روی ورکاستیشنهای ردهبالا با چند کارت گرافیک کاملاً عملی و شدنی باشد؛ هرچند اجرای آن هنوز فرسنگها فراتر از توان یک کارت گرافیک معمولی مصرفکننده است.
این خروجی در واقع حاصل کوانتایز کردن نسخه GLM-5.3-UNCENSORED-FP8 از تیم dealignai است؛ نسخهای که خودش بر پایه مدل اصلی GLM-5.3 از مجموعه zai-org دستکاری وزنی شده و بدون محدودیتهای مرسوم عمل میکند. بنابراین توسعهدهندگانی که قصد تست و ارزیابی آن را دارند باید هر دو تغییر را در نظر بگیرند: مدل پایه رفتار ریجکت پاسخها (refusal) را تغییر داده و تبدیل به EXL3 هم دقت محاسبات عددی را برای کاهش حجم پایین آورده است.
فشردهسازی هوشمند با دقت ترکیبی (Mixed-Precision)
مورد | جزئیات |
|---|---|
معماری | GlmMoeDsaForCausalLM |
تعداد کل پارامترها | ۷۵۳ میلیارد |
کارشناسهای مسیریابیشده (Routed Experts) | ۲۵۶ کارشناس (۸ کارشناس فعال به ازای هر توکن) |
کارشناسهای اشتراکی (Shared Experts) | ۱ |
لایهها | ۷۸ لایه ترنسفورمر و ۱ لایه MTP |
سازوکار توجه (Attention) | روش MLA همراه با نمایهساز تنک DSA |
کوانتایزیشن | فرمت EXL3 با میانگین ۳.۰۴ بیت به ازای هر وزن |
حجم نهایی مدل | ۲۷۳ گیگابایت (GiB) |
مدلهای مبتنی بر معماری «ترکیب کارشناسان» (Mixture-of-Experts یا MoE)، تعداد زیادی شبکه پیشخور تخصصی را در حافظه نگه میدارند اما برای پردازش هر توکن تنها بخش کوچکی از آنها را فعال میکنند. مدل GLM-5.3 به ازای هر توکن، ۸ کارشناس از بین ۲۵۶ کارشناس مسیریابیشده را به همراه یک کارشناس مشترک فعال میکند؛ این رویکرد بار محاسباتی فعال را به شدت کاهش میدهد، هرچند برای اجرای بدون دردسر، تمام کارشناسها باید کماکان در حافظه رم گرافیک حاضر باشند.
ابزار کوانتایزر در این پروژه هوشمندی به خرج داده و به بخشهایی که نسبت به فشردهسازی حساسترند بیتهای بیشتری اختصاص داده است، در حالی که کارشناسهای مسیریابیشده (که بخش اعظم حجم غولپیکر مدل را تشکیل میدهند) با بیتهای کمتری فشرده شدهاند تا حجم کلی به شدت افت کند.
بخش مدل | سطح دقت (Precision) |
|---|---|
لایههای توجه (Attention) | ۵ بیت بر وزن (bpw) |
کارشناسهای مشترک (Shared Experts) | ۵ بیت بر وزن (bpw) |
لایههای متراکم MLP | ۴ بیت بر وزن (bpw) |
کارشناسهای مسیریابیشده (Routed Experts) | ۳ بیت بر وزن (bpw) |
سر مدل زبانی (Language-model head) | - |
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

یارکشی اوپنایآی و آنتروپیک از دولت ترامپ: بازی قدرت غولهای هوش مصنوعی در واشنگتن!
غولهای هوش مصنوعی اوپنایآی و آنتروپیک در تلاشی همهجانبه برای تقویت نفوذ خود در واشنگتن و مهار فشارهای قانونی، به سراغ جذب و استخدام مقامات ارشد سابق دولت دونالد ترامپ رفتهاند. با توجه به اینکه فناوریهای پیشرفته اکنون به عنوان یکی از محورهای حیاتی امنیت ملی آمریکا تلقی میشوند، این آزمایشگاهها بستههای پیشنهادی وسوسهانگیزی برای جلب چهرههای سیاسی کاخ سفید ارائه میدهند.

چرا امنیت دیجیتال به جای یک گیت ورودی ساده، به «ضربان قلب مداوم» نیاز دارد؟
روشهای قدیمی احراز هویت که تنها در لحظه ورود اطلاعات شما را بررسی میکنند، دیگر توان مقابله با کلاهبرداران سایبری و باتهای خودکار را ندارند. وقت آن رسیده که سیستمهای امنیتی به جای یک گیت بازرسی ساده، هویت کاربر را مانند یک «ضربان قلب زنده» و از طریق الگوهای رفتاری در تمام طول نشست زیر نظر بگیرند.

تصویرگر برنده جایزه بریتانیا: «هنر هوش مصنوعی بیروح است؛ غولهای فناوری هنوز این جنگ را نبردهاند!»
راب بیدالف، تصویرگر سرشناس بریتانیایی، معتقد است تصاویر تولیدشده با هوش مصنوعی هرچقدر هم بینقص باشند، بهدلیل نداشتن روح و حس انسانی دلنشین نیستند. او تأکید دارد که نبرد هنرمندان برای حفظ هویت، ارزش ذاتی خلاقیت و معیشت خود در برابر غولهای فناوری تازه آغاز شده و نباید تسلیم شد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.