پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

فشرده‌سازی شگفت‌انگیز غول ۷۵۳ میلیارد پارامتری GLM-5.3: کاهش حجم به ۲۷۳ گیگابایت برای اجرا روی ورک‌استیشن‌ها!

انتشار:۱۷ مهر ۱۴۰۵(۱ ساعت پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

اینفاتوشی با انتشار نسخه فشرده‌شده EXL3 از مدل ۷۵۳ میلیارد پارامتری GLM-5.3، حجم این غول هوش مصنوعی را به ۲۷۳ گیگابایت رسانده است. این تکنیک کوانتایزیشن با میانگین ۳.۰۴ بیت به ازای هر وزن، اجرای این مدل عظیم را روی ورک‌استیشن‌های مجهز به چند کارت گرافیک ممکن می‌کند.

فشرده‌سازی شگفت‌انگیز غول ۷۵۳ میلیارد پارامتری GLM-5.3: کاهش حجم به ۲۷۳ گیگابایت برای اجرا روی ورک‌استیشن‌ها!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • اینفاتوشی نسخه کوانتایزشده EXL3 مدل ۷۵۳ میلیارد پارامتری GLM-5.3-UNCENSORED را با میانگین ۳.۰۴ بیت به ازای هر وزن عرضه کرده که حجم آن را به ۲۷۳ گیگابایت رسانده است.
  • با این فشرده‌سازی سنگین، امکان اجرای این مدل غول‌پیکر با معماری MoE روی ورک‌استیشن‌های حرفه‌ای چندگرافیکه فراهم شده؛ هرچند هنوز برای یک کارت گرافیک معمولی بسیار بزرگ است.
  • در این بهینه‌سازی از تکنیک دقت ترکیبی (Mixed-Precision) استفاده شده تا بخش‌های حساسی مثل لایه‌های Attention با دقت بالاتری (۵ بیتی) حفظ شوند و افت کیفیت رخ ندهد.

کاهش وزن‌های مدل ۷۵۳ میلیاردی GLM-5.3 به ۲۷۳ گیگابایت

توسعه‌دهنده‌ای با نام اینفاتوشی (Infatoshi) به‌تازگی یک نسخه مبتنی بر EXL3 از مدل GLM-5.3 منتشر کرده که به طور میانگین ۳.۰۴ بیت به ازای هر وزن (bpw) فضا می‌گیرد و کل حجم آن فقط ۲۷۳ گیگابایت (GiB) است. این فشرده‌سازی چشمگیر باعث می‌شود اجرای این مدل ۷۵۳ میلیارد پارامتری مبتنی بر معماری ترکیب کارشناسان (MoE)، روی ورک‌استیشن‌های رده‌بالا با چند کارت گرافیک کاملاً عملی و شدنی باشد؛ هرچند اجرای آن هنوز فرسنگ‌ها فراتر از توان یک کارت گرافیک معمولی مصرف‌کننده است.

این خروجی در واقع حاصل کوانتایز کردن نسخه GLM-5.3-UNCENSORED-FP8 از تیم dealignai است؛ نسخه‌ای که خودش بر پایه مدل اصلی GLM-5.3 از مجموعه zai-org دستکاری وزنی شده و بدون محدودیت‌های مرسوم عمل می‌کند. بنابراین توسعه‌دهندگانی که قصد تست و ارزیابی آن را دارند باید هر دو تغییر را در نظر بگیرند: مدل پایه رفتار ریجکت پاسخ‌ها (refusal) را تغییر داده و تبدیل به EXL3 هم دقت محاسبات عددی را برای کاهش حجم پایین آورده است.

فشرده‌سازی هوشمند با دقت ترکیبی (Mixed-Precision)

مورد
جزئیات
معماری
GlmMoeDsaForCausalLM
تعداد کل پارامترها
۷۵۳ میلیارد
کارشناس‌های مسیریابی‌شده (Routed Experts)
۲۵۶ کارشناس (۸ کارشناس فعال به ازای هر توکن)
کارشناس‌های اشتراکی (Shared Experts)
۱
لایه‌ها
۷۸ لایه ترنسفورمر و ۱ لایه MTP
سازوکار توجه (Attention)
روش MLA همراه با نمایه‌ساز تنک DSA
کوانتایزیشن
فرمت EXL3 با میانگین ۳.۰۴ بیت به ازای هر وزن
حجم نهایی مدل
۲۷۳ گیگابایت (GiB)

مدل‌های مبتنی بر معماری «ترکیب کارشناسان» (Mixture-of-Experts یا MoE)، تعداد زیادی شبکه پیش‌خور تخصصی را در حافظه نگه می‌دارند اما برای پردازش هر توکن تنها بخش کوچکی از آن‌ها را فعال می‌کنند. مدل GLM-5.3 به ازای هر توکن، ۸ کارشناس از بین ۲۵۶ کارشناس مسیریابی‌شده را به همراه یک کارشناس مشترک فعال می‌کند؛ این رویکرد بار محاسباتی فعال را به شدت کاهش می‌دهد، هرچند برای اجرای بدون دردسر، تمام کارشناس‌ها باید کماکان در حافظه رم گرافیک حاضر باشند.

ابزار کوانتایزر در این پروژه هوشمندی به خرج داده و به بخش‌هایی که نسبت به فشرده‌سازی حساس‌ترند بیت‌های بیشتری اختصاص داده است، در حالی که کارشناس‌های مسیریابی‌شده (که بخش اعظم حجم غول‌پیکر مدل را تشکیل می‌دهند) با بیت‌های کمتری فشرده شده‌اند تا حجم کلی به شدت افت کند.

بخش مدل
سطح دقت (Precision)
لایه‌های توجه (Attention)
۵ بیت بر وزن (bpw)
کارشناس‌های مشترک (Shared Experts)
۵ بیت بر وزن (bpw)
لایه‌های متراکم MLP
۴ بیت بر وزن (bpw)
کارشناس‌های مسیریابی‌شده (Routed Experts)
۳ بیت بر وزن (bpw)
سر مدل زبانی (Language-model head)
-

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

یارکشی اوپن‌ای‌آی و آنتروپیک از دولت ترامپ: بازی قدرت غول‌های هوش مصنوعی در واشنگتن!
آخرین اخبار

یارکشی اوپن‌ای‌آی و آنتروپیک از دولت ترامپ: بازی قدرت غول‌های هوش مصنوعی در واشنگتن!

غول‌های هوش مصنوعی اوپن‌ای‌آی و آنتروپیک در تلاشی همه‌جانبه برای تقویت نفوذ خود در واشنگتن و مهار فشارهای قانونی، به سراغ جذب و استخدام مقامات ارشد سابق دولت دونالد ترامپ رفته‌اند. با توجه به اینکه فناوری‌های پیشرفته اکنون به عنوان یکی از محورهای حیاتی امنیت ملی آمریکا تلقی می‌شوند، این آزمایشگاه‌ها بسته‌های پیشنهادی وسوسه‌انگیزی برای جلب چهره‌های سیاسی کاخ سفید ارائه می‌دهند.

۶ دقیقه مطالعه
۰
۱۷ مهر
چرا امنیت دیجیتال به جای یک گیت ورودی ساده، به «ضربان قلب مداوم» نیاز دارد؟
آخرین اخبار

چرا امنیت دیجیتال به جای یک گیت ورودی ساده، به «ضربان قلب مداوم» نیاز دارد؟

روش‌های قدیمی احراز هویت که تنها در لحظه ورود اطلاعات شما را بررسی می‌کنند، دیگر توان مقابله با کلاهبرداران سایبری و بات‌های خودکار را ندارند. وقت آن رسیده که سیستم‌های امنیتی به جای یک گیت بازرسی ساده، هویت کاربر را مانند یک «ضربان قلب زنده» و از طریق الگوهای رفتاری در تمام طول نشست زیر نظر بگیرند.

۵ دقیقه مطالعه
۰
۱۷ مهر
تصویرگر برنده جایزه بریتانیا: «هنر هوش مصنوعی بی‌روح است؛ غول‌های فناوری هنوز این جنگ را نبرده‌اند!»
آخرین اخبار

تصویرگر برنده جایزه بریتانیا: «هنر هوش مصنوعی بی‌روح است؛ غول‌های فناوری هنوز این جنگ را نبرده‌اند!»

راب بیدالف، تصویرگر سرشناس بریتانیایی، معتقد است تصاویر تولیدشده با هوش مصنوعی هرچقدر هم بی‌نقص باشند، به‌دلیل نداشتن روح و حس انسانی دلنشین نیستند. او تأکید دارد که نبرد هنرمندان برای حفظ هویت، ارزش ذاتی خلاقیت و معیشت خود در برابر غول‌های فناوری تازه آغاز شده و نباید تسلیم شد.

۶ دقیقه مطالعه
۰
۱۷ مهر