پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

مدل ۷۰ میلیاردی Llama 3.3 متا حالا روی یک کارت گرافیک ۴۸ گیگابایتی جا می‌شود!

انتشار:۱۶ مهر ۱۴۰۵(۱ ساعت پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

یک نسخه بهینه‌سازی‌شده از مدل قدرتمند Llama 3.3 70B متا منتشر شده که به لطف کوانتیزاسیون ۴ بیتی AWQ، روی یک کارت گرافیک ۴۸ گیگابایتی جا می‌شود. این نسخه جدید حجم وزن‌های مدل را از ۱۴۰ گیگابایت به زیر ۴۰ گیگابایت رسانده و اجرای محلی یکی از قوی‌ترین مدل‌های زبانی متن‌باز دنیا را برای توسعه‌دهندگان بسیار ساده‌تر و کم‌هزینه‌تر کرده است.

مدل ۷۰ میلیاردی Llama 3.3 متا حالا روی یک کارت گرافیک ۴۸ گیگابایتی جا می‌شود!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • با فشرده‌سازی و کوانتیزاسیون ۴ بیتی AWQ، حالا توسعه‌دهندگان می‌توانند مدل قدرتمند و ۷۰ میلیاردی Llama 3.3 Instruct متا را روی یک پردازنده گرافیکی ۴۸ گیگابایتی (مثل RTX A6000) اجرا کنند.
  • حجم وزن‌های مدل از ۱۴۰ گیگابایت در حالت استاندارد (BF16) به حدود ۳۵ تا ۴۰ گیگابایت کاهش پیدا کرده و بدون نیاز به تبدیل دستی، مستقیماً با فریم‌ورک‌های محبوبی مثل vLLM و SGLang کار می‌کند.
  • با اینکه وزن‌های مدل کوچک‌تر شده‌اند، اما حافظه مورد نیاز برای کانتکست‌های طولانی (۱۲۸ هزار توکن) همچنان سنگین است و برای مکالمات خیلی طولانی به چند کارت گرافیک نیاز خواهید داشت.

یک نسخه کوانتیزه‌شده از مدل Llama 3.3 70B Instruct متا که توسط جامعه متن‌باز توسعه پیدا کرده، بالاخره اجرای این هوش مصنوعی غول‌پیکر را روی سخت‌افزارهایی با ۴۸ گیگابایت حافظه گرافیکی (VRAM) ممکن کرده است. این چک‌پوینت AWQ بیش‌تر وزن‌های مدل را به ۴ بیت فشرده می‌کند و به‌طور کامل با فریم‌ورک‌های vLLM و SGLang و نسخه‌های جدید Transformers هماهنگ است.

مخزن این پروژه در پلتفرم هاگینگ فیس طی ماه‌های اخیر صدها هزار بار دانلود شده است. هرچند این آمار دانلود شامل درخواست‌های خودکار و دانلودهای مکرر هم می‌شود و لزوماً به معنای پیاده‌سازی هم‌زمان در محیط پروداکشن نیست، اما پیام واضحی برای توسعه‌دهندگان دارد: این مدل حالا از پشتیبانی گسترده‌ای در ابزار‌های مختلف برخوردار است و بدون نیاز به تبدیل دستی، می‌توان آن را روی استک‌های آماده و مرسوم اجرا کرد.

کوانتیزاسیون ۴ بیتی چطور ۱۴۰ گیگابایت وزن مدل را جمع‌وجور می‌کند؟

روش کوانتیزاسیون هوشمند وزن‌ها بر اساس اکتیویشن (Activation-aware Weight Quantization یا به اختصار AWQ)، مدل را روی نمونه‌های ورودی کالیبره می‌کند تا کانال‌هایی از وزن‌ها را که خطای آن‌ها بیش‌ترین تأثیر را روی خروجی مدل می‌گذارد، شناسایی کند. این روش قبل از اعمال کوانتیزاسیون گروهی ۴ بیتی، این کانال‌های حساس را مقیاس‌بندی می‌کند تا بدون افت دقت، تانسورهای وزن را حسابی فشرده نگه دارد. در این میان، بخش اکتیویشن‌ها و کش کلید-مقدار (KV Cache) همچنان در فرمت ۱۶ بیتی FP16 یا BF16 باقی می‌مانند.

این چک‌پوینت با استفاده از پروژه AutoAWQ ساخته شده است. فایل‌های safetensors این مدل حاوی متادیتای کوانتیزاسیون هستند که موتورهای سازگار از آن برای انتخاب کرنل‌های بهینه AWQ استفاده می‌کنند؛ هرچند در دسترس بودن این کرنل‌ها و بازدهی نهایی آن‌ها همچنان به مدل کارت گرافیک، نسخه CUDA و فریم‌ورک اجرایی شما بستگی دارد.

منبع پردازشی
حجم تقریبی
تأثیر در اجرا و پیاده‌سازی
وزن‌های اصلی BF16
۱۴۰ گیگابایت
با احتساب سربار اجرایی، به چندین کارت گرافیک بزرگ نیاز دارد
چک‌پوینت کوانتیزه‌شده AWQ
۳۵ تا ۴۰ گیگابایت
روی یک پردازنده گرافیکی ۴۸ گیگابایتی (با کش و درخواست‌های هم‌زمان محدود) جا می‌شود
کش ۱۶ بیتی KV
حدود ۳۲۰ کیلوبایت به ازای هر توکن و رشته
در کانتکست ۸ هزار توکن حدود ۲.۵ گیگابایت و در ۱۲۸ هزار توکن نزدیک به ۴۰ گیگابایت حافظه مصرف می‌کند

تکنیک AWQ فضای ذخیره‌سازی وزن‌ها و پهنای باند حافظه را به شکل چشمگیری کاهش می‌دهد. با این حال، فضای کاری اجرا، اکتیویشن‌ها و کش KV همچنان بخشی از حافظه VRAM را به خود اختصاص می‌دهند؛ موضوعی که استفاده از سقف کانتکست ۱۲۸ هزار توکنی متا را بسیار پرهزینه می‌کند. در عمل، یک کارت گرافیک ۴۸ گیگابایتی مثل RTX A6000 می‌تواند کانتکست‌های کوتاه‌تر را با تعداد درخواست‌های هم‌زمان پایین میزبانی کند، اما برای بهره‌مندی از کل ظرفیت کانتکست، معمولاً به کارت‌های گرافیک کمکی یا استفاده از کش با دقت پایین‌تر نیاز خواهید داشت.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رسوایی جدید آمازون: ردیابی «اورولی» کارگران با هوش مصنوعی برای سرکوب اتحادیه‌ها!
آخرین اخبار

رسوایی جدید آمازون: ردیابی «اورولی» کارگران با هوش مصنوعی برای سرکوب اتحادیه‌ها!

اسناد فاش‌شده نشان می‌دهد آمازون با استفاده از یک الگوریتم هوش مصنوعی به نام «اطلس»، فعالیت‌های کارگران و حتی گفتگوهای آن‌ها در ردیت را رصد می‌کرده تا مانع تشکیل اتحادیه‌ها شود. این سیستم نظارتی جنجالی که شبیه دنیای رمان ۱۹۸۴ توصیف شده، با انتقادهای تند اتحادیه‌های کارگری روبه‌رو شده و ممکن است نقض جدی قوانین حریم خصوصی و هوش مصنوعی باشد.

۵ دقیقه مطالعه
۰
۱۶ مهر
برایان جانسون، پیشگام جنبش «نمیر»: «هوش مصنوعی هم نابغه است هم خنگ؛ سلامتم را دستش نمی‌سپارم!»
آخرین اخبار

برایان جانسون، پیشگام جنبش «نمیر»: «هوش مصنوعی هم نابغه است هم خنگ؛ سلامتم را دستش نمی‌سپارم!»

برایان جانسون، چهره سرشناس جنبش «نمیر» که تمام زندگی‌اش را صرف توقف پیری کرده، می‌گوید هوش مصنوعی هنوز خام است و مدام سوتی‌های احمقانه می‌دهد. او با این که در حال ساخت ایجنت‌های هوشمند از روی مغز خودش است، تأکید دارد که به این زودی‌ها تصمیم‌گیری درباره سلامتی‌اش را به هوش مصنوعی نمی‌سپارد اما امیدوار است طی ۳۰ سال آینده این فناوری پیری را معکوس کند.

۳ دقیقه مطالعه
۰
۱۶ مهر
بحران ۱۰ تریلیون دلاری بی‌توجهی کارمندان؛ هوش مصنوعی چطور جلسات کاری را به برنامه‌های جذاب تلویزیونی تبدیل می‌کند؟
آخرین اخبار

بحران ۱۰ تریلیون دلاری بی‌توجهی کارمندان؛ هوش مصنوعی چطور جلسات کاری را به برنامه‌های جذاب تلویزیونی تبدیل می‌کند؟

افت شدید انگیزه و مشارکت کارکنان سالانه ۱۰ تریلیون دلار خسارت به اقتصاد جهانی می‌زند؛ بحرانی که ریشه در اسلایدهای متنی و جلسات کسل‌کننده سازمانی دارد. اکنون هوش مصنوعی با دموکراتیزه کردن کیفیت استودیوهای تلویزیونی، به شرکت‌ها امکان می‌دهد جلسات خود را بدون هزینه‌های سنگین به برنامه‌هایی جذاب و اثرگذار تبدیل کنند.

۵ دقیقه مطالعه
۰
۱۶ مهر