مدل ۷۰ میلیاردی Llama 3.3 متا حالا روی یک کارت گرافیک ۴۸ گیگابایتی جا میشود!
یک نسخه بهینهسازیشده از مدل قدرتمند Llama 3.3 70B متا منتشر شده که به لطف کوانتیزاسیون ۴ بیتی AWQ، روی یک کارت گرافیک ۴۸ گیگابایتی جا میشود. این نسخه جدید حجم وزنهای مدل را از ۱۴۰ گیگابایت به زیر ۴۰ گیگابایت رسانده و اجرای محلی یکی از قویترین مدلهای زبانی متنباز دنیا را برای توسعهدهندگان بسیار سادهتر و کمهزینهتر کرده است.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- با فشردهسازی و کوانتیزاسیون ۴ بیتی AWQ، حالا توسعهدهندگان میتوانند مدل قدرتمند و ۷۰ میلیاردی Llama 3.3 Instruct متا را روی یک پردازنده گرافیکی ۴۸ گیگابایتی (مثل RTX A6000) اجرا کنند.
- حجم وزنهای مدل از ۱۴۰ گیگابایت در حالت استاندارد (BF16) به حدود ۳۵ تا ۴۰ گیگابایت کاهش پیدا کرده و بدون نیاز به تبدیل دستی، مستقیماً با فریمورکهای محبوبی مثل vLLM و SGLang کار میکند.
- با اینکه وزنهای مدل کوچکتر شدهاند، اما حافظه مورد نیاز برای کانتکستهای طولانی (۱۲۸ هزار توکن) همچنان سنگین است و برای مکالمات خیلی طولانی به چند کارت گرافیک نیاز خواهید داشت.
یک نسخه کوانتیزهشده از مدل Llama 3.3 70B Instruct متا که توسط جامعه متنباز توسعه پیدا کرده، بالاخره اجرای این هوش مصنوعی غولپیکر را روی سختافزارهایی با ۴۸ گیگابایت حافظه گرافیکی (VRAM) ممکن کرده است. این چکپوینت AWQ بیشتر وزنهای مدل را به ۴ بیت فشرده میکند و بهطور کامل با فریمورکهای vLLM و SGLang و نسخههای جدید Transformers هماهنگ است.
مخزن این پروژه در پلتفرم هاگینگ فیس طی ماههای اخیر صدها هزار بار دانلود شده است. هرچند این آمار دانلود شامل درخواستهای خودکار و دانلودهای مکرر هم میشود و لزوماً به معنای پیادهسازی همزمان در محیط پروداکشن نیست، اما پیام واضحی برای توسعهدهندگان دارد: این مدل حالا از پشتیبانی گستردهای در ابزارهای مختلف برخوردار است و بدون نیاز به تبدیل دستی، میتوان آن را روی استکهای آماده و مرسوم اجرا کرد.
کوانتیزاسیون ۴ بیتی چطور ۱۴۰ گیگابایت وزن مدل را جمعوجور میکند؟
روش کوانتیزاسیون هوشمند وزنها بر اساس اکتیویشن (Activation-aware Weight Quantization یا به اختصار AWQ)، مدل را روی نمونههای ورودی کالیبره میکند تا کانالهایی از وزنها را که خطای آنها بیشترین تأثیر را روی خروجی مدل میگذارد، شناسایی کند. این روش قبل از اعمال کوانتیزاسیون گروهی ۴ بیتی، این کانالهای حساس را مقیاسبندی میکند تا بدون افت دقت، تانسورهای وزن را حسابی فشرده نگه دارد. در این میان، بخش اکتیویشنها و کش کلید-مقدار (KV Cache) همچنان در فرمت ۱۶ بیتی FP16 یا BF16 باقی میمانند.
این چکپوینت با استفاده از پروژه AutoAWQ ساخته شده است. فایلهای safetensors این مدل حاوی متادیتای کوانتیزاسیون هستند که موتورهای سازگار از آن برای انتخاب کرنلهای بهینه AWQ استفاده میکنند؛ هرچند در دسترس بودن این کرنلها و بازدهی نهایی آنها همچنان به مدل کارت گرافیک، نسخه CUDA و فریمورک اجرایی شما بستگی دارد.
منبع پردازشی | حجم تقریبی | تأثیر در اجرا و پیادهسازی |
|---|---|---|
وزنهای اصلی BF16 | ۱۴۰ گیگابایت | با احتساب سربار اجرایی، به چندین کارت گرافیک بزرگ نیاز دارد |
چکپوینت کوانتیزهشده AWQ | ۳۵ تا ۴۰ گیگابایت | روی یک پردازنده گرافیکی ۴۸ گیگابایتی (با کش و درخواستهای همزمان محدود) جا میشود |
کش ۱۶ بیتی KV | حدود ۳۲۰ کیلوبایت به ازای هر توکن و رشته | در کانتکست ۸ هزار توکن حدود ۲.۵ گیگابایت و در ۱۲۸ هزار توکن نزدیک به ۴۰ گیگابایت حافظه مصرف میکند |
تکنیک AWQ فضای ذخیرهسازی وزنها و پهنای باند حافظه را به شکل چشمگیری کاهش میدهد. با این حال، فضای کاری اجرا، اکتیویشنها و کش KV همچنان بخشی از حافظه VRAM را به خود اختصاص میدهند؛ موضوعی که استفاده از سقف کانتکست ۱۲۸ هزار توکنی متا را بسیار پرهزینه میکند. در عمل، یک کارت گرافیک ۴۸ گیگابایتی مثل RTX A6000 میتواند کانتکستهای کوتاهتر را با تعداد درخواستهای همزمان پایین میزبانی کند، اما برای بهرهمندی از کل ظرفیت کانتکست، معمولاً به کارتهای گرافیک کمکی یا استفاده از کش با دقت پایینتر نیاز خواهید داشت.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

رسوایی جدید آمازون: ردیابی «اورولی» کارگران با هوش مصنوعی برای سرکوب اتحادیهها!
اسناد فاششده نشان میدهد آمازون با استفاده از یک الگوریتم هوش مصنوعی به نام «اطلس»، فعالیتهای کارگران و حتی گفتگوهای آنها در ردیت را رصد میکرده تا مانع تشکیل اتحادیهها شود. این سیستم نظارتی جنجالی که شبیه دنیای رمان ۱۹۸۴ توصیف شده، با انتقادهای تند اتحادیههای کارگری روبهرو شده و ممکن است نقض جدی قوانین حریم خصوصی و هوش مصنوعی باشد.

برایان جانسون، پیشگام جنبش «نمیر»: «هوش مصنوعی هم نابغه است هم خنگ؛ سلامتم را دستش نمیسپارم!»
برایان جانسون، چهره سرشناس جنبش «نمیر» که تمام زندگیاش را صرف توقف پیری کرده، میگوید هوش مصنوعی هنوز خام است و مدام سوتیهای احمقانه میدهد. او با این که در حال ساخت ایجنتهای هوشمند از روی مغز خودش است، تأکید دارد که به این زودیها تصمیمگیری درباره سلامتیاش را به هوش مصنوعی نمیسپارد اما امیدوار است طی ۳۰ سال آینده این فناوری پیری را معکوس کند.

بحران ۱۰ تریلیون دلاری بیتوجهی کارمندان؛ هوش مصنوعی چطور جلسات کاری را به برنامههای جذاب تلویزیونی تبدیل میکند؟
افت شدید انگیزه و مشارکت کارکنان سالانه ۱۰ تریلیون دلار خسارت به اقتصاد جهانی میزند؛ بحرانی که ریشه در اسلایدهای متنی و جلسات کسلکننده سازمانی دارد. اکنون هوش مصنوعی با دموکراتیزه کردن کیفیت استودیوهای تلویزیونی، به شرکتها امکان میدهد جلسات خود را بدون هزینههای سنگین به برنامههایی جذاب و اثرگذار تبدیل کنند.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.