استقبال کمنظیر از مدل کدنویسی علیبابا: عبور دانلودهای نسخه ۴ بیتی Qwen2.5-Coder از مرز ۷۷۵ هزار بار روی کارتهای گرافیک ۸ گیگابایتی
نسخه فشرده و ۴ بیتی مدل کدنویسی Qwen2.5-Coder علیبابا با استقبال چشمگیر توسعهدهندگان روبهرو شده و از مرز ۷۷۵ هزار دانلود در پلتفرم Hugging Face عبور کرد. این نسخه به لطف بهینهسازی با تکنیک AWQ، حجم مدل را به حدود ۵.۷ گیگابایت رسانده و امکان اجرای روان آن را روی کارتهای گرافیک اقتصادی ۸ گیگابایتی فراهم کرده است.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- نسخه ۴ بیتی مدل کدنویسی Qwen2.5-Coder-7B-Instruct علیبابا با تکنیک AWQ، بیش از ۷۷۵ هزار بار در هاگینگ فیس دانلود شده و حسابی گل کاشته است.
- این نسخه سبکشده فقط به حدود ۵.۷ گیگابایت حافظه VRAM نیاز دارد؛ یعنی حتی روی کارتهای گرافیک اقتصادی ۸ گیگابایتی هم بدون دردسر اجرا میشود.
- تمام قابلیتهای کلیدی مدل اصلی مثل معماری، تنظیمات دستورپذیری و لایسنس تجاری آپاچی ۲.۰ بدون افت کیفیت در این نسخه حفظ شدهاند.
رکوردشکنی نسخه ۴ بیتی مدل کدنویسی Qwen با بیش از ۷۷۵ هزار دانلود
نسخه سبکسازیشده توسط جامعه متنباز (چکپوینت کوانتایز شده AWQ) از مدل قدرتمند Qwen2.5-Coder-7B-Instruct متعلق به شرکت علیبابا، از مرز ۷۷۵ هزار بار دانلود در پلتفرم Hugging Face عبور کرد. این نسخه با فشردهسازی و تبدیل وزنهای مدل به دقت ۴ بیتی، حجم مورد نیاز حافظه برای بارگذاری مدل را به حدود ۵.۷ گیگابایت رسانده و اجرای روان و محلی آن را روی بسیاری از کارتهای گرافیک اقتصادی ۸ گیگابایتی ممکن کرده است.
این چکپوینت تمامی ویژگیهای بنیادین از جمله ساختار معماری، توکنایزر، تنظیمات دقیق دستورپذیری (Instruction Tuning) و مجوز متنباز آپاچی ۲.۰ مربوط به مدل اصلی و پایه را بدون هیچ تغییری حفظ کرده است. دلیل اصلی جذابیت بالای این نسخه به سادگی استقرار و اجرای آن مربوط میشود؛ وزنهای مدل اصلی با فرمت متداول BF16 برای یک شبکه ۷.۶۱ میلیارد پارامتری به تنهایی حدود ۱۵.۲ گیگابایت فضا اشغال میکنند (بدون احتساب سربار پردازشی زمان اجرا)، در حالی که این نسخه فشرده فضای کافی برای پردازشهای اکتیویشن و کش کلید-مقدار (KV Cache) را حتی روی کارتهای گرافیک کوچکتر خالی میگذارد. البته شایان ذکر است که آمار هاگینگ فیس دانلودهای مکرر و دریافتهای خودکار فایل توسط اسکریپتها را هم شامل میشود و نمیتوان آن را دقیقاً معادل تعداد کاربران منحصربهفرد دانست.
پشت پرده تکنیک کوانتایزیشن AWQ و سازوکار فشردهسازی
روش AWQ که مخفف عبارت Activation-aware Weight Quantization است، با بررسی اکتیویشنهای مرحله کالیبراسیون، کانالهای حساس و کلیدی وزنها را به دقت شناسایی کرده و پیش از کاهش دقت، ضریبهای مقیاسبندی بهینهای را برای آنها در نظر میگیرد. با این شیوه، خطای ناشی از کوانتایزیشن (کاهش دقت) به حداقل میرسد و در عین حال فایل ذخیرهشده مدل بسیار کمحجم باقی میماند. لازم به یادآوری است که برچسب ۴ بیتی صرفاً برای وزنهای ثابت مدل اعمال میشود؛ اکتیویشنها و حافظه کش کلید-مقدار (KV) همچنان در دقت بالاتر نگهداری میشوند، مگر اینکه در موتور استنتاج به شکلی متفاوت پیکربندی شده باشند.
مشخصات فنی | جزئیات |
|---|---|
تعداد پارامترها | ۷.۶۱ میلیارد |
لایههای ترنسفورمر | ۲۸ لایه |
مکانیزم توجه (Attention) | ۲۸ هد پرسوجو (Query) و ۴ هد مشترک کلید-مقدار (Key-Value) |
معماری مدل | معماری Qwen2 به همراه RoPE، SwiGLU، RMSNorm و Grouped-Query Attention |
روش کوانتایزیشن | دقت ۴ بیتی به روش AWQ |
حجم دانلود وزنها | حدود ۵.۳ گیگابایت در قالب ۴ فایل |
حافظه VRAM اعلامشده | حدود ۵.۷ گیگابایت (پیش از سربار وابسته به بار پردازش) |
طول کانتکست پیشفرض | ۳۲٬۷۶۸ توکن |
طول کانتکست گسترشیافته | تا ۱۳۱٬۰۷۲ توکن با بهرهگیری از پیکربندی YaRN مدل مادر |
مجوز استفاده (لایسنس) | مجوز آپاچی ۲.۰ (Apache 2.0) با امکان بهرهبرداری تجاری مطابق شروط |
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

یک ماه هر روز به خودم ایمیل زدم و جمینای جواب داد؛ نتیجه جالب این آزمایش با هوش مصنوعی گوگل
چه اتفاقی میافتد اگر به مدت یک ماه هر روز افکار، یادداشتها و دغدغههای ذهنیتان را برای خودتان ایمیل کنید و بگذارید هوش مصنوعی جمینای به آنها جواب دهد؟ این آزمایش تجربی نشان میدهد که دستیار هوش مصنوعی گوگل فراتر از پاسخهای اداری و کلیشهای، چطور میتواند ابزاری غافلگیرکننده برای مرتب کردن شلوغیهای ذهن و پیدا کردن زوایای پنهان کارهای روزمره باشد.

دستهگلهای جنجالی هوش مصنوعی آنتروپیک؛ کاخ سفید گزارش تخلفات را اجباری کرد!
پس از دستهگلهای اخیر مدلهای هوش مصنوعی آنتروپیک و نفوذ ناخواسته آنها به سامانههای دولتی، کاخ سفید رویکرد ملایم قبلی را کنار گذاشت. حالا دولت آمریکا با ابلاغ دستورالعملی تازه، تمامی توسعهدهندگان هوش مصنوعی را موظف کرده که هرگونه حادثه و خطای امنیتی مدلهای خود را فوراً گزارش داده و خسارات ناشی از آن را جبران کنند.

شاهکار ارتش ۲۰۰۰ ایجنتی پرایم اینتلکت؛ بازنویسی پرایم ایجنت با زبان راست و سرعت ۱۳ برابری!
استارتاپ پرایم اینتلکت در اقدامی شگفتانگیز، با هماهنگی بیش از ۲۰۰۰ ایجنت هوش مصنوعی موفق شد فریمورک پرایم ایجنت را ظرف دو هفته از تایپاسکریپت به زبان راست بازنویسی کند. نتیجه این مهاجرت عظیم، کاهش ۸۳ درصدی مصرف حافظه و جهش چشمگیر ۱۳ برابری در سرعت اجرای این ابزار متنباز است.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.