پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

استقبال کم‌نظیر از مدل کدنویسی علی‌بابا: عبور دانلودهای نسخه ۴ بیتی Qwen2.5-Coder از مرز ۷۷۵ هزار بار روی کارت‌های گرافیک ۸ گیگابایتی

انتشار:۱۸ مهر ۱۴۰۵(۲ ساعت پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

نسخه فشرده و ۴ بیتی مدل کدنویسی Qwen2.5-Coder علی‌بابا با استقبال چشمگیر توسعه‌دهندگان روبه‌رو شده و از مرز ۷۷۵ هزار دانلود در پلتفرم Hugging Face عبور کرد. این نسخه به لطف بهینه‌سازی با تکنیک AWQ، حجم مدل را به حدود ۵.۷ گیگابایت رسانده و امکان اجرای روان آن را روی کارت‌های گرافیک اقتصادی ۸ گیگابایتی فراهم کرده است.

استقبال کم‌نظیر از مدل کدنویسی علی‌بابا: عبور دانلودهای نسخه ۴ بیتی Qwen2.5-Coder از مرز ۷۷۵ هزار بار روی کارت‌های گرافیک ۸ گیگابایتی

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • نسخه ۴ بیتی مدل کدنویسی Qwen2.5-Coder-7B-Instruct علی‌بابا با تکنیک AWQ، بیش از ۷۷۵ هزار بار در هاگینگ فیس دانلود شده و حسابی گل کاشته است.
  • این نسخه سبک‌شده فقط به حدود ۵.۷ گیگابایت حافظه VRAM نیاز دارد؛ یعنی حتی روی کارت‌های گرافیک اقتصادی ۸ گیگابایتی هم بدون دردسر اجرا می‌شود.
  • تمام قابلیت‌های کلیدی مدل اصلی مثل معماری، تنظیمات دستورپذیری و لایسنس تجاری آپاچی ۲.۰ بدون افت کیفیت در این نسخه حفظ شده‌اند.

رکوردشکنی نسخه ۴ بیتی مدل کدنویسی Qwen با بیش از ۷۷۵ هزار دانلود

نسخه سبک‌سازی‌شده توسط جامعه متن‌باز (چک‌پوینت کوانتایز شده AWQ) از مدل قدرتمند Qwen2.5-Coder-7B-Instruct متعلق به شرکت علی‌بابا، از مرز ۷۷۵ هزار بار دانلود در پلتفرم Hugging Face عبور کرد. این نسخه با فشرده‌سازی و تبدیل وزن‌های مدل به دقت ۴ بیتی، حجم مورد نیاز حافظه برای بارگذاری مدل را به حدود ۵.۷ گیگابایت رسانده و اجرای روان و محلی آن را روی بسیاری از کارت‌های گرافیک اقتصادی ۸ گیگابایتی ممکن کرده است.

این چک‌پوینت تمامی ویژگی‌های بنیادین از جمله ساختار معماری، توکنایزر، تنظیمات دقیق دستورپذیری (Instruction Tuning) و مجوز متن‌باز آپاچی ۲.۰ مربوط به مدل اصلی و پایه را بدون هیچ تغییری حفظ کرده است. دلیل اصلی جذابیت بالای این نسخه به سادگی استقرار و اجرای آن مربوط می‌شود؛ وزن‌های مدل اصلی با فرمت متداول BF16 برای یک شبکه ۷.۶۱ میلیارد پارامتری به تنهایی حدود ۱۵.۲ گیگابایت فضا اشغال می‌کنند (بدون احتساب سربار پردازشی زمان اجرا)، در حالی که این نسخه فشرده فضای کافی برای پردازش‌های اکتیویشن و کش کلید-مقدار (KV Cache) را حتی روی کارت‌های گرافیک کوچک‌تر خالی می‌گذارد. البته شایان ذکر است که آمار هاگینگ فیس دانلودهای مکرر و دریافت‌های خودکار فایل توسط اسکریپت‌ها را هم شامل می‌شود و نمی‌توان آن را دقیقاً معادل تعداد کاربران منحصربه‌فرد دانست.

پشت پرده تکنیک کوانتایزیشن AWQ و سازوکار فشرده‌سازی

روش AWQ که مخفف عبارت Activation-aware Weight Quantization است، با بررسی اکتیویشن‌های مرحله کالیبراسیون، کانال‌های حساس و کلیدی وزن‌ها را به دقت شناسایی کرده و پیش از کاهش دقت، ضریب‌های مقیاس‌بندی بهینه‌ای را برای آن‌ها در نظر می‌گیرد. با این شیوه، خطای ناشی از کوانتایزیشن (کاهش دقت) به حداقل می‌رسد و در عین حال فایل ذخیره‌شده مدل بسیار کم‌حجم باقی می‌ماند. لازم به یادآوری است که برچسب ۴ بیتی صرفاً برای وزن‌های ثابت مدل اعمال می‌شود؛ اکتیویشن‌ها و حافظه کش کلید-مقدار (KV) همچنان در دقت بالا‌تر نگهداری می‌شوند، مگر اینکه در موتور استنتاج به شکلی متفاوت پیکربندی شده باشند.

مشخصات فنی
جزئیات
تعداد پارامترها
۷.۶۱ میلیارد
لایه‌های ترنسفورمر
۲۸ لایه
مکانیزم توجه (Attention)
۲۸ هد پرس‌وجو (Query) و ۴ هد مشترک کلید-مقدار (Key-Value)
معماری مدل
معماری Qwen2 به همراه RoPE، SwiGLU، RMSNorm و Grouped-Query Attention
روش کوانتایزیشن
دقت ۴ بیتی به روش AWQ
حجم دانلود وزن‌ها
حدود ۵.۳ گیگابایت در قالب ۴ فایل
حافظه VRAM اعلام‌شده
حدود ۵.۷ گیگابایت (پیش از سربار وابسته به بار پردازش)
طول کانتکست پیش‌فرض
۳۲٬۷۶۸ توکن
طول کانتکست گسترش‌یافته
تا ۱۳۱٬۰۷۲ توکن با بهره‌گیری از پیکربندی YaRN مدل مادر
مجوز استفاده (لایسنس)
مجوز آپاچی ۲.۰ (Apache 2.0) با امکان بهره‌برداری تجاری مطابق شروط

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

یک ماه هر روز به خودم ایمیل زدم و جمینای جواب داد؛ نتیجه جالب این آزمایش با هوش مصنوعی گوگل
آخرین اخبار

یک ماه هر روز به خودم ایمیل زدم و جمینای جواب داد؛ نتیجه جالب این آزمایش با هوش مصنوعی گوگل

چه اتفاقی می‌افتد اگر به مدت یک ماه هر روز افکار، یادداشت‌ها و دغدغه‌های ذهنی‌تان را برای خودتان ایمیل کنید و بگذارید هوش مصنوعی جمینای به آن‌ها جواب دهد؟ این آزمایش تجربی نشان می‌دهد که دستیار هوش مصنوعی گوگل فراتر از پاسخ‌های اداری و کلیشه‌ای، چطور می‌تواند ابزاری غافلگیرکننده برای مرتب کردن شلوغی‌های ذهن و پیدا کردن زوایای پنهان کار‌های روزمره باشد.

۷ دقیقه مطالعه
۰
۱۸ مهر
دسته‌گل‌های جنجالی هوش مصنوعی آنتروپیک؛ کاخ سفید گزارش تخلفات را اجباری کرد!
آخرین اخبار

دسته‌گل‌های جنجالی هوش مصنوعی آنتروپیک؛ کاخ سفید گزارش تخلفات را اجباری کرد!

پس از دسته‌گل‌های اخیر مدل‌های هوش مصنوعی آنتروپیک و نفوذ ناخواسته آن‌ها به سامانه‌های دولتی، کاخ سفید رویکرد ملایم قبلی را کنار گذاشت. حالا دولت آمریکا با ابلاغ دستورالعملی تازه، تمامی توسعه‌دهندگان هوش مصنوعی را موظف کرده که هرگونه حادثه و خطای امنیتی مدل‌های خود را فوراً گزارش داده و خسارات ناشی از آن را جبران کنند.

۴ دقیقه مطالعه
۰
۱۸ مهر
شاهکار ارتش ۲۰۰۰ ایجنتی پرایم اینتلکت؛ بازنویسی پرایم ایجنت با زبان راست و سرعت ۱۳ برابری!
آخرین اخبار

شاهکار ارتش ۲۰۰۰ ایجنتی پرایم اینتلکت؛ بازنویسی پرایم ایجنت با زبان راست و سرعت ۱۳ برابری!

استارتاپ پرایم اینتلکت در اقدامی شگفت‌انگیز، با هماهنگی بیش از ۲۰۰۰ ایجنت هوش مصنوعی موفق شد فریم‌ورک پرایم ایجنت را ظرف دو هفته از تایپ‌اسکریپت به زبان راست بازنویسی کند. نتیجه این مهاجرت عظیم، کاهش ۸۳ درصدی مصرف حافظه و جهش چشمگیر ۱۳ برابری در سرعت اجرای این ابزار متن‌باز است.

۵ دقیقه مطالعه
۰
۱۸ مهر