پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

فشرده‌سازی شگفت‌انگیز مدل Qwen3.8-27B توسط بایت‌شیپ؛ اجرای مدل ۲۷ میلیاردی با ۸.۸ گیگابایت رم و سرعت ۱۷۶ توکن بر ثانیه!

انتشار:۱۲ مهر ۱۴۰۵(۱ ساعت پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

استارتاپ بایت‌شیپ (ByteShape) با معرفی روش نوآورانه ShapeLearn موفق شد مدل قدرتمند بینایی-زبانی Qwen3.8-27B را تا حجم باورنکردنی ۸.۸ گیگابایت فشرده کند. این نسخه‌های جدید در فرمت پرکاربرد GGUF عرضه شده‌اند و امکان اجرای این مدل غول‌پیکر را حتی روی کارت‌های گرافیک ۱۶ گیگابایتی خانگی با سرعت فوق‌العاده ۱۷۶ توکن بر ثانیه فراهم می‌کنند.

فشرده‌سازی شگفت‌انگیز مدل Qwen3.8-27B توسط بایت‌شیپ؛ اجرای مدل ۲۷ میلیاردی با ۸.۸ گیگابایت رم و سرعت ۱۷۶ توکن بر ثانیه!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • تیم بایت‌شیپ مدل بینایی-زبانی Qwen3.8-27B رو با سیستم اختصاصی ShapeLearn کوانتایز کرده و ۵ نسخه کم‌حجم GGUF بین ۸.۸ تا ۱۳.۱ گیگابایت منتشر کرده.
  • این مدل ۲۷ میلیاردی که در حالت عادی به ۵۴ گیگابایت رم نیاز داشت، حالا به‌راحتی روی کارت‌های گرافیک ۱۶ گیگابایتی خانگی جا می‌شه و اجرا می‌شه.
  • در بنچمارک‌های انجام‌شده روی کارت گرافیک RTX 5090 با تکنیک دیکودینگ حدسی، سرعت پردازش در کوچک‌ترین نسخه به رقم فوق‌العاده ۱۷۶ توکن بر ثانیه رسیده!

فشرده‌سازی مدل Qwen3.8-27B به زیر ۱۴ گیگابایت توسط بایت‌شیپ

تیم بایت‌شیپ (ByteShape) به‌تازگی از پنج نسخه کوانتایزشده GGUF برای مدل پیشرفته بینایی-زبانی Qwen3.8-27B رونمایی کرده است. این فایل‌ها که حجمی بین ۸.۸ تا ۱۳.۱ گیگابایت دارند، از سیستم اختصاصی کوانتایزیشن ShapeLearn بهره می‌برند؛ سیستمی هوشمند که وزن‌های حساس مدل را شناسایی کرده و مانع از افت کیفیت آن‌ها در بیت‌های پایین می‌شود. نکته هیجان‌انگیز ماجرا اینجاست که در تست‌های انجام‌شده روی کارت گرافیک قدرتمند RTX 5090، سرعت پردازش متن با تکنیک دیکودینگ حدسی (Speculative Decoding) در کوچک‌ترین نسخه به رقم خیره‌کننده ۱۷۶ توکن بر ثانیه رسیده است!

یک مدل ۲۷ میلیارد پارامتری در فرمت استاندارد BF16، پیش از در نظر گرفتن حافظه لازم برای اجرا، به‌تنهایی حدود ۵۴ گیگابایت فضا برای ذخیره وزن‌ها اشغال می‌کند. اینجاست که پای کوانتایزیشن (Quantization) به میان می‌آید تا با ذخیره وزن‌ها در بیت‌های کمتر، مصرف حافظه را به شدت کاهش دهد. سیستم ShapeLearn نوع داده و متد کوانتایزیشن را به شکل مجزا برای هر تنسور تعیین می‌کند و به بخش‌هایی از مدل که حساس‌ترند، دقت و بیت بیشتری اختصاص می‌دهد. در نهایت، تمام این وزن‌های بهینه‌سازی‌شده در قالب فایل‌های استاندارد GGUF بسته‌بندی می‌شوند تا بتوان آن‌ها را به‌سادگی در محیط‌های محلی سازگار با llama.cpp اجرا کرد.

پنج نسخه سبک با حجمی کم‌تر از ۱۴ گیگابایت

این پنج بیلد اختصاصی برای پردازنده‌های گرافیکی (GPU)، بین ۲.۵۶ تا ۳.۸۴ بیت میانگین به ازای هر وزن (bpw) مصرف می‌کنند. طبیعتاً هرچه این عدد کم‌تر باشد، حجم فایل و حافظه موردنیاز کم‌تر می‌شود؛ هرچند ممکن است این کاهش حجم با افت جزئی کیفیت خروجی مدل همراه باشد.

چک‌پوینت
بیت به ازای هر وزن
حجم فایل
GPU-1
2.56 bpw
8.8 گیگابایت
GPU-2
2.88 bpw
9.9 گیگابایت
GPU-3
3.01 bpw
10.4 گیگابایت
GPU-4
3.23 bpw
11.0 گیگابایت
GPU-5
3.84 bpw
13.1 گیگابایت

یک کارت گرافیک با ۱۶ گیگابایت حافظه VRAM برای قرار دادن هر کدام از این فایل‌ها کاملاً کافی است؛ البته باید در نظر داشت که مصرف کل حافظه گرافیکی شامل کش KV، بافرهای اجرایی، بخش پردازش تصویر (Vision Projector) و مدل پیش‌نویس دیکودینگ حدسی هم می‌شود. در نتیجه، فاکتورهایی مثل طول پنجره کانتکست (Context Length)، فرمت کش و نحوه تقسیم بار روی GPU مشخص می‌کنند که آیا کل مدل بدون مشکل درون حافظه جا می‌شود یا خیر.

تگ‌هایی مانند IQ4_XS و IQ2_XXS در نام فایل‌ها صرفاً برای دسته‌بندی و سازگاری بهتر در هاگینگ فیس (Hugging Face) قرار گرفته‌اند؛ چرا که فایل‌های زیرساختی حاوی ترکیب هیبریدی روش‌های فشرده‌سازی ShapeLearn هستند و یک تگ تکی به‌تنهایی بیانگر فرمت تمام تنسورهای مدل نخواهد بود.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

چطور هوش مصنوعی آیفون را خاموش یا محدود کنیم؟ راهنمای مهار اپل اینتلیجنس
آخرین اخبار

چطور هوش مصنوعی آیفون را خاموش یا محدود کنیم؟ راهنمای مهار اپل اینتلیجنس

اگر از دخالت‌ها و خلاصه‌سازی‌های مداوم هوش مصنوعی در آیفون کلافه شده‌اید، جای نگرانی نیست؛ هنوز هم کنترل گوشی کاملاً در دستان شماست. در این راهنمای کاربردی، گام‌به‌گام یاد می‌گیرید که چطور بخش‌های مختلف اپل اینتلیجنس مثل سیری هوشمند، خلاصه‌سازی پیام‌ها و ابزار‌های ساخت تصویر را متوقف یا محدود کنید.

۴ دقیقه مطالعه
۰
۱۲ مهر
ترامپ از «نیروی ابرهوش مصنوعی» پرده برداشت؛ مأموریت ویژه کاخ سفید برای حفظ برتری آمریکا
آخرین اخبار

ترامپ از «نیروی ابرهوش مصنوعی» پرده برداشت؛ مأموریت ویژه کاخ سفید برای حفظ برتری آمریکا

دونالد ترامپ با رونمایی از کارگروه جدید «نیروی ابرهوش مصنوعی»، گام تازه‌ای برای تثبیت برتری فناورانه آمریکا برداشت. این تیم ویژه به رهبری مدیر اطلاعات ملی وظیفه دارد فرصت‌ها و خطرات هوش مصنوعی را ارزیابی کند و مانع پیشی گرفتن رقبایی مانند چین شود.

۲ دقیقه مطالعه
۰
۱۲ مهر
درس‌های غافلگیرکننده از ساخت ایجنت هوش مصنوعی برای ServiceNow: چالش‌ها فراتر از نقشه‌راه بودند!
آخرین اخبار

درس‌های غافلگیرکننده از ساخت ایجنت هوش مصنوعی برای ServiceNow: چالش‌ها فراتر از نقشه‌راه بودند!

ساخت یک دستیار هوش مصنوعی واقعی برای سیستم‌های سازمانی پیچیده‌ای مثل ServiceNow چقدر عملی است؟ در این تجربه عملی، متخصصان نشان می‌دهند چگونه با طراحی یک ایجنت هوشمند مجهز به پروتکل MCP، توانسته‌اند زمان و هزینه‌های ساخت آیتم‌های کاتالوگ IT را تا ۸۰ درصد کاهش دهند و پایش ریشه‌ای تیکت‌ها و مجوزها را متحول کنند.

۱۰ دقیقه مطالعه
۰
۱۲ مهر