فشردهسازی شگفتانگیز مدل Qwen3.8-27B توسط بایتشیپ؛ اجرای مدل ۲۷ میلیاردی با ۸.۸ گیگابایت رم و سرعت ۱۷۶ توکن بر ثانیه!
استارتاپ بایتشیپ (ByteShape) با معرفی روش نوآورانه ShapeLearn موفق شد مدل قدرتمند بینایی-زبانی Qwen3.8-27B را تا حجم باورنکردنی ۸.۸ گیگابایت فشرده کند. این نسخههای جدید در فرمت پرکاربرد GGUF عرضه شدهاند و امکان اجرای این مدل غولپیکر را حتی روی کارتهای گرافیک ۱۶ گیگابایتی خانگی با سرعت فوقالعاده ۱۷۶ توکن بر ثانیه فراهم میکنند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- تیم بایتشیپ مدل بینایی-زبانی Qwen3.8-27B رو با سیستم اختصاصی ShapeLearn کوانتایز کرده و ۵ نسخه کمحجم GGUF بین ۸.۸ تا ۱۳.۱ گیگابایت منتشر کرده.
- این مدل ۲۷ میلیاردی که در حالت عادی به ۵۴ گیگابایت رم نیاز داشت، حالا بهراحتی روی کارتهای گرافیک ۱۶ گیگابایتی خانگی جا میشه و اجرا میشه.
- در بنچمارکهای انجامشده روی کارت گرافیک RTX 5090 با تکنیک دیکودینگ حدسی، سرعت پردازش در کوچکترین نسخه به رقم فوقالعاده ۱۷۶ توکن بر ثانیه رسیده!
فشردهسازی مدل Qwen3.8-27B به زیر ۱۴ گیگابایت توسط بایتشیپ
تیم بایتشیپ (ByteShape) بهتازگی از پنج نسخه کوانتایزشده GGUF برای مدل پیشرفته بینایی-زبانی Qwen3.8-27B رونمایی کرده است. این فایلها که حجمی بین ۸.۸ تا ۱۳.۱ گیگابایت دارند، از سیستم اختصاصی کوانتایزیشن ShapeLearn بهره میبرند؛ سیستمی هوشمند که وزنهای حساس مدل را شناسایی کرده و مانع از افت کیفیت آنها در بیتهای پایین میشود. نکته هیجانانگیز ماجرا اینجاست که در تستهای انجامشده روی کارت گرافیک قدرتمند RTX 5090، سرعت پردازش متن با تکنیک دیکودینگ حدسی (Speculative Decoding) در کوچکترین نسخه به رقم خیرهکننده ۱۷۶ توکن بر ثانیه رسیده است!
یک مدل ۲۷ میلیارد پارامتری در فرمت استاندارد BF16، پیش از در نظر گرفتن حافظه لازم برای اجرا، بهتنهایی حدود ۵۴ گیگابایت فضا برای ذخیره وزنها اشغال میکند. اینجاست که پای کوانتایزیشن (Quantization) به میان میآید تا با ذخیره وزنها در بیتهای کمتر، مصرف حافظه را به شدت کاهش دهد. سیستم ShapeLearn نوع داده و متد کوانتایزیشن را به شکل مجزا برای هر تنسور تعیین میکند و به بخشهایی از مدل که حساسترند، دقت و بیت بیشتری اختصاص میدهد. در نهایت، تمام این وزنهای بهینهسازیشده در قالب فایلهای استاندارد GGUF بستهبندی میشوند تا بتوان آنها را بهسادگی در محیطهای محلی سازگار با llama.cpp اجرا کرد.
پنج نسخه سبک با حجمی کمتر از ۱۴ گیگابایت
این پنج بیلد اختصاصی برای پردازندههای گرافیکی (GPU)، بین ۲.۵۶ تا ۳.۸۴ بیت میانگین به ازای هر وزن (bpw) مصرف میکنند. طبیعتاً هرچه این عدد کمتر باشد، حجم فایل و حافظه موردنیاز کمتر میشود؛ هرچند ممکن است این کاهش حجم با افت جزئی کیفیت خروجی مدل همراه باشد.
چکپوینت | بیت به ازای هر وزن | حجم فایل |
|---|---|---|
GPU-1 | 2.56 bpw | 8.8 گیگابایت |
GPU-2 | 2.88 bpw | 9.9 گیگابایت |
GPU-3 | 3.01 bpw | 10.4 گیگابایت |
GPU-4 | 3.23 bpw | 11.0 گیگابایت |
GPU-5 | 3.84 bpw | 13.1 گیگابایت |
یک کارت گرافیک با ۱۶ گیگابایت حافظه VRAM برای قرار دادن هر کدام از این فایلها کاملاً کافی است؛ البته باید در نظر داشت که مصرف کل حافظه گرافیکی شامل کش KV، بافرهای اجرایی، بخش پردازش تصویر (Vision Projector) و مدل پیشنویس دیکودینگ حدسی هم میشود. در نتیجه، فاکتورهایی مثل طول پنجره کانتکست (Context Length)، فرمت کش و نحوه تقسیم بار روی GPU مشخص میکنند که آیا کل مدل بدون مشکل درون حافظه جا میشود یا خیر.
تگهایی مانند IQ4_XS و IQ2_XXS در نام فایلها صرفاً برای دستهبندی و سازگاری بهتر در هاگینگ فیس (Hugging Face) قرار گرفتهاند؛ چرا که فایلهای زیرساختی حاوی ترکیب هیبریدی روشهای فشردهسازی ShapeLearn هستند و یک تگ تکی بهتنهایی بیانگر فرمت تمام تنسورهای مدل نخواهد بود.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

چطور هوش مصنوعی آیفون را خاموش یا محدود کنیم؟ راهنمای مهار اپل اینتلیجنس
اگر از دخالتها و خلاصهسازیهای مداوم هوش مصنوعی در آیفون کلافه شدهاید، جای نگرانی نیست؛ هنوز هم کنترل گوشی کاملاً در دستان شماست. در این راهنمای کاربردی، گامبهگام یاد میگیرید که چطور بخشهای مختلف اپل اینتلیجنس مثل سیری هوشمند، خلاصهسازی پیامها و ابزارهای ساخت تصویر را متوقف یا محدود کنید.

ترامپ از «نیروی ابرهوش مصنوعی» پرده برداشت؛ مأموریت ویژه کاخ سفید برای حفظ برتری آمریکا
دونالد ترامپ با رونمایی از کارگروه جدید «نیروی ابرهوش مصنوعی»، گام تازهای برای تثبیت برتری فناورانه آمریکا برداشت. این تیم ویژه به رهبری مدیر اطلاعات ملی وظیفه دارد فرصتها و خطرات هوش مصنوعی را ارزیابی کند و مانع پیشی گرفتن رقبایی مانند چین شود.

درسهای غافلگیرکننده از ساخت ایجنت هوش مصنوعی برای ServiceNow: چالشها فراتر از نقشهراه بودند!
ساخت یک دستیار هوش مصنوعی واقعی برای سیستمهای سازمانی پیچیدهای مثل ServiceNow چقدر عملی است؟ در این تجربه عملی، متخصصان نشان میدهند چگونه با طراحی یک ایجنت هوشمند مجهز به پروتکل MCP، توانستهاند زمان و هزینههای ساخت آیتمهای کاتالوگ IT را تا ۸۰ درصد کاهش دهند و پایش ریشهای تیکتها و مجوزها را متحول کنند.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.