شتاب خیرهکننده مدل زبانی MiniCPM5 با دستیار ۳۲۴ میلیونی DSpark؛ جهش چشمگیر در تولید موازی توکنها
تیم OpenBMB با انتشار مدل کمحجم ۳۲۴ میلیون پارامتری DSpark، جهش بزرگی در سرعت استنتاج مدل زبانی MiniCPM5-2B ایجاد کرده است. این مدل با تکیه بر تکنیک هوشمندانه رمزگشایی گمانهزنانه، توکنها را به صورت دستهای حدس میزند تا فرایند پردازش با کمترین مصرف محاسباتی و بیشترین سرعت ممکن اجرا شود.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- تیم OpenBMB از مدل کوچک و تخصصی DSpark رونمایی کرد؛ مدلی با ۳۲۴ میلیون پارامتر که وظیفهاش شتاببخشی اساسی به مدل زبانی MiniCPM5-2B از طریق رمزگشایی گمانهزنانه است.
- در این راهکار نوین، فریمورک SGLang با کمک مدل کوچکتر دستههای ۷ توکنی را حدس میزند و مدل اصلی ۲.۵ میلیارد پارامتری تنها با یک دور ارزیابی، صحت آنها را به سرعت تأیید میکند.
- مدل جمعوجور MiniCPM5-2B با ۴۲ لایه و پشتیبانی بومی از پنجره زمینه ۱۳۱ هزار توکنی، با میانگین نمره ۵۳.۹ در بنچمارکها حتی مدل بزرگتر Qwen3.5-4B را هم پشت سر گذاشته است.
تیم OpenBMB با مدل پیشنویس ۳۲۴ میلیونی DSpark به سراغ شتاببخشی به MiniCPM5-2B رفت
مجموعه OpenBMB به تازگی از چکپوینت DSpark رونمایی کرده است؛ یک مدل پیشنویس با ۳۲۳.۸ میلیون پارامتر که به طور ویژه برای شتاببخشی به مدل MiniCPM5-2B از طریق تکنیک رمزگشایی گمانهزنانه (Speculative Decoding) آموزش دیده است. در این فرایند، فریمورک محبوب SGLang با کمک این مدل جمعوجور، بلوکهای ۷ توکنی را حدس میزند و پیشنهاد میدهد؛ سپس مدل اصلی با ۲.۵۲ میلیارد پارامتر تنها در یک مرحله، صحت تمام این پیشنهادها را به سرعت بررسی و تأیید میکند.
مدل زبانی MiniCPM5-2B یک مدل متراکم (Dense) برای پیشبینی توکن بعدی با ۴۲ لایه، مکانیزم توجه کوئری گروهبندیشده (GQA) و پنجره زمینه بومی ۱۳۱٬۰۷۲ توکنی است. معماری مبتنی بر LlamaForCausalLM در این مدل به موتورهای استنتاج استاندارد اجازه میدهد تا آن را بدون نیاز به کرنلهای توجه سفارشی و پیچیده، به راحتی بارگذاری و اجرا کنند.
بر اساس بررسی اجمالی بنچمارکهای منتشرشده، این مدل موفق شده در میانگین ۳۴ ارزیابی گوناگون امتیاز ۵۳.۹ را کسب کند که به شکل معناداری از امتیاز ۵۱.۱ مدل Qwen3.5-4B بالاتر است. از جمله نتایج درخشان آن میتوان به امتیاز ۶۹.۱ در بنچمارک LiveCodeBench v6 و امتیاز ۹۷.۱ در آزمون τ2-Bench Telecom اشاره کرد. با این حال، از آنجا که نمرات کلی ترکیبی از وظایف مختلف هستند، تست عملی و ارزیابی در محیط استقرار واقعی همچنان برای سناریوهای کاری مختلف ضروری خواهد بود.
بلوکهای هفتتوکنی در کنار یک اعتبارسنج قدرتمند
تکنیک رمزگشایی گمانهزنانه به یک مدل کوچکتر اجازه میدهد تا با صرف هزینه محاسباتی بسیار ناچیز، چند توکن بعدی را پیشبینی و پیشنهاد کند. سپس مدل اصلی و بزرگتر کل بلوک پیشنهادی را به صورت موازی ارزیابی کرده، توکنهایی که قوانین اعتبارسنجی را برآورده میکنند میپذیرد و از اولین موقعیت ردشده، کار تولید را دوباره پیش میبرد. در این ساختار، مدل هدف همچنان مسئولیت صحت توالی نهایی خروجی را حفظ میکند، در حالی که دقت بالای مدل پیشنویس تعیین میکند که در هر دور اعتبارسنجی چه میزان از بار محاسباتی کاهش یابد.
مدل DSpark مشکل افت نرخ پذیرش توکنها را که در پیشنویسکنندههای موازی بسیار رایج است حل میکند؛ مشکلی که در آن توکنهای انتهایی بلوک معمولاً اطلاعات کافی از توکنهای ابتدایی ندارند. ستون فقرات موازی این مدل پیشنویسهای اولیه را تولید میکند، یک ماژول متوالی سبک وابستگیهای درون بلوک را به آن میافزاید، و در نهایت یک زمانبند اطمینان هوشمند بر اساس بقای تخمینی پیشوندها و مشخصات توان پردازشی موتور ارائهدهنده خدمت، تعیین میکند که چه تعداد از پیشنهادها برای اعتبارسنجی نهایی ارسال شوند.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

هشدار جنجالی مسئول سابق ایمنی OpenAI: با هوش مصنوعی باید مثل نیروگاه هستهای رفتار کرد!
دیوید رابینسون، مدیر سابق بخش گزارشهای ایمنی OpenAI، پس از ترک این شرکت هشدار داد که غولهای فناوری بهجای شتابزدگی برای عرضه مدلهای جدید، باید از نیروگاههای هستهای الگوبرداری کنند. به گفته او، نبود لایههای نظارتی سختگیرانه و فرار ایجنتهای هوش مصنوعی از محیطهای آزمایشی میتواند فاجعهای بهمراتب بزرگتر از حوادث اتمی رقم بزند.

دوپامین مصنوعی و مغزهای هکشده؛ هوش مصنوعی مولد چطور سیمکشی تمرکز ما را به هم میریزد؟
رگبار نوتیفیکیشنها و سیستمهای هوش مصنوعی مولد با تولید مداوم «دوپامین مصنوعی»، ساختار شیمیایی و مدارهای تمرکز مغز انسان را دستخوش تغییر اساسی کردهاند. این سقوط دامنه توجه صرفاً یک مسئله شخصی نیست، بلکه با از بین بردن فرصتهای استراحت مغزی، امنیت شناختی و تفکر عمیق جامعه را در معرض تهدیدی جدی قرار داده است.

پیودیپای: موقع ساخت هوش مصنوعی اختصاصیام، OpenAI دو بار اکانتم را بست!
فلیکس شلبرگ یا همان پیودیپای معروف، بهتازگی مدل هوش مصنوعی محلی خود به نام Ajax را معرفی کرده، اما فاش ساخته که در مسیر توسعه آن، شرکت OpenAI دو بار حسابش را مسدود کرده است. او برای ساخت این مدل ۹ میلیارد پارامتری از تکنیک تقطیر استفاده کرده؛ موضوعی که زنگ خطر نقض قوانین سازنده ChatGPT را به صدا درآورده است.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.