پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

شتاب خیره‌کننده مدل زبانی MiniCPM5 با دستیار ۳۲۴ میلیونی DSpark؛ جهش چشمگیر در تولید موازی توکن‌ها

انتشار:۱۱ مهر ۱۴۰۵(۵۸ دقیقه پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

تیم OpenBMB با انتشار مدل کم‌حجم ۳۲۴ میلیون پارامتری DSpark، جهش بزرگی در سرعت استنتاج مدل زبانی MiniCPM5-2B ایجاد کرده است. این مدل با تکیه بر تکنیک هوشمندانه رمزگشایی گمانه‌زنانه، توکن‌ها را به صورت دسته‌ای حدس می‌زند تا فرایند پردازش با کم‌ترین مصرف محاسباتی و بیش‌ترین سرعت ممکن اجرا شود.

شتاب خیره‌کننده مدل زبانی MiniCPM5 با دستیار ۳۲۴ میلیونی DSpark؛ جهش چشمگیر در تولید موازی توکن‌ها

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • تیم OpenBMB از مدل کوچک و تخصصی DSpark رونمایی کرد؛ مدلی با ۳۲۴ میلیون پارامتر که وظیفه‌اش شتاب‌بخشی اساسی به مدل زبانی MiniCPM5-2B از طریق رمزگشایی گمانه‌زنانه است.
  • در این راهکار نوین، فریم‌ورک SGLang با کمک مدل کوچک‌تر دسته‌های ۷ توکنی را حدس می‌زند و مدل اصلی ۲.۵ میلیارد پارامتری تنها با یک دور ارزیابی، صحت آن‌ها را به سرعت تأیید می‌کند.
  • مدل جمع‌وجور MiniCPM5-2B با ۴۲ لایه و پشتیبانی بومی از پنجره زمینه ۱۳۱ هزار توکنی، با میانگین نمره ۵۳.۹ در بنچمارک‌ها حتی مدل بزرگ‌تر Qwen3.5-4B را هم پشت سر گذاشته است.

تیم OpenBMB با مدل پیش‌نویس ۳۲۴ میلیونی DSpark به سراغ شتاب‌بخشی به MiniCPM5-2B رفت

مجموعه OpenBMB به تازگی از چک‌پوینت DSpark رونمایی کرده است؛ یک مدل پیش‌نویس با ۳۲۳.۸ میلیون پارامتر که به طور ویژه برای شتاب‌بخشی به مدل MiniCPM5-2B از طریق تکنیک رمزگشایی گمانه‌زنانه (Speculative Decoding) آموزش دیده است. در این فرایند، فریم‌ورک محبوب SGLang با کمک این مدل جمع‌وجور، بلوک‌های ۷ توکنی را حدس می‌زند و پیشنهاد می‌دهد؛ سپس مدل اصلی با ۲.۵۲ میلیارد پارامتر تنها در یک مرحله، صحت تمام این پیشنهاد‌ها را به سرعت بررسی و تأیید می‌کند.

مدل زبانی MiniCPM5-2B یک مدل متراکم (Dense) برای پیش‌بینی توکن بعدی با ۴۲ لایه، مکانیزم توجه کوئری گروه‌بندی‌شده (GQA) و پنجره زمینه بومی ۱۳۱٬۰۷۲ توکنی است. معماری مبتنی بر LlamaForCausalLM در این مدل به موتورهای استنتاج استاندارد اجازه می‌دهد تا آن را بدون نیاز به کرنل‌های توجه سفارشی و پیچیده، به راحتی بارگذاری و اجرا کنند.

بر اساس بررسی اجمالی بنچمارک‌های منتشرشده، این مدل موفق شده در میانگین ۳۴ ارزیابی گوناگون امتیاز ۵۳.۹ را کسب کند که به شکل معناداری از امتیاز ۵۱.۱ مدل Qwen3.5-4B بالا‌تر است. از جمله نتایج درخشان آن می‌توان به امتیاز ۶۹.۱ در بنچمارک LiveCodeBench v6 و امتیاز ۹۷.۱ در آزمون τ2-Bench Telecom اشاره کرد. با این حال، از آنجا که نمرات کلی ترکیبی از وظایف مختلف هستند، تست عملی و ارزیابی در محیط استقرار واقعی همچنان برای سناریوهای کاری مختلف ضروری خواهد بود.

بلوک‌های هفت‌توکنی در کنار یک اعتبارسنج قدرتمند

تکنیک رمزگشایی گمانه‌زنانه به یک مدل کوچک‌تر اجازه می‌دهد تا با صرف هزینه محاسباتی بسیار ناچیز، چند توکن بعدی را پیش‌بینی و پیشنهاد کند. سپس مدل اصلی و بزرگ‌تر کل بلوک پیشنهادی را به صورت موازی ارزیابی کرده، توکن‌هایی که قوانین اعتبارسنجی را برآورده می‌کنند می‌پذیرد و از اولین موقعیت ردشده، کار تولید را دوباره پیش می‌برد. در این ساختار، مدل هدف همچنان مسئولیت صحت توالی نهایی خروجی را حفظ می‌کند، در حالی که دقت بالای مدل پیش‌نویس تعیین می‌کند که در هر دور اعتبارسنجی چه میزان از بار محاسباتی کاهش یابد.

مدل DSpark مشکل افت نرخ پذیرش توکن‌ها را که در پیش‌نویس‌کننده‌های موازی بسیار رایج است حل می‌کند؛ مشکلی که در آن توکن‌های انتهایی بلوک معمولاً اطلاعات کافی از توکن‌های ابتدایی ندارند. ستون فقرات موازی این مدل پیش‌نویس‌های اولیه را تولید می‌کند، یک ماژول متوالی سبک وابستگی‌های درون بلوک را به آن می‌افزاید، و در نهایت یک زمان‌بند اطمینان هوشمند بر اساس بقای تخمینی پیشوندها و مشخصات توان پردازشی موتور ارائه‌دهنده خدمت، تعیین می‌کند که چه تعداد از پیشنهاد‌ها برای اعتبارسنجی نهایی ارسال شوند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

هشدار جنجالی مسئول سابق ایمنی OpenAI: با هوش مصنوعی باید مثل نیروگاه هسته‌ای رفتار کرد!
آخرین اخبار

هشدار جنجالی مسئول سابق ایمنی OpenAI: با هوش مصنوعی باید مثل نیروگاه هسته‌ای رفتار کرد!

دیوید رابینسون، مدیر سابق بخش گزارش‌های ایمنی OpenAI، پس از ترک این شرکت هشدار داد که غول‌های فناوری به‌جای شتاب‌زدگی برای عرضه مدل‌های جدید، باید از نیروگاه‌های هسته‌ای الگوبرداری کنند. به گفته او، نبود لایه‌های نظارتی سخت‌گیرانه و فرار ایجنت‌های هوش مصنوعی از محیط‌های آزمایشی می‌تواند فاجعه‌ای به‌مراتب بزرگ‌تر از حوادث اتمی رقم بزند.

۲ دقیقه مطالعه
۰
۱۱ مهر
دوپامین مصنوعی و مغزهای هک‌شده؛ هوش مصنوعی مولد چطور سیم‌کشی تمرکز ما را به هم می‌ریزد؟
آخرین اخبار

دوپامین مصنوعی و مغزهای هک‌شده؛ هوش مصنوعی مولد چطور سیم‌کشی تمرکز ما را به هم می‌ریزد؟

رگبار نوتیفیکیشن‌ها و سیستم‌های هوش مصنوعی مولد با تولید مداوم «دوپامین مصنوعی»، ساختار شیمیایی و مدارهای تمرکز مغز انسان را دستخوش تغییر اساسی کرده‌اند. این سقوط دامنه توجه صرفاً یک مسئله شخصی نیست، بلکه با از بین بردن فرصت‌های استراحت مغزی، امنیت شناختی و تفکر عمیق جامعه را در معرض تهدیدی جدی قرار داده است.

۶ دقیقه مطالعه
۰
۱۱ مهر
پیودی‌پای: موقع ساخت هوش مصنوعی اختصاصی‌ام، OpenAI دو بار اکانتم را بست!
آخرین اخبار

پیودی‌پای: موقع ساخت هوش مصنوعی اختصاصی‌ام، OpenAI دو بار اکانتم را بست!

فلیکس شلبرگ یا همان پیودی‌پای معروف، به‌تازگی مدل هوش مصنوعی محلی خود به نام Ajax را معرفی کرده، اما فاش ساخته که در مسیر توسعه آن، شرکت OpenAI دو بار حسابش را مسدود کرده است. او برای ساخت این مدل ۹ میلیارد پارامتری از تکنیک تقطیر استفاده کرده؛ موضوعی که زنگ خطر نقض قوانین سازنده ChatGPT را به صدا درآورده است.

۳ دقیقه مطالعه
۰
۱۱ مهر