شتاب ۳ برابری پردازش تصویر هوش مصنوعی روی تراشههای Apple با فناوری جدید Liquid AI
استارتاپ Liquid AI با معرفی مدل آزمایشی LFM2.5-VL-DSpark، تکنیک رمزگشایی حدسی را به مدلهای چندوجهی آورده است تا سرعت تولید توکن تا ۳٫۱۳ برابر روی تراشههای Apple ارتقا یابد.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- معرفی مدل LFM2.5-VL-DSpark توسط Liquid AI با هدف افزایش چشمگیر سرعت استنتاج در مدل بینایی-زبانی ۳ میلیارد پارامتری LFM2.5-VL-3B
- بهکارگیری رویکرد رمزگشایی حدسی (Speculative Decoding) و دستیابی به جهش سرعت ۲٫۶۶ برابری روی Nvidia H100 و تا ۳٫۱۳ برابری روی پردازندههای Apple Silicon
- افزایش ناچیز ۸٫۹ درصدی در تعداد پارامترها (معادل ۲۸۰ میلیون پارامتر) بدون نیاز به تغییر توزیع خروجی یا افت دقت مدل اصلی
- پشتیبانی فوری در ابزارهای محبوب اجرای محلی از جمله llama.cpp، MLX-VLM و SGLang در قالب وزنهای Safetensors و GGUF
شرکت Liquid AI از مدل پیشنویس آزمایشی LFM2.5-VL-DSpark برای مدل بینایی-زبانی LFM2.5-VL-3B رونمایی کرد. این مدل همراه، با پیادهسازی تکنیک رمزگشایی حدسی (Speculative Decoding) روی استنتاجهای چندوجهی، سرعت تولید توکن را بدون تغییر در توزیع خروجی مدل هدف افزایش میدهد.
در روش رمزگشایی حدسی، یک مدل کوچکتر بهعنوان «پیشنویسکننده» (Drafter) در کنار مدل اصلی و بزرگتر قرار میگیرد. مدل پیشنویس تعدادی توکن را پیشنهاد میدهد؛ سپس مدل هدف در یک مرحله پردازش رفت، کل این بلوک پیشنهادی را ارزیابی میکند، پیشبینیهای درست را میپذیرد و عدم تطابقها را اصلاح مینماید. این فرایند اعتبارسنجی موجب میشود توزیع خروجی مدل هدف حفظ شود؛ بنابراین، رمزگشایی قطعی همچنان همان توالی یکسان از توکنها را تولید خواهد کرد.
بر اساس گزارش Liquid AI، شتاب سرعت رمزگشایی روی تراشه Nvidia H100 تا ۲٫۶۶ برابر و روی پردازندههای Apple Silicon تا ۳٫۱۳ برابر به ثبت رسیده است. همچنین بیشترین میزان بهبود سرعت سرتاسری (End-to-End) در این سیستمها به ترتیب ۲٫۲۷ برابر و ۲٫۶۲ برابر گزارش شده است. شتاب رمزگشایی صرفاً نرخ تولید توکنها را میسنجد، در حالی که شتاب سرتاسری شامل زمان انکود تصویر و پردازش دستور ورودی نیز میشود.
چرا تصاویر برای مدل پیشنویس شبیه به توکن به نظر میرسند؟
انکودر بینایی پیش از آنکه هسته زبانی تصویر را در کنار متن تحلیل کند، آن را به توکنهای بصری تبدیل میکند. در این مرحله، هر دو حالت ورودی به شکل تنسورهای چندبعدی در حالتهای پنهان مدل حضور دارند؛ ساختاری که به DSpark اجازه میدهد از همان متدولوژی رمزگشایی حدسیِ طراحیشده برای مدلهای متنی استفاده کند.
مدل DSpark حالتهای پنهان چندین لایه از مدل هدف را میخواند و بلوکی از توکنهای بعدی را پیشبینی میکند. مدل هدف این بلوک را به صورت یکجا ارزیابی میکند و هر بار که پیشبینیها انطباق کافی با توزیع آماری آن داشته باشند، در هر گذر پردازشی چندین توکن خروجی تحویل میدهد.
افزایش ۸٫۹ درصدی تعداد پارامترها
این مدل پیشنویس حدود ۲۸۰ میلیون پارامتر به سیستم اضافه میکند که به معنای افزایش ۸٫۹ درصدی در تعداد کل پارامترهای بارگذاریشده است. لایههای امبدینگ و خروجی زبانی مدل همچنان به مدل ۳ میلیارد پارامتری اصلی متکی هستند و DSpark آنها را تکرار نمیکند.
- پشته ۴ لایه دکودر: ۱۹۳ میلیون پارامتر
- تصویرسازی حالت پنهان (Projection): ۲۱ میلیون پارامتر
- هد مارکوف: ۶۵٫۵ میلیون پارامتر
- هد نرمالسازی و ضریب اطمینان: ۶٫۴ هزار پارامتر
تیم Liquid AI پس از آزمایشهای سنجش معماری (Ablation)، ساختار ۴ لایه و اندازه بلوک حدسی ۹ تایی را انتخاب کرده است. این تیم بسته به سختافزار و محیط اجرا، اندازه بلوک ۸ یا ۹ را برای استنتاج توصیه میکند. تمام ارزیابیهای معماری و مراحل آموزش روی سختافزار AMD و از طریق فریمورک آموزشی Liquid AI انجام شده است.
سه محیط اجرا با شتاب رمزگشایی تا ۳٫۱۳ برابر
عملکرد DSpark با بنچمارک MMSpec در زمینههای پاسخدهی بصری به سوالات، تشخیص متن در تصویر، کپشننویسی، تحلیل نمودارها، استدلالهای پیچیده و گفتگوهای چندمرحلهای مورد بررسی قرار گرفت. این تستها با اندازه دسته ۱ (Batch size 1)، دمای ۰ (Temperature 0) و وزنهای FP16 یا BF16 انجام شدهاند. بازههای ذکرشده در جدول زیر، نشاندهنده تنوع عملکرد در این سناریوهای مختلف هستند.
محیط اجرا و سختافزار | شتاب رمزگشایی | شتاب سرتاسری | توکنهای تاییدشده در هر گذر |
|---|---|---|---|
MLX-VLM روی M5 Max | ۲٫۳۰ تا ۳٫۱۳ برابر | ۱٫۵۶ تا ۲٫۶۲ برابر | حدود ۳٫۲ تا ۴٫۵ |
llama.cpp روی M3 Ultra | ۱٫۵۷ تا ۲٫۱۴ برابر | ۱٫۳۰ تا ۱٫۷۷ برابر | حدود ۳٫۲ تا ۴٫۵ |
SGLang روی H100 80GB | ۲٫۰۴ تا ۲٫۶۶ برابر | ۱٫۶۴ تا ۲٫۲۷ برابر | ۳٫۴۶ تا ۴٫۵۷ |
تعداد توکنهای پذیرفتهشده در هر سه محیط نرمافزاری شباهت بالایی دارد؛ زیرا تطابق پیشبینیها صرفاً به مدل پیشنویس و ماهیت وظیفه بستگی دارد، در حالی که سختافزار و محیط اجرا مشخص میکنند این توکنهای پذیرفتهشده چه میزان زمان ذخیره میکنند.
در تستهای همزمانی بالاتر (Concurrency)، برتری پهنای باند استنتاج حفظ شد، هرچند با بزرگتر شدن اندازههای دسته، این اختلاف کمتر میشود؛ چرا که دستههای بزرگتر پردازش را به سمت اشباع محاسباتی میبرند و مزیت کاهش دسترسی به حافظه را تعدیل میکنند.
مرحله پیشبارگذاری؛ سقف بهبود سرعت
هر درخواست در مدلهای بینایی-زبانی شامل سه مرحله کلیدی است: انکود تصویر، پیشبارگذاری پرامپت (Prompt Prefill) و رمزگشایی خودبازگشتی (Autoregressive Decoding). معماری DSpark صرفاً فاز رمزگشایی را تسریع میکند؛ انکودر بینایی همچنان باید تصویر را تحلیل کند و ستون اصلی مدل زبانی نیز باید پرامپت متنی و صدها توکن تصویری را پیشبارگذاری نماید.
طبق قانون امدال (Amdahl's law)، هنگامی که مراحل دستنخورده بخش عمدهای از زمان درخواست را به خود اختصاص میدهند، بهبود کل سیستم محدود میشود. در پردازش پاسخهای کوتاه روی تصاویر پیچیده، سهم زیادی از تاخیر صرف انکود بصری و پیشبارگذاری میشود، بهویژه در دستگاههایی که توان محاسباتی کمتری دارند. در نقطه مقابل، سناریوهایی نظیر کپشننویسی، تحلیل چارت، چتهای چندمرحلهای و استدلالهای تفصیلی، توکنهای خروجی بیشتری تولید میکنند و فرصت بیشتری برای عملکرد بهینه رمزگشایی حدسی فراهم میآورند.
علاوه بر این، افزایش دمای نمونهبرداری (Sampling Temperature) بازدهی را کاهش میدهد؛ چرا که یکنواختتر شدن توزیع توکنها، اختلاف میان پیشنویس و مدل اصلی را بیشتر کرده و نرخ پذیرش را پایین میآورد. بنچمارکهای منتشرشده از رمزگشایی حریصانه (Greedy Decoding) با دمای ۰ بهره بردهاند که در آن نرخ پذیرش توکنها و توان پردازشی به اوج میرسد.
پشتیبانی بومی در ابزارهای مختلف پیادهسازی شد
شرکت Liquid AI وزنهای مدل پیشنویس را در دو قالب Safetensors و GGUF عرضه کرده و تغییرات نرمافزاری لازم در فریمورکهای llama.cpp، MLX-VLM و SGLang اعمال شده است.
- مدل DSpark را در کنار مدل هدف متناظر، یعنی LFM2.5-VL-3B اجرا کنید.
- کار را با اندازه بلوک حدسی ۸ یا ۹ آغاز نمایید.
- تاخیر مرحله رمزگشایی و تاخیر سرتاسری را بهصورت مجزا اندازهگیری کنید.
- بنچمارکها را با طول پرامپت، ابعاد تصویر، دما و سطح همزمانی واقعی محیط عملیاتی بسنجید.
- افزایش ۲۸۰ میلیون پارامتری را جدا از امبدینگهای مشترک در محاسبات حافظه لحاظ کنید.
برنامههایی که پاسخهای طولانی تولید میکنند، میتوانند با پذیرش ۸٫۹ درصد پارامتر بیشتر، به جهش سرعت سرتاسری حدود ۱٫۶ تا ۲٫۶ برابری روی سیستمهای تستشده دست یابند. با این حال، در سناریوهایی که زمان اصلی صرف پردازش تصویر، پیشبارگذاری، پاسخهای تککلمهای یا نمونهبرداری با دمای بالا میشود، میزان بهبود سرعت در مرزهای پایینتر این بازه قرار خواهد گرفت.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.