پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

شتاب ۳ برابری پردازش تصویر هوش مصنوعی روی تراشه‌های Apple با فناوری جدید Liquid AI

انتشار:۳ مهر ۱۴۰۵(۳ روز پیش)
۴ دقیقه زمان مطالعه
۰ دیدگاه

استارتاپ Liquid AI با معرفی مدل آزمایشی LFM2.5-VL-DSpark، تکنیک رمزگشایی حدسی را به مدل‌های چندوجهی آورده است تا سرعت تولید توکن تا ۳٫۱۳ برابر روی تراشه‌های Apple ارتقا یابد.

شتاب ۳ برابری پردازش تصویر هوش مصنوعی روی تراشه‌های Apple با فناوری جدید Liquid AI

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • معرفی مدل LFM2.5-VL-DSpark توسط Liquid AI با هدف افزایش چشمگیر سرعت استنتاج در مدل بینایی-زبانی ۳ میلیارد پارامتری LFM2.5-VL-3B
  • به‌کارگیری رویکرد رمزگشایی حدسی (Speculative Decoding) و دستیابی به جهش سرعت ۲٫۶۶ برابری روی Nvidia H100 و تا ۳٫۱۳ برابری روی پردازنده‌های Apple Silicon
  • افزایش ناچیز ۸٫۹ درصدی در تعداد پارامترها (معادل ۲۸۰ میلیون پارامتر) بدون نیاز به تغییر توزیع خروجی یا افت دقت مدل اصلی
  • پشتیبانی فوری در ابزارهای محبوب اجرای محلی از جمله llama.cpp، MLX-VLM و SGLang در قالب وزن‌های Safetensors و GGUF

شرکت Liquid AI از مدل پیش‌نویس آزمایشی LFM2.5-VL-DSpark برای مدل بینایی-زبانی LFM2.5-VL-3B رونمایی کرد. این مدل همراه، با پیاده‌سازی تکنیک رمزگشایی حدسی (Speculative Decoding) روی استنتاج‌های چندوجهی، سرعت تولید توکن را بدون تغییر در توزیع خروجی مدل هدف افزایش می‌دهد.

در روش رمزگشایی حدسی، یک مدل کوچک‌تر به‌عنوان «پیش‌نویس‌کننده» (Drafter) در کنار مدل اصلی و بزرگ‌تر قرار می‌گیرد. مدل پیش‌نویس تعدادی توکن را پیشنهاد می‌دهد؛ سپس مدل هدف در یک مرحله پردازش رفت، کل این بلوک پیشنهادی را ارزیابی می‌کند، پیش‌بینی‌های درست را می‌پذیرد و عدم تطابق‌ها را اصلاح می‌نماید. این فرایند اعتبارسنجی موجب می‌شود توزیع خروجی مدل هدف حفظ شود؛ بنابراین، رمزگشایی قطعی همچنان همان توالی یکسان از توکن‌ها را تولید خواهد کرد.

بر اساس گزارش Liquid AI، شتاب سرعت رمزگشایی روی تراشه Nvidia H100 تا ۲٫۶۶ برابر و روی پردازنده‌های Apple Silicon تا ۳٫۱۳ برابر به ثبت رسیده است. همچنین بیشترین میزان بهبود سرعت سرتاسری (End-to-End) در این سیستم‌ها به ترتیب ۲٫۲۷ برابر و ۲٫۶۲ برابر گزارش شده است. شتاب رمزگشایی صرفاً نرخ تولید توکن‌ها را می‌سنجد، در حالی که شتاب سرتاسری شامل زمان انکود تصویر و پردازش دستور ورودی نیز می‌شود.

چرا تصاویر برای مدل پیش‌نویس شبیه به توکن به نظر می‌رسند؟

انکودر بینایی پیش از آنکه هسته زبانی تصویر را در کنار متن تحلیل کند، آن را به توکن‌های بصری تبدیل می‌کند. در این مرحله، هر دو حالت ورودی به شکل تنسورهای چندبعدی در حالت‌های پنهان مدل حضور دارند؛ ساختاری که به DSpark اجازه می‌دهد از همان متدولوژی رمزگشایی حدسیِ طراحی‌شده برای مدل‌های متنی استفاده کند.

مدل DSpark حالت‌های پنهان چندین لایه از مدل هدف را می‌خواند و بلوکی از توکن‌های بعدی را پیش‌بینی می‌کند. مدل هدف این بلوک را به صورت یک‌جا ارزیابی می‌کند و هر بار که پیش‌بینی‌ها انطباق کافی با توزیع آماری آن داشته باشند، در هر گذر پردازشی چندین توکن خروجی تحویل می‌دهد.

افزایش ۸٫۹ درصدی تعداد پارامترها

این مدل پیش‌نویس حدود ۲۸۰ میلیون پارامتر به سیستم اضافه می‌کند که به معنای افزایش ۸٫۹ درصدی در تعداد کل پارامترهای بارگذاری‌شده است. لایه‌های امبدینگ و خروجی زبانی مدل همچنان به مدل ۳ میلیارد پارامتری اصلی متکی هستند و DSpark آن‌ها را تکرار نمی‌کند.

  • پشته ۴ لایه دکودر: ۱۹۳ میلیون پارامتر
  • تصویرسازی حالت پنهان (Projection): ۲۱ میلیون پارامتر
  • هد مارکوف: ۶۵٫۵ میلیون پارامتر
  • هد نرمال‌سازی و ضریب اطمینان: ۶٫۴ هزار پارامتر

تیم Liquid AI پس از آزمایش‌های سنجش معماری (Ablation)، ساختار ۴ لایه و اندازه بلوک حدسی ۹ تایی را انتخاب کرده است. این تیم بسته به سختافزار و محیط اجرا، اندازه بلوک ۸ یا ۹ را برای استنتاج توصیه می‌کند. تمام ارزیابی‌های معماری و مراحل آموزش روی سختافزار AMD و از طریق فریم‌ورک آموزشی Liquid AI انجام شده است.

سه محیط اجرا با شتاب رمزگشایی تا ۳٫۱۳ برابر

عملکرد DSpark با بنچمارک MMSpec در زمینه‌های پاسخ‌دهی بصری به سوالات، تشخیص متن در تصویر، کپشن‌نویسی، تحلیل نمودارها، استدلال‌های پیچیده و گفتگوهای چندمرحله‌ای مورد بررسی قرار گرفت. این تست‌ها با اندازه دسته ۱ (Batch size 1)، دمای ۰ (Temperature 0) و وزن‌های FP16 یا BF16 انجام شده‌اند. بازه‌های ذکرشده در جدول زیر، نشان‌دهنده تنوع عملکرد در این سناریوهای مختلف هستند.

محیط اجرا و سختافزار
شتاب رمزگشایی
شتاب سرتاسری
توکن‌های تاییدشده در هر گذر
MLX-VLM روی M5 Max
۲٫۳۰ تا ۳٫۱۳ برابر
۱٫۵۶ تا ۲٫۶۲ برابر
حدود ۳٫۲ تا ۴٫۵
llama.cpp روی M3 Ultra
۱٫۵۷ تا ۲٫۱۴ برابر
۱٫۳۰ تا ۱٫۷۷ برابر
حدود ۳٫۲ تا ۴٫۵
SGLang روی H100 80GB
۲٫۰۴ تا ۲٫۶۶ برابر
۱٫۶۴ تا ۲٫۲۷ برابر
۳٫۴۶ تا ۴٫۵۷

تعداد توکن‌های پذیرفته‌شده در هر سه محیط نرم‌افزاری شباهت بالایی دارد؛ زیرا تطابق پیش‌بینی‌ها صرفاً به مدل پیش‌نویس و ماهیت وظیفه بستگی دارد، در حالی که سختافزار و محیط اجرا مشخص می‌کنند این توکن‌های پذیرفته‌شده چه میزان زمان ذخیره می‌کنند.

در تست‌های هم‌زمانی بالاتر (Concurrency)، برتری پهنای باند استنتاج حفظ شد، هرچند با بزرگ‌تر شدن اندازه‌های دسته، این اختلاف کمتر می‌شود؛ چرا که دسته‌های بزرگ‌تر پردازش را به سمت اشباع محاسباتی می‌برند و مزیت کاهش دسترسی به حافظه را تعدیل می‌کنند.

مرحله پیش‌بارگذاری؛ سقف بهبود سرعت

هر درخواست در مدل‌های بینایی-زبانی شامل سه مرحله کلیدی است: انکود تصویر، پیش‌بارگذاری پرامپت (Prompt Prefill) و رمزگشایی خودبازگشتی (Autoregressive Decoding). معماری DSpark صرفاً فاز رمزگشایی را تسریع می‌کند؛ انکودر بینایی همچنان باید تصویر را تحلیل کند و ستون اصلی مدل زبانی نیز باید پرامپت متنی و صدها توکن تصویری را پیش‌بارگذاری نماید.

طبق قانون امدال (Amdahl's law)، هنگامی که مراحل دست‌نخورده بخش عمده‌ای از زمان درخواست را به خود اختصاص می‌دهند، بهبود کل سیستم محدود می‌شود. در پردازش پاسخ‌های کوتاه روی تصاویر پیچیده، سهم زیادی از تاخیر صرف انکود بصری و پیش‌بارگذاری می‌شود، به‌ویژه در دستگاه‌هایی که توان محاسباتی کمتری دارند. در نقطه مقابل، سناریوهایی نظیر کپشن‌نویسی، تحلیل چارت، چت‌های چندمرحله‌ای و استدلال‌های تفصیلی، توکن‌های خروجی بیشتری تولید می‌کنند و فرصت بیشتری برای عملکرد بهینه رمزگشایی حدسی فراهم می‌آورند.

علاوه بر این، افزایش دمای نمونه‌برداری (Sampling Temperature) بازدهی را کاهش می‌دهد؛ چرا که یکنواخت‌تر شدن توزیع توکن‌ها، اختلاف میان پیش‌نویس و مدل اصلی را بیشتر کرده و نرخ پذیرش را پایین می‌آورد. بنچمارک‌های منتشرشده از رمزگشایی حریصانه (Greedy Decoding) با دمای ۰ بهره برده‌اند که در آن نرخ پذیرش توکن‌ها و توان پردازشی به اوج می‌رسد.

پشتیبانی بومی در ابزارهای مختلف پیاده‌سازی شد

شرکت Liquid AI وزن‌های مدل پیش‌نویس را در دو قالب Safetensors و GGUF عرضه کرده و تغییرات نرم‌افزاری لازم در فریم‌ورک‌های llama.cpp، MLX-VLM و SGLang اعمال شده است.

  • مدل DSpark را در کنار مدل هدف متناظر، یعنی LFM2.5-VL-3B اجرا کنید.
  • کار را با اندازه بلوک حدسی ۸ یا ۹ آغاز نمایید.
  • تاخیر مرحله رمزگشایی و تاخیر سرتاسری را به‌صورت مجزا اندازه‌گیری کنید.
  • بنچمارک‌ها را با طول پرامپت، ابعاد تصویر، دما و سطح هم‌زمانی واقعی محیط عملیاتی بسنجید.
  • افزایش ۲۸۰ میلیون پارامتری را جدا از امبدینگ‌های مشترک در محاسبات حافظه لحاظ کنید.

برنامه‌هایی که پاسخ‌های طولانی تولید می‌کنند، می‌توانند با پذیرش ۸٫۹ درصد پارامتر بیشتر، به جهش سرعت سرتاسری حدود ۱٫۶ تا ۲٫۶ برابری روی سیستم‌های تست‌شده دست یابند. با این حال، در سناریوهایی که زمان اصلی صرف پردازش تصویر، پیش‌بارگذاری، پاسخ‌های تک‌کلمه‌ای یا نمونه‌برداری با دمای بالا می‌شود، میزان بهبود سرعت در مرزهای پایین‌تر این بازه قرار خواهد گرفت.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر