اجرای تصمیمات هوش مصنوعی در ۷ میلیثانیه؛ مدل Laya بدون نیاز به کلاد به تراشههای اپل آمد
پورت بومی مدلهای تصمیمگیری Laya برای چارچوب MLX اپل منتشر شد. این مدل روی پردازندههای M3 Max با تأخیر کمتر از ۱۴ میلیثانیه بهصورت محلی اجرا میشود.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- انتشار پورت بومی مدلهای Laya برای چارچوب MLX اپل جهت پردازش محلی با دقت FP16.
- تأخیر بسیار پایین ۱۳٫۴ میلیثانیهای برای زبان انگلیسی و ۷٫۴ میلیثانیهای برای مدل چندزبانه در پردازنده M3 Max.
- حذف نیاز به رمزگشایی توکنبهتوکن و کلاد؛ بازگشت مستقیم احتمالات برای تصمیمگیری سریع اپلیکیشنها.
پورت laya-mlx مدلهای تصمیمگیری Laya را به پردازندههای اپل میآورد
پروژه laya-mlx خانواده مدلهای تصمیمگیری Laya را برای چارچوب یادگیری ماشین اپل یعنی MLX پورت کرده است. این پکیج پایتون، چکپوینتهای ازپیشآموزشدیده FP16 را بهصورت محلی روی پردازندههای اپل (Apple Silicon) اجرا میکند. طبق بنچمارکهای ارائهشده، میانه تأخیر برای هر کوئری در پردازنده M3 Max بین ۷٫۳۹ تا ۱۳٫۴۲ میلیثانیه گزارش شده است.
در این روش، اپلیکیشنها یک انتخاب، امتیاز یا گزاره را از پیش تعریف میکنند و هدهای تصمیمگیری اختصاصی، احتمالات کالیبرهشده را برمیگردانند. این رویکرد از رمزگشایی توکنبهتوکن، تولید فایلهای JSON و مسیرهای پردازشی مرتبط با آن جلوگیری میکند. به این ترتیب، استنتاج مدل کاملاً روی سیستم مک باقی میماند و هیچ نیازی به رانتایم PyTorch یا APIهای ابری نخواهد داشت.
اجرای میلیثانیهای با شرایط مشخص
این پروژه تأخیر پایانبهپایان را روی یک پردازنده M3 Max با پردازشگر گرافیکی ۴۰ هستهای و ۱۲۸ گیگابایت حافظه یکپارچه اندازهگیری کرده است. هر نتیجه کوئری تکی شامل یک سؤال کوتاه انگلیسی است؛ درحالیکه آمارهای توان عملیاتی بر اساس دستههای ۵۰تایی محاسبه شدهاند. باید توجه داشت که این اندازهگیریها توسط خود پروژه گزارش شده و هنوز در انتظار بررسی و بازتولید مستقل هستند.
چکپوینت | تعداد پارامترها | میانه تأخیر تککوئری | توان عملیاتی (دسته ۵۰تایی) |
|---|---|---|---|
Laya | ۴۲۱ میلیون | ۱۳٫۴۲ میلیثانیه | ۱۴۶٫۸ سؤال بر ثانیه |
Multilingual Laya | ۳۲۲ میلیون | ۷٫۳۹ میلیثانیه | ۳۹۵٫۰ سؤال بر ثانیه |
در هر دو پیکربندی بنچمارک، اوج مصرف حافظه گزارششده زیر ۱ گیگابایت نگه داشته شده است. توان عملیاتی دستهای نشاندهنده پردازش مجموع درخواستها است و نباید به عنوان تأخیر هر درخواست مجزا در نظر گرفته شود.
این پروژه همچنین شامل یک دموی بازی Snake است که مدل را بهصورت محلی با سرعت تقریبی ۶۰ تصمیم در ثانیه اجرا میکند و احتمالات هر حرکت را به نمایش میگذارد. یک لایه مجزای ایمنی نیز میتواند پیش از اعمال حرکتها در بازی، پیشنهادهای ناامن را رد کند.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.