پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

پرایم اینتلکت از Prime Inference رونمایی کرد؛ پردازش روزانه ۶۰۰ میلیارد توکن برای ایجنت‌های هوشمند

انتشار:۱۱ مهر ۱۴۰۵(۱۱ ساعت پیش)
۶ دقیقه زمان مطالعه
۰ دیدگاه

استارتاپ پرایم اینتلکت با رونمایی از پلتفرم Prime Inference، زیرساخت پروداکشن پردازش روزانه صدها میلیارد توکن را در اختیار عموم قرار داد. این سرویس جدید با بهینه‌سازی‌های عمیق سخت‌افزاری و نرم‌افزاری روی تراشه‌های بلک‌ول انویدیا، سرعت اجرای ایجنت‌های کدنویسی و مدل‌های متن‌باز بزرگی مثل GLM-5.3 را به اوج رسانده است.

پرایم اینتلکت از Prime Inference رونمایی کرد؛ پردازش روزانه ۶۰۰ میلیارد توکن برای ایجنت‌های هوشمند

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • پرایم اینتلکت پلتفرم Prime Inference رو معرفی کرد که روزانه نزدیک به ۶۰۰ میلیارد تا یک تریلیون توکن رو روی تراشه‌های پیشرفته انویدیا بلک‌ول پردازش می‌کنه.
  • این زیرساخت با تفکیک مراحل پردازش پرامپت و تولید توکن، فشرده‌سازی ۴ بیتی کش (NVFP4) و کاهش ترافیک NVLink، تأخیر اجرای مدل GLM-5.3 رو تا ۴۰ درصد کاهش داده.
  • توسعه‌دهنده‌ها می‌تونن با همون API آشنای سازگار با OpenAI، بدون دردسر از اندپوینت‌های سرورلس یا ظرفیت‌های رزروشده برای اجرای پایدار ایجنت‌های هوشمند استفاده کنن.

استارتاپ پرایم اینتلکت (Prime Intellect) رسماً از پلتفرم جدید خود با نام Prime Inference رونمایی کرد؛ زیرساخت پردازشی قدرتمندی که ستون فقرات فرآیندهای یادگیری تقویتی (RL) و سرویس‌دهی‌های اختصاصی به مشتریان این شرکت را تشکیل می‌دهد. این پلتفرم در حال حاضر روزانه نزدیک به یک تریلیون توکن را با تکیه بر منابع محاسباتی خود پردازش می‌کند. حالا پرایم اینتلکت همین زیرساخت مقیاس‌پذیر را در قالب اندپوینت‌های سرورلس (Serverless) برای مدیریت ترافیک‌های متغیر و ظرفیت‌های رزروشده (Reserved Capacity) برای بارهای پردازشی مداوم روی مدل‌های متن‌باز پیشرو، در دسترس همگان قرار داده است.

پرایم این استک نرم‌افزاری و سخت‌افزاری را به‌طور ویژه برای پشتیبانی از چرخه‌های سنگین یادگیری تقویتی، تولید داده‌های مصنوعی (Synthetic Data)، ارزیابی مدل‌ها و اجرای بی‌وقفه ایجنت‌های کدنویسی طولانی‌مدت توسعه داده است. نخستین خروجی عمومی این سرویس، مدل قدرتمند GLM-5.3 است که هم‌اکنون از طریق پلتفرم OpenRouter و همچنین API اختصاصی پرایم در دسترس قرار دارد. طبق آمار‌های منتشرشده از سوی پرایم، این اندپوینت یکی از پرسرعت‌ترین سرویس‌های ارائه‌دهنده مدل GLM-5.3 در OpenRouter محسوب می‌شود و نرخ خطای فراخوانی ابزار‌ها (Tool-call Error Rate) در آن تقریباً به صفر رسیده است.

یک API آشنا در کنار دو مدل دسترسی به ظرفیت پردازشی

این سرویس از یک رابط برنامه‌نویسی کاملاً سازگار با استاندارد OpenAI بهره می‌برد؛ به این معنی که توسعه‌دهندگان می‌توانند بدون نیاز به کوچک‌ترین تغییری در کدهای خود و تنها با به‌روزرسانی آدرس پایه (Base URL) به https://api.pinference.ai/api/v1 به این زیرساخت متصل شوند. علاوه بر این، پرایم یک رابط خط فرمان (CLI) اختصاصی را نیز برای تست و ارزیابی مستقیم فراهم کرده است:

prime inference chat 'z-ai/glm-5.3' "Write a haiku about KV caches."
  • مدل عمومی: سرویس‌دهی فوق‌العاده کم‌تأخیر مدل GLM-5.3 با پشتیبانی قراردادهای تضمین سطح خدمات (SLA) در مقیاس صنعتی و تجاری
  • سخت‌افزار قدرتمند: به‌کارگیری شتاب‌دهنده‌های پیشرفته بلک‌ول انویدیا (NVIDIA Blackwell) با برنامه‌ریزی قطعی برای تجهیز به زیرساخت نسل بعدی ورا روبین (Vera Rubin)
  • تاب‌آوری و پایداری: سوئیچ خودکار (Failover) بی‌درنگ بین دیتاسنترهای مختلف در صورت افت سلامت یا بروز اختلال در هر یک از سرور‌ها
  • ظرفیت منعطف: ارائه اندپوینت‌های سرورلس برای پاسخگویی به نوسانات لحظه‌ای ترافیک و ظرفیت‌های اختصاصی رزروشده برای بارهای کاری سنگین و مداوم
  • اکوسیستم نرم‌افزاری پیشرفته: بهره‌گیری از فناوری‌های NVIDIA Dynamo، vLLM، Mooncake و FlashInfer به همراه بازگرداندن بهینه‌سازی‌های فنی انجام‌شده به پروژه‌های متن‌باز اصلی (Upstream)

پرایم همچنین قصد دارد به‌زودی قابلیت استنتاج ناهمگام و دسته‌ای (Batch & Asynchronous Inference) را برای پردازش‌های آفلاین و کم‌هزینه‌تر به این پلتفرم اضافه کند. یکی دیگر از برنامه‌های جذاب این تیم، فراهم کردن امکان دیپلوی تک‌کلیکی مدل‌های فاین‌تیون‌شده از محیط‌های آموزشی پرایم روی ظرفیت‌های پردازشی رزروشده است.

چرا ایجنت‌های هوش مصنوعی سرور‌های استنتاج را به زانو درمی‌آورند؟

در یک سناریوی معمول هنگام اجرای ایجنت‌های هوش مصنوعی با زمینه‌های طولانی (Long-Context)، در هر رفت‌وبرگشت حدود ۶ هزار توکن جدید به یک پرامپت ۱۴۰ هزار توکنی اضافه می‌شود؛ در حالی که بخش عمده‌ای از تاریخچه گفتگو دست‌نخورده باقی می‌ماند و دوباره مورد استفاده قرار می‌گیرد. سرور‌های استنتاج برای اینکه مجبور نشوند در هر مرحله کل این مکالمه غول‌پیکر را از ابتدا پردازش کنند، داده‌های میانی لایه‌های توجه (Attention) را در حافظه‌ای اختصاصی به نام «کی‌وی کش» (KV Cache) نگهداری می‌کنند.

اما چالش اصلی زمانی رخ می‌دهد که زیر بار پردازشی همزمان، سشن‌های جاری با کش‌های قبلی باید همان منابع پردازنده‌های گرافیکی (GPU) را با درخواست‌های تازه‌ای به اشتراک بگذارند که دارای پرامپت‌های طولانی و بدون کش هستند. پردازش این پرامپت‌های اولیه یا به‌اصطلاح «سرد»، سرعت تولید توکن را برای سایر کاربران فعال به شدت کاهش می‌دهد؛ از سوی دیگر، جابه‌جایی حجم عظیمی از داده‌های KV Cache بین کارت‌های گرافیکی، بخش عمده‌ای از پهنای باند حافظه را می‌بلعد و سیستم را دچار کندی و معطلی می‌کند.

تفکیک پردازش پرامپت از فرآیند تولید توکن

پرایم برای حل این گلوگاه، مرحله پردازش اولیه پرامپت (Prefill) را به طور کامل از مرحله تولید توکن‌ها (Decode) تفکیک کرده است. در این معماری، هر مرحله توسط دسته‌های مجزایی از GPUها مدیریت می‌شود. وظیفه مسیریابی هوشمند درخواست‌ها بر عهده NVIDIA Dynamo گذاشته شده، اجرای مدل توسط فریم‌ورک محبوب vLLM انجام می‌شود و در نهایت کتابخانه اختصاصی NIXL انویدیا داده‌های ذخیره‌شده در KV Cache را بلافاصله پس از پایان پردازش پرامپت به پردازنده‌های تولید توکن (دیکودرها) منتقل می‌کند.

بررسی‌ها و تست‌های فنی پرایم نشان می‌دهد که این بازطراحی ساختاری، میزان تأخیر بین توکن‌ها در صدک نودم (90th-percentile) را تا مرز ۴۰ درصد کاهش داده است. در سیستم‌های پیشرفته GB200 NVL72 که مدل GLM-5.3 را میزبانی می‌کنند، ترکیب یک گروه پردازش پرامپت به ازای هر چهار گروه دیکودر توانسته از ۶۶ سشن همزمان با نرخ خیره‌کننده ۱۰۱ توکن تولیدی در ثانیه برای هر کاربر فعال پشتیبانی کند.

مرز کارایی مدل GLM-5.3 روی سیستم‌های GB200 NVL72 در نسبت‌های مختلف پردازش پرامپت به تولید توکن
توان عملیاتی و میزان تأخیر مدل GLM-5.3 در پیکربندی‌های مختلف تفکیک پرامپت و تولید توکن روی سیستم GB200 NVL72.

کش‌های ۴ بیتی راه را باز می‌کنند

استفاده از موازی‌سازی تنسور روی چهار پردازنده گرافیکی (موسوم به TP4) توانست کم‌ترین میزان تأخیر را در مرحله تولید توکن به ثبت برساند؛ با این حال، هر یک از GPUها کماکان ناچار بودند یک نسخه کامل از کش نهان KV مربوط به هر درخواست را در حافظه خود نگه دارند؛ مسأله‌ای که سقف تعداد توکن‌های قابل ذخیره‌سازی در رم را به شدت محدود می‌کرد.

مهندسان پرایم برای عبور از این بن‌بست، حافظه کش توجه نهان چندسر (MLA) مدل GLM-5.3 را با فرمت فشرده ۴ بیتی NVFP4 ذخیره کردند؛ فرمتی که به ازای هر گروه ۱۶ تایی از مقادیر، تنها یک مقیاس FP8 اختصاص می‌دهد. در نتیجه این ابتکار، حجم هر ردیف کش از ۵۷۶ بایت به ۳۵۲ بایت تقلیل یافت. با این ترفند و بدون نیاز به افزایش بودجه حافظه، ظرفیت بخش دیکودر حدود ۵۰ درصد جهش کرد و تعداد توکن‌های قابل نگهداری در کش از ۱.۰۹ میلیون به ۱.۶۳ میلیون توکن رسید.

در روش‌های ابتدایی، داده‌های ۴ بیتی ابتدا روی بافرهای FP8 بازگشایی می‌شدند و سپس فرآیند توجه روی آن‌ها اجرا می‌شد که همین رفت‌وبرگشت اضافه در حافظه GPU، تأخیر لایه‌ها را بالا می‌برد. پرایم برای رفع این نقیصه، یک کرنل محاسباتی بومی برای توجه تنک (Sparse-Attention Kernel) نوشت که منحصراً ردیف‌های منتخب ایندکسر را لود کرده و مستقیماً روی خود چیپ آنلاک می‌کند. در این ساختار، NVFP4 به عنوان فرمت ذخیره‌سازی حفظ شده، در حالی که محاسبات توجه با متغیرهای FP16 و تجمیع داده‌ها در دقت FP32 پیش می‌رود. این دستاورد فنی با سه تصمیم کلیدی در پیاده‌سازی حاصل شد:

  1. پیاده‌سازی پایپ‌لاین سه‌مرحله‌ای که به یک دسته وارپ (Warp Group) اجازه می‌دهد ردیف‌ها را از حالت فشرده خارج کند، همزمان با اینکه سایر گروه‌ها به محاسبه امتیاز و تجمیع مراحل قبلی می‌پردازند
  2. تنظیم پویای اندازه کلاسترهای پردازنده‌های جریانی (SM) متناسب با اندازه بچ توکن‌ها در لحظه
  3. پر کردن خانه‌های خالی در لیست ۲۰۴۸ موقعیتی با مقدار صفر؛ راهکاری که زمان آغاز اجرای توجه برای ۳۵ توکن را از حدود ۴۱ میکروثانیه به ۲۰.۶ میکروثانیه کاهش داد و عملاً نصف کرد
مسیر محاسبات توجه (Attention Path)
میزان تأخیر (Latency)
فرمت بومی NVFP4 (Native)
حدود ۱۲ میکروثانیه
فرمت مرحله‌ای NVFP4 (Staged)
۱۷.۷ میکروثانیه
فرمت FP8
۱۳.۷ میکروثانیه

پرایم در حرکتی ارزشمند، کرنل بومی NVFP4 خود را به عنوان یک عملیات آزمایشی در اختیار پروژه محبوب FlashInfer قرار داده است تا کل جامعه متن‌باز بتوانند از آن بهره‌مند شوند.

اندازه‌گیری تأخیر در نسخه‌های مختلف کرنل دیکود NVFP4 پرایم
بهینه‌سازی‌های پی‌درپی کرنل، تأخیر محاسبات توجه NVFP4 را در مسیر دیکود به شکل چشمگیری کاهش داده است.

کاهش تکرار کپی‌ها؛ آزادسازی تمام پتانسیل NVLink

آزمایش‌های اولیه پرایم نشان داد که انتقال داده‌های KV در بستر چندگره‌ای NVLink در مقایسه با استاندارد InfiniBand، حدود ۲۹۲ میلی‌ثانیه زمان پاسخ‌دهی به اولین توکن (TTFT) را به تعویق می‌اندازد. علت ماجرا اینجا بود که یک درخواست ساده با ۲۰۰ هزار توکن می‌توانست ۳۲ هزار عملیات کپی ریز بین دستگاه‌ها را روی هر کارت گرافیک فعال کند و با سیل عظیمی از برچسب‌های انتقال، پهنای باند را فلج سازد.

جامعه توسعه‌دهندگان vLLM این پراکندگی داده را با معماری نوآورانه BLHNC حل کردند؛ چیدمانی بلوک‌محور از حافظه KV که داده‌های چندین لایه مختلف را به صورت پیوسته در هر بلوک ذخیره می‌کند. هرچند در این طرح اندازه هر بلوک به یک‌شانزدهم اندازه قبلی تقلیل یافته، اما تعداد توصیف‌گرهای انتقال از ۱۹,۵۵۹ به حدود ۱,۹۴۰ عدد کاهش پیدا کرده است. نتیجه این بهینه‌سازی، افت میانگین زمان انتقال از ۱۴۶ میلی‌ثانیه به ۷۸ میلی‌ثانیه (یعنی کاهشی در حدود ۴۷ درصد) بود.

حافظه کش بیش‌تر و صف‌های کوتاه‌تر

روی پردازنده‌های گرافیکی فاز پرامپت، پرایم از ساختار DEP8 استفاده کرد که هشت دسته توجه موازی داده‌ای را با موازی‌سازی تخصصی ترکیب می‌کند. این در حالی بود که در ساختار جایگزین TEP8، داده‌های KV هر درخواست روی تمامی هشت پردازنده کپی می‌شد. راهکار DEP8 به کارت‌های مختلف این امکان را داد که درخواست‌های متفاوتی را کش کنند؛ نوآوری بزرگی که بدون نیاز به سخت‌افزار اضافه، ظرفیت قابل استفاده پیشوند کش (Prefix-Cache) را حدود ۵ برابر افزایش داد.

زمان‌بند پردازشی پرایم معمولاً حتی پیش از آنکه درخواست وارد صف پردازش دسته‌ای شود، داده‌های کش‌شده KV را آماده در اختیار داشت. این تیم با کاهش سقف پردازش پرامپت از ۸,۰۰۰ به ۴,۰۰۰ توکن به ازای هر GPU توانست این معطلی را هم کم‌تر کند؛ اقدامی که میانه زمان انتظار در صف را از ۵۵۰ میلی‌ثانیه به ۱۱۰ میلی‌ثانیه رساند و زمان تولید نخستین توکن را تقریباً ۲۰ درصد سریع‌تر کرد.

گاردریل‌های ساختاری برای فراخوانی بی‌نقص ابزار‌ها

سیستم Dynamo در شرایط عادی ممکن بود درخواست‌هایی را که به ابزار‌های تعریف‌نشده ارجاع داده می‌شدند، بدون هیچ هشداری نادیده بگیرد و وضعیت پایان عادی را به ایجنت برگرداند؛ خطایی بی‌صدا که ایجنت هوش مصنوعی را بدون هیچ پیام خطا یا دستور اجرایی معلق رها می‌کرد. چنین نقص‌هایی به ویژه برای ایجنت‌های کدنویسی و پژوهشی آسیب‌زننده است؛ چرا که تک‌تک مراحل تصمیم‌گیری آن‌ها به فراخوانی معتبر و دقیق ابزار‌های ساختاریافته وابسته است.

پرایم برای رفع این معضل، یک ابزار سازنده تگ‌های ساختاری را به Dynamo اضافه کرد تا موتور xgrammar فریم‌ورک vLLM بتواند ساختار دقیق و قوانین فراخوانی ابزار‌ها را در حین تولید تضمین کند. این گرامر ساختاری، توکن‌هایی را که موجب شکست قالب استاندارد می‌شوند، پیش از انتشار توسط مدل مسدود می‌سازد. علاوه بر این، این تیم باگ‌های پارسر را که باعث خراب شدن کاراکترهای < در کدهای تولیدی و فایل‌ها می‌شدند نیز به طور کامل برطرف کرد.

حلقه بازخورد مدل‌های باز و آینده پردازش هوش مصنوعی

هدف کلان و راهبردی پرایم، پیوند زدن زیرساخت سرویس‌دهی پروداکشن با فرآیندهای یادگیری و آموزش مدل‌ها است؛ به این صورت که داده‌ها و عملکردهای ثبت‌شده از ایجنت‌های در حال اجرا، مستقیماً به عنوان داده‌های آموزشی جدید برای چرخه‌های بعدی یادگیری تقویتی به کار گرفته شوند. تحقق این چرخه پیشرفته نیازمند لایه استنتاجی فوق‌العاده پایداری است که بتواند متن‌های بسیار طولانی را با اطمینان کامل پردازش کند و خروجی‌های ساختاریافته مورد نیاز ایجنت‌ها را کاملاً سالم تحویل دهد.

این دستاوردهای مهندسی به‌خوبی اثبات می‌کنند که در کنار قدرت پردازشی صرف GPUها، عواملی نظیر چیدمان حافظه، فشرده‌سازی کش، زمان‌بندی هوشمند، ظرافت انتقال داده و دیکودینگ مقید، نقشی بنیادین در کارایی نهایی ایجنت‌ها ایفا می‌کنند. اکنون جامعه توسعه‌دهندگان مدل‌های متن‌باز می‌توانند از طریق اندپوینت عمومی GLM-5.3 یا تهیه سرویس‌های رزروشده، از این بهینه‌سازی‌های فنی بهره‌مند شوند. البته باید به خاطر داشت که ارقام و رکوردهای منتشرشده توسط خود توسعه‌دهنده و بر اساس مدلی خاص ثبت شده‌اند و کارایی واقعی در عمل به طول زمینه، بار همزمانی کاربران، نرخ استفاده مجدد از پرامپت‌ها و معماری نهایی مدل‌ها وابسته خواهد بود.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

شتاب خیره‌کننده مدل زبانی MiniCPM5 با دستیار ۳۲۴ میلیونی DSpark؛ جهش چشمگیر در تولید موازی توکن‌ها
آخرین اخبار

شتاب خیره‌کننده مدل زبانی MiniCPM5 با دستیار ۳۲۴ میلیونی DSpark؛ جهش چشمگیر در تولید موازی توکن‌ها

تیم OpenBMB با انتشار مدل کم‌حجم ۳۲۴ میلیون پارامتری DSpark، جهش بزرگی در سرعت استنتاج مدل زبانی MiniCPM5-2B ایجاد کرده است. این مدل با تکیه بر تکنیک هوشمندانه رمزگشایی گمانه‌زنانه، توکن‌ها را به صورت دسته‌ای حدس می‌زند تا فرایند پردازش با کم‌ترین مصرف محاسباتی و بیش‌ترین سرعت ممکن اجرا شود.

۲ دقیقه مطالعه
۰
۱۱ مهر
پیودی‌پای: موقع ساخت هوش مصنوعی اختصاصی‌ام، OpenAI دو بار اکانتم را بست!
آخرین اخبار

پیودی‌پای: موقع ساخت هوش مصنوعی اختصاصی‌ام، OpenAI دو بار اکانتم را بست!

فلیکس شلبرگ یا همان پیودی‌پای معروف، به‌تازگی مدل هوش مصنوعی محلی خود به نام Ajax را معرفی کرده، اما فاش ساخته که در مسیر توسعه آن، شرکت OpenAI دو بار حسابش را مسدود کرده است. او برای ساخت این مدل ۹ میلیارد پارامتری از تکنیک تقطیر استفاده کرده؛ موضوعی که زنگ خطر نقض قوانین سازنده ChatGPT را به صدا درآورده است.

۳ دقیقه مطالعه
۰
۱۱ مهر
طعنه سنگین سم آلتمن به آنتروپیک: نسبت دادن روح و دین به هوش مصنوعی خطرناکه!
آخرین اخبار

طعنه سنگین سم آلتمن به آنتروپیک: نسبت دادن روح و دین به هوش مصنوعی خطرناکه!

سم آلتمن، مدیرعامل اوپن‌ای‌آی، در اظهارنظری جنجالی به رویکرد شرکت رقیب یعنی آنتروپیک تاخت و نسبت دادن مفاهیم مذهبی و خودآگاهی به مدل‌های هوش مصنوعی را یک تهدید امنیتی واقعی دانست. این اختلاف‌نظر تازه پس از آن بالا گرفت که گزارش‌هایی از گفت‌وگوهای آنتروپیک با رهبران دینی برای تزریق اخلاق به مدل‌ها منتشر شد. حالا دانشمندان ارشد هوش مصنوعی و حتی واتیکان هم به این مناقشه فلسفی کشیده شده‌اند و درباره خطرات چنین رویکردی هشدار می‌دهند.

۲ دقیقه مطالعه
۰
۱۱ مهر