پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

پایان اشغال بی‌دلیل کارت‌های گرافیک؛ مؤسسه Ai2 زمان معطلی در صف کلاسترهای انویدیا را ۸۷ درصد کاهش داد!

انتشار:۱۸ مهر ۱۴۰۵(۱ ساعت پیش)
۶ دقیقه زمان مطالعه
۰ دیدگاه

مؤسسه هوش مصنوعی آلن (Ai2) با کنار گذاشتن سیستم سنتی اولویت‌بندی، سیستم زمان‌بندی کلاسترهای قدرتمند پردازنده‌های انویدیا را به طور اساسی بازطراحی کرد. با این سازوکار جدید که مبتنی بر بودجه‌بندی ساعتی و سهم منصفانه سلسله‌مراتبی است، زمان معطلی پژوهشگران در صف کلاستر بزرگ H100 تا ۸۷ درصد کاهش یافته و صف‌های طولانی چندساعته به چند ثانیه تبدیل شده است.

پایان اشغال بی‌دلیل کارت‌های گرافیک؛ مؤسسه Ai2 زمان معطلی در صف کلاسترهای انویدیا را ۸۷ درصد کاهش داد!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مؤسسه هوش مصنوعی آلن (Ai2) سیستم زمان‌بندی کلاسترهای مجهز به پردازنده‌های H100، B200 و B300 انویدیا را از نو طراحی کرد تا جلوی احتکار و اشغال صوری منابع پردازشی توسط پژوهشگران را بگیرد.
  • با به‌کارگیری بودجه‌های ساعتی و سهمیه منصفانه، میانه زمان معطلی در صف کلاستر بزرگ H100 از ۵ دقیقه به فقط ۲۴ ثانیه سقوط کرد و انتظار طولانی ۹۰ درصد کار‌ها هم تا یک ساعت کم‌تر شد.
  • ترفند طلایی این سیستم تعریف سقف مصونیت ۸ ساعته برای فرایندهای سنگین و امکان قرض گرفتن موقت ظرفیت‌های خالی بود که نرخ اشغال کلی کلاستر را همچنان روی عدد عالی ۹۸ درصد حفظ کرد.

کاهش چشمگیر زمان معطلی در صف پردازنده‌های گرافیکی با ترفند بودجه‌بندی زمانی در Ai2

مؤسسه هوش مصنوعی آلن (Ai2) سیستم زمان‌بندی (Scheduler) کلاسترهای مجهز به پردازنده‌های گرافیکی انویدیا H100، B200 و B300 خود را از پایه بازطراحی کرد. پیش از این، برچسب‌های اولویت بدون هزینه و فرایندهای بی‌پایانی که در برابر توقف مصون بودند، باعث شده بود پژوهشگران منابع پردازشی گران‌قیمت را پیش خودشان احتکار و قرق کنند! معماری جایگزین، ترکیبی هوشمندانه از بودجه‌بندی ساعتی مصرف پردازنده (GPU-hour)، زمان‌بندی منصفانه سلسله‌مراتبی و مصونیت محدود در برابر توقف زودهنگام پردازش (Preemption) است.

در بزرگ‌ترین کلاستر H100 این مؤسسه، میانه (Median) زمان معطلی در صف پردازش از ۵ دقیقه به تنها ۲۴ ثانیه سقوط کرد. همچنین شاخص معطلی صدک نودم (p90 Wait) که بیانگر حداکثر زمان انتظار ۹۰ درصد از درخواست‌هاست، از ۲.۸ ساعت به ۱.۸ ساعت رسید. این بازطراحی به تیم‌های زیرساخت یک راهکار عملی و کارآمد می‌دهد تا شتاب‌دهنده‌های کمیاب و گران‌بها را بدون افت نرخ پر بودن و استفاده از کلاستر، به عادلانه‌ترین شکل ممکن توزیع کنند.

اولویت‌های مجانی؛ ریشه دردسرهای بزرگ

مؤسسه Ai2 هزاران پردازنده گرافیکی را در قالب کلاسترهایی با ظرفیت ۸۸ تا ۱۰۲۴ تراشه مدیریت می‌کند. حدود ۱۵۰ پژوهشگر این مجموعه از این غول‌های سخت‌افزاری برای آموزش مدل‌های زبانی بزرگ، مدل‌های بینایی‌محور، شبیه‌سازی‌های یادگیری تقویتی در رباتیک و پس‌آموزش ایجنت‌ها استفاده می‌کنند؛ حجم تقاضایی که در صف انتظار می‌ماند معمولاً دو تا سه برابر کل ظرفیت موجود است!

سیستم زمان‌بندی قبلی به بار کاری اجازه می‌داد درخواست مصونیت در برابر توقف (Protection from Preemption) ثبت کند و سقف هم‌زمانی در سطح تیم‌ها هم فقط تعداد کل این کار‌های مصون را محدود می‌کرد. اما از آنجا که تعیین اولویت بالا و دریافت مصونیت هیچ هزینه‌ای برای تیم‌ها نداشت، این سیاست به سه بحران عملیاتی دردسرساز ختم شد:

  • اشغال صوری و جا گرفتن روی پردازنده‌ها (GPU squatting): پژوهشگران کار‌های صوری و خالی (No-op) را روی پردازنده‌ها اجرا می‌کردند تا سرور‌ها را اشغال نگه دارند و هر وقت خواستند جلسه دیباگ یا رفع اشکال راه بیندازند، بدون معطلی وصل شوند.
  • تورم برچسب اولویت (Priority inflation): کار به جایی رسید که تقریباً همه درخواست‌ها با برچسب اولویت HIGH ثبت می‌شدند و کار‌هایی که با اولویت‌های پایین‌تر ارسال می‌شدند، عملاً هیچ‌وقت نوبت بهشان نمی‌رسید و در صف خاک می‌خوردند!
  • قفل شدن عملیات نگهداری (Maintenance gridlock): مهندسان زیرساخت برای تعمیر سرور‌های معیوب، زمان زیادی را صرف مذاکره و چانه‌زنی با پژوهشگران می‌کردند تا راضی شوند کار‌های تحت حفاظت خود را موقتاً متوقف کنند.

مؤسسه Ai2 این سازوکار معیوب انگیزشی را نوعی تراژدی منابع مشترک (Tragedy of the Commons) می‌داند. در گزارش این مؤسسه به نمونه مشابهی در مقاله مشهور Dominant Resource Fairness در سال ۲۰۱۱ اشاره شده است؛ جایی که کاربران با قرار دادن حلقه‌های بی‌نهایت در کدهای خود، آمار مصرف را به شکل تصنعی بالا می‌بردند تا سرور‌های اختصاصی را همچنان برای خودشان نگه دارند!

لایه‌ای که دست سیستم زمان‌بند به آن می‌رسد

مؤسسه Ai2 برای ریشه‌یابی عملکرد کلاستر از یک مدل چهار لایه استفاده می‌کند که سیاست‌های زمان‌بندی را از سلامت سخت‌افزار و بازدهی بار کاری جدا می‌کند. در این بازطراحی، تمرکز اصلی روی لایه اثرگذاری (Impact) گذاشته شد:

دسترسی‌پذیری (Availability)اشغال ظرفیت (Occupancy)اثرگذاری (Impact)بهره‌وری عملیاتی (Utilization)
Ai2 pyramid showing availability, occupancy, impact, and utilization
مدل هرمی Ai2 اثرگذاری سیستم زمان‌بندی را از دسترسی‌پذیری ناوگان، نرخ اشغال و بهره‌وری بار کاری تفکیک می‌کند.

بودجه ساعتی پردازنده به جای برچسب‌های اولویت

اختصاص ثابت و همیشگی کارت‌های گرافیک باعث بی‌کار ماندن بخش زیادی از سخت‌افزار می‌شد، چرا که نیازهای پژوهشی معمولاً موجی و ناگهانی شکل می‌گیرند. حالا Ai2 سهم کل زمان استفاده از پردازنده‌ها را از طریق یک ساختار سلسله‌مراتبی شامل برنامه‌ها، پروژه‌ها و پژوهشگران تقسیم می‌کند. این بودجه‌ها نوعی حق بهره‌برداری وزن‌دار به وجود می‌آورند و در عین حال اجازه می‌دهند تیم‌ها بتوانند ظرفیت‌های خالی و دست‌نخورده دیگران را موقتاً قرض بگیرند.

سیستم زمان‌بند برای هر سهمیه، نسبت متحرک هفت‌روزه میان میزان اشغال واقعی و کل زمان اختصاص‌یافته را محاسبه می‌کند. به این ترتیب، کار‌های متعلق به تیم‌هایی که سهمیه خود را مصرف نکرده‌اند، در اولویت بالاتری نسبت به تیم‌هایی قرار می‌گیرند که تمام سهمشان را سوزانده‌اند. همچنین اگر بار کاری تیم هنوز از درخواست‌های رقیب در صف اولویت بالاتری داشته باشد، می‌تواند پس از پایان حداقل زمان درخواستی هم به اجرای خود ادامه دهد.

از آنجا که هر پردازش در حال اجرا از بودجه کل تیم کم می‌کند، اجرای کار‌های صوری و اشغال الکی سرور‌ها عملاً سهمیه زمان پردازش تیم را برای آموزش‌های اصلی در آینده می‌سوزاند! این سامانه حسابرسی دقیق، تمام تصمیمات زمان‌بندی را مستقیماً به سهمیه تیمی که از آن سود می‌برد متصل کرده است.

این الگوریتم ادامه‌دهنده راه سیستم‌های بالغی مثل Hadoop Fair Scheduler در سال ۲۰۰۹، سیستم Fair Scheduler در YARN و قابلیت Fair Tree در ابزار اسلورم (Slurm) است. تیم Ai2 این سلسله‌مراتب را با ساختار سازمانی پژوهشی خود منطبق کرده و به مدیران اجازه می‌دهد به جای تعریف سهمیه‌های خشک و ثابت برای هر فرد، وزن‌ها را در قالب بودجه‌های تیمی مشخص کنند.

۸ ساعت مصونیت؛ بعد از آن نوبت توقف اجباری است!

کار‌های سنگین آموزش مدل کار زمان‌بندی منصفانه را سخت می‌کنند؛ چون فرایندی که یک هفته طول می‌کشد ممکن است صدها پردازنده گرافیکی را برای روز‌ها گروگان بگیرد، حتی در شرایطی که تیم‌های رقیب تشنه منابع باشند. مؤسسه Ai2 این مشکل را با یک قرارداد کاری حل کرده است: هر کار ارسالی باید حداقل زمان اجرا و قابلیت ادامه‌یافتن پس از توقف (Resumable) را مشخص کند، و سقف این مصونیت زمانی حداکثر روی ۸ ساعت تنظیم شده است.

  1. کاربر درخواست منابع، حداقل زمان اجرا و پرچم قابلیت ازسرگیری پردازش را ارسال می‌کند.
  2. سیستم زمان‌بند کار را بر اساس نسبت اشغال واقعی به سهمیه تخصیص‌یافته در بازه زمانی متحرک ارزیابی و رتبه‌بندی می‌کند.
  3. پس از قرار گرفتن روی سرور، پردازش شروع به مصرف زمان مجاز از بودجه سهمیه مربوطه می‌کند.
  4. زمان‌بند تا سقف حداقل زمان اعلام‌شده، کار را در برابر متوقف شدن محافظت می‌کند.
  5. پس از اتمام مهلت مصونیت، تا زمانی که سهمیه این تیم بالا‌تر از رقبا باشد کار می‌تواند ادامه پیدا کند؛ اما اگر رقیبی با اولویت بالا‌تر بیاید، کار متوقف و دوباره راهی صف انتظار می‌شود.
  6. با پایان موفقیت‌آمیز کار، منابع برای پردازش‌های بعدی آزاد می‌شوند.

اگر کاری با مقدار minimum_runtime=0 ثبت شود، وارد دسته پرکننده ظرفیت‌های خالی (Backfill) می‌شود. این دست از کار‌ها هیچ بودجه‌ای از تیم کم نمی‌کنند، از پردازنده‌های بلااستفاده و خالی بهره می‌برند و به محض رسیدن کار‌های اصلی و سهمیه‌دار، بلافاصله متوقف و از سرور خارج می‌شوند.

با اتمام زمان مصونیت، کار‌ها به طور خودکار سرور‌هایی را که در صف تعمیر و سرویس قرار دارند تخلیه می‌کنند و دیگر نیازی نیست مهندسان برای تک‌تک سرور‌ها چانه‌زنی کنند. طبق آمار Ai2، میزان تعمیراتی که نیازمند هماهنگی دستی و انسانی بود تا ۷۴ درصد کاهش یافته است.

اجرای موفق با حفظ نرخ اشغال شگفت‌انگیز ۹۸ درصدی

پیش از پیاده‌سازی نهایی، تیم Ai2 یک شبیه‌ساز ساخت تا بازه نگاه به عقب هفت‌روزه، حداکثر زمان مصونیت و سایر سیاست‌ها را روی داده‌های واقعی گذشته و سناریوهای فرضی آزمایش کند. اجرای آزمایشی و ۳۰ روزه این سیستم در محیط عملیاتی، این دستاوردهای درخشان را رقم زد:

شاخص عملکرد
نتیجه در محیط عملیاتی
تحویل بودجه پردازشی
تیم‌ها ۹۸ درصد از کل ساعت‌های اختصاص‌یافته GPU را دریافت کردند.
پایداری تخصیص سهمیه‌ها
۱۳ سهمیه از ۱۵ سهمیه تیمی حداقل ۹۵ درصد از بودجه تعیین‌شده خود را دریافت کردند؛ کم‌ترین میزان ۹۰ درصد بود.
نرخ اشغال کلاستر
قبل و بعد از تغییر زمان‌بند، روی عدد شگفت‌انگیز ۹۸ درصد ثابت ماند.
استفاده از ظرفیت‌های خالی (Backfill)
۱۸ درصد از کل زمان تحویل‌داده‌شده به این کار‌های بدون سهمیه تعلق گرفت.
معطلی صدک نودم (p90) برای کار‌های دیباگ
از ۲ ساعت به ۳۰ ثانیه سقوط کرد (در حالی که شبیه‌ساز کاهش از ۶ ساعت به ۵ دقیقه را پیش‌بینی کرده بود).

امکان قرض گرفتن ظرفیت‌های استفاده‌نشده به پژوهشگران اجازه داد در کار‌های سنگین و ناگهانی، به طور موقت حتی فراتر از سهمیه خود از منابع استفاده کنند. یکی از محققان این دستاورد را به «۳۰ درصد توان پردازشی اضافه» تشبیه کرده است؛ چرا که ظرفیت‌هایی که قبلاً میان پروژه‌های تیم‌ها خاک می‌خوردند، حالا کاملاً به چرخه کار برگشته‌اند.

کوتاه شدن صف‌ها بدون دردسر هم نبود

تغییر اصطلاحات در ابتدای کار کمی باعث سردرگمی شد؛ چون پژوهشگران حتی بعد از تغییر مفهوم زمان‌بندی، همچنان از واژه‌هایی مثل «اولویت» با معنای قدیمی استفاده می‌کردند. از آنجا که مستندات متنی کافی نبود، تیم زیرساخت جلسات پرسش‌وپاسخ زنده ترتیب داد تا بر اساس تصمیمات واقعی سیستم، نحوه کار را برای همه جا بیندازد.

سقف مصونیت ۸ ساعته برای آن دسته از محققانی که جلسات توسعه تعاملی را به مدت یک هفته باز نگه می‌داشتند و داده‌ها را در حافظه رم ذخیره می‌کردند هم چالش‌برانگیز شد؛ چون توقف اجباری کار، آنها را وادار می‌کرد این محیط را از نو بسازند. حالا Ai2 قصد دارد برای این فرایند، یک کلاستر مجزای مبتنی بر پردازنده مرکزی (CPU) با امکان بازیابی نشست‌ها فراهم کند.

تضمین حداقل زمان اجرا گاهی باعث تکه‌تکه شدن ظرفیت (Fragmentation) می‌شود. کار‌های کوچک و مصون مانع می‌شوند که پردازنده‌های کافی به صورت هم‌زمان برای اجرای یک پردازش سنگین ۵۱۲ کارت گرافیکی آزاد شوند؛ به همین دلیل تیم Ai2 همچنان در حال پایش تاخیرها در جای‌گذاری بزرگ‌ترین بارهای پردازشی است.

الگویی که همه جا جواب می‌دهد

هوشمندانه‌ترین تصمیم Ai2 این بود که دعواها و چانه‌زنی‌های موردی بر سر منابع را به تخصیص شفاف بودجه‌های ساعتی پردازنده تبدیل کرد؛ بودجه‌هایی که پیش از ورود کار‌ها به صف توسط مدیران تعیین می‌شوند. مدیران منابع پردازشی را بر اساس ارزش علمی و بازدهی پژوهش‌ها تقسیم می‌کنند و زمان‌بند هم اجرای دقیق و مرحله‌به‌مرحله این سهمیه‌ها را تضمین می‌کند.

این راهبرد می‌تواند به عنوان لایه‌ای روی اسلورم (Slurm)، کوبرنتیز (Kubernetes) یا هر زمان‌بند اختصاصی دیگری سوار شود؛ چون ورودی‌های اصلی آن یک ساختار سازمانی، بودجه‌های وزن‌دار، سنجش دقیق مصرف و قوانین مشخص برای توقف اجباری فرایندها است. پیاده‌سازی این رویکرد به چند زیرسیستم پشتیبان نیاز دارد:

  • حسابرسی قابل اعتماد: رهگیری دقیق ساعت‌های مصرف GPU بر اساس بار کاری، پژوهشگر، پروژه و تیم در یک بازه زمانی مشخص.
  • مالکیت بودجه: تفویض اختیار به مدیران مشخص برای تعیین و ویرایش سهمیه‌ها.
  • پشتیبانی از توقف اجباری (Preemption): تشویق به ذخیره چک‌پوینت‌ها و تعریف مصونیت محدود برای کار‌هایی که قابلیت ادامه کار دارند.
  • ظرفیت پشتیبان پرکننده (Backfill): ایجاد یک کلاس کاری با امکان خروج آنی از سرور برای بلعیدن ظرفیت‌های خالی کارت‌های گرافیک.
  • ابزار‌های راه‌اندازی و پایش: شبیه‌سازی داده‌های پیشین، شفاف‌سازی تصمیمات اولویت‌بندی و تفکیک مسیر کار‌های تعاملی طولانی‌مدت.

در گزارش فنی و کامل مؤسسه Ai2 می‌توانید جزئیات بیشتری درباره چالش‌های این طراحی و برنامه‌های آینده برای ارتقای بهره‌وری پردازنده‌های گرافیکی بخوانید.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

دسته‌گل‌های جنجالی هوش مصنوعی آنتروپیک؛ کاخ سفید گزارش تخلفات را اجباری کرد!
آخرین اخبار

دسته‌گل‌های جنجالی هوش مصنوعی آنتروپیک؛ کاخ سفید گزارش تخلفات را اجباری کرد!

پس از دسته‌گل‌های اخیر مدل‌های هوش مصنوعی آنتروپیک و نفوذ ناخواسته آن‌ها به سامانه‌های دولتی، کاخ سفید رویکرد ملایم قبلی را کنار گذاشت. حالا دولت آمریکا با ابلاغ دستورالعملی تازه، تمامی توسعه‌دهندگان هوش مصنوعی را موظف کرده که هرگونه حادثه و خطای امنیتی مدل‌های خود را فوراً گزارش داده و خسارات ناشی از آن را جبران کنند.

۴ دقیقه مطالعه
۰
۱۸ مهر
شاهکار ارتش ۲۰۰۰ ایجنتی پرایم اینتلکت؛ بازنویسی پرایم ایجنت با زبان راست و سرعت ۱۳ برابری!
آخرین اخبار

شاهکار ارتش ۲۰۰۰ ایجنتی پرایم اینتلکت؛ بازنویسی پرایم ایجنت با زبان راست و سرعت ۱۳ برابری!

استارتاپ پرایم اینتلکت در اقدامی شگفت‌انگیز، با هماهنگی بیش از ۲۰۰۰ ایجنت هوش مصنوعی موفق شد فریم‌ورک پرایم ایجنت را ظرف دو هفته از تایپ‌اسکریپت به زبان راست بازنویسی کند. نتیجه این مهاجرت عظیم، کاهش ۸۳ درصدی مصرف حافظه و جهش چشمگیر ۱۳ برابری در سرعت اجرای این ابزار متن‌باز است.

۵ دقیقه مطالعه
۰
۱۸ مهر
هوش مصنوعی کلود هر روز صبح صفحه تب جدید کروم را از نو می‌سازد؛ آن‌هم با ۷۵ سنت!
آخرین اخبار

هوش مصنوعی کلود هر روز صبح صفحه تب جدید کروم را از نو می‌سازد؛ آن‌هم با ۷۵ سنت!

پروژه متن‌باز جدیدی به نام ai-newtab با تکیه بر هوش مصنوعی کلود، هر روز صفحه تب جدید کروم را متناسب با علایق و تاریخچه وب‌گردی شما از نو می‌سازد. این ابزار با هزینه روزانه حدود ۰.۷۵ دلار، یک صفحه خانگی شخصی‌سازی‌شده و جذاب آماده می‌کند.

۲ دقیقه مطالعه
۰
۱۸ مهر