پایان اشغال بیدلیل کارتهای گرافیک؛ مؤسسه Ai2 زمان معطلی در صف کلاسترهای انویدیا را ۸۷ درصد کاهش داد!
مؤسسه هوش مصنوعی آلن (Ai2) با کنار گذاشتن سیستم سنتی اولویتبندی، سیستم زمانبندی کلاسترهای قدرتمند پردازندههای انویدیا را به طور اساسی بازطراحی کرد. با این سازوکار جدید که مبتنی بر بودجهبندی ساعتی و سهم منصفانه سلسلهمراتبی است، زمان معطلی پژوهشگران در صف کلاستر بزرگ H100 تا ۸۷ درصد کاهش یافته و صفهای طولانی چندساعته به چند ثانیه تبدیل شده است.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- مؤسسه هوش مصنوعی آلن (Ai2) سیستم زمانبندی کلاسترهای مجهز به پردازندههای H100، B200 و B300 انویدیا را از نو طراحی کرد تا جلوی احتکار و اشغال صوری منابع پردازشی توسط پژوهشگران را بگیرد.
- با بهکارگیری بودجههای ساعتی و سهمیه منصفانه، میانه زمان معطلی در صف کلاستر بزرگ H100 از ۵ دقیقه به فقط ۲۴ ثانیه سقوط کرد و انتظار طولانی ۹۰ درصد کارها هم تا یک ساعت کمتر شد.
- ترفند طلایی این سیستم تعریف سقف مصونیت ۸ ساعته برای فرایندهای سنگین و امکان قرض گرفتن موقت ظرفیتهای خالی بود که نرخ اشغال کلی کلاستر را همچنان روی عدد عالی ۹۸ درصد حفظ کرد.
کاهش چشمگیر زمان معطلی در صف پردازندههای گرافیکی با ترفند بودجهبندی زمانی در Ai2
مؤسسه هوش مصنوعی آلن (Ai2) سیستم زمانبندی (Scheduler) کلاسترهای مجهز به پردازندههای گرافیکی انویدیا H100، B200 و B300 خود را از پایه بازطراحی کرد. پیش از این، برچسبهای اولویت بدون هزینه و فرایندهای بیپایانی که در برابر توقف مصون بودند، باعث شده بود پژوهشگران منابع پردازشی گرانقیمت را پیش خودشان احتکار و قرق کنند! معماری جایگزین، ترکیبی هوشمندانه از بودجهبندی ساعتی مصرف پردازنده (GPU-hour)، زمانبندی منصفانه سلسلهمراتبی و مصونیت محدود در برابر توقف زودهنگام پردازش (Preemption) است.
در بزرگترین کلاستر H100 این مؤسسه، میانه (Median) زمان معطلی در صف پردازش از ۵ دقیقه به تنها ۲۴ ثانیه سقوط کرد. همچنین شاخص معطلی صدک نودم (p90 Wait) که بیانگر حداکثر زمان انتظار ۹۰ درصد از درخواستهاست، از ۲.۸ ساعت به ۱.۸ ساعت رسید. این بازطراحی به تیمهای زیرساخت یک راهکار عملی و کارآمد میدهد تا شتابدهندههای کمیاب و گرانبها را بدون افت نرخ پر بودن و استفاده از کلاستر، به عادلانهترین شکل ممکن توزیع کنند.
اولویتهای مجانی؛ ریشه دردسرهای بزرگ
مؤسسه Ai2 هزاران پردازنده گرافیکی را در قالب کلاسترهایی با ظرفیت ۸۸ تا ۱۰۲۴ تراشه مدیریت میکند. حدود ۱۵۰ پژوهشگر این مجموعه از این غولهای سختافزاری برای آموزش مدلهای زبانی بزرگ، مدلهای بیناییمحور، شبیهسازیهای یادگیری تقویتی در رباتیک و پسآموزش ایجنتها استفاده میکنند؛ حجم تقاضایی که در صف انتظار میماند معمولاً دو تا سه برابر کل ظرفیت موجود است!
سیستم زمانبندی قبلی به بار کاری اجازه میداد درخواست مصونیت در برابر توقف (Protection from Preemption) ثبت کند و سقف همزمانی در سطح تیمها هم فقط تعداد کل این کارهای مصون را محدود میکرد. اما از آنجا که تعیین اولویت بالا و دریافت مصونیت هیچ هزینهای برای تیمها نداشت، این سیاست به سه بحران عملیاتی دردسرساز ختم شد:
- اشغال صوری و جا گرفتن روی پردازندهها (GPU squatting): پژوهشگران کارهای صوری و خالی (No-op) را روی پردازندهها اجرا میکردند تا سرورها را اشغال نگه دارند و هر وقت خواستند جلسه دیباگ یا رفع اشکال راه بیندازند، بدون معطلی وصل شوند.
- تورم برچسب اولویت (Priority inflation): کار به جایی رسید که تقریباً همه درخواستها با برچسب اولویت
HIGHثبت میشدند و کارهایی که با اولویتهای پایینتر ارسال میشدند، عملاً هیچوقت نوبت بهشان نمیرسید و در صف خاک میخوردند! - قفل شدن عملیات نگهداری (Maintenance gridlock): مهندسان زیرساخت برای تعمیر سرورهای معیوب، زمان زیادی را صرف مذاکره و چانهزنی با پژوهشگران میکردند تا راضی شوند کارهای تحت حفاظت خود را موقتاً متوقف کنند.
مؤسسه Ai2 این سازوکار معیوب انگیزشی را نوعی تراژدی منابع مشترک (Tragedy of the Commons) میداند. در گزارش این مؤسسه به نمونه مشابهی در مقاله مشهور Dominant Resource Fairness در سال ۲۰۱۱ اشاره شده است؛ جایی که کاربران با قرار دادن حلقههای بینهایت در کدهای خود، آمار مصرف را به شکل تصنعی بالا میبردند تا سرورهای اختصاصی را همچنان برای خودشان نگه دارند!
لایهای که دست سیستم زمانبند به آن میرسد
مؤسسه Ai2 برای ریشهیابی عملکرد کلاستر از یک مدل چهار لایه استفاده میکند که سیاستهای زمانبندی را از سلامت سختافزار و بازدهی بار کاری جدا میکند. در این بازطراحی، تمرکز اصلی روی لایه اثرگذاری (Impact) گذاشته شد:
دسترسیپذیری (Availability)اشغال ظرفیت (Occupancy)اثرگذاری (Impact)بهرهوری عملیاتی (Utilization)
بودجه ساعتی پردازنده به جای برچسبهای اولویت
اختصاص ثابت و همیشگی کارتهای گرافیک باعث بیکار ماندن بخش زیادی از سختافزار میشد، چرا که نیازهای پژوهشی معمولاً موجی و ناگهانی شکل میگیرند. حالا Ai2 سهم کل زمان استفاده از پردازندهها را از طریق یک ساختار سلسلهمراتبی شامل برنامهها، پروژهها و پژوهشگران تقسیم میکند. این بودجهها نوعی حق بهرهبرداری وزندار به وجود میآورند و در عین حال اجازه میدهند تیمها بتوانند ظرفیتهای خالی و دستنخورده دیگران را موقتاً قرض بگیرند.
سیستم زمانبند برای هر سهمیه، نسبت متحرک هفتروزه میان میزان اشغال واقعی و کل زمان اختصاصیافته را محاسبه میکند. به این ترتیب، کارهای متعلق به تیمهایی که سهمیه خود را مصرف نکردهاند، در اولویت بالاتری نسبت به تیمهایی قرار میگیرند که تمام سهمشان را سوزاندهاند. همچنین اگر بار کاری تیم هنوز از درخواستهای رقیب در صف اولویت بالاتری داشته باشد، میتواند پس از پایان حداقل زمان درخواستی هم به اجرای خود ادامه دهد.
از آنجا که هر پردازش در حال اجرا از بودجه کل تیم کم میکند، اجرای کارهای صوری و اشغال الکی سرورها عملاً سهمیه زمان پردازش تیم را برای آموزشهای اصلی در آینده میسوزاند! این سامانه حسابرسی دقیق، تمام تصمیمات زمانبندی را مستقیماً به سهمیه تیمی که از آن سود میبرد متصل کرده است.
این الگوریتم ادامهدهنده راه سیستمهای بالغی مثل Hadoop Fair Scheduler در سال ۲۰۰۹، سیستم Fair Scheduler در YARN و قابلیت Fair Tree در ابزار اسلورم (Slurm) است. تیم Ai2 این سلسلهمراتب را با ساختار سازمانی پژوهشی خود منطبق کرده و به مدیران اجازه میدهد به جای تعریف سهمیههای خشک و ثابت برای هر فرد، وزنها را در قالب بودجههای تیمی مشخص کنند.
۸ ساعت مصونیت؛ بعد از آن نوبت توقف اجباری است!
کارهای سنگین آموزش مدل کار زمانبندی منصفانه را سخت میکنند؛ چون فرایندی که یک هفته طول میکشد ممکن است صدها پردازنده گرافیکی را برای روزها گروگان بگیرد، حتی در شرایطی که تیمهای رقیب تشنه منابع باشند. مؤسسه Ai2 این مشکل را با یک قرارداد کاری حل کرده است: هر کار ارسالی باید حداقل زمان اجرا و قابلیت ادامهیافتن پس از توقف (Resumable) را مشخص کند، و سقف این مصونیت زمانی حداکثر روی ۸ ساعت تنظیم شده است.
- کاربر درخواست منابع، حداقل زمان اجرا و پرچم قابلیت ازسرگیری پردازش را ارسال میکند.
- سیستم زمانبند کار را بر اساس نسبت اشغال واقعی به سهمیه تخصیصیافته در بازه زمانی متحرک ارزیابی و رتبهبندی میکند.
- پس از قرار گرفتن روی سرور، پردازش شروع به مصرف زمان مجاز از بودجه سهمیه مربوطه میکند.
- زمانبند تا سقف حداقل زمان اعلامشده، کار را در برابر متوقف شدن محافظت میکند.
- پس از اتمام مهلت مصونیت، تا زمانی که سهمیه این تیم بالاتر از رقبا باشد کار میتواند ادامه پیدا کند؛ اما اگر رقیبی با اولویت بالاتر بیاید، کار متوقف و دوباره راهی صف انتظار میشود.
- با پایان موفقیتآمیز کار، منابع برای پردازشهای بعدی آزاد میشوند.
اگر کاری با مقدار minimum_runtime=0 ثبت شود، وارد دسته پرکننده ظرفیتهای خالی (Backfill) میشود. این دست از کارها هیچ بودجهای از تیم کم نمیکنند، از پردازندههای بلااستفاده و خالی بهره میبرند و به محض رسیدن کارهای اصلی و سهمیهدار، بلافاصله متوقف و از سرور خارج میشوند.
با اتمام زمان مصونیت، کارها به طور خودکار سرورهایی را که در صف تعمیر و سرویس قرار دارند تخلیه میکنند و دیگر نیازی نیست مهندسان برای تکتک سرورها چانهزنی کنند. طبق آمار Ai2، میزان تعمیراتی که نیازمند هماهنگی دستی و انسانی بود تا ۷۴ درصد کاهش یافته است.
اجرای موفق با حفظ نرخ اشغال شگفتانگیز ۹۸ درصدی
پیش از پیادهسازی نهایی، تیم Ai2 یک شبیهساز ساخت تا بازه نگاه به عقب هفتروزه، حداکثر زمان مصونیت و سایر سیاستها را روی دادههای واقعی گذشته و سناریوهای فرضی آزمایش کند. اجرای آزمایشی و ۳۰ روزه این سیستم در محیط عملیاتی، این دستاوردهای درخشان را رقم زد:
شاخص عملکرد | نتیجه در محیط عملیاتی |
|---|---|
تحویل بودجه پردازشی | تیمها ۹۸ درصد از کل ساعتهای اختصاصیافته GPU را دریافت کردند. |
پایداری تخصیص سهمیهها | ۱۳ سهمیه از ۱۵ سهمیه تیمی حداقل ۹۵ درصد از بودجه تعیینشده خود را دریافت کردند؛ کمترین میزان ۹۰ درصد بود. |
نرخ اشغال کلاستر | قبل و بعد از تغییر زمانبند، روی عدد شگفتانگیز ۹۸ درصد ثابت ماند. |
استفاده از ظرفیتهای خالی (Backfill) | ۱۸ درصد از کل زمان تحویلدادهشده به این کارهای بدون سهمیه تعلق گرفت. |
معطلی صدک نودم (p90) برای کارهای دیباگ | از ۲ ساعت به ۳۰ ثانیه سقوط کرد (در حالی که شبیهساز کاهش از ۶ ساعت به ۵ دقیقه را پیشبینی کرده بود). |
امکان قرض گرفتن ظرفیتهای استفادهنشده به پژوهشگران اجازه داد در کارهای سنگین و ناگهانی، به طور موقت حتی فراتر از سهمیه خود از منابع استفاده کنند. یکی از محققان این دستاورد را به «۳۰ درصد توان پردازشی اضافه» تشبیه کرده است؛ چرا که ظرفیتهایی که قبلاً میان پروژههای تیمها خاک میخوردند، حالا کاملاً به چرخه کار برگشتهاند.
کوتاه شدن صفها بدون دردسر هم نبود
تغییر اصطلاحات در ابتدای کار کمی باعث سردرگمی شد؛ چون پژوهشگران حتی بعد از تغییر مفهوم زمانبندی، همچنان از واژههایی مثل «اولویت» با معنای قدیمی استفاده میکردند. از آنجا که مستندات متنی کافی نبود، تیم زیرساخت جلسات پرسشوپاسخ زنده ترتیب داد تا بر اساس تصمیمات واقعی سیستم، نحوه کار را برای همه جا بیندازد.
سقف مصونیت ۸ ساعته برای آن دسته از محققانی که جلسات توسعه تعاملی را به مدت یک هفته باز نگه میداشتند و دادهها را در حافظه رم ذخیره میکردند هم چالشبرانگیز شد؛ چون توقف اجباری کار، آنها را وادار میکرد این محیط را از نو بسازند. حالا Ai2 قصد دارد برای این فرایند، یک کلاستر مجزای مبتنی بر پردازنده مرکزی (CPU) با امکان بازیابی نشستها فراهم کند.
تضمین حداقل زمان اجرا گاهی باعث تکهتکه شدن ظرفیت (Fragmentation) میشود. کارهای کوچک و مصون مانع میشوند که پردازندههای کافی به صورت همزمان برای اجرای یک پردازش سنگین ۵۱۲ کارت گرافیکی آزاد شوند؛ به همین دلیل تیم Ai2 همچنان در حال پایش تاخیرها در جایگذاری بزرگترین بارهای پردازشی است.
الگویی که همه جا جواب میدهد
هوشمندانهترین تصمیم Ai2 این بود که دعواها و چانهزنیهای موردی بر سر منابع را به تخصیص شفاف بودجههای ساعتی پردازنده تبدیل کرد؛ بودجههایی که پیش از ورود کارها به صف توسط مدیران تعیین میشوند. مدیران منابع پردازشی را بر اساس ارزش علمی و بازدهی پژوهشها تقسیم میکنند و زمانبند هم اجرای دقیق و مرحلهبهمرحله این سهمیهها را تضمین میکند.
این راهبرد میتواند به عنوان لایهای روی اسلورم (Slurm)، کوبرنتیز (Kubernetes) یا هر زمانبند اختصاصی دیگری سوار شود؛ چون ورودیهای اصلی آن یک ساختار سازمانی، بودجههای وزندار، سنجش دقیق مصرف و قوانین مشخص برای توقف اجباری فرایندها است. پیادهسازی این رویکرد به چند زیرسیستم پشتیبان نیاز دارد:
- حسابرسی قابل اعتماد: رهگیری دقیق ساعتهای مصرف GPU بر اساس بار کاری، پژوهشگر، پروژه و تیم در یک بازه زمانی مشخص.
- مالکیت بودجه: تفویض اختیار به مدیران مشخص برای تعیین و ویرایش سهمیهها.
- پشتیبانی از توقف اجباری (Preemption): تشویق به ذخیره چکپوینتها و تعریف مصونیت محدود برای کارهایی که قابلیت ادامه کار دارند.
- ظرفیت پشتیبان پرکننده (Backfill): ایجاد یک کلاس کاری با امکان خروج آنی از سرور برای بلعیدن ظرفیتهای خالی کارتهای گرافیک.
- ابزارهای راهاندازی و پایش: شبیهسازی دادههای پیشین، شفافسازی تصمیمات اولویتبندی و تفکیک مسیر کارهای تعاملی طولانیمدت.
در گزارش فنی و کامل مؤسسه Ai2 میتوانید جزئیات بیشتری درباره چالشهای این طراحی و برنامههای آینده برای ارتقای بهرهوری پردازندههای گرافیکی بخوانید.
مطالب مرتبط و پیشنهادی

دستهگلهای جنجالی هوش مصنوعی آنتروپیک؛ کاخ سفید گزارش تخلفات را اجباری کرد!
پس از دستهگلهای اخیر مدلهای هوش مصنوعی آنتروپیک و نفوذ ناخواسته آنها به سامانههای دولتی، کاخ سفید رویکرد ملایم قبلی را کنار گذاشت. حالا دولت آمریکا با ابلاغ دستورالعملی تازه، تمامی توسعهدهندگان هوش مصنوعی را موظف کرده که هرگونه حادثه و خطای امنیتی مدلهای خود را فوراً گزارش داده و خسارات ناشی از آن را جبران کنند.

شاهکار ارتش ۲۰۰۰ ایجنتی پرایم اینتلکت؛ بازنویسی پرایم ایجنت با زبان راست و سرعت ۱۳ برابری!
استارتاپ پرایم اینتلکت در اقدامی شگفتانگیز، با هماهنگی بیش از ۲۰۰۰ ایجنت هوش مصنوعی موفق شد فریمورک پرایم ایجنت را ظرف دو هفته از تایپاسکریپت به زبان راست بازنویسی کند. نتیجه این مهاجرت عظیم، کاهش ۸۳ درصدی مصرف حافظه و جهش چشمگیر ۱۳ برابری در سرعت اجرای این ابزار متنباز است.

هوش مصنوعی کلود هر روز صبح صفحه تب جدید کروم را از نو میسازد؛ آنهم با ۷۵ سنت!
پروژه متنباز جدیدی به نام ai-newtab با تکیه بر هوش مصنوعی کلود، هر روز صفحه تب جدید کروم را متناسب با علایق و تاریخچه وبگردی شما از نو میسازد. این ابزار با هزینه روزانه حدود ۰.۷۵ دلار، یک صفحه خانگی شخصیسازیشده و جذاب آماده میکند.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.