پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

چرا ایجنت‌های هوش مصنوعی حریف خرابی زیرساخت‌ها نمی‌شن؟ دردسر بزرگ کارخانه‌های پردازشی

انتشار:۱۴ مهر ۱۴۰۵(۲ ساعت پیش)
۷ دقیقه زمان مطالعه
۰ دیدگاه

با پیچیده‌تر شدن کارخانه‌های هوش مصنوعی، پیدا کردن علت خرابی پردازنده‌ها و سرور‌ها به کابوسی برای مهندسان تبدیل شده است. حالا آمار‌های تازه نشان می‌دهند که بدون شناسایی دقیق ریشه مشکلات، حتی ایجنت‌های خودکار هم نمی‌توانند گرهی باز کنند و فقط اشتباهات را با سرعت ماشینی تکثیر می‌کنند.

چرا ایجنت‌های هوش مصنوعی حریف خرابی زیرساخت‌ها نمی‌شن؟ دردسر بزرگ کارخانه‌های پردازشی

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • بیش‌تر از نیمی از سازمان‌ها نمی‌تونن علت اصلی خرابی بارهای کاری هوش مصنوعی رو پیدا کنن و ساعت‌ها وقت باارزش پردازنده‌های گرافیکی (GPU) به خاطر هشدارهای پراکنده هدر می‌ره.
  • ایجنت‌های هوش مصنوعی تا وقتی تصویر کل سیستم و علت ریشه‌ای خرابی رو نبینن، نه تنها مشکلی رو حل نمی‌کنن، بلکه اشتباهات رو با سرعت سرسام‌آور ماشینی تکثیر می‌کنن.
  • شکاف بزرگی بین مدیران و مهندسان وجود داره؛ مدیران فکر می‌کنن سیستم‌هاشون کاملاً تحت کنترله، اما مهندسان کف میدان هنوز درگیر هشدارهای نامفهوم و غیرقابل پیش‌بینی هستن.

تشخیص خرابی‌ها در زیرساخت‌های هوش مصنوعی کار به‌شدت دشواری است؛ چرا که بروز اشکال در یک بخش از سیستم، معمولاً به شکل خطاها و نشانه‌های گوناگون در بخش‌های دیگر خودش را نشان می‌دهد. برای مثال وقتی سرعت آموزش یک مدل افت می‌کند، داشبورد پردازنده‌های گرافیکی (GPU) تداخل و شلوغی نشان می‌دهد، پایپ‌لاین انتقال داده قفل می‌کند و سیستم ذخیره‌سازی هم‌زمان هشدارهای I/O ارسال می‌کند؛ جالب‌تر اینکه هر هشدار هم راه‌حل متفاوتی را پیشنهاد می‌دهد! در نتیجه تیم‌های زیرساخت می‌مانند و انبوهی از هشدارهای ضد و نقیض، و ساعت‌ها زمان صرف می‌کنند تا ریشه خرابی را پیدا کنند؛ آن هم در شرایطی که ظرفیت گران‌قیمت پردازنده‌ها بی‌استفاده مانده و خاک می‌خورد.

با حرکت سازمان‌ها به سمت ساخت «کارخانه‌های هوش مصنوعی» بزرگ‌تر—محیط‌های عظیمی که از هزاران پردازنده، شبکه‌های پرسرعت، حافظه‌ها و زیرساخت‌های هیبریدی تشکیل شده‌اند—پیدا کردن سرنخ ماجرا حتی پیچیده‌تر هم می‌شود؛ زیرا پایش این سیستم‌ها هنوز به ابزار‌های جزیره‌ای و جداگانه برای هر بخش متکی است. بر اساس نظرسنجی جدید شرکت ویرتانا (Virtana) از مدیران ارشد در آمریکا و بریتانیا، مشخص شده که ۵۹ درصد از شرکت‌های آمریکایی و ۵۳ درصد از شرکت‌های بریتانیایی نمی‌توانند علت ریشه‌ای توقف بارهای کاری هوش مصنوعی را در میان بخش‌های مختلف زیرساخت به‌صورت خودکار شناسایی کنند.

پل اپل‌بی (Paul Appleby)، مدیرعامل شرکت ویرتانا، در این باره می‌گوید: «تنها زمانی که به علت ریشه‌ای برسید، می‌توانید مشکل را برطرف کنید. اگر علت را ندانید، عملاً در تاریکی تیر می‌اندازید تا شاید تصادفی بفهمید چه اتفاقی افتاده و چگونه باید درستش کرد.»

مقیاس بزرگ‌تر، ردگیری خرابی‌ها را سخت‌تر می‌کند

فشار هیئت‌مدیره‌ها باعث شده شرکت‌ها برای نمایش پیشرفت در حوزه هوش مصنوعی، صرفاً به فکر راه‌اندازی سریع زیرساخت‌ها باشند؛ رویکردی که در آن ابتدا سخت‌افزارها مستقر می‌شوند و تازه بعد از آن (شاید هم هرگز!) به سراغ ابزار‌های پایش و سنجش می‌روند. ابزار‌های سنتی مانیتورینگ بر این فرض کار می‌کنند که سیستم‌ها پایدار، محدود و با رفتار قابل‌پیش‌بینی هستند؛ اما در یک کارخانه هوش مصنوعی، برنامه‌ریزها (Schedulers) مدام بار کاری را میان محیط‌های ابری و محلی جابه‌جا می‌کنند و مصرف منابع هم به‌صورت ناگهانی و غیرخطی نوسان می‌کند.

سیستم‌های هشدار سنتی که بر پایه حد آستانه کار می‌کنند، نیازمند یک خط مبنا از عملکرد عادی هستند، در حالی که ۶۶ درصد از شرکت‌های آمریکایی زیرساخت هوش مصنوعی خود را بدون هرگونه خط مبنای عملکردی قابل‌اعتماد اداره می‌کنند. تنها ۳۴ درصد در آمریکا و ۲۶ درصد در بریتانیا عملکرد بار کاری هوش مصنوعی را قابل‌پیش‌بینی توصیف می‌کنند؛ آماری که در سازمان‌های آمریکایی با بیش از ۵۰ هزار کارمند حتی به ۲۵ درصد کاهش می‌یابد. این یعنی دقیقاً همان شرکت‌هایی که بزرگ‌ترین کارخانه‌های پردازشی هوش مصنوعی را می‌چرخانند، کم‌ترین توانایی را در پیش‌بینی رفتار بعدی سیستم‌های خود دارند.

برای مهار هزینه‌های سرسام‌آور سخت‌افزارهای پردازشی، بسیاری از شرکت‌ها سعی می‌کنند هم‌زمان با کارکرد زیر بار سیستم‌ها، بار کاری را میان محیط‌های هیبریدی بازتوزیع کرده یا سیستم‌ها را ادغام کنند تا راندمان افزایش یابد. اما هر کدام از این اقدامات، روابط وابستگی و تداخل منابع را در تمام لایه‌ها تغییر می‌دهد.

اپل‌بی هشدار می‌دهد: «بدون دیده‌پذیری (Observability) در سطح کل سیستم، سازمان‌ها متوجه نمی‌شوند که این تغییرات چه تأثیری بر نتایج، هزینه‌ها یا پایداری سیستم می‌گذارد. آن‌ها پیوسته سیستم‌هایی را دستکاری و بهینه‌سازی می‌کنند که شناخت کاملی از آن‌ها ندارند و با هر تغییر، ریسک تازه‌ای وارد مدار می‌کنند.»

پیدا کردن ریشه مشکل، به مدلی از کل کارخانه هوش مصنوعی نیاز دارد

تحلیل علت ریشه‌ای باید مشخص کند که هشدار دقیقاً از کجای این سیستم توزیع‌شده منشأ گرفته است؛ یعنی در یک کارخانه هوش مصنوعی، باید هم‌زمان لایه‌های پردازنده‌های گرافیکی، پردازنده‌های مرکزی، رم، فضای ذخیره‌سازی، شبکه، سیستم‌های ارکستراسیون و پایپ‌لاین‌های داده رصد شوند.

در بریتانیا، شرکت‌های به‌مراتب بیشتری به تشخیص خودکار هشدارها مجهز هستند تا ریشه‌یابی آن‌ها؛ ۷۵ درصد از شرکت‌ها در مواجهه اولیه با خرابی‌ها به هشدارهای خودکار متکی هستند، اما فقط ۴۷ درصد می‌توانند علت اصلی را در تمامی بخش‌های زیرساخت به‌شکل خودکار پیدا کنند. بقیه سازمان‌ها یا فقط یک بخش محدود را می‌بینند، یا باید سیگنال‌ها را به‌صورت دستی در میان چند ابزار تطبیق دهند، یا اینکه چندین تیم مختلف را ساعت‌ها و روز‌ها درگیر پیدا کردن سرنخ کنند. در آمریکا نیز ۲۵ درصد سازمان‌ها مدیریت بحران را با بررسی دستی در کنسول‌های کاملاً جداگانه آغاز می‌کنند.

اپل‌بی با یک مثال ملموس می‌گوید: «یک گلوگاه در سیستم ذخیره‌سازی باعث افت عملکرد پایپ‌لاین داده می‌شود؛ این افت، فرایند آموزش مدل را متوقف می‌کند و در نهایت به تداخل و اشغال پردازنده‌های گرافیکی منجر می‌شود. ابزار‌های قدیمی مانیتورینگ این روند را در قالب سه رویداد کاملاً مجزا در سه بخش ثبت می‌کنند. از نظر فنی هر سه هشدار درست هستند، اما هیچ‌کدام به شما نمی‌گویند که در واقعیت چه اتفاقی رخ داده است.»

افزودن ابزار‌های مجزا به هر بخش نیز گرهی باز نمی‌کند، زیرا این سه رویداد همچنان بدون ارتباط باقی می‌مانند. کارخانه‌های هوش مصنوعی به یک مدل عملیاتی یکپارچه از کل سیستم اجرای هوش مصنوعی نیاز دارند که داده‌های تله‌متری دقیق را از تمامی حوزه‌ها، از جمله ارکستراسیون و رفتار نرم‌افزار، به‌صورت بلادرنگ تحلیل و همبسته کند. این مدل همچنین باید نقشه‌ای زنده (Topology) از نحوه وابستگی بارهای کاری، سرویس‌ها و زیرساخت‌ها به یکدیگر داشته باشد تا بتواند تداخل پردازنده گرافیکی را به همان گلوگاه ذخیره‌سازی در آغاز ماجرا پیوند بزند. با توجه به اینکه هر جابه‌جایی بار کاری توسط برنامه‌ریز این چیدمان را تغییر می‌دهد، این نقشه نیز باید به‌طور مداوم به‌روزرسانی شود.

مدیران در هر دو کشور، دید یکپارچه روی هوش مصنوعی و زیرساخت را در رتبه اول و ریشه‌یابی خودکار مبتنی بر هوش مصنوعی را در رتبه دوم نیازهای خود قرار داده‌اند. بازار دیده‌پذیری همین حالا هم بازاری چند میلیارد دلاری است، اما صرفاً اضافه کردن ابزار‌های پایش تک‌بعدی نمی‌تواند معمای دید سراسری و ریشه‌یابی حوادث را حل کند.

ایجنت‌های هوش مصنوعی قبل از رفع مشکل، باید علت را بفهمند

کارخانه‌های بزرگ هوش مصنوعی بدون شک به سیستم‌های ترمیم خودکار نیاز خواهند داشت؛ زیرا حجم عملیات و پیچیدگی این محیط‌ها مدت‌هاست از توان هماهنگی دستی انسان فراتر رفته است. با این حال تنها ۲۳ درصد از مهندسان پایداری سیستم (SRE) و متخصصان زیرساخت بریتانیا عملکرد سیستم‌ها را قابل‌پیش‌بینی می‌دانند. اپل‌بی توضیح می‌دهد که سازمان‌ها پیش از واگذاری هرگونه اقدام خودکار به ایجنت‌ها، باید داده‌های تله‌متری و مدل نقشه زنده را مستقر کرده باشند.

او تأکید می‌کند: «بدون این زیربنا، ایجنت‌های هوش مصنوعی دقیقاً به همان نقاط کوری گرفتار می‌شوند که اپراتورهای انسانی با آن دست‌به‌گریبان هستند؛ با این تفاوت که ایجنت‌ها این خطاها را با سرعت سرسام‌آور ماشینی تکثیر و تشدید می‌کنند. ایجنتی که بر اساس داده‌های ناقص عمل کند، بحران‌ها را سریع‌تر حل نمی‌کند، بلکه بحران‌های تازه‌ای می‌آفریند.»

شرکت ویرتانا این رویکرد را از طریق پلتفرم «دیده‌پذیری ایجنت‌محور» (Agentic Observability) خود عملیاتی کرده است؛ سامانه‌ای که یک مدل مشترک از کل لایه‌های اجرای هوش مصنوعی در سرور‌های محلی، محیط‌های مجازی و ابرهای عمومی را حفظ می‌کند. ایجنت‌های خودکار این پلتفرم، مصرف پردازنده‌ها، تقاضای توکن‌ها، رفتار مدل و عملکرد لایه‌های زیرین را به‌صورت زنده به یکدیگر مرتبط کرده و یافته‌های علت ریشه‌ای را با شواهد مستند پشتیبانی می‌کنند.

شفافیت هزینه‌ها و نظارت دقیق هم به همین داده‌ها وابسته‌اند

در هر دو کشور، ۳۱ درصد سازمان‌ها برخورداری از معیارهای شفاف بازگشت سرمایه (ROI) را مهم‌ترین پیش‌شرط خود برای توسعه و مقیاس‌پذیری بیش‌تر هوش مصنوعی می‌دانند.

اپل‌بی خاطرنشان می‌کند: «سازمان‌هایی که توان اندازه‌گیری بهره‌وری پردازنده‌ها، هزینه به ازای هر بار کاری و راندمان زیرساخت را ندارند، نمی‌توانند مدیران را برای سرمایه‌گذاری بیش‌تر قانع کنند. آن‌ها شاید خرج شدن پول را ببینند، اما تسلطی بر مهار و مدیریت آن ندارند.»

نکته قابل‌توجه، تفاوت دیدگاه فاحش میان مدیران ارشد و مهندسانی است که مستقیماً زیرساخت هوش مصنوعی را اداره می‌کنند. در بریتانیا، ۵۹ درصد از مدیران ارشد مدعی هستند که سازمانشان علت اصلی خرابی‌ها را به‌صورت خودکار تشخیص می‌دهد؛ در حالی که تنها ۳۴ درصد از مهندسان زیرساخت و SRE که با هشدارها دست‌وپنجه نرم می‌کنند چنین نظری دارند. مدیران ارشد فناوری که تصمیم‌گیرنده نهایی بودجه‌ها هستند، بیش‌ترین اطمینان کاذب را در این زمینه دارند. این یک چالش بزرگ در حاکمیت سازمانی است؛ زیرا کسانی بودجه‌ها را تصویب می‌کنند که برآوردی غیرواقعی از آمادگی فنی سازمان دارند.

علاوه بر این، سازمان‌های بریتانیایی باید هوش مصنوعی را تحت مقررات سخت‌گیرانه‌ای مانند GDPR و نظارت‌های ویژه حوزه‌های مالی و سلامت توسعه دهند که نیازمند ردگیری دقیق داده‌ها و شفافیت مالی است. با این وجود، ۳۹ درصد از شرکت‌های بریتانیایی هم‌گام با افزایش فشارها برای گسترش کارخانه‌های هوش مصنوعی، بررسی‌های امنیتی و انطباق را به حاشیه رانده‌اند. اپل‌بی باور دارد که موضوع «حاکمیت داده و هوش مصنوعی» (Sovereignty) در خارج از آمریکا پررنگ‌تر خواهد شد، چرا که دولت‌ها و شهروندان خواستار کنترل سرنوشت داده‌های خود هستند.

او می‌گوید: «سیستمی که ثابت می‌کند کارخانه هوش مصنوعی شما درست کار می‌کند، همان سیستمی است که نهادهای قانونی، حسابرسان یا هیئت‌مدیره را قانع می‌سازد. حاکمیت بدون دیده‌پذیری، ادعایی است که هیچ سندی برای اثبات آن وجود ندارد.»

کارخانه‌های هوش مصنوعی سازمانی؛ عقب‌تر از ادعاهای پر زرق‌وبرق

تصور عمومی بر این است که ۲ هزار شرکت برتر جهان با مقیاسی خیره‌کننده در حال استفاده از هوش مصنوعی هستند، اما به گفته اپل‌بی، بخش اعظم این سرمایه‌گذاری‌های عظیم در اختیار غول‌های ارائه‌دهنده خدمات ابری (هایپراسکیلرها) است.

او می‌گوید: «وضعیت فعلی سازمان‌ها بسیار عقب‌تر از رقمی است که سرمایه‌گذاری‌ها نشان می‌دهند. نمونه‌های بسیار کمی در سراسر دنیا وجود دارد که شرکت‌های بزرگ توانسته باشند سرویس‌های هوش مصنوعی را در مقیاس صنعتی پیاده‌سازی کرده و با راندمان بالا اداره کنند.»

او هشدار می‌دهد که اضافه کردن ظرفیت پردازشی پیش از ایجاد دید و تسلط بر سیستم، صرفاً نسخه‌ای بزرگ‌تر و بسیار پرهزینه‌تر از همان مشکلات عملیاتی گذشته را پدید می‌آورد.

اپل‌بی در پایان یادآور می‌شود: «تب داغ طلا در حال حاضر میان غول‌های ارائه‌دهنده خدمات ابری در جریان است؛ اما برای شرکت‌ها و سازمان‌های بزرگ، هنوز این فرصت طلایی وجود دارد که مسیر را از ابتدا درست و هوشمندانه بسازند.»

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

ابزار امنیتی VulnHunter از انحصار کلود آزاد شد: شکار هوشمند باگ‌ها در هر محیط کدنویسی!
آخرین اخبار

ابزار امنیتی VulnHunter از انحصار کلود آزاد شد: شکار هوشمند باگ‌ها در هر محیط کدنویسی!

ابزار امنیتی محبوب VulnHunter که توسط شرکت Capital One توسعه یافته بود، با یک فورک جامعه‌محور تازه از انحصار محیط Claude Code رها شد. این ابزار متن‌باز با رویکرد هکرهای واقعی کدهای پروژه را اسکن می‌کند و حالا توسعه‌دهندگان می‌توانند ایجنت‌ها و اسکیل‌های آن را در هر محیط کدنویسی دلخواهی برای کشف و رفع تضمینی آسیب‌پذیری‌ها به کار بگیرند.

۲ دقیقه مطالعه
۰
۱۴ مهر
متا ابزار Rebalancer را متن‌باز کرد؛ حل روزانه ۴۰ میلیون معمای زیرساختی در دیتاسنترها
آخرین اخبار

متا ابزار Rebalancer را متن‌باز کرد؛ حل روزانه ۴۰ میلیون معمای زیرساختی در دیتاسنترها

متا پس از ۹ سال استفاده داخلی، کتابخانه اختصاصی Rebalancer را به‌صورت متن‌باز در اختیار عموم توسعه‌دهندگان قرار داد. این ابزار قدرتمند روزانه بیش از ۴۰ میلیون مسئله پیچیده تخصیص منابع و چیدمان سخت‌افزار را در زیرساخت‌های عظیم این شرکت حل‌وفصل می‌کند. انتشار این پروژه همراه با ابزار بصری Explorer، مدیریت دیتاسنترها و سرور‌های توزیع‌شده را برای تیم‌های فنی متحول خواهد کرد.

۶ دقیقه مطالعه
۰
۱۴ مهر
کلود آنتروپیک وارد گوگل داکس و شیتس شد؛ ویرایش مستقیم اسناد بدون نیاز به کپی‌پیست!
آخرین اخبار

کلود آنتروپیک وارد گوگل داکس و شیتس شد؛ ویرایش مستقیم اسناد بدون نیاز به کپی‌پیست!

شرکت آنتروپیک نسخه بتای عمومی Claude for Workspace را عرضه کرد تا کاربران بتوانند چت‌بات کلود را مستقیماً داخل گوگل داکس، شیتس و اسلایدز به کار بگیرند. با این قابلیت، بدون نیاز به کپی‌پیست مداوم میان تب‌های مختلف مرورگر، می‌توانید متن‌ها را در لحظه اصلاح کنید، در شیتس فرمول بسازید و اسلایدهای حرفه‌ای طراحی کنید.

۴ دقیقه مطالعه
۰
۱۴ مهر