چرا ایجنتهای هوش مصنوعی حریف خرابی زیرساختها نمیشن؟ دردسر بزرگ کارخانههای پردازشی
با پیچیدهتر شدن کارخانههای هوش مصنوعی، پیدا کردن علت خرابی پردازندهها و سرورها به کابوسی برای مهندسان تبدیل شده است. حالا آمارهای تازه نشان میدهند که بدون شناسایی دقیق ریشه مشکلات، حتی ایجنتهای خودکار هم نمیتوانند گرهی باز کنند و فقط اشتباهات را با سرعت ماشینی تکثیر میکنند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- بیشتر از نیمی از سازمانها نمیتونن علت اصلی خرابی بارهای کاری هوش مصنوعی رو پیدا کنن و ساعتها وقت باارزش پردازندههای گرافیکی (GPU) به خاطر هشدارهای پراکنده هدر میره.
- ایجنتهای هوش مصنوعی تا وقتی تصویر کل سیستم و علت ریشهای خرابی رو نبینن، نه تنها مشکلی رو حل نمیکنن، بلکه اشتباهات رو با سرعت سرسامآور ماشینی تکثیر میکنن.
- شکاف بزرگی بین مدیران و مهندسان وجود داره؛ مدیران فکر میکنن سیستمهاشون کاملاً تحت کنترله، اما مهندسان کف میدان هنوز درگیر هشدارهای نامفهوم و غیرقابل پیشبینی هستن.
تشخیص خرابیها در زیرساختهای هوش مصنوعی کار بهشدت دشواری است؛ چرا که بروز اشکال در یک بخش از سیستم، معمولاً به شکل خطاها و نشانههای گوناگون در بخشهای دیگر خودش را نشان میدهد. برای مثال وقتی سرعت آموزش یک مدل افت میکند، داشبورد پردازندههای گرافیکی (GPU) تداخل و شلوغی نشان میدهد، پایپلاین انتقال داده قفل میکند و سیستم ذخیرهسازی همزمان هشدارهای I/O ارسال میکند؛ جالبتر اینکه هر هشدار هم راهحل متفاوتی را پیشنهاد میدهد! در نتیجه تیمهای زیرساخت میمانند و انبوهی از هشدارهای ضد و نقیض، و ساعتها زمان صرف میکنند تا ریشه خرابی را پیدا کنند؛ آن هم در شرایطی که ظرفیت گرانقیمت پردازندهها بیاستفاده مانده و خاک میخورد.
با حرکت سازمانها به سمت ساخت «کارخانههای هوش مصنوعی» بزرگتر—محیطهای عظیمی که از هزاران پردازنده، شبکههای پرسرعت، حافظهها و زیرساختهای هیبریدی تشکیل شدهاند—پیدا کردن سرنخ ماجرا حتی پیچیدهتر هم میشود؛ زیرا پایش این سیستمها هنوز به ابزارهای جزیرهای و جداگانه برای هر بخش متکی است. بر اساس نظرسنجی جدید شرکت ویرتانا (Virtana) از مدیران ارشد در آمریکا و بریتانیا، مشخص شده که ۵۹ درصد از شرکتهای آمریکایی و ۵۳ درصد از شرکتهای بریتانیایی نمیتوانند علت ریشهای توقف بارهای کاری هوش مصنوعی را در میان بخشهای مختلف زیرساخت بهصورت خودکار شناسایی کنند.
پل اپلبی (Paul Appleby)، مدیرعامل شرکت ویرتانا، در این باره میگوید: «تنها زمانی که به علت ریشهای برسید، میتوانید مشکل را برطرف کنید. اگر علت را ندانید، عملاً در تاریکی تیر میاندازید تا شاید تصادفی بفهمید چه اتفاقی افتاده و چگونه باید درستش کرد.»
مقیاس بزرگتر، ردگیری خرابیها را سختتر میکند
فشار هیئتمدیرهها باعث شده شرکتها برای نمایش پیشرفت در حوزه هوش مصنوعی، صرفاً به فکر راهاندازی سریع زیرساختها باشند؛ رویکردی که در آن ابتدا سختافزارها مستقر میشوند و تازه بعد از آن (شاید هم هرگز!) به سراغ ابزارهای پایش و سنجش میروند. ابزارهای سنتی مانیتورینگ بر این فرض کار میکنند که سیستمها پایدار، محدود و با رفتار قابلپیشبینی هستند؛ اما در یک کارخانه هوش مصنوعی، برنامهریزها (Schedulers) مدام بار کاری را میان محیطهای ابری و محلی جابهجا میکنند و مصرف منابع هم بهصورت ناگهانی و غیرخطی نوسان میکند.
سیستمهای هشدار سنتی که بر پایه حد آستانه کار میکنند، نیازمند یک خط مبنا از عملکرد عادی هستند، در حالی که ۶۶ درصد از شرکتهای آمریکایی زیرساخت هوش مصنوعی خود را بدون هرگونه خط مبنای عملکردی قابلاعتماد اداره میکنند. تنها ۳۴ درصد در آمریکا و ۲۶ درصد در بریتانیا عملکرد بار کاری هوش مصنوعی را قابلپیشبینی توصیف میکنند؛ آماری که در سازمانهای آمریکایی با بیش از ۵۰ هزار کارمند حتی به ۲۵ درصد کاهش مییابد. این یعنی دقیقاً همان شرکتهایی که بزرگترین کارخانههای پردازشی هوش مصنوعی را میچرخانند، کمترین توانایی را در پیشبینی رفتار بعدی سیستمهای خود دارند.
برای مهار هزینههای سرسامآور سختافزارهای پردازشی، بسیاری از شرکتها سعی میکنند همزمان با کارکرد زیر بار سیستمها، بار کاری را میان محیطهای هیبریدی بازتوزیع کرده یا سیستمها را ادغام کنند تا راندمان افزایش یابد. اما هر کدام از این اقدامات، روابط وابستگی و تداخل منابع را در تمام لایهها تغییر میدهد.
اپلبی هشدار میدهد: «بدون دیدهپذیری (Observability) در سطح کل سیستم، سازمانها متوجه نمیشوند که این تغییرات چه تأثیری بر نتایج، هزینهها یا پایداری سیستم میگذارد. آنها پیوسته سیستمهایی را دستکاری و بهینهسازی میکنند که شناخت کاملی از آنها ندارند و با هر تغییر، ریسک تازهای وارد مدار میکنند.»
پیدا کردن ریشه مشکل، به مدلی از کل کارخانه هوش مصنوعی نیاز دارد
تحلیل علت ریشهای باید مشخص کند که هشدار دقیقاً از کجای این سیستم توزیعشده منشأ گرفته است؛ یعنی در یک کارخانه هوش مصنوعی، باید همزمان لایههای پردازندههای گرافیکی، پردازندههای مرکزی، رم، فضای ذخیرهسازی، شبکه، سیستمهای ارکستراسیون و پایپلاینهای داده رصد شوند.
در بریتانیا، شرکتهای بهمراتب بیشتری به تشخیص خودکار هشدارها مجهز هستند تا ریشهیابی آنها؛ ۷۵ درصد از شرکتها در مواجهه اولیه با خرابیها به هشدارهای خودکار متکی هستند، اما فقط ۴۷ درصد میتوانند علت اصلی را در تمامی بخشهای زیرساخت بهشکل خودکار پیدا کنند. بقیه سازمانها یا فقط یک بخش محدود را میبینند، یا باید سیگنالها را بهصورت دستی در میان چند ابزار تطبیق دهند، یا اینکه چندین تیم مختلف را ساعتها و روزها درگیر پیدا کردن سرنخ کنند. در آمریکا نیز ۲۵ درصد سازمانها مدیریت بحران را با بررسی دستی در کنسولهای کاملاً جداگانه آغاز میکنند.
اپلبی با یک مثال ملموس میگوید: «یک گلوگاه در سیستم ذخیرهسازی باعث افت عملکرد پایپلاین داده میشود؛ این افت، فرایند آموزش مدل را متوقف میکند و در نهایت به تداخل و اشغال پردازندههای گرافیکی منجر میشود. ابزارهای قدیمی مانیتورینگ این روند را در قالب سه رویداد کاملاً مجزا در سه بخش ثبت میکنند. از نظر فنی هر سه هشدار درست هستند، اما هیچکدام به شما نمیگویند که در واقعیت چه اتفاقی رخ داده است.»
افزودن ابزارهای مجزا به هر بخش نیز گرهی باز نمیکند، زیرا این سه رویداد همچنان بدون ارتباط باقی میمانند. کارخانههای هوش مصنوعی به یک مدل عملیاتی یکپارچه از کل سیستم اجرای هوش مصنوعی نیاز دارند که دادههای تلهمتری دقیق را از تمامی حوزهها، از جمله ارکستراسیون و رفتار نرمافزار، بهصورت بلادرنگ تحلیل و همبسته کند. این مدل همچنین باید نقشهای زنده (Topology) از نحوه وابستگی بارهای کاری، سرویسها و زیرساختها به یکدیگر داشته باشد تا بتواند تداخل پردازنده گرافیکی را به همان گلوگاه ذخیرهسازی در آغاز ماجرا پیوند بزند. با توجه به اینکه هر جابهجایی بار کاری توسط برنامهریز این چیدمان را تغییر میدهد، این نقشه نیز باید بهطور مداوم بهروزرسانی شود.
مدیران در هر دو کشور، دید یکپارچه روی هوش مصنوعی و زیرساخت را در رتبه اول و ریشهیابی خودکار مبتنی بر هوش مصنوعی را در رتبه دوم نیازهای خود قرار دادهاند. بازار دیدهپذیری همین حالا هم بازاری چند میلیارد دلاری است، اما صرفاً اضافه کردن ابزارهای پایش تکبعدی نمیتواند معمای دید سراسری و ریشهیابی حوادث را حل کند.
ایجنتهای هوش مصنوعی قبل از رفع مشکل، باید علت را بفهمند
کارخانههای بزرگ هوش مصنوعی بدون شک به سیستمهای ترمیم خودکار نیاز خواهند داشت؛ زیرا حجم عملیات و پیچیدگی این محیطها مدتهاست از توان هماهنگی دستی انسان فراتر رفته است. با این حال تنها ۲۳ درصد از مهندسان پایداری سیستم (SRE) و متخصصان زیرساخت بریتانیا عملکرد سیستمها را قابلپیشبینی میدانند. اپلبی توضیح میدهد که سازمانها پیش از واگذاری هرگونه اقدام خودکار به ایجنتها، باید دادههای تلهمتری و مدل نقشه زنده را مستقر کرده باشند.
او تأکید میکند: «بدون این زیربنا، ایجنتهای هوش مصنوعی دقیقاً به همان نقاط کوری گرفتار میشوند که اپراتورهای انسانی با آن دستبهگریبان هستند؛ با این تفاوت که ایجنتها این خطاها را با سرعت سرسامآور ماشینی تکثیر و تشدید میکنند. ایجنتی که بر اساس دادههای ناقص عمل کند، بحرانها را سریعتر حل نمیکند، بلکه بحرانهای تازهای میآفریند.»
شرکت ویرتانا این رویکرد را از طریق پلتفرم «دیدهپذیری ایجنتمحور» (Agentic Observability) خود عملیاتی کرده است؛ سامانهای که یک مدل مشترک از کل لایههای اجرای هوش مصنوعی در سرورهای محلی، محیطهای مجازی و ابرهای عمومی را حفظ میکند. ایجنتهای خودکار این پلتفرم، مصرف پردازندهها، تقاضای توکنها، رفتار مدل و عملکرد لایههای زیرین را بهصورت زنده به یکدیگر مرتبط کرده و یافتههای علت ریشهای را با شواهد مستند پشتیبانی میکنند.
شفافیت هزینهها و نظارت دقیق هم به همین دادهها وابستهاند
در هر دو کشور، ۳۱ درصد سازمانها برخورداری از معیارهای شفاف بازگشت سرمایه (ROI) را مهمترین پیششرط خود برای توسعه و مقیاسپذیری بیشتر هوش مصنوعی میدانند.
اپلبی خاطرنشان میکند: «سازمانهایی که توان اندازهگیری بهرهوری پردازندهها، هزینه به ازای هر بار کاری و راندمان زیرساخت را ندارند، نمیتوانند مدیران را برای سرمایهگذاری بیشتر قانع کنند. آنها شاید خرج شدن پول را ببینند، اما تسلطی بر مهار و مدیریت آن ندارند.»
نکته قابلتوجه، تفاوت دیدگاه فاحش میان مدیران ارشد و مهندسانی است که مستقیماً زیرساخت هوش مصنوعی را اداره میکنند. در بریتانیا، ۵۹ درصد از مدیران ارشد مدعی هستند که سازمانشان علت اصلی خرابیها را بهصورت خودکار تشخیص میدهد؛ در حالی که تنها ۳۴ درصد از مهندسان زیرساخت و SRE که با هشدارها دستوپنجه نرم میکنند چنین نظری دارند. مدیران ارشد فناوری که تصمیمگیرنده نهایی بودجهها هستند، بیشترین اطمینان کاذب را در این زمینه دارند. این یک چالش بزرگ در حاکمیت سازمانی است؛ زیرا کسانی بودجهها را تصویب میکنند که برآوردی غیرواقعی از آمادگی فنی سازمان دارند.
علاوه بر این، سازمانهای بریتانیایی باید هوش مصنوعی را تحت مقررات سختگیرانهای مانند GDPR و نظارتهای ویژه حوزههای مالی و سلامت توسعه دهند که نیازمند ردگیری دقیق دادهها و شفافیت مالی است. با این وجود، ۳۹ درصد از شرکتهای بریتانیایی همگام با افزایش فشارها برای گسترش کارخانههای هوش مصنوعی، بررسیهای امنیتی و انطباق را به حاشیه راندهاند. اپلبی باور دارد که موضوع «حاکمیت داده و هوش مصنوعی» (Sovereignty) در خارج از آمریکا پررنگتر خواهد شد، چرا که دولتها و شهروندان خواستار کنترل سرنوشت دادههای خود هستند.
او میگوید: «سیستمی که ثابت میکند کارخانه هوش مصنوعی شما درست کار میکند، همان سیستمی است که نهادهای قانونی، حسابرسان یا هیئتمدیره را قانع میسازد. حاکمیت بدون دیدهپذیری، ادعایی است که هیچ سندی برای اثبات آن وجود ندارد.»
کارخانههای هوش مصنوعی سازمانی؛ عقبتر از ادعاهای پر زرقوبرق
تصور عمومی بر این است که ۲ هزار شرکت برتر جهان با مقیاسی خیرهکننده در حال استفاده از هوش مصنوعی هستند، اما به گفته اپلبی، بخش اعظم این سرمایهگذاریهای عظیم در اختیار غولهای ارائهدهنده خدمات ابری (هایپراسکیلرها) است.
او میگوید: «وضعیت فعلی سازمانها بسیار عقبتر از رقمی است که سرمایهگذاریها نشان میدهند. نمونههای بسیار کمی در سراسر دنیا وجود دارد که شرکتهای بزرگ توانسته باشند سرویسهای هوش مصنوعی را در مقیاس صنعتی پیادهسازی کرده و با راندمان بالا اداره کنند.»
او هشدار میدهد که اضافه کردن ظرفیت پردازشی پیش از ایجاد دید و تسلط بر سیستم، صرفاً نسخهای بزرگتر و بسیار پرهزینهتر از همان مشکلات عملیاتی گذشته را پدید میآورد.
اپلبی در پایان یادآور میشود: «تب داغ طلا در حال حاضر میان غولهای ارائهدهنده خدمات ابری در جریان است؛ اما برای شرکتها و سازمانهای بزرگ، هنوز این فرصت طلایی وجود دارد که مسیر را از ابتدا درست و هوشمندانه بسازند.»
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

ابزار امنیتی VulnHunter از انحصار کلود آزاد شد: شکار هوشمند باگها در هر محیط کدنویسی!
ابزار امنیتی محبوب VulnHunter که توسط شرکت Capital One توسعه یافته بود، با یک فورک جامعهمحور تازه از انحصار محیط Claude Code رها شد. این ابزار متنباز با رویکرد هکرهای واقعی کدهای پروژه را اسکن میکند و حالا توسعهدهندگان میتوانند ایجنتها و اسکیلهای آن را در هر محیط کدنویسی دلخواهی برای کشف و رفع تضمینی آسیبپذیریها به کار بگیرند.

متا ابزار Rebalancer را متنباز کرد؛ حل روزانه ۴۰ میلیون معمای زیرساختی در دیتاسنترها
متا پس از ۹ سال استفاده داخلی، کتابخانه اختصاصی Rebalancer را بهصورت متنباز در اختیار عموم توسعهدهندگان قرار داد. این ابزار قدرتمند روزانه بیش از ۴۰ میلیون مسئله پیچیده تخصیص منابع و چیدمان سختافزار را در زیرساختهای عظیم این شرکت حلوفصل میکند. انتشار این پروژه همراه با ابزار بصری Explorer، مدیریت دیتاسنترها و سرورهای توزیعشده را برای تیمهای فنی متحول خواهد کرد.

کلود آنتروپیک وارد گوگل داکس و شیتس شد؛ ویرایش مستقیم اسناد بدون نیاز به کپیپیست!
شرکت آنتروپیک نسخه بتای عمومی Claude for Workspace را عرضه کرد تا کاربران بتوانند چتبات کلود را مستقیماً داخل گوگل داکس، شیتس و اسلایدز به کار بگیرند. با این قابلیت، بدون نیاز به کپیپیست مداوم میان تبهای مختلف مرورگر، میتوانید متنها را در لحظه اصلاح کنید، در شیتس فرمول بسازید و اسلایدهای حرفهای طراحی کنید.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.