پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

آموزش بی‌نقص تیم‌های هوش مصنوعی؛ فریم‌ورک PROWL-2 خطاهای شبیه‌ساز را خودش حین تمرین تعمیر می‌کند!

انتشار:۱۰ مهر ۱۴۰۵(۱ ساعت پیش)
۵ دقیقه زمان مطالعه
۰ دیدگاه

استارتاپ Odyssey با معرفی فریم‌ورک نوآورانه PROWL-2، یکی از بزرگ‌ترین چالش‌های آموزش چندایجنت در محیط‌های شبیه‌سازی‌شده را حل کرده است. این فریم‌ورک با تفکیک مسیر آموزش ایجنت‌ها و مدل جهان، خطاهای شبیه‌ساز را در لحظه شناسایی و اصلاح می‌کند تا هوش مصنوعی بر اساس توهمات محیطی آموزش نبیند. دستاوردی چشمگیر که جهشی خیره‌کننده در بازی‌های استراتژیک پیچیده و هدایت ربات‌های فیزیکی رقم زده است.

آموزش بی‌نقص تیم‌های هوش مصنوعی؛ فریم‌ورک PROWL-2 خطاهای شبیه‌ساز را خودش حین تمرین تعمیر می‌کند!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • استارتاپ اودیسه (Odyssey) از فریم‌ورک جدید PROWL-2 رونمایی کرده؛ سیستمی بر پایه یادگیری تقویتی که موقع آموزش کار تیمی ایجنت‌ها، خطاهای مدل جهان و شبیه‌سازش رو خودش شناسایی و تعمیر می‌کنه.
  • نتایج این سیستم فوق‌العاده بوده؛ تو نبردهای شبیه‌سازی‌شده استارکرفت ۲ عملکرد ایجنت‌ها تا ۹۱ درصد رشد داشته و تو کنترل ربات‌های چهارپا هم نرخ موفقیت از حدود ۳۰ درصد به بالای ۷۰ درصد رسیده.
  • برخلاف روش‌های سنتی که توهمات شبیه‌ساز کل آموزش رو به باد می‌داد، PROWL-2 یه دروازه ارزیابی داره که وضعیت‌های پرخطا رو نگه می‌داره تا مدل اول تعمیر بشه و بعد آموزش ادامه پیدا کنه.

تعمیر مدل‌های جهان هم‌گام با آموزش ایجنت‌ها در PROWL-2

استارتاپ اودیسه (Odyssey) به‌تازگی از PROWL-2 رونمایی کرده است؛ یک فریم‌ورک یادگیری تقویتی مدرن که حین آموزش هماهنگ تیمی از ایجنت‌ها، خطاهای مدل جهان (World Model) را که وظیفه شبیه‌سازی تجربه آن‌ها را بر عهده دارد، شناسایی و تعمیر می‌کند. در این چارچوب، برنامه آموزشی خط‌مشی‌ها (Policy Curriculum) سناریوهایی را در اولویت می‌گذارد که ایجنت‌ها هنوز جا برای پیشرفت دارند، در حالی که یک خط‌مشی اکتشافی جداگانه در محیط واقعی می‌گردد تا وضعیت‌هایی را پیدا کند که مدل جهان در پیش‌بینی آن‌ها لنگ می‌زند.

بر اساس مقاله پژوهشی منتشرشده، این متدولوژی جدید در مقایسه با مدل پایه یادگیرنده جهان، در ۹ سناریوی مختلف چالش چندایجنت بازی StarCraft v2 عملکرد خیره‌کننده‌ای ثبت کرده و جهش نسبی آن به ۹۱ درصد رسیده است. در بنچمارک‌های هدایت رباتیک چندگانه نیز نرخ موفقیت آزمون Gate-3 از ۲۹.۸ درصد به ۷۰.۴ درصد جهش یافته و سناریوی فوق‌العاده دشوار Shepherd-Hard هم از ۷.۳ درصد به ۲۸.۲ درصد ارتقا پیدا کرده است.

یادگیری تقویتی مبتنی بر مدل (Model-based RL) از یک شبیه‌ساز هوشمند یا همان «مدل جهان» استفاده می‌کند تا تخمین بزند محیط به اقدامات ایجنت‌ها چه واکنشی نشان خواهد داد. به این ترتیب، استراتژی‌ها می‌توانند در این دنیاهای ذهنی شبیه‌سازی‌شده (که به آن‌ها رول‌اوت‌های تصوری یا Imagined Rollouts می‌گویند) بدون نیاز به تعامل دائمی با محیط پرهزینه واقعی، به تمرین و مهارت‌افزایی بپردازند.

با این حال، یک مشکل بزرگ وجود دارد: خطاهای پیش‌بینی شبیه‌ساز می‌توانند کل فرآیند آموزش را به بیراهه بکشانند. در این شرایط، ممکن است ایجنت یاد بگیرد از باگ‌ها و شکاف‌های مدل شبیه‌ساز سوءاستفاده کند؛ رفتاری که در داخل مدل شبیه‌ساز جواب می‌دهد اما وقتی به دنیای واقعی بازگردانده می‌شود، با شکست سنگین روبه‌رو خواهد شد. علاوه بر این، در سناریوهای طولانی‌تر، خطاهای کوچک به‌سرعت بزرگ‌تر می‌شوند؛ چرا که هر پیش‌بینی نادرست، خوراک و ورودی مرحله بعدی می‌شود.

سیستم‌های چندایجنت یک چالش سردردآور دیگر هم اضافه می‌کنند: «انحراف جمعی». از آن‌جا که حرکت هر ایجنت روی تجربه و شرایط سایر هم‌تیمی‌هایش تأثیر می‌گذارد، با پیشرفت تیم، مدل جهان باید تعاملات پیچیده و مداوم میان چند ایجنت را به‌طور هم‌زمان ردیابی کند. کافی است مدل جهان درباره حرکت تنها یکی از ایجنت‌ها اشتباه کند تا مسیر شبیه‌سازی‌شده کل گروه به‌کلی دگرگون شود!

یک چرخه و سه ابزار کنترلی کلیدی

فریم‌ورک PROWL-2 رویکرد «طراحی بدون نظارت محیط» (UED) را گسترش می‌دهد؛ رویکردی که سناریوهای آموزشی را بر اساس ارزش و پتانسیلی که برای یادگیری دارند، گلچین یا خلق می‌کند. نقطه شروع هر شبیه‌سازی ذهنی، یک «وضعیت آغازین» یا همان پیکربندی ذخیره‌شده محیطی است. این فریم‌ورک این وضعیت‌ها را از طریق ۳ سازوکار زیر مدیریت و هماهنگ می‌کند:

نمودار سازوکار برنامه آموزشی خط‌مشی، برنامه آموزشی مدل جهان و دروازه ارزیابی در فریم‌ورک PROWL-2
فریم‌ورک PROWL-2 برنامه‌های آموزشی مجزای خط‌مشی و مدل جهان را از طریق یک دروازه ارزیابی وفاداری به هم پیوند می‌دهد.
  1. برنامه آموزشی خط‌مشی وظایف (Task-policy curriculum): ایجنت‌های خط‌مشی در شبیه‌سازی‌های ذهنی تمرین می‌کنند که از وضعیت‌های آغازین دارای بیش‌ترین پتانسیل یادگیری شروع می‌شوند. هم‌زمان با رشد مهارت ایجنت‌ها، این برنامه وضعیت‌های دشوارتر و چالش‌برانگیزتری را جلوی پای آن‌ها قرار می‌دهد.
  2. برنامه آموزشی مدل جهان (World-model curriculum): یک ایجنت جداگانه به عنوان «توسعه‌دهنده»، در محیط واقعی کاوش می‌کند تا مسیرهایی را بیابد که مدل فعلی در پیش‌بینی آن‌ها ضعف دارد. این شکست‌ها به داده‌های فاین‌تیونینگ مدل تبدیل می‌شوند؛ ایده‌ای که رویکرد معرفی‌شده در PROWL-1 را توسعه می‌دهد.
  3. دروازه ارزیابی وفاداری (Fidelity gate): سیستم اقدامات ثبت‌شده از وضعیت‌های آغازین مهم را در مدل جهان بازپخش می‌کند و سپس هر مسیر فرضی را با نمونه واقعی متناظرش تطبیق می‌دهد. اگر خطای پیش‌بینی از حد مجاز عبور کند، آن سناریو بلافاصله از چرخه آموزش خط‌مشی خارج شده و وارد صف تعمیر مدل می‌شود.

تنها زمانی سناریوها دوباره به چرخه آموزش ایجنت‌ها برمی‌گردند که مدل تعمیرشده بتواند مسیرهای واقعی را با دقت کافی پیش‌بینی کند. با این شیوه، خطاهای شناخته‌شده شبیه‌ساز به نمونه‌هایی برای تعمیر و بازآموزی تبدیل می‌شوند و تا زمانی که اعتبارسنجی آن‌ها تأیید نشود، اجازه ندارند آموزش خط‌مشی ایجنت‌ها را آلوده کنند.

هرچه هماهنگی سخت‌تر باشد، فاصله عملکرد چشمگیرتر می‌شود

بنچمارک StarCraft Multi-Agent Challenge v2 نبردها را به‌صورت رویه‌ای (Procedural) تولید می‌کند؛ یعنی ایجنت‌ها نمی‌توانند سناریوها را حفظ کنند. این آزمون شامل مبارزات متقارن ۵ به ۵ و ۱۰ به ۱۰ و حتی نبردهای نامتقارن ۱۰ به ۱۱ است که در آن‌ها تیم آموزش‌دیده در اقلیت عددی قرار دارد. تصویرسازی‌های روند بازی در مقاله نشان می‌دهد که ایجنت‌های PROWL-2 به‌خوبی آتش خود را متمرکز می‌کنند، صفوف دفاعی را فشرده نگه می‌دارند و از تاکتیک‌های فریبنده بهره می‌برند؛ در حالی که تیم‌های مدل پایه معمولاً انسجام خود را از دست داده و حملات متفرق و بی‌اثری پیاده می‌کنند.

سناریو
PROWL-2
مدل پایه (Baseline)
Terran 5v5
۸۷.۵٪
۷.۵٪
Terran 10v11
۵۵٪
۲.۵٪
Protoss 10v11
۳۵٪
۰٪
Zerg 10v10
۹۰٪
۰٪

در این جامعه آماری ۴۰ اجرایی، هر پیروزی معادل ۲.۵ درصد است، بنابراین ارقام گزارش‌شده تخمین‌های حاصل از یک جامعه آماری مشخص هستند. جدول بالا ۴ سناریو از مجموع ۹ سناریوی استارکرفت ارائه‌شده در این مقاله پژوهشی را نشان می‌دهد.

در سوی دیگر، محیط روباتیک چندایجنت چهارپا (Multi-Agent Quadruped) کنترل پیوسته و هماهنگی فیزیکی ماشین‌ها را به چالش می‌کشد. در ۶۰۰ هزار گام آموزشی در تست Gate-3، مدل پایه حتی در حل یکی از ۲۰ سناریوی ارزیابی موفق نشد، در حالی که PROWL-2 بیش از ۲۰ درصد سناریوها را حل کرد. با رسیدن به ۱.۵ میلیون گام آموزشی، نمودار یادگیری آن‌ها به‌ترتیب به حدود ۲۵ درصد و ۷۰ درصد رسید.

ماموریت
PROWL-2
مدل پایه (Baseline)
Gate-3
۷۰.۴٪
۲۹.۸٪
Shepherd-Hard
۲۸.۲٪
۷.۳٪

حضور داده‌های واقعی همچنان نقشی حیاتی دارد

دروازه ارزیابی وفاداری برای کشف و رفع خطاهای شبیه‌ساز کاملاً به مسیرهای ثبت‌شده در دنیای واقعی وابسته است. به بیان دیگر، اگرچه PROWL-2 تعاملات لازم برای آموزش خط‌مشی ایجنت‌ها را به‌شدت کاهش می‌دهد، اما هزینه‌های جمع‌آوری داده‌ها، ذخیره‌سازی مسیرها، اعتبارسنجی و فاین‌تیونینگ دوره‌ای مدل شبیه‌ساز همچنان پابرجا خواهند بود.

آزمایش‌های گزارش‌شده در این پژوهش روی بازی‌ها و بنچمارک‌های کنترل پیوسته با وضعیت‌ها، اقدامات و معیارهای موفقیت مشخص انجام شده است. استقرار فیزیکی در دنیای واقعی چالش‌هایی نظیر نویز سنسورها، عدم مشاهده‌پذیری کامل محیط، تنوع سخت‌افزاری و محدودیت‌های ایمنی را به همراه دارد. به همین دلیل پیش از پیاده‌سازی این دستاوردها روی ربات‌های فیزیکی یا سیستم‌های ازدحامی (Swarm Systems)، اعتبارسنجی‌های مستقلی نیاز خواهد بود.

ادغام سیستم بر چهار پایه اصلی استوار است

شرکت اودیسه تأکید دارد که این فریم‌ورک با انواع الگوریتم‌های یادگیری خط‌مشی و معماری‌های مدل جهان سازگاری دارد. با این حال، استفاده عملی از آن بستگی به این دارد که آیا سیستم موجود می‌تواند داده‌ها و کنترل‌های مورد نیاز این برنامه آموزشی دوگانه را تأمین کند یا خیر. پیاده‌سازی این رویکرد به ۴ مؤلفه نیازمند است:

  • مسیرهای ثبت‌شده: داده‌های واقعی از وضعیت‌ها، کنش‌ها و پیامدها برای بازپخش و مقایسه با شبیه‌ساز.
  • سنجه ناهمخوانی (Discrepancy Metric): معیاری دقیق برای اندازه‌گیری میزان خطای رول‌اوت‌های ذهنی و تعیین آستانه وفاداری مدل.
  • زمان‌بند برنامه آموزشی (Curriculum Scheduler): سیستمی برای تعلیق، بازتعریف اولویت و بازگرداندن وضعیت‌های آغازین.
  • بودجه بازآموزی: منابع پردازشی کافی برای به‌روزرسانی‌های هدفمند مدل جهان و اعتبارسنجی مکرر آن.

فریم‌ورک PROWL-2 در واقع مانند یک لایه هماهنگ‌کننده روی مدل‌های یادگیرنده موجود سوار می‌شود و کاوش محیطی، آموزش خط‌مشی، تشخیص خطا و تعمیر شبیه‌ساز را مدیریت می‌کند. تیم‌هایی که قصد بهره‌گیری از آن را دارند باید بررسی کنند که آیا توان پردازشی مازاد و هزینه تعامل با محیط واقعی، با صرفه‌جویی حاصل از تمرین در شبیه‌ساز ذهنی همخوانی دارد یا خیر.

از حلقه آموزش تا لایه محصول تجاری

تیم اودیسه شبیه‌سازهای مبتنی بر یادگیری خود را «ماشین‌های تجربه» (Experience Machines) می‌نامد؛ محیط‌هایی که ایجنت‌ها می‌توانند تجربیات آموزشی ارزنده‌ای را کسب کنند که به دست آوردن مستقیم آن‌ها در دنیای واقعی بسیار پرهزینه یا ناامن است. این شرکت PROWL را به عنوان لایه‌ای برای ارتقای وفاداری و مدیریت آموزش مدل‌های بنیادین جهان (مانند Odyssey-3) طراحی کرده است؛ با این هدف بلندمدت که زمینه آموزش سیستم‌های چندوجهی (Multimodal) را از طریق تعاملات واقعی و بی‌پایان فراهم سازد.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

پایان افت کیفیت تصاویر در ادیت‌های پیاپی؛ عرضه مدل Ideogram 4.5 در هیگزفیلد
آخرین اخبار

پایان افت کیفیت تصاویر در ادیت‌های پیاپی؛ عرضه مدل Ideogram 4.5 در هیگزفیلد

مدل هوش مصنوعی جدید Ideogram 4.5 با هدف حل یکی از بزرگ‌ترین چالش‌های تولید تصویر، یعنی افت کیفیت و به‌هم‌ریختگی پیکسل‌ها در ادیت‌های پیاپی، به پلتفرم هیگزفیلد آمد. این مدل با تثبیت پیکسل‌های دست‌نخورده، امکان ویرایش متن، تغییر نورپردازی و اصلاح جزئیات عکس‌ها را با بالا‌ترین دقت و بدون افت کیفیت فراهم می‌کند.

۵ دقیقه مطالعه
۰
۱۰ مهر
خط و نشان سناتور وارن برای غول‌های فناوری: ماجرای تخفیف‌های نجومی مالیات به بهانه هوش مصنوعی چیست؟
آخرین اخبار

خط و نشان سناتور وارن برای غول‌های فناوری: ماجرای تخفیف‌های نجومی مالیات به بهانه هوش مصنوعی چیست؟

الیزابت وارن، سناتور سرشناس آمریکایی، با ارسال نامه‌هایی به مدیران ارشد مایکروسافت، آلفابت، متا و آمازون خواستار شفاف‌سازی درباره میلیاردها دلار تخفیف مالیاتی به بهانه سرمایه‌گذاری در هوش مصنوعی شد. بر اساس گزارش‌ها، غول‌های فناوری با اتکا به قانون مالیاتی ۲۰۲۵ مبالغ هنگفتی را به جای مالیات، در دیتاسنترها و سخت‌افزارهای پردازشی خود هزینه کرده‌اند. این سناتور معتقد است معافیت‌های سرسام‌آور این شرکت‌ها نباید به قیمت فشار مالی بر دوش طبقه متوسط و بودجه عمومی جامعه تمام شود.

۴ دقیقه مطالعه
۰
۱۰ مهر
ضربه محکم دادگاه به سازندگان هوش مصنوعی: آموزش مدل‌ها با زحمت تحریریه‌ای دیگران «استفاده منصفانه» نیست!
آخرین اخبار

ضربه محکم دادگاه به سازندگان هوش مصنوعی: آموزش مدل‌ها با زحمت تحریریه‌ای دیگران «استفاده منصفانه» نیست!

دادگاه تجدیدنظر آمریکا در حکمی سرنوشت‌ساز اعلام کرد آموزش هوش مصنوعی با خلاصه‌ها و یادداشت‌های تحریریه‌ای دیگران نقض قانون است و استفاده منصفانه به حساب نمی‌آید. این تصمیم پیام واضح و تکان‌دهنده‌ای برای توسعه‌دهندگان دارد: نمی‌توان با دیتای‌تر و تمیز دیگران، برای خودشان رقیب تجاری ساخت!

۴ دقیقه مطالعه
۰
۱۰ مهر