پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

سقوط آخرین سنگر بازی‌های فکری؛ هوش مصنوعی اسطوره تاریخ استراتگو را با بودجه‌ای ناچیز درهم کوبید!

انتشار:۹ مهر ۱۴۰۵(۱ ساعت پیش)
۷ دقیقه زمان مطالعه
۰ دیدگاه

پس از شطرنج و گو، آخرین سنگر تسخیرنشده بازی‌های رومیزی یعنی استراتگو نیز در برابر هوش مصنوعی تسلیم شد. محققان با توسعه مدل کم‌هزینه Ataraxos موفق شدند اسطوره بی‌رقیب تاریخ این بازی را با نتیجه قاطع ۱۵ بر یک شکست دهند؛ موفقیتی چشمگیر که تنها با چند هزار دلار و ۱۶ پردازنده گرافیکی به دست آمد.

سقوط آخرین سنگر بازی‌های فکری؛ هوش مصنوعی اسطوره تاریخ استراتگو را با بودجه‌ای ناچیز درهم کوبید!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مدل هوش مصنوعی Ataraxos موفق شد پیم نیمایر، بزرگ‌ترین اسطوره تاریخ بازی استراتگو را با نتیجه سنگین ۱۵ بر یک مغلوب کند و یکی از دشوارترین بازی‌های فکری جهان را به تسخیر خود درآورد.
  • برخلاف دیپ‌مایند که میلیون‌ها دلار برای پروژه قبلی هزینه کرده بود، این هوش مصنوعی تنها با ۱۶ کارت گرافیک و با بودجه‌ای چند هزار دلاری آموزش دیده و با یک شبکه عصبی هوشمند، حرکات پنهان حریف را حدس می‌زند.
  • این مدل علاوه بر بازگشت‌های معجزه‌آسا در شرایط نزدیک به باخت و تغییر سبک بازی حرفه‌ای‌ها، راه را برای کاربردهای حیاتی مانند مذاکرات پیچیده، بازارهای مالی و شبیه‌سازی‌های استراتژیک باز کرده است.

در سال ۱۹۹۷ ابررایانه Deep Blue گری کاسپاروف را در شطرنج شکست داد، در سال ۲۰۱۶ هوش مصنوعی AlphaGo لی سدول را در بازی گو به زانو درآورد و بات‌های پوکر هم سال‌هاست که بازیکنان حرفه‌ای را نقره‌داغ می‌کنند. اما در این میان، یک بازی کلاسیک و سرسخت به نام «استراتگو» (Stratego) همچنان در برابر ماشین مقاومت می‌کرد. کار به جایی رسیده بود که حتی دیپ‌مایند (DeepMind) هم با بودجه‌های نجومی و امکانات بی‌انتهای خود نتوانست مدلی بسازد که بتواند اسطوره‌های انسانی این بازی را با اطمینان شکست دهد.

حالا تیمی از محققان دانشگاه‌های کارنگی ملون، ام‌آی‌تی (MIT)، دانشگاه نیویورک و استنفورد بالاخره این طلسم را شکستند. هوش مصنوعی جدید آن‌ها با نام «آتاراکسوس» (Ataraxos) موفق شد پیم نیمایر (Pim Niemeijer)، که بدون شک بزرگ‌ترین و پرافتخارترین بازیکن تاریخ استراتگو به حساب می‌آید را با نتیجه سنگین ۱۵ بر یک (به همراه ۴ تساوی) مغلوب کند. شگفت‌انگیزتر این‌که آموزش این هوش مصنوعی تنها با ۱۶ کارت گرافیک (GPU) و با بودجه‌ای ناچیز در حد چند هزار دلار انجام شده است!

ارتش‌های پنهان

در بازی استراتگو، هر بازیکن ۴۰ مهره با درجات نظامی مختلف در اختیار دارد؛ از ارتشبد گرفته تا جاسوس، بمب‌ها و البته یک پرچم. هدف بازی ساده است: تصرف پرچم حریف. جذابیت ماجرا این‌جاست که رقیب شما می‌داند مهره‌هایتان کجا هستند، اما نمی‌داند هویت هر مهره چیست. هویت واقعی مهره‌ها تنها زمانی فاش می‌شود که دو مهره در صفحه با هم شاخ‌به‌شاخ شوند؛ مهره ضعیف‌تر از بازی حذف می‌شود و هویت مهره برنده آشکار می‌گردد. همین ویژگی باعث می‌شود استراتگو مثل پوکر، یک بازی با «اطلاعات ناقص» باشد؛ یعنی همان کلاسی از بازی‌ها که کامپیوترها سال‌ها پیش رمزش را شکسته بودند. یوجین وینیتسکی، پژوهشگر دانشگاه نیویورک و یکی از نویسندگان این مقاله، می‌گوید: «استراتگو یک ویژگی فوق‌العاده متمایز دارد: حجم عظیمی از اطلاعات پنهان که در طول یک بازه زمانی بسیار طولانی و گام‌به‌گام آشکار می‌شود.»

در بعضی از انواع پوکر، اطلاعات پنهان بازی بسیار ناچیز است. گابریله فارینا، دانشمند علوم کامپیوتر از دانشگاه MIT و یکی دیگر از همکاران این پژوهش، توضیح می‌دهد: «در پوکر تگزاس هولدم، شما فقط دو کارت پنهان دارید.» این یعنی کلاً ۱,۳۲۶ حالت ممکن برای دست‌ها وجود دارد؛ رقمی که یک ماشین به راحتی می‌تواند تمام احتمالاتش را سبک‌سنگین کند. فارینا ادامه می‌دهد: «اما در استراتگو، ۴۰ مهره روی صفحه وجود دارد که می‌توانند به هر چیدمانی قرار بگیرند.» این تنوع سرسام‌آور به معنای بیش از یک دسیلیون (عددی با ۳۳ صفر!) چیدمان ممکن است. تازه این فقط اول ماجراست؛ طول بازی را هم باید در نظر گرفت!

فارینا می‌گوید: «یک بازی شطرنج معمولاً حدود ۴۰ حرکت طول می‌کشد، اما در استراتگو بازی به راحتی می‌تواند تا ۲,۰۰۰ حرکت کش پیدا کند!» علاوه بر این، استراتگو بازی بلوف‌زدن است. گاهی یک مهره ضعیف را طوری حرکت می‌دهید که انگار ارتشبد است، فقط برای این‌که حریف بترسد و عقب بکشد. اما اگر بازیکنی بیش از حد بلوف بزند، تهدیدهایش بی‌اثر می‌شوند؛ و اگر اصلاً بلوف نزند، دستش کاملاً خوانده و حرکاتش قابل پیش‌بینی می‌شود. به گفته تیم پژوهشی، برقراری تعادل در این بندبازی ظریف همان جایی بود که هوش مصنوعی‌های قبلی، مثل مدل دیپ‌نش (DeepNash) شرکت دیپ‌مایند در سال ۲۰۲۲، در آن گیر افتاده بودند.

یادگیری حدس زدن

مدل آتاراکسوس درست مثل دیپ‌نش، از طریق بازی با خودش آموزش دید و در مجموع ۱۶۳ میلیون دست بازی کرد. در این جلسات خودآموزی، حرکاتی که منجر به برد می‌شدند پاداش می‌گرفتند و در بازی‌های بعدی بیش‌تر تکرار می‌شدند، و حرکاتی که به باخت ختم می‌شدند کم‌رنگ‌تر می‌شدند؛ که همان ایده ساده و پایه در یادگیری تقویتی است. تفاوت اصلی در میزان تغییر استراتژی آتاراکسوس پس از هر بازی بود؛ چرا که وجود اطلاعات پنهان معمولاً باعث می‌شود الگوریتم‌های یادگیری خودبه‌خود وارد یک دور باطل شوند. تیم تحقیقاتی این معضل را با یک راهکار هوشمندانه حل کرد: اعمال تغییرات بزرگ و جسورانه در اوایل فرآیند آموزش، و سپس انجام اصلاحات ظریف و محتاطانه در مراحل بعدی.

اما نوآوری بزرگ‌تر این مدل، قابلیتی بود که دیپ‌نش اصلاً خوابش را هم نمی‌دید: دوراندیشی و محاسبه حرکات آینده درست قبل از بازی کردن! مدل‌هایی مثل AlphaGo استراتژی کلی خود را با یک جست‌وجوی سریع پیش از هر حرکت صیقل می‌دهند. دیپ‌مایند نتوانسته بود این رویکرد را در استراتگو پیاده کند، چون فضای جست‌وجو آن‌قدر عظیم بود که حتی مشخص نبود امتحان کردنش اصلاً ارزش وقت گذاشتن دارد یا نه.

فارینا می‌گوید: «این دقیقاً یکی از همان مسائلی بود که توانستیم راهکارش را پیدا کنیم.» کلید حل معما، استفاده از یک شبکه عصبی دوم یا به‌اصطلاح یک «مدل باور» (Belief Model) بود؛ شبکه‌ای که آموزش دیده تا با بررسی نحوه جابه‌جایی مهره‌های حریف، هویت پنهان آن‌ها را حدس بزند. به این ترتیب، آتاراکسوس به جای بررسی تک‌تک چیدمان‌های نامحدود، فقط سناریوهای منطقی و محتمل را گزینش می‌کند، حرکات کاندید را در ذهن خود شبیه‌سازی می‌نماید و در نهایت بهترین گزینه را انتخاب می‌کند.

و این برتری فنی، مستقیماً در سبک بازی آتاراکسوس خود را نشان می‌دهد.

آرام، خونسرد و تسلیم‌ناپذیر

نام آتاراکسوس از یک واژه یونان باستان به معنای «حالت آرامش درونی» گرفته شده است. فارینا توضیح می‌دهد: «این کلمه یعنی کسی که کاملاً آرام و خونسرد است و هیچ‌چیز تکانش نمی‌دهد.» او معتقد است ساختار این هوش مصنوعی و نداشتن احساسات انسانی باعث می‌شود هرگز دست به حرکات هیجانی و نسنجیده نزند؛ «حتی در شرایطی که یک بازیکن انسان کنترل اعصابش را کاملاً از دست می‌دهد.» در حالی که یک انسان در زمان عقب افتادن شدید دست به قمار و ریسک‌های خطرناک می‌زند، آتاراکسوس خیلی آرام، باحوصله و گام‌به‌گام راه بازگشت به بازی را باز می‌کند.

استراتژی خارق‌العاده‌ای که این هوش مصنوعی توسعه داده، به شکلی است که حریف اصلاً متوجه نقاط ضعفش نمی‌شود. وقتی آتاراکسوس تشخیص می‌دهد که حریف دلیلی برای شک کردن به یک نقطه آسیب‌پذیر ندارد، به آن نقطه دست نمی‌زند و اوضاع را آرام نگه می‌دارد؛ حتی اگر از دید یک تماشاچی که هر دو سمت صفحه را می‌بیند، آن وضعیت شبیه به یک فاجعه آماده انفجار به نظر برسد!

فارینا می‌گوید: «برای انسان‌ها خیلی سخت است وقتی رازی را می‌دانند، طوری تصمیم بگیرند که انگار از آن بی‌خبرند؛ اما برای ماشین این کار مثل آب خوردن است.» به گفته تیم، این قابلیت باعث می‌شود ماشین حرکاتی انجام دهد که انسان فقط موقع بلوف زدن جسورانه به سراغشان می‌رود؛ با این تفاوت که ماشین نقشه را خیلی بهتر از انسان‌ها پیش می‌برد. وینیتسکی اضافه می‌کند: «ما با چشمان خودمان می‌دیدیم که این ربات در شرایطی که شانس بردش فقط ۲ درصد بود، با بلوف‌زدن‌های فوق‌العاده ماهرانه و با کمال خونسردی بازی را برمی‌گرداند!»

پیم نیمایر، یعنی همان بازیکن نگون‌بختی که آتاراکسوس این بازگشت‌های معجزه‌آسا را در برابرش رقم زد، ۴ بار قهرمان جهان شده و بیش از ۶۰۰ هفته عنوان نفر اول رنکینگ جهانی استراتگو را در اختیار داشته است!

نبرد تن‌به‌تن با اسطوره

طی یک بازه سه هفته‌ای، نیمایر ۲۰ مسابقه آنلاین با آتاراکسوس برگزار کرد و قرار بود به ازای هر برد ۱۰۰ دلار جایزه بگیرد. او می‌دانست که این هوش مصنوعی قرار نیست حین بازی خودش را با سبک او تطبیق دهد، بنابراین وقت کافی داشت تا به دنبال نقاط ضعف سیستم بگردد. با این حال، او در تمام این بازی‌ها فقط و فقط یک بار توانست طعم پیروزی را بچشد!

محققان می‌گویند همان یک باخت هم نقص واقعی سیستم به حساب نمی‌آید؛ زیرا بازی خوب در استراتگو نیازمند تصادفی‌سازی چیدمان مهره‌هاست و شانس همیشه در نتیجه دخیل است. فارینا تأکید می‌کند: «حتی اگر بی‌نقص‌ترین استراتژی ممکن را هم داشته باشید، گاهی اوقات بازی را می‌بازید.»

ظاهراً قهرمان انسانی در آن بازی حسابی خوش‌شانس بود، اما این ماجرا دوطرفه بود. وینیتسکی هم صادقانه اعتراف می‌کند: «راستش را بخواهید، بعضی وقت‌ها شانس با ما هم یار بود!»

در مسابقات قهرمانی جهان استراتگو در سال ۲۰۲۵، سایر شرکت‌کنندگانی که آتاراکسوس را به چالش کشیدند، سرنوشتی به مراتب بد‌تر داشتند: این هوش مصنوعی موفق شد از ۴۰ بازی، ۳۸ مسابقه را مغلوب خود کند! در این میان، سبک بازی این بات شیوه بازی خود انسان‌ها را هم دگرگون کرد. فارینا می‌گوید: «فکر می‌کنم این ربات سبک و قواعد نانوشته بازی حرفه‌ای (متاگیم) را حسابی تکان داده است.»

برای مثال، بازیکنان از این متعجب شده بودند که آتاراکسوس در بسیاری از بازی‌ها پرچم خود را در گوشه صفحه و فقط پشت دو بمب مخفی می‌کرد؛ چیدمانی عجیب و نامتعارف که بازیکنان سنتی به ندرت به سراغش می‌روند.

اما شگفت‌انگیزترین برگ برنده آتاراکسوس، بی‌شک برچسب قیمت باورنکردنی آن است!

معجزه کاهش هزینه‌ها

مدل قبلی دیپ‌مایند یعنی دیپ‌نش به مدت ۲ الی ۳ ماه روی ۱,۰۲۴ تراشه تخصصی گوگل (TPU) آموزش دیده بود؛ پردازشی که طبق برآورد تیم آتاراکسوس با قیمت‌های سال ۲۰۲۵ هزینه‌ای بین ۳ تا ۴.۵ میلیون دلار روی دست سازندگانش می‌گذاشت. در مقابل، آتاراکسوس تنها به ۱۶ پردازنده گرافیکی (GPU) به مدت یک هفته، به علاوه ۴ پردازنده گرافیکی دیگر برای ۴ روز جهت آموزش «مدل باور» نیاز داشت!

فارینا و ساموئل سوکوتا (نویسنده اصلی مقاله) این جهش بهره‌وری خارق‌العاده را با نوشتن یک شبیه‌ساز اختصاصی به دست آوردند که میلیون‌ها حرکت را در هر ثانیه روی کارت‌های گرافیک اجرا می‌کند. فارینا توضیح می‌دهد: «ما در محیط‌های دانشگاهی به مزارع غول‌پیکر کارت گرافیک و سرمایه‌های بی‌حساب دسترسی نداریم و باید راهکارهای هوشمندانه‌تر پیدا می‌کردیم.»

این الگوریتم همچنین با سرعتی سرسام‌آور آموزش دید؛ به‌طوری‌که حدود ۳۴ برابر بازی‌های کمتری نسبت به دیپ‌نش انجام داد، اما در نهایت خروجی به مراتب قدرتمندتری ارائه کرد.

معماری آتاراکسوس فقط محدود به استراتگو نماند و در بازی‌های دیگر هم گل کاشت. همین رویکرد موفق شد سه قهرمان جهان را در نسخه سریع‌تر هشت‌مهره‌ای (Barrage Stratego) شکست دهد، در بازی کارتی و همکارانه «هانابی» (Hanabi) به استادی کامل برسد و بهترین بات‌های بازی کارتی چینی «دو دیژو» (Dou Dizhu) را تارومار کند. اما هدف نهایی این تیم بسیار فراتر از بازی‌های تخته‌ای یا کارتی است.

فراتر از صفحه بازی

بازی‌های فکری و رومیزی قوانین مشخص و برندگان معلومی دارند، در حالی که چالش‌های دنیای واقعی مثل مذاکرات سیاسی و تجاری، بازارهای مالی یا مناقشات نظامی، اصلاً به این شفافیت نیستند. با این وجود، پژوهشگران آتاراکسوس استدلال می‌کنند که فاصله این دو دنیا کم‌تر از آن چیزی است که به نظر می‌رسد؛ زیرا حل هر معضل واقعی در دنیای ما، با ساخت یک مدل ساده‌شده از آن آغاز می‌شود.

وینیتسکی می‌گوید: «شبیه‌سازی بازی‌های جنگی و تصمیم‌گیری استراتژیک (War Gaming) رویکردی رایج در دنیاست. شما می‌توانید از تکنیک‌های توسعه‌یافته در این پروژه استفاده کنید تا سناریوهای آینده را شبیه‌سازی نمایید و ببینید که یک رقیب سرسخت در برابر تصمیمات شما چه واکنشی نشان خواهد داد.»

فارینا و همکارانش اکنون به دنبال آن هستند که عملکرد این هوش مصنوعی را شفاف‌تر و قابل فهم‌تر کنند؛ زیرا آتاراکسوس در وضعیت کنونی‌اش نمی‌تواند توضیح دهد که چرا فلان حرکت خاص را انجام داده است. فارینا در پایان اشاره می‌کند: «هدف ما ساخت ماشین‌هایی است که استراتژی‌های فوق‌العاده قدرتمند، اما در عین حال قابل تفسیر و توضیح‌پذیر ارائه دهند. فکر می‌کنم هنوز تا رسیدن به آن نقطه کمی فاصله داریم.»

این مقاله به طور رسمی در سال ۲۰۲۶ در ژورنال علمی معتبر نیچر (Nature) با شناسه دیجیتال DOI: 10.1038/s41586-026-11036-y به چاپ رسیده است.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

اخراج جنجالی ۳ محقق اوپن‌ای‌آی؛ پای درز اطلاعات حساس در میان است!
آخرین اخبار

اخراج جنجالی ۳ محقق اوپن‌ای‌آی؛ پای درز اطلاعات حساس در میان است!

اوپن‌ای‌آی از اخراج سه پژوهشگر خود به دلیل نقض سیاست‌های امنیتی و مدیریت نادرست اطلاعات حساس خبر داد. این اخراج‌های غیرمنتظره در حالی رخ می‌دهد که فشارهای بیرونی بر سر پروتکل‌های ایمنی این غول هوش مصنوعی به بالا‌ترین حد خود رسیده است.

۲ دقیقه مطالعه
۰
۹ مهر
سرمایه‌گذاری تریلیون دلاری در هوش مصنوعی ترمز کاهش نرخ بهره را کشید؛ دردسر جدید فدرال رزرو
آخرین اخبار

سرمایه‌گذاری تریلیون دلاری در هوش مصنوعی ترمز کاهش نرخ بهره را کشید؛ دردسر جدید فدرال رزرو

موج عظیم سرمایه‌گذاری تریلیون دلاری در زیرساخت‌های هوش مصنوعی و دیتاسنترها، معادلات بانک مرکزی آمریکا را به هم ریخته است. مقامات ارشد فدرال رزرو می‌گویند تقاضای انفجاری غول‌های فناوری برای تأمین مالی پروژه‌های هوش مصنوعی، یکی از موتورهای اصلی بالا ماندن نرخ بهره در اقتصاد است. این تقاضای بی‌سابقه با وجود کمک به رشد اقتصادی، چالش‌های جدیدی برای بازار مسکن و وام‌های تجاری ایجاد کرده است.

۲ دقیقه مطالعه
۰
۹ مهر
ساخت فروشگاه اینترنتی فقط با چت کردن! شاپیفای از ابزار هوش مصنوعی Canvas رونمایی کرد
آخرین اخبار

ساخت فروشگاه اینترنتی فقط با چت کردن! شاپیفای از ابزار هوش مصنوعی Canvas رونمایی کرد

شاپیفای با معرفی ابزار جدید Canvas، ساخت فروشگاه‌های اینترنتی را به یک گفت‌وگوی ساده با هوش مصنوعی تبدیل کرده است. با این قابلیت، کاربران می‌توانند به سادگیِ چت کردن با ایجنت Sidekick، طرح و امکانات سایت خود را تغییر دهند و کدهای واقعی و نتیجه کار را به صورت زنده و تعاملی تماشا کنند.

۲ دقیقه مطالعه
۰
۹ مهر
سقوط آخرین سنگر بازی‌های فکری؛ هوش مصنوعی اسطوره تاریخ استراتگو را با | WireAI