سقوط آخرین سنگر بازیهای فکری؛ هوش مصنوعی اسطوره تاریخ استراتگو را با بودجهای ناچیز درهم کوبید!
پس از شطرنج و گو، آخرین سنگر تسخیرنشده بازیهای رومیزی یعنی استراتگو نیز در برابر هوش مصنوعی تسلیم شد. محققان با توسعه مدل کمهزینه Ataraxos موفق شدند اسطوره بیرقیب تاریخ این بازی را با نتیجه قاطع ۱۵ بر یک شکست دهند؛ موفقیتی چشمگیر که تنها با چند هزار دلار و ۱۶ پردازنده گرافیکی به دست آمد.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- مدل هوش مصنوعی Ataraxos موفق شد پیم نیمایر، بزرگترین اسطوره تاریخ بازی استراتگو را با نتیجه سنگین ۱۵ بر یک مغلوب کند و یکی از دشوارترین بازیهای فکری جهان را به تسخیر خود درآورد.
- برخلاف دیپمایند که میلیونها دلار برای پروژه قبلی هزینه کرده بود، این هوش مصنوعی تنها با ۱۶ کارت گرافیک و با بودجهای چند هزار دلاری آموزش دیده و با یک شبکه عصبی هوشمند، حرکات پنهان حریف را حدس میزند.
- این مدل علاوه بر بازگشتهای معجزهآسا در شرایط نزدیک به باخت و تغییر سبک بازی حرفهایها، راه را برای کاربردهای حیاتی مانند مذاکرات پیچیده، بازارهای مالی و شبیهسازیهای استراتژیک باز کرده است.
در سال ۱۹۹۷ ابررایانه Deep Blue گری کاسپاروف را در شطرنج شکست داد، در سال ۲۰۱۶ هوش مصنوعی AlphaGo لی سدول را در بازی گو به زانو درآورد و باتهای پوکر هم سالهاست که بازیکنان حرفهای را نقرهداغ میکنند. اما در این میان، یک بازی کلاسیک و سرسخت به نام «استراتگو» (Stratego) همچنان در برابر ماشین مقاومت میکرد. کار به جایی رسیده بود که حتی دیپمایند (DeepMind) هم با بودجههای نجومی و امکانات بیانتهای خود نتوانست مدلی بسازد که بتواند اسطورههای انسانی این بازی را با اطمینان شکست دهد.
حالا تیمی از محققان دانشگاههای کارنگی ملون، امآیتی (MIT)، دانشگاه نیویورک و استنفورد بالاخره این طلسم را شکستند. هوش مصنوعی جدید آنها با نام «آتاراکسوس» (Ataraxos) موفق شد پیم نیمایر (Pim Niemeijer)، که بدون شک بزرگترین و پرافتخارترین بازیکن تاریخ استراتگو به حساب میآید را با نتیجه سنگین ۱۵ بر یک (به همراه ۴ تساوی) مغلوب کند. شگفتانگیزتر اینکه آموزش این هوش مصنوعی تنها با ۱۶ کارت گرافیک (GPU) و با بودجهای ناچیز در حد چند هزار دلار انجام شده است!
ارتشهای پنهان
در بازی استراتگو، هر بازیکن ۴۰ مهره با درجات نظامی مختلف در اختیار دارد؛ از ارتشبد گرفته تا جاسوس، بمبها و البته یک پرچم. هدف بازی ساده است: تصرف پرچم حریف. جذابیت ماجرا اینجاست که رقیب شما میداند مهرههایتان کجا هستند، اما نمیداند هویت هر مهره چیست. هویت واقعی مهرهها تنها زمانی فاش میشود که دو مهره در صفحه با هم شاخبهشاخ شوند؛ مهره ضعیفتر از بازی حذف میشود و هویت مهره برنده آشکار میگردد. همین ویژگی باعث میشود استراتگو مثل پوکر، یک بازی با «اطلاعات ناقص» باشد؛ یعنی همان کلاسی از بازیها که کامپیوترها سالها پیش رمزش را شکسته بودند. یوجین وینیتسکی، پژوهشگر دانشگاه نیویورک و یکی از نویسندگان این مقاله، میگوید: «استراتگو یک ویژگی فوقالعاده متمایز دارد: حجم عظیمی از اطلاعات پنهان که در طول یک بازه زمانی بسیار طولانی و گامبهگام آشکار میشود.»
در بعضی از انواع پوکر، اطلاعات پنهان بازی بسیار ناچیز است. گابریله فارینا، دانشمند علوم کامپیوتر از دانشگاه MIT و یکی دیگر از همکاران این پژوهش، توضیح میدهد: «در پوکر تگزاس هولدم، شما فقط دو کارت پنهان دارید.» این یعنی کلاً ۱,۳۲۶ حالت ممکن برای دستها وجود دارد؛ رقمی که یک ماشین به راحتی میتواند تمام احتمالاتش را سبکسنگین کند. فارینا ادامه میدهد: «اما در استراتگو، ۴۰ مهره روی صفحه وجود دارد که میتوانند به هر چیدمانی قرار بگیرند.» این تنوع سرسامآور به معنای بیش از یک دسیلیون (عددی با ۳۳ صفر!) چیدمان ممکن است. تازه این فقط اول ماجراست؛ طول بازی را هم باید در نظر گرفت!
فارینا میگوید: «یک بازی شطرنج معمولاً حدود ۴۰ حرکت طول میکشد، اما در استراتگو بازی به راحتی میتواند تا ۲,۰۰۰ حرکت کش پیدا کند!» علاوه بر این، استراتگو بازی بلوفزدن است. گاهی یک مهره ضعیف را طوری حرکت میدهید که انگار ارتشبد است، فقط برای اینکه حریف بترسد و عقب بکشد. اما اگر بازیکنی بیش از حد بلوف بزند، تهدیدهایش بیاثر میشوند؛ و اگر اصلاً بلوف نزند، دستش کاملاً خوانده و حرکاتش قابل پیشبینی میشود. به گفته تیم پژوهشی، برقراری تعادل در این بندبازی ظریف همان جایی بود که هوش مصنوعیهای قبلی، مثل مدل دیپنش (DeepNash) شرکت دیپمایند در سال ۲۰۲۲، در آن گیر افتاده بودند.
یادگیری حدس زدن
مدل آتاراکسوس درست مثل دیپنش، از طریق بازی با خودش آموزش دید و در مجموع ۱۶۳ میلیون دست بازی کرد. در این جلسات خودآموزی، حرکاتی که منجر به برد میشدند پاداش میگرفتند و در بازیهای بعدی بیشتر تکرار میشدند، و حرکاتی که به باخت ختم میشدند کمرنگتر میشدند؛ که همان ایده ساده و پایه در یادگیری تقویتی است. تفاوت اصلی در میزان تغییر استراتژی آتاراکسوس پس از هر بازی بود؛ چرا که وجود اطلاعات پنهان معمولاً باعث میشود الگوریتمهای یادگیری خودبهخود وارد یک دور باطل شوند. تیم تحقیقاتی این معضل را با یک راهکار هوشمندانه حل کرد: اعمال تغییرات بزرگ و جسورانه در اوایل فرآیند آموزش، و سپس انجام اصلاحات ظریف و محتاطانه در مراحل بعدی.
اما نوآوری بزرگتر این مدل، قابلیتی بود که دیپنش اصلاً خوابش را هم نمیدید: دوراندیشی و محاسبه حرکات آینده درست قبل از بازی کردن! مدلهایی مثل AlphaGo استراتژی کلی خود را با یک جستوجوی سریع پیش از هر حرکت صیقل میدهند. دیپمایند نتوانسته بود این رویکرد را در استراتگو پیاده کند، چون فضای جستوجو آنقدر عظیم بود که حتی مشخص نبود امتحان کردنش اصلاً ارزش وقت گذاشتن دارد یا نه.
فارینا میگوید: «این دقیقاً یکی از همان مسائلی بود که توانستیم راهکارش را پیدا کنیم.» کلید حل معما، استفاده از یک شبکه عصبی دوم یا بهاصطلاح یک «مدل باور» (Belief Model) بود؛ شبکهای که آموزش دیده تا با بررسی نحوه جابهجایی مهرههای حریف، هویت پنهان آنها را حدس بزند. به این ترتیب، آتاراکسوس به جای بررسی تکتک چیدمانهای نامحدود، فقط سناریوهای منطقی و محتمل را گزینش میکند، حرکات کاندید را در ذهن خود شبیهسازی مینماید و در نهایت بهترین گزینه را انتخاب میکند.
و این برتری فنی، مستقیماً در سبک بازی آتاراکسوس خود را نشان میدهد.
آرام، خونسرد و تسلیمناپذیر
نام آتاراکسوس از یک واژه یونان باستان به معنای «حالت آرامش درونی» گرفته شده است. فارینا توضیح میدهد: «این کلمه یعنی کسی که کاملاً آرام و خونسرد است و هیچچیز تکانش نمیدهد.» او معتقد است ساختار این هوش مصنوعی و نداشتن احساسات انسانی باعث میشود هرگز دست به حرکات هیجانی و نسنجیده نزند؛ «حتی در شرایطی که یک بازیکن انسان کنترل اعصابش را کاملاً از دست میدهد.» در حالی که یک انسان در زمان عقب افتادن شدید دست به قمار و ریسکهای خطرناک میزند، آتاراکسوس خیلی آرام، باحوصله و گامبهگام راه بازگشت به بازی را باز میکند.
استراتژی خارقالعادهای که این هوش مصنوعی توسعه داده، به شکلی است که حریف اصلاً متوجه نقاط ضعفش نمیشود. وقتی آتاراکسوس تشخیص میدهد که حریف دلیلی برای شک کردن به یک نقطه آسیبپذیر ندارد، به آن نقطه دست نمیزند و اوضاع را آرام نگه میدارد؛ حتی اگر از دید یک تماشاچی که هر دو سمت صفحه را میبیند، آن وضعیت شبیه به یک فاجعه آماده انفجار به نظر برسد!
فارینا میگوید: «برای انسانها خیلی سخت است وقتی رازی را میدانند، طوری تصمیم بگیرند که انگار از آن بیخبرند؛ اما برای ماشین این کار مثل آب خوردن است.» به گفته تیم، این قابلیت باعث میشود ماشین حرکاتی انجام دهد که انسان فقط موقع بلوف زدن جسورانه به سراغشان میرود؛ با این تفاوت که ماشین نقشه را خیلی بهتر از انسانها پیش میبرد. وینیتسکی اضافه میکند: «ما با چشمان خودمان میدیدیم که این ربات در شرایطی که شانس بردش فقط ۲ درصد بود، با بلوفزدنهای فوقالعاده ماهرانه و با کمال خونسردی بازی را برمیگرداند!»
پیم نیمایر، یعنی همان بازیکن نگونبختی که آتاراکسوس این بازگشتهای معجزهآسا را در برابرش رقم زد، ۴ بار قهرمان جهان شده و بیش از ۶۰۰ هفته عنوان نفر اول رنکینگ جهانی استراتگو را در اختیار داشته است!
نبرد تنبهتن با اسطوره
طی یک بازه سه هفتهای، نیمایر ۲۰ مسابقه آنلاین با آتاراکسوس برگزار کرد و قرار بود به ازای هر برد ۱۰۰ دلار جایزه بگیرد. او میدانست که این هوش مصنوعی قرار نیست حین بازی خودش را با سبک او تطبیق دهد، بنابراین وقت کافی داشت تا به دنبال نقاط ضعف سیستم بگردد. با این حال، او در تمام این بازیها فقط و فقط یک بار توانست طعم پیروزی را بچشد!
محققان میگویند همان یک باخت هم نقص واقعی سیستم به حساب نمیآید؛ زیرا بازی خوب در استراتگو نیازمند تصادفیسازی چیدمان مهرههاست و شانس همیشه در نتیجه دخیل است. فارینا تأکید میکند: «حتی اگر بینقصترین استراتژی ممکن را هم داشته باشید، گاهی اوقات بازی را میبازید.»
ظاهراً قهرمان انسانی در آن بازی حسابی خوششانس بود، اما این ماجرا دوطرفه بود. وینیتسکی هم صادقانه اعتراف میکند: «راستش را بخواهید، بعضی وقتها شانس با ما هم یار بود!»
در مسابقات قهرمانی جهان استراتگو در سال ۲۰۲۵، سایر شرکتکنندگانی که آتاراکسوس را به چالش کشیدند، سرنوشتی به مراتب بدتر داشتند: این هوش مصنوعی موفق شد از ۴۰ بازی، ۳۸ مسابقه را مغلوب خود کند! در این میان، سبک بازی این بات شیوه بازی خود انسانها را هم دگرگون کرد. فارینا میگوید: «فکر میکنم این ربات سبک و قواعد نانوشته بازی حرفهای (متاگیم) را حسابی تکان داده است.»
برای مثال، بازیکنان از این متعجب شده بودند که آتاراکسوس در بسیاری از بازیها پرچم خود را در گوشه صفحه و فقط پشت دو بمب مخفی میکرد؛ چیدمانی عجیب و نامتعارف که بازیکنان سنتی به ندرت به سراغش میروند.
اما شگفتانگیزترین برگ برنده آتاراکسوس، بیشک برچسب قیمت باورنکردنی آن است!
معجزه کاهش هزینهها
مدل قبلی دیپمایند یعنی دیپنش به مدت ۲ الی ۳ ماه روی ۱,۰۲۴ تراشه تخصصی گوگل (TPU) آموزش دیده بود؛ پردازشی که طبق برآورد تیم آتاراکسوس با قیمتهای سال ۲۰۲۵ هزینهای بین ۳ تا ۴.۵ میلیون دلار روی دست سازندگانش میگذاشت. در مقابل، آتاراکسوس تنها به ۱۶ پردازنده گرافیکی (GPU) به مدت یک هفته، به علاوه ۴ پردازنده گرافیکی دیگر برای ۴ روز جهت آموزش «مدل باور» نیاز داشت!
فارینا و ساموئل سوکوتا (نویسنده اصلی مقاله) این جهش بهرهوری خارقالعاده را با نوشتن یک شبیهساز اختصاصی به دست آوردند که میلیونها حرکت را در هر ثانیه روی کارتهای گرافیک اجرا میکند. فارینا توضیح میدهد: «ما در محیطهای دانشگاهی به مزارع غولپیکر کارت گرافیک و سرمایههای بیحساب دسترسی نداریم و باید راهکارهای هوشمندانهتر پیدا میکردیم.»
این الگوریتم همچنین با سرعتی سرسامآور آموزش دید؛ بهطوریکه حدود ۳۴ برابر بازیهای کمتری نسبت به دیپنش انجام داد، اما در نهایت خروجی به مراتب قدرتمندتری ارائه کرد.
معماری آتاراکسوس فقط محدود به استراتگو نماند و در بازیهای دیگر هم گل کاشت. همین رویکرد موفق شد سه قهرمان جهان را در نسخه سریعتر هشتمهرهای (Barrage Stratego) شکست دهد، در بازی کارتی و همکارانه «هانابی» (Hanabi) به استادی کامل برسد و بهترین باتهای بازی کارتی چینی «دو دیژو» (Dou Dizhu) را تارومار کند. اما هدف نهایی این تیم بسیار فراتر از بازیهای تختهای یا کارتی است.
فراتر از صفحه بازی
بازیهای فکری و رومیزی قوانین مشخص و برندگان معلومی دارند، در حالی که چالشهای دنیای واقعی مثل مذاکرات سیاسی و تجاری، بازارهای مالی یا مناقشات نظامی، اصلاً به این شفافیت نیستند. با این وجود، پژوهشگران آتاراکسوس استدلال میکنند که فاصله این دو دنیا کمتر از آن چیزی است که به نظر میرسد؛ زیرا حل هر معضل واقعی در دنیای ما، با ساخت یک مدل سادهشده از آن آغاز میشود.
وینیتسکی میگوید: «شبیهسازی بازیهای جنگی و تصمیمگیری استراتژیک (War Gaming) رویکردی رایج در دنیاست. شما میتوانید از تکنیکهای توسعهیافته در این پروژه استفاده کنید تا سناریوهای آینده را شبیهسازی نمایید و ببینید که یک رقیب سرسخت در برابر تصمیمات شما چه واکنشی نشان خواهد داد.»
فارینا و همکارانش اکنون به دنبال آن هستند که عملکرد این هوش مصنوعی را شفافتر و قابل فهمتر کنند؛ زیرا آتاراکسوس در وضعیت کنونیاش نمیتواند توضیح دهد که چرا فلان حرکت خاص را انجام داده است. فارینا در پایان اشاره میکند: «هدف ما ساخت ماشینهایی است که استراتژیهای فوقالعاده قدرتمند، اما در عین حال قابل تفسیر و توضیحپذیر ارائه دهند. فکر میکنم هنوز تا رسیدن به آن نقطه کمی فاصله داریم.»
این مقاله به طور رسمی در سال ۲۰۲۶ در ژورنال علمی معتبر نیچر (Nature) با شناسه دیجیتال DOI: 10.1038/s41586-026-11036-y به چاپ رسیده است.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

اخراج جنجالی ۳ محقق اوپنایآی؛ پای درز اطلاعات حساس در میان است!
اوپنایآی از اخراج سه پژوهشگر خود به دلیل نقض سیاستهای امنیتی و مدیریت نادرست اطلاعات حساس خبر داد. این اخراجهای غیرمنتظره در حالی رخ میدهد که فشارهای بیرونی بر سر پروتکلهای ایمنی این غول هوش مصنوعی به بالاترین حد خود رسیده است.

سرمایهگذاری تریلیون دلاری در هوش مصنوعی ترمز کاهش نرخ بهره را کشید؛ دردسر جدید فدرال رزرو
موج عظیم سرمایهگذاری تریلیون دلاری در زیرساختهای هوش مصنوعی و دیتاسنترها، معادلات بانک مرکزی آمریکا را به هم ریخته است. مقامات ارشد فدرال رزرو میگویند تقاضای انفجاری غولهای فناوری برای تأمین مالی پروژههای هوش مصنوعی، یکی از موتورهای اصلی بالا ماندن نرخ بهره در اقتصاد است. این تقاضای بیسابقه با وجود کمک به رشد اقتصادی، چالشهای جدیدی برای بازار مسکن و وامهای تجاری ایجاد کرده است.

ساخت فروشگاه اینترنتی فقط با چت کردن! شاپیفای از ابزار هوش مصنوعی Canvas رونمایی کرد
شاپیفای با معرفی ابزار جدید Canvas، ساخت فروشگاههای اینترنتی را به یک گفتوگوی ساده با هوش مصنوعی تبدیل کرده است. با این قابلیت، کاربران میتوانند به سادگیِ چت کردن با ایجنت Sidekick، طرح و امکانات سایت خود را تغییر دهند و کدهای واقعی و نتیجه کار را به صورت زنده و تعاملی تماشا کنند.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.