پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

سیستم Dream-RSI شرکت Google فراخوانی ایجنت‌های اکتشافی را با بازپخش جستجوهای قبلی تا ۱۶۲ برابر کاهش می‌دهد

انتشار:۲۸ شهریور ۱۴۰۵(۱ هفته پیش)
۵ دقیقه زمان مطالعه
۰ دیدگاه

تیم‌های هوش مصنوعی چگونه هزینه‌های ایجنت‌ها را کاهش می‌دهند؟ سیستم جدید Dream-RSI شرکت Google با بررسی تاریخچه جستجوهای ذخیره‌شده برای آزمایش استراتژی‌های جدید، نیاز به فراخوانی ایجنت‌های اکتشافی را تا ۱۶۲ برابر کمتر می‌کند.

سیستم Dream-RSI شرکت Google فراخوانی ایجنت‌های اکتشافی را با بازپخش جستجوهای قبلی تا ۱۶۲ برابر کاهش می‌دهد

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • سیستم Dream-RSI شرکت Google با استفاده از بازپخش تاریخچه جستجوهای قبلی، نیاز به فراخوانی مکرر ایجنت‌های اکتشافی را به‌شدت کاهش می‌دهد.
  • این رویکرد به مدل‌ها اجازه می‌دهد بدون اجرای مجدد جستجوهای پرهزینه در محیط آنلاین، استراتژی‌های جدید را آزمایش کرده و فراخوانی‌ها را تا ۱۶۲ برابر کمتر کنند.
  • دستاورد جدید Google می‌تواند هزینه‌های محاسباتی تیم‌های توسعه‌دهنده هوش مصنوعی را در حلقه‌های اکتشافی و فرایندهای بهبود خودکار بازگشتی (RSI) به شکل چشمگیری بهینه‌سازی کند.

تیم‌های توسعه‌دهنده برای بهبود حلقه‌های اکتشافی خود همچنان ده‌ها هزار توکن و فراخوانی ایجنت را مصرف می‌کنند. به گفته پژوهشگران Google، بخش عمده‌ای از این هزینه صرف مسیرهایی می‌شود که پیش از این با شکست مواجه شده‌اند. راهکار آن‌ها این است که به جای تکرار این مسیرها، به ایجنت‌ها اجازه دهند تا در این حلقه‌ها «رؤیاپردازی» کنند و با یادگیری از تلاش‌های قبلی، جستجوهای آینده را هدایت کنند. این سیستم که Dream-RSI نام دارد، در آزمایش‌ها توانست تا ۱۶۲ برابر کمتر از سیستم اکتشافی موجود یعنی SimpleTES به فراخوانی ایجنت‌های اکتشافی نیاز داشته باشد.

این سیستم بر پایه یک لایه هماهنگ‌کننده سبک ساخته شده است که انشعاب‌ها، اکتشافات موازی و تصمیم‌گیری برای توقف را بدون تغییر در ایجنت کدنویسی پایه کنترل می‌کند. روند اکتشاف در این مدل «صریح و قابل‌برنامه‌ریزی» است و سیستم بدون نیاز به اجرای مجدد و پرهزینه آنلاین، سیاست‌های خود را ارزیابی و اصلاح می‌کند.

سیستم Dream-RSI در چندین حوزه مختلف توانست ضمن کاهش چشمگیر هزینه‌های محاسباتی، کیفیت اکتشاف را حفظ کرده یا حتی بهبود بخشد.

Image 1

پژوهشگران در این باره توضیح می‌دهند: «از آنجا که تمام نتایج اجراها پیش‌تر در ساختار درختی سیستم ذخیره شده‌اند، ارزیابی یک استراتژی جدید تنها به خواندن سوابق گذشته نیاز دارد و هیچ نیازی به اجرای مجدد ایجنت اکتشافی پایه یا ارزیاب نیست.» 

این پژوهش تنها چند روز پس از انتشار مقاله «ما باید سرعت مرزها را کنترل کنیم» به قلم داریو آمودی (Dario Amodei) منتشر شده است. هم‌بنیان‌گذار Anthropic از مفهوم بهبود خودکار بازگشتی (RSI) به عنوان یکی از دو پیشرفتی یاد کرد که نظر او را درباره لزوم کند کردن روند توسعه هوش مصنوعی تغییر داده است، چرا که این فناوری می‌تواند به سیستم‌هایی منجر شود که کنترل آن‌ها از توان انسان خارج است.

اما این آزمایش جدید، بر اساس نتایج بنچمارک‌ها، شکاف میان تهدیدات وجودی که آمودی و دیگران درباره آن هشدار می‌دهند و کاربردهای محدودتر و عمل‌گرایانه حلقه‌های اکتشافی ایجنت‌ها را برجسته می‌کند. 

ساخت «درخت‌های اکتشاف تاریخی»

مفهوم RSI کاملاً به اکتشاف مؤثر وابسته است؛ اینکه کجا و چه زمانی انشعاب ایجاد شود، به صورت موازی اجرا گردد یا یک مسیر متوقف شود. اما با گسترش حلقه‌های اکتشافی به هزاران چرخه، مدیریت این فرایند می‌تواند چالش‌برانگیز باشد. پژوهشگران می‌نویسند که روند اکتشاف هنوز «دستی و ثابت» است و یک استراتژی مشخص از تجربیات انباشته‌شده درس نمی‌گیرد، بنابراین توسعه‌دهندگان مدام برای مسیرهایی که پیش‌تر شکست خورده‌اند، هزینه می‌پردازند. 

آن‌ها خاطرنشان می‌کنند: «اکتشاف ضعیف می‌تواند محاسبات و زمان قابل‌توجهی را هدر دهد و کارایی و مقیاس‌پذیری RSI را به‌شدت محدود کند.» گلوگاه اصلی این فرایند، «بازخورد در سطح متا» است، زیرا با تأخیر همراه بوده، پرهزینه است و در نهایت ضرورتی ندارد. در واقع، توسعه‌دهندگان در حال تولید مجدد بازخوردهایی هستند که قبلاً هزینه آن‌ها را پرداخته‌اند. 

این تیم تحقیقاتی متشکل از ۱۷ پژوهشگر از Google، Google DeepMind و دانشگاه‌های مریلند و ویرجینیا، استدلال می‌کنند که روند اکتشاف باید به صورت یک «درخت اکتشاف تاریخی» ساختاریافته ارائه شود که شامل تمام تصمیمات ایجنت و نتایج آن‌ها باشد. این رویکرد به مدل توانایی می‌دهد تا بدون نیاز به اجرای مجدد هیچ فرایندی، مسیر بعدی خود را انتخاب کند. 

پژوهشگران می‌نویسند: «سیستم همان درخت ثبت‌شده را با ترتیبی متفاوت طی می‌کند و هر نتیجه‌ای که درخواست می‌کند، از پیش روی دیسک ذخیره شده است.» این معماری می‌تواند هزاران کشف گذشته را بدون اجرای اضافی بررسی کرده و بهترین گزینه را برای پیاده‌سازی نهایی انتخاب کند. در عمل، این فرایند یک «شبیه‌ساز بازپخش» بر اساس تاریخچه جستجوهای انباشته‌شده قبلی ایجاد می‌کند. 

نکته مهم این است که سیاست اکتشافی تنظیم‌شده توسط انسان تعیین می‌کند که یک ایجنت کجا را جستجو کند، کدام تلاش‌ها باید به صورت موازی اجرا شوند و چه زمانی فرایند اکتشاف باید متوقف شود. 

عملکرد Dream-RSI در سه مرحله انجام می‌شود: «اکتشاف آنلاین» که در آن سیاست‌ها یک ایجنت را برای ساخت درخت اکتشاف و ثبت سوابق تاریخی هدایت می‌کنند؛ «ساخت شبیه‌ساز بازپخش» که در آن درخت و سوابق آن به یک مخزن قابل‌استفاده مجدد اضافه می‌شوند؛ و «بهبود سیاست مبتنی بر رؤیاپردازی» که در آن ایجنت اساساً سیاست‌های جایگزین را در ذهن خود شبیه‌سازی می‌کند. 

ایجنت پس از اکتشاف، در صورت نیاز درخت خود را گسترش می‌دهد، سیاست‌ها را بازنویسی می‌کند، به هر نسخه امتیاز می‌دهد و سپس بهترین گزینه را مستقر می‌سازد. هر چرخه در واقع «یک دنیای جدید اضافه می‌کند» و سیاست‌های برنده برای ایجاد یک درخت اکتشافی جدید دوباره آنلاین می‌شوند. 

پژوهشگران توضیح می‌دهند: «این تاریخچه همیشه در آنجا وجود داشته است؛ اما در کارهای قبلی به چشم دیگری دیده می‌شد، یعنی صرفاً به عنوان یک بستر متنی ثابت برای پرامپت‌ها یا داده‌های آموزشی برای تنظیم دقیق وزن‌های شبکه.»

نویسندگان مقاله استدلال می‌کنند: «تاریخچه، دنیایی برای رؤیاپردازی است. درخت اکتشافی که ایجنت از پیش ساخته، یک شبیه‌ساز دقیق از فضای جستجویی است که به آن دست یافته است.» این مدل از طریق رؤیاپردازی بهبود می‌یابد و به جای تجربه مکرر شرایط، یک سیاست اکتشافی جدید را با «تصور کردن» آن آزمایش می‌کند. 

آن‌ها می‌نویسند: «شبیه‌ساز هر چیزی است که بتواند بدون نیاز به اجرای واقعی جهان، به سؤال 'چه می‌شد اگر...' پاسخ دهد.» 

عملکرد Dream-RSI در بنچمارک‌های کلیدی

در طیف وسیعی از وظایف الگوریتمی، هسته پردازنده گرافیکی (GPU-kernel) و بهینه‌سازی ریاضی در دوره‌های متوالی اکتشاف، پژوهشگران دریافتند که سیاست اکتشافی آموزش‌دیده در Dream-RSI میزان استفاده از منابع محاسباتی را تطبیق داده و نتایج بهتری را با فراخوانی ایجنت کمتری نسبت به رویکردهای موجود ارائه می‌دهد.

در تست‌های اکتشافی Lasso، جایی که به ایجنت‌ها یک مسئله کدنویسی و بهینه‌سازی داده می‌شود، سیستم Dream-RSI تعادل بهتری میان کیفیت و توان محاسباتی در مقایسه با «اکتشاف ثابت بازگشتی» (RFE) ارائه داد. رویکرد RFE زمانی رخ می‌دهد که یک ایجنت هوش مصنوعی فضای جستجو را به جای تطبیق در طول زمان، با استفاده از یک هماهنگ‌کننده ثابت کاوش کند.

Image 2
تصویر ساخته‌شده با Midjourney

با استفاده از مدل Gemini-3.1-Pro، سیستم Dream-RSI میانگین زمان اجرا در ۶ مجموعه داده را از ۳۵۸۷٫۱ به ۲۹۳۱٫۰ میلی‌ثانیه کاهش داد و فراخوانی ایجنت‌های اکتشافی را از ۵۵۰ به ۳۱۷ مورد رساند. همچنین با مدل Gemini-3.7-Flash، میانگین زمان اجرا از ۲۵۱۶٫۷ به ۲۳۵۰٫۶ میلی‌ثانیه و تعداد فراخوانی‌ها از ۳۲۰۰ به ۱۸۷۹ رسید. در مقایسه، سیستم SimpleTES که معیار ثبت رقم چشمگیر کاهش ۱۶۲ برابری بود، از یک مدل پایه متفاوت به نام gpt-oss-120b در ۵۱٬۲۰۰ نسل استفاده کرد.

پژوهشگران عملکرد Dream-RSI را در حوزه مهندسی هسته GPU نیز ارزیابی کردند؛ حوزه‌ای که ایجنت‌ها وظیفه دارند پیاده‌سازی‌های با کارایی بالا را بدون از بین بردن صحت محاسبات عددی کشف کنند. این کار نیازمند استدلال همزمان پیرامون دسترسی به حافظه، موازی‌سازی، الگوریتم‌ها و بهینه‌سازی‌های خاص سخت‌افزار است. همین موضوع این بنچمارک را به گزینه‌ای مناسب برای اثبات توانایی Dream-RSI در تعمیم فراتر از اکتشافات صرفاً ریاضی تبدیل می‌کند.

در وظیفه ConvDiv برای هسته GPU، که میزان کارایی اجرای بارهای کاری سطح سخت‌افزار یادگیری ماشین روی کارت گرافیک را ارزیابی می‌کند، عملکرد Dream-RSI به‌طور متوالی بهبود یافت و تلاش‌های ارزیابی‌شده را پیش از هزینه‌کرد مجدد، از ۱۱۰ به ۵۰ مورد کاهش داد؛ فرایندی که تا رسیدن به حدود عدد ۹۰ و توقف پیشرفت ادامه داشت.

در وظایف برنامه‌نویسی پردازنده‌های گرافیکی مانند VGG16 و LayerNorm، سیستم Dream-RSI با استفاده از نسل‌های کمتر (به ترتیب ۲٫۴۳ و ۱٫۷۹ برابر کمتر) به عملکرد مشابهی دست یافت. در تسک‌های ConvDiv و ConvMax نیز با بودجه محاسباتی قابل مقایسه، عملکردی ۲٫۰۹ و ۱٫۴۴ برابر بالاتر را به ثبت رساند.

پژوهشگران در پایان می‌نویسند: «رؤیاپردازی درون شبیه‌ساز بازپخش که از روی درخت‌های اکتشافی تاریخی ساخته شده است، بازخورد فوری و کم‌هزینه‌ای را برای ارزیابی و اصلاح سیاست‌های اکتشافی فراهم می‌کند؛ آن هم بدون نیاز به تکرار ارزیابی‌های پرهزینه آنلاین.» برای تیم‌هایی که هم‌اکنون در حال مصرف فراوان فراخوانی‌های ایجنت هستند، این دستاورد بر پایه سوابقی استوار است که پیش از این برای تولید آن‌ها هزینه کرده‌اند؛ علاوه بر این، کدهای این سیستم نیز به صورت عمومی در دسترس قرار گرفته است.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر