پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

تبدیل تصمیم‌گیری ایجنت‌ها به جست‌وجوی برداری؛ مدل CLM پژوهشگران Stanford استنتاج را ۹ برابر سریع‌تر می‌کند

انتشار:۲ مهر ۱۴۰۵(۳ روز پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

پژوهشگران Stanford با معرفی مدل CLM، فرایند تصمیم‌گیری ایجنت‌های هوش مصنوعی را به جست‌وجوی برداری تبدیل کردند؛ رویکردی نوآورانه که سرعت استنتاج در انتخاب ابزارها و تصمیم‌های محدود را تا ۹ برابر افزایش می‌دهد.

تبدیل تصمیم‌گیری ایجنت‌ها به جست‌وجوی برداری؛ مدل CLM پژوهشگران Stanford استنتاج را ۹ برابر سریع‌تر می‌کند

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • پژوهشگران دانشگاه Stanford مدل CLM را با هدف تبدیل تصمیم‌گیری ایجنت‌ها به جست‌وجوی برداری و ارتقای سرعت منتشر کردند.
  • مدل CLM-8B با بهره‌گیری از ستون فقرات Qwen3-8B سرعت استنتاج را تا ۹ برابر نسبت به مدل‌های اعتبارسنج متداول افزایش می‌دهد.
  • این مدل در بنچمارک‌های DeepSWE و Terminal-Bench 2.1 به دقت به ترتیب ۸۱٫۶ و ۸۷٫۶ درصدی در انتخاب راه‌حل بهینه دست یافته است.
  • با امکان پیش‌محاسبه بردارهای اکشن برای ابزارها و گزینه‌های پرتکرار، هزینه پردازشی ایجنت‌ها به محاسبات برداری سبک تقلیل می‌یابد.

تبدیل تصمیم‌گیری ایجنت‌ها به جست‌وجوی برداری با CLM

آزمایشگاه هوش مقیاس‌پذیر Stanford (Scaling Intelligence Lab) و گروه Hazy Research مخزن کد، وزن‌ها، زیرساخت سرویس‌دهی و کتابخانه‌های کلاینت مدل CLM را به‌طور عمومی منتشر کردند. مدل‌های زبانی کنتراستیو (Contrastive Language Models یا به‌اختصار CLM) وضعیت فعلی (State) ارائه‌شده را در فضای امبدینگ در برابر مجموعه‌ای محدود از اکشن‌های کاندید ارزیابی و امتیازدهی می‌کنند و سپس اکشنی را که بیشترین ضرب داخلی (Dot Product) را داشته باشد برمی‌گزینند. این ساختار به‌طور ویژه برای مسیریابی ابزارها، اعتبارسنجی خروجی‌ها، تعامل با کامپیوتر (Computer Use) و سایر مراحل کاری ایجنت‌ها طراحی شده است که در آن‌ها خروجی نهایی یک انتخاب محدود و مشخص است.

نسخه اولیه CLM-8B بر پایه مدل منجمدشده Qwen3-8B (به‌عنوان ستون فقرات) و دو هد نگاشت (Projection Head) کوچک توسعه یافته است. پژوهشگران گزارش داده‌اند که نرخ موفقیت این مدل در ارزیابی‌های Zero-shot با مدل مبنای Jev برابری می‌کند، در حالی که سرعت استنتاج آن تا ۹ برابر بیشتر است. پس از فاین‌تیونینگ اختصاصی، CLM موفق شد در زیرمجموعه‌ای متشکل از ۳۸ تسک بنچمارک DeepSWE به دقت ۸۱٫۶ درصد و در ۳۰ تسک بنچمارک Terminal-Bench 2.1 به دقت ۸۷٫۶ درصد برسد. البته این نتایج کدنویسی، توانایی مدل در انتخاب بهترین راه‌حل از میان گزینه‌های تولیدشده توسط سایر مدل‌ها را می‌سنجد و اندازه کوچک مجموعه‌های ارزیابی نیازمند احتیاط در تحلیل نتایج است.

تصمیم‌گیری تک‌مرحله‌ای در میان گزینه‌های محدود

پژوهشگران CLM را یک مدل «سیستم ۱» (System 1) توصیف می‌کنند؛ اصطلاحی که به سازوکار تصمیم‌گیری سریع و تک‌مرحله‌ای اشاره دارد. خروجی این مدل، رتبه‌بندی کاندیداهای مشخص‌شده است و همین ویژگی آن را به گزینه‌ای ایده‌آل برای طبقه‌بندی‌کننده‌ها، مسیریاب‌ها و اعتبارسنج‌های تعبیه‌شده در حلقه‌های اجرایی ایجنت‌ها تبدیل می‌کند.

چک‌پوینت این مدل، ستون فقرات تثبیت‌شده Qwen3-8B را با دو هد نگاشت مجزای ۲۰ میلیون پارامتری برای وضعیت‌ها (States) و اکشن‌ها (Actions) ترکیب می‌کند. در فرایند آموزش، این هدها به‌روزرسانی می‌شوند در حالی که مدل زبانی اصلی دست‌نخورده باقی می‌ماند. هنگام استنتاج نیز هر وضعیت یا اکشن جدید تنها یک بار انکود می‌شود، به یک فضای برداری مشترک نگاشت می‌یابد و از طریق ضرب داخلی مورد مقایسه قرار می‌گیرد.

در سناریوهایی که یک ایجنت به‌طور مکرر از ابزارها، المان‌های رابط کاربری یا حرکت‌های مشخص در بازی استفاده می‌کند، بردارهای اکشن را می‌توان از پیش محاسبه کرد. گرچه هزینه امتیازدهی با افزایش تعداد کاندیداها رشد می‌کند، اما هر مقایسه اضافه در عمل تنها یک عملیات برداری بسیار سبک و کم‌هزینه خواهد بود.

دستورالعمل آموزش سه‌مرحله‌ای

مدل CLM از تابع هدف دوطرفه InfoNCE روی دسته‌هایی از جفت‌های منطبق «وضعیت-اکشن» بهره می‌برد. این تابع زیان، شباهت میان هر جفت صحیح را افزایش داده و شباهت آن با سایر نمونه‌های موجود در دسته را کاهش می‌دهد. همین فرایند به‌صورت معکوس نیز اعمال می‌شود تا هم وضعیت‌ها برای بازیابی اکشن‌ها و هم اکشن‌ها برای بازیابی وضعیت‌ها بهینه‌سازی شوند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر