پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

مایکروسافت از مدل Decision-1 رونمایی کرد؛ تصمیمی ۳۵ برابر سریع‌تر برای ایجنت‌های هوش مصنوعی!

انتشار:۱۸ مهر ۱۴۰۵(۱ ساعت پیش)
۵ دقیقه زمان مطالعه
۰ دیدگاه

مایکروسافت از مدل تخصصی Decision-1 رونمایی کرده که وظیفه آن امتیازدهی و انتخاب آنی از بین گزینه‌های مشخص است و فرآیند تصمیم‌گیری ایجنت‌ها را تا ۳۵ برابر سریع‌تر می‌کند. این مدل کم‌هزینه تنها با یک بار پردازش، تأخیرهای سنگین پایپ‌لاین‌های هوش مصنوعی را از بین می‌برد و برای توکن‌های خروجی هم هیچ هزینه‌ای دریافت نمی‌کند.

مایکروسافت از مدل Decision-1 رونمایی کرد؛ تصمیمی ۳۵ برابر سریع‌تر برای ایجنت‌های هوش مصنوعی!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مایکروسافت مدل جدیدی به نام Decision-1 عرضه کرده که به جای تولید متن‌های طولانی، فقط گزینه‌های مشخص را ارزیابی و انتخاب می‌کند و وظایفی مثل دسته‌بندی و هدایت درخواست‌ها را به دوش می‌کشد.
  • این مدل بر پایه Qwen3.5-9B توسعه داده شده و طبق بنچمارک‌ها تا ۳۵ برابر سریع‌تر از مدل‌های سنگین عمل می‌کند؛ جالب‌تر اینکه مایکروسافت برای توکن‌های خروجی آن حتی یک سنت هم پول نمی‌گیرد!
  • در تست‌های داخلی مایکروسافت (مثل تیم ایکس‌باکس و کوپایلوت)، این مدل توانسته کیفیت تصمیم‌گیری را در سطح بهترین مدل‌ها حفظ کند، اما با تأخیر بسیار کم‌تر و تا ۲۰۰ برابر هزینه پایین‌تر.

رونمایی مایکروسافت از Decision-1 برای امتیازدهی سریع به گزینه‌های مشخص

مایکروسافت از مدل جدید Microsoft-Decision-1 رونمایی کرد؛ مدلی تخصصی که وظیفه‌اش امتیازدهی و انتخاب از میان یک لیست مشخص از گزینه‌هاست. این مدل دقیقاً برای تصمیم‌گیری‌های پرکاربرد نرم‌افزاری طراحی شده؛ کار‌هایی مثل هدایت یک درخواست (Routing)، دسته‌بندی تیکت‌های پشتیبانی، امتیاز دادن به عملکرد ایجنت‌ها، فیلتر کردن محتوا یا تأیید نهایی خروجی‌ها.

این مدل در حال حاضر از طریق کاتالوگ Foundry مایکروسافت در دسترس قرار گرفته و پشتیبانی از پلتفرم OpenRouter هم به زودی به آن اضافه می‌شود. مدل قیمت‌گذاری مایکروسافت هم حسابی وسوسه‌انگیز است: فقط ۰.۰۴۲ دلار به ازای هر یک میلیون توکن ورودی و هزینه توکن‌های خروجی هم کاملاً صفر است!

مشخصه
Microsoft-Decision-1
مدل پایه
نسخه پس‌آموزش‌دیده Qwen3.5-9B (Post-trained)
ورودی
محتوای وظیفه، گزینه‌های پاسخ مشخص و معیارهای اختیاری ارزیابی
خروجی
امتیاز احتمالاتی برای هر گزینه
نحوه اجرا
تنها یک گذر مستقیم (One forward pass)
قیمت ورودی
۰.۰۴۲ دلار به ازای هر میلیون توکن
قیمت خروجی
۰ دلار (کاملاً رایگان)

گزینه‌های ثابت و احتمالاتی که کار را راه می‌اندازند

در هر درخواست، شما مجموعه‌ای مشخص از گزینه‌ها را به مدل می‌دهید و در پاسخ، یک خروجی ساختاریافته دریافت می‌کنید که امتیاز احتمال هر گزینه را مشخص کرده است. الگوهای قابل پشتیبانی در این مدل بسیار متنوع هستند؛ از تصمیم‌گیری‌های بله/خیر و سوالات چندگزینه‌ای گرفته تا مقیاس‌های رتبه‌بندی، ارزیابی بر اساس سنجه‌های مشخص (Rubric) و حتی بررسی کیفیت پاسخ‌های هوش مصنوعی یا اقدامات ایجنت‌ها.

برنامه‌ها می‌توانند مستقیماً روی این امتیازها حد آستانه (Threshold) تعریف کنند. برای مثال، یک سیستم مسیریابی می‌تواند اگر اطمینان مدل بالای ۰.۹۵ بود، درخواست را به طور خودکار پردازش کند؛ اگر عدد بین ۰.۶۰ تا ۰.۹۵ بود، پرونده را برای بررسی دقیق‌تر به یک مدل زبانی بزرگ‌تر بفرستد و اگر اطمینان زیر ۰.۶۰ آمد، کار را به یک اپراتور انسانی بسپارد.

فقط یک گذر مستقیم؛ حذف تمام شاخ‌وبرگ‌های اضافی

مایکروسافت مدل Qwen3.5-9B را اختصاصاً برای این کار بهینه‌سازی و پس‌آموزش کرده تا امتیازدهی را تنها در یک گذر مستقیم انجام دهد. در مسیر اجرای این مدل، هیچ خبری از تولید متن آزاد، حلقه‌های فراخوانی ابزار و زنجیره‌های استدلال چندمرحله‌ای نیست؛ رویکردی هوشمندانه که بار پردازشی را برای هر دسته‌بندی به حداقل ممکن می‌رساند.

دیاگرام معماری امتیازدهی به تصمیم‌ها در مدل Microsoft-Decision-1
نمودار مایکروسافت از جریان کاری و نحوه امتیازدهی مدل Decision-1.

تصور کنید در یک جریان کاری که نیاز به ۲۰ تصمیم متوالی دارد، اگر هر ارزیابی فقط ۱۰۰ میلی‌ثانیه طول بکشد، در مجموع دو ثانیه تأخیر ایجاد می‌شود. پایپ‌لاین‌های ایجنت معمولاً شامل ده‌ها فراخوانی متوالی برای مسیریابی، تأیید و نمره‌دهی هستند؛ بنابراین کاهش تأخیر در هر درخواست، سرعت کل سیستم را دگرگون می‌کند.

سریع‌ترین در تست‌های مایکروسافت

مایکروسافت عملکرد Decision-1 را روی ۳۶ بنچمارک مختلف با نزدیک به ۱۵۰ هزار سوال (که طبق ادعای شرکت در فرآیند آموزش مدل حضور نداشته‌اند) ارزیابی کرده است. این مدل در مقایسه با رقبا، بالا‌ترین دقت و کم‌ترین میزان تأخیر را به نام خود ثبت کرد.

معیار
نتیجه گزارش‌شده
دامنه بنچمارک
۳۶ بنچمارک و نزدیک به ۱۵۰ هزار سوال
دقت
بالا‌ترین دقت در میان مدل‌های مورد مقایسه
سرعت در مقایسه با Quyet-1.0-Large
۴.۵ برابر سریع‌تر
سرعت در مقایسه با GPT-6 Sol
۳۵ برابر سریع‌تر
نرخ تغییر تصمیم (Decision-flip)
میانگین ۱.۳ درصد در ۸ حالت تغییر ورودی

مایکروسافت حساسیت مدل به تغییرات بی‌اهمیت در ورودی را هم به چالش کشید. وقتی محققان توضیحات گزینه‌ها را بازنویسی کردند، جای گزینه‌ها را برعکس کردند یا ترتیب آن‌ها را به هم ریختند، خروجی Decision-1 هیچ تغییری نکرد؛ این موضوع نشان می‌دهد مشکل رایج در دسته‌بندهای هوش مصنوعی (یعنی اثر منفی تغییر لحن یا چیدمان گزینه‌ها) در این مدل به خوبی مهار شده است.

البته نباید فراموش کرد که این آمار‌ها نتایج گزارش‌شده توسط خود مایکروسافت است و عملکرد واقعی مدل در محیط پروداکشن به پرامپت‌ها، توزیع برچسب‌ها، سخت‌افزار، مسیر شبکه و آستانه‌های تعیین‌شده بستگی دارد؛ بنابراین قبل از جایگزین کردن این مدل با ابزار‌های فعلی‌تان، حتماً باید آن را روی داده‌های اختصاصی خودتان تست کنید.

سیگنال اطمینان؛ فرمانی برای کنترل جریان کار

مایکروسافت امتیازهای احتمالاتی این مدل را نمراتی کالیبره‌شده می‌داند. نمره ۰.۹ زمانی واقعاً کالیبره است که پیش‌بینی‌های مدل با این نمره، در ۹ مورد از هر ۱۰ مورد واقعاً درست از آب دربیایند.

برآورد قابل اعتماد از میزان اطمینان به سیستم‌های نرم‌افزاری اجازه می‌دهد در موارد واضح، خودکار دست به عمل بزنند و موارد مشکوک را ارجاع دهند. تیم‌هایی که می‌خواهند از این مدل استفاده کنند، بهتر است کالیبراسیون را با استفاده از معیارهایی مثل خطای مورد انتظار کالیبراسیون (ECE) یا امتیازات Brier روی داده‌های خود اندازه بگیرند و سپس بر اساس ریسک خطاهای مثبت یا منفی کاذب، آستانه‌های تصمیم‌گیری را تنظیم کنند.

چهار کاربرد عملیاتی در دل پروژه‌های مایکروسافت

تیم
حجم کاری
نتیجه گزارش‌شده
تیم تحقیقات Xbox
دسته‌بندی بیش از ۱۰ هزار بازخورد نظرسنجی و نقد از پلتفرم‌های استیم و ایکس در موضوعات مشخص
کیفیتی در سطح GPT-6 Sol، بیش از ۱۴ برابر سریع‌تر و ۲۰۰ برابر ارزان‌تر
تیم Copilot
نمره‌دهی به کیفیت چت‌ها و پاسخ‌های ایجنت
کیفیتی هم‌رده با GPT5.6 Luna و ۱۰۰ برابر سریع‌تر
مهندسی پشتیبانی (On-call)
انتخاب اطلاعات مرتبط از میان لاگ‌ها، تیکت‌ها، تماس‌ها و داده‌های حوادث فنی
کیفیت بازیابی و سرعتی بهتر نسبت به مدل پایه نامشخص قبلی
تیم Microsoft Discovery
امتیازدهی به آزمایش‌ها برای ایجنتی که برنامه‌اش را بازبینی و تکرار می‌کند
۴۶ برابر ثبات بیش‌تر در نمره‌دهی با ۳ برابر سرعت، و بازبرنامه‌ریزی تطبیقی نزدیک به ۴ برابر سریع‌تر

هر چهار مثال بالا گزارش‌های داخلی خود مایکروسافت هستند و در برخی از این مقایسه‌ها، جزییات دقیق مدل‌های پایه و معیارهای ارزیابی ذکر نشده است. این نتایج به خوبی نشان می‌دهند که مایکروسافت چه سناریوهایی را هدف گرفته، هرچند که برای تأیید همه‌جانبه این پیشرفت‌ها، نیاز به آزمایش‌های مستقل خارجی خواهیم داشت.

کجا عالی جواب می‌دهد و مرزهای آن کجاست؟

  • تأیید و اعتبارسنجی ایجنت: تصمیم‌گیری برای ادامه دادن، تلاش مجدد، توقف یا سپردن کار به انسان.
  • مسیریابی بین مدل‌ها: انتخاب مدل مناسب بر اساس نوع درخواست یا سطح ریسک.
  • تشخیص قصد کاربر (Intent Classification): اختصاص دادن درخواست به یک دسته‌بندی شناخته‌شده.
  • ارزیابی کیفی: نمره‌دهی به پاسخ‌ها بر اساس معیارهای تعیین‌شده.
  • جستجو و بازیابی: امتیازدهی به نتایج پیشنهادی از نظر ارتباط با موضوع.
  • فیلترهای ایمنی: تطبیق محتوا با سیاست‌ها و قوانین از پیش تعیین‌شده.
  • ایجنت‌های کنترل کامپیوتر: انتخاب اقدام بعدی از میان گزینه‌ها و ابزار‌های رابط کاربری.
  • برچسب‌گذاری داده‌ها: دسته‌بندی داده‌ها در یک آرایه‌بندی و ساختار مشخص.

از سوی دیگر، کار‌هایی که نیازمند متن‌نویسی آزاد، برنامه‌ریزی باز، اجرای ابزار‌ها یا ارائه توضیحات استدلالی هستند، کاملاً خارج از توان این مدل قرار می‌گیرند. در واقع هر درخواستی که به این مدل ارسال می‌شود، باید در قالب گزینه‌های مشخص یا نمره‌دهی مبتنی بر سنجه‌های تعیین‌شده خلاصه شود.

تست مدل روی داده‌ها و ترافیک واقعی خودتان

  1. یک مجموعه داده ارزیابی بسازید که منعکس‌کننده ورودی‌های واقعی پروداکشن، موارد نادر و توزیع برچسب‌های واقعی باشد.
  2. دقت، کالیبراسیون، تأخیر و هزینه را با سیستم مسیریابی یا دسته‌بند فعلی خود مقایسه کنید.
  3. ترتیب گزینه‌ها را به هم بریزید و آن‌ها را بازنویسی کنید تا حساسیت مدل به ترتیب و لحن کلمات سنجیده شود.
  4. آستانه‌های اطمینان جداگانه‌ای برای اقدام خودکار، ارجاع به مدل‌های بزرگ‌تر و رد درخواست تعیین کنید.
  5. تأخیر کل فرآیند را از ابتدا تا انتها با احتساب سربار شبکه و هماهنگ‌سازی بسنجید.
  6. همزمان با تغییر ترافیک ورودی، وضعیت کالیبراسیون و عملکرد مدل را در کلاس‌های مختلف زیر نظر بگیرید.

لایه‌ای اختصاصی برای تصمیم‌گیری ایجنت‌ها

مایکروسافت این دسته از مدل‌های تصمیم‌گیری را به عنوان شاخه‌ای مستقل برای تولید خروجی‌های ساختاریافته تعریف کرده که سیستم‌های نرم‌افزاری می‌توانند بی‌درنگ آن‌ها را مصرف کنند. در معماری یک ایجنت هوشمند، مدل‌های مولد معمولی می‌توانند کار‌های خلاقانه و باز را پیش ببرند، در حالی که Decision-1 وظایف تکراری مثل هدایت مسیر، نمره‌دهی، فیلترینگ و تأیید را با سرعتی سرسام‌آور بر عهده می‌گیرد.

مایکروسافت قصد دارد در آینده نسخه‌هایی بر پایه مدل‌های MAI خود و همچنین مدل‌های اوپن‌ای‌آی عرضه کند. توسعه‌دهندگان می‌توانند همین حالا ساختار ارتباطی نرم‌افزار خود را بر اساس این الگوی گزینه‌های ثابت پیاده‌سازی کنند و در آینده ببینند که آیا مدل‌های پایه‌ای جدیدتر، دقت و پوشش بهتری برای نیازهای کاری‌شان ارائه می‌دهند یا خیر.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

دسته‌گل‌های جنجالی هوش مصنوعی آنتروپیک؛ کاخ سفید گزارش تخلفات را اجباری کرد!
آخرین اخبار

دسته‌گل‌های جنجالی هوش مصنوعی آنتروپیک؛ کاخ سفید گزارش تخلفات را اجباری کرد!

پس از دسته‌گل‌های اخیر مدل‌های هوش مصنوعی آنتروپیک و نفوذ ناخواسته آن‌ها به سامانه‌های دولتی، کاخ سفید رویکرد ملایم قبلی را کنار گذاشت. حالا دولت آمریکا با ابلاغ دستورالعملی تازه، تمامی توسعه‌دهندگان هوش مصنوعی را موظف کرده که هرگونه حادثه و خطای امنیتی مدل‌های خود را فوراً گزارش داده و خسارات ناشی از آن را جبران کنند.

۴ دقیقه مطالعه
۰
۱۸ مهر
شاهکار ارتش ۲۰۰۰ ایجنتی پرایم اینتلکت؛ بازنویسی پرایم ایجنت با زبان راست و سرعت ۱۳ برابری!
آخرین اخبار

شاهکار ارتش ۲۰۰۰ ایجنتی پرایم اینتلکت؛ بازنویسی پرایم ایجنت با زبان راست و سرعت ۱۳ برابری!

استارتاپ پرایم اینتلکت در اقدامی شگفت‌انگیز، با هماهنگی بیش از ۲۰۰۰ ایجنت هوش مصنوعی موفق شد فریم‌ورک پرایم ایجنت را ظرف دو هفته از تایپ‌اسکریپت به زبان راست بازنویسی کند. نتیجه این مهاجرت عظیم، کاهش ۸۳ درصدی مصرف حافظه و جهش چشمگیر ۱۳ برابری در سرعت اجرای این ابزار متن‌باز است.

۵ دقیقه مطالعه
۰
۱۸ مهر
هوش مصنوعی کلود هر روز صبح صفحه تب جدید کروم را از نو می‌سازد؛ آن‌هم با ۷۵ سنت!
آخرین اخبار

هوش مصنوعی کلود هر روز صبح صفحه تب جدید کروم را از نو می‌سازد؛ آن‌هم با ۷۵ سنت!

پروژه متن‌باز جدیدی به نام ai-newtab با تکیه بر هوش مصنوعی کلود، هر روز صفحه تب جدید کروم را متناسب با علایق و تاریخچه وب‌گردی شما از نو می‌سازد. این ابزار با هزینه روزانه حدود ۰.۷۵ دلار، یک صفحه خانگی شخصی‌سازی‌شده و جذاب آماده می‌کند.

۲ دقیقه مطالعه
۰
۱۸ مهر