مایکروسافت از مدل Decision-1 رونمایی کرد؛ تصمیمی ۳۵ برابر سریعتر برای ایجنتهای هوش مصنوعی!
مایکروسافت از مدل تخصصی Decision-1 رونمایی کرده که وظیفه آن امتیازدهی و انتخاب آنی از بین گزینههای مشخص است و فرآیند تصمیمگیری ایجنتها را تا ۳۵ برابر سریعتر میکند. این مدل کمهزینه تنها با یک بار پردازش، تأخیرهای سنگین پایپلاینهای هوش مصنوعی را از بین میبرد و برای توکنهای خروجی هم هیچ هزینهای دریافت نمیکند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- مایکروسافت مدل جدیدی به نام Decision-1 عرضه کرده که به جای تولید متنهای طولانی، فقط گزینههای مشخص را ارزیابی و انتخاب میکند و وظایفی مثل دستهبندی و هدایت درخواستها را به دوش میکشد.
- این مدل بر پایه Qwen3.5-9B توسعه داده شده و طبق بنچمارکها تا ۳۵ برابر سریعتر از مدلهای سنگین عمل میکند؛ جالبتر اینکه مایکروسافت برای توکنهای خروجی آن حتی یک سنت هم پول نمیگیرد!
- در تستهای داخلی مایکروسافت (مثل تیم ایکسباکس و کوپایلوت)، این مدل توانسته کیفیت تصمیمگیری را در سطح بهترین مدلها حفظ کند، اما با تأخیر بسیار کمتر و تا ۲۰۰ برابر هزینه پایینتر.
رونمایی مایکروسافت از Decision-1 برای امتیازدهی سریع به گزینههای مشخص
مایکروسافت از مدل جدید Microsoft-Decision-1 رونمایی کرد؛ مدلی تخصصی که وظیفهاش امتیازدهی و انتخاب از میان یک لیست مشخص از گزینههاست. این مدل دقیقاً برای تصمیمگیریهای پرکاربرد نرمافزاری طراحی شده؛ کارهایی مثل هدایت یک درخواست (Routing)، دستهبندی تیکتهای پشتیبانی، امتیاز دادن به عملکرد ایجنتها، فیلتر کردن محتوا یا تأیید نهایی خروجیها.
این مدل در حال حاضر از طریق کاتالوگ Foundry مایکروسافت در دسترس قرار گرفته و پشتیبانی از پلتفرم OpenRouter هم به زودی به آن اضافه میشود. مدل قیمتگذاری مایکروسافت هم حسابی وسوسهانگیز است: فقط ۰.۰۴۲ دلار به ازای هر یک میلیون توکن ورودی و هزینه توکنهای خروجی هم کاملاً صفر است!
مشخصه | Microsoft-Decision-1 |
|---|---|
مدل پایه | نسخه پسآموزشدیده Qwen3.5-9B (Post-trained) |
ورودی | محتوای وظیفه، گزینههای پاسخ مشخص و معیارهای اختیاری ارزیابی |
خروجی | امتیاز احتمالاتی برای هر گزینه |
نحوه اجرا | تنها یک گذر مستقیم (One forward pass) |
قیمت ورودی | ۰.۰۴۲ دلار به ازای هر میلیون توکن |
قیمت خروجی | ۰ دلار (کاملاً رایگان) |
گزینههای ثابت و احتمالاتی که کار را راه میاندازند
در هر درخواست، شما مجموعهای مشخص از گزینهها را به مدل میدهید و در پاسخ، یک خروجی ساختاریافته دریافت میکنید که امتیاز احتمال هر گزینه را مشخص کرده است. الگوهای قابل پشتیبانی در این مدل بسیار متنوع هستند؛ از تصمیمگیریهای بله/خیر و سوالات چندگزینهای گرفته تا مقیاسهای رتبهبندی، ارزیابی بر اساس سنجههای مشخص (Rubric) و حتی بررسی کیفیت پاسخهای هوش مصنوعی یا اقدامات ایجنتها.
برنامهها میتوانند مستقیماً روی این امتیازها حد آستانه (Threshold) تعریف کنند. برای مثال، یک سیستم مسیریابی میتواند اگر اطمینان مدل بالای ۰.۹۵ بود، درخواست را به طور خودکار پردازش کند؛ اگر عدد بین ۰.۶۰ تا ۰.۹۵ بود، پرونده را برای بررسی دقیقتر به یک مدل زبانی بزرگتر بفرستد و اگر اطمینان زیر ۰.۶۰ آمد، کار را به یک اپراتور انسانی بسپارد.
فقط یک گذر مستقیم؛ حذف تمام شاخوبرگهای اضافی
مایکروسافت مدل Qwen3.5-9B را اختصاصاً برای این کار بهینهسازی و پسآموزش کرده تا امتیازدهی را تنها در یک گذر مستقیم انجام دهد. در مسیر اجرای این مدل، هیچ خبری از تولید متن آزاد، حلقههای فراخوانی ابزار و زنجیرههای استدلال چندمرحلهای نیست؛ رویکردی هوشمندانه که بار پردازشی را برای هر دستهبندی به حداقل ممکن میرساند.

تصور کنید در یک جریان کاری که نیاز به ۲۰ تصمیم متوالی دارد، اگر هر ارزیابی فقط ۱۰۰ میلیثانیه طول بکشد، در مجموع دو ثانیه تأخیر ایجاد میشود. پایپلاینهای ایجنت معمولاً شامل دهها فراخوانی متوالی برای مسیریابی، تأیید و نمرهدهی هستند؛ بنابراین کاهش تأخیر در هر درخواست، سرعت کل سیستم را دگرگون میکند.
سریعترین در تستهای مایکروسافت
مایکروسافت عملکرد Decision-1 را روی ۳۶ بنچمارک مختلف با نزدیک به ۱۵۰ هزار سوال (که طبق ادعای شرکت در فرآیند آموزش مدل حضور نداشتهاند) ارزیابی کرده است. این مدل در مقایسه با رقبا، بالاترین دقت و کمترین میزان تأخیر را به نام خود ثبت کرد.
معیار | نتیجه گزارششده |
|---|---|
دامنه بنچمارک | ۳۶ بنچمارک و نزدیک به ۱۵۰ هزار سوال |
دقت | بالاترین دقت در میان مدلهای مورد مقایسه |
سرعت در مقایسه با Quyet-1.0-Large | ۴.۵ برابر سریعتر |
سرعت در مقایسه با GPT-6 Sol | ۳۵ برابر سریعتر |
نرخ تغییر تصمیم (Decision-flip) | میانگین ۱.۳ درصد در ۸ حالت تغییر ورودی |
مایکروسافت حساسیت مدل به تغییرات بیاهمیت در ورودی را هم به چالش کشید. وقتی محققان توضیحات گزینهها را بازنویسی کردند، جای گزینهها را برعکس کردند یا ترتیب آنها را به هم ریختند، خروجی Decision-1 هیچ تغییری نکرد؛ این موضوع نشان میدهد مشکل رایج در دستهبندهای هوش مصنوعی (یعنی اثر منفی تغییر لحن یا چیدمان گزینهها) در این مدل به خوبی مهار شده است.
البته نباید فراموش کرد که این آمارها نتایج گزارششده توسط خود مایکروسافت است و عملکرد واقعی مدل در محیط پروداکشن به پرامپتها، توزیع برچسبها، سختافزار، مسیر شبکه و آستانههای تعیینشده بستگی دارد؛ بنابراین قبل از جایگزین کردن این مدل با ابزارهای فعلیتان، حتماً باید آن را روی دادههای اختصاصی خودتان تست کنید.
سیگنال اطمینان؛ فرمانی برای کنترل جریان کار
مایکروسافت امتیازهای احتمالاتی این مدل را نمراتی کالیبرهشده میداند. نمره ۰.۹ زمانی واقعاً کالیبره است که پیشبینیهای مدل با این نمره، در ۹ مورد از هر ۱۰ مورد واقعاً درست از آب دربیایند.
برآورد قابل اعتماد از میزان اطمینان به سیستمهای نرمافزاری اجازه میدهد در موارد واضح، خودکار دست به عمل بزنند و موارد مشکوک را ارجاع دهند. تیمهایی که میخواهند از این مدل استفاده کنند، بهتر است کالیبراسیون را با استفاده از معیارهایی مثل خطای مورد انتظار کالیبراسیون (ECE) یا امتیازات Brier روی دادههای خود اندازه بگیرند و سپس بر اساس ریسک خطاهای مثبت یا منفی کاذب، آستانههای تصمیمگیری را تنظیم کنند.
چهار کاربرد عملیاتی در دل پروژههای مایکروسافت
تیم | حجم کاری | نتیجه گزارششده |
|---|---|---|
تیم تحقیقات Xbox | دستهبندی بیش از ۱۰ هزار بازخورد نظرسنجی و نقد از پلتفرمهای استیم و ایکس در موضوعات مشخص | کیفیتی در سطح GPT-6 Sol، بیش از ۱۴ برابر سریعتر و ۲۰۰ برابر ارزانتر |
تیم Copilot | نمرهدهی به کیفیت چتها و پاسخهای ایجنت | کیفیتی همرده با GPT5.6 Luna و ۱۰۰ برابر سریعتر |
مهندسی پشتیبانی (On-call) | انتخاب اطلاعات مرتبط از میان لاگها، تیکتها، تماسها و دادههای حوادث فنی | کیفیت بازیابی و سرعتی بهتر نسبت به مدل پایه نامشخص قبلی |
تیم Microsoft Discovery | امتیازدهی به آزمایشها برای ایجنتی که برنامهاش را بازبینی و تکرار میکند | ۴۶ برابر ثبات بیشتر در نمرهدهی با ۳ برابر سرعت، و بازبرنامهریزی تطبیقی نزدیک به ۴ برابر سریعتر |
هر چهار مثال بالا گزارشهای داخلی خود مایکروسافت هستند و در برخی از این مقایسهها، جزییات دقیق مدلهای پایه و معیارهای ارزیابی ذکر نشده است. این نتایج به خوبی نشان میدهند که مایکروسافت چه سناریوهایی را هدف گرفته، هرچند که برای تأیید همهجانبه این پیشرفتها، نیاز به آزمایشهای مستقل خارجی خواهیم داشت.
کجا عالی جواب میدهد و مرزهای آن کجاست؟
- تأیید و اعتبارسنجی ایجنت: تصمیمگیری برای ادامه دادن، تلاش مجدد، توقف یا سپردن کار به انسان.
- مسیریابی بین مدلها: انتخاب مدل مناسب بر اساس نوع درخواست یا سطح ریسک.
- تشخیص قصد کاربر (Intent Classification): اختصاص دادن درخواست به یک دستهبندی شناختهشده.
- ارزیابی کیفی: نمرهدهی به پاسخها بر اساس معیارهای تعیینشده.
- جستجو و بازیابی: امتیازدهی به نتایج پیشنهادی از نظر ارتباط با موضوع.
- فیلترهای ایمنی: تطبیق محتوا با سیاستها و قوانین از پیش تعیینشده.
- ایجنتهای کنترل کامپیوتر: انتخاب اقدام بعدی از میان گزینهها و ابزارهای رابط کاربری.
- برچسبگذاری دادهها: دستهبندی دادهها در یک آرایهبندی و ساختار مشخص.
از سوی دیگر، کارهایی که نیازمند متننویسی آزاد، برنامهریزی باز، اجرای ابزارها یا ارائه توضیحات استدلالی هستند، کاملاً خارج از توان این مدل قرار میگیرند. در واقع هر درخواستی که به این مدل ارسال میشود، باید در قالب گزینههای مشخص یا نمرهدهی مبتنی بر سنجههای تعیینشده خلاصه شود.
تست مدل روی دادهها و ترافیک واقعی خودتان
- یک مجموعه داده ارزیابی بسازید که منعکسکننده ورودیهای واقعی پروداکشن، موارد نادر و توزیع برچسبهای واقعی باشد.
- دقت، کالیبراسیون، تأخیر و هزینه را با سیستم مسیریابی یا دستهبند فعلی خود مقایسه کنید.
- ترتیب گزینهها را به هم بریزید و آنها را بازنویسی کنید تا حساسیت مدل به ترتیب و لحن کلمات سنجیده شود.
- آستانههای اطمینان جداگانهای برای اقدام خودکار، ارجاع به مدلهای بزرگتر و رد درخواست تعیین کنید.
- تأخیر کل فرآیند را از ابتدا تا انتها با احتساب سربار شبکه و هماهنگسازی بسنجید.
- همزمان با تغییر ترافیک ورودی، وضعیت کالیبراسیون و عملکرد مدل را در کلاسهای مختلف زیر نظر بگیرید.
لایهای اختصاصی برای تصمیمگیری ایجنتها
مایکروسافت این دسته از مدلهای تصمیمگیری را به عنوان شاخهای مستقل برای تولید خروجیهای ساختاریافته تعریف کرده که سیستمهای نرمافزاری میتوانند بیدرنگ آنها را مصرف کنند. در معماری یک ایجنت هوشمند، مدلهای مولد معمولی میتوانند کارهای خلاقانه و باز را پیش ببرند، در حالی که Decision-1 وظایف تکراری مثل هدایت مسیر، نمرهدهی، فیلترینگ و تأیید را با سرعتی سرسامآور بر عهده میگیرد.
مایکروسافت قصد دارد در آینده نسخههایی بر پایه مدلهای MAI خود و همچنین مدلهای اوپنایآی عرضه کند. توسعهدهندگان میتوانند همین حالا ساختار ارتباطی نرمافزار خود را بر اساس این الگوی گزینههای ثابت پیادهسازی کنند و در آینده ببینند که آیا مدلهای پایهای جدیدتر، دقت و پوشش بهتری برای نیازهای کاریشان ارائه میدهند یا خیر.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

دستهگلهای جنجالی هوش مصنوعی آنتروپیک؛ کاخ سفید گزارش تخلفات را اجباری کرد!
پس از دستهگلهای اخیر مدلهای هوش مصنوعی آنتروپیک و نفوذ ناخواسته آنها به سامانههای دولتی، کاخ سفید رویکرد ملایم قبلی را کنار گذاشت. حالا دولت آمریکا با ابلاغ دستورالعملی تازه، تمامی توسعهدهندگان هوش مصنوعی را موظف کرده که هرگونه حادثه و خطای امنیتی مدلهای خود را فوراً گزارش داده و خسارات ناشی از آن را جبران کنند.

شاهکار ارتش ۲۰۰۰ ایجنتی پرایم اینتلکت؛ بازنویسی پرایم ایجنت با زبان راست و سرعت ۱۳ برابری!
استارتاپ پرایم اینتلکت در اقدامی شگفتانگیز، با هماهنگی بیش از ۲۰۰۰ ایجنت هوش مصنوعی موفق شد فریمورک پرایم ایجنت را ظرف دو هفته از تایپاسکریپت به زبان راست بازنویسی کند. نتیجه این مهاجرت عظیم، کاهش ۸۳ درصدی مصرف حافظه و جهش چشمگیر ۱۳ برابری در سرعت اجرای این ابزار متنباز است.

هوش مصنوعی کلود هر روز صبح صفحه تب جدید کروم را از نو میسازد؛ آنهم با ۷۵ سنت!
پروژه متنباز جدیدی به نام ai-newtab با تکیه بر هوش مصنوعی کلود، هر روز صفحه تب جدید کروم را متناسب با علایق و تاریخچه وبگردی شما از نو میسازد. این ابزار با هزینه روزانه حدود ۰.۷۵ دلار، یک صفحه خانگی شخصیسازیشده و جذاب آماده میکند.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.