پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

رونمایی علی‌بابا از Qwen Intelligence: سه ایجنت هوش مصنوعی برای اتوماسیون گوشی‌های هوشمند

انتشار:۱ مهر ۱۴۰۵(۵ روز پیش)
۶ دقیقه زمان مطالعه
۰ دیدگاه

علی‌بابا از سیستم جدید Qwen Intelligence رونمایی کرد که با استفاده از سه ایجنت تخصصی، وظایف پیچیده در گوشی‌های هوشمند را به صورت خودکار انجام می‌دهد. ایجنت Qwen-UI در بنچمارک‌های مختلف عملکرد درخشانی ثبت کرده است.

رونمایی علی‌بابا از Qwen Intelligence: سه ایجنت هوش مصنوعی برای اتوماسیون گوشی‌های هوشمند

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • معرفی سیستم سه‌گانه Qwen Intelligence توسط علی‌بابا شامل ایجنت‌های برنامه‌ریز، رابط کاربری و خلاق برای مدیریت خودکار گوشی‌های هوشمند.
  • انتشار بنچمارک منبع‌باز MobileWorld برای ارزیابی جریان‌های کاری طولانی و چندبرنامه‌ای با قابلیت بررسی دقیق وضعیت سیستم.
  • ثبت امتیاز ۸۲٫۱ توسط Qwen-UI-Agent در بنچمارک MobileWorld و پشت سر گذاشتن مدل‌های رقیب در کنترل رابط کاربری.

علی‌بابا اتوماسیون گوشی‌های هوشمند را به سه ایجنت Qwen می‌سپارد

آزمایشگاه Tongyi متعلق به شرکت Alibaba از سیستم جدید Qwen Intelligence رونمایی کرد؛ یک پشته نرم‌افزاری مبتنی بر سه ایجنت که برای برنامه‌ریزی وظایف در گوشی‌های هوشمند، کار با اپلیکیشن‌ها و تولید تصویر طراحی شده است. این آزمایشگاه همچنین بنچمارک منبع‌باز MobileWorld را منتشر کرد که برای ارزیابی جریان‌های کاری طولانی‌تر در چندین اپلیکیشن، نیاز به شفاف‌سازی درخواست‌ها و ترکیب تعاملات صفحه نمایش با ابزارهای خارجی توسعه یافته است.

ایجنت‌های موبایل درخواست‌های مطرح‌شده به زبان طبیعی را به مجموعه‌ای از اقدامات در اپلیکیشن‌ها تبدیل می‌کنند. سیستم Qwen Intelligence این فرآیند را بین سه بخش مجزا تقسیم می‌کند:

  • Mobile Planner Agent: درخواست‌ها را تجزیه کرده، ایجنت‌های زیرمجموعه را هماهنگ می‌کند و وضعیت وظایف را زیر نظر می‌گیرد.
  • Mobile Use Agent: در صورت وجود ابزارهای ساختاریافته، گوشی را از طریق آن‌ها کنترل می‌کند و در غیر این صورت، از لمس و کشیدن (Swipe) روی صفحه بهره می‌برد. Alibaba این بخش را با نام Qwen-UI-Agent منتشر کرده است.
  • Mobile Creative Agent: تنها در حدود سه ثانیه، از روی یک پرامپت یک‌جمله‌ای تصویر تولید می‌کند. بنا بر اعلام Alibaba، سرعت این ایجنت تقریباً دو برابر رقبای پیشرو است؛ هرچند مقایسه دقیق تأخیر نیازمند سخت‌افزار و تنظیمات تولید یکسان است.

میزان دسترسی به هر یک از این اجزا متفاوت است. کد و منابع ارزیابی MobileWorld به صورت عمومی در دسترس قرار دارند، ایجنت برنامه‌ریز مخزن اختصاصی خود را دارد و جزئیات سایر ایجنت‌ها در صفحات پروژه منتشر شده است. تیم‌های توسعه باید وزن مدل‌ها، مجوزها، اپلیکیشن‌های پشتیبانی‌شده و پیش‌نیازهای دستگاه را برای هر بخش بررسی کنند. آمارهای عملکردی ارائه‌شده توسط سازنده گزارش شده‌اند و هنوز توسط مراجع مستقل تایید نشده‌اند.

بنچمارک MobileWorld جریان‌های کاری را گسترش می‌دهد

بنچمارک MobileWorld شامل ۲۰۱ وظیفه در ۲۰ اپلیکیشن مختلف است. وظایف این بنچمارک به طور میانگین تقریباً دو برابر بنچمارک رایج AndroidWorld به مراحل بیشتری نیاز دارند و بسیار بیشتر شامل جریان‌های کاری بین چند اپلیکیشن می‌شوند.

معیار
MobileWorld
AndroidWorld
میانگین مراحل تکمیل
۲۷٫۸
۱۴٫۳
وظایف بین‌برنامه‌ای (Cross-app)
۶۲٫۲٪
۹٫۵٪

دو دسته از وظایف، ارزیابی‌ها را فراتر از دستورالعمل‌های ثابت و ناوبری در صفحه نمایش می‌برند:

  • وظایف تعامل ایجنت و کاربر: ۲۲٫۴ درصد از این مجموعه آزمایش می‌کند که آیا ایجنت در صورت مبهم بودن دستورات، سوالات مفیدی می‌پرسد یا خیر. یک کاربر شبیه‌سازی‌شده مبتنی بر GPT-4.1 پاسخ‌ها را ارائه می‌دهد تا تعاملات قابل تکرار باشند.
  • وظایف تقویت‌شده با MCP: در ۱۹٫۹ درصد از وظایف، ایجنت‌ها باید کنترل رابط گرافیکی را با ابزارهای خارجی ارائه‌شده از طریق پروتکل زمینه مدل (MCP) ترکیب کنند.
مقایسه طول وظایف و پوشش بین‌برنامه‌ای در AndroidWorld و MobileWorld
بنچمارک MobileWorld بر وظایف طولانی‌تر و جریان‌های کاری که چندین اپلیکیشن را در بر می‌گیرند، تمرکز دارد.

بررسی وضعیت، اجرای مجدد را امکان‌پذیر می‌کند

بنچمارک MobileWorld درون Docker همراه با یک شبیه‌ساز کامل اندروید، بک‌اندهای محلی اپلیکیشن‌ها و سیستم اعتبارسنجی قطعی اجرا می‌شود. سیستم ارزیاب برای تعیین اینکه آیا ایجنت به وضعیت نهایی مطلوب رسیده است یا خیر، سوابق پایگاه داده، فضای ذخیره‌سازی محلی و فراخوانی‌های اپلیکیشن (callbacks) را بررسی می‌کند.

سرویس‌های محلی به این بنچمارک اجازه می‌دهند تا بدون وابستگی به APIهای متغیر شرکت‌های ثالث، برنامه‌های وابسته به بک‌اند مانند پیام‌رسان‌ها را در خود جای دهد. بررسی وضعیت نهایی همچنین ابهامات مربوط به ارزیابی بصری یا دستی را کاهش می‌دهد؛ جایی که ممکن است ظاهر صفحه نمایش درست به نظر برسد اما تراکنش زیرساختی با شکست مواجه شده باشد.

ترکیب ابزارها و کنترل لمسی در Qwen-UI-Agent

بر اساس گزارش Alibaba، ایجنت Qwen-UI-Agent در بنچمارک MobileWorld امتیاز ۸۲٫۱ را کسب کرده است، در حالی که این رقم برای Seed 2.1 Pro برابر ۷۳٫۲ و برای GPT-5.6 معادل ۷۰٫۱ بوده است. این مدل در MobileWorld-Real به امتیاز ۹۲٫۲ و در AndroidDaily به امتیاز ۹۷٫۵ دست یافته است.

بنچمارک
مدل
امتیاز
MobileWorld
Qwen-UI-Agent
۸۲٫۱
Seed 2.1 Pro
۷۳٫۲
GPT-5.6
۷۰٫۱
MobileWorld-Real
Qwen-UI-Agent
۹۲٫۲
AndroidDaily
Qwen-UI-Agent
۹۷٫۵

امتیازهای نسخه‌های مختلف بنچمارک‌ها به طور مستقیم قابل مقایسه نیستند. تفاوت‌ها در انتخاب وظایف، محیط اجرا و ابزارهای در دسترس می‌توانند بر نتایج تأثیر بگذارند؛ بنابراین، فاصله ۱۰٫۱ امتیازی بین MobileWorld و MobileWorld-Real را نمی‌توان بدون انجام آزمایش‌های کنترل‌شده، مستقیماً به استفاده از API یا MCP نسبت داد.

ایجنت Qwen-UI-Agent قابلیت‌های خود را در خارج از حوزه کنترل گوشی نیز حفظ کرده است. این مدل امتیاز ۷۲٫۴ را در بنچمارک چندوجهی MMMU-Pro، امتیاز ۸۲٫۸ را در بنچمارک ریاضیات بصری MathVision و امتیاز ۵۰٫۱ را در Terminal-Bench 2.0 ثبت کرده است. طبق اعلام Alibaba، مدل‌های UI-Venus 30B و GUI-Owl 32B که برای رابط‌های گرافیکی تخصصی شده‌اند، در Terminal-Bench به ترتیب امتیازهای ۳٫۲ و ۰٫۰ را به دست آورده‌اند.

با این حال، تعامل در محیط دسکتاپ هنوز از پایداری کمتری برخوردار است. ایجنت Qwen-UI-Agent در بنچمارک OSWorld-v2 امتیاز ۴۰٫۰ را برای پیشرفت نسبی ثبت کرده که پایین‌تر از امتیاز ۵۴٫۸ مدل Claude Opus 4.8 است. بنچمارک OSWorld کار با رایانه را در وظایف طولانی‌تر دسکتاپ ارزیابی می‌کند و این نتیجه نشان‌دهنده چالش‌های ادامه‌دار در درک دقیق رابط کاربری و اجرای زنجیره طولانی از اقدامات است.

آموزش ایجنت برنامه‌ریز با استفاده از سوابق اجرا

ایجنت برنامه‌ریز Qwen-Planner-Agent از یک مدل ۲۷ میلیارد پارامتری همراه با یک ساختار وضعیت‌محور بهره می‌برد که حافظه را ذخیره کرده، اسکیل‌های قابل استفاده مجدد را مدیریت می‌کند و ایجنت‌های زیرمجموعه را به کار می‌گیرد. بر اساس گزارش Alibaba، این ایجنت در بنچمارک MobilePA-Bench امتیاز کلی ۷۷٫۰۵ درصد را کسب کرده است که ۹٫۸۳ واحد درصد بالاتر از خط پایه تعیین‌شده توسط تیم سازنده است.

مدل
امتیاز کلی
Qwen-Planner-Agent
۷۷٫۰۵٪
GPT 6 Astra
۷۶٫۸۴٪
Claude Opus 5
۷۵٫۷۱٪

شرکت Alibaba هزینه توکن‌های خروجی را حدود ۲٫۴۱ دلار به ازای هر ۱۰۰۰ وظیفه تخمین می‌زند. این برآورد شامل توکن‌های ورودی، زیرساخت دستگاه و میزبانی اپلیکیشن‌ها نمی‌شود؛ عواملی که همگی در محاسبه هزینه‌های نهایی تولید اهمیت دارند.

تیم توسعه‌دهنده، روش آموزشی خود را CARE (مخفف آموزش برنامه‌ریز تطبیق‌پذیر با مهارت) نامیده است. این روش، یادگیری نظارت‌شده با تمرکز بر برنامه‌ریزی را با یادگیری تقویتی در محیط‌های ترکیبی ادغام می‌کند. تکنیک CARE پاداش‌ها و برآورد مزیت‌ها را بر اساس میزان مهارت فعلی مدل تنظیم می‌کند؛ به طوری که به موارد از پیش تسلط‌یافته وزن کمتری می‌دهد و در عین حال، شکست‌های دشوار را برای حفظ ثبات آموزش مقیاس‌بندی می‌کند.

سوابق اجرای ایجنت‌های مستقرشده، مجدداً به فرآیند ساخت وظایف، انتخاب مسیرها و آموزش برنامه‌ریز بازگردانده می‌شوند. این سیستم می‌تواند از این سوابق برای شناسایی خطاهای پرتکرار، گردآوری نمونه‌های بهتر و بهبود اسکیل‌های در دسترس برای اجراهای بعدی استفاده کند.

دستور پخت غذاها به آزمون‌های چندبرنامه‌ای تبدیل می‌شوند

دموهای ارائه‌شده توسط Alibaba گستره اهداف این سیستم را به خوبی نشان می‌دهند. در یکی از وظایف، ایجنت پلتفرم Douyin را برای یافتن پربازدیدترین پست مربوط به دستور پخت یک غذا جستجو می‌کند، مواد لازم را استخراج کرده، اپلیکیشن خرید خواروبار Hema را باز می‌کند، ادویه‌ها را کنار می‌گذارد، اقلام باقی‌مانده را به سبد خرید اضافه کرده و زمان ارسال را برنامه‌ریزی می‌کند. وظیفه دیگر، جستجوی هتل در Trip.com را با مقایسه زمان پیاده‌روی در پلتفرم Amap ترکیب می‌کند.

نمونه‌هایی از MobileWorld شامل شفاف‌سازی با کاربر و ابزارهای MCP
وظایف نمونه شامل ترکیبی از ناوبری در اپلیکیشن‌ها، ابزارهای خارجی، اعمال محدودیت‌ها و شفاف‌سازی درخواست‌ها هستند.

این جریان‌های کاری قابلیت‌هایی را می‌سنجند که وظایف کوتاه و تک‌برنامه‌ای به ندرت آن‌ها را پوشش می‌دهند:

  • حفظ وضعیت در چندین اپلیکیشن و در زنجیره‌های طولانی از اقدامات
  • اعمال محدودیت‌هایی مانند بودجه‌بندی، استثنائات و زمان‌بندی ارسال
  • درخواست شفاف‌سازی پیش از انجام اقدامات مهم و پیامددار
  • ترکیب APIهای ساختاریافته یا ابزارهای MCP با تعاملات مبتنی بر صفحه نمایش
  • بازیابی و اصلاح روند در صورت شکست اپلیکیشن، فراخوانی ابزار یا مراحل میانی

ادغام APIها در ساختار ایجنت‌ها

بنچمارک MobileWorld راهی را در اختیار توسعه‌دهندگان قرار می‌دهد تا معماری‌های ترکیبی از برنامه‌ریزها، فراخوانی ابزارها و کنترل گرافیکی را در شرایطی قابل تکرار آزمایش کنند. ابزارهای نظارتی بک‌اند آن نیز دسته‌هایی از اپلیکیشن‌ها را پوشش می‌دهند که به دلیل نیاز به پیام‌رسانی، حساب‌های کاربری یا وضعیت سمت سرور، اغلب در مجموعه‌های آزمایشی قطعی نادیده گرفته می‌شدند.

طراحی این سیستم چندین رویکرد کاربردی را برای توسعه سیستم‌های مبتنی بر ایجنت موبایل پیشنهاد می‌دهد:

  • در صورت امکان، اقدامات پایدار اپلیکیشن‌ها را از طریق APIها یا ابزارهای MCP در دسترس قرار دهید.
  • برای اپلیکیشن‌ها و اقداماتی که فاقد رابط‌های ساختاریافته هستند، کنترل گرافیکی را حفظ کنید.
  • نتایج را به جای تکیه صرف بر اسکرین‌شات‌ها، از طریق وضعیت اپلیکیشن، پایگاه‌های داده و فراخوانی‌ها اعتبارسنجی کنید.
  • فرآیند برنامه‌ریزی را از اجرا جدا کنید تا هر لایه بتواند به طور مستقل ارزیابی و بهبود یابد.
  • درخواست شفاف‌سازی و تأیید را به عنوان مراحل صریح در جریان‌های کاری همراه با ابهام یا پیامدهای مالی در نظر بگیرید.

بنچمارک MobileWorld به همراه لینک‌هایی به مجموعه داده‌ها و جدول امتیازات عمومی آن در GitHub در دسترس است. برنامه‌های میزبانی‌شده به صورت محلی و بررسی‌های قطعی، آن را به ابزاری مناسب برای مقایسه نسخه‌های مختلف ایجنت‌ها بدون انحراف امتیاز ناشی از تغییر سرویس‌های خارجی تبدیل می‌کند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر