پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

رویارویی Meta Muse با ChatGPT-6 در ۵ چالش روزمره؛ کدام چتبات پیروز شد؟

انتشار:۵ مهر ۱۴۰۵(۱ روز پیش)
۶ دقیقه زمان مطالعه
۰ دیدگاه

در یک ارزیابی مقایسه‌ای و تجربی، مدل هوش مصنوعی جدید Meta Muse در برابر ChatGPT-6 در ۵ سناریوی کاربردی روزمره از جمله برنامه‌ریزی، نگارش پیام و حل مسئله به چالش کشیده شد تا توانایی واقعی آن‌ها در مواجهه با پرامپت‌های کاربران سنجیده شود.

رویارویی Meta Muse با ChatGPT-6 در ۵ چالش روزمره؛ کدام چتبات پیروز شد؟

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مدل جدید Meta Muse در پنج سناریوی کاربردی روزمره شامل نگارش، برنامه‌ریزی، حل مسئله، آموزش مفاهیم و خلاقیت با ChatGPT-6 مقایسه شد.
  • مدل هوش مصنوعی Meta در درک ظرافت‌های لحن انسانی، ساده‌سازی مفاهیم و روانشناسی رفتار کاربر برتری داشت و ۳ بر ۲ پیروز شد.
  • در نقطه مقابل، ChatGPT-6 در واقع‌گرایی عملیاتی، پایبندی دقیق به محدودیت‌های زمانی و بودجه‌ای و تحلیل نیازهای پنهان عملکرد بهتری ثبت کرد.

شرکت Meta مدل هوش مصنوعی جدیدی را معرفی کرده است؛ از همین رو بررسی عملکرد آن در برابر پرامپت‌های واقعی و روزمره‌ای که کاربران استفاده می‌کنند، به‌ویژه در مقایسه با ChatGPT-6، اهمیت بالایی دارد.

مدل Meta Muse تازه‌ترین دستاورد این شرکت به شمار می‌رود و درست در زمانی عرضه شده که ChatGPT به چتبات پیش‌فرض میلیون‌ها کاربر در سراسر جهان تبدیل شده است. با این حال، بنچمارک‌ها تنها بخشی از واقعیت را نشان می‌دهند. آن‌چه در عمل برای کاربران اهمیت بیشتری دارد این است که آیا یک هوش مصنوعی می‌تواند پیام متنی حساسی را که کاربر مدت‌ها از ارسال آن طفره رفته بنویسد، یک برنامه تفریحی واقع‌گرایانه برای خانواده بچیند یا مفهومی پیچیده را بدون سردرگم‌کردن مخاطب توضیح دهد؟

در همین راستا، در یک بررسی تجربی دو مدل Meta Muse و ChatGPT با پنج پرامپت روزمره در زمینه‌های نگارش، برنامه‌ریزی، حل مسئله، توضیح مفاهیم و استدلال خلاقانه مورد آزمون قرار گرفتند تا مشخص شود کدام مدل درک دقیق‌تری از خواسته کاربر دارد و خروجی کاربردی‌تری ارائه می‌دهد.

پس از گذراندن این پنج مرحله، یکی از این دو مدل به عنوان برنده نهایی مشخص شد؛ هرچند رقابت میان آن‌ها بسیار نزدیک‌تر از حد انتظار بود.

۱. مدیریت یک موقعیت حساس و معذب‌کننده

screenshot
ارزیابی خروجی چتبات‌ها در نگارش پیام به همسایه

پرامپت: همسایه من سطل‌های زباله‌اش را جلوی مسیر خروجی پارکینگ من می‌گذارد و دنده‌عقب بیرون آمدن را سخت می‌کند. یک پیام متنی بنویس و مودبانه از او بخواه این کار را متوقف کند. چون رابطه خوبی با هم داریم لحن باید دوستانه باشد، اما در عین حال کاملاً واضح باشد تا رفتارش را تغییر دهد. مراقب باش لحن پیام پرخاشگرانه-منفعلانه (Passive-aggressive) به نظر نرسد.

ChatGPT مستقیماً به سراغ اصل مطلب رفت و پیامی تولید کرد که هرگونه ابهام درباره میزان جابه‌جایی سطل‌ها را برطرف می‌کرد.

Meta پیامی محترمانه و بسیار طبیعی ارائه داد. درخواست کاملاً لحنی همسایگی داشت و عبارت‌بندی به شکلی بود که موضوع را به جای یک معضل بزرگ، به عنوان یک جابه‌جایی جزئی جلوه می‌داد.

برنده: Meta؛ زیرا پیش‌نویس آن محدودیت‌های لحن را برای حفظ یک رابطه همسایگی دوستانه بهتر رعایت کرد. در مقابل، پیام ChatGPT با وجود وضوح کامل، بیشتر شبیه یک اخطاریه رسمی ساختمان بود و تا حدی لحن منفعلانه-پرخاشگرانه داشت.

۲. برنامه‌ریزی بر اساس محدودیت‌ها

screenshot
ارزیابی برنامه‌ریزی شهری با محدودیت بودجه و زمان

پرامپت: یک روز شنبه در شهر نیویورک را برای خانواده‌ای با سه فرزند ۵، ۹ و ۱۲ ساله برنامه‌ریزی کن. بودجه ما برای تفریحات و غذا ۲۰۰ دلار است، تمایلی به پیاده‌روی طولانی در تمام طول روز نداریم و حداقل به یک فعالیت در فضای سرپوشیده برای مواقع بارانی نیاز داریم. یک جدول زمانی واقع‌گرایانه از ساعت ۱۰ صبح تا ۷ عصر ارائه بده.

ChatGPT از نظر دسته‌بندی جغرافیایی عملکرد بسیار خوبی داشت و تضمین کرد که میزان پیاده‌روی در بخش اول روز کوتاه باشد. همچنین پیشنهاد گزینه‌های رایگان و توزیع مناسب انرژی در طول روز با در نظر گرفتن بخش‌های نشسته و استراحت بسیار کاربردی بود.

Meta جاذبه‌ای با جذابیت بسیار بالاتر برای رده سنی کودکان (۵، ۹ و ۱۲ سال) انتخاب کرد؛ موزه تاریخ طبیعی آمریکا (AMNH) به راحتی می‌تواند هر سه رده سنی را مجذوب کند. همچنین این مدل با اشاره به قانون رایگان بودن مترو برای کودکان زیر ۴۴ اینچ و پیشنهاد زمین بازی دقیقاً روبروی خیابان و ارائه نکات کاربردی مانند نشستن در سمت راست کشتی فری، دانش دقیق حمل‌ونقل شهری خود را به نمایش گذاشت.

برنده: ChatGPT؛ اگرچه برنامه Meta روی کاغذ جذاب‌تر به نظر می‌رسید، اما محاسبات بودجه آن بر پایه فرضیه اثبات‌نشده اقامت در منطقه نیویورک بنا شده بود. در نهایت ChatGPT به دلیل پایبندی دقیق به محدودیت‌های مالی و لجستیکی برنده این مرحله شد.

۳. مشاوره و حل مسئله فوری

screenshot
بررسی توانایی چتبات‌ها در مدیریت زمان و اولویت‌بندی کارها

پرامپت: تنها ۴۵ دقیقه تا رسیدن مهمان‌ها فرصت دارم. آشپزخانه نامرتب است، پذیرایی نیاز به جاروبرقی دارد، لباس‌ها روی کاناپه ریخته‌اند و هنوز باید دوش بگیرم. کارآمدترین برنامه را برای انجام کارها بده و مشخص کن اگر وقت کم آوردم از کدام کارها صرف‌نظر کنم.

ChatGPT نقطه کور مهمی را پیش‌بینی کرد که در پرامپت فراموش شده بود: سرویس بهداشتی مهمانان. اختصاص یک بازه ۵ دقیقه‌ای برای بررسی دستمال و تمیز کردن روشویی، تفاوت بین یک برنامه عادی و یک برنامه کاملاً واقع‌بینانه بود. این مدل همچنین چارچوب زمانی مشخصی برای حمام در نظر گرفت تا از تاخیر کاربر جلوگیری شود.

Meta مشاوره‌های رفتاری مفیدی ارائه داد و منطق تقسیم‌بندی زمان را شفاف توضیح داد و بر لزوم تنظیم تایمر تاکید کرد. همچنین قالب‌بندی زمان‌بندی آن خواناتر از ChatGPT بود.

برنده: ChatGPT؛ این مدل به دلیل واقع‌گرایی عملیاتی و پیش‌بینی نیازهای ذکرنشده به پیروزی رسید. اگرچه توصیه Meta برای استفاده از تایمر هوشمندانه بود، اما زمان‌بندی آن برای تمیز کردن آشپزخانه عملی به نظر نمی‌رسید. ChatGPT متوجه شد که در ۴۵ دقیقه، هدف اصلی مرتب‌سازی ظاهری و نظم دادن است، نه شست‌وشو و تمیزکاری اساسی.

۴. توضیح مفاهیم پیچیده به زبان ساده

screenshot
ارزیابی تطبیق لحن و ساده‌سازی مفاهیم علمی برای کودکان

پرامپت: دلیل پرواز هواپیما و ماندن آن در آسمان را برای یک کودک کنجکاو ۱۰ ساله توضیح بده. از معادلات استفاده نکن و فرض نکن مفاهیمی مثل برا (Lift)، پسا (Drag) یا فشار هوا را می‌داند. پاسخ زیر ۲۰۰ کلمه باشد و از تمثیلی تصویری و ملموس استفاده کن.

ChatGPT مکانیزم فیزیکی شهودی و دقیقی ارائه داد: بال‌ها هوا را به سمت پایین هدایت می‌کنند که باعث می‌شود هواپیما به سمت بالا رانده شود (ترجمه ساده قانون سوم نیوتون).

Meta لحن خود را کاملاً با مخاطب هدف هماهنگ کرد. لحن پاسخ پرانرژی و متناسب با یک کودک ۱۰ ساله بود. این مدل از یک تمثیل ملموس یعنی بیرون بردن دست از پنجره خودرو استفاده کرد و آن را با موشک‌های کاغذی و باند فرودگاه پیوند زد تا اهمیت سرعت رو به جلو را به تصویر بکشد.

برنده: Meta؛ این مدل با حفظ لحنی پرنشاط، سطح زبان کودک ۱۰ ساله را بدون هیچ حس تحقیرآمیزی رعایت کرد و توضیحی به‌یادماندنی و شفاف ارائه داد.

۵. استدلال خلاقانه و نوآوری

screenshot
سنجش خلاقیت مدل‌ها در ایده طراحی اپلیکیشن خانگی

پرامپت: یک اپلیکیشن جدید طراحی کن که مشکلی کوچک اما آزاردهنده را در کارهای روزمره خانه حل کند. این برنامه نباید فهرست وظایف (To-do list)، برنامه‌ریز غذایی، اپلیکیشن بودجه‌بندی یا ریموت خانه هوشمند باشد. نامی برای آن انتخاب کن، مشکل را توضیح بده، شیوه کارکرد آن را شرح بده و بگو چرا کاربران پس از هفته اول همچنان از آن استفاده خواهند کرد.

ChatGPT معضلی فراگیر را بدون نیاز به فهرست‌بندی تمام وسایل خانه حل کرد؛ مدل تعاملی آن با گرفتن یک عکس و ثبت صوتی توضیحات (مثل «چراغ‌های تزئینی در جعبه آبی») بسیار کم‌زحمت طراحی شده بود.

Meta یک چالش کاملاً ملموس خانگی را شناسایی کرد و نامی هوشمندانه به نام Takeout برای اپلیکیشن برگزید. منطق حفظ کاربر در این ایده بسیار استوار بود؛ این مدل به جای اینکه فرض کند کاربران عاشق اپلیکیشن‌های پیگیری کارها هستند، دریافت که بهترین برنامه‌های کاربردی به کمترین مداخله دستی نیاز دارند و بر روانشناسی «اجتناب از ضرر» تکیه می‌کنند.

برنده: Meta؛ زیرا این چتبات محصول خود را بر پایه واقعیت تنبلی روزمره انسان‌ها طراحی کرد و متوجه شد که یک اپلیکیشن تنها زمانی بعد از هفته اول زنده می‌ماند که تقریباً به هیچ ورودی دستی از جانب کاربر نیاز نداشته باشد.

جمع‌بندی و نتیجه نهایی

در نهایت و پس از مقایسه در این پنج آزمون، مدل Meta Muse توانست با نتیجه ۳ بر ۲ در برابر ChatGPT پیروز شود؛ نتیجه‌ای غافلگیرکننده که پیشرفت چشمگیر Meta را نشان می‌دهد. در حالی که ChatGPT در سناریوهایی که نیازمند برنامه‌ریزی دقیق، محاسبات واقع‌بینانه و رعایت محدودیت‌های سفت‌وسخت بود دست برتر را داشت، Meta Muse در درک احساسات و ظرافت‌های رفتاری انسان‌ها برتری قابل‌توجهی نشان داد. متن پیام همسایه در این مدل کاملاً طبیعی بود، توضیح پرواز هواپیما برای یک کودک بسیار عالی تنظیم شده بود و ایده اپلیکیشن آن نشان‌دهنده درک عمیق از دلایل ترک برنامه‌ها توسط کاربران بود.

مدل Meta Muse هویتی مستقل و متمایز از خود به نمایش می‌گذارد و صرفاً تلاشی برای تقلید از ChatGPT به نظر نمی‌رسد.

اگرچه ChatGPT همچنان چتبات اصلی و مورد اعتماد بسیاری از کاربران است، اما این رقابت نشان داد که Meta مسیری طولانی را به سرعت طی کرده و مدل جدید آن نمایشی قدرتمند و تاثیرگذار ارائه می‌دهد.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر