پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

مقایسه قابلیت‌های چندوجهی ChatGPT و Gemini؛ کدام هوش مصنوعی جهان را بهتر می‌بیند؟

انتشار:۳ مهر ۱۴۰۵(۳ روز پیش)
۸ دقیقه زمان مطالعه
۰ دیدگاه

بررسی میدانی قابلیت‌های بینایی و چندوجهی دو چت‌بات پرچمدار ChatGPT و Gemini نشان می‌دهد که هوش مصنوعی Google در خواندن دست‌خط، درک نشانه‌های بصری و شناسایی آثار هنری دقت فوق‌العاده‌ای به نمایش می‌گذارد.

مقایسه قابلیت‌های چندوجهی ChatGPT و Gemini؛ کدام هوش مصنوعی جهان را بهتر می‌بیند؟

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مدل Gemini در خواندن دست‌نوشته‌های ناخوانا و استخراج متن با دقت بالا عملکردی بسیار قدرتمندتر از ChatGPT ارائه داد.
  • در آزمون تحلیل وضعیت شطرنج، ChatGPT پس از پردازشی طولانی و استفاده از ابزارهای کمکی پاسخی دقیق‌تر به نمایش گذاشت.
  • در شناسایی آثار هنری مینیمال، هوش مصنوعی Gemini توانست هویت و فیلم مرجع اثر را بی‌درنگ و با جزئیات کامل تشخیص دهد.
  • در مجموع آزمون‌های درک تصویر و بینایی ماشین، چت‌بات Gemini برتری محسوسی نسبت به رقیب خود ثبت کرد.

امروزه ChatGPT و Gemini از محبوب‌ترین و توانمندترین چت‌بات‌های هوش مصنوعی به شمار می‌روند و هر یک در زمینه‌های گوناگون قابلیت‌های قابل‌توجهی دارند. با این‌که ChatGPT به دلیل حضور زودهنگام‌تر در بازار همچنان سهم عمده کاربران را در اختیار دارد، شرکت Google از زمان معرفی Gemini گام‌به‌گام در حال بستن این فاصله بوده است.

هر دو چت‌بات در پردازش متن و پژوهش‌های عمیق عملکردی فوق‌العاده ارائه می‌دهند، اما کاربرد هرکدام بسته به نیاز متفاوت است. ChatGPT یکی از همه‌فن‌حریف‌ترین چت‌بات‌های موجود محسوب می‌شود، در حالی که اشتراک‌های پولی Google ارزش افزوده بالایی برای کاربران به همراه دارند.

با این حال، در بخش چندوجهی (Multimodality) یعنی توانایی پردازش و درک صوت، تصویر و ویدیو در کنار متن، تفاوت محسوسی به چشم می‌خورد؛ به‌ویژه در آزمون‌های بازشناسی تصویر که برتری یکی از این دو مدل را آشکار می‌کند. در ادامه، عملکرد این دو چت‌بات در درک تصاویر دنیای واقعی مورد ارزیابی قرار گرفته است.

اگرچه مزیت ورود اولیه باعث شد ChatGPT جامعه کاربری بسیار گسترده‌ای بسازد، حضور پیش‌فرض Gemini روی تمام گوشی‌های اندرویدی می‌تواند به مرور زمان مدل Google را به چت‌بات غالب در بازار تبدیل کند.

در سطح امکانات پایه، هر دو چت‌بات قابلیت‌های مشابه‌ای در اختیار کاربران قرار می‌دهند، اما در حوزه تولید تصویر، فناوری‌های اختصاصی Google برتری محسوسی به نمایش می‌گذارند. هرچند ChatGPT در این بخش ابزار توانمندی است، رقابت با خروجی‌های بصری Google چالش‌برانگیز به نظر می‌رسد.

نسخه‌های رایگان هر دو ابزار بسیار کارآمد هستند، اما تمایز اصلی در اشتراک‌های تجاری و پیشرفته خود را نشان می‌دهد؛ جایی که هرچند Claude همچنان در صدر بهترین چت‌بات‌ها از نظر پردازش عمیق قرار دارد، رقابت میان ChatGPT و Gemini نیز بسیار نفس‌گیر است.

خرید اشتراک ماهانه Gemini امکاناتی فراتر از دسترسی صرف به مدل‌های پیشرفته ارائه می‌دهد. طرح‌های پرداختی Google با ارائه حداقل ۴۰۰ گیگابایت حافظه ابری همراه هستند. همچنین اشتراک استاندارد ۲۰ دلاری این شرکت مزایایی مانند دسترسی گسترده‌تر به مدل‌های هوش مصنوعی، فضای ابری بیشتر، ابزار Google Spark و حتی اشتراک YouTube Premium Lite برای مشاهده تبلیغات کمتر را شامل می‌شود؛ بسته‌ای که برای کاربران اکوسیستم Google مزیت اقتصادی بالایی دارد.

در سوی مقابل، اشتراک‌های پولی ChatGPT سقف استفاده بالاتر و دسترسی به قوی‌ترین مدل‌های پردازشی OpenAI را در اختیار کاربر می‌گذارند که در پلن معادل ۲۰ دلاری، دسترسی به جدیدترین مدل‌های پرچمدار این شرکت را ممکن می‌سازد.

آزمون اول: خواندن یادداشت‌های دست‌نویس

بررسی توانایی چت‌بات‌ها در خواندن یادداشت‌های دست‌نویس و ناخوانا روی تبلت جوهر الکترونیک

در نخستین آزمون، چند جمله به شیوه‌ای کاملاً شتاب‌زده و ناخوانا با قلم دیجیتال روی یک تبلت با نمایشگر جوهر الکترونیک یادداشت شد. متن انتخابی، بخشی تصادفی از کتاب «درنده‌ی باسکرویل» اثر آرتور کانن دویل بود:

«او گفت: یک پیاده‌روی کوتاه در امتداد این مسیر مردابی ما را به خانه مریپیت می‌رساند. شاید بتوانید ساعتی را اختصاص دهید تا افتخار معرفی خواهرم را داشته باشم. اولین فکرم این بود که باید کنار سر هنری باشم؛ اما بعد، کپه کاغذها و صورت‌حساب‌ها را به یاد آوردم...»

عملکرد ChatGPT

چت‌بات ChatGPT در این بخش ناموفق ظاهر شد. خط اول متن تقریباً به‌طور کامل نادرست رونویسی شد و ساختاری نامفهوم تحویل داد. این مدل در تحلیل تکمیلی خود اشاره کرد که نوشته شامل خاطره‌ای درباره فردی به نام هنری، سر هنری و خواهر نویسنده است، اما واژه‌های ناخوانا را درون قلاب قرار داد و نتوانست معنای کلی متن را بازسازی کند.

عملکرد Gemini

در نقطه مقابل، Gemini این چالش را با دقتی شگفت‌انگیز پشت سر گذاشت. این مدل توانست متن ناخوانا را واژه‌به‌واژه و صحیح استخراج کند، منبع ادبی اثر را به درستی تشخیص دهد و حتی ویژگی‌های ظاهری خط، مانند فرم انحنای باز حروفی چون y، g و f را به طور دقیق توصیف کند. این نتیجه نشان‌دهنده برتری محسوس توانایی‌های بصری Gemini در درک متون دست‌نویس است.

آزمون دوم: تحلیل وضعیت شطرنج

ارزیابی حرکت بعدی در مسابقه شطرنج؛ هر دو چت‌بات رویکرد متفاوتی در تحلیل موقعیت مهره‌ها در پیش گرفتند (منبع تصویر: Esports World Cup)

برای ارزیابی قدرت تحلیل وضعیت‌های بصری پیچیده، تصویری از صفحه شطرنج یک مسابقه ثبت و از هر دو چت‌بات خواسته شد بهترین حرکت بعدی را برای مهره سیاه تعیین کنند.

عملکرد Gemini

پاسخ ارائه شده توسط Gemini طولانی و مشروح بود و در نهایت حرکت Bxf4 را به عنوان بهترین گزینه اعلام کرد.

عملکرد ChatGPT

مدل ChatGPT رویکرد پردازشی متفاوتی را به نمایش گذاشت. این مدل مراحل تفکر خود را نمایش داد و اعلام کرد که برای محاسبه حرکت‌ها، کتابخانه‌های شطرنج و موتور متن‌باز Stockfish را بارگذاری و اجرا کرده است. هرچند رسیدن به پاسخ نهایی بیش از ۴ دقیقه زمان برد، اما حرکت پیشنهادی اصلی آن c5 به d4 بود. ChatGPT همچنین حرکت Bxf4 (مشابه پیشنهاد Gemini) را به عنوان گزینه دوم معرفی کرد.

به منظور ارزیابی دقیق‌تر و دریافت نظر کارشناسی، تصویر مذکور در اختیار چت‌بات Claude نیز قرار گرفت. برآورد مدل Claude این بود که Gemini موقعیت مهره‌های صفحه را به درستی نخوانده و تحلیل ارائه‌شده توسط ChatGPT انطباق بهتری با واقعیت بازی داشته است.

آزمون سوم: بررسی گیاه آسیب‌دیده

Three Venus flytrap plants on a table
بررسی وضعیت گیاه ونوس مگس‌خوار و دلیل سیاه‌شدن تله‌ها توسط مدل‌های هوش مصنوعی

در آزمون سوم، تصویری از یک گیاه ونوس مگس‌خوار ثبت شد تا نوع دقیق گیاه و دلیل تغییر رنگ و سیاه‌شدن یکی از تله‌ها مشخص شود؛ چالشی دشوار با توجه به شباهت ظاهری بالای گونه‌های مختلف این گیاه گوشت‌خوار.

عملکرد Gemini

چت‌بات Gemini نتوانست نام دقیق رقم این گیاه را شناسایی کند، اما درباره علت سیاه‌شدن تله، مجموعه‌ای از دلایل علمی مطرح کرد که در میان آن‌ها دلیل اصلی یعنی تلاش گیاه برای هضم طعمه‌ای بزرگ‌تر از حد مجاز به درستی ذکر شده بود.

عملکرد ChatGPT

در سمت دیگر، ChatGPT تحلیلی مفصل‌تر ارائه کرد. این مدل با اشاره به این‌که نام‌گذاری رقم دقیق گیاه از روی تصویر قطعی نیست، دلایل احتمالی آسیب‌دیدگی تله را موشکافی کرد و راهکارهای مراقبتی موثری برای بهبود وضعیت گیاه پیشنهاد داد. در این چالش، پاسخ منسجم‌تر و توصیه‌های مراقبتی ChatGPT برتری نسبی داشت.

آزمون چهارم: تشخیص اثر هنری

An artist's piece showing three diamonds with noses and smiling mouths in them
شناسایی اثر هنری الهام‌گرفته از یک فیلم سینمایی توسط Gemini در برابر ناتوانی ChatGPT

در این بخش، تصویری از سه تابلو نقاشی ارسال شد که فرم لبخند خواهران سندرسون در فیلم سینمایی Hocus Pocus را به تصویر کشیده بودند. این تابلوها دست‌ساز بوده و کالای تجاری رسمی فیلم محسوب نمی‌شدند.

عملکرد ChatGPT

چت‌بات ChatGPT قادر به تشخیص نام فیلم نشد؛ هرچند ویژگی‌های هندسی تابلوها را به درستی بازگو کرد و برای شناسایی دقیق، جزئیات بیشتری نظیر سال تولید فیلم را درخواست کرد.

عملکرد Gemini

اما Gemini بی‌درنگ هویت تصویر را شناسایی کرد و پاسخ داد: «این اثر هنری لبخند نمادین خواهران سندرسون در فیلم Hocus Pocus محصول سال ۱۹۹۳ شرکت دیزنی را نشان می‌دهد.» مدل هوش مصنوعی Google همچنین با جزئیات کامل شرح داد که هر لبخند مربوط به کدام شخصیت و بازیگر در فیلم است.

جمع‌بندی؛ درک بصری عمیق‌تر در Gemini

با وجود اینکه ChatGPT در آزمون بررسی گیاه راهکارهای دقیق‌تری ارائه داد، پایداری عملکرد Gemini و توانمندی شگفت‌انگیز آن در بازخوانی یادداشت‌های ناخوانا و کشف هویت بصری آثار هنری، آن را به برنده نهایی این مقایسه چندوجهی تبدیل می‌کند.

اگر معیار اصلی در انتخاب دستیار هوش مصنوعی، بینایی ماشین قوی‌تر، استخراج اطلاعات از تصاویر و درک دقیق‌تر محیط پیرامون از طریق دوربین باشد، چت‌بات Gemini در حال حاضر دست برتر را در مقایسه با ChatGPT در اختیار دارد.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر