پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

مقایسه عملکرد ChatGPT-6 و Claude Opus 5.5 در ۵ سناریوی روزمره؛ کدام مدل پیروز شد؟

انتشار:۲ مهر ۱۴۰۵(۴ روز پیش)
۸ دقیقه زمان مطالعه
۰ دیدگاه

در بررسی و مقایسه جامع دو مدل زبانی پرچمدار OpenAI و Anthropic، یکی از مدل‌ها به تحلیل عمیق مسائل پرداخت، در حالی که دیگری پاسخ‌های سریع و سرراست را ترجیح داد.

مقایسه عملکرد ChatGPT-6 و Claude Opus 5.5 در ۵ سناریوی روزمره؛ کدام مدل پیروز شد؟

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • بررسی عملکرد مدل‌های زبانی ChatGPT-6 و Claude Opus 5.5 در پنج سناریوی کاربردی و روزمره.
  • مدل Claude Opus 5.5 با دقت بالا در جزئیات، درک عمیق شرایط و تحلیل دقیق در ۴ تست از ۵ تست پیروز شد.
  • مدل ChatGPT-6 با ارائه پاسخ‌های سریع‌تر، ساختاریافته‌تر و کاربردی‌تر در مدیریت وظایف شخصی عملکرد بهتری ثبت کرد.

شرکت‌های OpenAI و Anthropic در ماه جاری از مدل‌های هوش مصنوعی پرچمدار خود یعنی ChatGPT-6 و Claude Opus 5.5 رونمایی کردند. هر دو مدل به قدری توانمند هستند که بسیار فراتر از نیازهای روزمره و درخواست‌های معمول کاربران عمل می‌کنند.

خانواده GPT-6 شرکت OpenAI بر پایه مدل GPT-6 Astra بنا شده است که تاکنون چشمگیرترین مدل این شرکت به شمار می‌رود. این مدل در زمینه‌هایی چون استدلال، کارهای حرفه‌ای، کدنویسی، وب‌گردی و استفاده از رایانه پیشرفت‌های چشمگیری داشته است. مدل جدیدتر GPT-6 Sol بخش عمده‌ای از این هوشمندی را به نسخه‌ای ویژه کارهای روزمره آورده است و OpenAI آن را به عنوان یک مدل استدلالی سریع‌تر و مقرون‌به‌صرفه‌تر معرفی می‌کند.

در سوی دیگر، Claude Opus 5.5 با رویکردی متفاوت وارد میدان شده است. Anthropic آن را مدلی ساخته‌شده برای پردازش‌های طولانی ایجنت‌ها و کارهای دانش‌محور توصیف می‌کند که با تفکر تطبیقی، میزان تلاش مورد نیاز برای هر درخواست را می‌سنجد. این مدل دارای پنجره زمینه یک میلیون توکنی است، می‌تواند تا ۱۲۸ هزار توکن خروجی تولید کند و طبق گزارش Anthropic، در بیشتر وظایف عملکردی مشابه مدل رده‌بالای Claude Fable 5.1 دارد، در حالی که هزینه اجرای آن ۴۰ درصد کمتر از نسخه قبلی Opus است. این شرکت همچنین بر بهبود ارتباط طبیعی مدل و پیروی دقیق از دستورالعمل‌های نگارشی تاکید کرده است.

این تفاوت‌ها روی کاغذ بسیار جذاب به نظر می‌رسند، اما لزوماً مشخص نمی‌کنند که در دنیای واقعی کدام چت‌بات می‌تواند دستیار بهتری باشد.

در همین راستا، در بررسی‌های انجام‌شده پنج پرامپت (دستور) کاملاً یکسان به ChatGPT-6 و Claude Opus 5.5 داده شد. نتایج به دست‌آمده برخلاف تصور اولیه، یک‌طرفه نبود و هر کدام نقاط قوت خاص خود را به نمایش گذاشتند. در ادامه نتایج این آزمایش‌های روزمره بررسی می‌شود.

۱. برنامه‌ریزی پیچیده در دنیای واقعی — محدودیت‌ها و قدرت قضاوت

screenshot

پرامپت: من ۱۵۰ دلار بودجه برای برنامه‌ریزی یک جشن تولد برای ۱۰ کودک ۸ تا ۱۱ ساله دارم. این جشن باید سه ساعت طول بکشد، در صورت بارندگی در فضای بسته قابل اجرا باشد، شامل غذا باشد و استفاده از نمایشگرها در آن به حداقل برسد. دو کودک گیاه‌خوار هستند و یک نفر حساسیت به بادام زمینی دارد. یک برنامه کامل شامل بودجه‌بندی، جدول زمانی، فعالیت‌ها و برنامه جایگزین طراحی کن. بودجه نباید از ۱۵۰ دلار فراتر برود.

ChatGPT با ارائه یک هویت و جهت‌گیری سریع برای رویداد، چارچوب مفهومی شفافی ارائه داد. اختصاص ۳۶ دلار برای سفارش ۳ پیتزای پنیر، در عمل برای والدینی که میزبان ۱۰ کودک هستند بسیار آسان‌تر از پخت مینی‌پیتزاهای خانگی در آشپزخانه است. این مدل همچنین نیاز به «بودجه اضطراری» در پایان کار را به‌خوبی درک کرد.

Claude در برخورد با آلرژی‌ها و پروتکل‌های غذایی رویکردی هوشمندانه و پیشگیرانه داشت. این مدل به خطر آلودگی متقاطع در کیک‌های قنادی و پودرهای آماده نیز توجه کرد. افزون بر این، با اختصاص ۱۴ دلار برای کیف‌های پارچه‌ای و ۱۲ دلار برای ماژیک‌های پارچه، یک بودجه‌بندی دو‌منظوره انجام داد که هم به عنوان فعالیت کاردستی هنگام ورود و هم به عنوان هدیه پایان جشن کاربرد داشت؛ این کار باعث صرفه‌جویی و حذف پلاستیک‌های ارزان‌قیمت شد. ارائه یک جدول زمانی عملیاتی و راه‌حل‌هایی برای مشکلات احتمالی از دیگر نقاط قوت این مدل بود.

برنده: Claude پیروز شد؛ زیرا یک برنامه کامل و آماده اجرا با رعایت دقیق اصول ایمنی ارائه داد، در حالی که خروجی ChatGPT بیشتر شبیه به یک لیست خرید پراکنده بود.

۲. نگارش — انسانی کردن لحن هوش مصنوعی

screenshot

پرامپت: این اطلاعیه خسته‌کننده را طوری بازنویسی کن که شبیه متنی شود که یک انسان واقعی مایل به خواندن آن باشد. تمام جزئیات واقعی را حفظ کن، از خط تیره بلند استفاده نکن، از کلیشه‌ها بپرهیز و کلماتی مثل «هیجان‌انگیز»، «انقلابی»، «تحول‌آفرین» یا «یکپارچه» را به کار نبر.

«شرکت ما در حال معرفی یک قابلیت جدید تقویم مبتنی بر هوش مصنوعی است که به‌طور خودکار تداخل‌های زمانی را تشخیص می‌دهد، زمان جلسات را پیشنهاد می‌کند و پس از جلسات خلاصه‌ای از آن‌ها تهیه می‌کند. این ویژگی ۱۵ اکتبر راه‌اندازی می‌شود و بدون هزینه اضافی برای تمامی مشتریان در دسترس خواهد بود.»

ChatGPT یک جمله جذاب و گیرا ارائه داد که مخاطب را درگیر می‌کرد. این مدل از سبک‌های نگارشی رایج هوش مصنوعی پرهیز کرد و تمام جزئیات واقعی را نگه داشت. همچنین فاصله‌گذاری مناسب پاراگراف‌ها، خواندن سریع متن را آسان‌تر کرد.

Claude موارد کلیدی را به مزیت‌های ملموس انسانی تبدیل کرد و جزئیات را حول محور کاهش فشارهای واقعی در محیط کار بازنویسی نمود.

برنده: Claude پیروز شد؛ زیرا به‌خوبی درک کرد که بازنویسی «انسانی» نیازمند بازنگری در نحوه بیان ارزش ویژگی‌هاست و صرفاً نباید به جابه‌جایی چند فعل در متن اصلی بسنده کرد.

۳. استدلال — پاسخ بدیهی نیست

screenshot

پرامپت: یک خانواده در حال انتخاب بین دو اقامتگاه برای تعطیلات است. اقامتگاه A حدود ۱۸۵۰ دلار هزینه دارد و فاصله آن تا ساحل ۱۰ دقیقه پیاده‌روی است. اقامتگاه B با هزینه ۱۵۰۰ دلار در دسترس است، اما برای رسیدن به ساحل نیاز به ۲۵ دقیقه رانندگی دارد و روزانه ۳۵ دلار هزینه پارکینگ در پی خواهد داشت. آن‌ها هفت روز اقامت دارند و قصد دارند روزی دو بار به ساحل بروند. این خانواده سه فرزند دارد. کدام اقامتگاه را باید انتخاب کنند؟ فقط هزینه‌ها را محاسبه نکن. عواملی که می‌توانند پیشنهاد تو را تغییر دهند را مشخص کن و بگو چه اطلاعات اضافه‌ای بیشترین اهمیت را دارد.

ChatGPT بهترین دیدگاه متقابل را درباره سن کودکان ارائه داد. این مدل هوشمندانه اشاره کرد که «۱۰ دقیقه پیاده‌روی» بسته به زیرساخت‌ها (مانند مسیر تخته‌پوش در برابر عبور از یک بزرگراه چهاربانده یا تپه‌های شنی) بسیار متفاوت است. این چت‌بات مشخصاً خاطرنشان کرد که اقامتگاه A به والدین اجازه می‌دهد تا در صورت نیاز از هم جدا شوند (مثلاً یک والد کودک خسته را به اقامتگاه برگرداند در حالی که والد دیگر با دو کودک دیگر در ساحل بماند).

Claude در واقع محاسبات مسافت و هزینه‌ها را به‌طور دقیق انجام داد و ثابت کرد که صرفه‌جویی مالی اقامتگاه B در کل هفته تنها حدود ۵۵ تا ۶۵ دلار است که رقم ناچیزی به حساب می‌آید. Claude همچنین یک نکته روان‌شناختی ظریف را مطرح کرد: سوار و پیاده کردن سه کودک در صندلی ماشین، آن هم چهار بار در روز، احتمالاً باعث می‌شود خانواده از دومین برنامه روزانه ساحل منصرف شوند. این مدل به‌درستی به هزینه‌های پنهان پلتفرم‌های اجاره اقامتگاه اشاره کرد؛ نرخ‌های پایه شامل هزینه‌های نظافت، خدمات یا مالیات نمی‌شوند و همین موارد به‌تنهایی می‌توانند تفاوت ۱۰۵ دلاری را کاملاً برعکس کنند.

برنده: Claude با اختلافی اندک پیروز شد. اگرچه ChatGPT بهترین استدلال تک‌موردی را داشت (تشخیص اینکه پیاده‌روی با وسایل سنگین ساحل و کودکان خردسال می‌تواند طاقت‌فرساتر از رانندگی باشد)، اما Claude در مجموع برنده شد؛ زیرا تحلیل مالی آن تا ریزترین جزئیات دقیق بود، هزینه‌های پنهان را پیش‌بینی کرد و به‌درستی متوجه شد که سختی‌های رفت‌وآمد با خودرو باعث لغو بخشی از برنامه‌های روزانه خانواده می‌شود.

۴. انبوه گزینه‌ها — یافتن آنچه اهمیت دارد

screenshot

پرامپت: یک شهر ۱۰ میلیون دلار بودجه برای هزینه کردن دارد و سه گزینه پیش رو است:

الف) ساخت یک کتابخانه عمومی جدید که انتظار می‌رود حداقل ۳۰ سال، سالانه ۲۰۰ هزار بازدیدکننده داشته باشد.ب) پرداخت ۵۰۰ دلار کمک‌نقدی یکباره به هر خانوار.ج) ارتقای زیرساخت‌های فرسوده آب، پروژه‌ای که ساکنان متوجه آن نخواهند شد مگر آنکه مشکلی پیش بیاید.

شهر تنها می‌تواند یک گزینه را انتخاب کند. بهترین گزینه را مشخص کن. دلایل خود را توضیح بده، قوی‌ترین استدلال مخالف با انتخابت را بیان کن و بگو چه اطلاعات اضافه‌ای می‌تواند پاسخ تو را تغییر دهد. با گفتن اینکه «هر سه گزینه خوب هستند»، از دادن پاسخ صریح طفره نرو.

ChatGPT به‌خوبی تمام دستورالعمل‌ها را رعایت کرد و دفاعیه‌ای خوانا و منطقی برای گزینه «ج» ارائه داد. این مدل همچنین آستانه ارزیابی‌های مهندسی را به‌روشنی تعریف کرد.

Claude انتخاب خود را در چارچوب انگیزه‌ها و سیاست‌های شهری مطرح کرد و به‌درستی تشخیص داد که تأمین مالی پروژه‌هایی که در سیاست‌های انتخاباتی نادیده گرفته می‌شوند، وظیفه اصلی مدیریت شهری است.

برنده: Claude پیروز شد؛ زیرا پاسخ بسیار بهتری ارائه داد. این چت‌بات گویی در مدیریت مالیه عمومی تجربه داشت، در حالی که پاسخ ChatGPT بیشتر به صورت استاندارد و سطحی‌واره به نظر می‌رسید.

۵. آزمایش نهایی — درخواست مبهم و قدرت ابتکار

screenshot

پرامپت: زندگی من بی‌نظم شده است. سه فرزند، یک شغل تمام‌وقت، مسئولیت‌های خانه و تنها حدود ۳۰ دقیقه وقت آزاد در هر عصر دارم تا اوضاع را کنترل کنم. یک سیستم برای من طراحی کن که واقعاً بتوانم آن را حفظ کنم. از توصیه‌های کلی بهره‌وری پرهیز کن. هر جا لازم است فرضیات منطقی در نظر بگیر، به من بگو چه فرضیاتی داشته‌ای و برنامه‌ای به من بده که بتوانم از همین امشب شروع کنم.

ChatGPT راهکارهایی ساده برای جلوگیری از فرسودگی ارائه داد و دستورالعمل‌هایی را به صورت گام‌به‌گام درآورد تا کاربر نیازی به برنامه‌ریزی ذهنی یا حدس زدن نقطه شروع نداشته باشد.

Claude به بار روانی مسئله پرداخت که نشان‌دهنده درک دقیق و عمیق این مدل از دلایل بی‌نظمی بود. این مدل همچنین به ترفند کاربردی واگذاری کارهای خانه در صورت امکان اشاره کرد و پذیرفت که یک والد به‌تنهایی نمی‌تواند موتور محرک یک خانواده پنج‌نفره باشد.

برنده: ChatGPT پیروز شد؛ زیرا چارچوب شناختی آن به‌مراتب محافظت بیشتری از ظرفیت ذهنی یک والد خسته به عمل می‌آورد. Claude یک روال منظم خانگی خوب ارائه داد، اما ChatGPT یک فیلتر تصمیم‌گیری کاربردی خلق کرد که مانع از تداخل و آسیب‌رسانی کار، خانواده و زندگی شخصی به یکدیگر می‌شود.

برنده نهایی: Claude

پس از انجام پنج آزمایش، Claude Opus 5.5 در چهار مورد پیشتاز بود. اما نکته قابل‌توجه این بود که تفاوت بین این دو مدل در وظایف کاملاً نامرتبط، به‌شکلی پایدار تکرار می‌شد. Claude همیشه تمایل داشت عمیق‌تر مسائل را بشکافد.

هنگامی که از این مدل خواسته شد یک جشن تولد را برنامه‌ریزی کند، به خطر آلودگی متقاطع مواد غذایی توجه کرد و راه‌هایی یافت تا یک خرید، دو کاربرد داشته باشد. در مسئله اجاره اقامتگاه، هزینه‌هایی را محاسبه کرد که صراحتاً در پرامپت خواسته نشده بود و به این فکر کرد که آیا زحمت رانندگی واقعاً رفتار خانواده را تغییر می‌دهد یا خیر. حتی در تصمیم‌گیری برای نحوه هزینه‌کرد ۱۰ میلیون دلار توسط شهرداری، فراتر از مزایا و معایب آشکار رفت و ریشه‌های تصمیمات دولتی را موشکافی کرد.

این دقیقاً همان نقطه‌ای است که Opus 5.5 قدرت خود را به رخ می‌کشد. در مقابل، ChatGPT-6 عموماً روندی سرراست‌تر داشت که کاملاً با ماهیت و برند ChatGPT همخوانی دارد. فارغ از نوع مدل، ChatGPT همواره به عنوان مدلی شناخته می‌شود که کمتر به حاشیه می‌رود و سریع‌تر به اصل مطلب می‌پردازد. این ویژگی باعث می‌شود گاهی پاسخ‌های آن به اندازه Claude عمیق نباشد؛ با این حال، همین رویکرد مستقیم در آخرین آزمایش به یک مزیت بزرگ برای این مدل تبدیل شد.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر