پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

ترفندی ساده برای آشکار کردن نقاط کور و خطاهای پنهان در پاسخ‌های ChatGPT

انتشار:۳۱ شهریور ۱۴۰۵(۶ روز پیش)
۵ دقیقه زمان مطالعه
۰ دیدگاه

تنها با پرسیدن یک سؤال تکمیلی ساده از ChatGPT، می‌توان فرضیات پنهان و اشتباهات احتمالی در پاسخ‌های این هوش مصنوعی را شناسایی و اصلاح کرد.

ترفندی ساده برای آشکار کردن نقاط کور و خطاهای پنهان در پاسخ‌های ChatGPT

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • پرسیدن سؤال ساده‌ی «در پاسخ خود نسبت به چه چیزی نامطمئن هستی؟» می‌تواند نقاط کور و فرضیات پنهان ChatGPT را آشکار کند.
  • مدل‌های زبانی مانند ChatGPT تمایل دارند برای راضی نگه‌داشتن کاربر، جاهای خالی اطلاعات را با فرضیات خیالی پر کنند.
  • با مشخص شدن پیش‌فرض‌های پنهان هوش مصنوعی، می‌توان اطلاعات ناقص را به مدل ارائه داد و به پاسخ‌های بسیار دقیق‌تری دست یافت.

بررسی‌ها نشان می‌دهد که همواره باید به پاسخ‌های ChatGPT که هیچ پیامد منفی را در نظر نمی‌گیرند یا هیچ سؤال تکمیلی از کاربر نمی‌رسند، با دیده‌ی تردید نگریست. اعتمادبه‌نفس کاذب و شبیه‌سازی‌شده‌ی هوش مصنوعی می‌تواند کاربران را با موانع غیرمنتظره‌ای روبه‌رو کند.

اما یکی از راه‌های کاربردی برای جلوگیری از این مشکلات، این است که به‌سادگی پس از دریافت پاسخ، سؤال دیگری پرسیده شود که ChatGPT را مجبور کند نقاط کور و اطمینان بی‌دلیل خود را (هرچند مصنوعی) در نظر بگیرد. تنها پرسیدن این سؤال که «در پاسخ خود نسبت به چه چیزی نامطمئن هستی؟»، بینش‌های شگفت‌انگیزی را درباره‌ی بخش‌هایی که هوش مصنوعی در آن‌ها دچار خطا شده است، آشکار می‌کند.

روند کار بسیار ساده است. یک مکالمه‌ی عادی شکل می‌گیرد، پاسخی دریافت می‌شود و سپس از هوش مصنوعی پرسیده می‌شود که فکر می‌کند پاسخش در کدام بخش‌ها ضعیف‌تر است.

در بررسی‌های انجام‌شده، پس از پرسیدن این سؤال، ChatGPT اغلب مستقیماً به پیش‌فرضی اشاره می‌کرد که پیش‌تر در جریان مکالمه به‌طور پنهانی در نظر گرفته بود. با آشکار شدن این پیش‌فرض، می‌توان اطلاعات ازدست‌رفته را به مدل داد و به پاسخی دست یافت که واقعاً بهتر و دقیق‌تر است.

برنامه‌ریزی یک سفر

Travel

ابتدا با یک برنامه‌ی سفر شروع شد، زیرا این کاری است که ChatGPT در تولید آن بسیار مهارت دارد، اما گاهی در درک شرایط آن بسیار ضعیف عمل می‌کند. از مدل خواسته شد تا یک سفر خانوادگی سه‌روزه را برنامه‌ریزی کند. پس از ارائه‌ی اطلاعات اولیه، برنامه‌ی نهایی مطلوب به نظر می‌رسید؛ شامل فعالیت‌های صبحگاهی، پیشنهادهای ناهار، توقف‌های عصرانه و زمان استراحت کافی که اجرای آن را لذت‌بخش جلوه می‌داد.

اما یک مشکل وجود داشت. ChatGPT این سفر را بدون در نظر گرفتن اینکه مسافران چه کسانی هستند و بدون فکر کردن به خطاها یا تأخیرهای احتمالی که ممکن است برنامه را به هم بریزد، ایجاد کرده بود. در این مرحله، به‌جای اینکه به ChatGPT گفته شود برنامه‌ی سفر بیش‌ازحد فشرده است، همان سؤال تکمیلی تایپ شد: «در پاسخ خود نسبت به چه چیزی نامطمئن هستی؟»

مدل این‌گونه پاسخ داد: «من درباره‌ی سرعت اجرای برنامه‌ی سفر، به‌ویژه در روز دوم، نامطمئن هستم. من فرض کرده‌ام که خانواده‌ی شما به‌راحتی می‌توانند دو فعالیت مهم را با یک استراحت در میان آن‌ها مدیریت کنند، اما از برنامه‌ی خواب کودک شما، سطح انرژی معمول یا میزان استراحتی که در طول سفر ترجیح می‌دهید، اطلاعی ندارم. همچنین زمان‌های سفر را بدون دانستن دقیق محل اقامت شما تخمین زده‌ام. اگر هر یک از این پیش‌فرض‌ها اشتباه باشد، ممکن است این برنامه در عمل بسیار پرشتاب‌تر از آنچه روی کاغذ به نظر می‌رسد، احساس شود.»

اینجا بود که ChatGPT بدون نیاز به اشاره‌ی کاربر، مشکل برنامه‌ی خود را پیدا کرد. این امر باعث شد پرامپت بعدی بسیار بهتر تنظیم شود. به مدل گفته شد که برای هر روز تنها یک فعالیت برنامه‌ریزی‌شده‌ی مهم در نظر گرفته شود و عصرها نیز باید منعطف باقی بمانند. ChatGPT برنامه را بر اساس این محدودیت‌ها بازسازی کرد و نسخه‌ی جدید بلافاصله بسیار واقعی‌تر و قابل‌اجراتر برای یک خانواده به نظر رسید.

تعمیر یا تعویض؟

old laptops
(منبع تصویر: dasytnik / Shutterstock)

در آزمایش دیگری، یک دوراهی فرضی درباره‌ی لپ‌تاپ برای ChatGPT مطرح شد. سناریو این بود که یک کامپیوتر قدیمی که شروع به کند شدن کرده، در دسترس است و باید مشخص شود که آیا تعمیر آن بهتر است یا تعویض آن. هوش مصنوعی چارچوبی شامل سن لپ‌تاپ، هزینه‌های احتمالی تعمیر، عملکرد و قیمت جایگزین آن ایجاد کرد. پس از بررسی تمامی موارد، پیشنهاد داد که احتمالاً تعویض لپ‌تاپ در بلندمدت گزینه‌ی منطقی‌تری است.

مدل ChatGPT در تولید متن‌هایی که ظاهر یک نتیجه‌گیری را دارند، بسیار توانمند است. به همین دلیل ممکن است کاربر به‌راحتی فراموش کند که برخی از شواهد هرگز ارائه نشده‌اند. بنابراین دوباره همان سؤال تکمیلی پرسیده شد: «در پاسخ خود نسبت به چه چیزی نامطمئن هستی؟»

چت‌بات در پاسخ نوشت: «من درباره‌ی پیشنهاد تعویض، بدون دانستن هزینه‌ی واقعی تعمیر یا اینکه دقیقاً چه قطعه‌ای خراب شده است، نامطمئن هستم. من از سن لپ‌تاپ به‌عنوان مدرکی استفاده می‌کنم که نشان می‌دهد ممکن است مشکلات بیشتری ظاهر شوند، اما سن به‌تنهایی به ما نمی‌گوید که آیا تعویض آن از نظر مالی منطقی است یا خیر. اگر مشکل مربوط به ارتقای نسبتاً ارزان‌قیمت باتری یا فضای ذخیره‌سازی باشد، تعمیر آن می‌تواند عمر مفید دستگاه را به‌طور قابل‌توجهی افزایش دهد. اگر مدل، مشخصات، علائم خرابی و قیمت تقریبی تعمیر را می‌دانستم، با اطمینان بسیار بیشتری پاسخ می‌دادم.»

این بار نقطه‌ضعف زمانی آشکار شد که ChatGPT آن را بیان کرد. در واقع سؤال این بود که آیا یک مشکل ناشناخته ارزش تعمیر دارد یا خیر، بدون اینکه گفته شود مشکل چیست یا تعمیر آن چقدر هزینه دارد. با این حال، ChatGPT توانسته بود پاسخی ارائه دهد.

انسان‌ها به‌راحتی بیان می‌کنند که تا زمانی که اطلاعات بیشتری نداشته باشند، نمی‌توانند توصیه‌ای ارائه دهند. اما ChatGPT برای کمک کردن طراحی شده است و کمک کردن اغلب به معنای پر کردن خلأها برای ادامه‌ی مکالمه است. گاهی اوقات این بدان معناست که چت‌بات مجموعه‌ای خیالی از ایده‌ها را دارد که بدون توجه به واقعیت، جاهای خالی را با آن‌ها پر می‌کند.

گسترش این روش

این ترفند را می‌توان به روش‌های دیگری نیز گسترش داد. پرسیدن «در حال حاضر نسبت به چه چیزی نامطمئن هستی؟» یک نقطه‌ی شروع عالی است، اما پاسخ آن می‌تواند پایه‌ای برای یک سؤال دیگر باشد.

اگر ChatGPT سه مورد عدم قطعیت را فهرست کند، می‌توان پرسید که کدام‌یک از آن‌ها احتمال بیشتری برای تغییر دادن توصیه‌ی نهایی دارد. اگر بگوید که زمینه‌ی مهمی در اطلاعات مفقود است، می‌توان پرسید دقیقاً چه اطلاعاتی نیاز دارد. پرسیدن «چه چیزی می‌توانم به تو بگویم که باعث شود مطمئن‌تر شوی؟» کمک می‌کند تا هوش مصنوعی برای ارائه‌ی پاسخ‌های بهتر آماده شود.

این روش به‌ویژه برای تصمیم‌گیری‌ها بسیار کاربردی است. هنگام مقایسه‌ی محصولات یا انتخاب بین چند گزینه، می‌توان از ChatGPT خواست برداشت اولیه‌ی خود را ارائه دهد و سپس بلافاصله ضعیف‌ترین بخش آن را زیر سؤال برد. این فرآیند بسیار طبیعی‌تر از آن است که پیش از شروع مکالمه، زمان زیادی صرف ساختن یک پرامپت طولانی و پیچیده شود.

البته محدودیت آشکاری برای همه‌ی این موارد وجود دارد. توصیف ChatGPT از میزان اطمینان خود، توسط خود ChatGPT تولید می‌شود. این چت‌بات می‌تواند درباره‌ی آنچه باید نگرانش باشد، اشتباه کند یا یک مشکل اساسی را به‌طور کامل نادیده بگیرد. برای هر موضوعی که شامل حقایق مهم است، پرسیدن از ChatGPT درباره‌ی میزان اطمینانش، هیچ‌گاه جایگزین بررسی منابع معتبر نخواهد شد.

اما در مکالمات روزمره، این ترفند به‌طرز شگفت‌انگیزی یکی از بزرگ‌ترین چالش‌های کار با هوش مصنوعی را برطرف می‌کند؛ تنها با مجبور کردن مدل به آشکارسازی داربست‌های نامرئی که نتیجه‌گیری‌های پاسخ‌هایش را شکل می‌دهند، می‌توان دریافت که آیا این نتایج برای اتکا کردن به‌اندازه‌ی کافی مستحکم هستند یا خیر.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر