ترفندی ساده برای آشکار کردن نقاط کور و خطاهای پنهان در پاسخهای ChatGPT
تنها با پرسیدن یک سؤال تکمیلی ساده از ChatGPT، میتوان فرضیات پنهان و اشتباهات احتمالی در پاسخهای این هوش مصنوعی را شناسایی و اصلاح کرد.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- پرسیدن سؤال سادهی «در پاسخ خود نسبت به چه چیزی نامطمئن هستی؟» میتواند نقاط کور و فرضیات پنهان ChatGPT را آشکار کند.
- مدلهای زبانی مانند ChatGPT تمایل دارند برای راضی نگهداشتن کاربر، جاهای خالی اطلاعات را با فرضیات خیالی پر کنند.
- با مشخص شدن پیشفرضهای پنهان هوش مصنوعی، میتوان اطلاعات ناقص را به مدل ارائه داد و به پاسخهای بسیار دقیقتری دست یافت.
بررسیها نشان میدهد که همواره باید به پاسخهای ChatGPT که هیچ پیامد منفی را در نظر نمیگیرند یا هیچ سؤال تکمیلی از کاربر نمیرسند، با دیدهی تردید نگریست. اعتمادبهنفس کاذب و شبیهسازیشدهی هوش مصنوعی میتواند کاربران را با موانع غیرمنتظرهای روبهرو کند.
اما یکی از راههای کاربردی برای جلوگیری از این مشکلات، این است که بهسادگی پس از دریافت پاسخ، سؤال دیگری پرسیده شود که ChatGPT را مجبور کند نقاط کور و اطمینان بیدلیل خود را (هرچند مصنوعی) در نظر بگیرد. تنها پرسیدن این سؤال که «در پاسخ خود نسبت به چه چیزی نامطمئن هستی؟»، بینشهای شگفتانگیزی را دربارهی بخشهایی که هوش مصنوعی در آنها دچار خطا شده است، آشکار میکند.
روند کار بسیار ساده است. یک مکالمهی عادی شکل میگیرد، پاسخی دریافت میشود و سپس از هوش مصنوعی پرسیده میشود که فکر میکند پاسخش در کدام بخشها ضعیفتر است.
در بررسیهای انجامشده، پس از پرسیدن این سؤال، ChatGPT اغلب مستقیماً به پیشفرضی اشاره میکرد که پیشتر در جریان مکالمه بهطور پنهانی در نظر گرفته بود. با آشکار شدن این پیشفرض، میتوان اطلاعات ازدسترفته را به مدل داد و به پاسخی دست یافت که واقعاً بهتر و دقیقتر است.
برنامهریزی یک سفر

ابتدا با یک برنامهی سفر شروع شد، زیرا این کاری است که ChatGPT در تولید آن بسیار مهارت دارد، اما گاهی در درک شرایط آن بسیار ضعیف عمل میکند. از مدل خواسته شد تا یک سفر خانوادگی سهروزه را برنامهریزی کند. پس از ارائهی اطلاعات اولیه، برنامهی نهایی مطلوب به نظر میرسید؛ شامل فعالیتهای صبحگاهی، پیشنهادهای ناهار، توقفهای عصرانه و زمان استراحت کافی که اجرای آن را لذتبخش جلوه میداد.
اما یک مشکل وجود داشت. ChatGPT این سفر را بدون در نظر گرفتن اینکه مسافران چه کسانی هستند و بدون فکر کردن به خطاها یا تأخیرهای احتمالی که ممکن است برنامه را به هم بریزد، ایجاد کرده بود. در این مرحله، بهجای اینکه به ChatGPT گفته شود برنامهی سفر بیشازحد فشرده است، همان سؤال تکمیلی تایپ شد: «در پاسخ خود نسبت به چه چیزی نامطمئن هستی؟»
مدل اینگونه پاسخ داد: «من دربارهی سرعت اجرای برنامهی سفر، بهویژه در روز دوم، نامطمئن هستم. من فرض کردهام که خانوادهی شما بهراحتی میتوانند دو فعالیت مهم را با یک استراحت در میان آنها مدیریت کنند، اما از برنامهی خواب کودک شما، سطح انرژی معمول یا میزان استراحتی که در طول سفر ترجیح میدهید، اطلاعی ندارم. همچنین زمانهای سفر را بدون دانستن دقیق محل اقامت شما تخمین زدهام. اگر هر یک از این پیشفرضها اشتباه باشد، ممکن است این برنامه در عمل بسیار پرشتابتر از آنچه روی کاغذ به نظر میرسد، احساس شود.»
اینجا بود که ChatGPT بدون نیاز به اشارهی کاربر، مشکل برنامهی خود را پیدا کرد. این امر باعث شد پرامپت بعدی بسیار بهتر تنظیم شود. به مدل گفته شد که برای هر روز تنها یک فعالیت برنامهریزیشدهی مهم در نظر گرفته شود و عصرها نیز باید منعطف باقی بمانند. ChatGPT برنامه را بر اساس این محدودیتها بازسازی کرد و نسخهی جدید بلافاصله بسیار واقعیتر و قابلاجراتر برای یک خانواده به نظر رسید.
تعمیر یا تعویض؟

در آزمایش دیگری، یک دوراهی فرضی دربارهی لپتاپ برای ChatGPT مطرح شد. سناریو این بود که یک کامپیوتر قدیمی که شروع به کند شدن کرده، در دسترس است و باید مشخص شود که آیا تعمیر آن بهتر است یا تعویض آن. هوش مصنوعی چارچوبی شامل سن لپتاپ، هزینههای احتمالی تعمیر، عملکرد و قیمت جایگزین آن ایجاد کرد. پس از بررسی تمامی موارد، پیشنهاد داد که احتمالاً تعویض لپتاپ در بلندمدت گزینهی منطقیتری است.
مدل ChatGPT در تولید متنهایی که ظاهر یک نتیجهگیری را دارند، بسیار توانمند است. به همین دلیل ممکن است کاربر بهراحتی فراموش کند که برخی از شواهد هرگز ارائه نشدهاند. بنابراین دوباره همان سؤال تکمیلی پرسیده شد: «در پاسخ خود نسبت به چه چیزی نامطمئن هستی؟»
چتبات در پاسخ نوشت: «من دربارهی پیشنهاد تعویض، بدون دانستن هزینهی واقعی تعمیر یا اینکه دقیقاً چه قطعهای خراب شده است، نامطمئن هستم. من از سن لپتاپ بهعنوان مدرکی استفاده میکنم که نشان میدهد ممکن است مشکلات بیشتری ظاهر شوند، اما سن بهتنهایی به ما نمیگوید که آیا تعویض آن از نظر مالی منطقی است یا خیر. اگر مشکل مربوط به ارتقای نسبتاً ارزانقیمت باتری یا فضای ذخیرهسازی باشد، تعمیر آن میتواند عمر مفید دستگاه را بهطور قابلتوجهی افزایش دهد. اگر مدل، مشخصات، علائم خرابی و قیمت تقریبی تعمیر را میدانستم، با اطمینان بسیار بیشتری پاسخ میدادم.»
این بار نقطهضعف زمانی آشکار شد که ChatGPT آن را بیان کرد. در واقع سؤال این بود که آیا یک مشکل ناشناخته ارزش تعمیر دارد یا خیر، بدون اینکه گفته شود مشکل چیست یا تعمیر آن چقدر هزینه دارد. با این حال، ChatGPT توانسته بود پاسخی ارائه دهد.
انسانها بهراحتی بیان میکنند که تا زمانی که اطلاعات بیشتری نداشته باشند، نمیتوانند توصیهای ارائه دهند. اما ChatGPT برای کمک کردن طراحی شده است و کمک کردن اغلب به معنای پر کردن خلأها برای ادامهی مکالمه است. گاهی اوقات این بدان معناست که چتبات مجموعهای خیالی از ایدهها را دارد که بدون توجه به واقعیت، جاهای خالی را با آنها پر میکند.
گسترش این روش
این ترفند را میتوان به روشهای دیگری نیز گسترش داد. پرسیدن «در حال حاضر نسبت به چه چیزی نامطمئن هستی؟» یک نقطهی شروع عالی است، اما پاسخ آن میتواند پایهای برای یک سؤال دیگر باشد.
اگر ChatGPT سه مورد عدم قطعیت را فهرست کند، میتوان پرسید که کدامیک از آنها احتمال بیشتری برای تغییر دادن توصیهی نهایی دارد. اگر بگوید که زمینهی مهمی در اطلاعات مفقود است، میتوان پرسید دقیقاً چه اطلاعاتی نیاز دارد. پرسیدن «چه چیزی میتوانم به تو بگویم که باعث شود مطمئنتر شوی؟» کمک میکند تا هوش مصنوعی برای ارائهی پاسخهای بهتر آماده شود.
این روش بهویژه برای تصمیمگیریها بسیار کاربردی است. هنگام مقایسهی محصولات یا انتخاب بین چند گزینه، میتوان از ChatGPT خواست برداشت اولیهی خود را ارائه دهد و سپس بلافاصله ضعیفترین بخش آن را زیر سؤال برد. این فرآیند بسیار طبیعیتر از آن است که پیش از شروع مکالمه، زمان زیادی صرف ساختن یک پرامپت طولانی و پیچیده شود.
البته محدودیت آشکاری برای همهی این موارد وجود دارد. توصیف ChatGPT از میزان اطمینان خود، توسط خود ChatGPT تولید میشود. این چتبات میتواند دربارهی آنچه باید نگرانش باشد، اشتباه کند یا یک مشکل اساسی را بهطور کامل نادیده بگیرد. برای هر موضوعی که شامل حقایق مهم است، پرسیدن از ChatGPT دربارهی میزان اطمینانش، هیچگاه جایگزین بررسی منابع معتبر نخواهد شد.
اما در مکالمات روزمره، این ترفند بهطرز شگفتانگیزی یکی از بزرگترین چالشهای کار با هوش مصنوعی را برطرف میکند؛ تنها با مجبور کردن مدل به آشکارسازی داربستهای نامرئی که نتیجهگیریهای پاسخهایش را شکل میدهند، میتوان دریافت که آیا این نتایج برای اتکا کردن بهاندازهی کافی مستحکم هستند یا خیر.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.