پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

هوش مصنوعی بلای جان سرمایه شما؛ چت‌بات‌ها در پاسخ به سوالات مالی مردود شدند

انتشار:۳۱ شهریور ۱۴۰۵(۶ روز پیش)
۴ دقیقه زمان مطالعه
۰ دیدگاه

بررسی‌های جدید نشان می‌دهد چت‌بات‌های هوش مصنوعی گزینه‌های قابل‌اعتمادی برای دریافت مشاوره مالی نیستند و بیشتر اوقات پاسخ‌های نادرستی ارائه می‌دهند.

هوش مصنوعی بلای جان سرمایه شما؛ چت‌بات‌ها در پاسخ به سوالات مالی مردود شدند

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • بررسی ۱۷ مدل هوش مصنوعی نشان می‌دهد این ابزارها در پاسخ به سوالات مالی ساده ۵۷ درصد و در مسائل پیچیده ۸۸ درصد مواقع اشتباه می‌کنند.
  • مدل پولی Claude Opus 5 با ثبت دقت ۶۱ درصدی بهترین عملکرد را داشته است، درحالی‌که Claude Haiku 4.5 ضعیف‌ترین مدل رایگان لقب گرفت.
  • چت‌بات‌ها مشاوره‌های خطرناکی ارائه دادند؛ از جمله ادعای نادرست توقف بازپرداخت وام دانشجویی با مهاجرت یا بی‌تأثیر بودن عدم پرداخت وام مسکن بر امتیاز اعتباری.

کمتر کسی از شنیدن اینکه کاربران برای دریافت پاسخ پرسش‌های مالی خود به دانش نهفته در سیستم‌های هوش مصنوعی روی آورده‌اند، تعجب می‌کند.

نگاهی به آمارهای منتشرشده از سوی Intuit Credit Karma گویای همین واقعیت است. بر اساس این داده‌ها، «۶۶ درصد از آمریکایی‌هایی که تجربه استفاده از هوش مصنوعی مولد را داشته‌اند، از آن برای دریافت مشاوره مالی کمک گرفته‌اند. این رقم در میان نسل زد و هزاره به ۸۲ درصد می‌رسد.» به نظر می‌رسد کمک گرفتن از هوش مصنوعی برای مدیریت پول به یکی از کاربردی‌ترین موارد استفاده این فناوری تبدیل شده است؛ به‌طوری‌که امور مالی با ۴۱ درصد، دومین کاربرد رایج هوش مصنوعی مولد پس از حوزه سلامت و تندرستی (۴۴ درصد) به شمار می‌رود.

بااین‌حال، بر اساس پژوهش جدیدی با عنوان «اقتدار مصنوعی» که توسط شرکت فناوری و هوش مصنوعی Saturn انجام شده است، تبدیل کردن هوش مصنوعی به یک مشاور مالی شاید چندان هوشمندانه نباشد. تیم Domain در شرکت Saturn پس از آزمایش ۱۸ ابزار محبوب هوش مصنوعی از جمله ChatGPT، Gemini، Claude و Copilot به این نتیجه دست یافت.

نتایج بررسی‌های Saturn به یک واقعیت تلخ اشاره دارد: چت‌بات‌ها گزینه‌های چندان قابل‌اعتمادی برای دریافت مشاوره‌های مالی اصولی و قانونی نیستند.

نتایج نگران‌کننده بنچمارک Saturn

chatgpt
(منبع تصویر: Shutterstock)

تکان‌دهنده‌ترین آمار ارائه‌شده در گزارش Saturn نشان می‌دهد که مدل‌های هوش مصنوعی در مواجهه با سوالات مالی، بیشتر از آنکه پاسخ درست بدهند، اشتباه می‌کنند.

در میان ۱۷ مدل هوش مصنوعی بررسی‌شده، میانگین دقت ثبت‌شده روی عدد ۴۳ درصد ایستاد؛ به این معنا که همین چت‌بات‌ها در ۵۷ درصد مواقع به سوالات مالی پاسخ اشتباه دادند. زمانی که سناریوهای پیچیده و چندمرحله‌ای با تمرکز بر قوانین مالیاتی و ارقام دقیق‌تر مطرح شد، دقت این ابزارها تا ۱۲ درصد سقوط کرد و در ۸۸ درصد مواقع با خطا همراه بود.

جای تعجب نیست که مدل‌های رایگان با ۶۳ درصد خطا، عملکرد ضعیف‌تری نسبت به نسخه‌های پولی (با ۴۹ درصد خطا) از خود نشان دادند. مدل Claude Haiku 4.5 عنوان ضعیف‌ترین مدل رایگان را از آن خود کرد و در ۸۲ درصد موارد پاسخ‌های نادرست یا ناقص ارائه داد. از سوی دیگر، ChatGPT-5.6 Luna با وجود ثبت آمار ۵۶ درصدی در ارائه پاسخ‌های اشتباه، به عنوان بهترین مدل رایگان شناخته شد.

شرکت Saturn در میان تمامی مدل‌های آزمایش‌شده دریافت که مدل پولی و استدلالی Claude Opus 5 متعلق به شرکت Anthropic با ثبت نرخ موفقیت ۶۱ درصدی، بهترین نتایج را به دست آورده است. اما حتی با وجود این آمار که آن را به برترین چت‌بات در زمینه مشاوره مالی تبدیل می‌کند، Claude Opus 5 همچنان در تقریباً چهار مورد از هر ده پرسش، از ارائه پاسخ صحیح بازماند. این مدل در مواجهه با سوالات پیچیده‌تر نیز در ۶۷ درصد مواقع دچار اشتباه شد.

آنچه پژوهش Saturn را نگران‌کننده‌تر می‌کند، بررسی عمیق اشتباهات خاصی است که این مدل‌های هوش مصنوعی مرتکب شده‌اند و می‌توانند پیامدهای مالی وخیمی به همراه داشته باشند. برای نمونه، یک مدل قانونی از خود ابداع کرد و مدعی شد که فارغ‌التحصیلان دانشگاهی می‌توانند با مهاجرت به خارج از کشور، بازپرداخت وام دانشجویی خود را متوقف کنند (در صورتی که در دنیای واقعی، چنین اقدامی می‌تواند به افزایش اقساط ماهانه منجر شود). همچنین، در یکی از آزمایش‌ها، مدل Gemini به‌اشتباه به وام‌گیرنده‌ای اعلام کرد که استفاده از مهلت تنفس برای پرداخت وام مسکن، تاثیری بر امتیاز اعتباری او نخواهد گذاشت.

چشم‌انداز آینده

گزارش Saturn پرده از حقیقت تلخی برمی‌دارد که بسیاری از کاربران هوش مصنوعی باید با آن کنار بیایند: مشاوره‌های مالی هوش مصنوعی همچنان غیرقابل‌اعتماد هستند و به‌جای افزایش درآمد، می‌توانند کاربران را در معرض خطر از دست دادن بخش زیادی از سرمایه‌شان قرار دهند.

گزارش شرکت EY در مارس ۲۰۲۶ نشان داد که ۵۳ درصد از پاسخ‌دهندگان ترجیح می‌دهند برای تصمیم‌گیری‌های مربوط به سرمایه‌گذاری مالی از یک دستیار هوش مصنوعی استفاده کنند. ۱۴ درصد مدل‌های هوش مصنوعی کاملاً خودمختار را ترجیح می‌دادند و ۳۳ درصد نیز اعلام کردند که در چنین شرایطی از هیچ شکلی از هوش مصنوعی کمک نخواهند گرفت.

با توجه به یافته‌های Saturn، ممکن است این آمارهای مربوط به استقبال از هوش مصنوعی دچار ریزش شود، زیرا کاربران بیشتری از طرح پرسش‌های شخصی درباره مدیریت بدهی، وام‌های دانشجویی، وام مسکن، حقوق بازنشستگی، مالیات بر ارث و برنامه‌ریزی برای دوران بازنشستگی از چت‌بات‌ها خودداری خواهند کرد.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر