هوش مصنوعی بلای جان سرمایه شما؛ چتباتها در پاسخ به سوالات مالی مردود شدند
بررسیهای جدید نشان میدهد چتباتهای هوش مصنوعی گزینههای قابلاعتمادی برای دریافت مشاوره مالی نیستند و بیشتر اوقات پاسخهای نادرستی ارائه میدهند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- بررسی ۱۷ مدل هوش مصنوعی نشان میدهد این ابزارها در پاسخ به سوالات مالی ساده ۵۷ درصد و در مسائل پیچیده ۸۸ درصد مواقع اشتباه میکنند.
- مدل پولی Claude Opus 5 با ثبت دقت ۶۱ درصدی بهترین عملکرد را داشته است، درحالیکه Claude Haiku 4.5 ضعیفترین مدل رایگان لقب گرفت.
- چتباتها مشاورههای خطرناکی ارائه دادند؛ از جمله ادعای نادرست توقف بازپرداخت وام دانشجویی با مهاجرت یا بیتأثیر بودن عدم پرداخت وام مسکن بر امتیاز اعتباری.
کمتر کسی از شنیدن اینکه کاربران برای دریافت پاسخ پرسشهای مالی خود به دانش نهفته در سیستمهای هوش مصنوعی روی آوردهاند، تعجب میکند.
نگاهی به آمارهای منتشرشده از سوی Intuit Credit Karma گویای همین واقعیت است. بر اساس این دادهها، «۶۶ درصد از آمریکاییهایی که تجربه استفاده از هوش مصنوعی مولد را داشتهاند، از آن برای دریافت مشاوره مالی کمک گرفتهاند. این رقم در میان نسل زد و هزاره به ۸۲ درصد میرسد.» به نظر میرسد کمک گرفتن از هوش مصنوعی برای مدیریت پول به یکی از کاربردیترین موارد استفاده این فناوری تبدیل شده است؛ بهطوریکه امور مالی با ۴۱ درصد، دومین کاربرد رایج هوش مصنوعی مولد پس از حوزه سلامت و تندرستی (۴۴ درصد) به شمار میرود.
بااینحال، بر اساس پژوهش جدیدی با عنوان «اقتدار مصنوعی» که توسط شرکت فناوری و هوش مصنوعی Saturn انجام شده است، تبدیل کردن هوش مصنوعی به یک مشاور مالی شاید چندان هوشمندانه نباشد. تیم Domain در شرکت Saturn پس از آزمایش ۱۸ ابزار محبوب هوش مصنوعی از جمله ChatGPT، Gemini، Claude و Copilot به این نتیجه دست یافت.
نتایج بررسیهای Saturn به یک واقعیت تلخ اشاره دارد: چتباتها گزینههای چندان قابلاعتمادی برای دریافت مشاورههای مالی اصولی و قانونی نیستند.
نتایج نگرانکننده بنچمارک Saturn

تکاندهندهترین آمار ارائهشده در گزارش Saturn نشان میدهد که مدلهای هوش مصنوعی در مواجهه با سوالات مالی، بیشتر از آنکه پاسخ درست بدهند، اشتباه میکنند.
در میان ۱۷ مدل هوش مصنوعی بررسیشده، میانگین دقت ثبتشده روی عدد ۴۳ درصد ایستاد؛ به این معنا که همین چتباتها در ۵۷ درصد مواقع به سوالات مالی پاسخ اشتباه دادند. زمانی که سناریوهای پیچیده و چندمرحلهای با تمرکز بر قوانین مالیاتی و ارقام دقیقتر مطرح شد، دقت این ابزارها تا ۱۲ درصد سقوط کرد و در ۸۸ درصد مواقع با خطا همراه بود.
جای تعجب نیست که مدلهای رایگان با ۶۳ درصد خطا، عملکرد ضعیفتری نسبت به نسخههای پولی (با ۴۹ درصد خطا) از خود نشان دادند. مدل Claude Haiku 4.5 عنوان ضعیفترین مدل رایگان را از آن خود کرد و در ۸۲ درصد موارد پاسخهای نادرست یا ناقص ارائه داد. از سوی دیگر، ChatGPT-5.6 Luna با وجود ثبت آمار ۵۶ درصدی در ارائه پاسخهای اشتباه، به عنوان بهترین مدل رایگان شناخته شد.
شرکت Saturn در میان تمامی مدلهای آزمایششده دریافت که مدل پولی و استدلالی Claude Opus 5 متعلق به شرکت Anthropic با ثبت نرخ موفقیت ۶۱ درصدی، بهترین نتایج را به دست آورده است. اما حتی با وجود این آمار که آن را به برترین چتبات در زمینه مشاوره مالی تبدیل میکند، Claude Opus 5 همچنان در تقریباً چهار مورد از هر ده پرسش، از ارائه پاسخ صحیح بازماند. این مدل در مواجهه با سوالات پیچیدهتر نیز در ۶۷ درصد مواقع دچار اشتباه شد.
آنچه پژوهش Saturn را نگرانکنندهتر میکند، بررسی عمیق اشتباهات خاصی است که این مدلهای هوش مصنوعی مرتکب شدهاند و میتوانند پیامدهای مالی وخیمی به همراه داشته باشند. برای نمونه، یک مدل قانونی از خود ابداع کرد و مدعی شد که فارغالتحصیلان دانشگاهی میتوانند با مهاجرت به خارج از کشور، بازپرداخت وام دانشجویی خود را متوقف کنند (در صورتی که در دنیای واقعی، چنین اقدامی میتواند به افزایش اقساط ماهانه منجر شود). همچنین، در یکی از آزمایشها، مدل Gemini بهاشتباه به وامگیرندهای اعلام کرد که استفاده از مهلت تنفس برای پرداخت وام مسکن، تاثیری بر امتیاز اعتباری او نخواهد گذاشت.
چشمانداز آینده
گزارش Saturn پرده از حقیقت تلخی برمیدارد که بسیاری از کاربران هوش مصنوعی باید با آن کنار بیایند: مشاورههای مالی هوش مصنوعی همچنان غیرقابلاعتماد هستند و بهجای افزایش درآمد، میتوانند کاربران را در معرض خطر از دست دادن بخش زیادی از سرمایهشان قرار دهند.
گزارش شرکت EY در مارس ۲۰۲۶ نشان داد که ۵۳ درصد از پاسخدهندگان ترجیح میدهند برای تصمیمگیریهای مربوط به سرمایهگذاری مالی از یک دستیار هوش مصنوعی استفاده کنند. ۱۴ درصد مدلهای هوش مصنوعی کاملاً خودمختار را ترجیح میدادند و ۳۳ درصد نیز اعلام کردند که در چنین شرایطی از هیچ شکلی از هوش مصنوعی کمک نخواهند گرفت.
با توجه به یافتههای Saturn، ممکن است این آمارهای مربوط به استقبال از هوش مصنوعی دچار ریزش شود، زیرا کاربران بیشتری از طرح پرسشهای شخصی درباره مدیریت بدهی، وامهای دانشجویی، وام مسکن، حقوق بازنشستگی، مالیات بر ارث و برنامهریزی برای دوران بازنشستگی از چتباتها خودداری خواهند کرد.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.