پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

ادعای دقت ۹۹ درصدی زیر ذره‌بین؛ وقتی ابزار معروف تشخیص هوش مصنوعی با ۳ تا جمله دور می‌خوره!

انتشار:۷ مهر ۱۴۰۵(۱ ساعت پیش)
۱۰ دقیقه زمان مطالعه
۰ دیدگاه

ابزار معروف تشخیص محتوای هوش مصنوعی یعنی پنگرام (Pangram) با مانور روی دقت ۹۹ درصدی حسابی سروصدا کرده، اما بررسی‌های عملی نشون میده دور زدنش از آب خوردن هم راحت‌تره! این ابزار حتی با چند ویرایش ساده در متن یا تصاویر ساختگی به راحتی گول می‌خوره و هشداری جدی برای کاربرانی به حساب میاد که به این الگوریتم‌ها تکیه می‌کنن.

ادعای دقت ۹۹ درصدی زیر ذره‌بین؛ وقتی ابزار معروف تشخیص هوش مصنوعی با ۳ تا جمله دور می‌خوره!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • پنگرام (Pangram) ادعا می‌کنه با دقت بالای ۹۹ درصد متن‌های هوش مصنوعی رو لو میده، اما تو بررسی‌های عملی فقط با اضافه کردن ۳ جمله و کمی بازنویسی، به سادگی فریب خورد.
  • سیستم تشخیص تصویر این ابزار هم پاشنه آشیل بزرگی داره و با یه کراپ ساده یا رد شدن از ابزارهای رایگان ضدتشخیص، عکس‌های کاملاً ساختگی رو اثر دست انسان جا می‌زنه.
  • خطای تشخیص مثبت (False Positive) این ابزارها می‌تونه زندگی شغلی یا تحصیلی افراد رو نابود کنه؛ پلتفرم‌هایی مثل ساب‌استک یا دانشگاه‌ها نباید کورکورانه به این آمارها اعتماد کنن.

این روزها که چت‌بات‌ها، ابزارهای ساخت تصویر و ویدیوهای هوش مصنوعی تشخیص محتوای واقعی از فیک رو تو اینترنت به شدت سخت کردن، ابزارهای تشخیص هوش مصنوعی اهمیت بیشتری از همیشه پیدا کردن. تو این میون، پنگرام (Pangram) به لطف تیترهای پرسروصدا و بیانیه‌های خبری جنجالی‌اش، احتمالاً معروف‌ترین ابزار تو این حوزه‌ست. اما آیا واقعاً ادعای دقت ۹۹ درصدی این ابزار درسته؟ بر اساس بررسی‌ها و تست‌های انجام‌شده، این سرویس تو خیلی از موارد متن‌های هوش مصنوعی رو شکار می‌کنه، ولی در عین حال دور زدنش هم فوق‌العاده ساده‌ست! تو ادامه، قراره صفر تا صد عملکرد و نقاط ضعف پنگرام رو بررسی کنیم.


استفاده از هوش مصنوعی برای مهار خود هوش مصنوعی

پنگرام خودش رو «تنها ابزار تشخیص هوش مصنوعی که واقعاً کار می‌کنه» معرفی می‌کنه و مدعیه برای متن‌های تولیدشده توسط تقریباً تمام مدل‌های مطرح، از ChatGPT گرفته تا Qwen و سایر رقبا، دقتی بالای ۹۹ درصد داره. این پلتفرم قابلیت تشخیص تصاویر ساختگی رو هم داره. نکته جالب ماجرا اینجاست که خود پنگرام برای توسعه سیستم‌های تشخیصش، از مدل‌های اختصاصی هوش مصنوعی استفاده می‌کنه.

این شرکت ادعا می‌کنه قدرت بالاتری نسبت به بقیه رقباش داره چون پژوهشگران و نهادهای مستقل دقت و اعتبارش رو بررسی و تأیید کردن. پنگرام همچنین به پشتیبانی از زبان‌های گسترده، سال‌ها پژوهش اختصاصی، آموزش روی دیتاست‌های متنوع و پوشش تمام مدل‌های اصلی اشاره می‌کنه. حتی مدعی شده هوش مصنوعیش تو شکار محتوای ماشینی از انسان‌ها هم قوی‌تره؛ حتی در مواجهه با ابزارهایی که مخصوص انسانی‌سازی متن (Humanizer) طراحی شدن تا رد هوش مصنوعی رو پاک کنن!

روش پرامپت‌های آینه‌ای پنگرام، ترفندی هوشمندانه برای آموزش مدل تشخیص هوش مصنوعیه.

این‌ها ادعاهای بسیار بزرگی هستن و انصافاً بعضی از تکنولوژی‌های زیربنایی پنگرام نوآورانه به حساب میان؛ مثلاً تمرکز ویژه روی تکنیک «پرامپت‌های آینه‌ای» (Mirrored Prompts). تو این روش، پنگرام از یک انسان می‌خواد متنی بنویسه و همون پرامپت رو به مدل هوش مصنوعی هم میده تا الگوریتم‌های تشخیصی با مقایسه تفاوت‌های ظریف بین این دو آموزش ببینن. این متد روی کاغذ عالی به نظر می‌رسه، اما پای عمل و بررسی دقیق آمارها که به میون میاد، ضعف‌ها کم‌کم رو میشن.


شکستن سد تشخیص: چطور پنگرام گول خورد؟

اگر فکر می‌کنید ادعای دقت ۹۹ درصدی یعنی این ابزار تقریباً هیچ‌وقت خطا نداره، سخت در اشتباهید. معنای این حرف این نیست که پنگرام اصلاً کار نمی‌کنه؛ در واقع تو اکثر اوقات جواب میده و بین تمام ابزارهای موجود، شاید بالاترین دقت رو نشون داده باشه. اما موضوع اینه که پنگرام صرفاً بهترین گزینه میون یه مشت ابزار پر از عیب و ایراده!

یادتون باشه پنگرام برای اینکه بررسی دقیقی انجام بده، شرط گذاشته که متن ورودی باید حداقل ۵۰ کلمه باشه. برای سنجش عملکرد این ابزار، پیش‌نویس بخش اول همین مقاله برداشته شد و یک جمله تولیدشده با جمینای (Gemini) وسط اون قرار گرفت؛ نتیجه؟ پنگرام هیچ ردپایی از هوش مصنوعی ندید! بعد از اون، یک جمله دیگه با جمینای به متن اضافه شد، اما باز هم پنگرام چیزی متوجه نشد. فقط وقتی سه جمله کامل هوش مصنوعی وارد متن شد (و حجم متن از ۲۵۰ به ۳۱۱ کلمه رسید)، سیستم آژیر خطر کشید! اما ماجرا وقتی جالب‌تر شد که سیستم فقط دو جمله رو ماشینی تشخیص داد که اتفاقاً یکی از اونا رو خود انسان نوشته بود! در نهایت با کمی بازنویسی اون یک جمله‌ای که درست تشخیص داده شده بود، پنگرام کاملاً تسلیم شد و هیچی پیدا نکرد.

ابزارهای رایگان بی‌شماری تو اینترنت وجود دارن که متن هوش مصنوعی رو انسانی‌سازی می‌کنن.

علاوه بر این، پنگرام ادعا می‌کنه متن‌های بازنویسی‌شده توسط ابزارهای انسانی‌ساز رو هم تشخیص میده، اما دور زدنش با همین ابزارها خیلی راحته. در یک بررسی تجربی، شعری با مدل GPT-5.6 تولید شد و بعد با اولین سایت رایگانی که برای Humanize کردن تو وب پیدا شد بازنویسی شد؛ وقتی خروجی به پنگرام داده شد، این ابزار شعر هوش مصنوعی رو ۱۰۰ درصد کار دست انسان دونست!


تصاویر هم بی‌نقص نیستند: وقتی ادیت‌های ساده تشخیص‌دهنده تصویر رو فریب میدن

با اینکه تمرکز اصلی پنگرام روی متن هست، قابلیت شناسایی تصاویر تولیدشده با هوش مصنوعی رو هم ارائه میده. اگرچه بیشتر تصاویر هوش مصنوعی تو تست‌ها شناسایی شدن، ولی خطاهای عجیب و غریب به وفور دیده میشه.

برای نمونه، تصاویر فیکی که کمی طبیعی و باورپذیر طراحی شدن خیلی راحت پنگرام رو به اشتباه میندازن. سال ۲۰۲۳ وبسایت CNET چالشی منتشر کرده بود که مهارت آدما در تشخیص تصاویر هوش مصنوعی رو می‌سنجید. یکی از این عکس‌ها یک نان تست آووکادو با برشی عجیب از لیمو بود. پنگرام این عکس رو ۱۰۰ درصد انسانی و واقعی اعلام کرد، در حالی که کاملاً کار هوش مصنوعی بود!

اشتباه نکنید، این یک نان تست آووکادوی واقعی نیست؛ عکس کاملاً توسط هوش مصنوعی ساخته شده.

علاوه بر این، اگر نشانه‌های تصویر رو پاک کنید، پنگرام کاملاً فریب می‌خوره. مثلاً وقتی عکسی با مدل Nano Banana در جمینای برش (کراپ) داده شد، سیستم‌های امنیتی نشانگرهای C2PA و SynthID رو روی فایل ثبت کردن. پنگرام هم با خوندن متادیتای C2PA تصویر رو به عنوان هوش مصنوعی علامت زد. اما وقتی همین تصویر از یک ابزار رایگان ضدتشخیص رد شد و نشانه‌هاش پاک شد، پنگرام اون رو یک عکس معمولی و ساخته دست انسان تشخیص داد!


پشت‌پرده ادعای دقت ۹۹ درصدی؛ ریزه‌کاری‌هایی که پنگرام بهتون نمیگه

حالا سؤال اینجاست: چطور ابزاری با ادعای دقت بالای ۹۹ درصد این‌همه گاف میده؟ پنگرام مستندات متعددی از نتایج آزمایش‌هاش منتشر کرده که شفافیت قابل تحسینی داره، اما با نگاهی دقیق‌تر به این اسناد میشه متوجه بازی با اعداد شد.

به عنوان مثال، پنگرام برای مدل Opus 5 شرکت آنتروپیک (Anthropic) مدعی دقت ۹۹.۸ درصدی شده و به تست‌های خودش استناد می‌کنه. اما این ادعا فقط متونی رو شامل میشه که مدل مستقیماً و بدون دستکاری در پاسخ به پرامپت تولید کرده؛ یعنی این عدد متونی که توسط انسان یا ابزارهای ادیت دستکاری شدن رو پوشش نمیده! پنگرام نتایج مربوط به متن‌های دستکاری‌شده رو جداگانه و زیر خروارها سند پنهان کرده.

طبق همون مستندات، پنگرام می‌تونه متن‌های انسانی‌سازی‌شده رو در ۹۷.۶۷ درصد موارد به عنوان هوش مصنوعی و در ۹۸.۸۳ درصد موارد به عنوان محتوای ترکیبی یا ماشینی شناسایی کنه. هرچند این ارقام هنوز خوب به نظر می‌رسن، اما بقیه آمارها عملکرد بسیار ضعیف‌تری نشون میدن؛ برای نمونه، این ابزار در تشخیص متن‌هایی که فقط با کمک هوش مصنوعی نوشته شدن (AI-assisted) صرفاً در ۵۵.۰۱ درصد موارد موفق بوده! این در حالیه که پنگرام تو تبلیغاتش فقط روی همون سناریوی خاص با دقت ۹۹.۸ درصدی مانور میده.

آمارهای مربوط به سایر مدل‌ها هم پر از تناقضه. مثلاً لینک ادعای دقت ۹۹.۵ درصدی برای سری مدل‌های Gemini 3 در صفحه اصلی، به صفحه‌ای قدیمی درباره Gemini 3 Pro باز میشه که برخلاف صفحات GPT-5.6 و Opus 5 هیچ توضیحی درباره نحوه رسیدن به این عدد نداده!

با بررسی مستندات پنگرام ۴ مشخص میشه که شرکت نسخه‌های آزمایشی Gemini 3.1 Pro و 3.5 Flash رو هم تست کرده که خطای منفی کاذب (False Negative) ۹۹.۵ درصدی رو نشون میدن. با این حال مشخص نیست دقت اعلامی Gemini 3 چطور در نوامبر ۲۰۲۵ و قبل از معرفی این مدل‌ها ثبت شده. علاوه بر این، سری جیمینای مدل‌های جدیدتری مثل 3.6 Flash، 3.7 Flash و 3.8 Flash رو هم شامل میشه که اثری ازشون نیست. در حالی که برای GPT-5.6 تمام نسخه‌ها مثل Luna، Sol و Terra تست شدن، تست‌های خانواده جیمینای به شدت ناقص رها شده.

البته شواهدی وجود نداره که شرکت این اعداد رو جعل کرده باشه، اما این ماجرا دوباره نشون میده که بنچمارک‌های هوش مصنوعی چقدر با عملکرد واقعی تو دنیای روزمره فاصله دارن. تست‌های آزمایشگاهی پنگرام روی کاغذ نتایج درخشانی دارن، اما تو واقعیت خیلی ساده میشه دورشون زد.


آمار دست‌چین‌شده؛ واقعیت تاییده‌های مستقل چیه؟

پنگرام علاوه بر تست‌های داخلی، ادعا می‌کنه بر اساس تحقیقات مستقل دانشگاه‌های مریلند و شیکاگو، به عنوان دقیق‌ترین ابزار بازار اثبات شده. این ادعا دروغ نیست، اما طوری بیان شده که نتایج این پژوهش‌ها رو خیلی بزرگ‌تر از واقعیت نشون میده.

وقتی پنگرام میگه از انسان‌ها جلو زده، صرفاً مقایسه تک‌به‌تکه مدنظره نه تشخیص گروهی انسان‌ها.

به عنوان مثال، در تحقیق دانشگاه مریلند، پنگرام مدعی شده عملکردش در تشخیص متون هوش مصنوعی بهتر از انسان‌ها بوده. واقعیت اینه که پنگرام تو مقایسه تک‌به‌تک با افراد برنده شده، اما وقتی ارزیابی توسط گروهی از انسان‌ها انجام شده، انسان‌ها عملکرد به مراتب بهتری نسبت به پنگرام ثبت کردن! این تناقض ادعای پنگرام رو که میگه «مطالعات مستقل برتری این ابزار رو بر ارزیاب‌های انسانی آموزش‌دیده نشون داده»، به چالش می‌کشه.

در مطالعه دانشگاه شیکاگو هم پنگرام فقط با سه ابزار دیگه مقایسه شده که برای بازاری با ده‌ها سرویس مختلف انتخابی بسیار محدود محسوب میشه. محققان دانشگاه آزاد بروکسل هم این ابزار رو صرفاً در کنار سه ابزار دیگه روی مقالات طولانی آکادمیک تست کردن. اگرچه این نتایج مثبت بودن، اما به هیچ وجه مدرک قطعی برای اثبات بی‌نقص بودن پنگرام نیستن.

در کنار پژوهش‌های دانشگاهی، پنگرام به نقل‌قول‌های رسانه‌ای هم استناد می‌کنه؛ مثل مقاله‌ای از دیوید گورتز در ZDNET که گفته بود پنگرام تازه‌واردیه که بلافاصله به صدر جدول رسیده. اما پنگرام فراموش کرده این بخش از حرف‌های گورتز رو نقل کنه که گفته بود «سرویس‌های تشخیص هوش مصنوعی کارنامه‌ای پر از تناقض دارن و قبل از اعتماد به نتایج هرکدوم از این ابزارها باید احتیاط زیادی به خرج داد».

تردیدی نیست که پنگرام خروجی‌های خوبی ثبت کرده، اما تکیه بر این داده‌ها انتظارات غیرواقعی ایجاد می‌کنه؛ چرا که این سیستم همچنان مرتب اشتباه می‌کنه و خطاهای اون عواقب سنگینی برای افراد داره.


تشخیص‌های اشتباهی که می‌تونن زندگی آدما رو نابود کنن

امروز تشخیص واقعیت تو اینترنت سخت‌تر از گذشته شده و توسعه هوش مصنوعی اوضاع رو پیچیده‌تر کرده. ابزارهایی هم که مدعی تشخیص هستن ولی دقت کامل ندارن، به این هرج‌ومرج دامن می‌زنن.

به عنوان مثال، پلتفرم ساب‌استک (Substack) اخیراً امکان اسکن نوشته‌ها با فناوری پنگرام رو اضافه کرده تا نویسندگان میزان استفاده از هوش مصنوعی رو متوجه بشن. اما اگه شما نویسنده‌ای باشید که تمام درآمدتون از ساب‌استک تأمین میشه و پنگرام متنتون رو به غلط هوش مصنوعی تشخیص بده چی میشه؟ یا برعکس، نویسنده‌ای متن هوش مصنوعی رو منتشر کنه و پنگرام اون رو ۱۰۰ درصد انسانی معرفی کنه چی؟ با اینکه ساب‌استک امکان گزارش خطا رو فراهم کرده، اما راه‌حل پایدار و مطمئنی نیست.

اینکه بفهمیم متنی که می‌خونیم واقعیه یا نه مفیده، اما اگه ابزار تشخیص اشتباه کنه چه بلایی سر نویسنده میاد؟

این خطرات فراتر از پلتفرم‌های نویسندگیه. تصور کنید استادی در دانشگاه که درک عمیقی از فناوری نداره، به اعتبار همکاری دانشگاه با پنگرام، مقالات دانشجوها رو با این ابزار بررسی کنه. اگه پنگرام متنی کاملاً اصیل و زحمت‌کشیده رو هوش مصنوعی علامت بزنه، دانشجو به راحتی مشروط یا محروم میشه، بدون اینکه راهی برای اثبات بی‌گناهی خودش داشته باشه؛ چرا که اکثر افراد نحوه کارکرد این ابزارها رو نمی‌دونن و به این درصدها اعتماد مطلق دارن.

همین خطرات جدی دلیلیه که کارشناسان نسبت به ادعاهای پنگرام سخت‌گیر باشن. شرکت‌های این حوزه باید خیلی شفاف‌تر درباره نقاط ضعف و خطاهای احتمالی خودشون صحبت کنن.


هیچ استاندارد طلایی وجود نداره؛ باید به همه ابزارهای تشخیص شک کرد

ابزارهای تشخیص هوش مصنوعی برخلاف تبلیغات تجاری و ادعاهای پژوهشی، تو دنیای واقعی هنوز قابل اتکا نیستن. البته اگه پنگرام متنی رو هوش مصنوعی علامت بزنه ممکنه نشانه‌ای از دستکاری باشه، اما این هشدارها هرگز وحی منزل نیستن! فراموش نکنید اعتماد چشم‌بسته به این پلتفرم‌ها می‌تونه فاجعه بسازه. بهترین راهکار اینه که نحوه محاسبه این آمارها رو بشناسید و در برابر هرگونه ادعای دقت بالا، همیشه یک دوز سالم از شک و تردید همراه خودتون داشته باشید.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

هشدار جینا ریموندو درباره هوش مصنوعی: در آینده شغل می‌سازد، اما اولش یک موج سنگین اخراج در راه است!
آخرین اخبار

هشدار جینا ریموندو درباره هوش مصنوعی: در آینده شغل می‌سازد، اما اولش یک موج سنگین اخراج در راه است!

جینا ریموندو، وزیر سابق بازرگانی آمریکا، معتقد است هوش مصنوعی در نهایت شغل‌های جدیدی خلق می‌کند، اما بدون برنامه‌ریزی دقیق، ابتدا با موج ویرانگری از اخراج‌های دسته‌جمعی مواجه خواهیم شد. او هشدار می‌دهد اگر قوانین و مالیات‌ها برای عصر ایجنت‌های هوشمند بازنویسی نشود، بحران اقتصادی و اجتماعی عمیقی شکل خواهد گرفت.

۷ دقیقه مطالعه
۰
۷ مهر
بیش از نیمی از تراکنش‌های ایجنت جنجالی اینستینکت مربوط به سفر است؛ هوش مصنوعی آژانس‌های مسافرتی را دور می‌زند!
آخرین اخبار

بیش از نیمی از تراکنش‌های ایجنت جنجالی اینستینکت مربوط به سفر است؛ هوش مصنوعی آژانس‌های مسافرتی را دور می‌زند!

نوآ شین، بنیان‌گذار پلتفرم محبوب Instinct اعلام کرده که بیش از نیمی از خریدها و تراکنش‌های کاربران در این پلتفرم هوش مصنوعی به برنامه‌ریزی سفر اختصاص دارد. این استارتاپ ۱۴ نفره که ارزش آن به‌تازگی به ۱۰ میلیارد دلار رسیده، قصد دارد با کمک ایجنت‌های هوشمند شیوه سنتی رزرو بلیت، هتل و حتی میز رستوران‌ها را دگرگون کند.

۲ دقیقه مطالعه
۰
۷ مهر
پلتفرم Autoheal به میدان آمد: مدیریت خرابکاری‌ها و کارهای نیمه‌کاره ایجنت‌های کدنویسی!
آخرین اخبار

پلتفرم Autoheal به میدان آمد: مدیریت خرابکاری‌ها و کارهای نیمه‌کاره ایجنت‌های کدنویسی!

با انفجار ابزارهای کدنویسی هوش مصنوعی و تولید حجم عظیمی از کد، حالا معضل اصلی تیم‌های فنی، بررسی و نگهداری این کوه کد است. استارتاپ تازه وارد «اتوهیل» (Autoheal) با معرفی پلتفرمی هوشمند و ایجنت‌هایی که کار بقیه ایجنت‌ها را نظارت و خودکار اصلاح می‌کنند، می‌خواهد هزینه‌ها و دردسرهای توسعه نرم‌افزار را به‌شدت کاهش دهد.

۱۰ دقیقه مطالعه
۰
۷ مهر