ادعای دقت ۹۹ درصدی زیر ذرهبین؛ وقتی ابزار معروف تشخیص هوش مصنوعی با ۳ تا جمله دور میخوره!
ابزار معروف تشخیص محتوای هوش مصنوعی یعنی پنگرام (Pangram) با مانور روی دقت ۹۹ درصدی حسابی سروصدا کرده، اما بررسیهای عملی نشون میده دور زدنش از آب خوردن هم راحتتره! این ابزار حتی با چند ویرایش ساده در متن یا تصاویر ساختگی به راحتی گول میخوره و هشداری جدی برای کاربرانی به حساب میاد که به این الگوریتمها تکیه میکنن.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- پنگرام (Pangram) ادعا میکنه با دقت بالای ۹۹ درصد متنهای هوش مصنوعی رو لو میده، اما تو بررسیهای عملی فقط با اضافه کردن ۳ جمله و کمی بازنویسی، به سادگی فریب خورد.
- سیستم تشخیص تصویر این ابزار هم پاشنه آشیل بزرگی داره و با یه کراپ ساده یا رد شدن از ابزارهای رایگان ضدتشخیص، عکسهای کاملاً ساختگی رو اثر دست انسان جا میزنه.
- خطای تشخیص مثبت (False Positive) این ابزارها میتونه زندگی شغلی یا تحصیلی افراد رو نابود کنه؛ پلتفرمهایی مثل ساباستک یا دانشگاهها نباید کورکورانه به این آمارها اعتماد کنن.
این روزها که چتباتها، ابزارهای ساخت تصویر و ویدیوهای هوش مصنوعی تشخیص محتوای واقعی از فیک رو تو اینترنت به شدت سخت کردن، ابزارهای تشخیص هوش مصنوعی اهمیت بیشتری از همیشه پیدا کردن. تو این میون، پنگرام (Pangram) به لطف تیترهای پرسروصدا و بیانیههای خبری جنجالیاش، احتمالاً معروفترین ابزار تو این حوزهست. اما آیا واقعاً ادعای دقت ۹۹ درصدی این ابزار درسته؟ بر اساس بررسیها و تستهای انجامشده، این سرویس تو خیلی از موارد متنهای هوش مصنوعی رو شکار میکنه، ولی در عین حال دور زدنش هم فوقالعاده سادهست! تو ادامه، قراره صفر تا صد عملکرد و نقاط ضعف پنگرام رو بررسی کنیم.
استفاده از هوش مصنوعی برای مهار خود هوش مصنوعی
پنگرام خودش رو «تنها ابزار تشخیص هوش مصنوعی که واقعاً کار میکنه» معرفی میکنه و مدعیه برای متنهای تولیدشده توسط تقریباً تمام مدلهای مطرح، از ChatGPT گرفته تا Qwen و سایر رقبا، دقتی بالای ۹۹ درصد داره. این پلتفرم قابلیت تشخیص تصاویر ساختگی رو هم داره. نکته جالب ماجرا اینجاست که خود پنگرام برای توسعه سیستمهای تشخیصش، از مدلهای اختصاصی هوش مصنوعی استفاده میکنه.
این شرکت ادعا میکنه قدرت بالاتری نسبت به بقیه رقباش داره چون پژوهشگران و نهادهای مستقل دقت و اعتبارش رو بررسی و تأیید کردن. پنگرام همچنین به پشتیبانی از زبانهای گسترده، سالها پژوهش اختصاصی، آموزش روی دیتاستهای متنوع و پوشش تمام مدلهای اصلی اشاره میکنه. حتی مدعی شده هوش مصنوعیش تو شکار محتوای ماشینی از انسانها هم قویتره؛ حتی در مواجهه با ابزارهایی که مخصوص انسانیسازی متن (Humanizer) طراحی شدن تا رد هوش مصنوعی رو پاک کنن!

اینها ادعاهای بسیار بزرگی هستن و انصافاً بعضی از تکنولوژیهای زیربنایی پنگرام نوآورانه به حساب میان؛ مثلاً تمرکز ویژه روی تکنیک «پرامپتهای آینهای» (Mirrored Prompts). تو این روش، پنگرام از یک انسان میخواد متنی بنویسه و همون پرامپت رو به مدل هوش مصنوعی هم میده تا الگوریتمهای تشخیصی با مقایسه تفاوتهای ظریف بین این دو آموزش ببینن. این متد روی کاغذ عالی به نظر میرسه، اما پای عمل و بررسی دقیق آمارها که به میون میاد، ضعفها کمکم رو میشن.
شکستن سد تشخیص: چطور پنگرام گول خورد؟
اگر فکر میکنید ادعای دقت ۹۹ درصدی یعنی این ابزار تقریباً هیچوقت خطا نداره، سخت در اشتباهید. معنای این حرف این نیست که پنگرام اصلاً کار نمیکنه؛ در واقع تو اکثر اوقات جواب میده و بین تمام ابزارهای موجود، شاید بالاترین دقت رو نشون داده باشه. اما موضوع اینه که پنگرام صرفاً بهترین گزینه میون یه مشت ابزار پر از عیب و ایراده!
یادتون باشه پنگرام برای اینکه بررسی دقیقی انجام بده، شرط گذاشته که متن ورودی باید حداقل ۵۰ کلمه باشه. برای سنجش عملکرد این ابزار، پیشنویس بخش اول همین مقاله برداشته شد و یک جمله تولیدشده با جمینای (Gemini) وسط اون قرار گرفت؛ نتیجه؟ پنگرام هیچ ردپایی از هوش مصنوعی ندید! بعد از اون، یک جمله دیگه با جمینای به متن اضافه شد، اما باز هم پنگرام چیزی متوجه نشد. فقط وقتی سه جمله کامل هوش مصنوعی وارد متن شد (و حجم متن از ۲۵۰ به ۳۱۱ کلمه رسید)، سیستم آژیر خطر کشید! اما ماجرا وقتی جالبتر شد که سیستم فقط دو جمله رو ماشینی تشخیص داد که اتفاقاً یکی از اونا رو خود انسان نوشته بود! در نهایت با کمی بازنویسی اون یک جملهای که درست تشخیص داده شده بود، پنگرام کاملاً تسلیم شد و هیچی پیدا نکرد.

علاوه بر این، پنگرام ادعا میکنه متنهای بازنویسیشده توسط ابزارهای انسانیساز رو هم تشخیص میده، اما دور زدنش با همین ابزارها خیلی راحته. در یک بررسی تجربی، شعری با مدل GPT-5.6 تولید شد و بعد با اولین سایت رایگانی که برای Humanize کردن تو وب پیدا شد بازنویسی شد؛ وقتی خروجی به پنگرام داده شد، این ابزار شعر هوش مصنوعی رو ۱۰۰ درصد کار دست انسان دونست!
تصاویر هم بینقص نیستند: وقتی ادیتهای ساده تشخیصدهنده تصویر رو فریب میدن
با اینکه تمرکز اصلی پنگرام روی متن هست، قابلیت شناسایی تصاویر تولیدشده با هوش مصنوعی رو هم ارائه میده. اگرچه بیشتر تصاویر هوش مصنوعی تو تستها شناسایی شدن، ولی خطاهای عجیب و غریب به وفور دیده میشه.
برای نمونه، تصاویر فیکی که کمی طبیعی و باورپذیر طراحی شدن خیلی راحت پنگرام رو به اشتباه میندازن. سال ۲۰۲۳ وبسایت CNET چالشی منتشر کرده بود که مهارت آدما در تشخیص تصاویر هوش مصنوعی رو میسنجید. یکی از این عکسها یک نان تست آووکادو با برشی عجیب از لیمو بود. پنگرام این عکس رو ۱۰۰ درصد انسانی و واقعی اعلام کرد، در حالی که کاملاً کار هوش مصنوعی بود!

علاوه بر این، اگر نشانههای تصویر رو پاک کنید، پنگرام کاملاً فریب میخوره. مثلاً وقتی عکسی با مدل Nano Banana در جمینای برش (کراپ) داده شد، سیستمهای امنیتی نشانگرهای C2PA و SynthID رو روی فایل ثبت کردن. پنگرام هم با خوندن متادیتای C2PA تصویر رو به عنوان هوش مصنوعی علامت زد. اما وقتی همین تصویر از یک ابزار رایگان ضدتشخیص رد شد و نشانههاش پاک شد، پنگرام اون رو یک عکس معمولی و ساخته دست انسان تشخیص داد!
پشتپرده ادعای دقت ۹۹ درصدی؛ ریزهکاریهایی که پنگرام بهتون نمیگه
حالا سؤال اینجاست: چطور ابزاری با ادعای دقت بالای ۹۹ درصد اینهمه گاف میده؟ پنگرام مستندات متعددی از نتایج آزمایشهاش منتشر کرده که شفافیت قابل تحسینی داره، اما با نگاهی دقیقتر به این اسناد میشه متوجه بازی با اعداد شد.
به عنوان مثال، پنگرام برای مدل Opus 5 شرکت آنتروپیک (Anthropic) مدعی دقت ۹۹.۸ درصدی شده و به تستهای خودش استناد میکنه. اما این ادعا فقط متونی رو شامل میشه که مدل مستقیماً و بدون دستکاری در پاسخ به پرامپت تولید کرده؛ یعنی این عدد متونی که توسط انسان یا ابزارهای ادیت دستکاری شدن رو پوشش نمیده! پنگرام نتایج مربوط به متنهای دستکاریشده رو جداگانه و زیر خروارها سند پنهان کرده.
طبق همون مستندات، پنگرام میتونه متنهای انسانیسازیشده رو در ۹۷.۶۷ درصد موارد به عنوان هوش مصنوعی و در ۹۸.۸۳ درصد موارد به عنوان محتوای ترکیبی یا ماشینی شناسایی کنه. هرچند این ارقام هنوز خوب به نظر میرسن، اما بقیه آمارها عملکرد بسیار ضعیفتری نشون میدن؛ برای نمونه، این ابزار در تشخیص متنهایی که فقط با کمک هوش مصنوعی نوشته شدن (AI-assisted) صرفاً در ۵۵.۰۱ درصد موارد موفق بوده! این در حالیه که پنگرام تو تبلیغاتش فقط روی همون سناریوی خاص با دقت ۹۹.۸ درصدی مانور میده.
آمارهای مربوط به سایر مدلها هم پر از تناقضه. مثلاً لینک ادعای دقت ۹۹.۵ درصدی برای سری مدلهای Gemini 3 در صفحه اصلی، به صفحهای قدیمی درباره Gemini 3 Pro باز میشه که برخلاف صفحات GPT-5.6 و Opus 5 هیچ توضیحی درباره نحوه رسیدن به این عدد نداده!
با بررسی مستندات پنگرام ۴ مشخص میشه که شرکت نسخههای آزمایشی Gemini 3.1 Pro و 3.5 Flash رو هم تست کرده که خطای منفی کاذب (False Negative) ۹۹.۵ درصدی رو نشون میدن. با این حال مشخص نیست دقت اعلامی Gemini 3 چطور در نوامبر ۲۰۲۵ و قبل از معرفی این مدلها ثبت شده. علاوه بر این، سری جیمینای مدلهای جدیدتری مثل 3.6 Flash، 3.7 Flash و 3.8 Flash رو هم شامل میشه که اثری ازشون نیست. در حالی که برای GPT-5.6 تمام نسخهها مثل Luna، Sol و Terra تست شدن، تستهای خانواده جیمینای به شدت ناقص رها شده.
البته شواهدی وجود نداره که شرکت این اعداد رو جعل کرده باشه، اما این ماجرا دوباره نشون میده که بنچمارکهای هوش مصنوعی چقدر با عملکرد واقعی تو دنیای روزمره فاصله دارن. تستهای آزمایشگاهی پنگرام روی کاغذ نتایج درخشانی دارن، اما تو واقعیت خیلی ساده میشه دورشون زد.
آمار دستچینشده؛ واقعیت تاییدههای مستقل چیه؟
پنگرام علاوه بر تستهای داخلی، ادعا میکنه بر اساس تحقیقات مستقل دانشگاههای مریلند و شیکاگو، به عنوان دقیقترین ابزار بازار اثبات شده. این ادعا دروغ نیست، اما طوری بیان شده که نتایج این پژوهشها رو خیلی بزرگتر از واقعیت نشون میده.

به عنوان مثال، در تحقیق دانشگاه مریلند، پنگرام مدعی شده عملکردش در تشخیص متون هوش مصنوعی بهتر از انسانها بوده. واقعیت اینه که پنگرام تو مقایسه تکبهتک با افراد برنده شده، اما وقتی ارزیابی توسط گروهی از انسانها انجام شده، انسانها عملکرد به مراتب بهتری نسبت به پنگرام ثبت کردن! این تناقض ادعای پنگرام رو که میگه «مطالعات مستقل برتری این ابزار رو بر ارزیابهای انسانی آموزشدیده نشون داده»، به چالش میکشه.
در مطالعه دانشگاه شیکاگو هم پنگرام فقط با سه ابزار دیگه مقایسه شده که برای بازاری با دهها سرویس مختلف انتخابی بسیار محدود محسوب میشه. محققان دانشگاه آزاد بروکسل هم این ابزار رو صرفاً در کنار سه ابزار دیگه روی مقالات طولانی آکادمیک تست کردن. اگرچه این نتایج مثبت بودن، اما به هیچ وجه مدرک قطعی برای اثبات بینقص بودن پنگرام نیستن.
در کنار پژوهشهای دانشگاهی، پنگرام به نقلقولهای رسانهای هم استناد میکنه؛ مثل مقالهای از دیوید گورتز در ZDNET که گفته بود پنگرام تازهواردیه که بلافاصله به صدر جدول رسیده. اما پنگرام فراموش کرده این بخش از حرفهای گورتز رو نقل کنه که گفته بود «سرویسهای تشخیص هوش مصنوعی کارنامهای پر از تناقض دارن و قبل از اعتماد به نتایج هرکدوم از این ابزارها باید احتیاط زیادی به خرج داد».
تردیدی نیست که پنگرام خروجیهای خوبی ثبت کرده، اما تکیه بر این دادهها انتظارات غیرواقعی ایجاد میکنه؛ چرا که این سیستم همچنان مرتب اشتباه میکنه و خطاهای اون عواقب سنگینی برای افراد داره.
تشخیصهای اشتباهی که میتونن زندگی آدما رو نابود کنن
امروز تشخیص واقعیت تو اینترنت سختتر از گذشته شده و توسعه هوش مصنوعی اوضاع رو پیچیدهتر کرده. ابزارهایی هم که مدعی تشخیص هستن ولی دقت کامل ندارن، به این هرجومرج دامن میزنن.
به عنوان مثال، پلتفرم ساباستک (Substack) اخیراً امکان اسکن نوشتهها با فناوری پنگرام رو اضافه کرده تا نویسندگان میزان استفاده از هوش مصنوعی رو متوجه بشن. اما اگه شما نویسندهای باشید که تمام درآمدتون از ساباستک تأمین میشه و پنگرام متنتون رو به غلط هوش مصنوعی تشخیص بده چی میشه؟ یا برعکس، نویسندهای متن هوش مصنوعی رو منتشر کنه و پنگرام اون رو ۱۰۰ درصد انسانی معرفی کنه چی؟ با اینکه ساباستک امکان گزارش خطا رو فراهم کرده، اما راهحل پایدار و مطمئنی نیست.

این خطرات فراتر از پلتفرمهای نویسندگیه. تصور کنید استادی در دانشگاه که درک عمیقی از فناوری نداره، به اعتبار همکاری دانشگاه با پنگرام، مقالات دانشجوها رو با این ابزار بررسی کنه. اگه پنگرام متنی کاملاً اصیل و زحمتکشیده رو هوش مصنوعی علامت بزنه، دانشجو به راحتی مشروط یا محروم میشه، بدون اینکه راهی برای اثبات بیگناهی خودش داشته باشه؛ چرا که اکثر افراد نحوه کارکرد این ابزارها رو نمیدونن و به این درصدها اعتماد مطلق دارن.
همین خطرات جدی دلیلیه که کارشناسان نسبت به ادعاهای پنگرام سختگیر باشن. شرکتهای این حوزه باید خیلی شفافتر درباره نقاط ضعف و خطاهای احتمالی خودشون صحبت کنن.
هیچ استاندارد طلایی وجود نداره؛ باید به همه ابزارهای تشخیص شک کرد
ابزارهای تشخیص هوش مصنوعی برخلاف تبلیغات تجاری و ادعاهای پژوهشی، تو دنیای واقعی هنوز قابل اتکا نیستن. البته اگه پنگرام متنی رو هوش مصنوعی علامت بزنه ممکنه نشانهای از دستکاری باشه، اما این هشدارها هرگز وحی منزل نیستن! فراموش نکنید اعتماد چشمبسته به این پلتفرمها میتونه فاجعه بسازه. بهترین راهکار اینه که نحوه محاسبه این آمارها رو بشناسید و در برابر هرگونه ادعای دقت بالا، همیشه یک دوز سالم از شک و تردید همراه خودتون داشته باشید.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

هشدار جینا ریموندو درباره هوش مصنوعی: در آینده شغل میسازد، اما اولش یک موج سنگین اخراج در راه است!
جینا ریموندو، وزیر سابق بازرگانی آمریکا، معتقد است هوش مصنوعی در نهایت شغلهای جدیدی خلق میکند، اما بدون برنامهریزی دقیق، ابتدا با موج ویرانگری از اخراجهای دستهجمعی مواجه خواهیم شد. او هشدار میدهد اگر قوانین و مالیاتها برای عصر ایجنتهای هوشمند بازنویسی نشود، بحران اقتصادی و اجتماعی عمیقی شکل خواهد گرفت.

بیش از نیمی از تراکنشهای ایجنت جنجالی اینستینکت مربوط به سفر است؛ هوش مصنوعی آژانسهای مسافرتی را دور میزند!
نوآ شین، بنیانگذار پلتفرم محبوب Instinct اعلام کرده که بیش از نیمی از خریدها و تراکنشهای کاربران در این پلتفرم هوش مصنوعی به برنامهریزی سفر اختصاص دارد. این استارتاپ ۱۴ نفره که ارزش آن بهتازگی به ۱۰ میلیارد دلار رسیده، قصد دارد با کمک ایجنتهای هوشمند شیوه سنتی رزرو بلیت، هتل و حتی میز رستورانها را دگرگون کند.

پلتفرم Autoheal به میدان آمد: مدیریت خرابکاریها و کارهای نیمهکاره ایجنتهای کدنویسی!
با انفجار ابزارهای کدنویسی هوش مصنوعی و تولید حجم عظیمی از کد، حالا معضل اصلی تیمهای فنی، بررسی و نگهداری این کوه کد است. استارتاپ تازه وارد «اتوهیل» (Autoheal) با معرفی پلتفرمی هوشمند و ایجنتهایی که کار بقیه ایجنتها را نظارت و خودکار اصلاح میکنند، میخواهد هزینهها و دردسرهای توسعه نرمافزار را بهشدت کاهش دهد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.