پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

رونمایی OpenAI از فناوری textGrain: ردپای نامرئی روی متن‌های هوش مصنوعی برای رعایت قوانین اروپا

انتشار:۱۳ مهر ۱۴۰۵(۱ ساعت پیش)
۵ دقیقه زمان مطالعه
۰ دیدگاه

شرکت OpenAI از سیستم جدیدی به نام textGrain رونمایی کرد که با ایجاد الگوهای آماری نامرئی در متن‌های خروجی، امکان ردیابی محتوای تولیدشده توسط هوش مصنوعی را فراهم می‌کند. این اقدام برای انطباق با قوانین هوش مصنوعی اتحادیه اروپا کلید خورده، هرچند بازنویسی یا ترجمه متن می‌تواند این ردپای دیجیتال را تا حد زیادی محو کند.

رونمایی OpenAI از فناوری textGrain: ردپای نامرئی روی متن‌های هوش مصنوعی برای رعایت قوانین اروپا

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • اوپن‌ای‌آی از سیستم جدیدی به نام textGrain رونمایی کرد که بدون افت کیفیت متن، یک واترمارک آماری کاملاً نامرئی را لابه‌لای کلمات خروجی ChatGPT و Codex تزریق می‌کند.
  • این قابلیت در پاسخ به الزام ماده ۵۰ قانون هوش مصنوعی اروپا (EU AI Act) عرضه شده و به توسعه‌دهندگان اجازه می‌دهد اصالت متن‌های تولیدشده را با یک ابزار اختصاصی بسنجند.
  • البته این واترمارک جادویی نیست؛ آزمایش‌ها نشان می‌دهند بازنویسی، ترجمه متن یا استفاده در کدهای برنامه‌نویسی و فرمول‌های ریاضی می‌تواند این سیگنال پنهان را به‌راحتی تضعیف یا به‌کلی پاک کند.

ورود واترمارک متنی به API و محصولات اوپن‌ای‌آی در اروپا

شرکت OpenAI فرایند پیاده‌سازی سیستم textGrain را آغاز می‌کند؛ فناوری نوآورانه‌ای برای واترمارک متنی که یک الگوی آماری نامرئی را در خروجی مدل‌ها جاسازی می‌کند. با استفاده از یک آشکارساز اختصاصی، می‌توان این الگوی پنهان را تحلیل کرد و با دقت بالایی تشخیص داد که آیا یک متن توسط مدل‌های این شرکت تولید شده است یا خیر.

این قابلیت تازه در واکنش مستقیم به ماده ۵۰ قانون هوش مصنوعی اتحادیه اروپا (EU AI Act) ارائه شده است؛ قانونی که ارائه‌دهندگان هوش مصنوعی مولد را ملزم می‌کند خروجی‌های ساختگی را در قالبی ماشین‌خوان علامت‌گذاری کنند. فناوری textGrain ابزاری کم‌هزینه برای رهگیری اصالت متن در اختیار توسعه‌دهندگان می‌گذارد، هرچند بررسی‌های خود OpenAI نشان می‌دهد مواردی مانند بازنویسی، ترجمه، قطعه‌متن‌های کوتاه، کدهای برنامه‌نویسی و متون بسیار رسمی می‌توانند این ردپای آماری را تضعیف کرده یا کاملاً از بین ببرند.

عرضه تدریجی؛ شروع کار با دسترسی اختیاری

  • دسترسی جهانی به API: از تاریخ ۵ اکتبر ۲۰۲۶، کاربران API در سراسر جهان می‌توانند قابلیت واترمارک را برای مدل‌های منتخب فعال کنند؛ این گزینه به‌طور پیش‌فرض غیرفعال است.
  • عرضه برای محصولات اروپایی: اوپن‌ای‌آی قصد دارد این واترمارک را برای کاربران واجد شرایط ChatGPT و Codex در تمامی پلن‌های اتحادیه اروپا فعال کند. تاریخ دقیقی اعلام نشده اما گفته شده این اتفاق «طی هفته‌های آینده» رخ خواهد داد.
  • محدودیت دسترسی به ابزار تشخیص (Detector): در فاز اول، دسترسی به شناساگر واترمارک به‌صورت موردی و تحت چارچوب مقررات رفتاری اتحادیه اروپا ارائه می‌شود. OpenAI ریسک گزارش‌های مثبت کاذب (تشخیص اشتباه) و از دست رفتن واترمارک را دلیل این احتیاط دانسته است.
  • پشتیبانی در پلتفرم‌های ابری: اوپن‌ای‌آی در حال همکاری با شرکای ابری خود است تا خروجی مدل‌هایی که از طریق خدمات ابری آن‌ها ارائه می‌شوند نیز نشانه‌گذاری شوند.
  • برنامه انتشار متن‌باز در آینده: اوپن‌ای‌آی اعلام کرده که در نهایت قصد دارد این فناوری را به‌صورت متن‌باز منتشر کند، هرچند هنوز زمان مشخصی برای آن متعهد نشده است.

اوپن‌ای‌آی این قابلیت واترمارک را به‌صورت یک دکمه اختیاری و کاملاً رایگان عرضه می‌کند و قیمت‌گذاری فعلی API بدون تغییر باقی می‌ماند. البته بهره‌مندی از آن به نوع مدل بستگی دارد و در بیانیه این شرکت تأکید شده که پشتیبانی API فعلاً تنها شامل «مدل‌های منتخب» می‌شود.

واترمارک چگونه لابه‌لای کلمات جا خوش می‌کند؟

فناوری textGrain سیگنال مخفی خود را درست در جریان انتخاب توکن‌ها توسط مدل جاگذاری می‌کند. هنگام تولید متن، نمونه‌بردار (Sampler) مدل هوش مصنوعی در میان گزینه‌های محتمل و منطقی، تمایل جزئی و اندکی به انتخاب برخی کلمات یا قطعات کلمات پیدا می‌کند. همین سوگیری ظریف، یک الگوی آماری منظم خلق می‌کند که آشکارساز می‌تواند آن را در طول کل متن اندازه‌گیری و ردیابی کند.

بر اساس مقاله فنی منتشرشده، این روش مبتنی بر «کالیبراسیون آنتروپی» است. به زبان ساده، هر زمان که دست مدل برای انتخاب کلمه بعدی باز باشد و گزینه‌های متنوعی وجود داشته باشد، سیستم سوگیری آماری قوی‌تری اعمال می‌کند؛ اما هر وقت متن ساختار حساسی داشته باشد یا انتخاب کلمات محدود باشد، این سوگیری به حداقل می‌رسد. به همین خاطر، نثرهای آزاد و روان بستر بسیار مساعدتری برای پنهان کردن این الگو نسبت به فرمول‌های ریاضی، کدها، جدول‌ها یا سایر خروجی‌های ساختاریافته فراهم می‌کنند.

تغییرات کیفیت؛ افت محسوسی در کار نیست

طبق گزارش OpenAI در آزمایش‌های مدل Astra، نشانه‌گذاری متن هیچ افت محسوس و معناداری در کیفیت کلی ایجاد نمی‌کند. نمرات بنچمارک‌های مختلف نوسانات جزئی در هر دو جهت مثبت و منفی نشان داده‌اند و هیچ نشانه‌ای از افت مداوم کیفیت دیده نشده است:

بنچمارک
بدون واترمارک
با واترمارک
اختلاف (Delta)
Artificial Analysis Intelligence Index
49.57
49.76
+0.19
GPQA Diamond
94.44%
93.94%
-0.50 pp
Terminal-Bench 4.0
53.90%
56.06%
+2.16 pp
DeepSWE v1.1
72.80%
71.68%
-1.12 pp
HealthBench Professional
64.27%
64.60%
+0.33 pp

تشخیص واترمارک؛ نیاز اساسی به طول متن و انعطاف کلمات

در آستانه تنظیمی با نرخ ۱ درصد خطای مثبت کاذب (یعنی شرایطی که از هر ۱۰۰ متن بدون واترمارک، تقریباً تنها یکی ممکن است به اشتباه شناسایی شود)، اوپن‌ای‌آی توانسته در محتواهای منعطف مانند متون روان‌شناسی، واترمارک را در حدود ۸۰ درصد از قطعات ۲۰۰ توکنی و حدود ۹۵ درصد از قطعات ۴۰۰ توکنی با موفقیت بازیابی کند.

با این حال، نرخ تشخیص در مسائل ریاضی به‌شدت پایین‌تر بوده است؛ چراکه نمادگذاری‌های ثابت و دایره لغات محدود، جای کمی برای رمزگذاری سیگنال باقی می‌گذارند. همین محدودیت دقیقاً برای خروجی‌های کدنویسی Codex نیز صادق است: تکه‌کدهای کوتاه، ساختارهای دستوری تکراری، فایل‌های پیکربندی و کدهای رسمی، فضای آماری بسیار محدودی برای ثبت مطمئن واترمارک ارائه می‌دهند.

ویرایش و دستکاری؛ قاتل خاموش واترمارک

ارزیابی‌های اوپن‌ای‌آی نشان می‌دهد که حتی بازنویسی‌های مختصر نیز نرخ تشخیص را به‌شدت کاهش می‌دهند. در قطعات ۴۰۰ توکنی، جایگزین کردن تنها ۱۰ درصد از کلمات با مترادف‌هایشان، نرخ تشخیص را از حدود ۹۲ درصد به ۶۶ درصد رساند. با تغییر ۲۵ درصد از کلمات، این عدد به ۱۷ درصد سقوط کرد و ترجمه متن به زبانی دیگر توانست سیگنال را به‌طور کامل محو کند!

بازنویسی متن به کمک یک مدل زبانی دیگر نیز دقیقاً همین نتیجه را رقم می‌زند؛ به همین دلیل سیستم textGrain به‌هیچ‌وجه به عنوان یک سند قطعی و مستقل قضایی یا حقوقی قابل اتکا نیست. این نقاط ضعف به‌خوبی نشان می‌دهند که چرا اوپن‌ای‌آی دسترسی به ابزار تشخیص خود را محدود کرده و در خصوص انتساب قطعی متن‌ها در پرونده‌های حساس، محتاطانه عمل می‌کند.

نتیجه ابزار تشخیص چه معنایی دارد؟ (و چه معنایی ندارد!)

  • نتیجه مثبت: متن مورد نظر حاوی یک الگوی آماری منطبق با خروجی‌های نشانه‌گذاری‌شده اوپن‌ای‌آی در آستانه تعریف‌شده ابزار است.
  • عدم امکان انتساب به شخص: این ابزار هیچ سرنخی درباره هویت کاربر، حساب کاربری، پرامپت ارسالی، نویسنده، مالک یا مقصر اصلی فاش نمی‌کند.
  • عدم تضمین درستی محتوا: مثبت بودن تشخیص هیچ دلیلی بر صحت، درستی یا قابل اعتماد بودن محتوای متن نیست.
  • نتیجه منفی: خروجی منفی هرگز قطعی نیست؛ چراکه متن‌های کوتاه، ویرایش‌شده، ترجمه‌شده، ساختاریافته یا نسخه‌های قدیمی‌تر ممکن است به‌سادگی از رادار تشخیص فرار کرده باشند.

گوگل و آنتروپیک هم در همین مسیر گام برداشته‌اند

با این اقدام، اوپن‌ای‌آی به جمع گوگل و آنتروپیک پیوست که پیش از این استفاده از واترمارک‌های آماری را آغاز کرده بودند. شرکت آنتروپیک در اوت ۲۰۲۶ اعلام کرده بود که مدل‌های جدید Claude به واترمارک نامرئی برگرفته از فناوری SynthID-Text مجهز می‌شوند و دسترسی به شناساگر آن ابتدا تنها در اختیار نهادهای قانون‌گذار، پژوهشگران، رسانه‌ها و گروه‌های واجد شرایط قرار می‌گیرد.

گوگل نیز مدتی است از SynthID-Text در مدل‌های جمینای (Gemini) استفاده می‌کند. ارزیابی این غول جستجو روی حدود ۲۰ میلیون پاسخ با و بدون واترمارک، نشان داد که هیچ تفاوت آماری معناداری در کیفیت پاسخ‌ها ایجاد نمی‌شود. با این حال، در هر سه سیستم (گوگل، آنتروپیک و اوپن‌ای‌آی)، بازنویسی و ترجمه همچنان بزرگ‌ترین چالش و نقطه ضعف فنی به شمار می‌روند.

دلیل اصلی حرکت هماهنگ این غول‌های فناوری، ماده ۵۰ قانون هوش مصنوعی اروپا است: توسعه‌دهندگان به روشی ماشین‌خوان برای تفکیک محتوای مصنوعی نیاز دارند. واترمارک‌های آماری می‌توانند این الزام قانونی را در بسترهای پردازشی تعاملی برآورده کنند، هرچند کارایی واقعی آن‌ها در دنیای واقعی کاملاً به دست‌نخورده ماندن متن اولیه وابسته است.

بهترین موارد استفاده؛ نثرهای دست‌نخورده

مورد کاربرد
راهنمای عملیاتی
علت
خروجی API در اتحادیه اروپا
از واترمارک به عنوان یکی از اهرم‌های کنترلی در برنامه جامع شفاف‌سازی استفاده کنید.
بدون نیاز به پرداخت هزینه اضافی، اصالت ماشین‌خوان را به متن اضافه می‌کند.
فرایندهای نشر محتواهای بلند
متن اصلی را تا زمان تکمیل فرایند راستی‌آزمایی دست‌نخورده نگه دارید.
نثرهای بلند و منعطف، بالا‌ترین نرخ دقت تشخیص را ایجاد می‌کنند.
خروجی‌های کدنویسی و محاسبات ریاضی
نتایج ابزار تشخیص را تنها به عنوان شواهدی ضعیف و تکمیلی در نظر بگیرید.
ساختار دستوری محدود، فضای بسیار کمی برای گنجاندن سیگنال باقی می‌گذارد.
محتوای ترجمه‌شده یا بازنویسی‌شده
انتظار دقت و قابلیت اتکای پایینی داشته باشید.
تغییر کلمات می‌تواند واترمارک را به‌شدت تضعیف کرده یا کاملاً پاک کند.
تصمیم‌گیری‌های دانشگاهی، استخدامی یا قضایی
حتماً به شواهد مستقل و پشتیبان دیگری نیاز خواهید داشت.
این شناساگر توانایی اثبات نویسنده اصلی، نیت یا مسئولیت قانونی را ندارد.

تیم‌هایی که قصد دارند textGrain را فعال کنند، باید نسخه مدل و تنظیمات واترمارک را مستند کرده، خروجی‌های اصلی را برای ممیزی نگهداری کنند و تا پیش از اعتبارسنجی از ترجمه یا بازنویسی متن بپرهیزند. علاوه بر این، این تیم‌ها نیازمند تأییدیه رسمی برای دسترسی به شناساگر هستند؛ زیرا طرف‌های ثالث در ابتدای عرضه نمی‌توانند این واترمارک را به‌صورت مستقل بررسی و تست کنند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

شکاف دستمزد به دنیای هوش مصنوعی هم رسید؛ پرداخت ۱۰ درصد پول کم‌تر به ایجنت‌های زن!
آخرین اخبار

شکاف دستمزد به دنیای هوش مصنوعی هم رسید؛ پرداخت ۱۰ درصد پول کم‌تر به ایجنت‌های زن!

نتایج یک پژوهش تازه در واقعیت مجازی نشان می‌دهد تعصبات دنیای واقعی حتی دامن هوش مصنوعی را هم گرفته است؛ جایی که کارمندان به یک ایجنت زن با توانایی کاملاً یکسان، بیش از ۱۰ درصد کم‌تر از همتای مردش پاداش پرداخت کردند. این یافته‌ها ثابت می‌کند انتخاب نام، چهره و هویت ظاهری برای ایجنت‌های کاری می‌تواند ناخودآگاه پیش‌داوری‌های انسانی را در محیط کار فعال کند.

۳ دقیقه مطالعه
۰
۱۳ مهر
آزادسازی ۱۲ گیگابایت حافظه در مک؛ چطور مدل‌های پنهان هوش مصنوعی اپل را با RemoveMacAI پاک کنیم؟
آخرین اخبار

آزادسازی ۱۲ گیگابایت حافظه در مک؛ چطور مدل‌های پنهان هوش مصنوعی اپل را با RemoveMacAI پاک کنیم؟

اگر در مک‌اواس نیازی به هوش مصنوعی اپل ندارید اما مدل‌های سنگین آن حافظه باارزش سیستم‌تان را اشغال کرده‌اند، یک ابزار متن‌باز جدید به کمکتان می‌آید. ابزار رایگان RemoveMacAI به شما اجازه می‌دهد تا ۱۲ گیگابایت از مدل‌های زبانی هوش مصنوعی اپل را به‌طور کامل پاک کرده و جلوی دانلود خودکار آن‌ها را بگیرید. با این ترفند کاربردی می‌توانید کنترل کامل فضای ذخیره‌سازی مک خود را دوباره به دست بگیرید.

۴ دقیقه مطالعه
۰
۱۳ مهر
پای ایجنت هوش مصنوعی اینستینکت به چت‌های گروهی باز شد؛ همکاری تیمی حتی بدون نیاز به حساب کاربری!
آخرین اخبار

پای ایجنت هوش مصنوعی اینستینکت به چت‌های گروهی باز شد؛ همکاری تیمی حتی بدون نیاز به حساب کاربری!

استارتاپ ۱۰ میلیارد دلاری اینستینکت (Instinct) با آوردن ایجنت هوش مصنوعی خود به چت‌های گروهی، هماهنگی کار‌ها میان دوستان را فوق‌العاده آسان کرده است. نکته جذاب این قابلیت آن است که حتی دوستان بدون حساب کاربری هم می‌توانند در گروه از این دستیار هوشمند کمک بگیرند. این قابلیت تازه، رقابت اینستینکت با غول‌هایی مثل متا و اوپن‌ای‌آی را وارد مرحله هیجان‌انگیزتری می‌کند.

۳ دقیقه مطالعه
۰
۱۳ مهر