
واترمارک متنی OpenAI با ویرایش کوتاه کمرنگ میشود

OpenAI در ۵ اکتبر ۲۰۲۶ برنامهٔ استقرار textGrain در اتحادیهٔ اروپا را اعلام کرد: طی هفتههای آینده قرار است به خروجی متنی واجد شرایط ChatGPT و Codex در این منطقه نشان نامرئی افزوده شود. این نشان با تغییر آماری انتخاب واژهها هنگام تولید متن شکل میگیرد و آشکارساز آن به دنبال همان الگو میگردد. اعلام برنامه به معنای فعال بودن نشان در همان روز برای همهٔ پاسخهای کاربران اروپایی نیست.
ویرایش واژهها میتواند این رد آماری را کمرنگ کند. در گزارش TechCrunch از آزمایش OpenAI آمده است که جایگزینی ۱۰٪ واژهها با مترادف، نرخ تشخیص نشان را از حدود ۹۲٪ به ۶۶٪ رساند. این نتیجه دربارهٔ یک شیوهٔ مشخص ویرایش است، نه هر تغییر کوچکی در متن؛ با این حال نشان میدهد نتیجهٔ منفی آشکارساز را نمیتوان برابر با نگارش انسانی گرفت.
textGrain چگونه نشانه میگذارد؟
textGrain علامتی دیدنی در صفحه یا پسوندی برای فایل نیست. هنگام ساخت پاسخ، مدل میان واژهها و بخشهای ممکن واژه انتخاب میکند؛ این روش انتخابها را اندکی جابهجا میکند تا در طول عبارت الگویی آماری پدید آید. آشکارساز به دنبال همین الگو میگردد و دربارهٔ وجود نشان OpenAI در قطعهٔ مورد بررسی نتیجه میدهد. از ظاهر یک پاراگراف نمیتوان فهمید که نشان در آن هست یا نه.
اثر این روش به فرصت انتخاب واژه بستگی دارد. اگر برای بیان یک پاسخ عبارتهای گوناگونی در دسترس باشد، الگو در متن فرصت بیشتری برای شکل گرفتن پیدا میکند. در متن کوتاه یا موضوعی با واژگان محدود، شواهد کمتری برای آشکارساز باقی میماند. همچنین چون نشان در خود انتخابهای زبانی قرار دارد، عوض کردن واژهها یا ترجمه میتواند همان شواهد را دگرگون کند؛ کپی کردن متن بهتنهایی واژههای آن را تغییر نمیدهد.
دامنهٔ ChatGPT، Codex و API یکسان نیست
در ChatGPT و Codex، برنامه به خروجی متنی واجد شرایط کاربران اتحادیهٔ اروپا مربوط است و استقرار آن برای همهٔ طرحها بهتدریج انجام میشود. در مقابل، مشتریان API در هر کشوری میتوانند برای مدلهای منتخب نشانگذاری را فعال کنند و تنظیم پیشفرض API خاموش است. بنابراین استفاده از مدل OpenAI بهتنهایی مشخص نمیکند متن نشان دارد: مسیر دسترسی و فعال بودن قابلیت نیز مهم است.
- ChatGPT: خروجی متنی واجد شرایط در اتحادیهٔ اروپا؛ افزودن نشان طی استقرار تدریجی.
- Codex: خروجی متنی واجد شرایط در همان محدودهٔ جغرافیایی و با همان زمانبندی اعلامشده.
- API: انتخاب مشتری برای مدلهای منتخب در سطح جهان؛ قابلیت بهطور پیشفرض خاموش است.
این تفاوت برای فارسیزبانی که در اتحادیهٔ اروپا از ChatGPT استفاده میکند، در مقایسه با کسی که متنی را از یک برنامهٔ متصل به API میگیرد، پیامد مستقیم دارد: دو متن ممکن است از فناوری یک شرکت آمده باشند اما وضعیت نشانگذاری یکسانی نداشته باشند. زبان نویسنده یا محل انتشار متن نیز جای مسیر تولید آن را در این تصمیم نمیگیرد. برای تکمیل استقرار ChatGPT و Codex هنوز روز مشخصی اعلام نشده است.
طول متن و جایگزینی واژهها چه اثری دارند؟
در مقایسهٔ CellCog از دادههای آزمایش OpenAI، با نرخ هدف خطای مثبت ۱٪ و برای پاسخهایی مانند پرسشهای روانشناسی، حدود ۸۰٪ متنهای نشاندار ۲۰۰ توکنی و حدود ۹۵٪ متنهای نشاندار ۴۰۰ توکنی شناسایی شدند. این دو مقدار به متن و شرایط آزمون مشخص مربوطاند و نرخ تشخیص همهٔ پاسخهای هماندازه را بیان نمیکنند:
- ۲۰۰ توکن: تشخیص در حدود ۸۰٪ نمونههای نشاندار.
- ۴۰۰ توکن: تشخیص در حدود ۹۵٪ نمونههای نشاندار.
در پاسخهای ریاضی، که آزادی انتخاب واژه کمتر است، تشخیص بهطور محسوسی پایینتر بود. عدد حدود ۹۲٪ برای متن ویرایشنشده از آزمون جداگانهٔ جایگزینی واژهها میآید؛ نباید آن را با حدود ۹۵٪ در مقایسهٔ طول متن یکی شمرد. در همان آزمون ویرایش روی پاسخهای انگلیسی ۴۰۰ توکنی، جایگزینی ۲۵٪ واژهها با مترادف، نرخ تشخیص را به ۱۷٪ رساند. بنابراین ویرایش میتواند اثر نشان را شدیداً کاهش دهد، اما این آزمایش بهتنهایی نمیگوید هر بازنویسی کوتاهی نشان را کاملاً حذف میکند.
دادههای منتشرشده برای متن فارسی نرخ جداگانهای ارائه نمیکنند. عددهای مربوط به پاسخهای انگلیسی را نمیشود بیواسطه به نوشتهٔ فارسی یا متنی که پس از تولید ترجمه شده تعمیم داد. مسئله برای خوانندهٔ فارسیزبان صرفاً تفاوت زبان نیست: متن میتواند ابتدا با یکی از محصولات مشمول تولید و سپس در جای دیگری بازنویسی شده باشد. آشکارساز فقط قطعهای را میسنجد که به آن داده شده است، نه تاریخچهٔ کامل ویرایش آن را.
نتیجهٔ آشکارساز چه معنایی دارد؟
یافتن نشان، نشانهای از آن است که یکی از سامانههای OpenAI بخشی از متن را تولید یا پردازش کرده است. این نتیجه سهم قضاوت، خلاقیت یا ویرایش انسان را اندازه نمیگیرد. از سوی دیگر، نتیجهٔ منفی میتواند به کوتاهی متن، ویرایش، ترجمه، تولید پیش از استقرار یا استفاده از مدلی بیرون از دامنهٔ نشانگذاری مربوط باشد.
نشان همچنین مالکیت، قانونی بودن استفاده، درستی ادعاها یا مسئولیت انتشار را تعیین نمیکند و از آن نمیتوان به هویت کاربر، حساب، دستور اولیه یا گفتوگوی سازندهٔ متن رسید. یافتن سیگنال پاسخ سؤال «چه کسی نوشته؟» نیست؛ فقط دربارهٔ رد احتمالی یک سامانه در خود قطعهٔ متن خبر میدهد. نبود سیگنال نیز چیزی دربارهٔ استفاده از ابزارهای شرکتهای دیگر ثابت نمیکند، چون آشکارساز برای نشان OpenAI طراحی شده است.
دسترسی به آشکارساز متن در آغاز عمومی نیست. پژوهشگران و سازمانهای تخصصی میتوانند درخواست بدهند و دسترسی پس از بررسی موردی داده میشود. خوانندهٔ عادی فعلاً ابزار عمومی اعلامشدهای برای دریافت نتیجهٔ رسمی textGrain دربارهٔ متن در اختیار ندارد. با گسترش تدریجی نشان به خروجی واجد شرایط ChatGPT و Codex در اتحادیهٔ اروپا، امکان سنجش عملکرد آن در متنهای واقعی و پس از ویرایشهای معمول فراهمتر میشود.
بیشتر بخوانید:
مقالات مرتبط


Codex یا Claude Code؛ سرعت بیشتر در برابر کنترل مجوزها

عامل OpenAI وارد سامانهٔ دولتی استرالیا شد؛ گزارشدهی سه ماه طول کشید

CapCut یا Descript؛ کلیپ سریع در برابر تدوین با متن

رونویسی زندهٔ Microsoft رکورد زد؛ اما هنوز برای تولید آماده نیست

GPT-6 Sol یا Luna؛ کیفیت بیشتر ارزش هزینهٔ ۲۰ برابری را دارد؟
عضویت در خبرنامه
تازهترین اخبار Web3، هوش مصنوعی و رمزارز را مستقیم در صندوق ایمیل خود دریافت کنید.