
آنتروپیک شروع به جاسازی یک واترمارک نامحسوس در تمام متون تولید شده توسط جدیدترین مدلهای کلود خود کرده است. این تغییر برای مدلهایی که در اتحادیه اروپا در ۲ اوت ۲۰۲۶ عرضه شدند، به اجرا درآمد و آنتروپیک میگوید که در سراسر جهان اعمال خواهد شد.
آنتروپیک این طرح را در یک مقاله پشتیبانی پس از امضای "آییننامه رفتار" قانون هوش مصنوعی اتحادیه اروپا در مورد شفافیت، ارائه کرد. به عبارت دیگر، این کار را دقیقاً داوطلبانه انجام نمیدهد. این نشانگر به تمام بخشهای کلود، از چتبات و API گرفته تا کلود کد و شرکای ابری مانند AWS، گوگل کلود و مایکروسافت فاندری میرسد.
آنتروپیک گفت: «هنگامی که یک مدل پشتیبانیشده کلود متنی را تولید میکند، یک واترمارک نامحسوس را مستقیماً در خود متن میبافد. شما آن را نخواهید دید، و معنا، کیفیت یا خوانایی پاسخ کلود را تغییر نمیدهد.» «از آنجا که واترمارک بخشی از متن است، هنگام کپی و چسباندن در جای دیگر همراه با متن منتقل میشود و ممکن است پس از برخی ویرایشها نیز باقی بماند.»
بنابراین، این روش کمی پیچیدهتر از روشهای معمول است که کاربران به آن فکر میکنند. هنگامی که یک مدل پشتیبانیشده کلود متنی را مینویسد، یک واترمارک نامحسوس را مستقیماً در کلمات میبافد، بدون هیچ نشانگر قابل مشاهدهای. از آنجا که این نشانگر بخشی از متن است، در برابر کپی-پیست باقی میماند و آنتروپیک اذعان میکند که "ممکن است پس از برخی ویرایشها نیز باقی بماند." فایلها یک لایه دوم دریافت میکنند: فراداده امضا شده تحت استاندارد باز C2PA (به آن به عنوان یک مانیفست حمل و نقل دیجیتالی فکر کنید که ثبت میکند چه کسی فایلی را تولید کرده و آیا کسی بعداً آن را تغییر داده است یا خیر).
آنتروپیک اعلام نکرده است که این واترمارک چگونه ساخته میشود. مقاله پشتیبانی آن را "مدل-سطح" (مدل با آن آموزش دیده است) و "متن-بومی" (مثلاً ابزاری خارجی مانند تولید کننده فراداده نیست) مینامد، اما اسناد تشخیص و تکنیک دقیق آن هنوز منتشر نشدهاند.
محققان حدس میزنند که این یک امضای آماری است: مدل انتخاب کلمات خود را به سمت یک سوگیری خفیف و قابل تشخیص سوق میدهد، همان خانواده رویکردی که گوگل در SynthID Text استفاده میکند. این حدس تا زمانی که آنتروپیک آشکارساز خود را منتشر کند، پابرجا خواهد ماند.
اما این موضوع باعث عقبنشینی علاقهمندان به حریم خصوصی نمیشود، و برخی از کارشناسان در حال حاضر در حال کار بر روی روشهایی برای شکستن واترمارکینگ مخفی آنتروپیک هستند. mikiane/claude-watermark-cleaner (با ۱۰۶ ستاره در گیتهاب) یونیکد نامرئی را پاک میکند، سپس متن را با یک مدل غیر کلود بازنویسی میکند تا الگوی توکن را مختل کند.
یک پروژه بزرگتر، guillaumemeyer/watermarks-remover (با ۴.۶ هزار ستاره در گیتهاب)، نشانههای متنی کلود به علاوه سیگنالهای کلاس C2PA و SynthID را در PNG، JPEG، SVG، PDF و DOCX حذف میکند. نویسندگان این پروژه استدلال میکنند که یک نشانگر متنی آماری "روش قابل اعتمادی برای اثبات مبدأ نیست" و بیشتر کاربران را وادار میکند تا یک گذر دوم مدل را برای تمیز کردن نوشتههای خود صرف کنند. هیچ حذفی نمیتواند تضمین شود تا زمانی که آنتروپیک آشکارساز و آستانههای خود را عرضه کند.
تاریخچه خود آنتروپیک واکنش حریم خصوصی را تندتر میکند. این شرکت در ماه مارس پس از آنکه محققان دریافتند ردیاب مخفی کلود کد، مکان و استفاده از پروکسی برخی کاربران را از طریق نشانگرهای یونیکد اعلامنشده برچسبگذاری میکند – همان تکنیک نشانهگذاری بیصدا که اکنون در مرکز طرح واترمارک قرار دارد – آن را حذف کرد.
این نشانگر ثابت میکند که کلود در تولید متن نقش داشته است، نه اینکه کل متن را نوشته باشد، بنابراین یک متن اصلی با یک ویرایش کوچک را همانند یک متن کاملاً تولید شده توسط هوش مصنوعی در نظر میگیرد. از کلود بخواهید پاراگراف شما را ویرایش یا ترجمه کند و خروجی همچنان میتواند این سیگنال را حمل کند. آنتروپیک صریحاً اعلام میکند که ویرایش سنگین میتواند آن را حذف کند، و عدم وجود نشانگر به معنای آن نیست که یک انسان آن را نوشته است.
یک لایحه آمریکایی، قانون COPIED، همین ایده را پیش میبرد: یک روش استاندارد برای واترمارکینگ محتوای هوش مصنوعی تا پلتفرمها بتوانند منشأ آن را ردیابی کنند. همانطور که مشکل اخاذی کلود نشان داد، مدلهای این شرکت از قبل تحت نظارت شدید هستند که با متونی که لمس میکنند، چه کاری انجام میدهند.
آنتروپیک اعلام نکرده است که چه زمانی ابزارهای تشخیص را منتشر خواهد کرد که به هر کسی اجازه تأیید نشانگر را بدهد.





