صفحه اصلیمرکز اخبار LBank
آنتروپیک به‌طور پنهانی روی هر خروجی هوش مصنوعی کلود واترمارک می‌گذارد. سازندگان همین حالا در حال تلاش برای شکستن آن هستند
anthropic-quietly-watermarking-ai-claude-output-builders-break
آنتروپیک به‌طور پنهانی روی هر خروجی هوش مصنوعی کلود واترمارک می‌گذارد. سازندگان همین حالا در حال تلاش برای شکستن آن هستند
Anthropic در حال بافتن یک واترمارک نامرئی و قابل‌خواندن توسط ماشین در تک‌تک کلماتی است که جدیدترین مدل‌های Claude آن می‌نویسند — و هنوز نگفته چگونه.
2026-08-13 منبع:decrypt.co

به طور خلاصه

  • مدل‌های جدید کلود که در اتحادیه اروپا در تاریخ ۲ اوت ۲۰۲۶ یا پس از آن عرضه می‌شوند، یک واترمارک قابل خواندن توسط ماشین را در هر قطعه متن تولید شده جاسازی می‌کنند که در سطح مدل اعمال می‌شود.
  • این نشانه‌گذاری‌ها در سراسر کلود، API، کلود کد و شرکای ابری در سراسر جهان اعمال می‌شوند.
  • پروژه‌های متن باز برای حذف آنها طی چند روز ظاهر شدند.

آنتروپیک شروع به جاسازی یک واترمارک نامحسوس در تمام متون تولید شده توسط جدیدترین مدل‌های کلود خود کرده است. این تغییر برای مدل‌هایی که در اتحادیه اروپا در ۲ اوت ۲۰۲۶ عرضه شدند، به اجرا درآمد و آنتروپیک می‌گوید که در سراسر جهان اعمال خواهد شد.

آنتروپیک این طرح را در یک مقاله پشتیبانی پس از امضای "آیین‌نامه رفتار" قانون هوش مصنوعی اتحادیه اروپا در مورد شفافیت، ارائه کرد. به عبارت دیگر، این کار را دقیقاً داوطلبانه انجام نمی‌دهد. این نشانگر به تمام بخش‌های کلود، از چت‌بات و API گرفته تا کلود کد و شرکای ابری مانند AWS، گوگل کلود و مایکروسافت فاندری می‌رسد.

مایریاد: اوپن‌ای‌آی چه زمانی GPT-6 را منتشر خواهد کرد؟ برای پیش‌بینی کلیک کنید.

آنتروپیک گفت: «هنگامی که یک مدل پشتیبانی‌شده کلود متنی را تولید می‌کند، یک واترمارک نامحسوس را مستقیماً در خود متن می‌بافد. شما آن را نخواهید دید، و معنا، کیفیت یا خوانایی پاسخ کلود را تغییر نمی‌دهد.» «از آنجا که واترمارک بخشی از متن است، هنگام کپی و چسباندن در جای دیگر همراه با متن منتقل می‌شود و ممکن است پس از برخی ویرایش‌ها نیز باقی بماند.»

بنابراین، این روش کمی پیچیده‌تر از روش‌های معمول است که کاربران به آن فکر می‌کنند. هنگامی که یک مدل پشتیبانی‌شده کلود متنی را می‌نویسد، یک واترمارک نامحسوس را مستقیماً در کلمات می‌بافد، بدون هیچ نشانگر قابل مشاهده‌ای. از آنجا که این نشانگر بخشی از متن است، در برابر کپی-پیست باقی می‌ماند و آنتروپیک اذعان می‌کند که "ممکن است پس از برخی ویرایش‌ها نیز باقی بماند." فایل‌ها یک لایه دوم دریافت می‌کنند: فراداده امضا شده تحت استاندارد باز C2PA (به آن به عنوان یک مانیفست حمل و نقل دیجیتالی فکر کنید که ثبت می‌کند چه کسی فایلی را تولید کرده و آیا کسی بعداً آن را تغییر داده است یا خیر).

روش مخفی می‌ماند

آنتروپیک اعلام نکرده است که این واترمارک چگونه ساخته می‌شود. مقاله پشتیبانی آن را "مدل-سطح" (مدل با آن آموزش دیده است) و "متن-بومی" (مثلاً ابزاری خارجی مانند تولید کننده فراداده نیست) می‌نامد، اما اسناد تشخیص و تکنیک دقیق آن هنوز منتشر نشده‌اند.

محققان حدس می‌زنند که این یک امضای آماری است: مدل انتخاب کلمات خود را به سمت یک سوگیری خفیف و قابل تشخیص سوق می‌دهد، همان خانواده رویکردی که گوگل در SynthID Text استفاده می‌کند. این حدس تا زمانی که آنتروپیک آشکارساز خود را منتشر کند، پابرجا خواهد ماند.

اما این موضوع باعث عقب‌نشینی علاقه‌مندان به حریم خصوصی نمی‌شود، و برخی از کارشناسان در حال حاضر در حال کار بر روی روش‌هایی برای شکستن واترمارکینگ مخفی آنتروپیک هستند. mikiane/claude-watermark-cleaner (با ۱۰۶ ستاره در گیت‌هاب) یونیکد نامرئی را پاک می‌کند، سپس متن را با یک مدل غیر کلود بازنویسی می‌کند تا الگوی توکن را مختل کند.

یک پروژه بزرگتر، guillaumemeyer/watermarks-remover (با ۴.۶ هزار ستاره در گیت‌هاب)، نشانه‌های متنی کلود به علاوه سیگنال‌های کلاس C2PA و SynthID را در PNG، JPEG، SVG، PDF و DOCX حذف می‌کند. نویسندگان این پروژه استدلال می‌کنند که یک نشانگر متنی آماری "روش قابل اعتمادی برای اثبات مبدأ نیست" و بیشتر کاربران را وادار می‌کند تا یک گذر دوم مدل را برای تمیز کردن نوشته‌های خود صرف کنند. هیچ حذفی نمی‌تواند تضمین شود تا زمانی که آنتروپیک آشکارساز و آستانه‌های خود را عرضه کند.

تاریخچه خود آنتروپیک واکنش حریم خصوصی را تندتر می‌کند. این شرکت در ماه مارس پس از آنکه محققان دریافتند ردیاب مخفی کلود کد، مکان و استفاده از پروکسی برخی کاربران را از طریق نشانگرهای یونیکد اعلام‌نشده برچسب‌گذاری می‌کند – همان تکنیک نشانه‌گذاری بی‌صدا که اکنون در مرکز طرح واترمارک قرار دارد – آن را حذف کرد.

این نشانگر ثابت می‌کند که کلود در تولید متن نقش داشته است، نه اینکه کل متن را نوشته باشد، بنابراین یک متن اصلی با یک ویرایش کوچک را همانند یک متن کاملاً تولید شده توسط هوش مصنوعی در نظر می‌گیرد. از کلود بخواهید پاراگراف شما را ویرایش یا ترجمه کند و خروجی همچنان می‌تواند این سیگنال را حمل کند. آنتروپیک صریحاً اعلام می‌کند که ویرایش سنگین می‌تواند آن را حذف کند، و عدم وجود نشانگر به معنای آن نیست که یک انسان آن را نوشته است.

یک لایحه آمریکایی، قانون COPIED، همین ایده را پیش می‌برد: یک روش استاندارد برای واترمارکینگ محتوای هوش مصنوعی تا پلتفرم‌ها بتوانند منشأ آن را ردیابی کنند. همانطور که مشکل اخاذی کلود نشان داد، مدل‌های این شرکت از قبل تحت نظارت شدید هستند که با متونی که لمس می‌کنند، چه کاری انجام می‌دهند.

آنتروپیک اعلام نکرده است که چه زمانی ابزارهای تشخیص را منتشر خواهد کرد که به هر کسی اجازه تأیید نشانگر را بدهد.

رمزارز های محبوب
همین حالا ثبت‌نام کنید، هیچ به‌روزرسانی‌ای را از دست ندهید!