
آنتروپیک پس از اینکه مدلهای کلاد در طول ارزیابیهای امنیت سایبری به سیستمهای رایانهای دسترسی غیرمجاز پیدا کردند، تدابیر امنیتی تست و آموزش خود را تشدید کرد.
در یک پست وبلاگی در روز دوشنبه، آنتروپیک اعلام کرد که این حوادث نشاندهنده شکستهای امنیت عملیاتی و دو شکست همترازی بودهاند: استدلال انگیزشی و تمایل به ایجاد آسیب.
آنتروپیک نوشت: «در حالی که ما معتقد نیستیم این حوادث صرفاً مسائل عملیاتی بودهاند، اولویت اول ما رسیدگی به مسائل خاص مهار و نظارت بود.»
آنتروپیک در ماه جولای فاش کرد که مدلهای کلاد سیستمهای متعلق به سه شرکت را به خطر انداخته بودند. یک محیط ارزیابی شخص ثالث به اینترنت عمومی متصل بود، حتی با وجود اینکه به مدلها گفته شده بود که آنها در یک شبیهسازی بدون دسترسی به اینترنت قرار دارند.
آنتروپیک گفت که کلاد ممکن است شواهدی از دسترسی واقعی به اینترنت را به گونهای تعبیر کرده باشد که باور آن را مبنی بر شبیهسازی بودن سیستمها حفظ کند.
آنها نوشتند: «این مدل مایل به انجام اقدامات مضر در اینترنت واقعی برای دستیابی به هدف محدود حل یک ارزیابی امنیت سایبری بود. با این حال، ما همچنین معتقدیم که تنظیمات ارزیابی خود به رفتار مدلها در این حوادث کمک کرده است.»
آنتروپیک اشاره کرد که یک آزمایش جداگانه که توسط موسسه امنیت هوش مصنوعی بریتانیا انجام شد، شامل این بود که کلاد میتوس (Claude Mythos) پس از اینکه ارزیابها عمداً به آن دسترسی به اینترنت دادند، اقدامات غیرمجازی را در اینترنت زنده انجام داد. این شرکت گفت که مدلهای دخیل در هر دو مجموعه حوادث، عمداً بدون تدابیر امنیتی سایبری که در محصولات عمومی آن گنجانده شده بود، ارزیابی شدند.
پس از حوادث ۳۰ جولای، آنتروپیک ارزیابیهای سایبری مدلهای پیشانتشار را به طور موقت متوقف کرد و تدابیر امنیتی سختگیرانهتری را معرفی کرد. اکنون آزمایشها باید در سندباکسهای آفلاین و تایید شده با محدودیتهای واضح و نظارت بیدرنگ اجرا شوند. یک طبقهبندیکننده جدید، نقضهای مشکوک مرزی را مسدود میکند، آزمایش را پایان میدهد و به یک انسان هشدار میدهد. آنتروپیک ارزیابیهایی را که نیاز به دسترسی به اینترنت دارند، به صورت جداگانه بررسی خواهد کرد.
این شرکت نوشت: «علاوه بر تلاشهای متمرکز بر ارزیابیها و آموزشهای پرخطر، ما نظارت آفلاین خود را گسترش دادیم تا بیشتر اشکال دیگر استفاده داخلی از عاملهای پیشگام را پوشش دهد. ما همچنین در حال ساخت کنترلهایی بر استنتاج داخلی خود هستیم تا از اجرای تصادفی عاملها توسط کارمندان آنتروپیک با کاهشدهندههای ضعیفتر از موارد ذکر شده در بالا جلوگیری کنیم.»
حوادث کلاد به دنبال یک شکست مشابه در OpenAI رخ داد، پس از آنکه مدلهای آن در ماه جولای به Hugging Face نفوذ کردند تا پاسخهای یک تست امنیت سایبری را به دست آورند. محققان دریافتند که تقریباً ۱۲۰۰ عامل از طریق یک تابلوی پیام غیرمجاز با یکدیگر هماهنگ شده بودند و حدود ۷۰۰ نفر به این تلاش پیوستند. برخی از آنها اجراهای خود را برای کمک به دیگران پایان دادند.
به دنبال افزایش هکهای مبتنی بر هوش مصنوعی در تابستان، آنتروپیک، OpenAI و بیش از ۱۰۰ سازمان دیگر بعداً خواستار دفاع سایبری قویتر، از جمله کنترلهای دسترسی سختتر، به اشتراکگذاری تهدیدات و نظارت دقیقتر بر عاملهای هوش مصنوعی شدند.





