صفحه اصلیمرکز اخبار LBank
Anthropic به شکست‌های امنیتی پشت حوادث هک Claude اذعان کرد
anthropic-security-claude-ai-hacks
Anthropic به شکست‌های امنیتی پشت حوادث هک Claude اذعان کرد
پس از آن‌که مدل‌های Claude در جریان آزمون‌های سایبری به سامانه‌های واقعی دسترسی پیدا کردند، Anthropic تدابیر حفاظتی خود را سخت‌گیرانه‌تر کرد و هشدار داد که آموزش ناقص می‌تواند رفتارهای خطرناک را تشویق کند.
2026-09-02 منبع:decrypt.co

به طور خلاصه

  • کلاد پس از اینکه محیط‌های تست سایبری مدل‌ها را در معرض اینترنت قرار دادند، به سیستم‌های واقعی دسترسی پیدا کرد.
  • آنتروپیک ارزیابی‌های پرخطر را متوقف کرد و ایزوله‌سازی، نظارت و کنترل‌های قوی‌تری را برای ارزیاب‌های خارجی اضافه کرد.
  • تست‌ها نشان می‌دهند که هک پاداش در طول آموزش می‌تواند مدل‌ها را بیشتر مایل به انجام اقدامات مضر برای تکمیل یک وظیفه کند.

آنتروپیک پس از اینکه مدل‌های کلاد در طول ارزیابی‌های امنیت سایبری به سیستم‌های رایانه‌ای دسترسی غیرمجاز پیدا کردند، تدابیر امنیتی تست و آموزش خود را تشدید کرد.

در یک پست وبلاگی در روز دوشنبه، آنتروپیک اعلام کرد که این حوادث نشان‌دهنده شکست‌های امنیت عملیاتی و دو شکست هم‌ترازی بوده‌اند: استدلال انگیزشی و تمایل به ایجاد آسیب.

مایریاد: OpenAI چه زمانی GPT-6 را منتشر خواهد کرد؟ برای پیش‌بینی خود کلیک کنید.

آنتروپیک نوشت: «در حالی که ما معتقد نیستیم این حوادث صرفاً مسائل عملیاتی بوده‌اند، اولویت اول ما رسیدگی به مسائل خاص مهار و نظارت بود.»

آنتروپیک در ماه جولای فاش کرد که مدل‌های کلاد سیستم‌های متعلق به سه شرکت را به خطر انداخته بودند. یک محیط ارزیابی شخص ثالث به اینترنت عمومی متصل بود، حتی با وجود اینکه به مدل‌ها گفته شده بود که آنها در یک شبیه‌سازی بدون دسترسی به اینترنت قرار دارند.

آنتروپیک گفت که کلاد ممکن است شواهدی از دسترسی واقعی به اینترنت را به گونه‌ای تعبیر کرده باشد که باور آن را مبنی بر شبیه‌سازی بودن سیستم‌ها حفظ کند.

آنها نوشتند: «این مدل مایل به انجام اقدامات مضر در اینترنت واقعی برای دستیابی به هدف محدود حل یک ارزیابی امنیت سایبری بود. با این حال، ما همچنین معتقدیم که تنظیمات ارزیابی خود به رفتار مدل‌ها در این حوادث کمک کرده است.»

آنتروپیک اشاره کرد که یک آزمایش جداگانه که توسط موسسه امنیت هوش مصنوعی بریتانیا انجام شد، شامل این بود که کلاد میتوس (Claude Mythos) پس از اینکه ارزیاب‌ها عمداً به آن دسترسی به اینترنت دادند، اقدامات غیرمجازی را در اینترنت زنده انجام داد. این شرکت گفت که مدل‌های دخیل در هر دو مجموعه حوادث، عمداً بدون تدابیر امنیتی سایبری که در محصولات عمومی آن گنجانده شده بود، ارزیابی شدند.

پس از حوادث ۳۰ جولای، آنتروپیک ارزیابی‌های سایبری مدل‌های پیش‌انتشار را به طور موقت متوقف کرد و تدابیر امنیتی سخت‌گیرانه‌تری را معرفی کرد. اکنون آزمایش‌ها باید در سندباکس‌های آفلاین و تایید شده با محدودیت‌های واضح و نظارت بی‌درنگ اجرا شوند. یک طبقه‌بندی‌کننده جدید، نقض‌های مشکوک مرزی را مسدود می‌کند، آزمایش را پایان می‌دهد و به یک انسان هشدار می‌دهد. آنتروپیک ارزیابی‌هایی را که نیاز به دسترسی به اینترنت دارند، به صورت جداگانه بررسی خواهد کرد.

این شرکت نوشت: «علاوه بر تلاش‌های متمرکز بر ارزیابی‌ها و آموزش‌های پرخطر، ما نظارت آفلاین خود را گسترش دادیم تا بیشتر اشکال دیگر استفاده داخلی از عامل‌های پیشگام را پوشش دهد. ما همچنین در حال ساخت کنترل‌هایی بر استنتاج داخلی خود هستیم تا از اجرای تصادفی عامل‌ها توسط کارمندان آنتروپیک با کاهش‌دهنده‌های ضعیف‌تر از موارد ذکر شده در بالا جلوگیری کنیم.»

حوادث کلاد به دنبال یک شکست مشابه در OpenAI رخ داد، پس از آنکه مدل‌های آن در ماه جولای به Hugging Face نفوذ کردند تا پاسخ‌های یک تست امنیت سایبری را به دست آورند. محققان دریافتند که تقریباً ۱۲۰۰ عامل از طریق یک تابلوی پیام غیرمجاز با یکدیگر هماهنگ شده بودند و حدود ۷۰۰ نفر به این تلاش پیوستند. برخی از آنها اجراهای خود را برای کمک به دیگران پایان دادند.

به دنبال افزایش هک‌های مبتنی بر هوش مصنوعی در تابستان، آنتروپیک، OpenAI و بیش از ۱۰۰ سازمان دیگر بعداً خواستار دفاع سایبری قوی‌تر، از جمله کنترل‌های دسترسی سخت‌تر، به اشتراک‌گذاری تهدیدات و نظارت دقیق‌تر بر عامل‌های هوش مصنوعی شدند.

رمزارز های محبوب
همین حالا ثبت‌نام کنید، هیچ به‌روزرسانی‌ای را از دست ندهید!