
اوپنایآی (OpenAI) سیستم GPT-Red را معرفی کرده است، یک سیستم هوش مصنوعی خودکار که برای یافتن آسیبپذیریهای امنیتی در مدلهای زبان خود طراحی شده است.
نام GPT-Red از "تیم قرمز" (red teaming) در امنیت سایبری گرفته شده است، که رویهای برای تلاش عمدی برای شکستن یک سیستم به منظور شناسایی نقاط ضعف قبل از اینکه مهاجمان بتوانند از آنها سوءاستفاده کنند، میباشد.
اوپنایآی در پستی در روز چهارشنبه اعلام کرد که این ابزار به مقاومتر شدن GPT-5.6 در برابر حملات تزریق پرامپت (prompt injection) قبل از استقرار کمک کرده است.
اوپنایآی در X نوشت: «همانطور که قابلیتهای مدل افزایش مییابد، ایمنی و همسویی باید همراه با آنها مقیاسپذیر باشد. تیم قرمز ضروری است، اما رویکردهای امروزی به سختی مقیاسپذیر هستند و یک تنگنای حیاتی ایجاد میکنند. GPT-Red یکی از راههایی است که ما به آن رسیدگی میکنیم.»
به گفته اوپنایآی، GPT-Red از طریق یادگیری تقویتی خود-بازی (self-play reinforcement learning) آموزش دیده است و حملات تزریق پرامپت قویتر و قویتری را تولید میکند، در حالی که مدلهای مدافع مقاومت در برابر آنها را میآموزند. این شرکت اعلام کرد که این حملات در فرآیند آموزش GPT-5.6 گنجانده شدهاند و گزارش داد که GPT-Red در 84% سناریوهای ارزیابی داخلی موفق بوده است، در مقایسه با 13% برای تیمهای قرمز انسانی در همان آزمایشات.
اوپنایآی نوشت: «GPT-Red از طریق خود-بازی خصمانه یاد میگیرد، جایی که هدف آن تزریق پرامپت به مجموعهای از مدلهای مدافع چالشبرانگیز است. هر حمله موفقی که GPT-Red پیدا میکند، برای بهبود این مدافعان استفاده میشود و GPT-Red را به یافتن مستمر شکستهای گستردهتر و پیچیدهتر سوق میدهد.»
در یک مطالعه موردی، اوپنایآی گفت که این سیستم یک عامل خودکار ماشین فروش را وادار کرده تا قیمتها را کاهش دهد، موجودی با تخفیف سفارش دهد و سفارش مشتری دیگری را لغو کند، پیش از اینکه این آسیبپذیریها افشا و برطرف شوند.
GPT-Red در ادامه سالها تلاش اوپنایآی در زمینه امنیت سایبری، پس از عرضه عمومی ChatGPT، معرفی شده است.
در سال 2023، این شرکت شبکه تیم قرمز اوپنایآی (OpenAI Red Teaming Network) را راهاندازی کرد و محققان امنیت سایبری خارجی و کارشناسان حوزه را برای بررسی ChatGPT و سایر مدلها از نظر نقصهای امنیتی قبل از انتشار، به خدمت گرفت. GPT-Red با خودکارسازی بخش زیادی از این فرآیند، این تلاش را گسترش میدهد و از یک مدل هوش مصنوعی برای تولید حملات تزریق پرامپت و سایر آزمایشهای خصمانه در مقیاسی استفاده میکند که برای محققان انسانی به تنهایی دشوار خواهد بود.
اعلامیه اوپنایآی نشاندهنده یک تغییر گستردهتر به سمت استفاده از هوش مصنوعی برای ایمنسازی هوش مصنوعی است.
اوایل این ماه، بنیاد اتریوم (Ethereum Foundation) اعلام کرد که عاملان هوش مصنوعی را برای تیم قرمز کردن زیرساختهای حیاتی شبکه مستقر کرده است و یک آسیبپذیری در نرمافزار مورد استفاده توسط کلاینتهای اجماع اتریوم را کشف کرده است. محققان گفتند که عاملان هوش مصنوعی میتوانند پایگاههای کد بزرگتری را نسبت به انسانها جستجو کنند، اما چالش از یافتن باگهای بالقوه به اثبات قابل بهرهبرداری بودن آنها تغییر کرده است.
به گفته اوپنایآی، GPT-Red یک ابزار داخلی باقی خواهد ماند زیرا حاوی قابلیتهای تهاجمی است که عمداً توسعه یافتهاند.
آنها گفتند: «ما با GPT-Red معتقدیم که چرخهای مشابه برای ایمنی را آغاز کردهایم، جایی که مدلهای امروزی میتوانند برای ساخت مدلهای فردا که قویتر، همسوتر و قابل اعتمادتر باشند، استفاده شوند.»