صفحه اصلیمرکز اخبار LBank
تقویت GPT-5.6 اوپن‌ای‌آی با تیم قرمز هوش مصنوعی در برابر حملات تزریق پرامپت
openai-ai-red-team-strengthen-gpt-5-6-prompt-injection-attacks
تقویت GPT-5.6 اوپن‌ای‌آی با تیم قرمز هوش مصنوعی در برابر حملات تزریق پرامپت
اوپن‌ای‌آی اعلام کرد که مدل جدید تیم قرمز خودکار آن، GPT-Red، آسیب‌پذیری‌هایی را کشف کرده است که از آن‌ها برای مقاوم‌تر کردن GPT-5.6 در برابر حملات تزریق پرامپت استفاده شد.
2026-07-15 منبع:decrypt.co

به طور خلاصه

  • اوپن‌ای‌آی GPT-Red را معرفی کرد، یک سیستم هوش مصنوعی خودکار که برای یافتن آسیب‌پذیری‌ها در مدل‌های GPT پیش از انتشار طراحی شده است.
  • این شرکت گفت که از GPT-Red برای آموزش GPT-5.6 استفاده شده است، که باعث کاهش خطاها در یکی از دشوارترین معیارهای تزریق پرامپت آن شده است.
  • این سیستم به منظور تکمیل تیم‌های قرمز انسانی، آزمایش شخص ثالث و سایر اقدامات ایمنی هوش مصنوعی در نظر گرفته شده است.

اوپن‌ای‌آی (OpenAI) سیستم GPT-Red را معرفی کرده است، یک سیستم هوش مصنوعی خودکار که برای یافتن آسیب‌پذیری‌های امنیتی در مدل‌های زبان خود طراحی شده است.

نام GPT-Red از "تیم قرمز" (red teaming) در امنیت سایبری گرفته شده است، که رویه‌ای برای تلاش عمدی برای شکستن یک سیستم به منظور شناسایی نقاط ضعف قبل از اینکه مهاجمان بتوانند از آنها سوءاستفاده کنند، می‌باشد.

اوپن‌ای‌آی در پستی در روز چهارشنبه اعلام کرد که این ابزار به مقاوم‌تر شدن GPT-5.6 در برابر حملات تزریق پرامپت (prompt injection) قبل از استقرار کمک کرده است.

اوپن‌ای‌آی در X نوشت: «همانطور که قابلیت‌های مدل افزایش می‌یابد، ایمنی و همسویی باید همراه با آنها مقیاس‌پذیر باشد. تیم قرمز ضروری است، اما رویکردهای امروزی به سختی مقیاس‌پذیر هستند و یک تنگنای حیاتی ایجاد می‌کنند. GPT-Red یکی از راه‌هایی است که ما به آن رسیدگی می‌کنیم.»

به گفته اوپن‌ای‌آی، GPT-Red از طریق یادگیری تقویتی خود-بازی (self-play reinforcement learning) آموزش دیده است و حملات تزریق پرامپت قوی‌تر و قوی‌تری را تولید می‌کند، در حالی که مدل‌های مدافع مقاومت در برابر آنها را می‌آموزند. این شرکت اعلام کرد که این حملات در فرآیند آموزش GPT-5.6 گنجانده شده‌اند و گزارش داد که GPT-Red در 84% سناریوهای ارزیابی داخلی موفق بوده است، در مقایسه با 13% برای تیم‌های قرمز انسانی در همان آزمایشات.

اوپن‌ای‌آی نوشت: «GPT-Red از طریق خود-بازی خصمانه یاد می‌گیرد، جایی که هدف آن تزریق پرامپت به مجموعه‌ای از مدل‌های مدافع چالش‌برانگیز است. هر حمله موفقی که GPT-Red پیدا می‌کند، برای بهبود این مدافعان استفاده می‌شود و GPT-Red را به یافتن مستمر شکست‌های گسترده‌تر و پیچیده‌تر سوق می‌دهد.»

در یک مطالعه موردی، اوپن‌ای‌آی گفت که این سیستم یک عامل خودکار ماشین فروش را وادار کرده تا قیمت‌ها را کاهش دهد، موجودی با تخفیف سفارش دهد و سفارش مشتری دیگری را لغو کند، پیش از اینکه این آسیب‌پذیری‌ها افشا و برطرف شوند.

GPT-Red در ادامه سال‌ها تلاش اوپن‌ای‌آی در زمینه امنیت سایبری، پس از عرضه عمومی ChatGPT، معرفی شده است.

در سال 2023، این شرکت شبکه تیم قرمز اوپن‌ای‌آی (OpenAI Red Teaming Network) را راه‌اندازی کرد و محققان امنیت سایبری خارجی و کارشناسان حوزه را برای بررسی ChatGPT و سایر مدل‌ها از نظر نقص‌های امنیتی قبل از انتشار، به خدمت گرفت. GPT-Red با خودکارسازی بخش زیادی از این فرآیند، این تلاش را گسترش می‌دهد و از یک مدل هوش مصنوعی برای تولید حملات تزریق پرامپت و سایر آزمایش‌های خصمانه در مقیاسی استفاده می‌کند که برای محققان انسانی به تنهایی دشوار خواهد بود.

اعلامیه اوپن‌ای‌آی نشان‌دهنده یک تغییر گسترده‌تر به سمت استفاده از هوش مصنوعی برای ایمن‌سازی هوش مصنوعی است.

اوایل این ماه، بنیاد اتریوم (Ethereum Foundation) اعلام کرد که عاملان هوش مصنوعی را برای تیم قرمز کردن زیرساخت‌های حیاتی شبکه مستقر کرده است و یک آسیب‌پذیری در نرم‌افزار مورد استفاده توسط کلاینت‌های اجماع اتریوم را کشف کرده است. محققان گفتند که عاملان هوش مصنوعی می‌توانند پایگاه‌های کد بزرگ‌تری را نسبت به انسان‌ها جستجو کنند، اما چالش از یافتن باگ‌های بالقوه به اثبات قابل بهره‌برداری بودن آنها تغییر کرده است.

به گفته اوپن‌ای‌آی، GPT-Red یک ابزار داخلی باقی خواهد ماند زیرا حاوی قابلیت‌های تهاجمی است که عمداً توسعه یافته‌اند.

آنها گفتند: «ما با GPT-Red معتقدیم که چرخه‌ای مشابه برای ایمنی را آغاز کرده‌ایم، جایی که مدل‌های امروزی می‌توانند برای ساخت مدل‌های فردا که قوی‌تر، همسوتر و قابل اعتمادتر باشند، استفاده شوند.»

رمزارز های محبوب
همین حالا ثبت‌نام کنید، هیچ به‌روزرسانی‌ای را از دست ندهید!