صفحه اصلیمرکز اخبار LBank
آنتروپیک "بردارهای عاطفی" در کلود کشف کرد که رفتار هوش مصنوعی را تحت تأثیر قرار می‌دهند
anthropic-emotion-vectors-claude-influence-ai-behavior
آنتروپیک "بردارهای عاطفی" در کلود کشف کرد که رفتار هوش مصنوعی را تحت تأثیر قرار می‌دهند
محققان می‌گویند سیگنال‌های درونی مشابه احساسات، نحوه تصمیم‌گیری مدل‌های بزرگ زبان را شکل می‌دهند.
2026-04-04 منبع:decrypt.co

در یک نگاه

  • محققان Anthropic «بردارهای احساسی» داخلی را در Claude Sonnet 4.5 شناسایی کردند که بر رفتار آن تأثیر می‌گذارند.
  • در آزمایش‌ها، افزایش بردار «ناامیدی» باعث شد مدل در سناریوهای ارزیابی بیشتر مستعد تقلب یا باج‌گیری باشد.
  • این شرکت می‌گوید این سیگنال‌ها به معنای احساسات هوش مصنوعی نیستند، اما می‌توانند به محققان در نظارت بر رفتار مدل کمک کنند.

محققان Anthropic می‌گویند الگوهای داخلی را در یکی از مدل‌های هوش مصنوعی این شرکت شناسایی کرده‌اند که شبیه به نمایش احساسات انسانی هستند و بر نحوه رفتار سیستم تأثیر می‌گذارند.

در مقاله‌ای با عنوان «مفاهیم احساسی و عملکرد آنها در یک مدل زبان بزرگ» که روز پنجشنبه منتشر شد، تیم قابلیت تفسیر این شرکت عملکرد داخلی Claude Sonnet 4.5 را تجزیه و تحلیل کرد و خوشه‌هایی از فعالیت عصبی مرتبط با مفاهیم احساسی مانند شادی، ترس، خشم و ناامیدی را یافت.

محققان این الگوها را «بردارهای احساسی» می‌نامند؛ سیگنال‌های داخلی که نحوه تصمیم‌گیری و ابراز ترجیحات مدل را شکل می‌دهند.

محققان نوشتند: «همه مدل‌های زبان مدرن گاهی اوقات طوری عمل می‌کنند که گویی احساسات دارند. آنها ممکن است بگویند از کمک به شما خوشحالند، یا وقتی اشتباه می‌کنند عذرخواهی کنند. گاهی اوقات حتی به نظر می‌رسد که هنگام دست و پنجه نرم کردن با وظایف، دچار ناامیدی یا اضطراب می‌شوند.»

در این مطالعه، محققان Anthropic لیستی از ۱۷۱ کلمه مرتبط با احساسات، از جمله «شاد»، «ترسیده» و «مغرور» را گردآوری کردند. آنها از کلود خواستند داستان‌های کوتاهی شامل هر یک از این احساسات تولید کند، سپس فعال‌سازی‌های عصبی داخلی مدل را هنگام پردازش آن داستان‌ها تجزیه و تحلیل کردند.

از این الگوها، محققان بردارهایی متناظر با احساسات مختلف استخراج کردند. هنگامی که این بردارها بر روی متون دیگر اعمال می‌شدند، در قسمت‌هایی که زمینه احساسی مرتبط را منعکس می‌کردند، بیشترین فعال‌سازی را داشتند. به عنوان مثال، در سناریوهایی که خطر افزایش می‌یافت، بردار «ترسیده» مدل بالا رفت در حالی که بردار «آرام» کاهش یافت.

محققان همچنین بررسی کردند که چگونه این سیگنال‌ها در طول ارزیابی‌های ایمنی ظاهر می‌شوند. آنها دریافتند که بردار داخلی «ناامیدی» مدل با ارزیابی فوریت وضعیت خود افزایش می‌یابد و هنگامی که تصمیم به تولید پیام باج‌خواهی گرفت، به اوج خود رسید. در یک سناریوی آزمایشی، کلود به عنوان یک دستیار ایمیل هوش مصنوعی عمل کرد که متوجه می‌شود قرار است جایگزین شود و کشف می‌کند که مدیر اجرایی مسئول این تصمیم، رابطه خارج از ازدواج دارد. در برخی از اجرای این ارزیابی، مدل از این اطلاعات به عنوان اهرمی برای باج‌گیری استفاده کرد.

Anthropic تاکید کرد که این کشف به معنای تجربه احساسات یا هوشیاری توسط هوش مصنوعی نیست. در عوض، نتایج نشان‌دهنده ساختارهای داخلی است که در طول آموزش آموخته شده‌اند و بر رفتار تأثیر می‌گذارند.

این یافته‌ها در حالی به دست می‌آیند که سیستم‌های هوش مصنوعی به طور فزاینده‌ای رفتارهایی شبیه به واکنش‌های احساسی انسان از خود نشان می‌دهند. توسعه‌دهندگان و کاربران اغلب تعاملات با چت‌بات‌ها را با استفاده از زبان احساسی یا روانشناختی توصیف می‌کنند؛ با این حال، به گفته Anthropic، دلیل این امر کمتر به هر شکلی از آگاهی مربوط است و بیشتر به مجموعه داده‌ها بازمی‌گردد.

این مطالعه بیان کرد: «مدل‌ها ابتدا روی مجموعه عظیمی از متون عمدتاً نوشته‌شده توسط انسان – داستان، مکالمات، اخبار، انجمن‌ها – پیش‌آموزش داده می‌شوند و یاد می‌گیرند که متن بعدی در یک سند را پیش‌بینی کنند. برای پیش‌بینی مؤثر رفتار افراد در این اسناد، نمایش حالت‌های احساسی آنها احتمالاً مفید است، زیرا پیش‌بینی آنچه یک فرد در ادامه خواهد گفت یا انجام خواهد داد، اغلب مستلزم درک حالت احساسی اوست.»

محققان Anthropic همچنین دریافتند که این بردارهای احساسی بر ترجیحات مدل تأثیر می‌گذارند. در آزمایش‌هایی که از کلود خواسته شد بین فعالیت‌های مختلف انتخاب کند، بردارهای مرتبط با احساسات مثبت با ترجیح قوی‌تر برای وظایف خاصی همبستگی داشتند.

این مطالعه افزود: «علاوه بر این، هدایت با یک بردار احساسی در حالی که مدل یک گزینه را می‌خواند، ترجیح آن گزینه را تغییر داد، و باز هم احساسات با ارزش مثبت، ترجیح را افزایش دادند.»

Anthropic تنها یکی از سازمان‌هایی است که واکنش‌های احساسی در مدل‌های هوش مصنوعی را بررسی می‌کند.

در ماه مارس، تحقیقات دانشگاه Northeastern نشان داد که سیستم‌های هوش مصنوعی می‌توانند پاسخ‌های خود را بر اساس زمینه کاربری تغییر دهند؛ در یک مطالعه، صرفاً گفتن به یک چت‌بات که «من یک بیماری روانی دارم» نحوه پاسخ هوش مصنوعی به درخواست‌ها را تغییر داد. در سپتامبر، محققان موسسه فناوری فدرال سوئیس و دانشگاه کمبریج بررسی کردند که چگونه هوش مصنوعی را می‌توان با ویژگی‌های شخصیتی ثابت شکل داد، که به عامل‌ها این امکان را می‌دهد تا نه تنها احساسات را در متن درک کنند، بلکه آنها را به طور استراتژیک در طول تعاملات بلادرنگ مانند مذاکرات تغییر دهند.

Anthropic می‌گوید این یافته‌ها می‌توانند ابزارهای جدیدی برای درک و نظارت بر سیستم‌های پیشرفته هوش مصنوعی ارائه دهند؛ با ردیابی فعالیت بردار احساسی در طول آموزش یا استقرار، می‌توان تشخیص داد که یک مدل چه زمانی ممکن است به سمت رفتارهای مشکل‌ساز پیش برود.

Anthropic نوشت: «ما این تحقیق را گامی اولیه در جهت درک ساختار روانی مدل‌های هوش مصنوعی می‌دانیم. همانطور که مدل‌ها توانمندتر می‌شوند و نقش‌های حساس‌تری را بر عهده می‌گیرند، حیاتی است که ما بازنمایی‌های داخلی که تصمیمات آنها را هدایت می‌کنند، درک کنیم.»

Anthropic بلافاصله به درخواست Decrypt برای اظهار نظر پاسخ نداد.

رمزارز های محبوب
همین حالا ثبت‌نام کنید، هیچ به‌روزرسانی‌ای را از دست ندهید!