
کلود اوپوس 5 امروز منتشر شد. اجرای آن برای کسبوکارها ارزانتر از مدل پیشرو Anthropic، یعنی کلود فیبل 5، است که شرکت آن را به عنوان محصول پیشرفته روزمره برای کاربران پولی معرفی کرده بود. علاوه بر این، اوپوس 5 در معیارهای مهم نیز از آن بهتر عمل میکند.
برای درک جایگاه اوپوس 5: خط تولید Anthropic چهار رده دارد. هایکو (Haiku) سریع و ارزان است. سونِت (Sonnet) میانرده است. اوپوس (Opus) مدل قدرتمند و کارآمد است. بالاتر از آن کلاس Mythos قرار دارد – ردهای که Anthropic در بهار امسال معرفی کرد – که شامل کلود فیبل 5 برای عموم و کلود میتوس 5 (Claude Mythos 5) میشود، نسخهای با محدودیتهای کمتر که از طریق پروژه گلسوینگ (Project Glasswing) برای محققان امنیتی تأیید شده و اپراتورهای زیرساختهای حیاتی اختصاص یافته است.
فیبل 5 به عنوان پرچمدار مشترکین دوران سختی را پشت سر گذاشته است. این مدل در 9 ژوئن عرضه شد، سه روز بعد پس از صدور دستور اضطراری کنترل صادرات توسط دولت ایالات متحده به دلیل آسیبپذیری جیلبریک، به طور جهانی از دسترس خارج شد، و در 30 ژوئن بازگشت – اما بلافاصله به یک مدل مبتنی بر اعتبار تغییر یافت و دیگر در برنامههای استاندارد گنجانده نشد. اکنون اوپوس 5 جایگاهی را پر میکند که فیبل 5 نتوانست حفظ کند.
لاوابل (Lovable)، یک پلتفرم توسعهدهندگان با میلیونها کاربر، اوپوس 5 را در ارزیابیهای داخلی خود اجرا کرد و خاطرنشان کرد که پیشرفتها فراتر از نمرات خام هستند: "این مدل نه تنها در سختترین وظایف کدنویسی عاملمحور ما 22 درصد بهتر از اوپوس 4.7 عمل میکند، بلکه پایدارتر است و تغییرات بسیار کمتری در هر اجرا دارد،" فابیان هدین در بیانیهای که توسط Anthropic به اشتراک گذاشته شد، گفت.
شاید عجیب به نظر برسد، اما اوپوس تقریباً در هر زمینهای که برای کاربر عادی اهمیت دارد، فیبل را شکست میدهد، در حالی که مانند فیبل به عنوان کلاس Mythos برچسبگذاری نشده است.
در Frontier-Bench v0.1 – معیاری که توانایی عوامل کدنویسی هوش مصنوعی در انجام وظایف مهندسی نرمافزار واقعی از ابتدا تا انتها را میسنجد و بر اساس درصد وظایف انجام شده نمرهدهی میشود – اوپوس 5 امتیاز 43.3% را کسب کرد. فیبل 5 با 33.7% و GPT-5.6 Sol از OpenAI، رقیب اصلی تجاری Anthropic، با 34.4% در رتبههای بعدی قرار گرفتند.
بیشترین اختلاف در ARC-AGI-3 مشاهده میشود، آزمایشی برای سنجش حل مسئله واقعی که بر اساس معماهای جدیدی طراحی شده که مدل نمیتواند از دادههای آموزشی به خاطر بسپارد و بر اساس درصد معماهای حل شده نمرهدهی میشود. اوپوس 5 امتیاز 30.2% را کسب کرد؛ GPT-5.6 Sol امتیاز 7.8% را به دست آورد؛ و فیبل 5 اصلاً آزمایش نشد. در GDPval-AA v2 – معیاری برای کار دانشمحور که از طریق رتبهبندی الو (Elo)، سیستم رتبهبندی شبیه شطرنج برای اندازهگیری عملکرد نسبی در وظایف حرفهای واقعی، نمرهدهی میشود – اوپوس 5 به امتیاز 1,861 رسید، در حالی که فیبل 5 1,747 و GPT-5.6 Sol 1,736 را کسب کردند.
زاپیر (Zapier) اوپوس 5 را در AutomationBench آزمایش کرد، ارزیابیای که توانایی مدل در انجام یک گردش کار تجاری کامل از ابتدا تا انتها بدون کمک انسان را میسنجد. نتیجه آنها: مدل "یک کارنامه خام سلامت حساب را گرفت و یک توالی کامل جلوگیری از ریزش مشتری را از ابتدا تا انتها اجرا کرد: حسابهای در معرض خطر را پرچمگذاری کرد، به مالک صحیح اطلاعرسانی نمود، و برای عملیات حفظ مشتری خلاصه کرد. مدلهای قبلی موفق نشدند؛ اوپوس 5 به 100% رسید."
Anthropic همچنین اوپوس 5 را به عنوان ارتقایی برای تحقیقات معرفی میکند. اولتیما جنومیکس (Ultima Genomics)، یک شرکت توالییابی DNA، اعلام کرد که این مدل "بیشتر شبیه یک دانشمند دقیق عمل میکند تا هر مدل دیگری که ما اجرا کردهایم. برای حذف عوامل مخدوشکننده به سراغ آزمونهای آماری صحیح میرود، نتایج خود را با روشهای مستقل بررسی میکند و در طول تحلیلهای چندمرحلهای طولانی در مسیر خود باقی میماند."
با این حال، این دو حوزه – حقوقی و بهداشتی – تنها مواردی هستند که فیبل 5 با حاشیه بسیار کمی در آنها برتری دارد.
این انتشار یک هفته پس از آن صورت میگیرد که Moonshot AI، یک استارتآپ مستقر در پکن با حمایت مالی علیبابا، کیمی K3 (Kimi K3) را رونمایی کرد – یک مدل اوپنویت (open-weight) با 2.8 تریلیون پارامتر (به این معنی که هر کسی میتواند کد اصلی را دانلود کرده تا آن را به طور مستقل اجرا کند) که مونشات آن را به عنوان بزرگترین سیستم هوش مصنوعی باز جهان توصیف میکند. معیارهای مستقل به طور مداوم کیمی K3 را در رتبه سوم کلی، پشت سر فیبل 5 و GPT-5.6 Sol، قرار میدهند، اما در برخی زمینههای خاص از آن دو بهتر عمل میکند.
اوپوس 5 اکنون از طریق API با قیمت 5 دلار به ازای هر میلیون توکن ورودی و 25 دلار به ازای هر میلیون خروجی در دسترس است. (توکنها واحد پایه اطلاعاتی هستند که یک مدل هوش مصنوعی میتواند در ورودی و خروجی پردازش کند). یک حالت سریع (Fast mode) نیز با سرعتی حدود 2.5 برابر سرعت پیشفرض و با دو برابر قیمت پایه – 10 دلار به ازای هر میلیون توکن ورودی و 50 دلار به ازای هر میلیون خروجی – در دسترس است.
این انتشار ممکن است به نگرانیها در مورد عدم دسترسی عمومی فیبل 5 پایان دهد. اوپوس نیز اکنون برای همه از طریق اشتراک در دسترس است.