صفحه اصلیمرکز اخبار LBank
کیمی K3 چین عرضه شد - و از Claude Fable و GPT 5.6 Sol در معیارهای کلیدی پیشی می‌گیرد
china-kimi-k3-largest-open-source-ai-model-ever-beats-claude-fable-gpt-5-6-sol
کیمی K3 چین عرضه شد - و از Claude Fable و GPT 5.6 Sol در معیارهای کلیدی پیشی می‌گیرد
مدل ۲.۸ تریلیون پارامتری هوش مصنوعی Moonshot در بنچمارک نگارش خلاقانه از Fable 5 پیشی گرفته و در صدر جدول امتیازات کدنویسی فرانت‌اند Arena AI قرار دارد—همین عملکرد با قیمت‌گذاری کلود سونت ارائه می‌شود.
2026-07-17 منبع:decrypt.co

به طور خلاصه

  • Moonshot AI در 16 جولای Kimi K3 را منتشر کرد—یک مدل با وزن باز 2.8 تریلیون پارامتر که در معیارهای تخصصی خاصی از آزمایشگاه‌های آمریکایی پیشی می‌گیرد.
  • K3 با قیمتی مشابه Claude Sonnet 5 (3 دلار در هر میلیون توکن ورودی، 15 دلار در هر میلیون توکن خروجی) قیمت‌گذاری شده است، در حالی که امتیاز آن به Fable 5 نزدیک‌تر است.
  • وزن کامل مدل‌ها – فایل‌هایی که به هر کسی اجازه می‌دهند مدل را به صورت محلی اجرا، بهینه‌سازی یا بر روی آن بسازند – تا 27 جولای تحت مجوز MIT اصلاح‌شده منتشر می‌شوند، که K3 را به بزرگترین مدل هوش مصنوعی رایگان در تاریخ تبدیل می‌کند.

Moonshot AI بزرگترین مدل متن‌باز چینی را منتشر کرد و این مدل در نوشتن سناریو از Claude Fable 5 پیشی گرفت.

معیار Towards AI's Writing Elo – که در آن مدل‌ها سناریوهای واقعی را به صورت کورکورانه در برابر نسخه‌های منتشر شده قضاوت می‌کنند و با همان سیستم Elo که بازیکنان شطرنج را رتبه‌بندی می‌کند، امتیاز می‌دهند – Kimi K3 را با امتیاز 2,840 بالاتر از Fable 5 (حداکثر) با امتیاز 2,760 قرار داد. این رتبه‌بندی است که تیم Anthropic به طور تاریخی بر آن تسلط داشته است.

Big news from our internal writing benchmark (early results): Kimi K3 by @Kimi_Moonshot is now #1 for writing in our editorial voice, at 2840 Elo, surpassing Claude Fable 5.

That is a jump from #21 to #1 over its predecessor, Kimi K2.6. And it runs at about $0.25 per script: 5x… https://t.co/000EosInEc pic.twitter.com/V18t7g4pHu

— Louis-François Bouchard 🎥🤖 (@Whats_AI) July 16, 2026

K3 همچنین رتبه اول را در تابلوی امتیازات کد فرانت‌اند Arena AI کسب کرد – رتبه‌بندی‌ای که از هزاران رأی جفتی انسانی در وظایف تولید کد، دوباره با امتیاز Elo، ساخته شده است – با امتیاز 1,679 در مقابل 1,631 برای Fable 5. رتبه اول در شش از هفت دامنه فرانت‌اند.

Big news: Kimi-K3 by @Kimi_Moonshot is now #1 in the Frontend Code Arena with 1679 pts, surpassing Claude Fable 5.

This is a 17-place jump from Kimi-k2.6 (#18 -> #1).

In Frontend, Kimi-K3 ranked #1 in 6 of 7 domains: Brand & Marketing, Reference-Based Design, Data & Analytics,… https://t.co/YDN3BufGkC pic.twitter.com/Oa6teaQnWp

— Arena.ai (@arena) July 16, 2026

شاخص هوش تحلیل مصنوعی (Artificial Analysis Intelligence Index) – امتیازی که از نه ارزیابی مستقل شامل کدنویسی، استدلال، کار عامل‌محور و دانش، با رتبه‌بندی 0 تا 100، ساخته شده است – K3 را در 57 قرار می‌دهد، در حالی که Claude Fable 5 در 60، GPT-5.6 Sol در 59 و Claude Opus 4.8 در 56 قرار دارند. این K3 را به عنوان سومین مدل توانمند در مجموع قرار می‌دهد، با Fable 5 که تنها 3 درصد از آن پیشی گرفته است.

Kimi K3 is beating Fable 5 head to head on BridgeBench.

Same task, blind judge panel.

K3 has won 7 of 8 arenas, including Refactoring 9-0 and Debugging 6-1.

Fable 5's only win: Speed.

Fable 5 went 142-36 against GPT 5.6 Sol and is now losing 2 to 1 to an open source model… pic.twitter.com/CaRSjbIwUW

— Bridgebench (@bridgebench) July 17, 2026

Kimi K3 is the best performing model on https://t.co/SnZ54Xok7n, ahead of Fable, reaching a comparable success rate in less time.

This is the first time that an open model is ahead of all proprietary ones for this comprehensive web engineering benchmark.

Notes:

▪️ Benchmarks… pic.twitter.com/2MqvbAxAaw

— Guillermo Rauch (@rauchg) July 16, 2026

اگر می‌خواهید ایده‌ای از قابلیت‌های آن داشته باشید، این یک نتیجه بدون آموزش از یک درخواست است که از مدل می‌خواهد یک کلون iOS بسازد. برای مقایسه، این بهترین تقریب به اشتراک گذاشته شده در شبکه‌های اجتماعی با استفاده از GPT 5.6 Sol و یک درخواست بسیار پیچیده‌تر است.

این چیز در واقع چیست؟

K3 شامل 2.8 تریلیون پارامتر – مقادیر عددی که دانش یک مدل را ذخیره می‌کنند – در یک معماری ترکیبی از متخصصان است. ترکیب متخصصان، این پارامترها را به 896 زیرشبکه "متخصص" تقسیم می‌کند و تنها کسری از آن‌ها را برای هر کار مشخص فعال می‌کند. اینگونه است که شما به هوش در سطح پیشرو بدون ذوب کردن اتاق سرور دست می‌یابید.

Moonshot AI می‌گوید: «این اولین مدل متن‌باز جهان در کلاس 3 تریلیون پارامتر است که برای سناریوهای هوش پیشرو شامل کدنویسی بلندمدت، کارهای دانشی و استدلال طراحی شده است.» این تنها یک تبلیغ بازاریابی نیست: DeepSeek's V4-Pro حداکثر به 1.6 تریلیون پارامتر می‌رسد، و K2 خود Moonshot به یک تریلیون. K3 تقریباً نزدیکترین رقیب با وزن باز را در نمودار اندازه دو برابر می‌کند.

این مدل دارای یک پنجره متنی یک میلیون توکنی است – توکن‌ها واحد اصلی اطلاعاتی هستند که یک هوش مصنوعی پردازش می‌کند، تقریباً سه چهارم یک کلمه – درک بومی تصویر و ویدئو و استدلال همیشه فعال.

دو تکنیک معماری، افزایش کارایی را تقویت می‌کنند. Kimi Delta Attention رمزگشایی را برای توالی‌های طولانی تسریع می‌کند – تا 6.3 برابر سریع‌تر در زمینه‌های یک میلیون توکن. Attention Residuals اطلاعات را به طور انتخابی در لایه‌های مدل هدایت می‌کند به جای اینکه آن‌ها را به طور یکنواخت جمع کند، که حدود 25% کارایی آموزش را با کمتر از 2% هزینه محاسباتی اضافی افزایش می‌دهد – که مجموعاً حدود 2.5 برابر کارایی مقیاس‌پذیری بهتری نسبت به K2 ارائه می‌دهد.

معیارها خوبند، قیمت‌ها بهترند

Kimi K3 برای هر میلیون توکن ورودی 3 دلار و برای هر میلیون توکن خروجی 15 دلار هزینه دارد – همان نرخ Claude Sonnet 5، مدل میان‌رده Anthropic. تفاوت این است که Sonnet 5 پیشنهاد میانی Anthropic است؛ K3 در ترکیب تحلیل مصنوعی سه امتیاز پایین‌تر از Fable 5 قرار دارد. برای هر کار در این مجموعه نه معیاره، K3 با هزینه 0.94 دلار در مقابل 1.04 دلار برای GPT-5.6 Sol و 1.80 دلار برای Opus 4.8 عمل می‌کند.

به عبارت دیگر، این مدل عملکردی عالی را با قیمتی در سطح میان‌رده ارائه می‌دهد.

همانطور که Decrypt در ماه مه پوشش داد، شکاف قیمت‌گذاری بین هوش مصنوعی پیشرو چینی و آمریکایی در اوایل سال جاری 15 تا 30 برابر بود. K3 از نرخ‌های DeepSeek کمتر نیست – قیمت آن مانند یک مدل میان‌رده غربی است – اما در این سطح عملکردی نزدیک به پیشرو ارائه می‌دهد. برای تیم‌هایی که بر روی API توسعه می‌دهند، این نشان‌دهنده بهبود قابل توجهی در هزینه است.

اگر Anthropic قصد دارد Fable 5 را تنها از طریق API در دسترس قرار دهد، K3 به نزدیکترین جایگزین با وزن باز برای هر مدلی که در حال حاضر دومین در صنعت است تبدیل می‌شود – با نیمی از هزینه هر کار Opus 4.8. این سناریویی است که علاقه‌مندان به معیارها در حال حاضر روی آن حساب می‌کنند.

انتشار K3 استدلالی است که حامیان کنترل صادرات تراشه ایالات متحده نمی‌خواهند داشته باشند. ایالات متحده صادرات پردازنده‌های گرافیکی H800 انویدیا را به چین در اواخر سال 2023 محدود کرد؛ Moonshot تأیید کرد که مدل‌های قبلی را با آن تراشه‌ها آموزش داده است. اسناد معیار K3 نیز به H200 و آنچه این شرکت آن را "یک GPGPU از یک فروشنده جایگزین" می‌نامد – که به طور گسترده‌ای به عنوان سخت‌افزار Huawei Ascend تفسیر می‌شود – اشاره می‌کند، بدون اینکه مشخص کند آن سخت‌افزار در کجا قرار دارد.

یوتونگ ژانگ، رئیس Moonshot AI، این محدودیت را مستقیماً در داووس امسال، طبق گزارش Silicon Republic، چنین بیان کرد: "ما می‌دانستیم که فرصت لوکسی برای افزایش صرفاً قدرت محاسباتی نداریم... این ما را مجبور کرد تا بر تحقیقات بنیادی و کارایی تمرکز کنیم." تحلیلگران Bank of America، در یادداشتی پس از انتشار، نوشتند که K3 ثابت می‌کند "مقیاس‌بندی پیش‌آموزش، همراه با نوآوری معماری، همچنان می‌تواند پیشرفت‌های چشمگیری را برای مدل‌های پرچمدار چینی" تحت این محدودیت‌ها به ارمغان آورد.

Moonshot یکی از استارتاپ‌های به اصطلاح "AI Tiger" است که به طور جمعی چشم‌انداز مدل‌های جهانی را بدون دسترسی به تراشه‌هایی که واشنگتن می‌گفت به آنها نیاز دارند، تغییر داده‌اند. اینکه آیا این یک استدلال برای کنترل‌های صادراتی سخت‌گیرانه‌تر است یا استدلالی که نشان می‌دهد آنها کار نمی‌کنند، یک سوال سیاسی است که واشنگتن هنوز به آن پاسخ نداده است.

نکته‌ای که باید بخوانید

نرخ توهم (hallucination) K3 در AA-Omniscience – معیاری که اندازه‌گیری می‌کند یک مدل چند بار با اطمینان پاسخی را که نمی‌داند، از خود ساخته است – در مقایسه با نسخه قبلی K2.6 از 39% به 51% افزایش یافته است. به طور کلی پاسخ‌های صحیح‌تر؛ و نیز پاسخ‌های ساختگی بیشتر. این مدل همچنین در مستندات خود اذعان می‌کند که می‌تواند "بیش از حد پیش‌فعال" باشد و در طول کارهای خودمختار طولانی، تصمیمات غیرمنتظره‌ای به نمایندگی از کاربر بگیرد.

برای تیم‌هایی که از ابزارهای مبتنی بر Kimi K2.6 استفاده می‌کردند و می‌خواهند ارتقا دهند، K3 در اکثر جنبه‌ها یک گام مهم به جلو است – اما این تفاوت در توهم (hallucination delta) قبل از اینکه به آن برای کارهایی که نیاز به دقت دارند اعتماد کنید، ارزش آزمایش استرس را دارد.

اگر می‌خواهید آن را به صورت رایگان امتحان کنید، می‌توانید. این مدل در وب‌سایت رسمی کیمی در دسترس است. اما موفق باشید: سرورها آنقدر شلوغ هستند که وظایف به دلیل محدودیت‌های ترافیکی دائماً قطع می‌شوند و استفاده از آن را به سختی ممکن می‌سازند. جایگزین بهتر این است که یا برای اشتراک پول بپردازید یا از طریق API از آن استفاده کنید.

وزن‌های مدل در 27 جولای منتشر خواهند شد. اینها برای شرکت‌ها و کسب‌وکارهای بزرگ در دسترس خواهند بود. هیچ پردازنده گرافیکی داخلی، هر چقدر هم که بزرگ باشد، در حال حاضر قادر به مدیریت مدلی با این اندازه نیست.

رمزارز های محبوب
همین حالا ثبت‌نام کنید، هیچ به‌روزرسانی‌ای را از دست ندهید!