
Moonshot AI بزرگترین مدل متنباز چینی را منتشر کرد و این مدل در نوشتن سناریو از Claude Fable 5 پیشی گرفت.
معیار Towards AI's Writing Elo – که در آن مدلها سناریوهای واقعی را به صورت کورکورانه در برابر نسخههای منتشر شده قضاوت میکنند و با همان سیستم Elo که بازیکنان شطرنج را رتبهبندی میکند، امتیاز میدهند – Kimi K3 را با امتیاز 2,840 بالاتر از Fable 5 (حداکثر) با امتیاز 2,760 قرار داد. این رتبهبندی است که تیم Anthropic به طور تاریخی بر آن تسلط داشته است.
Big news from our internal writing benchmark (early results): Kimi K3 by @Kimi_Moonshot is now #1 for writing in our editorial voice, at 2840 Elo, surpassing Claude Fable 5.
That is a jump from #21 to #1 over its predecessor, Kimi K2.6. And it runs at about $0.25 per script: 5x… https://t.co/000EosInEc pic.twitter.com/V18t7g4pHu
— Louis-François Bouchard 🎥🤖 (@Whats_AI) July 16, 2026
K3 همچنین رتبه اول را در تابلوی امتیازات کد فرانتاند Arena AI کسب کرد – رتبهبندیای که از هزاران رأی جفتی انسانی در وظایف تولید کد، دوباره با امتیاز Elo، ساخته شده است – با امتیاز 1,679 در مقابل 1,631 برای Fable 5. رتبه اول در شش از هفت دامنه فرانتاند.
Big news: Kimi-K3 by @Kimi_Moonshot is now #1 in the Frontend Code Arena with 1679 pts, surpassing Claude Fable 5.
This is a 17-place jump from Kimi-k2.6 (#18 -> #1).
In Frontend, Kimi-K3 ranked #1 in 6 of 7 domains: Brand & Marketing, Reference-Based Design, Data & Analytics,… https://t.co/YDN3BufGkC pic.twitter.com/Oa6teaQnWp
— Arena.ai (@arena) July 16, 2026
شاخص هوش تحلیل مصنوعی (Artificial Analysis Intelligence Index) – امتیازی که از نه ارزیابی مستقل شامل کدنویسی، استدلال، کار عاملمحور و دانش، با رتبهبندی 0 تا 100، ساخته شده است – K3 را در 57 قرار میدهد، در حالی که Claude Fable 5 در 60، GPT-5.6 Sol در 59 و Claude Opus 4.8 در 56 قرار دارند. این K3 را به عنوان سومین مدل توانمند در مجموع قرار میدهد، با Fable 5 که تنها 3 درصد از آن پیشی گرفته است.
Kimi K3 is beating Fable 5 head to head on BridgeBench.
Same task, blind judge panel.
K3 has won 7 of 8 arenas, including Refactoring 9-0 and Debugging 6-1.
Fable 5's only win: Speed.
Fable 5 went 142-36 against GPT 5.6 Sol and is now losing 2 to 1 to an open source model… pic.twitter.com/CaRSjbIwUW
— Bridgebench (@bridgebench) July 17, 2026
Kimi K3 is the best performing model on https://t.co/SnZ54Xok7n, ahead of Fable, reaching a comparable success rate in less time.
This is the first time that an open model is ahead of all proprietary ones for this comprehensive web engineering benchmark.
Notes:
▪️ Benchmarks… pic.twitter.com/2MqvbAxAaw
— Guillermo Rauch (@rauchg) July 16, 2026
اگر میخواهید ایدهای از قابلیتهای آن داشته باشید، این یک نتیجه بدون آموزش از یک درخواست است که از مدل میخواهد یک کلون iOS بسازد. برای مقایسه، این بهترین تقریب به اشتراک گذاشته شده در شبکههای اجتماعی با استفاده از GPT 5.6 Sol و یک درخواست بسیار پیچیدهتر است.
K3 شامل 2.8 تریلیون پارامتر – مقادیر عددی که دانش یک مدل را ذخیره میکنند – در یک معماری ترکیبی از متخصصان است. ترکیب متخصصان، این پارامترها را به 896 زیرشبکه "متخصص" تقسیم میکند و تنها کسری از آنها را برای هر کار مشخص فعال میکند. اینگونه است که شما به هوش در سطح پیشرو بدون ذوب کردن اتاق سرور دست مییابید.
Moonshot AI میگوید: «این اولین مدل متنباز جهان در کلاس 3 تریلیون پارامتر است که برای سناریوهای هوش پیشرو شامل کدنویسی بلندمدت، کارهای دانشی و استدلال طراحی شده است.» این تنها یک تبلیغ بازاریابی نیست: DeepSeek's V4-Pro حداکثر به 1.6 تریلیون پارامتر میرسد، و K2 خود Moonshot به یک تریلیون. K3 تقریباً نزدیکترین رقیب با وزن باز را در نمودار اندازه دو برابر میکند.
این مدل دارای یک پنجره متنی یک میلیون توکنی است – توکنها واحد اصلی اطلاعاتی هستند که یک هوش مصنوعی پردازش میکند، تقریباً سه چهارم یک کلمه – درک بومی تصویر و ویدئو و استدلال همیشه فعال.
دو تکنیک معماری، افزایش کارایی را تقویت میکنند. Kimi Delta Attention رمزگشایی را برای توالیهای طولانی تسریع میکند – تا 6.3 برابر سریعتر در زمینههای یک میلیون توکن. Attention Residuals اطلاعات را به طور انتخابی در لایههای مدل هدایت میکند به جای اینکه آنها را به طور یکنواخت جمع کند، که حدود 25% کارایی آموزش را با کمتر از 2% هزینه محاسباتی اضافی افزایش میدهد – که مجموعاً حدود 2.5 برابر کارایی مقیاسپذیری بهتری نسبت به K2 ارائه میدهد.
Kimi K3 برای هر میلیون توکن ورودی 3 دلار و برای هر میلیون توکن خروجی 15 دلار هزینه دارد – همان نرخ Claude Sonnet 5، مدل میانرده Anthropic. تفاوت این است که Sonnet 5 پیشنهاد میانی Anthropic است؛ K3 در ترکیب تحلیل مصنوعی سه امتیاز پایینتر از Fable 5 قرار دارد. برای هر کار در این مجموعه نه معیاره، K3 با هزینه 0.94 دلار در مقابل 1.04 دلار برای GPT-5.6 Sol و 1.80 دلار برای Opus 4.8 عمل میکند.
به عبارت دیگر، این مدل عملکردی عالی را با قیمتی در سطح میانرده ارائه میدهد.
همانطور که Decrypt در ماه مه پوشش داد، شکاف قیمتگذاری بین هوش مصنوعی پیشرو چینی و آمریکایی در اوایل سال جاری 15 تا 30 برابر بود. K3 از نرخهای DeepSeek کمتر نیست – قیمت آن مانند یک مدل میانرده غربی است – اما در این سطح عملکردی نزدیک به پیشرو ارائه میدهد. برای تیمهایی که بر روی API توسعه میدهند، این نشاندهنده بهبود قابل توجهی در هزینه است.
اگر Anthropic قصد دارد Fable 5 را تنها از طریق API در دسترس قرار دهد، K3 به نزدیکترین جایگزین با وزن باز برای هر مدلی که در حال حاضر دومین در صنعت است تبدیل میشود – با نیمی از هزینه هر کار Opus 4.8. این سناریویی است که علاقهمندان به معیارها در حال حاضر روی آن حساب میکنند.
انتشار K3 استدلالی است که حامیان کنترل صادرات تراشه ایالات متحده نمیخواهند داشته باشند. ایالات متحده صادرات پردازندههای گرافیکی H800 انویدیا را به چین در اواخر سال 2023 محدود کرد؛ Moonshot تأیید کرد که مدلهای قبلی را با آن تراشهها آموزش داده است. اسناد معیار K3 نیز به H200 و آنچه این شرکت آن را "یک GPGPU از یک فروشنده جایگزین" مینامد – که به طور گستردهای به عنوان سختافزار Huawei Ascend تفسیر میشود – اشاره میکند، بدون اینکه مشخص کند آن سختافزار در کجا قرار دارد.
یوتونگ ژانگ، رئیس Moonshot AI، این محدودیت را مستقیماً در داووس امسال، طبق گزارش Silicon Republic، چنین بیان کرد: "ما میدانستیم که فرصت لوکسی برای افزایش صرفاً قدرت محاسباتی نداریم... این ما را مجبور کرد تا بر تحقیقات بنیادی و کارایی تمرکز کنیم." تحلیلگران Bank of America، در یادداشتی پس از انتشار، نوشتند که K3 ثابت میکند "مقیاسبندی پیشآموزش، همراه با نوآوری معماری، همچنان میتواند پیشرفتهای چشمگیری را برای مدلهای پرچمدار چینی" تحت این محدودیتها به ارمغان آورد.
Moonshot یکی از استارتاپهای به اصطلاح "AI Tiger" است که به طور جمعی چشمانداز مدلهای جهانی را بدون دسترسی به تراشههایی که واشنگتن میگفت به آنها نیاز دارند، تغییر دادهاند. اینکه آیا این یک استدلال برای کنترلهای صادراتی سختگیرانهتر است یا استدلالی که نشان میدهد آنها کار نمیکنند، یک سوال سیاسی است که واشنگتن هنوز به آن پاسخ نداده است.
نرخ توهم (hallucination) K3 در AA-Omniscience – معیاری که اندازهگیری میکند یک مدل چند بار با اطمینان پاسخی را که نمیداند، از خود ساخته است – در مقایسه با نسخه قبلی K2.6 از 39% به 51% افزایش یافته است. به طور کلی پاسخهای صحیحتر؛ و نیز پاسخهای ساختگی بیشتر. این مدل همچنین در مستندات خود اذعان میکند که میتواند "بیش از حد پیشفعال" باشد و در طول کارهای خودمختار طولانی، تصمیمات غیرمنتظرهای به نمایندگی از کاربر بگیرد.
برای تیمهایی که از ابزارهای مبتنی بر Kimi K2.6 استفاده میکردند و میخواهند ارتقا دهند، K3 در اکثر جنبهها یک گام مهم به جلو است – اما این تفاوت در توهم (hallucination delta) قبل از اینکه به آن برای کارهایی که نیاز به دقت دارند اعتماد کنید، ارزش آزمایش استرس را دارد.
اگر میخواهید آن را به صورت رایگان امتحان کنید، میتوانید. این مدل در وبسایت رسمی کیمی در دسترس است. اما موفق باشید: سرورها آنقدر شلوغ هستند که وظایف به دلیل محدودیتهای ترافیکی دائماً قطع میشوند و استفاده از آن را به سختی ممکن میسازند. جایگزین بهتر این است که یا برای اشتراک پول بپردازید یا از طریق API از آن استفاده کنید.
وزنهای مدل در 27 جولای منتشر خواهند شد. اینها برای شرکتها و کسبوکارهای بزرگ در دسترس خواهند بود. هیچ پردازنده گرافیکی داخلی، هر چقدر هم که بزرگ باشد، در حال حاضر قادر به مدیریت مدلی با این اندازه نیست.