
Moonshot AI 剛剛發布了有史以來最大的中國開源模型,它在腳本撰寫方面超越了 Claude Fable 5。
在 Towards AI 的 Writing Elo 基準測試中(此測試中模型撰寫的真實腳本與已發布版本進行盲評,並使用與西洋棋評級相同的 Elo 系統評分),Kimi K3 獲得 2,840 分,高於 Fable 5 (max) 的 2,760 分。這個排名一直是 Anthropic 團隊歷史上佔據主導地位的領域。
Big news from our internal writing benchmark (early results): Kimi K3 by @Kimi_Moonshot is now #1 for writing in our editorial voice, at 2840 Elo, surpassing Claude Fable 5.
That is a jump from #21 to #1 over its predecessor, Kimi K2.6. And it runs at about $0.25 per script: 5x… https://t.co/000EosInEc pic.twitter.com/V18t7g4pHu
— Louis-François Bouchard 🎥🤖 (@Whats_AI) July 16, 2026
K3 還在 Arena AI 的前端程式碼排行榜上奪得頭把交椅——該排名同樣基於成千上萬的人工投票對程式碼生成任務進行評分,並使用 Elo 系統評分——K3 獲得 1,679 分,而 Fable 5 則為 1,631 分。它在七個前端領域中有六個位居第一。
Big news: Kimi-K3 by @Kimi_Moonshot is now #1 in the Frontend Code Arena with 1679 pts, surpassing Claude Fable 5.
This is a 17-place jump from Kimi-k2.6 (#18 -> #1).
In Frontend, Kimi-K3 ranked #1 in 6 of 7 domains: Brand & Marketing, Reference-Based Design, Data & Analytics,… https://t.co/YDN3BufGkC pic.twitter.com/Oa6teaQnWp
— Arena.ai (@arena) July 16, 2026
人工智慧分析指數 (Artificial Analysis Intelligence Index) 是一個由九項獨立評估(涵蓋編碼、推理、代理工作和知識,評分範圍 0 到 100)組成的分數,K3 獲得 57 分,Claude Fable 5 獲得 60 分,GPT-5.6 Sol 獲得 59 分,Claude Opus 4.8 獲得 56 分。這使得 K3 在綜合能力上排名第三,Fable 5 僅以 3% 的差距領先。
Kimi K3 is beating Fable 5 head to head on BridgeBench.
Same task, blind judge panel.
K3 has won 7 of 8 arenas, including Refactoring 9-0 and Debugging 6-1.
Fable 5's only win: Speed.
Fable 5 went 142-36 against GPT 5.6 Sol and is now losing 2 to 1 to an open source model… pic.twitter.com/CaRSjbIwUW
— Bridgebench (@bridgebench) July 17, 2026
Kimi K3 is the best performing model on https://t.co/SnZ54Xok7n, ahead of Fable, reaching a comparable success rate in less time.
This is the first time that an open model is ahead of all proprietary ones for this comprehensive web engineering benchmark.
Notes:
▪️ Benchmarks… pic.twitter.com/2MqvbAxAaw
— Guillermo Rauch (@rauchg) July 16, 2026
如果你想了解它能做什麼,這是一個零樣本結果,提示模型構建一個 iOS 克隆。作為比較,這是社交媒體上使用 GPT 5.6 Sol 和更為精細的提示所分享的最佳近似結果。
K3 在專家混合架構中包含了 2.8 兆參數——這些數值儲存著模型的知識。專家混合將這些參數分成 896 個「專家」子網路,並且對於任何給定任務只會激活其中一小部分。這就是如何在不讓伺服器機房過熱的情況下獲得前沿水平的智慧。
Moonshot AI 表示:「它是世界上第一個 3 兆參數級別的開源模型,專為前沿智慧場景設計,包括長期編碼、知識工作和推理。」這並非行銷噱頭:DeepSeek 的 V4-Pro 最高只有 1.6 兆參數,Moonshot 自家的 K2 只有 1 兆參數。K3 在規模上大約是其最接近的開放權重競爭模型的兩倍。
它擁有百萬級代幣的上下文窗口(代幣是 AI 處理資訊的基本單位,大約四分之三個單詞)、原生的圖像和影片理解能力,以及持續推理功能。
兩種架構技術是效率提升的基礎。Kimi Delta Attention 加速了長序列的解碼,在百萬級代幣上下文下速度提高了 6.3 倍。Attention Residuals 選擇性地在模型層之間傳遞資訊,而不是均勻累積,這使得訓練效率提高了約 25%,而額外計算成本不到 2%——兩者共同使擴展效率比 K2 提高了約 2.5 倍。
Kimi K3 的價格是每百萬輸入代幣 3 美元,每百萬輸出代幣 15 美元——與 Anthropic 的中階模型 Claude Sonnet 5 的費率相同。不同之處在於,Sonnet 5 是 Anthropic 的中階產品;而 K3 在人工智慧分析綜合評分上僅比 Fable 5 低三分。在這九項基準測試套件中的每個任務上,K3 的運行成本為 0.94 美元,而 GPT-5.6 Sol 為 1.04 美元,Opus 4.8 則為 1.80 美元。
換句話說,這個模型以中階模型的價格提供了頂級的性能。
正如 Decrypt 在 5 月報導的,今年早些時候,中國和美國前沿 AI 之間的定價差距達到了 15-30 倍。K3 並沒有像 DeepSeek 那樣低價競爭——它的定價與西方中階模型相似——但在該級別提供了接近前沿的性能。對於透過 API 進行開發的團隊來說,這代表著成本的大幅降低。
如果 Anthropic 按照其計畫,僅透過 API 提供 Fable 5,那麼 K3 將成為業界目前排名第二的模型最接近的開放權重替代方案——而且每個任務的成本只有 Opus 4.8 的一半。這是基準追逐者們已經在計算的情境。
K3 的發布,是美國晶片出口管制倡導者們不願談論的論點。美國在 2023 年底限制了 Nvidia 的 H800 GPU 出口到中國;Moonshot 證實,他們早期的模型是在這些晶片上訓練的。K3 自己的基準測試文件提到了 H200 和該公司所稱的「來自其他供應商的通用圖形處理器(GPGPU)」——這被廣泛解讀為華為昇騰硬體——但未明確說明該硬體在哪裡。
根據 Silicon Republic 的報導,Moonshot AI 總裁張宇通今年在達沃斯直接闡述了這一限制:「我們知道我們沒有奢侈地簡單地擴大算力……這迫使我們專注於基礎研究和效率。」美國銀行分析師在發布後的報告中寫道,K3 證明「預訓練擴展,搭配架構創新,仍然可以為這些限制下的中國旗艦模型帶來質的飛躍」。
Moonshot 是所謂的 AI 領頭新創公司之一,這些公司在沒有華盛頓聲稱他們需要的晶片的情況下,共同改變了全球模型格局。這到底是支持更嚴格的出口管制,還是證明這些管制無效,是一個華盛頓尚未解決的政策問題。
K3 在 AA-Omniscience 上的幻覺率——衡量模型在不知道答案時自信地捏造答案的頻率的基準測試——與其前身 K2.6 相比,從 39% 上升到 51%。整體上正確答案更多了;捏造的答案也更多了。該模型在其自己的文件中也承認它可能「過於主動」,在長時間的自主任務中代表用戶做出意想不到的決定。
對於運行 Kimi K2.6 相關工具並希望升級的團隊來說,K3 在大多數方面都有顯著提升——但這個幻覺率差異值得在將其用於任何需要精確的事務之前進行壓力測試。
如果你想免費試用,可以。它可以在 Kimi 的官方網站上找到。但祝你好運:伺服器負載過高,任務由於流量限制而經常中斷,使其幾乎無法使用。更好的替代方案是付費訂閱或透過 API 使用它。
權重將於 7 月 27 日發布。這些權重將提供給大型企業和商業機構。目前,無論多大的國產 GPU 都無法處理如此體積的模型。