首頁LBank 新聞中心
蜜拉·穆拉提離開OpenAI後發表首個AI模型——且完全開源
mira-murati-inkling-ai-model-openai-open-source
蜜拉·穆拉提離開OpenAI後發表首個AI模型——且完全開源
Mira Murati 的 Inkling 無法撼動最頂尖的中國開源模型,但它為西方開發者提供了他們迄今未曾擁有的東西。
2026-07-16 來源:decrypt.co

簡要速覽

  • Thinking Machines Lab於7月15日發布了Inkling——一個從零開始訓練的9,750億參數多模態AI模型,全部權重已在Hugging Face上以Apache 2.0許可證發布。
  • Inkling在MCP Atlas上取得74.1%的成績,比Nvidia的Nemotron 3 Ultra高出近30個百分點,使其成為在代理工具使用方面表現最佳的西方開源權重模型。中國模型GLM 5.2和Kimi K2.6在多個關鍵基準測試中仍處於領先地位。
  • Thinking Machines於2025年7月以120億美元估值籌集了20億美元,據報導,在2025年11月曾尋求500億美元的募資,但這些談判在2026年1月破裂。

Mira Murati於2024年9月離開OpenAI,自行創業。近兩年後,這項探索成果問世。她創立的Thinking Machines Lab發布了Inkling——一個完全從零開始訓練的多模態AI模型,所有權重均可免費下載。

2023年11月,當OpenAI董事會解雇Sam Altman時,當時擔任CTO的Murati被任命為臨時執行長。五天後,Altman復職,Murati重回CTO職位,大約10個月後永久離職。她於2025年2月創立了Thinking Machines Lab。

隨後,這家公司變得低調——但也財富豐厚。它於2025年7月以120億美元估值籌集了20億美元,由Andreessen Horowitz領投,Nvidia、Accel、ServiceNow、Cisco、AMD和Jane Street參與其中——這在當時是矽谷歷史上規模最大的種子輪融資之一。

2025年11月的報導稱,該公司正尋求以500億美元估值進行新一輪融資。這些談判在2026年1月破裂。

Inkling是什麼

Inkling是一種專家混合模型(mixture-of-experts model)——一種在任何給定輸入下,只有部分網路會被激活的架構,這能在不犧牲深度情況下保持推理速度。這是一個非常龐大的模型:它擁有9,750億個總參數(定義模型如何處理資訊的內部設定),每個任務有410億個活躍參數,因此別想在您的本機電腦上運行它。

作為一個多模態模型,它接受文本、圖像和音訊輸入,並支援一個100萬個token的上下文視窗(模型可以一次性推理的文本量),約75萬字。它在包含文本、圖像、音訊和影片的45兆個token上進行了預訓練。

Murati在X上寫道:「我們的第一個模型,Inkling。從零開始訓練,權重已開源,今天可在Tinker上進行微調。」它從零開始訓練這一事實意義重大,尤其是在開源社區中,因為這可以為那些對中國持謹慎態度、但又因西方頂級AI公司主要專注於推出閉源模型而不得不使用亞洲模型的西方開發者帶來一股清新的空氣。

微調(Fine-tuning)是在特定資料集上重新訓練現有模型以提高其在特定任務上性能的過程。Tinker是Thinking Machines圍繞此用例構建的雲平台。全部權重也已在Hugging Face上以Apache 2.0許可證發布,無任何限制。

Inkling最顯著的優勢體現在代理任務中。在MCP Atlas測試中——該測試衡量AI代理使用模型上下文協議(Model Context Protocol,連接AI助理與外部工具和服務的開放標準)完成真實世界任務的可靠性,以完成任務的百分比計分——Inkling達到了74.1%。這比Nvidia的Nemotron 3 Ultra高出近30個百分點,後者是本次比較中主要的西方開源權重競爭對手。

在SWE-Bench Verified測試中——該測試衡量AI代理能否自主修復GitHub上真實軟體錯誤,以解決問題的百分比計分——Inkling取得了77.6%的成績,也高於Nemotron的70.7%。

總體而言,Thinking Machines將此模型定位為「全面型」和通用型。這意味著它不會因為其能力專注於某個領域(例如有些模型擅長編碼,卻不擅長創意寫作)而犧牲其他特定任務的品質。

Inkling benmchmark results vs other AI models. Source: Thinking Machines
來源:Thinking Machines

中國模型在多個方面仍佔優勢。Z.ai的GLM 5.2在Terminal Bench 2.1測試中(衡量AI自主編碼代理在真實終端環境中完成任務的基準測試,以完成任務的百分比計分)取得了82.7%的成績,而Inkling為63.8%。Kimi K2.6在人類終極考試(Humanity's Last Exam,一項博士級科學推理測試)中表現領先。

Thinking Machines承認這一點。Inkling並非當今市面上最強大的模型,無論是開源還是閉源。

然而,它是西方實驗室開發出的最能幹的開源權重模型。對於那些因法律、安全或合規原因而不願將工作負載導向北京構建的模型之開發者來說,現在有了一個真正的替代方案,無需自行託管中國模型。

現在,這些開發者擁有了一個模型,它(儘管在幾乎所有方面都遜於最佳中國模型)卻更符合他們的理念、期望和價值觀。隨後的微調可以使該模型在特定任務上表現出色,讓這些微調後的模型在基準測試中與亞洲模型競爭。

在FORTRESS對抗性測試中(該測試衡量模型在拒絕真正有害提示的同時,不會過度阻擋合法提示的一致性,以正確處理的百分比計分),Inkling獲得了78.0%的成績,是本次比較中所有開源權重模型中的最高分。

除了Inkling,Thinking Machines還預覽了Inkling-Small:總參數2,760億,活躍參數120億,在大多數推理基準測試中已與大型模型持平。其權重將在測試完成後發布,但未給出具體時間表。