首頁LBank 新聞中心
隆重推出 Bonsai:首個可在手機上運行的 27B AI 模型
meet-bonsai-first-27b-ai-model-fits-phone
隆重推出 Bonsai:首個可在手機上運行的 27B AI 模型
PrismML 的 Bonsai 27B 可以在 iPhone 上免費運行全功能推理 AI。我們實測後,其表現確實如其所言般令人驚艷。
2026-07-15 來源:decrypt.co

簡報

  • PrismML 的 Bonsai 27B 是一款具有 270 億參數的 AI 模型,壓縮至 3.9 GB—體積小巧,足以在 iPhone 17 Pro Max 上以每秒 11 個 token 的速度運行,這是此能力等級的模型首次能滿足智慧型手機的記憶體預算。
  • 其三元變體保留了全精度基準測試效能的 94.6%,優於傳統的「2 位元」Qwen 模型,後者體積幾乎是其兩倍,且在 4 位元以下進行數學和編碼任務時會崩潰。
  • 據 CNBC 報導,Apple 正在與 PrismML 就其底層壓縮技術進行早期談判,該公司接下來的目標是推出壓縮後的 Gemma 模型。

AI 模型會佔用大量記憶體。一個擁有 270 億參數的 AI 模型,依產業標準而言被視為中等規模,若以半精度運行,大約需要 54 GB 的記憶體。大多數筆記型電腦無法應付,有些桌上型電腦也辦不到。

本週稍早,PrismML 發表了一款僅 3.9 GB 的模型—體積小到足以安裝在 iPhone 上。

參數是模型可以處理的「旋鈕和調整」數量。參數越多,模型就越密集、能力越強。

Bonsai 27B 是首個突破消費級智慧型手機記憶體上限的 27B 級模型,可以在 iPhone 17 Pro Max 上以每秒 11 個 token 的速度運行。(Token 是 AI 模型可以處理和產生的基本資訊單位。) 其三元變體為 5.9 GB,在 M5 Pro 筆記型電腦上達到每秒約 26 個 token。兩者均在 Apache 2.0 許可下免費提供。

這種壓縮方法基於加州理工學院的智慧財產權,將每個模型權重從 16 位元的浮點精度縮減為單一符號—在二進制版本中是 +1 或 -1,在三元版本中則是三種值之一。每組 128 個權重共享一個 16 位元的縮放因子,使得二進制變體每個權重為 1.125 位元:比全精度原始模型小 14 倍。三元模型則增加了一個零狀態以提供略微更強的表現力,並穩定在 1.71 位元。

簡單來說,這表示一個三元 AI 模型對每個內部數值只使用三種設定—負數、零或正數—而標準 AI 則可以從大約 65,000 種設定中選擇。

PrismML 做到這一點,同時沒有損失太多輸出品質。

與傳統的「低位元」模型不同之處在於,它沒有任何高精度逃逸通道:嵌入層、注意力機制和完整的語言模型頭部都被端到端地壓縮。大多數量化模型會將某些敏感層保持在全精度,這最終會以犧牲品質為代價增加其體積。Bonsai 不玩這種遊戲。

這是該系列中的第二次重大發布。今年三月,PrismML 發布了 Bonsai 8B,一個 1.15 GB 的模型,證明了 1 位元架構可以在 80 億參數的規模下存活,而其推理能力不會崩潰。躍升至 270 億參數的規模則改變了情況—在這個規模下,持續的思維鏈推理、可靠的工具使用以及多步驟代理行為才能真正穩定地出現—而這些都是較小型模型仍會失誤的地方。

基準測試

在 NVIDIA H100 GPU 上以思維模式評估的 15 個基準測試中—涵蓋知識、數學、編碼和工具使用—三元 Bonsai 27B 平均得分為 80.49,或全精度模型的 94.6%。1 位元變體則達到 76.11。

總體而言,在基準測試中,這些模型在其體積所提供的潛力方面,表現遠優於 Gemma 4 或 Qwen 3.6。

這些模型就其提供的功能而言表現相當出色,考量到所需的資源極少,它們將小型硬體 (智慧型手機和較低階的 PC) 的功能提升到了另一個層次。在針對美國邀請數學考試建模的 AIME25 和 AIME26 中,三元 Bonsai 27B 取得 93.7% 的分數,而更大的 Qwen 3.6B 則為 95.3%。Bonsai 在編碼方面得分 86,Qwen 3.6 為 88;在一般知識方面得分 77%,Qwen 3.6 為 83%。

該模型還採用了混合注意力主幹,其中約 75% 的層是線性注意力而非完整的二次注意力。這種架構使得在裝置上實現 262K-token 的上下文視窗成為可能—而標準注意力堆疊在手機硬體上將會昂貴得令人望而卻步。

我們測試了它

我們親自運行了 Bonsai 27B。編碼需要疊代:單次提示無法與雲端前沿模型競爭。但由於它在本地且免費,這點變得無關緊要。對於我們的《殭屍打字》遊戲—一款第一人稱打字恐怖瀏覽器遊戲—兩輪符合情境的編碼產生了清晰的碰撞檢測、適當的計分邏輯以及保持一致的圖形。該模型早期就能掌握結構;第二遍的目的是精煉而非重建。

有趣的是,一些模型(例如骨架)看起來比 GPT 5.6 Sol 的更精緻。這絕不代表它更好,只是在此任務中,它產生了一個可愛的骨架,而 AI 之王則做出了較差的風格選擇。

該遊戲可在此處進行測試。

創意寫作則是一個更具資格的故事,其標準也更為主觀。

大體而言,如果你心中只有一個零樣本提示,結果並不會特別富有想像力。

話雖如此,Bonsai 產生的故事具有一致的內部邏輯、節奏和情節弧線—與 Claude Haiku 甚至 Sonnet 在相似提示下投入較少精力時相比,表現更好或不相上下。對於一個完全在您自己的硬體上運行且無 API 成本的模型來說,這點非常值得一提。

它所創作的故事可在我們的 Github 儲存庫中找到。

PrismML 還與模型一同發布了 DSpark 推測解碼層—這是一個輕量級的草稿生成器,用於提出候選 token 區塊,主模型透過單次前向傳播進行驗證,而非逐個 token 生成。在 H100 上,這可帶來 1.37 倍的吞吐量提升,且輸出品質不變,因為驗證保留了精確的輸出分佈。在 Apple Silicon 上尚未預設啟用,但對於 GPU 服務而言,這是一個實實在在的提升。

Apple 的興趣增加了商業層面。PrismML 執行長 Babak Hassibi 向 CNBC 證實,該公司正在與 Apple 進行早期談判,Apple 正在評估其壓縮技術在裝置端使用的潛力。

Hassibi 表示,下一個開發中的目標是壓縮後的 Gemma 模型,隨後是更大的前沿模型;1 位元 Bonsai 27B 現已可在 Apache 2.0 許可下免費下載。如果您需要了解如何在本地運行此類模型,請查閱我們的指南。