首頁LBank 新聞中心
Google 推出新款 Gemini Flash 模型,但 Pro 仍未亮相
google-new-gemini-flash-models-pro-still-missing
Google 推出新款 Gemini Flash 模型,但 Pro 仍未亮相
隨著 Gemini 3.5 Pro 在測試中陷入停滯,Google 發布了 3.6 Flash、3.5 Flash-Lite 以及一個受限的網路安全模型,並悄悄地預告了 Gemini 4。
2026-07-21 來源:decrypt.co

簡要

  • Google 今天推出了 Gemini 3.6 Flash 和 3.5 Flash-Lite,它們比 3.5 Flash 效率更高、成本更低——但承諾在 Google I/O 2026 於六月交付的 Gemini 3.5 Pro,由於內部編碼表現未達標,仍處於測試階段。
  • 3.6 Flash 的輸出 token 使用量比 3.5 Flash 少 17%,同時將輸出價格從每百萬 token 9 美元降至 7.50 美元,使大規模運行 AI 代理程式的成本更低。
  • Google 證實已開始 Gemini 4 的預訓練,並稱之為「我們迄今最雄心勃勃的預訓練運行」。

Google 今天推出了三款新的 AI 模型:Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber。這並非大多數人所預期的。

在 2026 年 5 月的 Google I/O 大會上發布 Gemini 3.5 Flash 並承諾一個月內推出 Pro 版本後,Google 悄悄錯過了其自身期限。據彭博社報導,Gemini 3.5 Pro 因未達到內部目標而延後,尤其是在編碼任務方面。六月下旬,嘗試透過更新訓練數據(模型學習的龐大數據集)來修復此問題,結果卻令人失望。Alphabet 股價因此下跌約 4.4%,單日市值蒸發估計 2000 億美元。

Google 上一款出貨的 Pro 級模型是 Gemini 3 的後繼者 Gemini 3.1 Pro,那是在二月。

Flash 系列是 Google 的速度最佳化模型系列——快速、具成本效益,專為 AI 代理程式設計,這些程式能半自主運作,處理文件管理、數據管道處理或瀏覽網頁等任務,無需人工逐步點擊。Pro 模型則是重型主力:速度較慢、價格較高,專為複雜推理而建構,其中原始算力比速度更重要。

各款 AI 模型的功能及目標受眾

Gemini 3.6 Flash 是主要發布版本。根據 Artificial Analysis Index 的數據,它比 3.5 Flash 少使用 17% 的輸出 token(token 是 AI 處理的基本單位,大約是四分之三個單詞)。它也更便宜:每百萬輸入 token 1.50 美元,每百萬輸出 token 7.50 美元,相比 3.5 Flash 的輸出價格 9 美元有所下降。對於大規模運行代理程式的企業來說,這種差異會迅速累積。

在基準測試(根據正確完成任務的百分比來評分 AI 的標準化測試)中,3.6 Flash 在 DeepSWE v1.1 上達到 49%,該測試評估長週期軟體工程,例如建構和除錯完整的程式碼庫,而 3.5 Flash 則為 37%。在機器學習工程測試 MLE-Bench 上,它獲得 63.9%,而 3.5 Flash 為 49.7%。它在 OSWorld-Verified(AI 控制電腦螢幕以完成實際任務的測試)中以 83.0% 的分數位居榜首,領先於 Claude Sonnet 5 (81.2%) 和 GPT-5.6 Luna (72.6%)。

同類競爭者在其他方面仍領先:GPT-5.6 Luna 在 DeepSWE 上得分 67%,在測試代理終端編碼的 Terminal-Bench 2.1 上得分 84.7%。Claude Sonnet 5 在 GDPval-AA v2 上的知識工作表現位居榜首,得分 1607(這項基準測試採用類似西洋棋的 Elo 等級評分系統,數字越高表示實際任務表現越好),而 3.6 Flash 則為 1421。

我們嘗試使用該模型進行編碼,結果卻… 至少可以說,表現令人失望。
我們的簡單編碼測試最終得到了一個無法使用的檔案。HTML 格式不正確,元素也未正確渲染。隨後嘗試以直覺方式編碼來解決這些問題,但並未成功。

我們請 Deepseek 將第一個模型轉化為可玩的版本,只需修復錯誤即可。它找出了 11 個錯誤並實施了 8 項關鍵修復,從而產生了一個不錯的遊戲。

Deepseek 的微調修復了遊戲,這意味著 Gemini 的核心思維是正確的,但細節和不準確之處使其結果變得無用。如果您打算將該模型用於此目的,請準備好進行長時間的直覺編碼,因為它是一個廉價但表現不佳的模型。

Google 發布的第二個模型 Gemini 3.5 Flash-Lite 純粹為處理大量數據而設計:每秒 350 個輸出 token,輸入價格為每百萬 0.30 美元,輸出價格為每百萬 2.50 美元。它針對高吞吐量管道,例如大規模文件處理或代理搜尋系統,並且在關鍵編碼任務(包括 Terminal-Bench 2.1,得分 54% 對於舊版 3 Flash 的 31%)上表現優於舊版 3 Flash,儘管其價格顯著更便宜。

對於那些依賴 Hermes 和 Openclaw 的用戶來說,它也可能是一個出色的會話壓縮器(分析長時間會話並提取關鍵要素,使你的代理程式不會被雜訊淹沒)。

第三個模型 Gemini 3.5 Flash Cyber 將不會公開提供。Google 將其限制於需要查找和修復軟體漏洞的政府和經審查的合作夥伴使用——這是一種 Google 不願廣泛發布的雙重用途能力。

同時,Google 的 DeepMind 團隊已在推進。Google 在官方公告中證實,它已開始「迄今最雄心勃勃的 Gemini 4 預訓練運行」,而且該團隊已在大肆宣傳。

預訓練是模型在任務特定微調開始之前從龐大數據集學習的基礎階段——這意味著 Gemini 4 正在建造中,而非僅僅規劃。

We have started our most ambitious pre-training run yet, for Gemini 4, and are excited by the progress : )

— Logan Kilpatrick (@OfficialLoganK) July 21, 2026

3.6 Flash 和 3.5 Flash-Lite 今天都已在 Gemini 應用程式、Google AI Studio 和透過 API 上線。Google 表示,Gemini 3.5 Pro 將「一旦準備好」即發布,無論那是什麼時候。