7月21日,谷歌在未提前預告的情況下,於Google AI Studio和Gemini模型選擇器中上線了兩款新模型:Gemini 3.6 Flash和Gemini 3.5 Flash-Lite。前者主打更強的程式碼生成與Agent(智慧體)能力,後者則聚焦更低成本的大規模呼叫。然而,備受期待的旗艦模型Gemini 3.5 Pro依然缺席,其原定6月釋出的計劃已明顯推遲。
Gemini 3.6 Flash:效率優先,而非智力升級
谷歌表示,Gemini 3.6 Flash在編碼、推理和工具呼叫方面較上一代Gemini 3.5 Flash有所提升,同時通過減少輸出token降低了執行成本。其定價為:輸入1.50美元/百萬token,輸出7.50美元/百萬token。相比Gemini 3.5 Flash(輸出9美元/百萬token),輸入成本不變,但輸出成本下降約17%。谷歌內部測試顯示,在完成同一任務時,Gemini 3.6 Flash的token消耗減少55.8%,任務評分從85分提升至100分。
在公開基準測試中,Gemini 3.6 Flash在程式碼評測DeepSWE上得分49%(上一代37%),在AI操作電腦能力測試OSWorld-Verified中得分83%(上一代78.4%),在機器學習任務測試MLE Bench中得分63.9%(上一代49.7%)。不過,與競爭對手如GPT-5.6 Luna、Grok 4.5和Claude Sonnet 5相比,Gemini 3.6 Flash並未全面領先,尤其在複雜軟體工程和知識工作任務上仍處劣勢。
第三方機構Artificial Analysis的釋出前測試顯示,Gemini 3.6 Flash在Intelligence Index上得分與Gemini 3.5 Flash持平(均為50分),但任務完成時間從約2.7分鐘降至1.3分鐘,速度提升近一倍。這表明新模型的升級方向是效率而非智力。
Gemini 3.5 Flash-Lite:更快,但成本未降
Gemini 3.5 Flash-Lite是Flash系列中更輕量的版本,犧牲部分能力上限換取更低成本和更快速度。其定價為:輸入0.30美元/百萬token,輸出2.50美元/百萬token,約為Gemini 3.6 Flash的1/5和1/3。但與上一代Gemini 3.1 Flash-Lite相比,單價並未下降。不過,其生成速度達到約350 token/秒,任務完成時間從約1.6分鐘降至0.6分鐘。
該模型內建Computer Use能力,可幫助Agent更可靠地操作電腦環境。在測試中,Gemini 3.5 Flash-Lite在程式設計Agent測試Terminal-Bench 2.1中得分從31%提升至54%,在長上下文理解測試GDM-MRCR v2中從60.1%提升至72.2%,在任務執行測試GDPval-AA v2中從642提升至1140。值得注意的是,其在部分Agent和程式碼測試中甚至超過了上一代更高定位的Gemini 3 Flash模型,例如在SWE-Bench Pro中得分54.2%(Gemini 3 Flash為49.6%),在OSWorld-Verified中得分74.0%(Gemini 3 Flash為65.1%)。
此外,谷歌還推出了面向網路安全場景的Gemini 3.5 Flash Cyber,該模型不公開提供,僅通過CodeMender平台向政府和可信合作伙伴開放。
Gemini 3.5 Pro:旗艦模型持續跳票
Gemini 3.5 Pro的延期已成為市場焦點。谷歌在5月I/O大會上表示該模型將在“接下來一個月左右”推出,即預計6月上線,但至今未釋出。據彭博社7月16日報道,其釋出時間已落後原計劃數月,谷歌正最佳化模型尤其是編碼表現。路透社最新報道稱,谷歌仍未公佈具體上線時間,僅表示正在與合作伙伴測試並將“很快”推出;另有訊息稱Gemini 4的訓練工作已開始。
市場關注的已不僅是模型釋出時間,更是谷歌能否保持旗艦模型的競爭節奏。隨著Agent進入企業工作流,程式碼能力成為衡量模型實際生產價值的關鍵指標。路透社指出,華爾街將Gemini 3.5 Pro視為判斷Google DeepMind能否跟上OpenAI和Anthropic的重要指標。
谷歌CEO Sundar Pichai近期多次強調成本優勢,稱企業將大部分AI工作負載遷移至Gemini模型可每年節省超10億美元。但分析認為,谷歌在旗艦模型延遲下推出兩款輕量模型,有填補空檔之嫌。與此同時,AI競爭格局正在變化,除海外“御三家”外,GLM-5.2、Kimi K3等國產模型也開始進入前沿競爭。
在Alphabet本週舉行的第二季度財報電話會議上,投資者很可能進一步追問Gemini 3.5 Pro的更多細節。