7月21日,谷歌在未提前预告的情况下,于Google AI Studio和Gemini模型选择器中上线了两款新模型:Gemini 3.6 Flash和Gemini 3.5 Flash-Lite。前者主打更强的代码生成与Agent(智能体)能力,后者则聚焦更低成本的大规模调用。然而,备受期待的旗舰模型Gemini 3.5 Pro依然缺席,其原定6月发布的计划已明显推迟。
Gemini 3.6 Flash:效率优先,而非智力升级
谷歌表示,Gemini 3.6 Flash在编码、推理和工具调用方面较上一代Gemini 3.5 Flash有所提升,同时通过减少输出token降低了运行成本。其定价为:输入1.50美元/百万token,输出7.50美元/百万token。相比Gemini 3.5 Flash(输出9美元/百万token),输入成本不变,但输出成本下降约17%。谷歌内部测试显示,在完成同一任务时,Gemini 3.6 Flash的token消耗减少55.8%,任务评分从85分提升至100分。
在公开基准测试中,Gemini 3.6 Flash在代码评测DeepSWE上得分49%(上一代37%),在AI操作电脑能力测试OSWorld-Verified中得分83%(上一代78.4%),在机器学习任务测试MLE Bench中得分63.9%(上一代49.7%)。不过,与竞争对手如GPT-5.6 Luna、Grok 4.5和Claude Sonnet 5相比,Gemini 3.6 Flash并未全面领先,尤其在复杂软件工程和知识工作任务上仍处劣势。
第三方机构Artificial Analysis的发布前测试显示,Gemini 3.6 Flash在Intelligence Index上得分与Gemini 3.5 Flash持平(均为50分),但任务完成时间从约2.7分钟降至1.3分钟,速度提升近一倍。这表明新模型的升级方向是效率而非智力。
Gemini 3.5 Flash-Lite:更快,但成本未降
Gemini 3.5 Flash-Lite是Flash系列中更轻量的版本,牺牲部分能力上限换取更低成本和更快速度。其定价为:输入0.30美元/百万token,输出2.50美元/百万token,约为Gemini 3.6 Flash的1/5和1/3。但与上一代Gemini 3.1 Flash-Lite相比,单价并未下降。不过,其生成速度达到约350 token/秒,任务完成时间从约1.6分钟降至0.6分钟。
该模型内置Computer Use能力,可帮助Agent更可靠地操作电脑环境。在测试中,Gemini 3.5 Flash-Lite在编程Agent测试Terminal-Bench 2.1中得分从31%提升至54%,在长上下文理解测试GDM-MRCR v2中从60.1%提升至72.2%,在任务执行测试GDPval-AA v2中从642提升至1140。值得注意的是,其在部分Agent和代码测试中甚至超过了上一代更高定位的Gemini 3 Flash模型,例如在SWE-Bench Pro中得分54.2%(Gemini 3 Flash为49.6%),在OSWorld-Verified中得分74.0%(Gemini 3 Flash为65.1%)。
此外,谷歌还推出了面向网络安全场景的Gemini 3.5 Flash Cyber,该模型不公开提供,仅通过CodeMender平台向政府和可信合作伙伴开放。
Gemini 3.5 Pro:旗舰模型持续跳票
Gemini 3.5 Pro的延期已成为市场焦点。谷歌在5月I/O大会上表示该模型将在“接下来一个月左右”推出,即预计6月上线,但至今未发布。据彭博社7月16日报道,其发布时间已落后原计划数月,谷歌正优化模型尤其是编码表现。路透社最新报道称,谷歌仍未公布具体上线时间,仅表示正在与合作伙伴测试并将“很快”推出;另有消息称Gemini 4的训练工作已开始。
市场关注的已不仅是模型发布时间,更是谷歌能否保持旗舰模型的竞争节奏。随着Agent进入企业工作流,代码能力成为衡量模型实际生产价值的关键指标。路透社指出,华尔街将Gemini 3.5 Pro视为判断Google DeepMind能否跟上OpenAI和Anthropic的重要指标。
谷歌CEO Sundar Pichai近期多次强调成本优势,称企业将大部分AI工作负载迁移至Gemini模型可每年节省超10亿美元。但分析认为,谷歌在旗舰模型延迟下推出两款轻量模型,有填补空档之嫌。与此同时,AI竞争格局正在变化,除海外“御三家”外,GLM-5.2、Kimi K3等国产模型也开始进入前沿竞争。
在Alphabet本周举行的第二季度财报电话会议上,投资者很可能进一步追问Gemini 3.5 Pro的更多细节。