网易首页 > 网易号 > 正文 申请入驻

Gemini 3.5 Pro难产,谷歌先交了两张草稿纸

0
分享至

7月21日,谷歌突然上线了两个新模型:

Gemini 3.6 FlashGemini 3.5 Flash-Lite

没有一点点防备,也没有一丝顾虑,它俩就这样出现在了Google AI Studio和Gemini的模型选择器里。



这两个模型,一个主打更强的代码和Agent能力,一个主打更低成本的大规模调用。

而作为旗舰模型的Gemini 3.5Pro,千呼万唤依然……出不来。

按照此前的计划,3.5 Pro本应在6月份上线,现在7月都过一大半了,这款被寄予厚望的模型仍然没有正式亮相。

代表旗舰实力的答卷迟迟不交,谷歌先拿出两张“草稿纸”,是个什么意思?

01

3.6 Flash:比上一代便宜,不比上一代聪明

谷歌表示,相比上一代Flash模型,Gemini 3.6 Flash进一步提升了编码、推理和工具调用表现,同时通过减少输出token降低运行成本。



Gemini 3.6 Flash的定位是一个面向真实生产环境的高效模型,或者更直白一点,为Agent服务。

在Agent时代,一次任务可能需要几十轮模型调用,这意味着模型不仅要聪明,还必须足够快、足够便宜。

Google此前已经在Gemini 3.5 Flash上强化了这条路线。根据官方API文档,Gemini 3.5 Flash支持100万token的长上下文,可以一次处理大量信息,同时支持代码执行、调用外部工具、搜索文件等能力,能够完成更复杂、更长时间的任务。

Gemini 3.6 Flash延续了这条路线,它追求的并不是单次回答的质量,是一个“能够承担得起每日真实工作”的位置。

Gemini 3.6 Flash的定价如下:

输入:1.50 美元/百万 token

输出:7.50 美元/百万 token

相比此前Gemini 3.5 Flash每百万token输入1.5美元、输出9美元的价格,输入成本没有变化,但输出成本进一步下降。

对于需要大量调用AI的企业来说,这种成本变化可能比benchmark上的几个百分点提升更加重要。

另外,谷歌展示的一项内部测试显示,在完成同一任务时,Gemini 3.6 Flash相比3.5 Flash减少了55.8%的token消耗,同时将任务评分从85分提升到了100分。

当然,这只是谷歌自己的测试结果,只能说明Google希望展示的方向:

新模型不仅更省,而且能够用更少的计算完成同样甚至更好的任务。



在那些被公开的benchmark里,谷歌主要强调的是代码能力和Agent能力。

在DeepSWE代码评测中,Gemini 3.6 Flash得分49%,高于上一代的37%。谷歌表示,新模型能够减少无效代码修改和重复执行过程。

在测试AI操作电脑能力的OSWorld-Verified评测中,Gemini 3.6 Flash得分83%,超过3.5 Flash的78.4%。

而在面向机器学习任务的MLE Bench中,Gemini 3.6 Flash得分63.9%,相比上一代的49.7%也有明显提升。



不过,上述数据更多说明Gemini 3.6 Flash相比上一代有所进步。

如果放到当前大模型竞争中横向比较,Google选择的对手是GPT-5.6 Luna、Grok 4.5和Claude Sonnet 5(这里也可以看出这个产品的定位)。

从结果来看,Gemini 3.6 Flash并没有全面领先,GPT和Claude的模型在复杂软件工程和知识工作任务上仍然保持优势。

但这其实也是Flash系列存在的意义:

它不一定要成为最强模型,只需要在明显低于旗舰模型成本的情况下,提供够用的能力。



官方测评之外,根据Artificial Analysis的发布前测试,Gemini 3.6 Flash在Intelligence Index上拿到了50分,与Gemini 3.5 Flash持平。

这意味着,如果只看模型综合“智力”,Gemini 3.6 Flash并没有什么升级。



但是呢,它的速度又很好地弥补了这一点。

Artificial Analysis还统计了模型完成Intelligence Index任务所需的平均时间。结果显示,Gemini 3.6 Flash每项任务平均耗时约1.3分钟,相比上一代3.5 Flash的约2.7分钟,减少了一半。

与此同时,Gemini 3.5 Flash-Lite的任务完成时间也从上一代3.1 Flash-Lite的约1.6分钟,下降到约0.6分钟。



总的来说,Gemini 3.6 Flash的升级方向其实是效率——更少的token消耗,更低的运行成本,以及更适合长期运行的Agent能力。

对于习惯使用Gemini 3.5 Flash的用户来说,确实是非常不错的升级。

02

3.5 Flash-Lite:更快,但没有上一代便宜

然后再来看另一个模型Gemini 3.5 Flash-Lite。

顾名思义,Flash-Lite是Flash系列中更轻量的版本,相比Flash,它牺牲了一部分能力上限,换取了更低的成本和更快的速度。



就像前面提到的那样,Gemini 3.5 Flash-Lite的任务完成时间从上一代3.1 Flash-Lite的约1.6分钟,下降到了约0.6分钟。

3.5 Flash-Lite也是3.5系列中速度最快的型号,根据Artificial Analysis测试数据,其生成速度达到约350 token/秒,已经属于当前主流大模型中的高速水平。

Gemini 3.5 Flash-Lite的定价如下:

输入:0.30 美元/百万 token

输出:2.50 美元/百万 token

相比Gemini 3.6 Flash,输入价格约为1/5,输出价格约为1/3。不过,与上一代Gemini 3.1 Flash-Lite相比,新模型并没有进一步降价。

虽然Gemini 3.5 Flash-Lite由于能力提升,可以通过减少输出量降低部分成本,但综合起来,还是很难抵消单价上的成本增加。

根据官方文档,相比上一代Gemini 3.1 Flash-Lite,新模型在不同思考等级(thinking levels)下都有明显提升。开发者可以根据任务需求调整模型的思考深度。

此外,Gemini 3.5 Flash-Lite还内置了Computer Use能力,可以帮助Agent更可靠地操作电脑环境,完成跨应用任务。

在具体测试中,Gemini 3.5 Flash-Lite相比上一代模型也有明显提升:在Terminal-Bench 2.1编程Agent测试中,成绩从31%提升到54%;在测试长上下文理解能力的GDM-MRCR v2中,从60.1%提升到72.2%;在更贴近真实工作场景的GDPval-AA v2任务执行测试中,从642提升到1140。



值得注意的是,在一些Agent和代码相关测试中,Gemini 3.5 Flash-Lite甚至超过了上一代更高定位的Gemini 3 Flash模型。

例如,在SWE-Bench Pro软件工程测试中,Gemini 3.5 Flash-Lite得分54.2%,高于Gemini 3 Flash的49.6%;在测试AI操作电脑能力的OSWorld-Verified中,Gemini 3.5 Flash-Lite也以74.0%的成绩超过Gemini 3 Flash的65.1%。

这意味着,随着模型能力不断提升,过去需要更大模型才能完成的部分Agent任务,正在逐渐下沉到更便宜、更快速的模型。



顺便一提,除了前两个面向普通用户的通用模型,谷歌还推出了Gemini 3.5 Flash Cyber

它主要针对网络安全场景。根据官方文档,在CodeMender系统中,多个Gemini 3.5 Flash Cyber Agent可以协同工作,分别完成不同分析任务,并最终汇总成一份完整报告。在网络安全基准测试CyberGym中,Flash Cyber也达到了接近前沿模型的表现。



该模型目前不会公开提供,仅通过CodeMender平台向政府和可信合作伙伴开放。

03

3.5 Pro:谷歌迟迟交不出的旗舰答卷

如果说Gemini 3.6 Flash和Gemini 3.5 Flash-Lite还可以看作是谷歌对AI规模化应用的判断,那么Gemini 3.5 Pro则代表着谷歌的模型上限。

但问题在于:这份答卷,到现在还没有交出来。

5月I/O的时候,谷歌表示Gemini 3.5 Pro将在“接下来一个月左右”推出,也就是预计在今年6月上线。现在7月都过了一大半了。

据彭博社7月16日报道,Gemini 3.5 Pro的发布时间已经落后原计划数月。谷歌正在继续优化模型能力,尤其是编码表现,希望达到内部设定的目标。

路透社最新的报道则显示,截至目前,谷歌仍未公布具体上线时间,只表示该模型正在与合作伙伴测试,并将“很快”推出;另有新闻稿透露,Gemini 4的训练工作已经开始了。

而我们都知道,“很快”就是不确定的意思。



Gemini 1.0发布时就曾因演示争议受到质疑;Gemini 1.5 Pro凭借百万token上下文短暂扳回局面,但随后Claude和GPT系列快速追赶;直到Gemini 3系列发布,谷歌才重新获得“回到前沿竞争”的评价。

如今Gemini 3.5 Pro再次延期,市场关注的已经不只是一个模型什么时候上线,还有谷歌到底能否保持旗舰模型的竞争节奏问题。

何况谷歌透露出的编码表现不及预期,并不是什么容易解决的小问题。

随着Agent开始进入企业工作流,代码能力的重要性迅速提升。一个模型能否理解复杂项目、修改真实代码、完成多步骤开发任务,已经成为衡量它是否具备实际生产价值的重要指标。

路透社指出,华尔街正在等待Gemini 3.5 Pro,因为它将成为判断Google DeepMind是否能够跟上OpenAI和Anthropic的重要指标。

当然,谷歌并不是没有动作,这次推出的几个模型,恰说明谷歌正在强化另一条路线:让AI变得更便宜、更容易规模化。

谷歌CEO Sundar Pichai近期也多次强调成本优势,并表示企业如果将大部分AI工作负载迁移到Gemini模型,可以每年节省超过10亿美元。

但问题在于,市场在期待一份证明谷歌模型实力的“答卷”,谷歌交出的却是两张关于效率和成本的“草稿纸”——很难不让人觉得,谷歌在用Flash系列填补Pro延迟留下的空档。

有意思的是,在Gemini 3.5 Pro延期的同时,AI竞争格局正在发生变化。

过去,人们讨论AI领先者,主要关注海外“御三家”:OpenAI、Anthropic和Google DeepMind。

但最近,GLM-5.2、Kimi K3等国产模型也开始进入前沿竞争,并引发了大量讨论。

前沿模型的追赶速度正在加快,也让谷歌的问题变得更加紧迫,它当然可以继续大力推出Flash模型,但前提是它的旗舰模型足够给力——只要硬实力足够,自有大儒为他辩经。

如果谷歌最终推出一个真正领先的旗舰模型,那么Flash路线会成为完整体系的一部分:Pro负责突破能力上限;Flash负责规模化应用。

但如果Gemini 3.5 Pro持续落后,市场很可能会继续追问:谷歌拥有最强AI研究资源,为什么却无法稳定跑赢竞争对手?

在Alphabet本周举行第二季度财报电话会议时,人们很可能会进一步询问有关Gemini 3.5 Pro的更多细节。(作者:袁心玥)

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
癌症疫苗全面爆发!多项重磅数据公布:92%患者持续缓解无复发,高危人群成功“拦截”癌变

癌症疫苗全面爆发!多项重磅数据公布:92%患者持续缓解无复发,高危人群成功“拦截”癌变

康和源免疫之家
2026-07-22 09:31:57
烈士吴石夫人王碧奎晚年坦言:宁可在台湾漂泊三十年,也绝不回大陆,移居美国后还坚持和大陆子女断联

烈士吴石夫人王碧奎晚年坦言:宁可在台湾漂泊三十年,也绝不回大陆,移居美国后还坚持和大陆子女断联

磊子讲史
2026-07-20 10:36:50
破案了!山西队不对迪亚洛行使优先续约权,原因揭晓

破案了!山西队不对迪亚洛行使优先续约权,原因揭晓

体育哲人
2026-07-22 13:18:45
华为员工:我的人生很失败,赚了1000多万,买房赔了;孩子成绩全班倒数;媳妇每天不停的抱怨……

华为员工:我的人生很失败,赚了1000多万,买房赔了;孩子成绩全班倒数;媳妇每天不停的抱怨……

LULU生活家
2026-07-21 21:01:36
重磅交易方案曝光!火箭诚意报价欧文,双筹码+双首轮打造冲冠阵容

重磅交易方案曝光!火箭诚意报价欧文,双筹码+双首轮打造冲冠阵容

体育见习官
2026-07-22 12:07:27
长沙曾琦医生入职浙大四院,担任专科专家,引发争议!网友:曾医生也算是因祸得福,看中她的“知名度”

长沙曾琦医生入职浙大四院,担任专科专家,引发争议!网友:曾医生也算是因祸得福,看中她的“知名度”

火山詩话
2026-07-22 08:09:06
破17.8亿!3天就超《功夫女足》夺全球冠军,北美又出了一部爆款

破17.8亿!3天就超《功夫女足》夺全球冠军,北美又出了一部爆款

靠谱电影君
2026-07-21 08:20:24
三胎生父被曝?张柏芝案终于判了,给大儿子提车,谢霆锋沉默了

三胎生父被曝?张柏芝案终于判了,给大儿子提车,谢霆锋沉默了

胖猫喵喵
2026-06-23 12:15:14
没发生性关系也必须辞职!新加坡总理铁腕清洗内阁,严查操守

没发生性关系也必须辞职!新加坡总理铁腕清洗内阁,严查操守

明天后天大后天
2026-07-21 15:43:58
胡彦斌:身家过亿但感情路上多歧途,母亲一句话道出他最痛的秘密

胡彦斌:身家过亿但感情路上多歧途,母亲一句话道出他最痛的秘密

品茗赏娱
2026-07-22 10:05:16
泰国,为什么有一条长长的“尾巴”,直抵马来西亚

泰国,为什么有一条长长的“尾巴”,直抵马来西亚

清沐执笔
2026-07-21 18:55:33
谢贤被爆离世仅一天,谢霆锋惊现两大“噩耗”,彻底撕碎王菲体面

谢贤被爆离世仅一天,谢霆锋惊现两大“噩耗”,彻底撕碎王菲体面

汪巗的创业之路
2026-07-22 09:40:59
大反转!詹姆斯临时更改生涯决定,联盟多方施压催促尽快落位

大反转!詹姆斯临时更改生涯决定,联盟多方施压催促尽快落位

体育见习官
2026-07-22 10:07:28
美媒评今夏最离谱的5笔操作:开拓者交易莫兰特第三,榜首无争议

美媒评今夏最离谱的5笔操作:开拓者交易莫兰特第三,榜首无争议

你的篮球频道
2026-07-22 10:39:14
上海市委军民融合办原常务副主任彭崧被“双开”

上海市委军民融合办原常务副主任彭崧被“双开”

界面新闻
2026-07-21 18:01:43
无缘大满贯!足协杯爆冷:中超第1被淘汰,韦世豪被护送回替补席

无缘大满贯!足协杯爆冷:中超第1被淘汰,韦世豪被护送回替补席

足球大腕
2026-07-21 23:38:47
曝詹姆斯本月27日宣布加盟热火,这是声东击西还是故弄玄虚

曝詹姆斯本月27日宣布加盟热火,这是声东击西还是故弄玄虚

姜大叔侃球
2026-07-22 13:03:30
300 万赎金仍撕票,刘某文潜逃两年终归案

300 万赎金仍撕票,刘某文潜逃两年终归案

慕容律师
2026-07-21 15:49:27
CBA最新消息!辽宁旧将加盟北京首钢,青岛男篮签约超级外援

CBA最新消息!辽宁旧将加盟北京首钢,青岛男篮签约超级外援

体坛瞎白话
2026-07-22 10:31:57
德拉帕蒂是谁,为何俄罗斯军事博主对他出任乌军总司令愤怒?

德拉帕蒂是谁,为何俄罗斯军事博主对他出任乌军总司令愤怒?

山河路口
2026-07-22 12:33:55
2026-07-22 14:11:00
字母榜 incentive-icons
字母榜
让未来不止于大。
2630文章数 8076关注度
往期回顾 全部

数码要闻

终于看到降价希望了!机构预测NAND闪存供应2027下半年改善

头条要闻

男子拍台球女助教屁股被报警猥亵:我"预告"过很多次

头条要闻

男子拍台球女助教屁股被报警猥亵:我"预告"过很多次

体育要闻

“不会进球”的前锋,在世界杯决赛进球了

娱乐要闻

谢贤离世风波再起!王菲探望细节曝光

财经要闻

被误伤的A股:韧性、预期与底气

科技要闻

怕了?美财长扬言:严查中国AI

汽车要闻

WAIC专访|易启未来余志勇:网易孵化按摩机器人 能识穴会“手法”

态度原创

本地
房产
教育
时尚
数码

本地新闻

杭州诗意路名,自带氛围感

房产要闻

海中870分!2026海南中招提前批分数线出炉!

教育要闻

教育部:我国基础教育总体达到高收入国家平均水平

整容、断骨、换血,欧美白男正扎堆服美役

数码要闻

曝Meta定制版AMD MI450 GPU仅有1/2计算单元和1/3显存

无障碍浏览 进入关怀版