谷歌Gemini 3.5 Pro难产,仅推出两个预览版
谷歌于7月21日悄然上线Gemini3 6Flash和3 5Flash-Lite,前者提升代码与Agent能力并降低成本,后者速度更快但单价未降。旗舰模型Gemini3 5Pro原定6月上线至今仍延期,引发市场对其旗舰竞争力的担忧。
7月21日,谷歌悄然在AI Studio和Gemini模型选择器中上线了两款新模型:Gemini 3.6 Flash与Gemini 3.5 Flash-Lite。没有预热,没有发布会,就这么突兀地出现在用户面前。

这两款模型,一个侧重更强的代码与Agent能力,另一个主打更低成本的大规模调用。而备受期待的旗舰模型Gemini 3.5 Pro,依然迟迟未能亮相。
按照此前计划,Gemini 3.5 Pro本应在6月上线,如今7月已过大半,这款被寄予厚望的模型仍未见正式发布。旗舰答卷迟迟未交,谷歌却先拿出两张“草稿纸”,这究竟是何用意?
01 3.6 Flash:比上一代更便宜,但不一定更聪明
谷歌表示,相比上一代Flash模型,Gemini 3.6 Flash在编码、推理和工具调用方面均有提升,同时通过减少输出token来降低运行成本。

它的定位非常明确:面向真实生产环境的高效模型。更直白地说,就是为Agent服务。在Agent时代,一次任务可能需要数十轮模型调用,这意味着模型不仅要聪明,还必须足够快、足够便宜。
谷歌此前已在Gemini 3.5 Flash上强化了这一路线。根据最新API文档,Gemini 3.5 Flash支持100万token的长上下文,可一次性处理大量信息,同时支持代码执行、调用外部工具、搜索文件等能力,能够完成更复杂、更长时间的任务。Gemini 3.6 Flash延续了这一路线,它追求的不是单次回答的质量,而是“能够承担得起每日真实工作”的定位。
定价方面,Gemini 3.6 Flash的输入价格为1.50美元/百万token,输出价格为7.50美元/百万token。相比此前Gemini 3.5 Flash每百万token输出9美元的价格,输入成本不变,但输出成本进一步下降。对于需要大量调用AI的企业而言,这种成本变化可能比benchmark上几个百分点的提升更为重要。
此外,谷歌展示的一项内部测试显示,在完成同一任务时,Gemini 3.6 Flash相比3.5 Flash减少了55.8%的token消耗,同时将任务评分从85分提升至100分。当然,这只是谷歌自己的测试结果,只能说明Google希望展示的方向:新模型不仅更省,而且能用更少的计算完成同样甚至更好的任务。

在公开的benchmark中,谷歌主要强调代码能力和Agent能力。在DeepSWE代码评测中,Gemini 3.6 Flash得分49%,高于上一代的37%。谷歌表示,新模型能够减少无效代码修改和重复执行过程。在测试AI操作电脑能力的OSWorld-Verified评测中,Gemini 3.6 Flash得分83%,超过3.5 Flash的78.4%。而在面向机器学习任务的MLE Bench中,Gemini 3.6 Flash得分63.9%,相比上一代的49.7%也有明显提升。

不过,上述数据更多说明Gemini 3.6 Flash相比上一代有所进步。如果放到当前大模型竞争中横向比较,Google选择的对手是GPT-5.6 Luna、Grok 4.5和Claude Sonnet 5(从这也能看出产品的定位)。从结果来看,Gemini 3.6 Flash并未全面领先,GPT和Claude的模型在复杂软件工程和知识工作任务上仍保持优势。但这其实也是Flash系列存在的意义:它不一定要成为最强模型,只需在明显低于旗舰模型成本的情况下,提供够用的能力。

最新测评之外,根据Artificial Analysis的发布前测试,Gemini 3.6 Flash在Intelligence Index上拿到50分,与Gemini 3.5 Flash持平。这意味着,如果只看模型综合“智力”,Gemini 3.6 Flash并无升级。

但是,它的速度很好地弥补了这一点。Artificial Analysis还统计了模型完成Intelligence Index任务所需的平均时间。结果显示,Gemini 3.6 Flash每项任务平均耗时约1.3分钟,相比上一代3.5 Flash的约2.7分钟,减少了一半。与此同时,Gemini 3.5 Flash-Lite的任务完成时间也从上一代3.1 Flash-Lite的约1.6分钟,下降到约0.6分钟。

总的来说,Gemini 3.6 Flash的升级方向其实是效率——更少的token消耗,更低的运行成本,以及更适合长期运行的Agent能力。对于习惯使用Gemini 3.5 Flash的用户来说,这确实是一个非常不错的升级。
02 3.5 Flash-Lite:更快,但并未比上一代更便宜
再来看另一款模型Gemini 3.5 Flash-Lite。顾名思义,Flash-Lite是Flash系列中更轻量的版本,相比Flash,它牺牲了一部分能力上限,换取了更低的成本和更快的速度。

就像前面提到的,Gemini 3.5 Flash-Lite的任务完成时间从上一代3.1 Flash-Lite的约1.6分钟,下降到了约0.6分钟。它也是3.5系列中速度最快的型号,根据Artificial Analysis测试数据,其生成速度达到约350 token/秒,已经属于当前主流大模型中的高速水平。
Gemini 3.5 Flash-Lite的定价如下:输入0.30美元/百万token,输出2.50美元/百万token。相比Gemini 3.6 Flash,输入价格约为1/5,输出价格约为1/3。不过,与上一代Gemini 3.1 Flash-Lite相比,新模型并未进一步降价。虽然Gemini 3.5 Flash-Lite由于能力提升,可以通过减少输出量降低部分成本,但综合起来,还是很难抵消单价上的成本增加。
根据最新文档,相比上一代Gemini 3.1 Flash-Lite,新模型在不同思考等级(thinking levels)下都有明显提升。开发者可以根据任务需求调整模型的思考深度。此外,Gemini 3.5 Flash-Lite还内置了Computer Use能力,可以帮助Agent更可靠地操作电脑环境,完成跨应用任务。
在具体测试中,Gemini 3.5 Flash-Lite相比上一代模型也有明显提升:在Terminal-Bench 2.1编程Agent测试中,成绩从31%提升到54%;在测试长上下文理解能力的GDM-MRCR v2中,从60.1%提升到72.2%;在更贴近真实工作场景的GDPval-AA v2任务执行测试中,从642提升到1140。

值得注意的是,在一些Agent和代码相关测试中,Gemini 3.5 Flash-Lite甚至超过了上一代更高定位的Gemini 3 Flash模型。例如,在SWE-Bench Pro软件工程测试中,Gemini 3.5 Flash-Lite得分54.2%,高于Gemini 3 Flash的49.6%;在测试AI操作电脑能力的OSWorld-Verified中,Gemini 3.5 Flash-Lite也以74.0%的成绩超过Gemini 3 Flash的65.1%。这意味着,随着模型能力不断提升,过去需要更大模型才能完成的部分Agent任务,正在逐渐下沉到更便宜、更快速的模型。

顺便一提,除了前两个面向普通用户的通用模型,谷歌还推出了Gemini 3.5 Flash Cyber。它主要针对网络安全场景。根据最新文档,在CodeMender系统中,多个Gemini 3.5 Flash Cyber Agent可以协同工作,分别完成不同分析任务,并最终汇总成一份完整报告。在网络安全基准测试CyberGym中,Flash Cyber也达到了接近前沿模型的表现。该模型目前不会公开提供,仅通过CodeMender平台向政府和可信合作伙伴开放。

03 3.5 Pro:谷歌迟迟交不出的旗舰答卷
如果说Gemini 3.6 Flash和Gemini 3.5 Flash-Lite还可以看作是谷歌对AI规模化应用的判断,那么Gemini 3.5 Pro则代表着谷歌的模型上限。但问题在于:这份答卷,到现在还没有交出来。
5月I/O大会时,谷歌表示Gemini 3.5 Pro将在“接下来一个月左右”推出,也就是预计今年6月上线。现在7月已过大半。据彭博社7月16日报道,Gemini 3.5 Pro的发布时间已经落后原计划数月。谷歌正在继续优化模型能力,尤其是编码表现,希望达到内部设定的目标。路透社最新的报道则显示,截至目前,谷歌仍未公布具体上线时间,只表示该模型正在与合作伙伴测试,并将“很快”推出;另有新闻稿透露,Gemini 4的训练工作已经开始了。而我们都知道,“很快”就是不确定的意思。

Gemini 1.0发布时就曾因演示争议受到质疑;Gemini 1.5 Pro凭借百万token上下文短暂扳回局面,但随后Claude和GPT系列快速追赶;直到Gemini 3系列发布,谷歌才重新获得“回到前沿竞争”的评价。如今Gemini 3.5 Pro再次延期,市场关注的已经不只是一个模型什么时候上线,还有谷歌到底能否保持旗舰模型的竞争节奏问题。何况谷歌透露出的编码表现不及预期,并不是什么容易解决的小问题。
随着Agent开始进入企业工作流,代码能力的重要性迅速提升。一个模型能否理解复杂项目、修改真实代码、完成多步骤开发任务,已经成为衡量它是否具备实际生产价值的重要指标。路透社指出,华尔街正在等待Gemini 3.5 Pro,因为它将成为判断Google DeepMind是否能够跟上OpenAI和Anthropic的重要指标。
当然,谷歌并不是没有动作。这次推出的几个模型,恰恰说明谷歌正在强化另一条路线:让AI变得更便宜、更容易规模化。谷歌CEO Sundar Pichai近期也多次强调成本优势,并表示企业如果将大部分AI工作负载迁移到Gemini模型,可以每年节省超过10亿美元。但问题在于,市场在期待一份证明谷歌模型实力的“答卷”,谷歌交出的却是两张关于效率和成本的“草稿纸”——很难不让人觉得,谷歌在用Flash系列填补Pro延迟留下的空档。
有意思的是,在Gemini 3.5 Pro延期的同时,AI竞争格局正在发生变化。过去,人们讨论AI领先者,主要关注海外“御三家”:OpenAI、Anthropic和Google DeepMind。但最近,GLM-5.2、Kimi K3等国产模型也开始进入前沿竞争,并引发了大量讨论。前沿模型的追赶速度正在加快,也让谷歌的问题变得更加紧迫。它当然可以继续大力推出Flash系列,但前提是它的旗舰模型足够给力——只要硬实力足够,自有大儒为他辩经。如果谷歌最终推出一个真正领先的旗舰模型,那么Flash路线会成为完整体系的一部分:Pro负责突破能力上限;Flash负责规模化应用。但如果Gemini 3.5 Pro持续落后,市场很可能会继续追问:谷歌拥有最强AI研究资源,为什么却无法稳定跑赢竞争对手?
在Alphabet本周举行第二季度财报电话会议时,人们很可能会进一步询问有关Gemini 3.5 Pro的更多细节。
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
同类文章
三星Galaxy S27系列再曝 多处组件放弃自供
三星盖乐世S27系列预计明年春季正式登场,其中标准版与S27+主摄像头可能采用索尼传感器,并且会引入第三方显示驱动芯片及京东方OLED显示面板。而S27Pro取消了笔槽设计,内部配备5000毫安时电池。此外,猎户座2700芯片将搭载于S27和S27+两款机型上。
小米神秘旗舰入网,玄戒芯片、澎湃OS、自研AI大模型
小米新旗舰(型号2608BPX34C)已入网,配备67瓦快充,支持UWB超宽带技术及N79频段,或为首款阔折叠机型。该机有望搭载自研三纳米制程玄戒O3芯片与澎湃OS4操作系统,并备案了小米大模型、文心一言等多个人工智能大模型。
Google确认Pixel系列涨价 存储芯片成本激增所致
谷歌确认其手机系列将全面涨价,因存储芯片等成本激增。新机与存量机型均受影响,旗舰款起售价上调一百美元,标准版取消入门容量配置,高端版可能缩减运行内存以平衡成本。此外,所有型号价格均有所调整。
特朗普因欧盟谷歌罚款暴怒,再次威胁加征巨额关税
特朗普再度释放强硬信号——这次将矛头对准欧盟,导火索是欧盟对谷歌开出一张高达10亿欧元的罚单。简单来说,新仇旧怨一并清算,关税大棒又一次挥向大西洋彼岸的盟友。 事件经过如下:欧盟委员会于本周三发布新闻稿,正式宣布对谷歌处以10亿欧元罚款,理由是谷歌涉嫌违反欧盟的《数字市场法》。这部法律的核心目标就是
升仕175V踏板摩托车上市169cc动力升级售11800元
7月25日,升仕175V龙骨踏板摩托车正式上市,官方定价为11800元,与先前推出的150V和150X车型保持一致。先来了解几个关键信息:这款车早在7月20日就已开启销售,目前官方渠道均可查询到。 最核心的升级在于动力系统。175V搭载了一台实际排量为168 7cc(最新宣传口径为169cc级别)的
- 热门数据榜
相关攻略
2026-07-25 21:21
2026-07-25 21:21
2026-07-25 21:21
2026-07-25 21:21
2026-07-25 21:05
2026-07-25 21:05
2026-07-25 20:19
2026-07-25 20:18
热门教程
- 游戏攻略
- 安卓教程
- 苹果教程
- 电脑教程

