新闻中心

当前位置 > 新闻中心> 电脑办公 > CPU

料理仙姬

Gemini 3.5 Pro难产,谷歌先交了两张草稿纸_我的网站

鉴证实录2

A |     酒从诞生开始,就有着独一份的魅力,由于世界各地的风土不同,用来酿酒的原料也各不相同,而酿造出来的酒款也各有风味。    7月21日,谷歌突然上线了两个新模型:          Gemini 3.6 Flash和Gemini 3.5 Flash-Lite。         没有一点点防备,也没有一丝顾虑,它俩就这样出现在了Google AI Studio和Gemini的模型选择器里。随着全球旅行的展开,酒也作为出行的必需品被带到了世界各地——它作为一种全球通用的语言,不仅为饮食交流做出了贡献,更促进了文化的沟通互鉴。作为中国酒代表的白酒,也天然带有着“走出去”的基因,从郑和下西洋开始,白酒就已经随船走过了山川大海,而产自江苏的洋河酒业,更是心怀大志,旨在将酝酿于洪泽湖畔与骆马湖边的传奇酒业,送到世界各地,让中国白酒在世界舞台上尽情闪耀。         这两个模型,一个主打更强的代码和Agent能力,一个主打更低成本的大规模调用。从文化会全球朋友,洋河讲述中国白酒文化之旅中国白酒的出海故事要从明朝说起。

B | 据历史记载,郑和曾七次下西洋,到达过30多个国家和地区,而这七次出海都是从江苏出发,每一次船队都会载上南京当地官府准备的“盐、酱、茶、酒、油、烛”等大批物资。

C | 也正是在这七次伟大航海的历程中,郑和带上了中国的白酒,让世界感受到了中国的文化和美味。         而作为旗舰模型的Gemini 3.5Pro,千呼万唤依然……出不来。         按照此前的计划,3.5 Pro本应在6月份上线,现在7月都过一大半了,这款被寄予厚望的模型仍然没有正式亮相。         代表旗舰实力的答卷迟迟不交,谷歌先拿出两张“草稿纸”,是个什么意思?          01          3.6 Flash:比上一代便宜,不比上一代聪明          谷歌表示,相比上一代Flash模型,Gemini 3.6 Flash进一步提升了编码、推理和工具调用表现,同时通过减少输出token降低运行成本。

D |          Gemini 3.6 Flash的定位是一个面向真实生产环境的高效模型,或者更直白一点,为Agent服务。         在Agent时代,一次任务可能需要几十轮模型调用,这意味着模型不仅要聪明,还必须足够快、足够便宜。2004年,在郑和下西洋造船基地南京宝船厂遗址中,出土了大量的酒瓶。百家讲坛著名学者纪连海从历史角度研究说,作为产自江苏的历史名酒洋河、双沟,是郑和下西洋的必备物资,这也意味着,洋河的出海经历从明朝起就已经开始了。

E |          Google此前已经在Gemini 3.5 Flash上强化了这条路线。根据官方API文档,Gemini 3.5 Flash支持100万token的长上下文,可以一次处理大量信息,同时支持代码执行、调用外部工具、搜索文件等能力,能够完成更复杂、更长时间的任务。

F | 时间飞逝。

G |          Gemini 3.6 Flash延续了这条路线,它追求的并不是单次回答的质量,是一个“能够承担得起每日真实工作”的位置。1952年,洋河酒由中国粮油食品进出口总公司江苏分公司销往海外;1959年,洋河酒评称为“香味醇浓,适口芬芳”,由上海分公司试销至港澳地区。

H |          Gemini 3.6 Flash的定价如下:          输入:1.50 美元/百万 token          输出:7.50 美元/百万 token          相比此前Gemini 3.5 Flash每百万token输入1.5美元、输出9美元的价格,输入成本没有变化,但输出成本进一步下降。

I |          对于需要大量调用AI的企业来说,这种成本变化可能比benchmark上的几个百分点提升更加重要。

J |          另外,谷歌展示的一项内部测试显示,在完成同一任务时,Gemini 3.6 Flash相比3.5 Flash减少了55.8%的token消耗,同时将任务评分从85分提升到了100分。

K |          当然,这只是谷歌自己的测试结果,只能说明Google希望展示的方向:          新模型不仅更省,而且能够用更少的计算完成同样甚至更好的任务。20世纪60—70年代,洋河作为首批指定外销酒,扬帆出海,为国家出口创汇,促进中外交流,把中国酒文化的厚重底蕴和独特魅力尽情地展现给全世界。         在那些被公开的benchmark里,谷歌主要强调的是代码能力和Agent能力。         在DeepSWE代码评测中,Gemini 3.6 Flash得分49%,高于上一代的37%。值得一提的是,在上世纪80年代,印有敦煌“飞天”标志的洋河酒远销海外,中国白酒出口海外可以说形成了一波小高潮,为后来的进一步国际化打下了坚实的基础。谷歌表示,新模型能够减少无效代码修改和重复执行过程。进入21世纪,“白酒出海”成为了中国白酒头部企业极为关注的话题,白酒国际化也在这一过程中进入了白热化竞争。         在测试AI操作电脑能力的OSWorld-Verified评测中,Gemini 3.6 Flash得分83%,超过3.5 Flash的78.4%。

L | 对此,洋河酒业率先在加拿大、东南亚,积极建设国际品牌文化体验中心,成为国外体验中国白酒的“梦想空间”……在国际化进程中,洋河带来了很多的新举措、新突破,让洋河从中国走向世界。作为洋河酒业超高端酒款的代表,首家获得“中国酒业协会”授权、由第三方认证机构“方圆集团”权威认证的中国高端年份白酒梦之蓝手工班从一开始就以品质占据了市场。作为中国白酒行业的明星品牌,梦之蓝手工班全球行活动在2024年全面开启。从南非到马来西亚,从法国巴黎到中国澳门,再到阿联酋,梦之蓝手工班开启了一场跨越距离与时间的品质探索之旅,它以非凡的绵柔芬芳,为世界各地的美酒爱好者展现了来自古老东方大国的白酒魅力,掀起了一浪又一浪的品鉴热潮,让人们看到了中国高端年份白酒的“陈”意与诚意。

M |          而在面向机器学习任务的MLE Bench中,Gemini 3.6 Flash得分63.9%,相比上一代的49.7%也有明显提升。“梦之蓝手工班全球行”之外,2024年,洋河酒业还在世界经济论坛第54届年会(2024年冬季达沃斯论坛)、“庆祝中法建交60周年暨中法文化旅游年开幕音乐会”、ProWein2024、G20峰会等重要国际会议、文化及行业展会现场亮相,通过卓越品质,让最美“中国蓝”在世界舞台上得以闪耀。

N | 值得一提的是,早在2016年,洋河·梦之蓝就已经与G20峰会结缘,成为G20杭州峰会指定用酒。

o | 2024年,洋河·梦之蓝再度荣膺“G20巴西峰会官方指定用酒”,为与会嘉宾们带来了一场“绵柔”盛宴。随着洋河酒业在海外市场的布局越发成熟,近年来,除了G20峰会,洋河·梦之蓝还相继亮相APEC峰会、上合峰会、达沃斯论坛、一带一路峰会等重大国际交流活动,不断融入国际舞台,展现中国白酒风采,传播中华优秀传统文化,助力构建多元互利、百花齐放的交流格局。借体育架桥梁,洋河构建多元互利交流格局和酒一样,体育也是超越国界的“通用语言”,而当两者结合所创造的沟通力,足以跨越语言的隔阂,成就一段又一段的国际交流佳话。

p |          不过,上述数据更多说明Gemini 3.6 Flash相比上一代有所进步。早在1971年,“乒乓外交”就打开了中美两国人民友好往来的大门,“小球推动大球”成为世界外交史上的一段佳话,它的影响也一直持续到今天,而当时间转到2023年,中美民间交流再次因为这颗“小球”续写了新篇。         如果放到当前大模型竞争中横向比较,Google选择的对手是GPT-5.6 Luna、Grok 4.5和Claude Sonnet 5(这里也可以看出这个产品的定位)。洋河·梦之蓝通过赞助美国乒乓球公开赛,架起了一条合作友谊之路,成为盛开在“乒乓外交”里的“中国名片”——而在此之前,洋河·梦之蓝就已经远赴美国,成为中美“乒乓外交”48周年纪念活动用酒了。         从结果来看,Gemini 3.6 Flash并没有全面领先,GPT和Claude的模型在复杂软件工程和知识工作任务上仍然保持优势。2024年,洋河梦之蓝USOPEN全美乒乓球公开赛在拉斯维加斯曼德勒海湾会议中心举行,超过1500名中美选手参加了此次比赛,角逐最终的冠军。在这为期6天的比赛中,洋河·梦之蓝再次作为友好交流的“梦想使者”,与中美体育爱好者、在美各界嘉宾,共同见证“乒”搏瞬间,感受银球魅力。         但这其实也是Flash系列存在的意义:          它不一定要成为最强模型,只需要在明显低于旗舰模型成本的情况下,提供够用的能力。         官方测评之外,根据Artificial Analysis的发布前测试,Gemini 3.6 Flash在Intelligence Index上拿到了50分,与Gemini 3.5 Flash持平。         这意味着,如果只看模型综合“智力”,Gemini 3.6 Flash并没有什么升级。

q |          但是呢,它的速度又很好地弥补了这一点。值得一提的是,这也是洋河·梦之蓝第四次牵手全美乒乓球公开赛。

r | 乒乓球之外,作为中外友好交流的民间大使,洋河·梦之蓝一直持续致力于各类体育文化活动,不断播种跨国友谊的种子。

s | 2024年4月,巴黎100中法羽毛球慈善盛典上,洋河·梦之蓝“中法文化旅游年”礼盒亮相当晚的慈善晚宴,以香醇优雅的酒香,绵柔的口感备受现场嘉宾赞誉。

t | 从乒乓球到羽毛球,再到其他运动项目,在洋河·梦之蓝的“外交传奇”中,不难发现梦之蓝作为洋河股份的明星产品,不仅在国内市场上屡创佳绩,还在国际舞台上大放异彩,成为中国白酒的骄傲,也凸显了洋河在全球化浪潮中稳健前行的步伐。         Artificial Analysis还统计了模型完成Intelligence Index任务所需的平均时间。酿好酒,讲好中国白酒的全球化故事中国白酒是飘扬于世界酒业的一面鲜艳旗帜,在整个世界酒业的发展浪潮中,它不仅是品质的代表,更是潮流的代表、文化的代表。结果显示,Gemini 3.6 Flash每项任务平均耗时约1.3分钟,相比上一代3.5 Flash的约2.7分钟,减少了一半。

u |          与此同时,Gemini 3.5 Flash-Lite的任务完成时间也从上一代3.1 Flash-Lite的约1.6分钟,下降到约0.6分钟。1915年,中国白酒首次扬帆出海,在巴拿马万国博览会上闪耀全球舞台,到2002年,伴随中国加入WTO的时代大潮,白酒开始凭借其独特的文化魅力抵达全球人民的餐桌,再到2013年,乘着“一带一路”的东风,中国白酒借由千年的传承、国宝级的工艺、独特的文化、优质的产品,开启中国白酒国际化发展的新征程。2024年的现在,中国白酒再次追寻时代的浪潮,在世界酒业之海扬帆竞渡。         总的来说,Gemini 3.6 Flash的升级方向其实是效率——更少的token消耗,更低的运行成本,以及更适合长期运行的Agent能力。         对于习惯使用Gemini 3.5 Flash的用户来说,确实是非常不错的升级。

v | 白酒文化源起中国,凭借独到的风味,吸引着诸多拥趸。对品质的追求、对文化的坚守,构建起了中国白酒的“文化生态圈”,也给足了中国白酒开拓国际蓝海的底气与信心。         02          3.5 Flash-Lite:更快,但没有上一代便宜          然后再来看另一个模型Gemini 3.5 Flash-Lite。

w |          顾名思义,Flash-Lite是Flash系列中更轻量的版本,相比Flash,它牺牲了一部分能力上限,换取了更低的成本和更快的速度。         就像前面提到的那样,Gemini 3.5 Flash-Lite的任务完成时间从上一代3.1 Flash-Lite的约1.6分钟,下降到了约0.6分钟。随着全球经济的不断发展和消费者需求的日益多元化,中国白酒在国际市场上的潜力正逐步释放,其国际化也迎来了前所未有的发展机遇。         3.5 Flash-Lite也是3.5系列中速度最快的型号,根据Artificial Analysis测试数据,其生成速度达到约350 token/秒,已经属于当前主流大模型中的高速水平。洋河股份党委书记、董事长张联东曾在演讲中表示,“白酒出海是一个必答题,不是选择题,必须要走出去。”洋河是这样说的,也是这样做的。         Gemini 3.5 Flash-Lite的定价如下:          输入:0.30 美元/百万 token          输出:2.50 美元/百万 token          相比Gemini 3.6 Flash,输入价格约为1/5,输出价格约为1/3。从酒都宿迁走出国门,从中国走向世界,始终以品质为先的洋河酒业坚持酿好酒的理念,力图通过高品质的产品交流,向世界展示中国的悠久历史和白酒文化,积极开拓国际市场、深度参与白酒国际化,促进国际市场对中国白酒的认知和认同。从“星火燎原”到“星光灿烂”,洋河酒业始终通过增强全球战略意识,主动融入全球市场,持续彰显中国名酒的品牌自信与创新活力,让每一次的酒杯交接,演变为思想与文化的交流,让世界读懂中国,读懂中国白酒。(本文来自澎湃新闻,更多原创资讯请下载“澎湃新闻”APP)。不过,与上一代Gemini 3.1 Flash-Lite相比,新模型并没有进一步降价。

x |          虽然Gemini 3.5 Flash-Lite由于能力提升,可以通过减少输出量降低部分成本,但综合起来,还是很难抵消单价上的成本增加。         根据官方文档,相比上一代Gemini 3.1 Flash-Lite,新模型在不同思考等级(thinking levels)下都有明显提升。开发者可以根据任务需求调整模型的思考深度。

y |          此外,Gemini 3.5 Flash-Lite还内置了Computer Use能力,可以帮助Agent更可靠地操作电脑环境,完成跨应用任务。

z |          在具体测试中,Gemini 3.5 Flash-Lite相比上一代模型也有明显提升:在Terminal-Bench 2.1编程Agent测试中,成绩从31%提升到54%;在测试长上下文理解能力的GDM-MRCR v2中,从60.1%提升到72.2%;在更贴近真实工作场景的GDPval-AA v2任务执行测试中,从642提升到1140。         值得注意的是,在一些Agent和代码相关测试中,Gemini 3.5 Flash-Lite甚至超过了上一代更高定位的Gemini 3 Flash模型。         例如,在SWE-Bench Pro软件工程测试中,Gemini 3.5 Flash-Lite得分54.2%,高于Gemini 3 Flash的49.6%;在测试AI操作电脑能力的OSWorld-Verified中,Gemini 3.5 Flash-Lite也以74.0%的成绩超过Gemini 3 Flash的65.1%。         这意味着,随着模型能力不断提升,过去需要更大模型才能完成的部分Agent任务,正在逐渐下沉到更便宜、更快速的模型。         顺便一提,除了前两个面向普通用户的通用模型,谷歌还推出了Gemini 3.5 Flash Cyber。         它主要针对网络安全场景。根据官方文档,在CodeMender系统中,多个Gemini 3.5 Flash Cyber Agent可以协同工作,分别完成不同分析任务,并最终汇总成一份完整报告。

| 在网络安全基准测试CyberGym中,Flash Cyber也达到了接近前沿模型的表现。

|          该模型目前不会公开提供,仅通过CodeMender平台向政府和可信合作伙伴开放。         03          3.5 Pro:谷歌迟迟交不出的旗舰答卷          如果说Gemini 3.6 Flash和Gemini 3.5 Flash-Lite还可以看作是谷歌对AI规模化应用的判断,那么Gemini 3.5 Pro则代表着谷歌的模型上限。

|          但问题在于:这份答卷,到现在还没有交出来。

|          5月I/O的时候,谷歌表示Gemini 3.5 Pro将在“接下来一个月左右”推出,也就是预计在今年6月上线。

| 现在7月都过了一大半了。

|          据彭博社7月16日报道,Gemini 3.5 Pro的发布时间已经落后原计划数月。谷歌正在继续优化模型能力,尤其是编码表现,希望达到内部设定的目标。         路透社最新的报道则显示,截至目前,谷歌仍未公布具体上线时间,只表示该模型正在与合作伙伴测试,并将“很快”推出;另有新闻稿透露,Gemini 4的训练工作已经开始了。

|          而我们都知道,“很快”就是不确定的意思。         Gemini 1.0发布时就曾因演示争议受到质疑;Gemini 1.5 Pro凭借百万token上下文短暂扳回局面,但随后Claude和GPT系列快速追赶;直到Gemini 3系列发布,谷歌才重新获得“回到前沿竞争”的评价。         如今Gemini 3.5 Pro再次延期,市场关注的已经不只是一个模型什么时候上线,还有谷歌到底能否保持旗舰模型的竞争节奏问题。         何况谷歌透露出的编码表现不及预期,并不是什么容易解决的小问题。

|          随着Agent开始进入企业工作流,代码能力的重要性迅速提升。

| 一个模型能否理解复杂项目、修改真实代码、完成多步骤开发任务,已经成为衡量它是否具备实际生产价值的重要指标。         路透社指出,华尔街正在等待Gemini 3.5 Pro,因为它将成为判断Google DeepMind是否能够跟上OpenAI和Anthropic的重要指标。

|          当然,谷歌并不是没有动作,这次推出的几个模型,恰说明谷歌正在强化另一条路线:让AI变得更便宜、更容易规模化。         谷歌CEO Sundar Pichai近期也多次强调成本优势,并表示企业如果将大部分AI工作负载迁移到Gemini模型,可以每年节省超过10亿美元。         但问题在于,市场在期待一份证明谷歌模型实力的“答卷”,谷歌交出的却是两张关于效率和成本的“草稿纸”——很难不让人觉得,谷歌在用Flash系列填补Pro延迟留下的空档。         有意思的是,在Gemini 3.5 Pro延期的同时,AI竞争格局正在发生变化。         过去,人们讨论AI领先者,主要关注海外“御三家”:OpenAI、Anthropic和Google DeepMind。         但最近,GLM-5.2、Kimi K3等国产模型也开始进入前沿竞争,并引发了大量讨论。         前沿模型的追赶速度正在加快,也让谷歌的问题变得更加紧迫,它当然可以继续大力推出Flash模型,但前提是它的旗舰模型足够给力——只要硬实力足够,自有大儒为他辩经。

|          如果谷歌最终推出一个真正领先的旗舰模型,那么Flash路线会成为完整体系的一部分:Pro负责突破能力上限;Flash负责规模化应用。         但如果Gemini 3.5 Pro持续落后,市场很可能会继续追问:谷歌拥有最强AI研究资源,为什么却无法稳定跑赢竞争对手?          在Alphabet本周举行第二季度财报电话会议时,人们很可能会进一步询问有关Gemini 3.5 Pro的更多细节。(作者:袁心玥)。

Current article:http://www.tibiantasangnenti.buzz/9k0zmn8/20260826/5832013.pptx

Published on:01:21:42


文章观点支持

文章价值打分
当前文章打分0 分,共有0人打分
热门评论
热门文章