Gemini 3.8,明日登场
4 小时前 / 阅读约7分钟
来源:36kr
谷歌将发布Gemini 3.8 Flash,该模型在编程方面表现强悍,碾压Opus模型。谷歌还为Gemini植入了智能体视频理解能力,大幅降低token消耗和分析成本,提高准确率。AI大战进入新阶段。

Claude 5.1刚问世,另一边OpenAI Astra马上杀到。

现在,就连谷歌也有了新动作。最新爆料,Gemini 3.8 Flash将在明日登场

看来,AI圈又要「过年了」。

Gemini 3.5 Pro取消,下一个大版本4.0

比起Gemini 3.8 Flash的发布,许多人还是更加好奇:Gemini 3.5 Pro到底什么时候来啊?!

对不起,不用等了,谷歌已放弃......

今年5月I/O大会预告至今,已过去近4个月,Gemini 3.5 Pro进化程度连Flash都比不上。

谷歌也是迫不得已,直接「弃子」。

好在,Gemini 4.0在预训练中评估优秀,后训练还在顺利进行中

这篇来自WSJ的独家爆料,还重磅预告了Gemini 3.8 Flash(代号「Skimaki」)强悍的编程实力。

据称,在谷歌内部编码工具Jetski的对比测试中,3.8 Flash直接碾压Opus模型

而且,这款模型已研发数月,早在谷歌领导层「大地震」之前就开始了。

Hassabis让位,首席科学家Jeff Dean离职,让许多人对Gemini的未来都捏了把汗。

不过,目前看来,一切都在内部有条不紊地进行中。

目前,谷歌计划先推出Gemini 3.8 Flash,是因为这款模型参数小,所需计算少,更容易出成果。

听内部人士说,从今年初开始,谷歌就投入了更多的人力和算力,专门用来提升Gemini的写代码能力。

特别是,加大了对「强化学习」的投入,让AI通过不断试错来真正学会新本领。

而且谷歌DeepMind和其他实验室,同时推进多个项目,这样一来即便是这个不行,另一个还能顶上。

Gemini 3.5 Pro不及预期,但Gemini 4.0还未「出炉」。

如今,硅谷「御两家」OpenAI和Anthropic,已在前沿模型和编程Agent上,非常能打。

Information称,OpenAI下一代Astra还采用了一种「循环深度」(recurrent depth)新型推理方法,让思考token减少的同时,还大幅提升了性能。

这张王牌,即将在本周揭晓。

而此时此刻,谷歌总得交出点东西才行。

毕竟劈柴承诺之后几个月,除了发布了一款3.7 Flash,再没有扔出能让AI圈兴奋的模型了。

或许就在今晚,Gemini 3.8 Flash要登场了。

Gemini第一次,会自己看视频了

在此发布之前,谷歌今天先来了一波预热,为Gemini植入了一项新能力——

智能体视频理解(Agentic Vedio Understanding)

这项功能,简直上大分。

上传一段I/O大会视频,同一款模型Gemini 3.7 Flash,Token消耗直接暴降88%。

谷歌在官博中表示,Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite三个模型都能用agentic视频理解能力,入口在Google AI Studio和Gemini Enterprise Agent Platform。

在标准视频分析基准上打开这个开关,token消耗最多降88%,分析成本最多降66%,准确率反过来还涨了最多7%。

而且不额外收一分钱,走的仍是标准API的token定价。省钱和变准通常要打架。这次没打起来。

因为,Gemini学会了「拖进度条」。

过去的处理方式叫「静态」处理,模型被动接收固定帧率的画面流,帧率由API参数定死,模型没有话语权。

现在换成模型自己拿主意,看哪一段、以多快的速度看、是看画面、听音频还是直接读转录文字,都可以自己决定。

这不是谷歌第一次这么干。

此前的agentic vision把代码执行和Gemini原生的图像理解拼在一起,模型对着一张图能自己写代码去放大、裁剪、比对。

这回轮到视频,思路照搬,只不过把工具换成了原生视频工具。

四件以前很难干的活

官方博客中还列出了几种高难度的应用场景。

亚秒级片段检索。以前模型「看」视频,一秒只截一张图。问题是,很多东西不到一秒就闪过去了。

现在能精确到不到一秒去定位这些瞬间了。

这意味着「自动剪辑」这件事第一次真正可行了:以前剪辑师得自己趴在时间轴上,一帧一帧地找该在哪里下刀,现在可以先让模型扫一遍,把候选的切点标出来,人再去挑。

长视频里捞针。几小时的素材里问一个复杂问题,不用把几百万 token 全烧一遍。

异常检测。模型盯上某个时间窗口之后,可以专门对这一段提高帧率重新采样,看清快速运动和细微的画面瑕疵。产线质检和安防监控最吃这一口,因为异常本来就只发生在那几秒里。

数数。一个动作重复了多少次,画面里有几个不同的物体,这类问题模型过去错得很稳定,原因也很朴素,漏采的那几帧里正好有东西。

Agent终于看得起视频了

视频,一直是所有模态里最贵的那个。

文字便宜,图片还行,视频又大又长,一分钟就能顶掉一本书的token。

所以这两年所有人聊Agent,更多还是在聊它会读、会写、会调用工具。

问题是,一个主要靠文字理解世界的Agent,看到的其实只是一个被人「转述」过的世界。

摄像头拍到的、会议录下的、生产线上跑过去的,那些没人愿意花时间转成文字的东西,它一概不知道。

现在,这条成本曲线被砍掉一大截。

一个Agent如果能自己翻完几小时的监控、几十小时的课程、上百条素材,还不至于把预算烧穿,那它接触世界的方式就变了。

它不用再等着人把画面转述成文字喂给它,也不用再在「看得起」和「看得准」之间选一个。

谷歌,就先做了这个破局者。

AI大战,下一回合

这几天,四家的发布节奏,几乎撞到了一起。

Claude 5.1刚来,OpenAI Astra已经在门口,谷歌憋了几个月也终于拿出Gemini 3.8 Flash迎战。

这一波更新后,如今的Claude主攻两大领域:编程+科研。

下一代Astra将变成一个「持续智能体」,用奥特曼的话来说,其计算机使用能力已达人类水平。

Gemini 3.8 Flash也将在编程方面,有更大的跃升。

现在,OpenAI、Anthropic、谷歌,以及SpaceXAI已经同时开足马力。

马斯克预告Grok 4.7十天后发布

这场混战,才刚刚进入最凶的一段。

参考资料:

https://x.com/Google/status/2094840983913402704 

https://deepmind.google/blog/introducing-agentic-video-in-gemini/