美国豆包的优势,只剩下快了……
5 小时前 / 阅读约6分钟
来源:36kr
Gemini 3.8 Flash更新提升轮次,任务成本上涨但能力进步明显,Agent能力排名提升,超越大部分轻量级模型。其速度优势显著,符合Google对Flash系列定位,能力接近旗舰级。

按月更新版本,我就问问还有谁?

7月Gemini 3.6 Flash、8月Gemini 3.7 Flash、9月Gemini 3.8 Flash。这更新频率也是没谁了……

3.6和3.7 Flash的提升不痛不痒,我原本已经彻底对Gemini失去信心了,看到3.8 Flash发布的新闻,我的期待值几乎就是0。不过还是试了试3.8 Flash,没想到虽是Flash模型,它这次在能力上的进步还挺明显。

01、单价没涨,为什么干活还贵了

3.8 Flash的Token单价和之前依然保持不变,3.6、3.7、3.8,连着三代更新竟然一点没涨价。

我们的美国大豆包价格上比豆包Seed2.1 Pro要便宜,甚至逼近了DeepSeek V4 Pro峰值的价格。

话是这么说,但是总价还是涨了。

因为这次3.8 Flash最大的特色是提升轮次。官方说以前Flash模型会出现活没干完就草草了事的情况,新模型解决了这一点。Gemini 3.8 Flash的解决办法是让模型多想一会,多说一点,任务多做几轮。

这就导致了一个问题。和前几代Gemini相比,虽然Token单价一直没变,但是同样的任务下,由于完成任务普遍轮次变多了,开销还是涨了。3.8 Flash高推理档位的单任务输出Token比3.7 Flash多了33%,加上智能体任务轮次增加,平均任务成本从0.40美元涨到了0.58美元。

有意思的是,Google对步骤多少的态度,还真不是一成不变的。

3.6 Flash发布时,官方强调的是少走弯路:用更少的推理步骤和工具调用完成任务;到了3.8 Flash,官方又开始强调要多想几步。

可是老大,我们这样让3.8 Flash多说话真的有用吗?

同样的提示词,分别让Gemini 3.7 Flash和Gemini 3.8 Flash给我讲讲电贝斯的发声原理。同样是让我拨动琴弦试试看,3.7说得很明白:「用力拨动4弦」;结果3.8来了个「用右手手指猛烈拨动最粗的4弦」……

????

Hello?我的钱都花在这了吗?

02、美国大豆包终于能把活干完了

话都说不明白,那这个多做几轮的方法到底在哪进步了?

原来,它是来干活的。这次迭代主要是Agent能力的提升。

Arena的Agent能力排名从上一代Gemini 3.7 Flash的32名升到了14名。

试了一下,提升效果还真挺明显。它的能力已经超越了大部分「Flash」等级的轻量级模型。

我让3.8 Flash做了一个四缸发动机的互动模拟,就用了1分钟,而且结果呈现的要素齐全。

作为对比,3.7 Flash在同样的提示词下直接什么都没画出来,我在提示词里还特别说明了「要做验证」。看来3.7果然为了赶快交差美美无视了这个部分……

让GPT检查才发现,不仅因为一开始的依赖加载出了问题,后面的旋转过程、点火顺序全都写的不对。果然一回头测试3.7 Flash,美国大豆包那个一本正经胡写代码的感觉又回来了。

和Gemini 3.7 Flash同样的问题也出现在各家的Flash模型上。

GPT-5.6 luna和GLM-5.3 flash全都没能加载出来渲染正常的的发动机活塞,后面旋转、点火过程也全都没有。而且这俩模型分别做了20分钟和35分钟,结果还是完全运行不了。

不过DeepSeek V4 Flash成功跑起来了,但只是能跑起来而已:气缸没画明白,四冲程点火的效果也完全没有体现。

03、质量不够,速度来凑

不过真要说Gemini和市面上其他模型比最大的优势,还得是速度。

Gemini系列现在的速度是真快,高推理模式下的3.8 Flash,每秒钟输出Token达到了300以上……

市面上所有推理模型里,速度前几名全都是Gemini。

这和Google给Flash系列模型的定位有关。

在官方的产品定位里,它的主战场是Agent,而且定位是调用工具、持续运行、落实任务的「worker agent」,不是那个深度思考、规定路线、统筹调度的「central agent」。所以它追求速度快、省Token,其实 3.8 Flash的表现很符合Google对Flash系列产品的定位。

我又一次拿出我的吃豆人做了测试。

我发现Gemini 3.8 Flash这速度真有点东西。整个游戏功能齐全,只用了29秒。这也太快了……

用相同的提示词测试了一下在Artificial Analysis同样在「智能」维度得到59分的GPT-5.6 Sol xhigh。结果要慢不少,做了1分35秒,另外这个结果真的不怎么样,这个帧数是要干啥……

,

为什么3.8 Flash作为一个轻量模型还能在很多测试任务里保持质量?

因为对于它来说,高速是多做几轮的条件。

我看Google最近的Flash系列大更新是一次挺漂亮的曲线救国。

曾经的大模型发布是先做个旗舰模型,然后蒸馏出来一个轻量快速的Flash模型。但是由于Gemini 3.5 Pro的「持续难产」,Google选择反其道行之:质量不够、速度来凑。3.6、3.7的模型还是在一味地卷速度,但是这次的3.8 Flash,Google是真做到了利用高速优势,达到更好的质量。

用这种优化方式,Gemini 3.8 Flash的能力已经能算是「旗舰级Flash」模型了,但是它毕竟依然不是Pro。现在都已经9月了,原定6月发布的Gemini Pro模型到底啥时候能发出来,我真的等不及了。