上线当天就挤爆服务器,腾讯AI终于硬气一把
13 小时前 / 阅读约10分钟
来源:36kr
腾讯AI模型Hy4 Preview首发接入WorkBuddy,上线首日任务队列排队,腾讯紧急扩容。Hy4参数更大、上下文更长,性能提升显著,强调“为生产力而生”。腾讯通过内部数据共建和自进化方式追赶,找到适合自己的研发路径。

腾讯AI,彻底火了。

8月28日,混元Hy4 Preview在腾讯旗下AI办公工作台WorkBuddy首发接入。上线首日,任务队列就出现了排队;三天后,腾讯宣布紧急扩容推理集群,并把Hy3的限免期延长到9月30日,用来分流部分需求。

不过即便如此,高峰时段排队的情况还是避免不了。从当前的实际体验来看,在Workbuddy 上选择了混元Hy4 Preview 之后,按道理来说日常处理2 分钟就能搞定的任务,现在经常需要 5 分钟以上。

速度还是比较慢

大家对Hy4 Preview 的热情居高不下,排队情况也没见好转。如此盛况空前,对腾讯AI 来说确实比较少见。也许有人会说,Hy4 Preview 的限时免费导致了高峰时段排队,但显然这只是其中一个因素。

性能更为关键。看看Hy4 Preview 的“身份证信息”就知道了:

它是一款纯语言模型,主要升级集中在Agent、软件工程和办公任务上:总参数从Hy3的295B涨到770B,激活参数从21B涨到49B,上下文长度则从256K扩展到超过100万Token。

参数更大、上下文更长、能调用的能力也更多,腾讯也非常自信这款新模型,打上“为生产力而生”的标签。

这一次,腾讯真的追上来了吗?

老“御三家”之一,回来了

Hy4 Preview依然采用MoE架构,但模型规模已经完全不同。

总参数从Hy3的295B涨到770B,上下文窗口也从256K直接拉到1M。虽然总参数扩大了两倍多,每次推理实际参与计算的参数只有49B,并不需要把770B参数全部调用一遍。

简单说,Hy4可以把更多知识和能力装进模型里,真正回答问题时,只调动与当前任务相关的部分。这样既扩大了能力上限,也避免推理成本与总参数规模同步增长。

从官方公布的成绩来看,这次“加料”主要落在了软件工程和Agent任务上。

Terminal-Bench 2.1模拟的是AI在终端里完成真实任务:它需要读懂要求、输入命令、安装依赖、排查报错,再把任务完整跑通,Hy4在这项测试中从Hy3的70.8分提升到85.4分。

DeepSWE和SWE-bench Pro则更接近程序员的日常工作。它要求模型除了会写一段代码之外,还要读懂整个代码仓库,定位问题、修改多个文件并通过测试。

Hy4在DeepSWE上从28.0分升到64.3分,在SWE-bench Pro上拿到65.7分,已经进入GLM-5.3、Kimi K3和GPT-5.6 Sol所在的竞争区间。

跑分还是挺猛的 图源:混元官方账号

工具调用方面,Hy4在Toolathlon-Verified拿到74.1分,在APEX-Agents拿到37.1分。

腾讯还组织了163名内部专家,用203项真实工程任务进行盲测。Hy4平均得到2.99分,略高于Kimi K3的2.94分和GLM-5.3的2.92分。

虽然这些成绩都来自官方披露,还不能直接代替用户实测效果,但至少可以证明一件事:Hy4的进步集中在写代码、调工具和完成长流程任务上,腾讯已经把混元送到了开源模型的第一梯队。

这也解释了Hy4为什么强调“为生产力而生”。

生产力Agent,其实并没有太多的容错空间。大多数人给它布置了个任务之后,就放在一边干其他事情去了,过几个小时后之后再来“收菜”。

这就意味着,一旦Agent在十几个步骤中有某一步出错,前面已经完成的搜索、分析和操作都可能白费。因此,模型能不能把整条任务链跑通,比单次回答写得漂亮更加重要。

另一方面,除了模型能力的侧重之外,Hy4 Preview 的定价明显也更侧重于实际生产力。

Hy4 Preview每百万Token的输入价格是6元,输出18元。

其中最关键的,是缓存命中只要0.3元/百万Token,仅为普通输入价格的二十分之一。

价格性价比 图源:混元官方账号

这对Agent尤其重要。一次几十万Token的长任务,模型往往要在多轮操作中反复读取同一批文档或代码,重复调用占比很高。缓存命中价格足够低,就能明显压缩这部分费用。

Hy4的输入和输出价格虽然不是市场最低,但也处在相对便宜的区间。再加上低至0.3元的缓存命中价格,开发者运行长上下文、多轮Agent任务时,整体成本会更容易控制。

正因如此,从参数、跑分到内部盲测,甚至是整体定价,腾讯这次已经追进了头部竞争区间。

这下,问题来了:

从Hy3 到 Hy4 只隔了一代,姚顺雨到底有什么魔法,让模型有那么大的进步?

腾讯找对了追赶方式

腾讯能在两代模型之间快速追上来,还和它重新组织模型研发的方式有关。

这一次,腾讯没有只让模型团队围着公开榜单准备数据。Hy4的高质量训练数据,还由腾讯内部的软件工程、游戏、金融和安全等业务专家共同参与建设。

这些部门给模型出的题,比单纯的“写一段代码”更有含金量。

软件工程团队会要求它读懂长代码仓库,完成规划、调试和验证;金融团队会让它分析多份文件和复杂数据;游戏团队则会测试它能不能从一句需求开始,调用引擎做出可以继续修改的原型。

腾讯内部数据共建 图源:混元官方账号

最终把这些需求放到WorkBuddy里之后,任务就会演变整理资料、分析表格和生成PPT。

所以,腾讯内部的业务由此成了混元最早一批测试用户。模型在哪一步卡住、哪类文件读不懂、调用工具时为什么中断,都可以变成下一轮训练和评测需要解决的问题。

这就是姚顺雨一直强调的Co-design。

模型先进入CodeBuddy和WorkBuddy完成真实任务,产品侧收集用户的使用方式与失败案例,再把这些反馈送回数据、训练和评测环节。Hy3时期,腾讯已经在模型与产品之间跑起了这套循环。

腾讯的产品数据循环

此外,Hy4 还有另一条研发链路,就是所谓的“自进化”。

按照腾讯的说法,Hy4已经开始参与大模型训练方法、数据策略、评测体系和底层算子的自动优化。模型可以提出方案、运行实验,再根据结果继续修改;实验产生的代码、日志和反馈,又会成为下一轮尝试的依据。

最终,WorkBuddy和CodeBuddy负责为模型带来真实的需求和任务,告诉研发团队模型哪里不好用;Hy4参与的自动化研发,则帮助团队更快地尝试解决方案。

前者提供问题,后者加快解题。

再者,在今年7月,腾讯把混元大语言模型部门与多模态模型部门合并为基础模型部,由姚顺雨统一管理。原本分别推进的语言、多模态和AI Infra能力,开始向同一套研发体系集中。

所以,Hy4 当前爆火的意义,不只是一张更好看的成绩单。

用户对Hy4的好评

腾讯把内部专家、真实产品、模型训练和基础设施逐渐接成了一条迭代链路,这就相当于为后续的模型训练搭了一座地基。

腾讯终于找到了一种更适合自己的追赶方式。

腾讯终于“站上船”了

在今年5月的腾讯股东大会上,马化腾曾说过一句话:

“原来一年前我们以为上了船,后来发现那个船漏水了。又开始换一艘船,现在感觉站上去了,还坐不下去,还是希望船速能快一点。”

现在Hy4 Preview发布之后热度高居不下,看来马化腾想要的那艘能站上去、船速还快的船,已经来了。

唯一的问题是,想上船的人实在太多。

热度太大

或许这就是大热国产模型的宿命吧。这很难不让人想起2025年初,DeepSeek-R1突然爆火,“服务器繁忙,请稍后再试”一度成了用户最熟悉的提示。

有人反复刷新,有人换到接入DeepSeek的第三方平台,还有人专门等到深夜再用。

从某种程度上说,这甚至可以算作一枚短期的荣耀勋章。只有用户真的愿意用,服务器才有机会被挤爆。

只是这枚荣誉勋章,也有保质期。

DeepSeek刚火的时候,“服务器繁忙”还能被理解为用户增长太快。时间一长,打不开、跑不动就会从“太受欢迎”,变成用户的抱怨了。

恰好Hy4面对的又是生产力场景。用户把工作交给Agent,本来就是想节省时间;如果每次都要先排队,本来节约时间的事情反而变成了更费时间,就有可能让一次满心欢喜的 Agent 体验,变成劝退了。

图源:Arena

毕竟哪怕在WorkBuddy 上都有这么多选择,用户也没必要一直守着同一个模型。

好在,腾讯解决这个问题的家底,要比DeepSeek充足得多。

腾讯自己拥有云服务和推理基础设施,2026年第二季度资本开支达到527.8亿元,同比增长176%,其中很大一部分都投向了AI基础设施。Hy4出现排队以后,腾讯扩容推理集群、动态调配资源的反应都非常迅速。

用户的一些期待

排队证明Hy4开了个好头,接下来要做的,就是趁早让这块“荣耀勋章”消失。

至少看到WorkBuddy门口排起长队这番风景,姚顺雨总算可以先长舒一口气了。

参考资料

[1]腾讯科技:Hy4 preview上线!“在线考核”姚顺雨的新作业

[2]科技每日推送:Hy4爆火,终于轮到腾讯紧急扩容了

[3]极客公园:腾讯重金投入AI之后,混元Hy4 preview交出了什么

[4]量子位:姚顺雨空降腾讯半年,混元Hy4冲进第一梯队

[5]APPSO:实测混元Hy4 Preview:腾讯终于踩下油门,能杀入国模第一梯队吗?

[6]差评X.PIN:实测Hy4 preview,腾讯这次上强度了?

[7]腾讯:Hy4 preview登场:为生产力而生