谷歌正在开发一款专为其Gemini AI模型量身定制的新型服务器芯片,将模型架构直接固化于硅片之中,以大幅提升AI推理效率。
据科技媒体The Information周一报道,这款被内部称为"Frozen v2"的芯片效率或达现有自研芯片的6至10倍,最早有望于2028年投入部署。
两位直接知情人士向该媒体透露,这一项目的直接驱动力,是谷歌内部严峻的AI算力短缺问题——这一短缺已引发内部矛盾,并迫使谷歌云拒绝部分外部客户的合作请求。Frozen v2将部分Gemini模型的决策逻辑预先嵌入芯片,从而减少运行时的计算步骤与数据搬运量,以提升响应速度并降低单位算力功耗。
谷歌发言人在声明中表示,公司团队"持续研究和探索新创新,以为用户和客户提供最高性能与效率",并补充称"并非每个项目都会进入量产,但这种严格的探索是我们全栈方法的核心"。
受上述消息提振,谷歌股价周一盘中一度上涨3.7%,最终收涨1.52%。

Frozen v2的核心设计理念,在于将Gemini模型的底层架构永久刻入芯片硅基,使其在处理推理请求时无需像通用芯片那样进行大量实时决策。
报道称,以每单位功耗可处理的token数量衡量,该芯片的效率预计达到谷歌现有最新一代自研AI芯片的6至10倍。
这一逻辑与通用AI芯片形成鲜明对比。谷歌现有的张量处理器(TPU)与英伟达的GPU类似,均设计为兼容多种AI模型,因此在运行特定模型时需要处理大量动态决策过程。Frozen v2通过预先固化部分决策,换取更高的运行效率,但代价是通用性的降低。
谷歌正在评估应将多少信息锁定于芯片之中,以在灵活性与效率之间取得平衡。知情人士指出,Frozen v2芯片仅能兼容与设计时所采用的相同底层架构的Gemini后续版本,这意味着谷歌实际上是在押注自身将长期沿用当前的Gemini模型架构。谷歌表示,芯片可支持模型权重的更新——即决定模型如何响应问题的参数设置。
Frozen项目并非全新构想。
报道称,其前身为最初由谷歌DeepMind首席科学家Jeff Dean主导的"原版Frozen"方案,该方案计划将模型权重本身直接烧录进芯片。然而,由于这一设计将使芯片仅能服务于某一特定版本的Gemini模型,生命周期过短,该方案已被搁置。
Frozen v2在此基础上作出调整,转向"弹性固化"思路——固化模型架构而非具体权重,从而在保留效率优势的同时延长芯片使用周期。
在行业参照系上,加拿大芯片初创公司Taalas采用了类似的将特定AI模型硬编码入芯片的设计理念,目前已从Quiet Capital、富达等投资方融资逾2亿美元。相比之下,SambaNova、d-Matrix及OpenAI、微软等公司也在开发推理芯片,但技术路径与谷歌有所不同。英伟达则于去年12月斥资200亿美元与推理芯片初创公司Groq达成技术授权协议,以强化自身在推理市场的布局。
谷歌明确将Frozen v2定位为TPU产品线之外的新分支,而非对其现有自研芯片体系的替代。TPU与英伟达GPU同属通用AI芯片,可兼容多种模型;Frozen v2则专为Gemini打造,两条产品线将并行发展。
谷歌目前尚无将Frozen v2规模扩产至与TPU相当体量的计划。
知情人士表示,相对有限的部署规模使谷歌得以在项目后期再引入外部设计与制造合作伙伴,而无需像重大产品发布那样提前大规模统筹。此外,谷歌也将这一代产品部分视为工程试验——为工程师积累开发更高专用化芯片的经验,尤其是在AI模型架构逐渐趋于稳定的背景下。
谷歌现有的自研芯片战略已初见成效。
今年,谷歌发布了第八代TPU,并开始将其直接向云计算客户销售,向英伟达的主导地位发起挑战。谷歌已与Meta签署数十亿美元规模的TPU租用协议,并正积极争取其他云服务提供商客户。知情人士表示,自主研发芯片已使谷歌能够以更低成本运行Gemini模型——Frozen v2若能成功,则有望将这一成本优势进一步放大。
