大模型价格战下半场:将推理价格打下去
2 小时前 / 阅读约8分钟
来源:36kr
DeepSeek等大模型厂商降价,推理芯片成主要成本。企业通过算法优化和国产芯片采购降低成本。自研推理芯片难度大,涉及研发、迭代速度和生态支持等问题。

“买一批设备回来,10个月收回成本就够了,希望能以合理价格买到芯片,这样就不用自己做芯片了”,近日在投资会上,DeepSeek 创始人梁文峰道出了自己的苦恼,现在的芯片价格太贵了,无法满足DeepSeek对于大模型低成本的需求。

值得注意的是,在本次投资会之前,就有媒体爆料称:DeepSeek开始自研定制的推理芯片,已经秘密启动一年时间,并与芯片设计公司、晶圆代工厂及存储厂商展开多轮接洽。

从中我们不难看出,主打低价格的DeepSeek正在遭遇芯片的成本危机,随着AI大模型的商业落地和Token的大规模调用,曾经被边缘化的推理芯片正在取代训练芯片,成为AI大模型厂商的主要成本支出。

那么对于以DeepSeek为代表的主打低价格的大模型厂商来说,如何进一步降低推理芯片的价格,将成为大模型企业的核心竞争力。

【1】DeepSeek带动行业降价

2026年,对于国内大模型产业来说,是集体降价冲刺的一年:

5月23日,DeepSeek宣布将V4-Pro模型的“折扣优惠”正式变成了永久性的“降价通知”,原先2.5折的专业版模型API调用价格,变成了“永久2.5折”;此后更是推出类似电价的峰谷定价机制,根据不同时间段动态调整API价格;

5月28日,小米旗下MiMo-V2.5全系列API接口永久下调资费,部分细分调用场景降价比例逼近99%,并宣布不再区分上下文窗口长度,统一按低价计费,解决开发者长文本处理的成本焦虑。

6月底,腾讯云平台内上线的DeepSeek-V4全系列模型同步下调调用价格,最高降幅达到97.5%、第三方入驻模型MiniMax-M3推理输入、推理输出、缓存命中三项费用,各项降幅均为50%。

这波降价幅度有多大?以DeepSeek为例,经过调价后,其专业版百万Tokens的价格直接降到0.025元,价格只有Minimax M2.7价格的5.8%。

价格成为杀手锏,企业和用户开始用脚投票,对于大多数需求来说,使用成本往往比性能参数更重要,OpenRouter数据显示:在调低价后,DeepSeek-V4-Flash模型登顶全球调用榜,而在此之前,DeepSeek旗下 V3.2/R1等大模型排名最多达到第三名。

(来源: DeepSeek官网 ) 

为什么对外部融资不感兴趣的DeepSeek却能做到低价格?原因有两点:

一是利用精妙的算法和工程优化,大幅度降低了算力成本,如处理百万级Token长上下文时,V4系列算力消耗仅为上代产品的27%,缓存机制降低了10%,真题训练成本降低了10%;

二是摆脱对英伟达的依赖,采购国产算力芯片,如华为昇腾节点全系列产品已支持DeepSeek V4系列模型,降低了算力芯片的采购成本。

可以说,在软件算法和采购国产硬件双管齐下的情况下,DeepSeek等国内厂商加速了AI在商业上的应用。

【2】推理芯片成为价格限制期

DeepSeek等国内大模型厂商的降价,让AI大模型的行业发展有了另一条世界线——处理简单任务时,用户更加考虑处理的成本,因此会选择价格更便宜的大模型,而当处理的问题更复杂时,用户会使用追求高性能的OpenAI等高价格模型。

但随着模型创新和国产替代带来的价格优势逐渐缩小,DeepSeek、小米MiMo也已经触碰到了天花板——推理芯片越来越费钱,成为现在乃至未来AI大模型的主要成本支出。

这意味着,如果企业打不掉推理成本,就无法将AI普及。推理芯片对于大模型的价格影响体现在两方面:

一是采购数量和采购成本,此前大模型厂商是以模型训练为主,但随着AI商业化逐步落地应用,行业的玩法变了。推理芯片成为大模型厂商的采购主力。

阿里云在“2026年算力倍增计划”中,AI资本开支中,推理芯片的采购预算占到总预算的60%;Meta预计将在2026年底建立60万张GPU等效算力的推理集群,占到其AI总预算的55%……

“约70%—80%的AI算力用于训练,20%—30%用于推理,但是未来这一趋势会倒过来,用于推理的AI算力将占到70%以上”,在今年五月的联想业绩发布会上,联想集团董事长兼CEO杨元庆表示,推理芯片的时代即将来临。

二是全生命周期的成本,与一次性投入的训练芯片不同,推理芯片因为要回到用户问题,所以其成本产生是长期的,而且会随着用户问答数量的飙升而飙升,有数据显示:在生产环境中,推理芯片投入占大模型生命周期计算成本的80%至90%。

短期内采购量大+全生命周期费用占比高,让推理芯片成为AI商业化落地时代下最重的成本。

因此对于DeepSeek这类走低价格经济路线的大模型厂商来说,能不能降低推理芯片价格,就成为未来发展的关键。

【3】推理芯片自研很有难度

其实降低推理芯片的成本已经有很多企业在做了。

在完成首轮510亿元外部融资后,DeepSeek公布了该笔资金的用途,其中之一就是自研AI推理芯片,降低成本。

今年6月,OpenAI发布了与博通联合开发的首款定制推理芯片Jalapeño,以替换掉英伟达推理芯片,从而降低约50%的推理成本。

(来源:互联网) 

Anthropic就从OpenAI挖来了其自研芯片团队的早期核心成员Clive Chan,负责整个AI推理芯片的自研。

几乎所有大厂都将自研推理芯片作为优先选项,但自研这条路并不轻松,甚至会耽误大模型企业的进展。

首先是研发难度,AI大模型企业擅长算法架构这类软件层面,AI芯片此前只是上游的工具,如今要自研AI推理芯片,是要从软件领域跨界到完全陌生的硬件领域,需要在人员技术上重新积累。

其次是芯片厂商的迭代速度,相比大模型厂商,华为昇腾、寒武纪、英伟达这类AI芯片厂商有技术基础,他们对接整个大模型行业,能够根据市场需求快速研发生产,而大模型厂商只是针对自身需求定制推理芯片,再加上研发能力与芯片厂商有差距,这就可能导致出厂即落后的情况发生。

最后自研推理芯片最大的难题在于没有生态支持,以英伟达为例,其AI芯片除了算力性能外,更重要的是超过400万开发者的CUDA生态,这意味着,有庞大的开发者愿意适配芯片框架,愿意采购,进而增加芯片的采购量,从而降低成本。

而智普AI、DeepSeek等大模型企业自研芯片,它们没有生态,只能给自己用,无法依靠数量均摊研发成本,会让整个芯片成本居高不下。

可以说,对于智普AI、DeepSeek来说,自研推理芯片最难的不是研发,而是生态和产能,只有解决算法迭代、芯片流片、产能排期、用户生态这四个方面后,才能真正实现用自研推理芯片降低每百万Token推理成本的目标。

2026年的AI大模型行业,已经从“能不能做出好模型”的工程师时代,进入了“能不能把成本降到足够低”的工业时代。而AI大模型厂商能不能推出并使用自研推理芯片,这关系到这些公司是一家AI产品公司,还是一家AI时代的基础设施公司。