摘要:
过去,高性能模型遥遥领先,而即便是性能较差的模型也可能依靠低价拿下一定市场份额。但在DeepSeekV4系列、Gork4.6等主打性价比的高性能模型发布后,这种单纯的发展路线大概是要正式告吹了。
凤凰网科技 出品
作者|Dale
编辑|董雨晴
酝酿了多时,DeepSeek最强模型终于揭开面纱。
8 月 12 日深夜,DeepSeek 官网 API 文档悄然换版——模型版本从 V4-Pro 预览版切换为“DeepSeek-V4-Pro-0813”。
最先发现变化的依旧是开发者们。随后,一张评测对比表从 DeepSeek 官方群流出,AI 圈的深夜被彻底点亮。
需要注意的是,备受关注的Harness依旧保持悬念。凤凰网科技检索平台信息发现,“DeepSeek Harness团队”公众号已于今年7月6日正式注册,公众号认证主体为“北京深度求索人工智能基础技术研究有限公司”。
8月1日,DeepSeek内部Harness团队负责人崔添翼曾面向全球公开征集Harness内测用户,优先筛选具备Agent Harness开源项目经验的开发者,申请人需提交代码托管平台账号与代表作品。
据测试过的开发者表述,“参与内测并深度体验2天后,我愿称DeepSeek Harness为宇宙最强”。
就在V4 Pro正式发布六天前,DeepSeek刚宣布计划近期整体上调 API 服务定价,“预计涨幅较大”。而DeepSeek V4 Flash的极致性价比,才刚刚在海外留下深刻的印象。
一边是性能追平全球顶尖模型,一边是预告大幅涨价。这家以性价比横扫市场的公司,正在讲述一个截然不同的新故事。
0.1 分的距离,与全球最强模型厮杀
这张刷屏的评测表显示,Terminal Bench 2.1,一项衡量 AI 智能体在真实终端环境中完成复杂任务能力的测试,V4 Pro 正式版拿到 87.9 分。全球第一的 Anthropic Fable 5 是 88.0 分。差距只剩0.1。
作为参照,上一版 V4 Pro 预览版的成绩是 72.1 分。三个月,有了15.8 分的跃升。
此外,还有两项反超。在 AI 安全智能体基准 Cybergym 上,V4 Pro 拿到 83.3 分,以 0.2 分的微弱优势压过 Fable 5 的 83.1;在工作流智能体测试 AutomationBench 中,31.8 分对 29.1 分,同样胜出。而在衡量软件工程能力的 DeepSWE 上,分数从预览版的 12.8 分跃升至 62.7 分,接近原来的五倍,超过了 Anthropic 上一代旗舰 Opus 4.8 的 58.0 分。
需要说明的是,这些数据目前来自 DeepSeek 官方群及社区流传,官方尚未发布 V4-Pro-0813 的正式更新日志,严格来说应视为非官方披露。但多个信源交叉体验印证,提升幅度真实可感。
智能体是理解这次升级的关键词。与传统大模型比拼知识问答和数学推理不同,Terminal Bench、DeepSWE 这类测试考察的是 AI 能不能真正干活—— 调用工具、执行多步骤任务、编写和修改代码、在长链条中持续推进直到交付结果。这正是大模型从聊天玩具走向生产工具的核心门槛。
据DeepSeek官方API文档,V4 Pro 正式版支持 1M(百万)Token 上下文长度,最大输出 384K Token,支持非思考与思考两种模式,并兼容 OpenAI 和 Anthropic 两种 API 格式。这意味着开发者几乎不需要修改代码,就能把原本调用 Claude 的应用切换到 DeepSeek 上。
这一次更新的时间点也非常有意思。就在 V4 Pro 上线前几个小时,马斯克旗下 SpaceXAI 发布了 Grok 4.6,在面向真实知识工作的 GDPVal-AA v2 评估中以 1753 Elo 登顶,超过 Fable 5 的 1741 和 GPT-5.6 Sol Max 的 1728。两款主打高性价比的模型同夜撞车,不约而同地将矛头指向同一件事:让 AI 在长任务中稳定交付可用成果。梁文锋与马斯克双强对垒,纷纷拿出兼具高性能与高性价比的产品,真正感到有压力的恐怕还是OpenAI与Anthropic。
目前,Fable 5 每百万输出 Token 定价 50 美元,GPT-5.6 Sol Max 为 30 美元,Grok 4.6 为 6 美元,而 DeepSeek V4 Pro 仅为 0.87 美元 —— 约为 Fable 5 的五十七分之一。
0.1 分的跑分差距背后,是五十七倍的价格鸿沟。这个等式,足以让每一个开发者重新审视自己的技术选型。
一张涨价预告函的底气
此次DeepSeekV4 Pro的性能表现,也在一定程度上解释了六天前涨价的底气。
8 月 6 日,不少开发者登录 DeepSeek API 后台时看到一行提示:“计划近期整体上调 DeepSeek API 服务的定价,预计涨幅较大,请合理安排您的使用。具体方案以正式通知为准。”
这也是 DeepSeek 首次预告整体上调 API 价格,而非此前针对高峰时段的局部调整。
市场之所以震动,是因为 DeepSeek 过去一年的形象,恰恰是“价格屠夫”。
梳理其今年的定价时间线:4 月 V4 发布时,V4 Pro API 以 2.5 折优惠上线;5 月 31 日优惠结束后,直接永久降至原价的四分之一,输入(缓存未命中)3 元 / 百万 Token、输出 6 元 / 百万 Token,较首发价降幅达 75%;6 月 29 日又引入峰谷计费,工作日高峰时段价格翻倍。
从永久降价到预告大涨,中间只隔了两个多月。
DeepSeek 当然有自己的难处。OpenRouter 的数据显示,7 月 27 日至 8 月 2 日当周,DeepSeek V4 Flash 以 7.11万亿 Token 的调用量位居全球第一;另据开源项目 OpenCode 统计,仅 8 月 1 日一天,V4 Flash 处理量就达到 8 万亿 Token。8 月 4 日,该模型甚至因前所未有的访问量出现容量不足。
调用量是蜜糖,也是负担。每一次 API 调用背后都是真金白银的算力消耗,长时间低价跑量,持续吞噬的是现金流。
但如果只把涨价理解为“扛不住成本”,可能低估了DeepSeek的意图。
一个容易被忽略的细节是:仅仅两个月前的 6 月 16 日,DeepSeek 刚刚完成成立以来首轮外部融资,募资总额超过 500 亿元人民币(约 74 亿美元),投后估值突破 500 亿美元,创下中国 AI 行业单轮融资纪录。其中,创始人梁文锋个人出资约 200 亿元,为最大出资方。最新消息显示,DeepSeek已在推动第二轮保底 100 亿元的融资。
手握重金却选择涨价,这更像是一次主动的定价策略切换,而非被动的成本转嫁。
摩根士丹利 8 月 9 日发布的研报给出了三个驱动因素:其一,V4 模型需求旺盛,支撑了更强的定价能力;其二,厂商需要在市场份额与毛利率之间寻求平衡,以持续投入前沿模型研发;其三,更多使用国产芯片可能带来更高的推理成本。
报告认为,模型智能,而非价格,才是大模型竞争的终极壁垒。当 V4 Pro 在 Terminal Bench 上距 Fable 5 仅差 0.1 分时,DeepSeek 已经有资格为这份“足够接近”收取溢价。
价格战的终局信号
DeepSeek 的涨价,不是孤例。
把视野拉到整个行业,这条涨价曲线也已经浮现。据摩根士丹利统计,以字节跳动、阿里、百度、腾讯、智谱、月之暗面、MiniMax 及 DeepSeek 为样本,中国大模型平均 API 输出价格已从 2025 年一季度的约 12.2 元 / 百万 Token,回升至 2026 年二季度的 21.9 元 / 百万 Token。
拐点早已出现。今年一季度,智谱 API 定价较去年底累计上调约 83%,但调用量反而增长了 400%—— 量价齐升,说明开发者愿意为更强的模型付费。7 月,月之暗面发布 Kimi K3 后 48 小时内请求量超出预估,逼近集群承载极限,直接暂停 C 端新用户订阅以全力扩容。腾讯在 3 月至 4 月间两轮上调模型 API 价格,部分涨幅高达 463%。MiniMax、阿里云等也相继收紧免费额度、调整计费方式。
据 36 氪报道,过去两年国内大模型赛道深陷 Token 价格厮杀,厂商靠压低接口报价抢占开发者与企业客户。但进入 2026 年下半年,算力供需、芯片采购成本、运营成本持续走高,单纯靠低价换规模的模式难以为继。
逻辑其实并不复杂。有行业分析指出,Agent 任务的算力消耗是普通对话的十到一百倍,而当模型开始真正进入企业的生产流程——写代码、做分析、跑流程——客户对价格的敏感度会让位于对可靠性和能力的要求。智谱涨了 83% 依然供不应求,已经说明了问题。
摩根士丹利将其概括为一个飞轮:更强的模型带来更多收入,更多收入支撑更大投入,更大投入再次推高模型能力。头部厂商可以随时推出低价轻量版本覆盖大众市场,但中等厂商想要向上突破至顶尖水平,难度完全不在一个量级。
这或许才是 DeepSeek 深夜换版的真正注脚。它先用 V4 Pro 证明自己“能干活”,拿到了与全球顶尖模型同台竞技的入场券;再用一纸涨价预告,测试市场对“中国智能”的支付意愿。
当然,考题也随之而来。涨价之后,那些对成本极度敏感的中小开发者是否会迁移?“涨幅较大”究竟是多大?在 Grok 4.6 等同梯队选手仍以低价猛攻的背景下,DeepSeek 的定价权能维持多久?
这些问题,会在涨价正式落地后才能回答。但有一点可以确定:当最擅长打价格战的玩家开始收枪,中国大模型行业的竞争逻辑,已经翻过了一页。
(本文题图为AI生成)
