8月12日深夜,

与此同时,根据第一财经报道

另一方面,在DeepSWE测试集上,预览版仅得12.8分,基本属于“不会做”的水平;正式版直接飙到62.7分,涨幅接近5倍。
这个测试集是衡量代码Agent能力的核心基准。同样翻倍的还有DSBench-Hard,从31.1冲到67.2;DSBench-FullStack从41.8提升到71.1。
如此这般的性能提升,将其称之为
硬件规格上,V4 Pro延续了MoE架构设计,总参数规模1.6万亿,每次推理激活约490亿参数。接口侧提供100万 token上下文和最高38.4万 Token 输出,这两个数字对普通聊天可能意义不大,但对长任务Agent却是硬刚需。
尤其是大型代码库、长时间运行的日志以及连续工具调用,都会快速吃掉上下文。窗口不够大,Agent就只能不断压缩记忆,压着压着,前面做过什么也忘了。
调用方式保持不变,模型名仍然是deepseek-v4-pro,老用户的代码一行不用改,后端就自动切换到了新版本。
价格方面,0813版每百万token缓存未命中输入3元、输出6元,和预览版时期一致,并没有随模型转正而同步上调。
而就在不久前,
自
就好像西红柿涨价、鸡蛋涨价、糖涨价,结果西红柿炒鸡蛋反而比以前更便宜了。
2025年的时候,
但是现在今年7月31日V4 Flash正式版上线以后,行业叙事改成了“每任务/单位智能的价格”,
根据Artificial Analysis的测试,在完成相同水平任务的前提下,
落在斩杀线上的竞品,只剩两条出路,要不然主动大幅下调定价,或者干脆放弃普惠开发者市场,收缩到预算充足的高端企业客户。
于是各家厂商的处境变得很微妙。短期内没办法提高智能水平,又舍不得开发者市场,降价就成了唯一能立刻执行的防御手段。
OpenAI是最典型的例子。GPT-5.6 Luna 7月9日才上线,7月30日就宣布降价80%,输入价从每百万token 1美元砍到0.2美元,输出价从6美元砍到1.2美元。一款刚发布的新旗舰,上市不到一个月就打两折,这也是无可奈何的事情。
OpenAI在降价当天同步发了一篇技术博客,称GPT-5.6 Sol自己重写并优化了部分生产推理内核,把端到端模型服务成本压低了约20%,token生成效率提升了15%以上。
这就使得它能把省下来的钱,直接变成给用户的降价补贴。换句话说,OpenAI这波降价,是被自己模型写代码省下的成本托起来的。
不过成本降低20%和提升15%生成效率这两个数字,似乎跟降价80%匹配不上。
根据OpenAI的投资人披露,该企业单季营收57亿美元,同比增长约3倍;经营性亏损93亿美元,当期现金消耗(实际烧掉的现金)37亿美元,相当于每赚1美元收入就要烧掉约0.65美元现金。当季研发支出高达86亿美元,整体毛利率仅39%。
并且市场预测,OpenAI在2026年的全年经营性亏损约为140亿美元。
因此,无论如何OpenAI发布的技术报告内容如何,如果没这条斩杀线,这笔效率红利大概率会先进利润表,而不是变成用户账单上的折扣。
Anthropic也有相似的反应。Claude Opus 5发布后,其定价改为了5美元/25美元,正好是Fable 5的半价。Sonnet 5首发优惠价2美元/10美元,比标准定价低了三分之一,优惠期一路延到8月31日。
随着
谷歌7月21日一口气发三款 Gemini Flash 轻量模型,主力款3.6 Flash当天宣布输出价永久下调17%。
国内更是放血式促销,8月11日,智谱把GLM Coding Plan全员额度重置回满,再叠1.5倍限时加成;火山引擎给 GLM-5.2开出四倍折扣系数,49元的套餐能换到五千多万token;OpenRouter上GLM-5.2的三家供应商互相压价,从60%打到80%,再到95%。
逃避斩杀线的路有两条:一条往下走,一条往上走。
往下走是防御,是承认自己在这个区间和
在
以Kimi K3为例,于2026年7月16日正式上线,本身就发布在DeepSeek V4 Flash之后,其 API 定价为:国际版输入3美元/百万token、输出15美元/百万token;国内版输入20元/百万token、输出100元/百万token。
对比上一代旗舰K2.6,K3国内版的输入价格上涨了208%,输出价格上涨270%
但是有个事得提前说明白,如今已经2026年过半了。
Artificial Analysis的智能指数里,V4 Flash只得了50分,明显低于
这就使得在复杂推理、长链路任务、多步规划、需要深度领域知识的判断,这些超级硬核的任务上,
斩杀线扫过的是“够用就好”的那片海,在“必须万无一失”的那片土地上,
不过这个斩杀线其实也维持不了多久,因为“推测解码”越来越成为了主流。这也是为什么,所有大厂都要研发旗舰模型的同时,开发一款极其便宜的小模型。
所谓推测解码,是指2022年时,谷歌Research团队的亚尼夫·利维坦(Yaniv Leviathan)、马坦·卡尔曼(Matan Kalman)和约西·马蒂亚斯(Yossi Matias)曾在论文《通过推测解码实现Transformer的快速推理》(Fast Inference from Transformers via Speculative Decoding)中提出,用一个小模型快速出草稿,大模型只负责并行验证和修正,草稿命中率一旦稳定在80%以上,旗舰模型的有效推理成本就能降到原来的1/3到1/5。
但以前这项技术不太能降低成本,原因在于以前给旗舰模型配草稿,用的是7B、13B的通用超小模型,命中率上不去,所以价格就打不下来。
可推测解码仍然是业内公认最可行的方向,这才使得大家都备有一款小模型。
现在来看,推测解码逐渐走向成熟。2026年6月
随着DSpark的成功,势必会有越来越多的厂商部署推测解码,以实现更快更便宜的效果。
除了推测解码外,还有一个技术也可能会降低模型成本,那就是静态知识剥离。
这个技术其实起源更早,它是Meta AI的帕特里克·刘易斯(Patrick Lewis)等人在2020年论文《面向知识密集型NLP任务的检索增强生成》(Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks)中提出的。
简单来讲,它就是让模型在思考的过程中,把事实性知识从参数中拆出去,只靠外部检索补充。这样整个思考过程就会更快,成本因此更低,并且由于外部引入知识,还能让输出结果幻觉更少。
不过真正把这个技术发扬光大的依然是
论文的观点是,语言建模本质上包含两类完全不同的任务,一类是需要深度动态计算的组合推理,另一类是检索静态知识,但Transformer把这两件事混在一起做了。
于是论文就依照静态知识剥离的逻辑提出了一个叫做Engram的技术。
打个比方,在考试的时候,让大模型背下所有公式、历史年份、名人身份、地理常识。然而这就导致大模型只能用一部分的脑容量来解题。背得越多,能用来思考的脑容量就越少。
Engram干的事就是把闭卷考试改成开卷考试。它在模型中间插了一本“速查手册”,遇到 “戴安娜王妃是谁”、“张仲景是什么朝代的”这种事实性问题,不用现场一层层推导,直接翻手册,一秒查到。
这样,模型的脑容量就可以全部用来做真正需要动脑筋的事,比如解数学题、写代码、做逻辑推理。
Engram一旦成熟,也将大幅减少模型成本。
随着
可截止发稿,
甚至就连官方的更新日志,也停留在

除了这些迹象外,权威评测机构Artificial Analysis上线了V4 Pro 0813(最大推理强度)的独立评测页,综合智能指数为53 分。相比预览版的45分确有提升,和GLM-5.2齐平。
但问题在于,53分这个档位和Fable 5差了很远,无法匹配跑分表中的“接近甚至超过Fable 5”。
作为参照,同一天发布的Grok 4.6还拿到了61分。

不只是Artificial Analysis,在比较模型数学能力的Proof Bench上,作为靠数学能力而声名鹊起的

更有一些个人评测者对V4 Pro正式版进行了深度的测试,均表示实测效果皆不尽人意。
AI博主牙医就发文表示“刚发的
他进一步表示,“我这个测试总计50轮, 让模型不断优化代码, 结果他在3次测试中, 2次都在42-43轮左右的情况下停止了. 并未用完全部机会. 而且目前成绩来看, 甚至没打过 GLM-5.1 (仅我这一个case, 我不对其它case负责).”

以最常见的“鹈鹕测试”为例,提示词为“Generate an animated looping SVG of a pelican riding a bicycle. Wheels spin, pedals move, pelican’s legs pedal correctly, smooth infinite loop, no javascript, use native SVG animateTransform only.”(生成一个循环动画SVG:鹈鹕骑自行车。轮子旋转、踏板转动、鹈鹕的腿正确踩踏板,平滑无限循环,不要JS,只用SVG原生animateTransform动画。)
我将相同的提示词分别发给
0813这个版本号本身可能只是一个“占位符”。
换句话说,
此前,
在

目前看来该Harness产品还未发布,并且
模型的斩杀线会下降,但
2026年5月,
在V4 Flash正式版的API文档中有这么一段内容,对于公开基准测试中的Code Agent任务,正式版用的是
也就是说,V4 Flash能拿下Terminal Bench 2.1的82.7分,严格来说是“
V4 Flash预览版在Terminal Bench 2.1上是61.8分,同期V4 Pro预览版是72.1分。显然,DeepSeek Harness在Agent任务上,给DeepSeek模型带来了质的飞跃。
82.7分其实是一个非常高的分数。Terminal Bench 2.1目前的SOTA是GPT-5.6 Sol的88.8分,Kimi K3是88.3分,Claude Opus 5是84.3分,所有参评模型的平均分是77.3分。
正如前文提到的,V4 Flash是一个轻量模型,和Fable 5、GPT-5.6 Sol对比的应该是旗舰模型V4 Pro。那么可想而知,一旦DeepSeek Harness和V4 Pro正式版上线,势必会迎来一个新的斩杀档位。
更值得注意的是,国内玩家已经全部挤进了这条赛道。
除了DeepSeek外,智谱的ZCode也是一款Coding Harness,只不过它针对的是智谱自家的GLM,8月11日一口气上线了Goal、Subagents、Remote Control、闲时任务四大功能。
在智谱自研的Code Bench中,在复杂跨文件任务上,GLM-5.2配合ZCode,要比GLM-5.2配合Claude Code,整体通过率高出2.39 %,缓存命中率超过98%,有效 token 量提升约30%。
西红柿在涨价、鸡蛋在涨价、糖在涨价,结果西红柿炒鸡蛋反而便宜了。可是我们都清楚,这个逻辑是有问题的,至于它会持续多久,没人说得明白。
