DeepSeek一边涨价一边开源,是又香又臭吗
2 小时前 / 阅读约10分钟
来源:36kr
DeepSeek涨价同时开源DSH,引发关注。对比V4-Pro与Codex价格及性能,V4-Pro在高峰时段仍具性价比。DSH开源提供更大控制范围,获开发者青睐。DeepSeek开源路线非仅为卖token。

前两天,DeepSeek正式涨价了。

相比于DeepSeek V4 Pro之前的价格,V4-Pro-0813的峰时价格涨到了原来的12倍。而高峰时段恰好是国人都在工作的9:00-12:00、14:00-18:00。社交媒体上有人调侃说,这下不是梁圣,是结了梁子了。

但在发布涨价公告的2个多小时之后,DeepSeek又转身开源了DeepSeek Harness(简称DSH)。这套AI Agent工作台在github上公开之后,一天突破6.6万星,截至目前已经有了接近17万星。评论区的风向又转向了梁圣。

一边涨价一边开源,甚至有人说,DSH这个价格,都不如去用Codex了。但为什么V4-Pro明明已经不再最便宜,这17万人还在追?难道DSH真有什么独到之处?

01 DSH+V4-Pro,真的不如Codex划算吗?

首先要明确,DSH是免费开源的Agent运行程序,V4-Pro是按API(开发者付费调用模型的接口)收费的模型;而Codex则把Agent工具、GPT模型和订阅额度装在一起。目前还没有一套完全对齐的「DSH+V4-Pro」和「Codex+某一档GPT-5.6」完成同一项任务的总成本、和效果对比,但我们可以先看看逐项的对比。

DeepSeek从2025年2月就开始尝试分时计价,当时DeepSeek推出夜间错峰优惠,每天夜里00:30-08:30,V3打五折、R1打2.5折。这次DeepSeek则是把「夜间低谷便宜」变成了「白天高峰更贵」。

而OpenAI在上个月末统一对GPT 5.6价格调整,降低了Luna和Terra的价格。按照每百万Token的标准API价格,Luna三项单价都低于V4-Pro;但V4-Pro即使处于高峰,仍比Terra和Sol便宜。

在单次不超过27.2万个输入token的标准计费下,Luna的缓存输入、未缓存输入和输出三项单价都低于V4-Pro。无论缓存命中率是10%还是90%,只要两边消耗的输入和输出Token相同,Luna都会更便宜。但同样地,V4-Pro即使在高峰,三项仍低于Terra和Sol。

以70%缓存命中、输出等于输入的10%为例,每100万输入token加10万输出,Luna约1.31元,V4-Pro闲时约2.78元、高峰约5.55元,Terra要13.1元,Sol约32.74元。如果三者一次就能完成同一件事,Luna这一档确实赢了。

Codex还被放进了ChatGPT订阅。已经购买Plus或Business的用户,只要没有超过额度,使用Codex几乎不会产生新账单。但Plus并非无限使用,轻度新用户如果专门花20美元购买订阅,未必比V4-Pro按量付费更省。

假设模型每读入10个token,输出1个token,缓存命中率从0到99%浮动,V4-Pro一个月的API账单要达到20美元,大约需要输入闲时2330万至8830万token,或高峰1170万至4420万token。轻度用户一个月用不到这个量,按量付费反而更省。

对比完价格我们对比一下跑分。这里来看一下两项工作能力测试的对比数据,其中Terminal-Bench测试AI能否通过命令行安装软件、修改文件并解决故障,DeepSWE测试AI能否在真实代码仓库里定位问题并完成修改。

在命令行任务上,V4-Pro比Luna高3.2分、比Terra高0.5分,只落后Sol 0.9分;但更接近代码仓库修改,它又分别落后Luna、Terra和Sol 4.5分、6.9分、10分。V4-Pro在命令行任务上没有全面掉队,但长周期改代码确实是GPT-5.6更占上风。

所以,V4-Pro的性价比真的不如Codex吗?

这个结论只对两类人基本成立。对于追求最低API单价的人,luna的价格确实要低于V4-Pro,能力则不好说;另一类则是已经购买ChatGPT订阅的人,如果你的额度用不完,那肯定是需要按量计费的V4-Pro要增加额外支出。

02 DSH不一定便宜,但是有独特的魔力

把Agent想成一台会吃饭的机器人。当我们想要Agent完成一个吃饭的任务时,skill就是告诉模型(大脑)怎样使用餐具的操作说明,MCP则是餐具柜上面统一使用的标签和取用规则,它会告诉harness:我这里有筷子勺子、能用来吃饭喝汤,你可以告诉我你要吃的是什么,来取对应的工具。

而harness收到这些消息之后,会告诉大脑。当大脑决定了使用勺子之后,还是由harness取出勺子然后开始吃饭。

在不同的harness下,即使是相同的模型做同一个任务,成功率和成本也可能发生变化。一项测试固定使用V4-Flash,Pi(一个更精简的开源harness)完成20个任务,Codex完成16个,Pi每次成功的估算成本约为后者三分之一;另一项测试固定使用GPT-5.5,Pi和Codex成功率接近,Pi成本仍然更低。

但两项测试都没有DSH参加,没办法证明DSH和Codex谁赢了。

DSH都可以通过更换能选择不同档次的模型、批量调用工具、压缩长对话,也能使用子Agent。两边都可能因为减少重复操作而省钱,也可能因为任务拆得太细、重试太多而增加消耗。

DSH的区别在于,它允许用户接入OpenAI、Anthropic、本地模型和自建服务,还把工具调用、会话存储和执行流程开放给开发者修改。用户可以根据自己的需求调整这些环节,但这只能说明DSH提供了更大的控制范围。

那DSH凭啥能在github上获得这么多星?

最主要的,是DSH连「harness怎样指挥模型干活」都允许开发者修改。

多数Agent包括codex都允许用户增加说明和餐具,但DSH连机器人的内部结构也开放了。

DSH把把这些核心环节放进同一套插件体系,开发者可以方便地替换模型,改变任务怎样记录、工具怎样调用,甚至重写整套吃饭程序。原来的流程可能是「看一眼、吃一口、再判断」,修改后可以先看完所有饭菜,再安排顺序,或者让多个Agent分别处理。

DSH还提供了一个需要主动开启的「创造模式」。机器人可以检查已有零件,临时写出一套新的动作程序,失败后换回旧版本,用完再删除。它没有改变模型的核心参数,谈不上自我进化,但确实给了开发者更大的改装空间。这也是有人把它叫作「Agent 2.0」的原因。

如果再用一个不太适合但很简单的比喻来说,codex就像苹果,而DSH就像安卓。喜欢折腾的人会觉得DSH自由,想直接干活的人,多半还是Codex省心。

03 免费开源,最后卖的还是token吗

很多人说,DSH开源就是运营商交费赠机,手机免费,但是钱变成了话费(token消耗)交给了运营商。

但其实,DSH是DeepSeek的开源路线一路走到了用户入口的结果,token收费并不是核心目的。

2025年初,DeepSeek开放R1的模型权重;一个月后DeepSeek又开放了计算、通信和存储组件;到了今年8月,DSH连Agent组织任务、调用模型和使用工具的程序也开源了。开放范围一路从模型走到用户入口,只是网页、App和API等托管服务一直保持着收费。

卖Token真的是一门好生意吗?

根据DeepSeek在「开源周活动」中发布的文件,DeepSeek披露了24小时的服务流量、成本和理论收入估算。

2025年2月27日中午到28日中午,V3和R1服务处理了6080亿输入token与1680亿输出token,输入中3420亿命中缓存。官方按H800(英伟达的计算卡)租用价估出单日成本为87,072美元;如果把网页、App和API的所有token都当成R1付费流量,理论日收入会到562,027美元,按成本计算的利润率是545%。

所以即使DeepSeek一直坚持在行业最低的API价格档次,也是有底气的。就算这次V4 Pro涨价了,它依然是全世界所有先进模型里最便宜那一档。

DSH并不强制使用DeepSeek模型,用户完全可以把它接到OpenAI、Anthropic,也可以使用公司自己的服务器或电脑上的本地模型,甚至直接用Codex账号授权。DSH还能一次完成多项工具操作,缩短反复发送给模型的聊天记录,并把简单任务交给更便宜的模型。

这些功能不仅可能减少调用次数和文字用量,也可能直接把钱「送」给其他公司。

开放权重本身也是DeepSeek发展选择的一条舒适路径。DeepSeek曾经公开承认,团队没有足够人力单独维护完整的公开推理引擎,因此把功能拆出来交给现有开源项目。

这种做法既方便其他平台支持DeepSeek模型,也能让社区参与适配、发现问题和修复代码,DeepSeek不用独自维护一套面向所有用户的公开系统。

至于「免费收集轨迹训练V4」,这真的没什么依据。DSH默认把会话记录放在本地,自动上传默认关闭。当然,用户可以主动反馈上传对应数据。

所以,「开源Harness能帮DeepSeek多卖token」,这句话确实成立;但「开源就是为了卖token」,我觉得还是小看了梁文锋。