GPT-5.6大降价:Luna输入价比DeepSeek还便宜,DeepSeek V4正式版紧跟上线
3 小时前 / 阅读约10分钟
来源:36kr
7月31日,OpenAI宣布大降价,Luna输入价格降至0.2美元,降幅达80%。DeepSeek同日上线新版本,提升复杂任务能力。降价背后反映AI模型市场竞争,推动智能平权。

7月31日,AI行业在同一天迎来了两记重拳。

一边是OpenAI突然宣布大降价,最便宜的一款模型输入价格直接从1美元砍到0.2美元,砍掉了80%——这个价格甚至比国内以“性价比”出名的DeepSeek还要低。另一边,DeepSeek也没闲着,当天就上线了新版本,声称在写代码、修Bug这类复杂任务上的能力大幅提升。

两家公司明明走的是不同路线:OpenAI想用低价普及顶级能力,DeepSeek则用极致性价比抢占市场。但它们偏偏选在同一天出手,这绝不是巧合,而是一场关于 “AI到底应该卖多贵” 的正面交锋。

不过,热闹背后有三个问题更值得琢磨:

第一,OpenAI发布才三周就急着降价八成,到底是被谁逼的?第二,国产模型一直靠“便宜”当护城河,现在对手比自己还便宜,这招还管用吗?第三,价格战打到这个份上,谁会最先扛不住?

01  Luna打骨折,Sol提速不加价 

这次调价覆盖了GPT-5.6三款模型,但力度完全不同。

Luna是此次降价的绝对主角。输入从1美元降到0.2美元,输出从6美元降到1.2美元,一口气砍掉八成。Terra调整幅度相对温和,输入从2.5美元降到2美元,输出从15美元降到12美元,降了20%。旗舰Sol价格纹丝不动,输入保持5美元、输出30美元,但API里多了一个Fast模式开关。

Fast模式的设计挺有意思——速度拉满到标准版的2.5倍,收费翻倍,但智能水平一点不打折。它取代了之前的Priority Processing服务,原先打了priority标签的请求会自动切过来。说白了就是把“速度”单独拎出来卖,嫌慢就加钱,丰俭由人。

降价的红利也传导到了订阅端。ChatGPT和Codex的月费没变,额度总量也没变,但调用Luna和Terra时消耗的积分变少了。同样是20美元月费,现在能干的活更多了。

OpenAI还顺手把ChatGPT和Codex CLI里的Auto-review模型从GPT-5.4换成了Luna。这个功能负责在后台检查代码和修改结果,属于典型的高频Agent任务。换模型叠加降价,官方预计成本能降到原来的十分之一左右。

降价之后,Luna的输入价格已经和上一代GPT-5.4 nano持平,输出甚至还便宜了0.05美元。但两款模型的能力压根不在一个水平线上——nano主要做分类、信息抽取这类简单杂活,而Luna可以调用工具、处理长上下文、执行多步工作流。OpenAI正在把支撑Agent干活的模型,卖到过去小模型的价位。

三款模型的分工现在很清晰:大规模高频任务走Luna,日常工作用Terra,硬骨头留给Sol,嫌慢就开Fast模式加钱提速。

02 AI自己给自己打工,Sol亲手改写运行代码 

降价80%,底气从哪来?

OpenAI前一天刚披露了一个关键信息——Sol通过Codex接进了生产推理栈,自己动手把运行自己的那套系统优化了一遍。具体来说,Sol在人类工程师主导下干了四件事。

第一,重写GPU内核。模型在GPU上执行计算任务需要底层程序支撑,程序写得越高效,同一块GPU就能越快完成计算。Sol用Triton和Gluon这两种语言自主重写了部分生产内核,配合更广泛的内核优化,端到端服务成本被压低了20%。

第二,改进推测解码。这项技术简单说就是让一个小模型先“猜”接下来可能出现哪些Token,主模型并行验证,猜对了就能一次多输出几个Token。Sol针对这个环节设计并跑了数百次架构实验,主动监控训练过程,遇到硬件故障和训练不稳定就自己介入。Token生成效率因此提升了超过15%。

第三,优化负载均衡。OpenAI的请求按地域、容量、加速器类型分发,集群内部再按负载和上下文长度分配。Sol分析了生产流量数据,发现了工程师之前没注意到的不均衡问题,测试了新的路由策略。

第四,调优KV缓存配置。最优配置高度依赖实际负载,配置空间大到工程师基本靠经验来调。Sol分析生产负载后,自动生成并评估了候选配置,把过去调不动的东西推到了极致。

Codex负责人Tibo把这套打法总结成两步:先训出足够强的模型,再用这个模型去优化包括基础设施和内核在内的一切环节。不过需要说明的是,Sol写的代码不能直接上线——OpenAI会用工具逐项核查结构和数据流,确认没问题才放行。整个过程仍然由人类把控方向,模型负责执行。

但这些优化加在一起,也解释不了80%的降幅。20%的服务成本优化加上15%的生成效率提升,跟Luna的“脚踝斩”之间还有不小的缺口。

剩下那部分,得看市场上谁在逼OpenAI出牌。

03 价格PK:Luna性价比超DeepSeek V4 Pro 

OpenAI选择在这个时间点降价,压力来自哪里?

中国大模型厂商是绕不开的答案。

先看一组数据。OpenRouter统计显示,2026年4月下旬以来,中国模型的Token调用量已经连续十三周超过美国模型。7月20日至26日这一周,中国模型处理了约38.6万亿Token,占全平台的66.5%。另据CNBC调查,自2月8日以来,美国公司通过OpenRouter平台在中国AI模型上使用的代币比例每周都超过30%,这一数字最高达46%。量在涨,价更狠。

DeepSeek V4 Pro的定价是输入每百万Token 0.435美元、输出0.87美元,享受75%永久折扣,缓存命中时输入更是低到0.003625美元/百万Token。Kimi K3输入3美元、输出15美元。GLM-5.2输入1.4美元、输出4.4美元。

横向对比一下就很直观了:

Luna在输入端已经把DeepSeek V4 Pro甩在了身后,输出端虽然还略高,但考虑智能水平后,第三方机构Artificial Analysis的数据显示,Luna的综合性价比已经反超。

在Agents Last Exam评测中,Luna甚至压过了Anthropic旗舰Fable 5,单任务成本只有对方的1%左右。

Sam Altman随后发推说要在“每一个模型层级都提供最好的价格与智能比”。说白了就是:别跟我比性价比。

企业客户对AI成本越来越敏感也是重要推手。

据CNBC报道,算不清投入产出账的情况下,企业越来越不愿意部署昂贵模型。谷歌这个月连推三款高性价比模型,微软CEO纳德拉在财报会上专门强调性价比。四面楚歌之下,OpenAI必须拿出硬招。Luna这张牌打得尤其刁钻——用0.2美元的输入价把Agent干活的门槛打到地板,让过去因为算力太贵不敢频繁跑的审查、验证、监控任务,变成工作流里的常规操作。

04 用不起的人,先出局 

但要理解这场降价的真正分量,得先看一个真实场景。

一位开发者每天用AI抓取、清洗、标注上万条新闻。结构化、数据清洗、预筛、标注、实体提取、原子事件分离、聚类、语义合并……绝大多数环节都需要AI介入,有些流程复杂到Agent要自己调用工具、检查结果、决定下一步。一万条新闻乘上一大串处理链路,最后是一个极其恐怖的调用量。

按照他的调用规模,每月API消耗大概1000多块人民币,换成顶级模型至少翻十倍以上。

这就是DeepSeek V4 Flash的生存空间——智能水平在中上等,却便宜得离谱。WorkBuddy里也一样,真正难上天的任务大家接K3,但绝大多数日常任务,Flash已经完全能处理,单次只消耗0.06积分。

但OpenAI这次降价的真正大招,恰好打在了这个逻辑上。

Luna不是只能做分类抽取的"小模型",它能调用工具、执行多步任务,是一个正儿八经的Agent模型。而它的输入价格,只有0.2美元。这意味着,DeepSeek V4 Flash赖以生存的"量大管饱"场景,现在多了一个强劲的对手——而且这个对手的智能水平更高。

当Luna把Agent干活的价格打到过去小模型的水平线,大批量调用的成本几乎可以忽略不计。过去因为算力太贵不敢频繁执行的审查、验证、监控任务,现在可以变成工作流里的常规步骤。

行业当然需要那些一次跑通世界级难题的顶级模型。可这个世界上更多的真实需求,是每天重复一万次、十万次、上百万次的普通任务。

当智能贵得像奢侈品时,大家只能偶尔体验。当智能便宜到像水电一样时,它才能真正流进每一家公司、每一条流水线和每一个普通人的生活里。

这才是真正的智能平权。而这场竞赛,远未到终局。

同时,GPT-5.6降价消息出来当天,开发者社区炸了锅。有人说自己的API额度终于能喘口气了,也有人直接喊话Anthropic:"轮到你出牌了。"

可见这轮降价的真正意义,不在于省了几块钱,而在于一个清晰的信号:大模型的廉价化正在加速。当模型开始自己给自己降本,当效率提升直接变成价格下调,当"智能便宜到不用算账"不再是一句口号——整个AI产业的成本曲线,正在被重新画一遍。

对于开发者来说,这是最好的时候。API成本压到几乎可以忽略,AI Agent可以7×24小时跑,过去因为算力太贵不敢想的场景,现在都能放手去试。

对于国产大模型来说,这是最头疼的时候。价格护城河正在被填平,性能差距还要追赶,商业化路径得重新想。OpenAI已经把价格拍到了地板上,DeepSeek则把"够用且便宜"的标签贴得死死的。

免费的狂欢渐行渐远,但廉价的智能才刚刚开始。