出品|虎嗅科技组
作者|黄天媛
编辑|苗正卿
头图|AI生成
AI圈真是喘口气的时间都不给留。
北京时间9月23日,Anthropic刚把Claude Opus 5.5端上桌。2小时后,OpenAI立马祭出GPT-6 Sol和Luna迎战。
Opus 5.5比上一代Opus更强了,输入、输出单价也比上一代低了20%。而GPT-6 Sol两项单价只有Astra的五分之一;Luna更夸张,每百万输出Token只要0.5美元。
不过,这轮交锋最有意思的地方,不止降价。
Opus的能力提升,把自家Fable的位置弄得有点尴尬。OpenAI推出更低单价的Sol和Luna,想扩大用户的使用范围。但模型思考时间久了,最后可能花得反而更多。
Opus一升级,Fable先坐不住了
Opus 5.5是Claude 5.5系列第一个登场的模型。
Anthropic给它的定位很高——大多数任务能做到Fable 5.1级别,典型工作负载成本比Opus 5低约40%,而输出速度还快了30%以上。
我们翻了翻Opus 5.5的跑分。
在Anthropic公布的Terminal-Bench 4.0测试里,Opus 5.5拿到66.4%,Astra是57.9%,Fable 5.1是55.8%。到了FrontierCode,Opus又以54.4%小幅领先Astra的53.3%。
但在跨应用工作流测试AutomationBench和科学Agent测试里,领先的仍然是Astra。各项测试的推理设置也有差异,离“全面打爆”还有一段距离。
比跑分更直观的,是Claude Code负责人Boris Cherny分享的一次代码迁移案例。
他们让Opus 5.5和Fable 5.1分别把HAProxy(虎嗅注:一种把网络请求分配给多台服务器的软件)从C移植到Rust(虎嗅注:C和Rust都是编程语言,这项任务相当于用另一种语言重写软件,同时保留原有功能)。
两个模型都通过了几乎全部HAProxy测试,但Opus用了9.5小时,Fable用了12小时,而Opus的成本还低了51%。
当然,这是Anthropic内部分享的单项任务结果,不能代表所有项目。
但对开发者来说,活儿差不多,速度更快,钱还少一半。
这比别的好像都重要。
最先感到压力的,可能就是Fable 5.1模型了。
它的标准API输入、输出价格分别是每百万Token 10美元和50美元,Opus 5.5则是4美元和20美元。
如果手头的活儿Opus已经能干好,用户愿意为Fable多花这笔钱吗?
OpenAI摊开价目表
OpenAI的打法有所不同。
Astra把持最高能力的位置,Sol负责复杂编程和Agent工作流,Luna接高频、相对集中的任务。
它贴心地照顾到了不同预算的用户。
按标准API价格,每百万Token输入、输出分别计算,Astra是10美元、50美元;Sol是2美元、10美元;Luna只有0.1美元、0.5美元。
同样是一百万输出Token,Astra收50美元,Luna收0.5美元,差了100倍。
对于每天要调用成千上万次的产品来说,简单工作场景的分类、提取、批量处理任务里,便宜模型只要够用就行。
第三方机构Artificial Analysis的测试也给出了实际成本变化。Sol在其测试中的单任务成本从上一代的1.99美元降到1.06美元,Luna则从0.18美元降到0.07美元。
单价降了,账单可不一定
确实是普降价格了,但你可别上来就急着把推理强度拉满。
Artificial Analysis测试显示,Opus 5.5在max档的能力指数达到58分,但平均每项任务生成约11.9万Token,其中约8.4万是推理Token。
同一机构测试里,max档每项任务成本是5.98美元,high档则是1.82美元,对应能力指数54分。
为了多拿这4分提升,成本涨了不少。每个Token便宜了,但推理强度拉高后,模型可能生成更多Token,最后的账单未必更低。
Sol和Luna也出现了Token消耗增加的情况,不过,降价抵消了这部分增量。
Artificial Analysis的评测也显示,Sol和Luna这次省钱,主要靠的是靠降单价,没有省消耗。
在该机构的测试中,相比各自上一代模型,Sol每项任务平均生成的Token从约2.9万增加到3.1万,Luna则从约4.1万增加到5.1万。虽然消耗更多,但由于单价降低,Sol的单任务成本仍从1.99美元降到了1.06美元,Luna则从0.18美元降到了0.07美元。
此外,能力也没有每项都涨。
在Artificial Analysis的编程指数中,Sol从55分升到57分,Luna则从43分降到41分。
接地气的变化
除了价格,这次还有个很接地气的变化。
Anthropic专门强调,Opus 5.5这次会把重要信息放前面,减少行话,改善过去又长又密的表达。
毕竟,干活已经够忙了,谁还想先读一篇AI的工作感想。
但“去啰嗦化”做得怎么样,用户的反馈并不一致。
沃顿商学院教授Ethan Mollick在早期测试后,认可Opus 5.5已经有了Fable级模型的感觉,同时也指出,近期Claude语言过于密集的问题,还没完全解决。
另一边,不少开发者已经开始整活。
Anthropic工程师Addy Osmani用一只Three.js里的骑车鹈鹕庆祝发布。小鸟踩起踏板,比一屏参数容易让人记住多了,这一波手搓动画的效果也让不少人感叹其视频动画能力的提升之大。
但热闹归热闹,对普通用户来说,真正决定你留下哪个模型的,还得回归性价比。
同一件事,谁能少返工几次、少花一点钱,谁才一直能够留存用户。
大模型还得卷一会儿。
