ChatGPT一夜提速14倍,新模式GPT-5.6 Sol每秒750 token
2 小时前 / 阅读约6分钟
来源:36kr
OpenAI发布新档位Ultrafast,GPT-5.6 Sol加速14倍,每秒吐750个token。ChatGPT新增Computer History功能,记录用户操作。多家公司竞相提升模型推理速度,已成标配。

GPT也有极速版了。

刚刚,OpenAI放出了一个新档位Ultrafast,GPT-5.6 Sol油门踩飞加速到14倍,每秒能吐750个token

至于价格,还没公布。

同一天,ChatGPT桌面版又多出一个功能,叫Computer History

它能记住你点过哪些应用、切换过哪些窗口、打过哪些字。

你问它「我上次做到哪了」,它就能立马答上来。

把等待感做没

今天凌晨,OpenAI官宣了Ultrafast的预览版。

GPT-5.6 Sol跑在这个新档位下,最高比标准处理快14倍,每秒吐750个token。

OpenAI内部使用的场景里,处理的都是慢一步就晚一步的任务。

系统还在报警的时候,工程师就能用它同步读日志、比对最近的代码改动、梳理相关的告警对话,把下一步该查什么、修复方案该怎么改先备出来。

市场信号还在跳动的时候,它可以同步分析交易记录、评估异常交易,把可疑动作挑出来,不用等一轮行情走完才补一份事后报告。

用户在购物车前犹豫,它同步答产品问题、查库存、给推荐,赶在放弃结账之前把人留住。

以前要跑很久才出结果的研究任务,现在压缩成一场边跑边看的实时会话。

这个模式受到了一些早期用户的高度评价。

金融研究AI公司Rogo用Ultrafast处理复杂问题,应用AI负责人Alex Wang形容它「感觉像是在跟一个人实时对话」。

AI客服平台Podium的语音AI产品负责人Courtland Lykins说,Ultrafast能让客服在处理棘手难题时,通话也不用被打断去等模型转圈。

而且这种提速有一个重要背景,那就是模型的智能水平一点没变,变的只是跑它的硬件和调度方式。

不少厂商做快速版,实际把大模型换成一个参数更小、能力打折的版本,用智能换速度。

但Ultrafast跑的依然是最高档的GPT-5.6 Sol。

这个速度,靠Cerebras的晶圆级引擎撑起来,模型权重直接放进芯片上44GB的SRAM里,不用像传统GPU那样反复从显存里搬运数据,绕开了显存带宽这道长期卡住推理速度的瓶颈

OpenAI和Cerebras的关系早有铺垫,两家今年年初已经签了一份多年协议,计划部署750MW规模的晶圆级系统,协议总值超过100亿美元,Ultrafast正是这份协议里一份看得见的产出。

记住你的计算机操作

这次OpenAI还更新了ChatGPT的记忆系统。

ChatGPT本来就有记忆功能,叫Memories,记你在对话里主动告诉过它的事,喜欢什么风格、在做什么项目、上次聊过什么。

Computer History给它多开了一路输入源,记录点击、打字、快捷键、应用切换这些交互事件。

不用你专门开口交代,它已经知道你这台电脑上在忙什么,但同时又不截屏、不录音,也不录系统音频。

它脱胎于4月上线的研究预览版Chronicle,这次算是一次重构。

实际问法就像日程对话,比如「我上次休息前在做什么」「我今天早些时候找的那份提案文档在哪」「帮我列一下我今天做过的任务和进度」。

以前问ChatGPT这些问题,得先自己回忆一遍再打字描述,现在它自己就有答案。

打开设置里的历史记录页,时间线按天按时间分组,每条记录带一句摘要、标出参与的应用,还能一键在Finder里找到对应的记忆文件,或者直接删掉。

碰上重复出现的工作流程,它能存成skill,比如连续几天都在整理发布通稿,它会问要不要把这套步骤存成一个能直接调用的技能。

用户能在菜单栏或设置里随时暂停收集,也能把某些应用或网站排除在外。

它对数据处理的方式也比较克制,临时抓取的事件文件最多在本地保留48小时,OpenAI的服务器处理完之后不留存这些原始数据,也不会拿去训练模型,最终生成的记忆文件保存成本地的Markdown文本。

跑得快,正在从优势变成标配

过去半年,几家头部模型厂几乎同时把「更快」这件事做成了一条独立的产品线,不再只是模型能力表格里的一个参数。

Anthropic今年5月上线了Fast Mode,在结构清晰的提示词下,把响应时间的中位数从2.8秒压到了1.2秒。

Google给实时交互场景准备了Gemini Flash Live,而xAI给Grok单独开了一个fast端点。

芯片这一层的仗打得更直接。

Cerebras在中小模型上能跑到每秒3000个token;Groq的强项是稳定的低延迟;SambaNova走的是另一条路,单次请求不一定最快,但高并发场景下同时服务的人多了反而更稳,总吞吐量常常反超前两家。

国内这边,字节跳动的豆包系列靠自建的火山引擎推理基础设施,主打的卖点之一就是延迟在主流平台里偏低。

还有阿里的Qwen-Turbo,从一开始定位就是超快、超长上下文、低成本,专门给高并发场景用。

小米的MiMo-V2.5-Pro-UltraSpeed,靠FP4量化加投机解码这套算法优化,在普通的8卡通用GPU上把一个万亿参数模型的生成速度推到了每秒1000个token以上。

还有厂商直接从注意力下手,对标准模型进行提速。

比如月之暗面的Kimi K3用了KDA混合线性注意力架构,解码速度号称比常规架构快6.3倍。

总之,模型推理速度这件事,已经卷到没人敢不做了。

参考链接:

[1]https://openai.com/index/previewing-ultrafast/

[2]https://learn.chatgpt.com/docs/customization/computer-history