终于,Astra 来了!
今天,OpenAI 正式发布 GPT-6 Astra。ARC-AGI-3 打到 99.9%,FrontierMath Tier 4 拿下 97.6%。
数字在这里开始有些苍白。
OpenAI 总裁 Greg Brockman 在发布会上喊出:Welcome to the AGI era.
Fable 5.1 的 SOTA 只有可怜的两天。
9 月 1 日,Anthropic 刚把 Claude Fable 5.1 推上王座:Ramp 让它连续跑了 38 小时,中途发现训练数据标签有错,自己改掉,自己开六组实验,自己写结论。
9 月 2 日,谷歌发了 Gemini 3.8 Flash,外部实测在多项编码基准上够到 Claude Opus 5 那一档。
DeepMind 核心研究员姚顺宇评价:对模型是一小步,对递归自我改进是一次巨大的飞跃。
9 月 3 日,GPT-6 Astra 落地。
三天,三颗炸弹。放在两年前,随便哪一颗都够行业消化一个月。
而这还不是最让人紧张的部分。
GPT-6 Astra 的发布背后,藏着一段略显坎坷的故事。
8 月 7 日,OpenAI 发了一篇措辞罕见的声明——
它能独立发现此前无人知晓的系统漏洞,独立编写攻击代码,独立完成从入侵到深层渗透的全过程。
为此,OpenAI 甚至暂停了两周的强化学习训练。
Altman 发表长文:我们暂停了一些前沿 RL 训练,以确保达到新能力水平所需的对齐、安全和监控标准。
刹车本身就是信号。
就在 GPT-6 发布的前两天,马斯克和 Altman 在 G20 峰会上的发言,几乎可以当作这一周的注脚。
马斯克视频连线,原话是:AI will just crush all humans at software.(人工智能将会在软件领域彻底碾压)
他给了一个明确的时间表——未来 12 到 18 个月,AI 在软件上将达到Stockfish 级别,像国际象棋引擎碾压顶尖棋手一样碾压人类程序员,并且在所有形式的工程和一切数字事务上都会极其出色。
AI不仅会击败人类,还将训练人类。
Altman 把 AI 比作电力:说一个国家不要 AI,其糟糕程度大约相当于一百多年前说我们不要电。
但紧接着他也说了另一句话:担忧是有道理的。担忧是我们预判问题的方式。除非人们非常紧急地行动,否则网络安全方面会出很大问题。
然后 GPT-6 落地了。ExploitBench 满分。
奇点已过,进入 ASI 冲刺期
去年是新智元十周年,我们说 2027 年 AI 抵达 ASI 临界点。
一年过去了。METR 那条AI 独立完成任务的时长每七个月翻一番的曲线不但没有放缓,最新数据显示翻倍速度可能已经加快到每三到五个月。
38 小时的连续自主运行已经是事实。ARC-AGI-3 满分已经是事实。ExploitBench 满分已经是事实。
我们未必已经抵达 ASI。但我们已经进入通往 ASI 的超高加速段。
奇点已至。现在是 ASI 冲刺期。
新智元的 logo 像一个黑洞的视界。十一年,我们站在视界边缘,记下所看见的。
今天再往前看,像走到了地图失效的地方。再往前,旧的刻度、旧的榜单、旧的更新周期,都不够用了。
十一年前我们点燃第一束烛光时,ASI 还是遥远的词。那时候,把看见的记下来就够了。
这个时代,媒体得先有一套观测工具,才谈得上记录。
模型的坐标散在几十个地方。跑分在 LMArena、Vals.ai、MathArena、SWE-bench 这些榜上,价格在各家定价页和 OpenRouter 上,社区在全球各处吵。
同一张榜,单 Agent 和多 Agent 并行的分能差好几个点,厂商发布稿只挑高的那个写。
结果就是两种:每天焦虑地刷消息,越刷越乱;一种干脆不跟了,等别人告诉他结论。
不过,两种都不该是 2026 年的读法。
所以我们干脆让 Agent 来干这件事。让它持续追踪、整理、校准来自不同数据源的变化,不睡觉,不漏拍。落点只有一条——
你不用自己刷遍全网,也不会错过 ASI 重要的坐标变化。
我们决定做一个 ASI 坐标系
所以我们决定做一套新的 ASI 观测系统。
不是半年更新一次的榜单。不是发布后就静止的文章。是一张每天重新变化的坐标图。
它叫新智元 ASI 坐标系。
十几家独立数据源、29 个二级指标,归到 7 个维度——智能、推理、知识、编码、Agent、经济、效率,合成一个 0 到 100 的总分。
十几张榜换算到同一把尺上,才有得比。多源交叉验证,任何单一数据源在全体系里不超过 15%,没有哪张榜说了算。
其中,核心模块叫 ASI 今日看板。回答的是:今天全球模型坐标发生了什么变化?
谁上升,谁下降。能力、价格、速度有什么新动静。每天一张,看完就知道今天该重新认识谁。
重点在今日,它一直在更新中。
为什么GPT-6 Astra
能拿89.1分?
GPT-6 Astra 是今天刚官宣的,OpenAI 的开发者文档才挂上去,它就已经进了我们的看板,分算完了,排在第一。
昨天这一轮里它还只是GPT-6 灰测的传闻,今天一官宣,几路证据一凑齐,立即直接进官网。
它只盯最近 7 天新上线的文本大模型。
数据来源一共五路。第一路,是OpenRouter 模型目录,看上架时间、价格、上下文长度。第二路,LMArena 周榜快照,看模型第一次出现在哪周。第三路,我们自己的模型库,有发布日期的以它为准。第四路,新智元公众号当天和前一天的文章,按厂商名和「发布、上线、版本号」这类关键词筛标题,拉正文,再从里面提取模型能力信息。
能力图七个维度就是坐标系那七维:智能、推理、知识、编码、Agent、生态、经济。
今天的排名:
GPT-6 Astra 89.1 分第一;
Claude Fable 5.1 84.9 第二;
Gemini 3.8 Flash 81.5 第三;
Muse Spark 1.3 78.9 第四。
GPT-6 Astra的89.1分怎么算出来的?
这里一共关注四项:能力、 关注度、可用度、新鲜度。
其中,能力占大头,贡献 47.5 分。
关注度贡献 22.6 分, 公众号的发文数和阅读量全部拉满。可用度只贡献 9 分,是四项里最低的,因为GPT-6 Astra刚刚官宣,普通用户还用不到。新鲜度 10 分, 今天上线,所以满分。
过去是模型发布、编辑看新闻、等第三方评测,评测出来热点已经过了。
现在是它一官宣,早上机器自己把证据凑齐、图画好、分算好推到官网上。GPT-6 上线第一个早上,我们已经在分析它了。
其他栏目,包括秒追 ASI,回答的是:刚刚发生了什么?
新模型发布,版本上线,跑分更新,价格变化,实验室关键动向。机器人逐秒抓取,人类编辑一分钟内裁定。抓到即成条,最近三天滚动。
ASI 爆点,回答的是:今天全球 AI 社区在争论什么?不看谁声量大,看什么最热,每小时同步一次。
三个模块,三个时间尺度。秒追管秒,爆点管小时,看板管天。
ASI 启示录放每日深度和 Top 10 热文,视频和直播也在。上线之后,慢慢逛。
9 月 7 日,见
9 月 7 日,新智元十一周年。ASI 坐标系官网正式上线。
有些东西值得等,我们想让你先知道它。
所以这条评论区,也是这套系统上线前的需求入口。
在 ASI 官网正式开放之前,我们想知道一件事——
面对越来越快的模型迭代,你最希望每天看到什么?最新跑分?价格变化?模型能力的升降?还是社区里真正的爆点?
欢迎留言告诉我们。
这一次,我们不再按月回望 AI。从今天开始,按秒追踪 ASI。
