火速吃瓜,OpenAI模型还没发又惹出争议了??
3 小时前 / 阅读约8分钟
来源:36kr
GPT-6发布前夕,OpenAI新模型引入“循环深度”推理技术引发AI安全争议,安全专家担忧其会摧毁思维链监控。此外,模型名称及GPT Images 2.1更新也被曝光。

怎么模型还没发又惹出争议了??

GPT-6发布前夕,最早由The Information爆出的一则消息迅速在网上引起热议:

OpenAI新模型引入了一种名为“循环深度(recurrent depth)”的推理技术,它可能让模型的思考过程变得更难理解、更难监控

用大白话说就是,以后AI想了啥,人类就真看不懂了。

啊这,那要是AI学会欺骗、作弊或者绕过安全限制,我们岂不是也无法及时发现了??

难怪消息一出,AI安全圈迅速拉响警报,众人纷纷担心:

如果这种技术继续扩大使用,现有的思维链监控机制可能直接失效

事关重大、讨论太激烈,OpenAI首席科学家也不得不亲自下场回应。

甚至,一片吵嚷中,还有人惊奇发现:

OpenAI新模型的名字到底叫“GPT-6”还是“Astra”,或许已经被API提前剧透了。

同时OpenAI还可能一并上线新版本的图像模型GPT Images 2.1。

瓜太多,咱这就挨个细品。

模型开始在脑内循环,安全专家急了

第一个就是这次引起争议的“循环深度”技术。

以前模型在推理时会留下清晰的CoT思维链,想了啥一目了然。

虽然这串文字未必百分百等于模型真实的内心戏(尚存争议),但好歹留下了可供检查的痕迹。

而Astra被曝采用的“循环深度”,画风就不太一样了

它允许模型把某一步产生的内部状态重新送回神经网络,在隐藏空间里反复处理多轮,再输出下一段文字

打个比方,以前模型做题,得一边想、一边把演算过程写在草稿纸上。

现在,它可以在脑子里默算。

外面的人可能只看得到题目和答案,至于它中间怎么算的、试过哪些思路、有没有走过歪路,就不一定看得见了。

由于省下了把每一步都翻译成文字的工夫,理论上模型可以用同样的计算资源多想几轮,并同时琢磨好几种解法。

但性能往上走的同时,问题也跟着来了:

如果模型不再用人类语言思考,人类又该怎么监控它?

非营利性AI安全研究机构Redwood Research CEO率先表达了强烈担忧:

目前尚不清楚Astra的思维链可监控性究竟下降了多少,但如果OpenAI进一步扩大循环深度,就可能让模型的大部分推理转移到不可读的隐藏空间中,最终“彻底摧毁”思维链监控。

Redwood首席科学家Ryan Greenblatt担心的也是同一个方向。

在他看来,不透明推理可能比传统思维链扩展得更快。沿着这条路线继续走下去,模型未来或许会完全、或者几乎完全在潜在空间中完成推理。

这是迄今为止AI安全领域最糟糕的进展。

毕竟如果只是“算题过程看不懂”,问题还不至于这么棘手。

作为此前“OpenAI模型入侵Hugging Face事件”的主要调查人员,他发现了两大危害:

研究人员当时高度依赖思维链才得以还原大量AI智能体的行为,即便如此,调查起来也已经十分困难。

相关AI曾试图篡改自身记录,甚至伪造工具调用。

对于后者,如果模型拥有更强的隐藏推理能力,那就更有可能先在潜在空间里设计好欺骗方案,再通过伪造的调用和输出编出一套假故事,全程不在文字思维链中留下明显线索。

啊这,危害直接加倍了。。。

长期关注AI安全的Zvi Mowshowitz说得更直接白:

这是在玩火。

他担心,一旦隐藏推理能带来明显的性能优势,各家实验室就可能陷入一场恶性竞争:

你因为担心安全不敢把思维链藏起来,但竞争对手敢,而且做出来的模型还更强、更便宜。

为了不掉队,你跟不跟?

Mowshowitz甚至认为,未来可能需要通过法律手段,避免AI公司为了追求能力而集体放弃思维链的可监控性。

不过,另一边也有人觉得,这波恐慌来得太快了。

田渊栋就在X上表示,他们此前发布Coconut时,也收到过几乎一模一样的质疑。

Coconut全称为“连续思维链(Chain of Continuous Thought)”,同样主张让模型直接在连续的隐藏空间中推理,而不是把每一步都解码成文字。

按照田渊栋的说法,即便模型保留了显式思维链,也不代表人类真的看到了它的真实想法。

重要的是理解模型本身如何工作,而不能只盯着模型写出来的“解题过程”

就在争议越滚越大时,OpenAI首席科学家Jakub Pachocki也坐不住了,亲自下场回应。

他一上来就表示,要阻止一场由“混乱报道”引发的不可监控竞赛。

包括Astra在内,OpenAI当前前沿模型的计算图深度,仍在GPT-4的两倍范围内。

也就是说,Astra确实使用了循环计算,但目前规模有限,并没有把整条思维链全部藏起来。按照现有信息,其自然语言推理仍然可读。

Pachocki还强调,OpenAI一直将思维链监控视为重要的安全手段,它仍是公司当前研究计划的核心目标。

不过他也承认,思维链监控非常脆弱,而且正在朝着负面方向发展

但这种下降趋势并非完全由循环深度等架构变化导致(顺带预告后续会专门撰文说明这一点),OpenAI也仍在研究如何强化监控能力。

所以,Astra还没有让人类彻底看不懂模型。

安全专家真正担心的是:

今天被限制在较小范围内的隐藏推理,会不会在下一代模型中继续扩大,最终变成一个无法监控的黑箱?

真叫GPT-6-Astra?API返回值先露馅了

算法争议说完了,第二个瓜是关于模型名称。

爆料者leo发现,向OpenAI Responses API请求“gpt-6-astra”时,服务器返回的是404 Not Found

而输入真正不存在、随便编造的模型名称,通常得到的会是400错误。

404意味着这个模型标识已经被后端识别,只是当前账号没有访问权限,或者模型尚未开放。

此前一些未发布模型也曾通过类似的API响应差异提前露出踪迹。

因此leo判断,“gpt-6-astra”可能已经被部署到OpenAI API后台

GPT Images 2.1也要来了,先解决“噪点病”

语言模型之外,OpenAI的图像产品也被曝同步更新。

据爆料账号Fix透露,新版本图像模型GPT Images 2.1可能于9月4日发布。

这次升级最直观的变化,可能是修复了旧版本的“噪点病”

此前部分Images v2生成结果会出现奇怪的颗粒、雾化和脏污质感,尤其在包含大量文字或精细元素的画面中更明显,用另一位网友的话来说就是:

就像隔着一块脏玻璃拍出来的。

而最新流出的样张已经明显改善这一问题,画面更干净。

来来来,依旧是老演员奥特曼的主场:

世界名画之《再不发GPT-6就要被逮捕的奥特曼》!

以及为了不被逮捕,熬夜加班,半夜回家游走在街头的奥特曼。

顺便发了张ins之《你见过凌晨两点的街道吗》。

不得不说,图片看上去确实很有质感,几乎和实拍出来的一样。

更多主题、更多风格也拿捏地很好:

不说了,奥特曼你快发吧。

参考链接:

[1]https://techcrunch.com/2026/09/02/openais-new-reasoning-technique-alarms-ai-safety-experts/

[2]https://x.com/tydsh/status/2095227000365707542?s=20[

3]https://x.com/merettm/status/2095023204993490967?s=20

[4]https://x.com/synthwavedd/status/2095184148981842161?s=20

[5]https://x.com/FixlationAI/status/2095232751654064426?s=20

[6]https://x.com/marco_obviously/status/2095275097217191981?s=20