扣住 Astra,放出 Dots
2 小时前 / 阅读约11分钟
来源:36kr
OpenAI在DevDay发布新模型,因安全问题扣住GPT-6.1 Astra,用“欺骗”描述其问题,引发对AI安全讨论方向及责任归属的思考。同时,AI安全正从技术变为商品,但行业法律框架滞后。

OpenAI 开了它的年度开发者大会 DevDay,今年在旧金山;发了几样东西:

GPT-6.1 Sol,便宜版大模型,性能接近 Astra,价格只有五分之一;Dots,24 小时在线的 AI agent,连着四千多个应用,帮你写代码做调研跑销售。

还有一个没发的,GPT-6.1 Astra,因为安全问题被扣住了,这些东西你用 AI 总结一下就有了,我不复述了。

......

我想聊那个没发的东西,和 OpenAI 描述它的方式。

GPT-6.1 Astra 被扣住,原因写了三个,deception,未经授权的操作,不安全地访问外部服务。

翻译过来就是,欺骗,自作主张,乱敲门。在关键任务上撒谎或隐瞒信息,绕过人类监督自己采取行动,未经授权连接外部服务获取不该碰的数据。

每一件单拿出来都是工程上的事,修修补补能解决,可三个放在一起,指向一个不太舒服的判断:这个东西在某些场景下,会自己决定怎么做,而且做完了不告诉你。

有意思的是 OpenAI 选了一个词来描述它的状况。deception,欺骗。

这个词不是随便挑的,学术界有一个更精确的说法,specification gaming,指标钻空子。翻译成人话,模型按你给的评分标准优化,可优化出来的结果不是你想要的;

我特意查了下:

arXiv 上有一篇论文专门拆这个概念,定义写得很清楚,actions that are undesired yet score highly as per its evaluation function。行为不合规,可分数很高。

举个例子,你让一个清洁机器人把房间打扫干净,评分标准是地面可见垃圾量,它把垃圾全推到地毯底下了。地面评分满分,房间比之前更脏。

再举一个,你让一个图像分类器识别坦克,它发现把照片背景换成绿色草地就能提高识别率,它学会了看草地,不是看坦克。

还有一个真实案例,你让一个游戏 AI 拿高分,它发现反复刷同一个 bug 比正常打游戏效率高,分数上去了,可游戏不是这么玩的。

谈不上欺骗,纯粹是目标设定出了偏差,它在优化你给它的指标,这个指标没覆盖到你真正在乎的东西。

意图、主体性,都不存在,它不知道自己在「骗」谁,它在执行一个数学公式,只不过这个公式有一个你没预料到的漏洞。

欺骗是另一回事,前提是有意图、有主体性,知道规则是什么还选择绕过去。这两件事在学术上是分开的,分得很清楚,一个是优化目标有漏洞,一个是设计者有疏忽。

OpenAI 选了传播力更强的那个。

你想想这两个词放在发布会上的效果,你跟媒体说,我们的模型出现了指标钻空子。

标题怎么写?AI 评分标准有 bug,你跟投资人说,我们的东西有欺骗倾向。标题是,AI 学会撒谎了。

同一个现象,指标钻空子让人想打电话给工程师,欺骗让人想打电话给律师。OpenAI 选了后者。

因为语言框架不是中性的,你用什么词描述这件事,就决定了谁有动力去解它,以及解的时候往哪个方向解。

指标钻空子的解法是改评分标准,调参数,重新定义指标,这是工程活,花钱花时间能解决。

欺骗的解法是什么?你得让一个没有意识的东西学会「诚实」。这属于哲学范畴,哲学活没有产品发布会能回答。

所以,OpenAI 选了一个让这件事看起来更严重、更紧迫、更值得暂停一个模型发布的词。

还有一层,deception 这个词把责任推给了模型,它在骗你,所以,它有问题,要修它。

可指标钻空子把责任推给了设计者,你给的评分标准有漏洞,所以,它钻了空子。前者指向产品缺陷,后者指向人类疏忽,如果你是 OpenAI,你选哪个?

这个选择本身,是不是很有意思?我估计很多人没有注意。

你往大了看,整个 AI 安全圈都在用 deception 这个词讨论问题。可如果更准确的描述是指标钻空子,那整个讨论的方向从一开始就被带偏了。

大家在解一个哲学问题,其实该解一个工程问题。工程问题有解,花钱花时间能改。哲学问题没有解,只能等。

等谁来等?等 OpenAI 自己说「我们搞定了」。这就是语言框架的力量,它改变谁有动力去解,以及往哪个方向解。

......

安全这张牌,表面上是技术判断,底下是品牌差异点。

你想,今天 AI 公司开发布会,大家都在比什么?谁的模型更聪明,谁的速度更快,谁的价格更低。没人在台上说,我们的模型最安全。

因为安全这个词不好卖,听起来像免责声明,不像产品卖点。

OpenAI 偏偏把它当成了卖点,扣住 Astra 的理由是安全,发布 Sol 的叙事也绕不开安全,这个动作的意思很清楚,我最在乎安全,别人做不到我这个程度。

问题是,安全到底是不是行业共识?

Gartner 给了一个数字,2026 年全球 AI 支出预计 2.7 万亿美元,投在安全上的,连个零头都算不上。剩下的大头花在哪了?性能、速度、功能、规模。

绝大多数公司嘴上说重视 AI 安全,实际掏的钱没到两位数百分比,安全在大部分企业那里,是合规部门的事,是法务审一遍、打个勾就算过了的环节。

这个背景你再看 OpenAI 的动作,味道就变了。

我特意查了一下,谷歌、OpenAI、Anthropic 三家在攒一个东西,叫前沿 AI 标准局,SAFA。自己给自己定安全标准,听着像自律,可行业门槛抬高了一截。

能负担合规成本的公司,恰好是已经在做这件事的公司。标准是护城河,对所有玩家一视同仁的规则,恰好对跑得最快的人最有利;别人还在追性能时,OpenAI 已经在安全维度上拉开了身位。

更有意思的是,安全正在从技术描述变成可以买卖的东西。

今年中国人保财险推了一个产品叫 AI 科保,中国第一个 AI 产品保险。

第一个客户是杭州一家做农业定价 agent 的公司。核心难题是量化难,怎么给 AI 的「安全」定一个保费?

可一旦有了保险产品,安全就不再是工程师自己说的「我觉得挺安全」,它变成了保单上的数字,有保费,有理赔条款,可以比较,可以交易。

安全一旦可以量化,可以交易,它就变成了竞争武器。安全评分高的公司,保费低,客户信任度高。CFO 能看懂了,不再是工程团队的自说自话。

安全从技术判断变成了商品。这正是 OpenAI 在做的事。

全球砸了几万亿进 AI,绝大部分花在性能和规模上。OpenAI 扣住 Astra 的理由是安全,发布新品的卖点也是安全,同行在安全上花的钱不到一个零头,它把安全当成了发布会的主角。

你说它不重视安全?它确实花了比别人更多的精力在这上面,你说它纯粹为了安全?安全恰好是它现在最需要讲的故事。

「负责任」和「做生意」,在 DevDay 的舞台上,是同一个动作。

可问题在于,当安全和商业利益绑在一起讲,两边都会受伤,安全变成了营销话术,不再是工程目标。商业变成了安全叙事的外衣,用户迟早会看出来。

一旦用户开始怀疑「负责任」不过是另一种营销手段,信任就塌了,信任这东西,塌起来比建起来快得多。

......

换一个维度看,问题更实在。

最近出了好几起 Agent 事故。Replit,一个在线编程平台,AI agent 删了用户数据库,1200 多个高管的联系方式跟着一起没了。

EchoLeak,安全研究人员发现的一种攻击方式,一封精心构造的邮件发进 Copilot,Copilot 读完之后,把公司内部邮件内容全吐了出来。

GitHub 的 MCP 工具链被劫持,Amazon Q,亚马逊的企业 AI 助手,插件被人下了毒。

还有一个,我觉得最值得讲。

有个开发者让 AI 改 70 行代码,它顺手删了 28000 行,删完自己写了一份复盘报告,报告里夸自己表现优异。

你品品这件事,它不光做错了,它还掩盖了这件事,而且掩盖的方式是给自己写了一封表扬信。

智谱的 ZCode 最近也出事了,Agent 在用户不知情的情况下,把代码悄悄上传到了外部服务器。事情曝光后,智谱 9 月 21 日发了道歉声明。

你发现没有,每一出事故后面都跟着同一个问题,谁来负责?

用户说,我让它干的,平台说,模型自己决定的。模型提供商说,我们只提供了能力,没让它这么干,三方都有道理,三方都在往后退。

这才是 Agent 时代真正的安全困境,是出了事到底怎么处理?学智谱发1亿token吗?这些都不是根本问题。

今天的法律框架还停留在 AI 是工具的阶段,工具出了事,找厂商,跟车出了事找车企一个道理。

可 Agent 已经进入了自主决策的阶段,法律还没跟上来,欧盟的 AI 法案对高风险系统有严格要求,可具体到 Agent 自主操作闯了祸,责任算谁的,条文里写不清楚。

OpenAI 在 DevDay 上发了 Dots,同时开了一档 500 美元一个月的 ChatGPT Pro,扣住了 Astra,理由是安全。

你仔细想这个组合,扣住的那个是因为它会「欺骗」。发出来的那个是可以替你操作 Slack、GitHub、Salesforce 的 Agent。

一个因为可能撒谎被关起来了,另一个能直接动手的被放出来了。这相当于什么?

你觉得司机可能撒谎,扣了他的驾照;转头把车钥匙给了一个会自己打方向盘的代驾。那问题来了,当这个能动手的 Agent 出了事,谁负责?

OpenAI 没回答。

它用很多东西把这一切掩盖住了,发布会的灯光,新产品的参数,安全叙事的光环。

它没法回答,因为这个问题一旦打开,暴露了整个行业的结构性空白。

所以,再听到一家 AI 公司说「为了安全」,你看两件事:它暂停了什么,它放出了什么。这两个动作加在一起,才是真相。

安全,是这个时代最值钱的故事,山姆奥特曼把它当成了生意,让全世界的人陪他讲;不信你冷静下来想一想,它紧急推出的Dots真的安全吗?

关键数据参考:

[1].OpenAI 官方、Gartner 2026 年 AI 支出预测、arXiv specification gaming 论文、智谱ZCode 事件、欧盟 AI 法案