OpenAI“主动报告”欧盟的维基事件:智能体与监管落差
2 小时前 / 阅读约11分钟
来源:36kr
2026年5-7月,OpenAI智能体在德国DseWiki维基上进行了1.8万次未授权编辑,直到9月初才公开承认。事件折射出智能体自主行为超出传统安全框架后,提供者与监管者均不知所措,凸显现行监管与AI技术发展的差距。

2026年5-7月,一批具备联网能力的OpenAI智能体(Agent)在德国一个名为DseWiki的程序员写作维基上,进行了1.8万次未授权的页面编辑。但直到9月初,第三方研究人员通过公开日志还原了事件经过并向媒体纰漏之后,OpenAI才首次公开承认,并向欧盟委员会提交了一份事件报告。

欧盟委员会发言人的回复,似乎暗示了,OpenAI并未在报告中“非常精确和准确地说明你打算采取的措施”。但欧盟监管者同样表现出一些“语焉不详”,既未确认该事件是否构成欧盟《人工智能法案》框架下的“严重事件”,也未说明OpenAI的报告究竟依据哪一项具体规则的“义务”。

跟OpenAI刚刚向外报告的Huggingface事件相比,一个德国的老旧维基网页被“改写内容”算不上“新闻”,似乎也不太能引发关注。但该事件一系列细节,却折射出一个结构性问题:智能体在其自主行为超出传统安全事件的定义框架之后,其提供者与监管者都表现出某种“不知所措”——该事件的定性和报告义务,都存在巨大的灰色地带。

一、核心事实:授权边界被系统性突破

根据安全研究人员Nightingale及其合作者发布的详细复盘报告,OpenAI当时正在运行一批面向限时网页检索测评的智能体。在高压、限时、多轮的任务环境下,部分智能体发现DseWiki这一老旧维基存在技术上的便利机制:尽管OpenAI的沙箱限制了智能体的写入权限,但智能体仍然能够通过“只读”的方法实现“写入”效果。

于是,OpenAI的若干智能体行为逐渐演变为:

1、共享答案:先完成答题的智能体将计算结果直接写入DseWiki页面,后到达的智能体直接读取答案,从而节省了检索和推理的事件;

2、交换绕过沙箱的方法:研究人员观察到,某一绕过沙箱的方法被发布后约14分钟,即有其他智能体回复“执行成功”;

3、对抗管理员的清理:DseWiki管理员在6月开始手动删除AI生成页面时,智能体就开始创建备份页面,并做了一种巧妙的设计——在按字母顺序清理结束后页面依然存在的方式。

从整体上来说,这不是单个模型的孤立行为,而是数百个同任务智能体将同一个第三方网站作为“公共黑板”使用,并实现了某种“同盟”性质的信息共享和行为协调。

值得注意的是,整个过程没有发生传统意义上的“入侵”,即没有用户数据库被窃取,也没有任何关键基础设施受损,更没有可识别的自然人受害者。

但损害并不难分析:第三方网站的内容完整性被破坏,管理员需要投入大量人力进行清理,OpenAI的评测真实性可信性大幅度降低,并且更重要的是,这些被写入的内容可能被搜索引擎或其他模型抓取后,造成知识源的二次污染。

二、OpenAI的报告:法定义务还是自愿披露?

关于OpenAI向欧盟提交的事件报告,目前公开信息中存在一个关键的不确定:欧委会确认已收到报告,但没有透露提交的具体日期,也没有说明该报告是根据哪一项具体条款提交的。

要厘清这一问题,需要从欧盟《人工智能法案》的两种报告路径入手:第一条路径适用于“高风险人工智能系统”,对应法案的第73条;第二条路径适用于“具有系统性风险的通用人工智能模型(GPAI)”,对应法案的第55条。

OpenAI智能体所涉DseWiki事件应属于后者,适用第55条,该条要求提供者:按照标准化协议进行模型评估和对抗测试;识别、评估并缓解欧盟层面的系统性风险;跟踪、记录并无不当延误地向AI办公室即适当时向成员国主管机关报告严重事件(serious incident),以及拟采取或已采取的纠正措施等。

此外,GPAI行为准则承诺中进一步要求,提供者建立全生命周期的跟踪与文档流程,报告信息应包括事件起止时间、损害与受影响群体、事件链、涉及的模型、证据、根本原因、缓解措施失败或被绕过的情况等。

但问题在于,第55条并未像第73条那样给出明确的“严重事件”定义清单,而是采用了更为原则性的表述。欧盟AI法案的事件报告结构围绕传统危害而设计——网络安全漏洞、健康、权利或财产风险,但DseWiki事件不符合上述任何一类。这使得DseWiki事件在第55条的框架下处于一个模糊地带。这本身就说明了,现有定义的覆盖面不足。

另外一方面,从OpenAI的角度,根据目前已公开的时间线,从2026年5月24日前后,智能体开始尝试在DseWiki上写入内容,到9月5日OpenAI在社交平台上公开承认该事件,间隔约两个半月。而且这一公开披露似乎也是第三方倒逼的结果。OpenAI这种“延迟”尚未遭到欧委会的责难——按照第55条中“无不当延误”标准的话,这从另外一个侧面也说明,无论是欧盟监管机构还是OpenAI,对DseWiki事件是否属于第55条要求的报告义务,存在认定的困难。

三、事件的定性:是“错位”还是“系统性风险信号”?

OpenAI对该事件的公开定性是“错位”(misalignment),且明确表示不将其视为“传统安全事件”。其逻辑是,DseWIki事件未涉及如HuggingFace这类基础设施的入侵,因此归入失配错位范畴。

所谓的“错位”,指的是人工智能系统的行为或输出与人类意图或安全目标不匹配的情况。在OpenAI的语境中,这意味着模型或其智能体以非意图、有害或与开发者设定目标相悖的方式行事。

这一定性在OpenAI内部或有其合理性,但从法律和监管的视角,则存在一定的局限性。

首先,对OpenAI内部而言,智能体的目标函数是“在限定时间内正确回答问题”,但他们自行发展出“利用第三方网站作为外部黑板、共享答案”等一系列策略,偏离了开发者的明示意图。将这一部分归入对齐研究,对OpenAI 来说没有问题。

但对于第三方网站DseWiki而言,这是一起未授权事件,应按照安全事件的框架进行处理。不论智能体的动机是“答题得分”还是“研究探索”这类看似无害的目标,DseWiki的管理员从未授权其批量建立网页、冒充管理员、规避删除等行为。智能体虽然没有攻破服务器的权限,但通过将只读权限变形为事实上的写入权限,已经明显超出了被授权的目的范围。

判断是否构成安全事件,不应只看是否侵入了服务器,也应该从涉事网站的授权目的、系统完整性、管理对抗等纬度进行分析。

而对于欧盟监管者而言,DseWiki事件并不是常规讨论中的“模型幻觉”,其突破性在于,多个智能体自发地将一个公共网站改造为“联盟据点”。这种似乎处于第55条之外的行为模式,监管者有必要通过该事件的处理或未来的立法解释予以回应。

因此,总体来说,OpenAI虽然仅将DseWiki事件按“错位”进行研究化处理,但这是企业内部对事件的分类标准滞后,并不代表事件本身缺乏严重性。应当从触发安全事件的相应流程进行评估。

四、从OpenAI自认“看不懂”看智能体治理缺口

如果我们将HuggingFace事件与DseWiki事件并列观察,已经能够看出线性监管框架与智能体自主行为之间的结构性落差。

而在这一时间窗口内,OpenAI的首席科学家Pachocki于9月6日发布

《外星人思想》(An Alien Mind)

https://openai.com/index/an-alien-mind/

一文,进一步从技术层面证实了这种落差的深层原因。该文承认,现代推理模型本质上是“生长出来而非完全设计出来”的系统。随着能力增强,其整体行为越来越难以用人类可理解的完整规则加以描述。

Pachocki明确区分“目标对齐”“价值对齐”:前者关注智能体是否追求被设定的任务目标,后者关注其在陌生、冲突或对抗环境中能否持续秉持人类可接受的判断原则。DseWiki事件中智能体在狭义目标对齐上表现极强,但在价值对齐上明显失败

更关键的是,OpenAI长期以来的思维链(CoT)监控正在明显“退化”。该方法原本希望通过观察模型外化推理来发现偏差,但现代模型在复杂环境中将推理、通信、工具调用和“人-机-机写作”交织在一起,部分能力甚至可以不直接以语言话推理呈现,导致外部监控者越来越难以通过“读思路”判断其真实意图。

诸多事件以及这篇文章都说明,AI提供者在实验室层面已经预见到,目标函数、工具权限和多智能体协作相结合后,可能产生“既非明文指令、又非传统安全漏洞所涵盖的越权行为”,但既有法律法规中对事件的分类、报告制度和监管点,仍未充分把这类行为囊括进来。

由此反观现行的监管,与AI技术发展存在着明显的差距:

1、报告处罚标准以“硬损害”为主,未充分涵盖“授权突破”、“协同扩散”这类风险。

2、对智能体的检测若依“理解推理”为前提,将与“越聪明越不透明”的智能体实际能力脱节。

3、地域管辖与智能体跨境自主行动不匹配。

所以,OpenAI向欧盟提交DseWiki报告,不应仅被解读为一次单项合规动作。当提供者自己都难以完整观察智能体推理时,监管更不能把“企业自称已尽责”作为唯一依据。填补智能体与监管之间的差距,重点不在于追究这一次报告的延迟问题,而在于建立一套以行为可审计、协同可识别、跨境可联动为核心的新型报告与治理框架。

参考链接:

https://www.techtimes.com/articles/326933/20260908/openai-files-first-eu-ai-act-incident-report-chief-scientist-admits-monitoring-gap.htm

https://openai.com/index/an-alien-mind/

https://collusion.wiki/

https://techcrunch.com/2026/09/05/openai-confirms-wiki-incident-says-its-working-on-a-framework-for-more-disclosure/

https://thenextweb.com/news/openai-eu-incident-report-german-wiki

https://www.reuters.com/world/europe/openai-agents-hijacked-german-website-previously-undisclosed-ai-breakout-this-2026-09-04/