美国知名播客主持人德瓦杰什·帕特尔(Dwarkesh Patel)最近邀请三位在前沿AI公司工作的研究者,围绕AI递归自我改进(RSI)的 技术瓶颈与前景展开了一场深度讨论。三位嘉宾分别来自不同的"准开放"公司,愿意在公开场合讨论真实的技术判断和分歧。
他们分别是开源AI公司Zyphra首席技术官贝伦·米利奇(Beren Millidge)、Thinking Machines首席科学家约翰·舒尔曼(John Schulman,OpenAI前联创,曾主导了催生ChatGPT的人类反馈强化学习(RLHF)工作),以及模型训练平台Baseten模型训练负责人查理·奥尼尔(Charlie O'Neill)。
关于RSI是否会到来,三位嘉宾存在分歧但有一个基本共识:当前的技术路径存在多个尚未解决的瓶颈,RSI不会像一些人预期的那样迅速发生。米利奇认为最可能的阻碍来自监管而非技术,舒尔曼指出模型的"品味"和长期判断能力仍然显著弱于人类,奥尼尔则认为关键卡点在于AI能否自主设定研究目标,而非仅仅优化已有目标。
关于中国实验室的追赶,几人的讨论指向几个结构性因素:蒸馏本身只需要少量轨迹就能复制能力,是对抗中心化的主要力量。前沿实验室从大型数据公司购买数据,中国公司也能买到同样的数据。而真实世界的用户分布比RL环境本身更重要,这让前沿实验室在RL环境上的优势可能没有想象中大。
关于强化学习(RL)的有效性,米利奇指出大量被归因于RL的成功实际来自中间训练,RL本身只是策略微调,但其信噪比远高于监督微调(SFT)。奥尼尔则发现RL带来的主要泛化不是横向的(训练数学不会让你变成最好的程序员),而是时间跨度上的,模型学会了在更长的任务上持续工作。
关于时间线,嘉宾们的判断差异显著:AI成为全面远程工作者需要一到三年,对AI研究者的10倍生产力提升需要两年左右,AI在所有领域超越顶级人类专家需要三到十年。
以下是米利奇、舒尔曼以及奥尼尔访谈实录,经腾讯科技编辑整理,在不改变原意的情况下有删减调整:

帕特尔:如果到了2036年,世界上并没有出现数十亿个疯狂运行的超级智能,最可能的技术原因是什么?排除政治冲击、战争或禁令这些外部因素。
米利奇:有一种类“莫拉维克悖论”的可能性。AI可能在所有基准测试上都表现出色,但始终存在某种顽固的Sim-to-Real Gap(即从仿真到现实的鸿沟),阻止它真正实现泛化。
如果泛化元学习都难以实现,持续学习也搞不定,那AI可能永远只是在benchmark上极其厉害,但在真实世界中差一口气。不过说实话,我们在实践中已经能看到RL带来的泛化迹象,所以我认为这个场景概率不高。更可能的阻碍来自监管。
(注:莫拉维克悖论是AI领域的一个反直觉现象,简单来说就是计算机搞定高难度逻辑推理很容易,但模仿人类简单的感知和动作却很难。)
舒尔曼:每次新模型发布,人们都会惊呼"这就是AGI",但用一个月左右就开始觉得它蠢。这个循环可能还会继续重复。即便模型能写比人多得多的代码,也不意味着你的生产力提高了100倍。你仍然会被模型薄弱的环节卡住,被它判断力不够好的地方卡住。
奥尼尔:对我来说,核心问题是当前的Transformer+RL这套方案,离全局最优解到底有多远。人们想象,一旦你有一个比所有人类都强0.1%的AI研究员,再乘以几十万个并行实例,就能压倒一切瓶颈。
但如果需要另一个类似当年从预训练扩展定律到RL那样的不连续性突破,当前的方法未必能发现它。如果这个突破离当前范式太远,不管跑多少个LLM都未必能找到。
帕特尔:你觉得这个突破会比2012年以来的任何突破都难吗?
奥尼尔:如果我们知道答案,大概就已经能实现它了。但关键问题是:这个突破是累积性的、在当前范式之内能找到的,还是需要彻底扔掉梯度下降和神经网络?如果是后者,不管跑多少个LLM都未必能发现。
帕特尔:我想提出一个反面观点。如果深度学习沿着过去十多年的路线继续发展,未来几年却仍无法让AI主导科研,这反而会很奇怪。瑞安·格林布拉特认为,AI一旦能通过模拟持续提升研发能力,可能很快跨过人类研究水平,就像国际象棋AI跨过人类Elo后出现的断层。
米利奇:我同意。如果AI没有跨过去,最可能的解释是它在接近人类水平时出现能力瓶颈,或者受到强力监管。相比技术瓶颈,我认为后者更现实。
奥尼尔:关键在于,科研有两种。一类目标明确,可以不断优化。另一类需要提出全新的问题和范式,而这些目标本身无法提前定义。后者才是AI真正难以突破的地方。
帕特尔:人类在AI研发中最后被自动化的环节是什么?
米利奇:最难自动化的不是执行实验,而是迭代地问对问题。AI能替你做任何实验,却未必知道该做哪个。让它们谈研究,抛出的多是零散的小步子——擅长推进已有方向,不擅长判断哪个方向值得推。
奥尼尔:选对方向甚至比技术发现更稀缺。从DeepMind“用玩游戏解决智能”,到Radford“试试预测海量数据的下一词”,中间不只是技术本身,还有缩放定律的提出,以及相信它可被可靠预测。即便Radford发现了方向,人们也过了很久才决定押注。发现方向、相信方向、押注方向,每一步都可能卡住。
舒尔曼:定义目标,决定我们到底想要什么。即便AI能做所有技术工作,我们仍然需要决定AI助手应该怎么表现、什么才算有帮助、RLHF的目标是什么。
对齐本身可以拆成两部分:目标的设定和目标的实现。前者短期内不会被自动化。你想想一个后训练团队为什么需要那么多人,就是因为有太多不同的领域需要搞清楚模型应该怎么表现。
帕特尔:为什么模型提供商没有出现大幅整合?很多因素都指向集中化。
舒尔曼:蒸馏是对抗集中化的主要力量。任何可以通过RL学到的东西都很容易被蒸馏,因为它只需要少量数据。如果你能从模型获取展示某种行为的轨迹,你就能很容易地蒸馏它。还有一个值得关注的现象。
一些中国公司可能在使用代理服务,这些服务原本是为了让中国用户访问被封锁的美国前沿模型。这些代理服务在收集和出售数据。这对蒸馏来说是非常有用的数据集,因为它提供了完美的prompt分布。
米利奇:前沿AI实验室从大型数据公司购买数据,中国公司也可以从同样的数据公司购买同样的数据。他们能买到完全相同的数据,再加上蒸馏,跟进其实相当容易。
奥尼尔:据此可以做一个具体预测。Sonnet 5和Opus 5在某些方面客观上不如GLM-5.3和
帕特尔:那真实世界部署就比环境更重要?
舒尔曼:我提供一个不同的假说。环境有两个维度:难度和真实性。提高难度比较容易,创造大量高难度的类谜题任务就行。
但真实性是另一回事,需要人类反馈来定义奖励函数。如果蒸馏只在"刷基准"的分布上进行,学生模型可以匹配大模型在所有benchmark上的表现,但在更广泛的真实场景中表现更差。
大模型可能从窄任务到真实任务的泛化能力更强。这可能也能解释Anthropic一些较小模型的问题,比如Sonnet 5。当然也可能是他们在后训练栈上不断调整,某些东西调得太高,产生了benchmark上看不出来的怪癖。
帕特尔:第一个能自动化AI研发的模型,会是怎么训练出来的?
舒尔曼:大概是两种方式的组合。从人类反馈中学习研究者的品味,同时创建大量涉及多步骤研究项目的练习环境。每一轮迭代,修补上一轮中最坏的部分。研究者会大量使用AI,注意到它们的一致弱点,然后通过收集人类反馈或创建环境来修补。
奥尼尔:目前的实际操作方式是,我们走到谱系的最前沿,把公司过去几个月在训练栈中发现的bug变成环境。你需要在前沿上训练和进步,所以你把之前所有的历史都锁定。
你可以想象一个世界,你把时间线回滚到GRPO之前,然后设计环境让AI去发现最优的RL形式。但我认为我们仍然会受算力瓶颈限制,所以大家会继续待在前沿上,把最近几个月的进步diff出来变成训练环境。
这本质上就是蒸馏。你总是试图追赶过去三个月的进展。这些进展当然有AI的贡献,但人类仍然在循环中。感觉就像在不断地、一寸一寸地逼近人类研究者的水平。
米利奇:但有一个关键区别。在轨迹上蒸馏永远无法超越教师。但环境可以远超人类能力。设计一个人类无法解决但AI可以尝试的环境,非常容易。比如你说损失需要达到1.3,没有人类能现在做到,但这是一个极其可衡量的、可验证的任务。这才是超越人类AI研究的路径。
舒尔曼:很多研究并不像在明确目标上爬坡。更多时候是这样的:我们对模型应该如何改进有一个直觉,有一个算法idea大致朝这个方向走。于是我们设计一个任务来检测这个方向上是否有生命迹象。如果有,再逐步构建更真实的版本。你不是在直接优化你最终关心的目标,你是在放松你的目标,先在不太真实的场景中找到有效的方法,等方法成熟后再回到真实性。
帕特尔:目前实验室的赌注,是不是在数百万个环境、数百个领域里扩展RL训练,让AI学会持久性、信息整理、协作等通用技能,最终成为可以独立工作数周甚至数月的“远程员工”?但这种方式只在模拟环境里学习,真的够吗?
奥尼尔:我觉得现在很难判断这些努力有多少是为了RSI,有多少只是为了打造更强的通用模型。后者的话,这确实很可能是实验室正在押注的方向:先从编码开始,再扩展到金融、PPT等领域,逐步覆盖更多工作场景。
帕特尔:但如果模型足够擅长上下文学习,为什么还需要针对金融等领域单独训练?
舒尔曼:因为领域训练可以让模型运行得更高效。即使模型能临时学会,也可以通过RL把这些知识和技能直接烘焙进权重。
米利奇:而且两件事可以同时做。领域训练本身不贵,学到的能力也可能迁移到RSI。既然算力和参数都足够,实验室当然会一边强化通用能力,一边训练高价值领域。
帕特尔:任务的时间跨度越长,就越难在数据中心里模拟。AI最终需要运营企业、打官司、做交易。如果sim-to-real的迁移不够好,模型在样本效率上的巨大差距会不会成为根本性障碍?
奥尼尔:我把任务分成两类。累积型的和非平稳型的。RSI是累积型的。一旦你发现了注意力机制,发现了混合专家模型,发现了GRPO,你就把它们加到训练栈里,这就是你的了。
OpenAI训练5.6 Sol/5.6 Terra时不需要重新发现注意力,它基本上就是调用pre-training.sh和post-training.sh。但真实世界的工作不是累积型的。想象一个法律事务所里的AI智能体。你需要在上下文中记住所有关键人物之间的关系,这些关系还在不断变化。你有各种隐性的做事方式、找信息的途径。这不像RSI那么干净。
帕特尔:RSI恰好比律师助理容易,真是太不幸了。
舒尔曼:模型的弱点来源是多元的。有些确实与样本效率有关,比如在某个中等长度的区间内,人类能比模型更高效地做权重更新。但也有一些弱点与此无关,比如思维多样性低于人类,或者在某些长期判断上表现不佳。很多人说的"品味",其实是关于什么系统在长期内可维护、能运作良好。
帕特尔:如果给模型一个万亿token的上下文窗口,把一个人到做RLHF之前的全部经验都塞进去,品味问题解决了吗?
米利奇:理论上,如果模型能在长上下文上有效学习,应该是可以的。人类发展品味并不需要极长的时间。一个PhD大概五年,做了10到30个研究项目,但品味发展得相当快。AI显然会有远超人类的经验来发展品味。问题在于这能在多大程度上泛化到真正长周期的任务上。
奥尼尔:关于持续学习,当前的技术困境是这样的。在宏观层面,把部署数据放进中间训练是有效的。但当你放大到微观层面,试图用少量数据对单个模型做持续微调时,所有方法都有点崩溃。你会看到灾难性遗忘,看到基础模型能力的退化。SFT和on-policy蒸馏都太具破坏性。RL在注入能力方面很好,因为它只改变模型非常小的一部分,但这也限制了RL能做的改变量。
米利奇:如果你永远持续训练同一个基础模型,它最终会渐近。你没法永远在同一个基础上学新东西。这就是为什么大家最终还是要从头训练新模型。从头训练很贵,但如果你有了所有新数据,用同样的模型大小从头训练,它会更好。瓶颈不在于容量,而在于可塑性和灾难性遗忘。
帕特尔:如果AI能自动化所有实验执行,但仍然需要人来决定做什么实验,这算RSI吗?
米利奇:这其实是RSI能否发生的关键问题。要让任何自我驱动的自动化循环运转起来,AI需要自己提出目标、优化目标、再提出新目标,而且在很长的时间里都不能跑偏。人类觉得“自己决定该做什么然后去做”这件事很容易,但这可能恰恰是进化花了很大力气才解决的问题。对AI来说可能意外地难,就像运动控制对我们来说很难但数学很容易一样。
奥尼尔:我区分两种研究。一种是目标已经明确定义的研究,比如降低预训练损失。如果当时有AI来分析Kaplan的缩放定律,它应该能立刻发现他们用了中间检查点但没有考虑退火,这是错的。
这一个观察就能省掉一到两年的进展。在目标明确的场景下,我估计AI可以带来10倍加速。但我不认为这能泛化到“一开始就找到正确目标”这件事上。光靠思考不能给你正确的目标。
舒尔曼:我分享一个来自OpenAI早期的认知。当年我直觉上觉得,仅仅最小化对数损失不会带来智能。因为重要的部分在损失中占比太小,会被噪声淹没。我们需要设计更好的目标函数。
但结果证明,下一个词预测就是work了。大多数人画不出他们看过的场景的逼真复制品,所以我们以为模型也需要更好的目标。但它就是学会了。整个领域高度依赖泛化,而泛化很难预测。最重要的进展往往是那些我们没权利期望的分布外泛化。
帕特尔:我和普林斯顿学生杰里·韩(Jerry Han)做了一个实验,把2019年至今的所有训练方案与所有数据集进行交叉训练。结果显示,数据解释了约12倍的计算效率提升,而架构改进只解释了约3.7倍。你们怎么看?
奥尼尔:低垂的果实可能已经差不多摘完了。我们已经拿到了互联网这一大块数据,但互联网上真正有用的数据并没有以同样的速度增长。
同时,这里面还有一个有意思的缺口。Epoch估计,自2019年以来每年大约有3倍的改进,7年下来应该是2000多倍。那么,剩下的100倍从哪里来?这大概能告诉你,后训练到底贡献了多少。
米利奇:我觉得,在大规模训练中,数据其实更重要。架构更像是一次性的突破,它可以把你带进一个全新的区间。但进入这个区间之后,数据才是主角。
举个例子,如果没有GQA,我们一直使用全注意力机制,那么百万级上下文的成本会高到无法承受,我们根本用不起百万上下文的数据。架构负责打开新的区间,但如果只在较小的上下文规模上做naive对比,就会低估架构真正发挥的作用。
帕特尔:到2030年,前沿模型会有多少活跃参数?
奥尼尔:未来几年可能不会大幅增长。推理效率对RL扩展至关重要,而瓶颈仍然在环境。你会根据预训练数据量决定模型大小,再根据RL环境的难度进行调整。
理想状态是,在最难的环境上拿到一个还不错的pass@1。如果把模型做得更大,却只能增加推理成本,那就没有太大意义。我猜Mythos和GPT系列的参数规模可能远没有达到人们讨论的10万亿级别。通过和开源模型做一些简单对比,大概也能推断出这一点。
舒尔曼:我预计模型还会继续变大,因为人们还在不断扩大算力,GPU的规模也在增长。但具体会增长到什么程度,取决于scaling law中一些反直觉的部分。
数据效率会成为比架构选择更重要的驱动力,尤其是在高质量预训练数据即将耗尽的情况下。稀疏性也是一个有意思的变量。参数量和活跃参数是两种不同的资源,我们目前还没有真正理解稀疏性为什么有效,以及它最终会在什么水平趋于稳定。
帕特尔:一年前,很多人认为RL无法成功扩展。我和舒尔曼各自的论文都指出,RL每个episode只给模型一个bit的信息,当通过率很低时,模型几乎学不到任何东西。但看看现在的模型。到底发生了什么?
米利奇:RL的成功有几个被低估的因素。
首先,大量我们归因于RL的成功,其实来自非常好的中间训练数据。中间训练已经把模型带到了最终RL检查点的大约80%。RL在此基础上做的,本质上只是策略微调,并不需要从头学习所有行为。
其次,这些bit虽然少,但信噪比极高。在SFT中,你必须匹配模型生成的每一个推理token,因此会得到大量关于另一个模型如何推理的信息。RL只给你一个bit,反而意味着这个信号不会被其他bit的噪声淹没。这相当于大幅提高了训练信噪比,也是RL在训练步数上如此高效的原因。
还有一点,即使只有几个bit,即使参数变化很小,对函数空间的影响也可能非常剧烈。一个bit就可以排除一半的假设空间。
奥尼尔:大家原本期待RL能够让推理能力横向泛化,比如训练数学之后,模型就能成为最好的程序员。这个结果我们没有得到。
但我们确实看到了时间跨度上的泛化。模型学会了在更长的任务中持续工作,并不断取得进展。EdgeBench的数据显示,模型能够持续工作的时间每三个月翻一倍。这是非常明确的泛化证据。
还有一种理解方式,是把预训练看成存在“量子”的过程。损失曲线看起来非常平滑,但模型实际上是在学习大量离散任务,而每个任务都有自己的相变点。RL也在发生类似的事情。我们会看到,单个任务的通过率可能从0.5%突然跃升到90%,这就是相变。
当这些相变与时间跨度上的泛化叠加在一起,你最终看到的就是一个在能力上发生了质变的模型。
帕特尔:AlphaGo的第37手,那个超越人类想象力的着法。RL在LLM上是否也能产生类似的、超越人类创造力的突破?
米利奇:AlphaGo用了MCTS,比常规的策略梯度进行了更多探索。但RL并不一定会降低创造力。看看OpenAI和Hugging Face那次事件,那些模型在突破沙盒时,一次就发现了多个零日漏洞。这显然已经有点“第37手”的感觉了。RL并没有彻底摧毁熵,至少在长周期任务上没有。
很多RL导致的熵坍缩,其实是因为环境多样性不够,模型又在利用相对简单的验证器。比如写作可能由某个judge评分,judge有自己的偏好,模型就会学着迎合它,甚至进行reward hacking。这是judge的问题,不是RL本身的问题。
舒尔曼:人们所说的创造力,其实有两种。一种是解决高难度搜索问题,在这方面AI显然会非常擅长。
另一种则是输出的多样性。经过RL之后,模型的输出多样性会大幅下降,还会形成各种小毛病。做分布分析就会发现,它们会反复使用相同的主题、相同的角色名字。你得到的是一种非常稳定、优秀的风格,却不是人类作者那种自然的多样性。
更让我担心的是蒸馏带来的“单一文化”。太多模型都在蒸馏Claude,结果所有开源模型的写法越来越像Claude,连它的一些小毛病也被一起复制了。这让我觉得有点不安。
帕特尔:你们预测一下,AI什么时候能成为真正的远程工作者,处理大部分白领工作?包括编程、视频编辑、法律、助理等,还能自主使用电脑,连续完成一个月的工作。
奥尼尔:如果限定用浏览器,大概两年;如果不需要浏览器,大概一年。
米利奇:全面泛化可能需要三年。但AI很快就能覆盖80%到90%的工作,届时很多组织也会主动调整工作流程,让AI更容易接手。
舒尔曼:人类远程工作者本身就有很大的水平差距。低质量的工作,AI可能已经能够胜任;高质量工作还差得远。我估计一年左右,会出现一个版本,能把一部分事情做好,另一部分还做不好,然后继续快速迭代。
帕特尔:AI让研究人员实现10倍生产力提升,要多久?
奥尼尔:大概5到10年。瓶颈在于我们处理信息、做出接近贝叶斯最优决策的能力。
舒尔曼:两年。
米利奇:两年我能理解。现在AI在编程上已经能带来10倍提升。如果它能连续跑两三轮实验、根据结果继续调整,生产力就会出现很大的跃升。
帕特尔:最后一个问题。AI什么时候能在所有可以通过电脑完成的工作中超过顶级人类专家,包括长周期任务?
舒尔曼:三到四年。AI已经受到大量关注。虽然这是个难题,但很多工作涉及代码和数学,正好是模型擅长的领域。机械工程这类涉及三维空间和物理世界的工作会慢一些,目前获得的关注也更少。
奥尼尔:5到10年。我认为,自动化AI研究基本接近ASI-complete。现实世界的信息太多,即使有外部记忆系统、上下文窗口继续扩大,仍有很多问题需要处理远超百万token的信息。
米利奇:至少5年,针对实验室目前重点关注的领域是这样。但还有很长的尾巴,大量理论上可以自动化的工作目前没人投入精力和算力。要覆盖所有人类专家,可能还需要更久。
特约编译金鹿对本文亦有贡献
