OpenAI押注RSI,国产AI火速交卷!Flash叫板万亿大模型
4 小时前 / 阅读约4分钟
来源:凤凰网
OpenAI和Anthropic正转向递归自我改进(RSI),让AI推动自身研发。云知声推出U2-Flash,通过RSI机制实现自迭代,提升模型能力。实测中,U2-Flash成功排查复杂项目中的并发Bug,展示了其处理任务和修复问题的能力。

过去两周,AI圈最让人坐不住的三个字母,就是RSI。

先是OpenAI,破天荒公开了一本内部账——

一名人类员工全职工作一天,AI Agent完成的工作量相当于3.1天。

如今,AI自动化研究实习生已在内部实现,下一个节点定在2028年3月:造出真正的自动化AI研究员。

紧接着,OpenAI首席科学家Jakub Pachocki在一篇长文一个异星心智中明确表示:OpenAI正将研究重心转向递归自我改进。

他判断,随着能力继续提升,AI将越来越多地推动自身研发。

六天后,Anthropic CEO达里奥发了长文《We Must Pace the Frontier》,同样直接把话挑明了:

RSI已经在整个行业发生,Anthropic自己也不例外。

RSI的逻辑并不难理解:这一代AI参与研发,让下一代AI变强;更强的AI,再回头承担更多研发工作。

如此循环,改进能力本身也可能不断增强。

过去,需要研究员一轮轮找问题、补数据、调训练。如今,其中一些环节,已经可以让模型上场了。

顺着这条线看,国内也有了一个值得拆开的实践样本。

云知声最新推出的U2-Flash,就把自迭代放进了后训练流程——

模型参与发现薄弱环节,生成针对性数据,经过训练和验证,再进入下一轮。

这一轮暴露的短板,成为下一轮进步的起点。

他们正是希望借助这套RSI机制,把U2-Flash练成一个能接住日常复杂工作的主力模型。

一手实测来了

用AI干活的人,多半见过这样的场面。

离下班还有半小时,你把一份数据分析交给AI。它迅速列好计划,开始读文件、写代码,然后报错、重试,又报错。

屏幕热闹了半天,能交的表格还没影。

这时候,每秒吐多少个字,谁还在乎?你只想知道,活到底什么时候能干完。

所以这次,我们重点看U2-Flash能不能把任务接着做下去,遇到问题能不能处理,最后交付的东西能不能用。

顺便提一句,U2-Flash本身支持纯文本输入输出,文件读取、程序执行等工作,需要配合相应工具完成。

藏在运行时的Bug,揪出并修复了

一上手,我们不玩虚的,直接让U2-Flash去真实项目中抓虫。

复杂项目里的Bug,有时很会藏。

静态代码看着合理,普通路径也能运行,偏偏到了特定环境、碰上某个边界条件,程序才突然报错。

这类问题,考验的是模型能不能真正进入排错过程。

这次,U2-Flash接手的是vLLM中的一个真实并发Bug:

请求带上禁用词参数bad_words后,服务偶尔会报出Already borrowed,返回HTTP 500。

H100验证里,串行发送20个请求,全部正常;不带禁用词,200个请求、50并发,也全部通过。

偏偏加上禁用词后,同样的并发压力下,200次请求中出现了一次错误。

199次成功,也不能放过剩下那一次。

在没有提供原始Issue链接、没有参考答案、不能联网的条件下,U2-Flash通过OpenCode展开排查,沿着报错堆栈,从请求处理一路追到异步执行、线程池和底层分词器。

根因终于浮出水面:一条路径处理提示词,另一条处理禁用词,两边共用了同一个Fast Tokenizer底层对象。

并发编码时,对共享状态的操作发生冲突,触发了报错。

就像两个人同时修改同一份工作底稿,单独操作都没问题,撞在一起就出错。