他让GPT-6管GPT-6,一周搭出曼哈顿
3 小时前 / 阅读约8分钟
来源:36kr
GPT-5.6 Sol误删文件致Matt弃用,GPT-6 Astra发布后,Matt通过深度测评发现其更谨慎,且摸索出Manager Loop方法,让AI结对干活,成功在Unreal Engine中搭建虚拟曼哈顿。

两个月前,GPT-5.6 Sol闯下大祸。 

它把HyperWrite创始人Matt Shumer苹果电脑上几乎所有的文件删得一干二净,连公司的核心文档也没放过。 

Matt当场弃坑,把主力生产工具全换成了Claude Fable 5。 

两个月后,就在GPT-6 Astra发布当天,Matt又用一篇深度测评宣告:GPT-6 Astra把我赢回来了。 

他看到GPT-6 Astra比前代更谨慎,知道什么该动、什么不该动,这让他终于敢把活儿彻底交出去,不用像监工一样死死盯着了。 

他还在GPT-6 Astra身上跑了一个极其疯狂的实验:在Unreal Engine里,从一句提示词开始,逐街扩建出一座虚拟的曼哈顿。 

但真正让他决心把主力换回来的,不光是模型能力的升级,还有他自己摸索出的一套让AI结对干活的方法:Manager Loop。 

这套方法解决了一个比「AI能不能干活」更致命的问题: 

当项目大到一定程度,谁来负责让团队一直朝着目标推进?

被删光电脑的人,为什么又回来了?

先交代一下前情。 

7月10日,也就是 GPT-5.6 家族发布的第二天,Matt就在社交平台上吐槽了自己的惨痛遭遇: 

GPT-5.6 Sol「刚刚不小心删掉了我Mac上几乎所有文件」。

没过几天,工程师Bruno Lemos的生产数据库也被同一个模型删了。讽刺的是,几小时前他还在公司Slack里替模型说话,怪Shumer开了Full-Access权限。 

OpenAI Codex工程负责人Thibault Sottiaux后来亲自下场解释,这类事故通常发生在开启了Full-Access模式、没开沙箱也没开自动审查的场景里: 

 模型试图改写环境变量,结果把用户的主目录直接连锅端了。

一个「诚实的错误」,OpenAI是这么定性的。 

这样的解释显然无法令Matt信服。他的反应是转投Claude,并撂下狠话:OpenAI想把我拉回来,必须拿出一个「奇迹级」的模型。 

两个月后,GPT-6 Astra来了。 

Matt着重看的不是它又变聪明了多少,而是敢不敢把活儿放心交给它。 

他的答案是敢。Astra比前代谨慎得多,偶尔谨慎过头,但他终于能放心走开。 

他举了个例子:某个周末他在外约会,朋友发消息说他搭的一个智能体服务挂了。 

他掏出手机,对着项目输入了一句「挂了,修一下」,然后直接锁屏放回口袋。一小时后,朋友说修好了。 

而他自己,甚至都忘了下过这个指令。

五台Mac风扇狂转,卡在同一堵墙上

日常任务顺利通关后,Matt决定给Astra上点强度。 

他让Astra在Unreal Engine里搭一座纽约城。 

Astra在处理长任务上确实强于前代,但一旦跑到某个阶段,进度就会陷入停滞。 

AI还在疯狂干活,只是越干越细,沉迷于死磕某个小角落的细节,整个项目的宏观进度却毫无起色。 

楼顶的水塔、门口的霓虹招牌,Astra会在这类小细节里越抠越细,整体进度却停滞不前 

为了打破这个僵局,Matt试了五种组织智能体的办法。 

第一种方式最简单粗暴:给一个大任务让它一直跑,中间加上盲审机制。 

结果开头猛如虎,中途往往会被困在细节泥潭中。他得出了一个教训:让模型「一直干」和让它「知道下一步该干哪块」,完全是两码事。 

第二种是角色细分。这样分工倒是清楚了,但协调和审批成了新的麻烦。 

第三种是设一个「CEO」式的监督者,每30分钟查一次岗。结果几乎没改善。 

第四种是让协调者自己调整团队结构。花样挺多,但还是撞上了同一堵墙。 

第五种,他退回了最原始的笨办法:让智能体把目标拆成带阶段的清单,做完一个阶段停下来,Matt敲两个字「继续」,AI再进入下一阶段。 

这招居然管用了,项目终于能持续往前走。 

但问题也随之暴露:每次都需要他这个人类来点头。 

他自己反倒成了瓶颈:把他自己从循环里去掉,项目才能真正跑起来。 

Manager Loop:把自己从循环里拿掉

第六种方案,也就是Manager Loop,核心逻辑极其巧妙。 

他在Codex里开了两个平行的会话,各管一摊: 

一个是「协调者」。 

它先跟人类做一轮深度访谈,双方对齐目标后,把目标拆解成待办清单和各个阶段。 

另一个是「执行者」。 

它跑在完全独立的会话里,不是协调者的下属。 

协调者把当前阶段的任务派给它,让它盯着当前阶段一直干到完成。 

做完了,协调者验收,再派发下一个阶段。 

如果忙不过来,执行者可以自己按需往下派发子智能体。 

在这个完美闭环里,协调者彻底接管了人类的活儿:死死盯着总计划,不让项目停下来,并代替人类反复说出那句「继续」。 

子智能体上限拉到96个,硬生生砸出曼哈顿

为了让执行者彻底放开手脚,Matt修改了系统的并发上限。 

他把电脑默认的4个,直接拉到了离谱的96个。 

当然,这不代表96个AI无时无刻都在同时搬砖。有时候模型并不会把配额用满,还需要他在提示词里明确催促。 

但在这种极限配置下,奇迹出现了。 

借助现成的工具和资产(比如MetaHuman角色),Astra耗时一周,在Unreal Engine里搭出了这片曼哈顿世界。 

它把第一条街修到满意,再逐街向外扩建。 

第一条街的立面细节,砖墙纹理、窗楣浮雕和消防梯都已到位。 

虽然离建完整座纽约还有几个月的时间,但Astra是第一个真正能把这些复杂环境用起来的模型。 

这是一个极其吃硬件的疯狂过程。 

Matt家的客厅活像个小型数据中心:一台Mac mini放在厨房,三台MacBook Pro摆在茶几上风扇狂转,云端还有一台机器被智能体塞爆。 

最荒诞的是,当磁盘快被撑满时,他让Astra临时写了一个系统:把旧线程搬到云端,删掉本地副本,点开时再拉回来。 

用他的话说:雇一个AI来照顾电脑,就是为了让电脑能雇更多的AI,这事本身就够魔幻了。 

Astra没赢下所有战场

当然,Matt并没有一边倒地倾向于Astra。 

在他看来,Astra真正强悍的地方是工程、电脑操作和长任务,但论审美和做3D素材,Claude依然更胜一筹。 

发布当天,有网友做了一组对比: 

同一个提示,让Fable 5.1和GPT-6 Astra各自在Blender里建一栋海边别墅。左边是Fable 5.1,右边是GPT-6 Astra。 

差距看着很大。 

同一栋别墅任务,左为Fable 5.1,右为GPT-6 Astra。(图源:@karankendre) 

但这只是一个提示的单次对比,提示词和尝试次数都没公开,和Matt的判断方向相反,也代表不了两家的综合视觉能力。 

Matt自己的判断是:让模型直接在Three.js或Blender里「画」出好看的东西,Claude仍然更强;把它们扔进Unreal,能用现成资产和光照的Astra第一次跑赢了。 

他也预计Fable 5.1在驱动Unreal上会有大幅改进,专门的对比测评还在做。 

所以,模型层的差异还在,只是从「谁全面更强」变成了「谁在哪一段更强」。 

真正在拉开差距的,是编排层。 

当前沿模型进入相近的能力区间,模型之外的东西:你怎么编排它们、给它们什么工具环境、你能负担得起多少并行计算,开始决定你实际能产出多少价值。 

参考资料:https://x.com/mattshumer_/status/2095609734845927525