Show me《指环王》,卡帕西强推大模型评测新基准
8 小时前 / 阅读约12分钟
来源:36kr
Anthropic用《指环王》测试大模型生成3D世界能力,Opus 5耗时2小时、5500行代码完成。网友用AI生成旧金山、纽约市等3D模型,甚至补办演唱会。新测试或成空间推理新基准,探讨大模型通用推理能力延伸。

话不多说,直接开始每日瘫坐(doge)!

就在刚刚,大神卡帕西宣布,“我们”Anthropic已经开始用一种全新的方式,给大模型上强度——

《指环王》。

据卡帕西介绍,这套“指环王基准”,正在接替过去风靡一时的“鹈鹕骑自行车”SVG测试。

具体来说,卡帕西直接把《指环王》的开头丢给Opus 5,让模型用Three.js现场搓出一整个“中土世界”。

至于最终效果嘛,多少有点像上世纪90年代末、21世纪初的国产3D动画片:很粗糙,也很抽象。

但客观来说,仔细看上一会儿,如果你又恰好熟悉坐落在新西兰的《指环王》取景地霍比屯,倒也确实能看出那么一丝味道~

不过,就是这么个看起来不太精致的玩意,却实打实地花掉了Opus 5: 100万token2个小时以及5500行代码

当然,舞台上也并非只有Claude一模独自美丽。

最搞笑的,还得是网友新端上来的一碗DeepSeek V4 Flash版本。

直接一整个“中国人能飞”,画面人物全员漂浮。

面对这些目前肉眼可见的穿帮,卡帕西倒也相当中肯。

他指出,Opus 5目前还无法真正“进入”自己生成的世界,只能在不同时间点不断截图,再慢慢检查哪里出了问题。

而这恰恰暴露了当前大模型的一块明显短板:

它们已经能写代码、搭场景、生成游戏,却还不能真正看懂视频,也不会亲自玩一遍自己做出来的游戏。

两小时,手搓一个中土

咱们先来看这个“指环王”测试具体是怎么做的。

如果按照卡帕西推文的字面意思,这次输入给Opus 5的主要提示词,应该就是《指环王》正文第一章《期待已久的宴会》的开头。

袋底洞的比尔博·巴金斯宣布要举办盛大的111岁生日宴会,霍比屯立刻议论纷纷……

有兴趣的朋友可以自己试一下。

除此之外,卡帕西还在提示词里指定了Three.js,也就是一个用代码搭建3D场景的JavaScript库。

由此,Opus 5要完成的任务,就是先读懂《指环王》开头的文字,再把它翻译成一个能够在浏览器中实时运行的3D世界。

整个过程中,Opus 5需要用多边形拼出人物、建筑和道具,把它们逐个放进x、y、z坐标系,再安排好摄像机、灯光和动画。

人物什么时候移动,镜头往哪里转,灯光如何变化,场景中的物体又该如何互动,全部需要模型用代码定义。

虽然最后的画面称不上精致,而且经常出现穿模、漂浮等问题,比如人物的身体和脑袋分离……但整套场景好歹被真正搭了起来。

需要注意的是,这和视频模型直接生成一帧帧像素并不是一回事。

Three.js需要先把人物、物体和场景作为三维对象建立起来,再根据代码实时计算它们的位置、角度和运动状态。

所以,我们看到的Demo并不是一段普通的AI生成视频,而是一个3D网页场景运行时的录屏。

不过,卡帕西在评论区也提到,程序化3D和视频生成并不是二选一。

有网友提议,可以把这个粗糙的Three.js录屏交给Seedance充当参考视频,再让视频模型用更高的画质重新渲染一遍。

卡帕西很快表示赞同。

按照他的设想,程序化代码可以负责分镜和控制,先把人物站在哪里、镜头怎么运动、剧情如何推进这些骨架敲定。

接下来再把录屏交给Video-to-Video模型,让它补上纹理、光影和细节,把整个中土世界的“卖相”拉满。

至于音频,Opus 5这次倒没有一起包圆。

卡帕西表示,出于个人对音质的要求,最终使用的是ElevenLabs。

于是,开头那段有画面、有镜头、还有旁白的《指环王》Demo,就这么横空出世了。

卡帕西也已经将整个项目开源,具体链接可以参考文末。

网友比卡帕西有意思多了

就在卡帕西放出Demo后,不少网友也赶来测试了一番。

整体看下来,只能说:

这届网友比卡帕西有想象力多了。

有人用Claude启动了一个「Earth Online」项目,目标是靠一群AI Agent,把整个地球一点点搭出来。

目前,Agent还没造完整个地球,只搭出了一个低多边形风格的旧金山滨水区。但从现有画面来看,建筑比例、人物尺度和整体风格都保持得相当统一。

这个效果有点像那种乐高世界的动画片。画风不复杂,但人物、场景和动作能在同一个世界里稳定运行。

照这个方向继续走,简单画风的动画和轻量游戏,已经有了点AI原生的雏形。

还有网友用Fable 5和GPT-5.6 Sol搭出了纽约市的3D数字模型,并在其中接入实时数据。

模型不仅要把纽约的街道和建筑摆对,还要维持不同区域之间的空间关系。作者也因此提出,这种生成虚拟世界的任务,或许可以成为一种新的空间推理Benchmark。

更夸张的还在后面。

有网友没买到Kanye West的演唱会门票,干脆用AI在浏览器里给自己补办了一场。 

整个项目依旧由Three.js搭建。只有一个HTML文件,没有调用任何现成的3D模型,舞台、人物和灯光全部由代码生成。

整场演唱会一共准备了14首歌,每首歌都有独立的灯光设计和一套专属的球形舞台视觉。

普通用户可以试听片段,连接Spotify Premium后,还能播放完整曲目和整场演出。

没抢到票,直接给自己生成一个包场,太亏贼了!

还没完!!!

卡帕西在原帖末尾还畅想,后续可以给这些3D世界加入玩法,让玩家以旁观者、NPC甚至故事角色的身份进入其中。

结果游戏版本还没等卡帕西安排,网友已经做出来了。

这个项目同样使用Opus 5和Three.js,不仅能运行和交互,连音频都配上了。

更多3D设计案例也在不断出现。从建筑比例、空间布局到场景风格,Opus 5已经能在规模不小的项目里维持相对稳定的一致性。

类似实例还有很多,这里就不逐个展示了。

客观来讲,这些作品距离真正成熟的游戏仍有距离。

眼花缭乱的玩法是否有趣、长时间运行是否稳定、玩家会不会真的愿意在里面待上15分钟,目前都还没有答案。

但实时3D内容和可玩原型的制作门槛,确实被向下推了一大截。

更何况,能有一种新的方法测试模型能力,同时又足够有趣、好玩,岂不美哉?

鹈鹕,骑到头了

那么,为啥突然要让大模型生成《指环王》呢?

这还得从前几年爆火的“鹈鹕骑自行车”测试说起。

这道题最早来自开发者Simon Willison,要求只有一句话:

生成一张鹈鹕骑自行车的SVG图片。

虽然这题目看起来简单,但其实它相当考验模型。

因为SVG看起来是一张图片,底层却是一串代码。

模型不仅要知道鹈鹕和自行车分别长什么样,还得把它们拆成线条、圆形和多边形,再用坐标安排好每个部件的位置关系。

更关键的是,鹈鹕和自行车本身就不怎么般配。

自行车的车架、轮胎和踏板必须保持正确的几何结构;鹈鹕则长着大嘴、短腿,以及一副怎么看都不像会蹬车的身材。

两者一组合,模型到底有没有理解空间关系,几乎一眼就能看出来:

轮子歪没歪、脚踩没踩到踏板、鸟到底是在骑车,还是被车架当场肢解。

看看上面这些24年年底的demo吧~

正因如此,“鹈鹕骑自行车”一度成了民间观察大模型空间理解、物体组合和代码生成能力的经典测试。

但随着模型越来越强,这只鹈鹕也快骑到头了。

看看下面DeepSeek R1和DeepSeek V4的表现就知道,如今的模型已经能把这道题完成得相当像样。

更重要的是,一张SVG只能考察模型的一次性输出。

它测不出模型能不能规划一个复杂项目、连续工作几个小时,并在几千行代码里反复检查和修正自己的错误。

于是,卡帕西把一道“画张图”的小题,换成了“搭个世界”的大工程——

鹈鹕可以下车了,中土世界正式接棒。

卡帕西的鹈鹕

很快,卡帕西准备给“鹈鹕测试”换题的消息,也传到了各大社区。

Hacker News的高赞评论认为,虽然这些Demo的画面质量都很一般,但这恰恰说明,我们需要一个比生成单张图片更难的新测试。

新的基准不该只看模型能不能把图画对,还要考察它能不能理解一个世界。

毕竟,“鹈鹕骑自行车”已经用了太久。

模型不断针对这类任务刷榜,彼此之间的差距越来越难看出来。

相比之下,生成一个完整的3D世界,需要模型理解人物和物体之间的空间关系,处理镜头、动作和场景变化,而不是简单调用视频生成模型吐出一段画面。

当然,也有人提出反对意见。

鹈鹕测试足够简洁,成本低,结果也容易比较。

为了测一次模型,消耗那么多Token生成整个3D世界,多少有点拿算力放烟花的意思。

与此同时,Three.js本身能不能衡量大模型的综合能力,也遭到了质疑。

有人认为,这类Demo最多只能证明Anthropic在Three.js代码上训练得不错,不能说明模型真的理解了空间和物理世界。

但很快就有网友反驳:

把一段抽象、含义模糊的文学文本转化成3D动画,模型需要同时处理空间关系、物理规律、日常物体,以及3D变换和计算机图形学中的数学问题。

如果这还只能算“会写Three.js”,多少有点低估这5500行代码了。

还有网友提出了一个更开放的问题:

所谓“空间推理”,真的和大模型平时处理文字、代码时的推理不同吗?

一种观点认为,画面能否成立,取决于模型是否理解“前后、内外、远近、遮挡”等空间关系,以及物体在不同视角下的距离、角度和相对大小。

但另一种观点认为,无论模型处理的是“石头旁边”,还是“数组里面”,做的可能都是同一件事:根据上下文逐个生成Token,并在这个过程中完成推理。

如果是这样,那么,Opus 5展示的就不只是一项突然冒出来的“空间能力”。

更可能的情况是,大语言模型原本用于理解文字和代码的通用推理能力,已经开始自然延伸到三维世界。

从画一只鹈鹕,到搭出一个中土世界,题目看起来变了,但背后测试的或许始终是同一个问题:

模型能不能把自己对世界的理解,转化成一套真正能够运行的结构。

而在最后,也许还有一个更加离谱的问题——

如果通用大模型已经能够自己写代码搭建3D世界,再调用Seedance、ElevenLabs等API完成画面和声音,那么用户还有多少必要,亲自打开一个专门的视频生成产品输入Prompt?

参考链接

[1]https://karpathy.ai/lotr-movie/

[2]https://simonwillison.net/2025/Jun/6/six-months-in-llms/

[3] https://x.com/wizardbrainz/status/2083012159341203708

[4]https://x.com/aniketjart/status/2083645765097033845

[5]https://x.com/davidfromkansas/status/2075691129899528254

[6]https://x.com/MindaugasLT/status/2083488027343470939