AI造世界,难在第二步
4 小时前 / 阅读约57分钟
来源:36kr
生成式AI正从生成内容走向生成可维护的世界,面临速度与状态维护瓶颈。生境科技通过统一空间状态连接生成、执行与验证,利用真实交互数据训练空间智能。

生成一个世界只是开始,

让它经得起持续修改才是硬仗。

生成式 AI 正从文字、图像和视频进入软件、游戏、三维空间与仿真环境。模型面对的任务也随之变化:对象需要保持身份,规则需要经得起操作,世界还要根据行动结果持续更新。

生境科技创始人刘紫东认为,AI“造世界”正在进入更难的第二步:从生成可观看的世界,走向维护状态、模拟变化并规划行动。World Labs 将相关能力概括为 Renderer、Simulator 与 Planner,而连接模拟与规划的状态层,决定了一个世界能否长期稳定运行。〔1〕

进一步看,大规模真实交互还为递归自我改进(RSI)提供了现实路径:系统持续积累“状态—行动—反馈”轨迹,发现能力缺口并生成新的训练任务。空间世界具有明确对象、可执行动作和可验证结果,为这种自我进化提供了天然的工程基础。〔2〕〔3〕

1. AI的交付物正在从内容变成世界

三维场景不只检验生成效果,还要求世界在后续操作中保持对象、关系、规则与状态一致。

1.1 · 三维场景成为综合压力测试

一句话造出能跑、能玩的3D世界

Kimi K3 的程序化开放世界、GPT-5.6 与 Codex 构建的三维游戏和 Unity 场景,以及 Fable 5、Factorio、浏览器 CAD 等实验,都在把“一句话生成一个能运行的世界”推向前沿。三维场景同时考验语言理解、空间推理、长程编程、工具调用、资产组织和物理执行;任何一个环节失效,都可能表现为空场景、对象缺失、穿模或状态丢失。〔4〕〔5〕〔6〕

更重要的变化,是模型开始从“一次性生成”进入持续运行。MiniTown、Material Lab、Voxel Velocity 等工作已经表明,借助代码和工具接口,模型可以持续组织对象、规则与反馈;PlayCo 的 Unity 实验中,结构化调用还显著减少了 Token 消耗和迭代次数。〔7〕〔5〕〔6〕

当三维世界进入时间维度,问题的核心也随之改变:对象移动后身份能否保持,通道是否仍然可用,一次局部修改会不会破坏其他关系。场景一旦开始持续运行,状态维护就从后台工程问题上升为核心智能问题。

展示当前模型能力边界,不同案例口径不一,不作横向性能排名。〔12〕〔17〕

1.2 · 从能看到能运行

感知式与符号化路线正在行动闭环中汇合

世界模型大致沿两条路线发展:一条从视觉表征生成连续世界,一条从对象、代码和规则构建可执行世界。随着系统进入持续交互,两者正在快速汇合。〔29〕〔30〕〔31〕〔32〕〔33〕〔34〕

  • 感知式路线

Genie 3、World Labs Marble、Odyssey:从像素、视频或视觉 Latent 生成后续观察,强调真实感、连续性与可漫游体验。

  • 符号化路线

Kimi K3、GPT-5.6/Codex、Fable 5:生成对象、代码、规则与引擎状态,再执行、渲染和持续修改。

行业关注的重点,也正在从“世界如何表示”转向“世界能否持续运行”。未来的系统需要让观察、状态、行动与反馈形成闭环。〔1〕

观测负责呈现,状态负责计算。

同一张桌子,两种压缩。感知表征保存连续外观;结构化状态表征维护部件、连接与任务结构。

1.3 · 一句话生成背后的工程链

一个世界要靠长期运行的工程链维持

“一句话生成”只是入口。系统内部需要持续维护对象、关系、几何、规则与运行状态:LLM 理解目标与约束,空间模型完成求解,引擎执行结果,状态层再把变化写回世界。每次修改都继承已有状态,而不是重新生成一遍。

这套机制可以简化为 R–T–V:

  • R · Representation:

描述当前世界的对象、关系与状态。

  • T · Transition:

描述动作发生后,世界如何变化。

  • V · Verification / Value:

判断新的状态能否成立并继续运行。

LLM判断“要什么”,专用空间模型计算“放在哪里、如何成立”,状态基础设施负责保存、求解和验证。

世界生成能否从演示走向产品,很大程度取决于这条工程链能否长期稳定运行。

语言、状态、求解、执行和验证围绕同一个世界协作。

代码生成后,规则与VLM继续验证场景。

2. 技术瓶颈:世界生成以后,速度与状态都难以维持

今天的世界模型已经能生成令人惊艳的三维结果,但产品化仍卡在两个更基础的问题:结果多久第一次真正可用,以及世界在连续修改后能否保持同一套对象、关系和规则。

2.1 · 两条路线的共同状态缺口

结果可以成立,世界却未必持续成立

两类世界模型在进入持续运行后,会暴露出不同形式的状态漂移。

  • 感知式路线

画面可以保持逼真和连续,但真实尺度、对象身份与遮挡区域往往缺少稳定约束。镜头转动、离开后重返或继续扩展场景时,尺度可能漂移,视线之外的空间也会逐渐模糊和失真。

像素世界模型典型错误:尺度漂移、视线之外的空间会变得模糊和不稳定。

  • 符号化路线

对象、坐标和代码虽然显式存在,但碰撞、边界、朝向、拓扑与跨对象关系常分散在不同脚本和工具中。局部修改之后,对象仍然存在,却可能已经越界、重叠或破坏原有关系。〔34〕〔36〕〔37〕

layoutGPT典型错误案例:对象生成成功,并不代表空间关系成立。

两类故障最终指向同一个缺口:系统缺少一层独立、可验证、可增量更新的世界状态。 WorldCoder-Bench、GameCraft-Bench、FloorplanQA、GEST 等评测也反复表明,代码能够运行、对象能够生成,并不意味着整个世界在多轮操作后仍然成立。〔41〕〔42〕〔43〕

真正的挑战因此不再只是“生成得对”,而是修改和运行之后,世界仍能保持一致。

2.2 · 首次有效结果的速度瓶颈

生成只是起点,检查与返工吞掉响应速度

产品体验真正取决于首次有效结果,而非模型第一次返回。如果一次“生成—检查—修复”耗时为 (T_{round}),结果通过率为 (p_{accept}),那么:

T valid ≈ T round / p accept

公开案例已经显示出这种差距:World Labs Draft 可以在约 20 秒得到草稿,完整 World 约需 5 分钟,高质量 Mesh 接近 1 小时;其他完整场景流程也普遍落在数分钟到数十分钟。〔39〕〔34〕真正的速度瓶颈,不只是生成,而是检查、修复和返工。越依赖整场重算,越难进入高频交互。

公开案例显示,得到可用场景仍需经历显著的生成与修复成本。

3. 技术趋势:从一次生成走向状态—行动闭环

速度与维护瓶颈正在推动世界模型重构技术栈:Renderer、Simulator与Planner通过独立状态层连接,场景变成可编译程序,生成和编辑则变成能够学习、验证与回放的空间行动。

3.1 · 场景中间层正在成形

世界生成开始从“直接输出”走向“编译执行”

一个越来越清晰的技术趋势,是模型不再直接把自然语言变成最终三维结果,而是在模型与引擎之间加入一层可计算、可修改、可验证的场景中间表示。

模型理解意图,场景中间层组织对象、几何、拓扑与约束,引擎负责执行、渲染和仿真。这种分工让局部修改不必重新生成整个世界,而可以像修改程序一样,只更新受影响的部分。

LayoutGPT、Holodeck、AnyHome 已经开始显式组织对象和空间关系;SceneScript、HDSL、The Scene Language、Procedural Scene Programs 等进一步把场景变成可寻址、可修改的程序化表示。〔51〕〔52〕〔53〕〔54〕〔55〕〔56〕〔57〕

世界生成由此从“直接输出内容”,逐渐转向“编译并运行一个世界”。

场景中间层将对象、几何、关系与约束组织为可寻址状态,并为后续求解、执行与验证提供统一接口。

3.2 · 空间生成正在成为行动学习

从生成场景,转向学习世界如何被行动改变

当场景可以持续编辑,每一次创建、删除、移动和修改,都不再只是一次生成,而是一条状态转移:

当前状态 → 目标 → 行动 → 新状态 → 结果

这些过程一旦被完整记录,训练数据就从“最后生成了什么”,扩展到什么行动改变了世界、哪些行动有效,以及如何通过一连串行动抵达目标状态。

Hydra、ConceptGraphs、SayPlan、SayNav、VoxPoser 等工作已经在把持续感知整理为空间记忆,并围绕任务规划行动;HiSQ、OptiScene、LayoutVLM、SimWorld Studio 等则把碰撞、越界、关系失效和任务失败转化为可诊断反馈。〔63〕〔64〕〔65〕〔66〕〔68〕〔69〕

关键变化是:生成结果不再是终点,执行、失败、修复和反馈本身也开始成为训练数据。

SimWorld Studio把编码、运行与检查放在同一工作区,失败会进入下一轮修正,而不是直接成为交付结果。

4. 生境科技:在大规模交互中训练自主空间智能

生境科技将前述技术路线收束为一套自主空间智能系统,并通过真实产品持续获得空间行动与反馈数据。技术底座解决“世界如何持续运行”,大规模交互则让系统开始学习“世界如何被人和机器改变”。

4.1 · 自主空间智能架构

模型负责决策,空间系统负责让决策真正成立

生境围绕统一世界状态构建了三层核心能力:空间状态模型、空间—行动模型与空间执行引擎。状态模型维护对象、几何、关系、约束与历史;行动模型学习目标、动作与未来状态之间的关系;执行引擎负责生成、修改、渲染、验证,并将结果重新写回世界。〔84〕

与 Coding Agent 直接操纵 Blender、Unity、UE 等工具不同,生境把世界状态交给独立计算系统持续维护。LLM负责理解意图,专用空间模型和求解器负责空间计算,验证器负责发现失败与回滚。局部修改因此可以沿已有世界增量求解,而不必反复重建整个场景。

目前相关链路已实现约 20 秒级增量解算。〔84〕

感知和生成负责提出观察与候选结果;独立状态层、行动模型、执行引擎与验证反馈共同维持一个可持续运行的世界。

4.2 · 空间场、多模态编码与质量验证

仅有对象和关系,还不足以描述一个可运行的空间。生境同时维护离散对象图与连续空间场:前者描述对象、拓扑和关系,后者计算光照、视线、通行、可达性与活动条件。相关 NSF 实验将端到端布局碰撞率降低至 2.75%。〔88〕

MST-Builder进一步把图像、户型、商品、3D资产与UGC统一编码为 Spatial Token,使语义、几何、关系、来源和版本能够落到同一套空间状态中。〔89〕〔90〕〔91〕〔92〕

最后,验证器将意图一致性、几何合理性、空间可用性与视觉结果转化为可诊断信号。对象描述“有什么”,空间场判断“哪里能做什么”,验证器决定“结果是否成立”。〔66〕〔67〕

相同指令下的布局对比:生境在空间完整性、对象关系与可用性上表现更稳定。

4.3 · 产品即训练环境:大规模空间交互与反馈

真正稀缺的是带因果链的状态轨迹

互联网拥有海量空间图片、视频和三维资产,却很少记录一个世界为什么发生变化:用户为什么移动、撤回,什么结果最终被保存、分享或放弃。这些“目标—行动—状态变化—反馈”轨迹,直接揭示什么行动有效、哪里容易失败,以及人最终接受什么。

生境通过三类产品持续获取这种经验。SenBOX提供高密度的空间创作、修改与偏好反馈;SenHome引入真实空间、商品、尺寸和生活决策约束;SimHub/API进一步连接产业任务、仿真与机器行动。三类环境共享同一套对象、状态和验证体系,使人类选择、现实约束与机器执行能够沉淀到同一套经验系统中。〔84〕〔86〕

森盒二测已经形成第一批规模化数据:3,970 名用户产生 10,704 个最终空间状态、15.2 万次资产进入真实空间关系、119.4 万次空间交互和 29.1 万次评价反馈。〔85〕〔86〕随着规模扩大,更有价值的将是其中不断出现的撤回、冲突、局部失败、长期任务和个体偏好——这些长尾轨迹可以直接用于训练生成模型、行动模型与验证器。

静态数据记录世界的结果,交互数据记录世界变化的原因。 生境由此把产品增长转化为模型能力的积累,也为持续自我改进建立了现实的数据基础。〔2〕〔3〕〔87〕

交互数据栈空间场景与资产形成基座,状态迁移与人类反馈把一次次真实交互转化为可持续学习、难以复制的复合数据资产。·

10秒级响应与稳定状态,支撑准确、连续的修改

交互式空间产品必须同时满足响应速度、状态稳定与结果准确:把语言或参考图编译为空间边界、对象关系和3D资产操作,后续修改只重算必要区域并写回同一版本。速度支持高频尝试,稳定性保证每一轮都发生在同一个世界。〔84〕

生境AI-SenHOME产品录屏,更多内容可访问生境科技官网

5. 结语

从世界模型到自主空间智能:让世界在时间中持续成立

生成式 AI 已经可以写程序、生成画面并构造复杂三维场景。接下来的难题,是让这些场景经得起时间:对象身份能够延续,关系经得起修改,行动真正改变状态,失败也能被定位并进入下一轮学习。

世界模型因此正在从一次生成,走向可以长期运行的计算系统。视觉模型负责观察和泛化,结构化状态保存对象、关系与历史,规划和执行系统在其中采取行动。当世界能够被持续修改、验证和回放,生成本身才开始转化为行动能力。

生境科技正在沿这条路径推进:用统一空间状态连接生成、执行与验证,再通过 SenBOX、SenHome 和 SimHub/API 获取真实的人类选择、现实约束和机器执行数据。最终决定空间智能上限的,也许不只是模型能生成多复杂的世界,而是它能否在真实交互中长期维持这个世界,并从一次次变化中积累经验。

生境将真实交互与 Rollout 持续回流训练,形成不断改进的空间智能闭环。

参考资料与图片来源

1. Li, Fei-Fei and World Labs Team, “A Functional Taxonomy of World Models: Renderers, Simulators, Planners, and the Loop That Connects Them,” 2026。文章按输出功能区分Renderer、Simulator与Planner,并说明可计算的几何、物理和动态结构如何连接视觉观察与行动后果。 World Labs原文 ↗

2. Anthropic Institute, “When AI builds itself,” 2026。文章讨论AI系统参与改进自身研究与工程流程时的进展、评测与风险边界。 官方文章 ↗

3. Mingguang Chen, Licheng Wang and Bo Qu, “Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops,” arXiv:2607.07663, 2026。 论文 ↗

4. Moonshot AI, “Kimi K3,” 2026。官方页面把Game Dev与Digital Creation列为代表能力,并展示基于Three.js WebGPU的3D Open World案例;页面将其工作流描述为结合3D推理、编码、视觉理解与运行画面反馈。 官方页面 ↗

5. OpenAI, “GPT-5.6: Frontier intelligence that scales with your ambition,” 2026。官方页展示GPT‑5.6生成的3D帆船游戏;PlayCo报告,模型通过结构化API构建Unity场景时,相比直接工具调用减少63.5%的Token总量和50.1%的模型轮次。 官方页面 ↗

6. Anthropic, “Claude Fable 5 and Claude Mythos 5,” 2026。官方材料展示Fable 5从物理原理构建太阳系仿真、自主操作Factorio,以及在其创建的浏览器CAD中完成可3D打印模型。 官方页面 ↗

7. OpenAI Developers Showcase, “MiniTown,” GPT-5.6 + Codex. 链接 ↗

8. OpenAI Developers Showcase, “Material Lab,” GPT-5.6 + Codex. 链接 ↗

9. OpenAI Developers Showcase, “Theme Park Builder.” 链接 ↗

10. OpenAI Developers Showcase, “Biome Lab,” GPT-5.6 + Codex. 链接 ↗

11. OpenAI Developers Showcase, “Terrain Mixer,” GPT-5.6 + Codex. 链接 ↗

12. OpenAI Developers Showcase, “Procedural City Generator.” 链接 ↗

13. Danny Beijert转发的公开演示,“GPT-5.4 built a basically perfect Minecraft clone from scratch in 24 minutes — fully autonomous,” 2026。发布者称演示使用GPT-5.4、Codex与Playwright,从单次提示构建并自动试玩浏览器体素游戏;时间与流程为发布者自述。 公开视频 ↗

14. AI Andy / Dutch Startup, “I Gave Fable 5 Six Impossible Prompts (One Shot Each),” 2026。公开视频展示作者所称的单提示GTA式开放城市与移动端拉力原型;“47分钟”等数据属于作者测试口径。 原视频 ↗文字说明 ↗

15. Reddit用户Grenagar,“Built a full 3D browser game using Claude Code — Traffic Architect,” 2026。作者说明项目使用Claude Code与Three.js,全部场景资产由代码生成,同时强调规划、审阅、小步任务和数月迭代。 公开视频与复盘 ↗

16. Reddit用户DriftClub_gg,“Built a browser car racing game with Claude Code,” 2026。作者说明车辆物理运行在Three.js上,并明确称项目经过约三个月兼职开发、多轮提示与试错。 公开视频与复盘 ↗

17. OpenAI Developers Showcase, “Backroom Center: Corrupted.” 链接 ↗

18. Three.js, “Scene Graph” and “Object3D.” Three.js以对象层级、变换、材质与WebGL渲染构成代码优先的浏览器三维运行时。 官方手册 ↗

19. BlenderMCP, “Open-source MCP to use Blender with any LLM.” 社区项目通过Blender插件与MCP服务器提供场景查询、对象和材质操作、视口截图及Python执行。 代码 ↗

20. Blender Foundation, “Command Line Arguments.” Blender支持无界面运行、执行Python脚本、渲染、保存和导出。 官方文档 ↗

21. CoplayDev, “MCP for Unity”; Wu and Barnett, “MCP-Unity: Protocol-Driven Framework for Interactive 3D Authoring,” SIGGRAPH Asia Technical Communications 2025. 该项目把场景、资产、脚本和测试暴露给Claude、Codex等MCP客户端。 代码与论文信息 ↗

22. Epic Games, “Unreal MCP in Unreal Editor,” Unreal Engine 5.8 Documentation. 实验性插件在编辑器内嵌MCP服务器,可供Codex、Claude Code、Cursor等客户端调用Actor、灯光、材质与自动化测试工具。 官方文档 ↗

23. McNeel, “Compute: Features.” Rhino Compute通过无状态REST API提供Grasshopper求解和2,400余项RhinoCommon几何运算,并支持C#、Python与JavaScript客户端。 官方文档 ↗

24. SideFX, “Houdini Object Model” and “Command-Line Scripting.” HOM允许Python查询和控制Houdini,hython可在命令行加载、检查和修改HIP场景。 HOM文档 ↗命令行文档 ↗

25. Autodesk, “3ds Max Developer Help.” 3ds Max提供原生MAXScript、Python pymxs API和C++ SDK,用于场景操作、工具开发与管线自动化。 官方文档 ↗

26. Anthropic official video, “Claude Fable 5 simulates the solar system.” 链接 ↗

27. Anthropic official video, “Claude Fable 5 autonomously plays Factorio.” 链接 ↗

28. Anthropic official video, “Claude Fable 5 builds a browser CAD editor and 3D-printable model.” 链接 ↗

29. Google DeepMind, “Genie 3: A new frontier for world models,” 2025。官方页面报告由文本实时生成可交互世界,输出为720p、20–24fps并支持数分钟连续交互,同时列出长期一致性与有限动作空间等限制。 官方页面 ↗

30. World Labs, “Marble: A Multimodal World Model.” 链接 ↗

31. Odyssey, “Introducing interactive video.” 链接 ↗

32. Manifold AI, “WorldScape.” 链接 ↗

33. World Labs, “3D as code.” 链接 ↗

34. World Labs, “Marble Documentation.” 官方文档报告标准World通常约5分钟完成,并列出Draft、World与高质量Mesh的预计时间;服务条款同时提示,生成的三维世界未必准确反映真实物理、尺寸或空间关系。 生成时间 ↗输出边界 ↗

35. Kang et al., “SimWorld Studio: Automatic Environment Generation with Evolving Coding Agent for Embodied Agent Learning,” 2026. 链接 ↗

36. Lu et al., “WorldCoder-Bench: Benchmarking Physically Grounded 3D World Synthesis,” 2026. 链接 ↗

37. Rodionov et al., “FloorplanQA: A Benchmark for Spatial Reasoning in LLMs using Structured Representations,” 2025/2026. 链接 ↗

38. Li, Fei-Fei and World Labs Team, “A Functional Taxonomy of World Models: Renderers, Simulators, Planners, and the Loop That Connects Them,” 2026. 文章按输出功能区分Renderer、Simulator与Planner,并强调模拟所提供的几何、物理和动态结构是连接视觉观察与行动后果的关键。 World Labs原文 ↗中文介绍 ↗

39. Song et al., “SceneOrchestra: Agentic Planning and Tool Use for Long-Horizon Indoor Scene Generation,” 2026. 论文在统一A6000环境中报告LayoutGPT、Holodeck、SceneWeaver与SceneOrchestra的平均运行时间。 论文 ↗

40. 小红书传播案例,“GPT‑5.6硬控Blender,盘点AI建模玩法”,2026。该材料用于观察LLM接入本地图形软件的传播现象,不作为性能或模型版本的独立验证。 原帖链接 ↗

41. Luo et al., “GameCraft-Bench: Can Agents Build Playable Games End-to-End in a Real Game Engine?” 2026. 链接 ↗

42. Kraus et al., “Agentic Video Generation: From Text to Executable Event Graphs via Tool-Constrained LLM Planning,” 2026. 链接 ↗

43. Pfaff et al., “SceneSmith: Agentic Generation of Simulation-Ready Indoor Scenes,” ICML 2026 Spotlight. 分层VLM代理生成可分离、带物理属性并可用于机器人仿真的室内场景。 项目页 ↗论文 ↗

44. Yang et al., “Code-as-Room: Generating 3D Rooms from Top-Down View Images via Agentic Code Synthesis,” 2026。官方项目页公开输入俯视图与VIGA基线的Blender转台视频对照;正文并排保留原始输入与官方基线输出,用于观察对象遗漏、占位化、尺度与布局退化。 官方项目页与视频 ↗论文 ↗

45. Feng et al., “LayoutGPT: Compositional Visual Planning and Generation with Large Language Models,” NeurIPS 2023。论文补充材料的Figure 11展示三维室内布局中的家具越界、对象重叠和不协调摆放;随机选取8个卧室上下文示例时,越界率由43.26%升至85.58%。 项目页 ↗论文 ↗

46. fit_liger8646, “Blender×MCP:自然语言生成三维角色实测,” 2026. 三视图角色在自动建模中被近似为大量球体与圆柱,显示有机曲面、部件结构与拓扑恢复仍不稳定。 实测记录 ↗

47. JellyAI, “Blender MCP自然语言建模实测,” 2025. 测试覆盖房间、茶壶和四椅组合;复杂任务出现悬浮、比例失真、朝向与位置混乱,并需要拆分为连续小步骤。 实测记录 ↗

48. Reddit r/vibecoding, “New level: Vibe-modeling/animation in 3D,” 2026. 用户复盘Claude Code与Blender MCP修改角色网格时误伤牙齿和相邻部件,导致既有模型关系被破坏。 用户复盘 ↗

49. Yann LeCun, “A Path Towards Autonomous Machine Intelligence,” OpenReview, 2022。文章提出由感知、世界模型、代价、短期记忆与行动模块组成的自主机器架构。 论文 ↗

50. Meta AI, “V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning,” 2025。模型从视频学习物理世界表征,并用于理解、预测与机器人规划。 论文 ↗官方介绍 ↗

51. Feng et al., “LayoutGPT: Compositional Visual Planning and Generation with Large Language Models,” 2023. 链接 ↗

52. Yang et al., “Holodeck: Language Guided Generation of 3D Embodied AI Environments,” CVPR 2024. 链接 ↗

53. Bian, Ren, Yang and Callison-Burch, “HOLODECK 2.0: Vision-Language-Guided 3D World Generation with Editing,” arXiv:2508.05899, 2025. 论文 ↗

54. Avetisyan et al., “SceneScript: Reconstructing Scenes With An Autoregressive Structured Language Model,” 2024. 链接 ↗

55. Li et al., “HDSL: A Hierarchical Domain-Specific Language for Structured 3D Indoor Scene Generation and Localized Editing with LLM Agents,” 2026. 链接 ↗

56. Zhang et al., “The Scene Language: Representing Scenes with Programs, Words, and Embeddings,” CVPR 2025. 论文 ↗

57. Gumin et al., “Procedural Scene Programs for Open-Universe Scene Generation: LLM-Free Error Correction via Program Search,” SIGGRAPH Asia 2025. 论文 ↗

58. Jiang et al., “HOG-Layout: Hierarchical 3D Scene Generation, Optimization and Editing via Vision-Language Models,” CVPR 2026. 论文 ↗

59. Wang et al., “Function2Scene: 3D Indoor Scene Layout from Functional Specifications,” 2026. 论文 ↗

60. NVIDIA, “OpenUSD for Developers.” 链接 ↗

61. Kundu et al., “Kubric: A scalable dataset generator,” 2022. 链接 ↗

62. ASAM, “OpenSCENARIO DSL,” dynamic scenario description standard, v2.2.0, 2026. 标准 ↗

63. Gu et al., “ConceptGraphs: Open-Vocabulary 3D Scene Graphs for Perception and Planning,” 2023. 链接 ↗

64. Rana et al., “SayPlan: Grounding Large Language Models using 3D Scene Graphs for Scalable Robot Task Planning,” CoRL 2023. 链接 ↗

65. Huang et al., “VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models,” CoRL 2023. 项目页 ↗

66. 生境科技研究稿,“VisAlign: Aligning Multimodal Interior Design Reasoning with Scene Visualization Feedback,” 2026。 研究稿 ↗

67. 生境科技研究稿,“HiSQ-Bench: Benchmarking Human-Centric Spatial Quality in Indoor Scene Generation,” 2026。 研究稿 ↗

68. Yang et al., “OptiScene: LLM-driven Indoor Scene Layout Generation via Scaled Human-aligned Data Synthesis and Multi-Stage Preference Optimization,” 2025. 链接 ↗

69. Sun et al., “LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models,” CVPR 2025. 论文 ↗

70. Liu et al., “Controllable 3D Outdoor Scene Generation via Scene Graphs,” ICCV 2025. 论文 ↗

71. Fu et al., “AnyHome: Open-Vocabulary Generation of Structured and Textured 3D Homes,” 2023. 链接 ↗

72. Gao et al., “GraphDreamer: Compositional 3D Scene Synthesis from Scene Graphs,” 2023. 链接 ↗

73. Lin and Mu, “InstructScene: Instruction-Driven 3D Indoor Scene Synthesis with Semantic Graph Prior,” 2024. 链接 ↗

74. Zhou et al., “GALA3D: Towards Text-to-3D Complex Scene Generation via Layout-guided Generative Gaussian Splatting,” 2024. 链接 ↗

75. Huang et al., “Toward Scene Graph and Layout Guided Complex 3D Scene Generation,” 2024. 链接 ↗

76. Yang et al., “SceneCraft: Layout-Guided 3D Scene Generation,” 2024. 链接 ↗

77. Zhou et al., “LAYOUTDREAMER: Physics-guided Layout for Text-to-3D Compositional Scene Generation,” 2025. 链接 ↗

78. Zhou et al., “RoomCraft: Controllable and Complete 3D Indoor Scene Generation,” 2025. 链接 ↗

79. Lin et al., “GenUSD: 3D Scene Generation Made Easy,” SIGGRAPH 2024 Real-Time Live. 链接 ↗

80. Lara et al., “Generative Floor Plan Design with LLMs via Reinforcement Learning with Verifiable Rewards,” 2026. 链接 ↗

81. Sengupta et al., “SceneCritic: A Symbolic Evaluator for 3D Indoor Scene Synthesis,” 2026 preprint. 链接 ↗

82. Frühwirth et al., “Word2Minecraft: Generating Playable Minecraft Worlds from Structured Stories,” 2025. 链接 ↗

83. Dream‑Cubed, direct generation of Minecraft worlds from tens of billions of cube tokens, 2026. 链接 ↗

84. 生境科技内部工程记录与产品演示,2026:现有工程链路已实现20秒级空间状态增量解算。该结果是已完成的内部工程能力;跨系统性能比较仍需在同输入、同资产、同硬件和同质量阈值下建立公开Benchmark。

85. 生境科技研究稿,“SceneHub: Synthesizing High‑Variability Interior Data through User Collaboration,” 2026。 研究稿 ↗

86. 生境科技,《森盒二测商业价值数据报告》,2026年内部研究材料;统计来自二测原始数据表交叉计算,测试环境经济行为不等同于真实支付。

87. World Labs, “Scaling Robotic Simulation with Marble,” 2025;以及Lightwheel的real‑to‑sim评估案例。两项案例展示从真实场景构建可控三维世界,用于机器人策略训练、弱点搜索与评估。 机器人仿真案例 ↗Real‑to‑sim案例 ↗

88. 生境科技研究稿,“Neuro‑Spectral Fields: Bridging Semantic Intent and Geometry via Physics‑Informed Operators,” 2026。 研究稿 ↗

89. Bai et al., “Qwen2.5‑VL Technical Report,” 2025. 模型支持开放视觉识别、对象框/点定位、文档与布局理解及结构化信息抽取。 论文 ↗

90. Ravi et al., “SAM 2: Segment Anything in Images and Videos,” 2024. SAM‑2提供图像与视频中的可提示对象分割,并支持点、框与mask等交互提示。 论文 ↗

91. Oquab et al., “DINOv2: Learning Robust Visual Features without Supervision,” 2023. DINOv2通过自监督训练提供可跨图像与像素级任务复用的通用视觉特征。 论文 ↗

92. Zhai et al., “Sigmoid Loss for Language Image Pre‑Training,” ICCV 2023;Radford et al., “Learning Transferable Visual Models From Natural Language Supervision,” 2021. SigLIP与CLIP将图像和文本编码到可比较的语义空间。 SigLIP论文 ↗CLIP论文 ↗

93. 陶大程 / 大晓机器人,“世界模型的使命不是完整复制世界,而是精准支撑行动”,InfoQ转载,2026。 链接 ↗

94. Li et al., “HomeWorld: A Unified Floorplan‑to‑Furnished Framework for Generating Controllable, Densely Interactive Whole‑Home Scenes,” 2026. 论文 ↗项目页 ↗

95. Wu et al., “SceneGraphFusion: Incremental 3D Scene Graph Prediction from RGB‑D Sequences,” CVPR 2021. 链接 ↗

96. Rosinol et al., “Kimera: From SLAM to Spatial Perception with 3D Dynamic Scene Graphs,” 2021. 链接 ↗

97. Hughes et al., “Hydra: A Real‑time Spatial Perception System for 3D Scene Graph Construction and Optimization,” 2022. 链接 ↗

98. Werby et al., “Hierarchical Open‑Vocabulary 3D Scene Graphs for Language‑Grounded Robot Navigation,” 2024. 链接 ↗

99. Yan et al., “Dynamic Open‑Vocabulary 3D Scene Graphs for Long‑term Language‑Guided Mobile Manipulation,” 2024. 链接 ↗

100. Rajvanshi et al., “SayNav: Grounding Large Language Models for Dynamic Planning to Navigation in New Environments,” 2023. 链接 ↗

101. Liu et al., “OK‑Robot: What Really Matters in Integrating Open‑Knowledge Models for Robotics,” 2024. 项目页 ↗

102. Kim and Kim, “OP3DSG: Open‑Vocabulary Part‑Aware 3D Scene Graph Generation for Real‑World Environments,” 2026 preprint. 链接 ↗

103. Fujitsu Research, “Spatial World Model.” 链接 ↗

104. 财新,“大晓机器人完成天使+轮融资,2026年上半年累计融资数亿美元”,2026‑06‑15。 链接 ↗

105. Allen Institute for AI, “AI2‑THOR Environment State and Object Metadata.” 链接 ↗

106. Puig et al., “VirtualHome: Simulating Household Activities via Programs,” project and open‑source simulator. 链接 ↗

107. Allen Institute for AI, “ProcTHOR.” 链接 ↗

108. AI Habitat, embodied AI simulation platform. 链接 ↗

109. AI Habitat, “Habitat 3.0: A Co‑Habitat for Humans, Avatars and Robots.” 链接 ↗

110. AI Habitat, “ReplicaCAD Dataset.” 链接 ↗

111. AI Habitat, “Habitat‑Matterport 3D Dataset.” 链接 ↗

112. Stanford Vision and Learning Lab, “BEHAVIOR‑1K.” 链接 ↗

113. Xiang et al., “SAPIEN: A SimulAted Part‑based Interactive ENvironment,” CVPR 2020; ManiSkill platform. 项目页 ↗

114. NVIDIA, “Isaac Sim: Robotics Simulation and Synthetic Data Generation.” 链接 ↗

115. DLR‑RM, “BlenderProc2: A Procedural Pipeline for Photorealistic Rendering.” 代码与文档 ↗

116. SimWorld Studio official project page. 链接 ↗

117. NVIDIA, “Omniverse: Develop Physical AI Applications.” 链接 ↗

118. Siemens, “AI‑driven Industrial World Modeling,” PLANET of MIMICS Research Radar. 链接 ↗

119. NVIDIA, “Cosmos World Foundation Models and Physical AI Data Tools,” 2025. 链接 ↗

120. Niantic Spatial, “Large Geospatial Model,” 2024. 链接 ↗

121. CARLA Simulator, open‑source autonomous driving simulation platform. 链接 ↗

122. Fremont et al., “Scenic: A Language for Scenario Specification and Data Generation,” 2020; official language site. 链接 ↗

123. Li et al., “ScenarioNet: Open‑Source Platform for Large‑Scale Traffic Scenario Simulation and Modeling,” 2023. 链接 ↗

124. Li et al., “MetaDrive: Composing Diverse Driving Scenarios for Generalizable Reinforcement Learning,” 2021. 链接 ↗

125. Waabi, “How Waabi World Works.” 链接 ↗

126. Applied Intuition, “Products: Simulation, Evaluation and Physical AI Platform.” 链接 ↗

127. Foretellix, “Foretify Testing and Verification Platform.” 链接 ↗

128. Parallel Domain, “PD Replica and PD Sim.” 链接 ↗

129. Wu et al., “WorldReasonBench: Human‑Aligned Stress Testing of Video Generators as Future World‑State Predictors,” 2026. 链接 ↗

130. OpenAI, “Introducing the Codex app,” 2026. 链接 ↗

131. Hu et al., “SceneCraft: An LLM Agent for Synthesizing 3D Scenes as Blender Code,” ICML 2024. 系统以场景图规划关系,将关系转为数值约束和Blender Python脚本,再用视觉语言模型检查渲染结果并迭代修正;论文展示了包含约百个三维资产的复杂场景。 论文 ↗

132. World Labs, “API Pricing.” 标准World生成1,500 credits,Draft生成150 credits;输入类型另有附加credits。 官方计价 ↗

133. Yang et al., “Holodeck: Language Guided Generation of 3D Embodied AI Environments,” CVPR 2024 Supplementary Material. 补充材料报告单房间原始实现约3分钟、GPT‑4 API成本约0.2美元。 补充材料 ↗

134. Reddit r/ClaudeAI, “I tested Claude + Blender MCP for real 3D workflows,” 2026. 用户测试显示简单房间可快速生成,但复杂网格清理尚未达到生产标准,且完整过程包含多次失败尝试。 用户复盘 ↗

135. ahujasid/blender‑mcp issue tracker and user reports, 2026. 公开问题集中在调用超时、连接中断、不完整JSON、视口异常与状态恢复。 Issue 279 · Issue 264 · Issue 256 · 用户复盘

136. “Agent Augmented 3D Modeling: A Planner‑Actor‑Critic Framework,” arXiv:2601.05016, 2026. 研究以规划、执行和批评回路组织三维操作,反映单次脚本直出正在转向带状态检查的长程代理。 论文 ↗

137. World Labs, “Announcing the World API.” 链接 ↗

138. ACE Robotics / SenseTime, Kairos 3.0 world model. 链接 ↗

139. GigaWorld Team, “GigaWorld‑0: World Models as Data Engine to Empower Embodied AI,” 2025. 链接 ↗

140. Field AI, “Field Foundation Models / Belief World Model.” 链接 ↗

141. SpatialVerse official site. 链接 ↗

142. Manycore Research. 链接 ↗

143. Fang et al., “iWorld‑Bench: A Benchmark for Interactive World Models,” 2026. 链接 ↗

144. Hopkins et al., “Factorio Learning Environment,” 2025. 链接 ↗

145. Gu et al., “BlenderGym: Benchmarking Foundational Model Systems for Graphics Editing,” CVPR 2025 Highlight. 基准包含245个手工构造的Blender编辑任务,覆盖程序化几何、灯光、程序化材质、形变与对象摆放;论文与补充材料报告前沿VLM在细微差异识别、正确属性修改和可执行脚本生成上仍存在系统性失败。 项目页 ↗论文 ↗失败案例 ↗

146. Yang et al., “SceneCraft: Layout‑Guided 3D Scene Generation,” 2024。补充材料Figure E、F报告两类场景合成失败:对象过密与边界框高度重叠时几何无法收敛;房间布局与提示语义不匹配时难以生成合适内容。 项目页 ↗论文 ↗

147. Ling et al., “Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation,” ICLR 2026。项目页明确说明,直接使用规划场景图会因检索资产与视觉对象的尺寸、姿态差异产生错位、穿插和不稳定,因此需追加物理优化与空间一致性审阅。 项目页与视频 ↗论文 ↗

148. Fan et al., “MAGIC: Transition‑Aware Generation of Navigable Multi‑Scene Game Worlds with Large Language Models,” 2026。100例多场景基准把连接一致性、场内可达性和真实传送执行纳入验证;论文报告直接LLM基线生成的Unity项目没有一个可直接执行,HOLODECK也频繁漏门并受到高场景占用率影响。 论文 ↗代码 ↗

149. Alaya Lab, “AlayaWorld: Long‑Horizon and Playable Video World Generation,” 2026。官方项目页提供同一左右转与回看轨迹下的四方法视频对比,可用于观察感知式世界生成中的跨视角记忆漂移。 官方项目页与对比视频 ↗

150. Moonshot AI, “Kimi K2,” 2026。官方页面展示浏览器Minecraft式3D体素世界,包含程序化地形、树木与Canvas生成的方块纹理。 官方页面 ↗

151. Google, “Gemini 3: Introducing the latest Gemini AI model from Google,” 2025。官方发布材料展示复古3D飞船游戏、体素美术和可玩的科幻世界,用于说明模型把自然语言、代码与交互界面连成可运行结果。 官方页面 ↗

152. OpenAI, “Introducing GPT‑5.3‑Codex,” 2026。官方案例包括赛车与潜水游戏,并说明高质量结果来自跨多轮、数百万Token的自主迭代;这表明“一句话”通常是任务入口而非单次推理。 官方页面 ↗