物理AI拐点:国产空间具身智能底座,为什么是紫东太初被看见
3 小时前 / 阅读约10分钟
来源:36kr
多模态大模型进入工厂和实验室,暴露出物理AI产业化门槛。中科紫东太初开源通用多模态大模型ZDTaichu5.0-9B,提供空间具身智能方案,完成实体场景闭环验证,推动物理AI落地。

当下,多模态大模型进入工厂和实验室,一个局限迅速暴露——它们能看懂图片,却难以判断真实现场中的方位、遮挡和视角变化,更难据此规划行动。而这也是物理AI真正走向产业化必须跨过的一道门槛。

海外,Google、英伟达以及李飞飞创办的World Labs接连加码物理AI与世界模型;国内则逐渐形成两类技术路径:一类是主攻垂直具身大模型,聚焦机器人空间具身理解与操控;另一类从通用多模态大模型出发,持续扩展图文音视频等综合认知能力。前者更贴近真实物理任务,后者拥有更强的通用认知基础,但如何让两类能力在同一个模型中真正统一,依然是行业尚未解决的问题。

9月15日,中国科学院自动化研究所孵化的国家队企业中科紫东太初,开源面向物理世界的通用多模态大模型ZDTaichu5.0-9B。按照团队披露的横向评测,该模型通用能力维持第一梯队水平,同时是10B参数规模内空间具身能力领跑的通用多模态大模型,在九项国际空间具身理解基准中拿下八项组别第一。

跑分只能说明一部分能力。这次开源还包含空间多模态数据生产管线,模型也在科研实验和智能制造任务中进行了落地测试。这款模型延续了紫东太初多年的原生多模态路线,并把AI能力的边界进一步推向物理世界。

这一突破,也催生出两个值得深究的命题:当AI从读懂数字世界,进阶到理解、规划并介入真实物理现场,中国需要构建怎样的自主可控AI底座?紫东太初,又凭什么能成为这条赛道值得重点关注的选手?

物理AI拐点

空间具身智能底座成为必争之地

过去的大模型主要处理相对稳定的数字内容。进入物理现场后,模型面对的是持续变化、无法完全预设的环境。机器人要识别眼前的对象,还要判断它在哪里、与其他物体是什么关系,以及下一步该做什么。

空间具身理解已经是当今AI从数字世界进入物理世界必须补齐的基础能力。

以制造业为例,国际机器人联合会(IFR)统计,2024年中国新装工业机器人约29.5万台,占全球的54%,在役总量超过200万台。

然而在以预设程序为主的产线上,机器人擅长执行重复任务,一旦工件换型或工艺调整,往往需要工程师重新示教、标定与调试——这正是柔性生产长期悬而未决的痛点,也是空间具身智能最直接的产业价值所在。

但从模型能力到真实产业现场,中间仍存在明显断层。

开源权重只是起点。企业还要把工业和科研数据转成可训练样本,再用这些数据迭代模型。许多项目也缺少实体任务验证,模型在仿真之外的表现仍待检验。因此,产业需要的是一套能持续理解现场、处理空间关系并生成任务规划的空间具身智能方案。

Benchmark只能验证局部能力。空间具身智能的竞争,取决于模型能否从“看懂”走向“理解—规划—执行”。谁能把这条链路真正跑通,谁才有可能成为机器人、柔性制造与科研自动化背后的通用智能底座。

而ZDTaichu5.0-9B,正是紫东太初针对这一产业问题给出的实践方案。

紫东太初,从原生多模态模型里长出来的空间具身智能玩家

要理解这款模型,首先需要破除一个常见误解:ZDTaichu5.09B并非面向热点单独开发的全新项目,而是紫东太初长期技术路线演进的里程碑。

这家成立于2024年的公司,由中国科学院自动化研究所孵化,作为国家队企业,目标打造自主可控的中国通用人工智能底座。

它的技术路线可以追溯到2021年——彼时中国科学院自动化所发布千亿参数规模的图文音三模态大模型“紫东太初”,让图像、文本与语音在同一个模型里统一表示,这一布局早于行业多模态热潮。

此后的2.0版本纳入视频、传感信号与3D点云;4.0版本从多模态理解走向多模态深度推理;到了ZDTaichu5.09B,能力重心进一步落在空间感知、跨视角推理、任务状态维护与具身条件判断上。

换言之,空间具身能力是紫东太初原生多模态路线的自然延伸。

这种一体化的技术路线,带来了一个关键差异:空间具身推理能力提升的同时,图文理解、OCR、视觉数学、代码与Agent等通用能力仍然保持第一梯队。这一点对产业至关重要——真正的工业现场,既要看清物体位置与空间关系,也要读懂工单、识别仪表、理解实验文档,通用能力与空间能力必须同时在线。

根据团队披露的横向评测,在10B参数档位的通用多模态大模型中,ZDTaichu5.09B在九大国际权威空间具身理解基准测试中斩获八项通用组别第一,是这一档位空间具身能力最强的通用多模态模型。差距最大的复杂空间推理上,考察跨视角定位的ViewSpatial得分62.5,参与对比的同档模型为48.2;在考察三维空间推演维度的MindCube-tiny上则高出20.67分。

这组结果说明,它没有靠牺牲通用能力换来空间跑分。其自研的自适应循环推理,会让模型先评估每一步输出的把握,对空间变换、物体关系、操作条件等吃不准的环节增加几轮内部计算再作答,算力向难题倾斜,平均推理成本可控,也更适合产业端部署。

两大稀缺护城河

拉开与普通开源模型的差距

榜单只反映模型在规定题目中的表现。企业还要解决两个实际问题——如何用自有数据继续训练,以及模型进入设备后能否连续工作。ZDTaichu5.0-9B此次开源同时覆盖了数据管线和实体任务验证。

护城河一:不止开源权重,同步开放完整数据生产管线

市面上绝大多数开源模型只放出权重。企业拿回去后最常踩的坑在于:手里明明攒下了大量工厂现场视频、仿真数据与实验记录,却不知道如何把这些原始材料清洗、标注、构造成高质量的空间任务样本,最终无法完成自有数据的微调与迭代。

紫东太初的差异化在于,它在开放模型权重的同时,同步开源了一套经过验证的空间多模态数据生产管线方案——从数据接入与清洗、空间具身能力标注,到任务轨迹构造与样本校验,为微调和强化学习准备好数据。

如果说权重是一台出厂调好的设备,那么这套管线更像随设备附带的完整工艺文件:企业换了工件,可以照着工艺重新备料、打样与检验。

它的意义并不局限于交付一套基础模型,而是回应了产业“拿到模型、却无法用自有数据迭代”的普遍痛点,降低了全行业进入空间具身智能的门槛。紫东太初也把自身多年沉淀的数据工程经验,转化为产业可复用的开发方法,而这是过去普通开源模型难以提供的能力。

护城河二:拒绝“跑分即终点”,完成实体场景闭环验证

产业层面往往对“只刷Benchmark的模型公司”保持警惕。紫东太初的解法是,不止停留在仿真测试,已经将能力推进到科研智能与智能制造两大高价值赛道,完成真实实体任务的验证。

在科研场景中,ZDTaichu5.0-9B已接入紫东太初的科研智能体平台ScienceClaw开展测试。该平台覆盖8个学科,并验证了干实验和湿实验任务。

干实验中,研究者用自然语言提出一个阻尼振子问题,ZDTaichu5.0-9B在ScienceClaw中调用数学与编程工具求解、交叉比对解析解与数值解后输出分析报告;湿实验则把模型带到实验台前——试管按序入架、滴管液体转移等任务中,模型需要持续追踪对象位置、判断任务进度,这正是自动化实验平台编排上层任务所必需的能力。

在制造场景中,模型验证了工单与设备能力的衔接——从“将红架上的篮筐放到传送带上”这类工单指令出发,完成对象识别、空间关系理解、高层任务规划,直至依据执行反馈确认任务完成;在与某先进制造企业的合作中,模型读懂工艺图纸并转成机器人可执行的焊接代码,根据实时捕捉的焊缝间隙与错边量生成焊接路径,目前支持25种焊接工艺。

可以看到,很多模型还停留在实验室仿真,而紫东太初已经完成了从“空间具身理解推理—具身任务规划—实体执行反馈”的完整链路验证。

在战略选择上,它并不涉足机器人整机硬件,而是通过“一脑多形”的具身智能平台适配50多种机器人本体——模型负责高层理解与规划,底层的导航、抓取、夹爪控制与安全逻辑仍交由成熟系统,从而保护工厂已有的硬件与控制投资,降低产线改造门槛。这种“底座平台”的产业位置,也为其商业空间打开了更大的想象。

站在物理AI浪潮

看紫东太初的产业空间

ZDTaichu5.0-9B是紫东太初“模型—数据—场景”体系的一次阶段性呈现。

模型层提供原生多模态底座,兼顾通用能力与空间具身能力;数据层以自研数据生产管线,解决物理AI最难的“数据工程”难题;场景层则通过科研、智能制造与机器人持续验证,反过来反哺模型迭代。

未来机器人产业、柔性智能制造与科研自动化都需要空间具身智能底座,而国产自主可控的需求尤为强烈。ZDTaichu5.0-9B所在的9B档位,兼顾了性能与部署成本,适合私有化、端侧及产业端的大规模落地,具备清晰的商业化承接路径。

纵观当下的AI竞赛,大模型的竞争,已经走过单纯比拼参数量与榜单跑分的阶段。物理AI时代,真正的硬实力,还要看模型能不能走出实验室,落地到真实工厂与产业场景。国内不少玩家只占据“模型—数据—场景”中的某一环,而紫东太初是少数同时跑通三层链路的国产底座企业。

ZDTaichu5.0-9B开源的价值,已经超越一款开源模型本身。它向产业展示的,是紫东太初从原生多模态大模型,向空间具身智能演进的完整能力图谱。依托中国科学院自动化所的技术源头,通过“模型—数据—场景”的闭环布局,紫东太初正在为中国物理AI提供一套自主可控、可落地的基础底座方案。

当机器人、智能制造与科研自动化产业迎来爆发,底层基座的价值也将随之持续释放。而一支试管是否被准确放回架中、一只篮筐是否被稳妥放上传送带——空间具身智能的答案,最终都要在这些具体的现场里得到确认。