
两个互为竞品的机器人本体,在同一套通用大脑的调度下,自主规划、协同作业、互相补位、自我进化。当全球顶级团队还在用精修短片展示“机器人能做什么”时,这个神秘模型直接用一段未经修饰的长镜头,平静地宣判了旧时代的终结——机器人已经可以“自己决定做什么、怎么做、什么时候停、和谁一起更省力地做”。
今天的科技媒体圈,被一段来源不明的视频彻底炸开了锅。
知名科技媒体量子位发布了一篇深度报道,描述了一段长达十分钟、一镜到底、无剪辑、无分镜、无重拍、无场外遥控、无人工指令介入的机器人Demo视频,画面甚至有些粗糙,拍摄场地不过是一个约15平方米的狭小出租屋,过道狭窄到人类转身都费劲,摄像机视角受限,光线也并不理想。但恰恰是这样一个“地狱级”的真实居家环境里,两台人形机器人——宇树科技的G1和智元机器人的远征A3,这两个在市场上互为竞争对手的硬件产品——正在共用同一套通用智能大脑,并肩工作,默契得像一对合作多年的老搭档。
擦玻璃、擦完把刮水器精准归位、从洗衣机取衣物、分类收纳、开关冰箱、判断食物是否该冷藏、取出需解冻的食材、整理桌面杂物、把围巾温柔地挂在同伴脖子上、甚至自主寻找箱子垫高自己去够高处……整整十分钟,没有卡顿、没有迷路、没有报错崩溃,有的只是对物理世界的深度理解、自主推理决策、实时纠错、动态调度、以及近乎人类的“偷懒”智慧。
看完这篇报道和附带视频片段,我坐在电脑前愣了许久。一个直觉告诉我:这可能就是我们一直在等的,具身智能领域的“GPT时刻”。
在深入拆解这段视频的每一个细节之前,我们需要先冷静地回顾一下,过去一年具身智能行业到底在争论什么,以及为什么这次展示出的能力,让所有业内人士都感到“后背发凉”。
过去几年,我们看过了太多精心剪辑、打光考究、配乐激昂的机器人Demo。在聚光灯下,它们能跑能跳能抓取,动作流畅,配合默契,仿佛距离走进千家万户只有一步之遥。但剥开那些华丽的包装,背后的真相往往令人尴尬——预设脚本、绿幕抠图、远程遥操、定点重拍、分段剪辑,这些在行业内已经是心照不宣的“公开秘密”。
一旦将这些“演示王者”扔进真实世界,面对物体的遮挡、光线的变化、接触面的形变、空间的未知变动,它们立刻从“超级英雄”变回“人工智障”,连最基本的环境适配都难以完成。
过去两年,具身智能行业内部一直爆发激烈路线论战。两大主流技术路线VLA(视觉-语言-动作模型)、WAM世界动作模型,各有支持者,但两者都遇到难以逾越的底层瓶颈。
VLA,也就是视觉语言动作模型,我们可以称之为数据直觉派。代表模型包括RT‑2、OpenVLA等。逻辑非常直接:输入图像 + 语言指令,直接输出机器人动作,本质学习 “看到什么画面,输出什么动作” 的映射关系,大量依靠人类遥操作采集的三元组训练数据。
优势是推理速度快,部署轻量化,但致命短板在于:它并不真正理解物理世界。它学的是数据统计出来的概率,不是物理因果,一旦遇到训练集没有见过的新场景、新交互,很容易输出荒谬动作。长时序任务下误差会持续累积,任务越往后,动作偏离目标越严重,并且模型高度绑定本体硬件,换一台机器人,就要大规模重新适配训练。
WAM 世界动作模型,可以称之为预判空想派。它的思路发生变化:不再直接输出动作,而是先预测执行动作之后世界会变成什么画面,基于预判画面,反推应该输出怎样的动作。
它具备一定的物理预判能力,但是存在致命的“知行割裂”。模型可以在想象空间当中推演世界变化,但是很难把推演结果转化成满足真实动力学约束的机器人关节轨迹,看得懂,想得明白,但是做不准。同时推理算力开销巨大,延迟高,真实机器人上实时落地难度很高。
归根结底,当下所有主流赛道,本质都是“数据驱动的任务拟合”。所有动作都是基于海量数据的“概率猜测”,而非对物理规则的理解。模型的能力上限被训练数据牢牢锁死;面对遮挡、接触、形变等需要真正物理推理的长尾场景时极易失效;遇到新场景、新交互、新硬件即刻翻车。这也是为什么行业Demo永远局限于短时长、单任务、无干扰的标准化场景,因为一旦把时长拉长,把任务复杂度提升到多目标、多步骤,绝大多数模型会在30秒内崩溃。
而今天这支神秘团队流出的10分钟绝密长镜头Demo,从第一帧到最后一帧,彻底跳出行业固有框架,从底层逻辑上绕过了VLA和WAM几十年无法跨越的物理交互鸿沟。
它不是数据堆出来的“条件反射”,而是基于物理规则实时计算、基于本体能力实时评估、基于任务目标自主规划决策的真正的“智能”。
用一句话概括:其他模型在“猜”动作,这个模型在“算”动作,并且“算”完之后还能不断“学”。
视频中最震撼我的一个细节,是机器人擦玻璃,我认为这个场景展现了机器人有了真正的“自主推理”

图源:量子位
宇树G1机器人用刮水器擦拭室内玻璃,几下之后发现有一处擦不干净。它没有卡住,也没有报错,而是 “思考” 后做出推理——脏污可能在玻璃外侧。于是,它侧身、后仰、探头、展臂,将拿着刮水器的手精准地伸出窗外,完成了外侧擦拭。
这一套动作背后,是对空间感知、动力学解算、力矩控制的三位一体融合。它知道自己手臂多长、窗户边框在哪里、伸出去会不会撞到、用多大力能擦干净。
这不是数据能“喂”出来的,这是模型对物理规则的深度理解和实时运用。
还有一个画面是视频进行到一半,设定的闹钟突然响起,两台机器人立刻中断手中的家务活,优先执行“收纳桌面和冰箱”的临时指令。更神的是,完成这项“插队任务”后,它们又精确恢复了此前被打断的任务——去洗衣机取衣物继续收纳。
这种多任务动态调度和情景记忆恢复能力,在全球范围内,是首次在机器人身上展现。此前的Demo只能执行单一串行任务,中途遭遇干扰,基本就是“任务崩盘”。
整段视频的最高潮,出现在两个机器人互动的瞬间。面对桌面上一堆杂物,宇树机器人双手占满,难以一次性搬完。智元机器人“看懂”了局面,自主决策将一条围巾挂在了宇树的脖子上,发现围巾过长,宇树甚至配合地弯下腰,让智元将围巾绕过自己的头部。

图源:量子位
随后,宇树尝试将围巾放到高处的柜子,身高1.3米的它够不到,便自主找到一个箱子,企图垫高。发现弯不下腰搬箱子,它一脚把箱子“踢”到了柜子旁。智元机器人看到同伴的困境,立刻放下手头工作,走过来凭借1.7米的身高优势,取下围巾,折叠整齐,放进了衣柜。
这是一段没有语言交流、只有基于共同目标的默契配合。全球首次跨品牌人形机器人的实时交互与动态协同。它证明,这套“通用大脑”完全解耦了硬件,可以适配任何品牌、任何构型的机器人。这对整个行业的分工模式将是颠覆性的。
虽然神秘团队尚未公开技术细节,但从视频中展现出的能力特征,行业专家已经可以做出相当深入的推断。这套模型之所以能做到VLA和WAM都无法企及的事情,核心在于三大底层技术内核的全面创新。
内核一:物理约束动力学学习——告别数据拟合,拥抱真实世界推理
区别于VLA和WAM纯数据驱动的训练模式,这套模型的核心逻辑是 “物理规则前置、动力学预测驱动”。
传统VLA模型学习的是“看到画面A,最可能输出动作B”的统计相关性,它不理解为什么动作B是对的,也不理解如果环境发生微小变化,动作B需要如何调整。而视频中的模型,所有动作轨迹都不是数据的概率拟合,而是基于重力、力矩、受力、空间约束的实时计算结果。
当机器人用刮水器擦玻璃时,它不是在回忆“训练数据里擦玻璃的动作是什么”,而是在实时计算:刮水器与玻璃表面的接触力需要多大?
当前角度下,手臂关节需要输出多少力矩?
如果玻璃表面有污渍,摩擦力会如何变化?
力矩该如何补偿?
当手臂伸出窗外时,机身重心偏移了多少?
需要如何调整站姿来保持平衡?

这种“基于物理规则实时计算” 的范式,使得模型具备了绝佳的外推泛化能力。它不需要见过“伸出窗外擦玻璃”这个具体场景的训练数据,因为它理解“擦玻璃需要多少力”、“手臂伸出窗外需要如何调整平衡”这些底层的物理规律。只要理解了物理规律,任何新场景都可以现场推导出最优动作。
拎拖鞋挂绳、肩搭毛巾、站箱子登高、用脚踢箱子——这些动作都没有出现在任何训练数据里,但模型通过与环境的实时交互和物理规则的约束,自主探索出了这些最优解。
内核二:跨本体统一建模——终结“硬件绑定算法”的时代
过往机器人模型与硬件深度绑定的根源在于,不同本体的运动学参数、自由度、传感器特性差异巨大。宇树G1和智元远征A3,一个身高1.3米,一个身高1.7米;一个轻巧灵活,一个负载更大;它们的关节数量、活动范围、力矩输出特性完全不同。以往,为宇树开发的算法完全无法迁移到智元上,反之亦然,一切都得重来。
这次视频中的模型,通过统一的动作表示空间与本体自适应机制,让同一套模型可以同时适配两个完全不同品牌的硬件平台,并完成不同本体的完美算法耦合。
这相当于为具身智能完成了一次“软硬件解耦” 。就像Windows操作系统可以安装在联想、惠普、戴尔等任何品牌的电脑上一样,这套“通用大脑”可以部署在任何构型的机器人身上。它剥离了硬件的差异化参数,只保留通用的物理推理、任务决策、运动基元。
跨品牌协同的实现,更是证明了这套通用大脑的兼容性与泛化能力已经达到了全球最前列。
这一突破对行业分工模式的冲击将是颠覆性的。硬件厂商不再需要自研算法,可以专注于提升关节精度、续航能力、成本控制;AI公司不再需要绑定特定硬件,可以专注于让“大脑”更聪明,整个产业链将被彻底重构。
内核三:长时序鲁棒闭环——支撑超稳定真实场景落地
10分钟无干预长流程作业,考验的不是单任务的执行精度,而是全链路动态纠错、误差抑制、时序规划的系统能力。
传统VLA模型之所以无法做长序列任务,是因为每一步的微小误差会持续累积,到后面完全失控。就像蒙着眼睛走路,偏了一度,走十米后就偏到了一米外。
而视频中的模型,依托全局任务调度框架,实现了三个关键能力:
第一,实时误差修正。 每一步动作完成后,模型都会通过视觉和力觉反馈确认结果,如果发现偏差(比如刮水器没有完全擦干净),立刻调整下一步的策略。
第二,动态任务调度。 闹钟响起的瞬间切换任务,完成后精确恢复,这背后是一套完整的任务状态管理和优先级调度系统。
第三,长程规划与短程执行的结合。 模型既有“10分钟内整理完整个房间”的长程规划,又能根据实时反馈灵活调整短程动作。
这三大内核的综合作用,使得视频中的模型具备了代差级的优势。
如果这个神秘模型的真实性得到确认,其技术路径被验证可规模化,那么它对整个具身智能行业的影响将是地震级别的。它不是在原有赛道上超越对手,而是直接重新定义了比赛本身。
一、“通用大脑”终结硬件的“军备竞赛”
过去几年,具身智能行业陷入了一场关于“本体”的军备竞赛。每家公司都在打造自己的专属硬件平台,并为之开发专属算法。这种模式导致两个严重问题:
第一,重复造轮子。每家公司在算法层面的投入大量重复,因为彼此不通用。
第二,锁定效应。一旦选择了某款硬件,就被绑定在了该硬件的能力边界内,很难迁移。
而“通用大脑”的出现,将彻底终结这场“本体之争”。就像智能手机时代的Android系统+高通芯片+各家整机制造商的分工模式一样,具身智能行业也将迎来“通用大脑+专业本体+场景应用”的三层分工。
硬件厂商可以专注于提升运动关节的精度和寿命、电池的续航能力、整机的成本控制;AI公司可以专注于让“大脑”更聪明、推理更快、泛化更强;应用开发商可以专注于理解具体场景需求,开发上层应用。
产业分工的细化,是一个行业走向成熟的标志。这场变革将催生出一批新的巨头,同时也可能让那些“算法绑定硬件”的封闭生态面临严峻挑战。
二、Scaling Law被改写,数据和算力不再是唯一护城河
一个令人震惊的信息是:有消息称,视频中的模型仅用了“几十个小时”的视频数据训练,就达到了视频中展现的效果。
如果这一消息属实,那将是对当前行业“数据崇拜”的一记响亮耳光。
过去几年,行业的主流叙事是“数据越多越聪明”——Scaling Law(规模定律)被认为在具身智能领域同样适用。各家大厂疯狂采集数据、堆叠算力、扩大模型参数规模,认为这就是通往通用智能的唯一路径。
但视频中的模型似乎证明了另一条路的存在:对物理世界底层规律的理解,比数据的堆砌更有效。
几十个小时的数据,放在今天的大模型训练中简直是“九牛一毛”。但模型却展现出了极强的泛化能力和自我进化能力,这意味着学习效率可能比数据规模更重要。
当然,我们必须保持审慎。“几十个小时”这个信息尚未得到官方确认,具体的数据质量、训练方式、算力规模也都不清楚。但即便数据量被低估了一个数量级,如果模型真的能在远小于行业惯常数据规模的情况下达到如此效果,那Scaling Law的确需要重新审视了。
未来的竞争,可能不再是“谁的数据多”,而是“谁更懂物理世界”。
三、具身智能的“ChatGPT时刻”真的来了
2022年11月,ChatGPT的发布让全世界第一次感受到了大语言模型的真正威力。那一刻,人们意识到:AI不再是玩具,它真的可以成为生产力工具。
而今天,这段10分钟的视频,或许正是具身智能领域的“ChatGPT时刻”。
它用最朴素、最直接的方式告诉我们:机器人真的可以进入家庭干活了,而且能干得比人类更好、更稳定、更不知疲倦。
擦窗户、收纳衣物、整理房间、取快递、做饭(暗示)——这些家务活,机器人正在一项一项地攻克。视频中的场景虽然只有10分钟,但已足够让我们窥见未来的生活图景:一个“通用大脑”调度家里的多台机器人,它们各司其职、协同作业,把人类从繁琐的家务中彻底解放出来。
这不仅仅是生活品质的提升,更是生产力的革命。当数亿家庭的家务劳动可以被机器人替代时,释放出来的人类时间和精力将流向更有创造性的领域。
四、从工厂到家庭,应用场景全面打开
在视频之前,行业对具身智能的落地更多聚焦在工业场景——工厂流水线上的分拣、搬运、装配。因为这些场景相对结构化,更容易实现。
而视频中的场景选择了一个极度非结构化的居家环境,恰恰展示了这套“通用大脑”在最复杂场景中的能力。如果家庭场景都能驾驭,那工厂、物流、商业服务等相对简单的场景更是“降维打击”。
我们可以大胆畅想:
家庭服务:擦窗机器人、衣物整理机器人、厨房助手、老人陪护……每个家庭可以根据需求配置不同本体,但共享同一个“通用大脑”,所有机器人越用越聪明,越协同越默契。
商业服务:酒店客房服务、餐厅送餐、商场导购、医院护理……机器人不再需要针对每个场景单独开发算法,一套“大脑”适应所有场景。
工业制造:不同工位、不同操作、不同产品的需求,都可以由同一套智能系统调度适配,真正实现柔性生产。
公共服务:灾后救援、危险环境作业、太空探索……人类去不了、不想去的地方,机器人可以去,而且可以协同去。
五、“神秘团队”引发的行业猜想与焦虑
目前,最大的悬念仍然是:这究竟出自哪家公司、哪个团队
量子位的报道和本文都无法给出答案。从视频的呈现来看,这个团队刻意保持低调甚至匿名——他们放出的是一段粗糙的、未经包装的原片,没有logo、没有署名、没有说明文字。这种“不炫技、直接亮底牌”的姿态,反而让整个行业感到了前所未有的压力。
有人说可能是某家低调的创业公司,有人说可能是某个顶尖高校的实验室,也有人猜测是某家大厂的“秘密项目”。但无论答案是什么,这个团队已经用一段视频宣告了自己的存在,并且把技术标准推到了一个令所有人望尘莫及的高度。
可以预见的是,接下来整个行业的投资逻辑、技术路线、人才流向都将发生剧烈变化。那些还在坚持“本体绑定算法”路径的公司将面临巨大的转型压力;那些相信“数据越多越聪明”的团队需要重新思考Scaling Law是否仍然成立;那些以为“通用智能还很遥远”的投资者可能需要连夜调整估值模型。
一个视频,炸出了一个新时代。
* 图片来源于网络,侵权请联系删除
