智元机器人奥运首秀封神,戴着工牌狂揽18枚金牌
4 小时前 / 阅读约11分钟
来源:凤凰网
智元机器人在世界人形机器人运动会上表现出色,以量产机参赛获多枚金牌。其具备作业、运动、交互智能三位一体全栈模型,实现复杂任务稳定操作。创始人提出具身智能发展XYZ曲线,描绘技术探索到价值创造路线图。

赛博打工人请假来参加机器人奥运会了!

本届世界人形机器人运动会,出圈最频繁的要数从工厂请假来运动会的智元机器人。

它最终以 18 金 16 银 12 铜的成绩领跑奖牌榜。其中灵巧手摘取了八个专项比赛中的 7 块金牌,作业赛道赢取了 12 块中的 6 块金牌,竞技赛夺得了 5 块金牌。

武大智元联合队的灵巧手拿起小勺,在 27 秒内称出 20克盐,还能用镊子夹豆、搭建积木;精灵 G2 进入消防救援场景,也在图书馆完成图书整理;远征 A3 轻松完成外摆莲 540° 这样的高难度动作……

谁能想到,在参赛前,这些机器人还在工厂勤勤恳恳打工呢。

这是智元首次参赛,参赛机型均为量产机,并无为比赛专门打造的定制机型。

从打工人到运动员,智元打工基因不改,充分发挥了在实际落地场景中的应用积累,体现了机器人从能展示向能完成真实工作的部署态能力。

话不多说,APPSO 这就给你扒一扒这个人形机器人运动会的金牌大户,他们是怎么在赛场上大杀四方的。

平时是打工人,这几天是运动高手

开幕式现场,智元远征 A3 与奥运冠军丁宁,上演了一场人机 Battle。

乒乓球,大概是机器人最难演好的运动之一。球速快、旋转多,击球窗口以毫秒计算;更麻烦的是,对面还是个会临场变招、随时改变落点的奥运冠军。

结果这一场,远征 A3 直接打出了随机应变的味道。

上一秒还是乒乓高手,下一秒画风突变——

太极宗师,登场。

在武术-太极拳比赛中,远征 A3 一气呵成,完成全套高难度动作,包括腾空飞脚+外摆莲 450°、外摆莲 360° +马步、外摆莲 540°+马步。

早起锻炼的大爷也会赞叹一句:专业。

这也让智元在本届世界人形机器人运动会上收获了自己的第三枚金牌。

太极拳比赛其实看的不只是机器人能不能把动作做出来,最重要的是三个字:像、稳、难。

手臂、腰部和双腿不能各打各的。动作的起承转合、快慢节奏,也要连得起来。

以扎马步为例,不仅要把身体降下来,还要控制膝、髋和脚踝一起受力。稍微有一个关节没跟上,画面就可能从游刃有余变成连滚带爬。

面对太极拳这类新套路,A3 主要从灵创平台积累的运动数据中学习通用运动规律。系统在已有运动能力上继续适配动作轨迹和节奏。

训练过程中,智元还使用了 Sim2Real 方法。机器人先在仿真环境中练习起跳、转体和落地。工程团队可以调整动作参数,并反复测试不同状态。

随后,训练得到的策略会被迁移到真机。现实中的摩擦、关节间隙、传感器误差和落地冲击,与仿真环境存在差异。控制系统需要继续调整,才能让动作在真机上稳定完成。

太极讲究的收放自如,到机器人这里,实际上就是机器人本体结构和运控能力做了一次公开检验。

此外,运动会还决出了 100 米障碍赛金牌,智元灵犀 X2 夺冠。在高速行进状态下,智元灵犀 X2 同步完成绕障、跨越障碍、通过受限空间等一系列动作。

基于其自研的 AGILE 生成式通用小脑引擎框架,智元灵犀 X2 在通过不规则障碍物时兼具显著的速度优势与出色的稳定性,并能在多种地形下实现自主或半自主决策。

到了场景赛,相当于到了智元的主场。作为原生打工人的智元精灵 G2,在参加运动会前,早已在龙旗工厂,上汽工厂等大规模落地部署,工作经验非常丰富。

消防应急场景赛还原了真实的火灾环境,参赛机器人要依次完成危险品识别、异常阀门关断,以及灭火器抓取与灭火三项核心任务。

灭火器重达 4.5 到 5 公斤,远超市面上绝大多数人形机器人末端夹爪的负载上限。

智元没有为此定制昂贵的夹爪,而是在手腕处加装结构件,借助手腕本身的结构强度把灭火器勾起,再插入底盘上带 20 度倾角的专用承载桶,用一个巧妙的机械结构绕开了负载瓶颈。

配合这套动作的是智元自研的超视距遥操系统,系统基于 VR 方案做逆运动学映射,把操作者的身体动作转化为机器人指令,并采用全身控制把操作者身体运动映射到机器人全身,辅以力控策略,让机器人在与环境接触时具备柔顺性与容错能力,操作者不必刻意规避每一次碰撞,动作可以更自然、更连续。

在传统的机器人控制中,任何超出预设轨道的物理接触都可能导致关节电机的过载保护,进而引发系统停机。

通过引入基于力反馈的全身控制算法,智元让机器人在接触门把手、阀门或者消防器材时,能够像人类关节一样产生微小的弹性形变,从而吸收掉碰撞产生的冲击力。

图书场景赛考验的是全流程的稳定性。智元与清华大学、上海交通大学组建联合赛队参赛,需要完成出库运输、图书上架归位,以及错放图书识别与纠正三个任务。

在图书整理的实际操作中,书籍封面的反光、书籍排布的无序性,都对视觉识别提出了极高的要求。联合赛队采用的视觉模型不仅能够提取书籍表面的文字信息,还能根据书籍的厚度和倾斜角度,实时计算出最适合的抓取点。

比赛现场的观众可以看到,智元的机器人在书架前稍作停顿,双臂便能协同配合,精准地抽出指定书籍,并将其插入正确的空隙中。

金牌榜背后的大脑

硬件决定了机器人的身体极限,大脑则决定了其能否蜕变为人类未来不可或缺的真正伙伴。

智元能够在运动会上大放异彩得益于其构建了作业智能、运动智能、交互智能三位一体的全栈模型结构,使机器人具备了自主交互、稳定运动、自主规划和复杂任务执行能力。

智元 VLA 基座模型 GO-2 通过动作思维链,实现长程复杂任务的稳定操作,在 Libero-Plus 模型评测等多个国际头部榜单上持续领先。

传统的机器人控制往往采用端到端的直接映射,将图像输入直接转化为关节电机的控制电流。这种方法在面对简单、单一的任务时表现良好,但在面对需要多步规划的长程复杂任务时,模型的泛化能力会迅速崩溃。

为了解决这个难题,智元引入了动作思维链的概念。这一概念借鉴了大语言模型中的推理机制。

当机器人接收到一个复杂的任务指令,例如去厨房帮我拿一瓶冰可乐,GO-2 模型并不会立刻产生抓取动作,而是先在内部进行任务拆解。它会首先规划移动路线,感知冰箱的位置,然后预测打开冰箱门所需的力度,再识别可乐的摆放位置与温度特征,最终输出一连串协同的控制指令。

这使得机器人开始具备真正的自主决策能力。在国际知名的 Libero-Plus 评测中,该模型展现出了极高的任务成功率和对未知环境的强适应性。

与此遥相呼应的是,世界模型 GE-2 提供了长时间稳定且符合物理规律的生成式交互环境,成为机器人进化的物理引擎。在 2026 WorldArena Track 1 世界模型感知与动作响应赛道中,智元荣获总分第一。

GE-2 模型能够根据当前的物理状态,预测机器人做出某种动作后,周围环境在未来数秒乃至数分钟内的视觉变化和物理反馈。通过这种方式,机器人在进行实际操作前,可以在大脑中进行无数次的模拟想象。这种技术极大地减少了机器人在真实物理世界中因为试错而造成的硬件磨损与安全隐患。

在全球范围内,通过大模型赋予机器人智能的技术路线已经成为行业共识。

Google DeepMind 团队此前发布的 RT-2 模型尝试将视觉、语言和动作无缝结合,展示了互联网规模的数据如何直接转化为机器人的物理动作。

而斯坦福大学的 Mobile ALOHA 项目则证明了,通过低成本的硬件和高效的模仿学习算法,机器人同样可以完成炒菜、擦桌子等复杂的家务劳动。

英伟达具身智能负责人吉姆·范曾预测,未来所有的物理实体都将被大模型重新定义,人形机器人将成为最大规模的 AI 物理载体。

戴得了工牌,又赢得了金牌,才是未来需要的机器人

虽然这届人形机器人运动会带给我们很多乐子,但站在一个普通用户的视角来端详这些金属与硅片组成的造物,我们会产生一个最朴素的疑问:这些动辄价值数十万的人形机器人,究竟什么时候才能真正走进我们的生活,帮我们分担繁重的日常劳动?

在科幻电影里,机器管家总是无所不能。它们不仅能烹饪美味的晚餐,还能照顾老人、辅导孩子,甚至在主人遇到危险时挺身而出。

科幻喜剧《护工不是人》

目前市面上的许多人形机器人产品大多处于一种炫技阶段。

对于企业管理者或者普通家庭用户来说,他们需要的是一个能够稳定、高效、低成本执行重复性劳动的打工机器人。

这正是智元等国内头部机器人企业正在努力的方向。智元创始人邓泰华认为:这种每天搬几十斤的箱子、重复、简单、又对人身体有害的工作,就应该机器人来干。人的腰坏了换不了;机器人换一个关节就可以了。

人类社会的所有基础设施,从门把手的高度、台阶的宽度到汽车驾驶座的空间设计,都是围绕人类的身体结构来打造的。如果我们采用轮式或多足设计,机器人就不得不面对各种无法逾越的障碍。唯有人形,才能在不改变现有物理世界的前提下,实现最广泛的通用性。

智元或许会是首先实现部署态的具身智能公司,他们在 4 月给出了七大部署态生产力解决方案,在产线上下料、工业搬运、物流分拣、导览导购导引、服务零售站、安防巡检、工商业清洁等场景实现具身智能生产力落地。

过往多数具身智能落地仍停留在实验室验证、单点场景测试的试点模式,场景单一、无法复用、难以产生实际价值。部署态意味着智能机器人彻底脱离试验属性,实现多机批量上岗、常态化作业、长期稳定交付。

今年 6 月,多台智元精灵 G2 机器人集体进驻龙旗科技江西南昌量产工厂打工,累计完成 17625 次作业,任务成功率高达 99.99%。

展望未来,智元创始人邓泰华首次提出了具身智能发展的 XYZ 曲线,给我们描绘了从技术探索到价值创造的完整路线图。

按照智元的划分,X 曲线对应 2022—2026 年,让机器人像人一样动起来;Y 曲线对应 2026—2030 年,让机器人像人一样工作;Z 曲线则指向 2030 年之后更通用的智能与规模化生态。

可以想象,在未来的工厂车间、物流仓库乃至社区医院里,人机协作将成为日常。人类员工将主要负责策略规划、异常处理和创意工作,而那些枯燥、肮脏、危险、重复的重体力劳动,或许都更多交给人形机器人来完成。

在消防救援、灾害现场,人形机器人将承担高风险作业,把我们从危险环境中解救出来。

在商场、酒店、餐厅、展馆、机场,我们可能会越来越习惯和机器人直接交流:问路、点单、取货、咨询、导览。

而回到家里,机器人可以承担清洁、收纳、搬运、简单烹饪、物品整理等家务,甚至能够根据家庭成员的习惯主动完成任务。

尚且不用预言具身智能的iPhone 时刻何时到来,如果部署普及期真的到来,机器人接下来不会只能在舞台之上,具身智能生产力将成为更重要的主线。

但走向规模复制,它还要去回答人工接管、故障间隔、自动恢复、客户扩点和单位经济性等更现实的问题。

比起在台上拿金牌的铁疙瘩,人类更需要能拿工牌上班的具身牛马,现在我们距离这个转折点又近了一步。