AGI 原野

封面

对话交大薛宇斐:如何让不同品牌机器人,听从同一个指令?“一脑多形”运动控制模型

AGI 原野访谈回顾  Maggie X 薛宇斐

一个大脑,能不能控制多种身体?

如果你看到一群高矮胖瘦、来自不同厂商的人形机器人,跟着同一个节奏做动作,第一反应可能是:这是不是提前编排好的表演?

但在机器人研究者眼里,这背后真正有意思的问题是:同一个控制策略,能不能迁移到不同的机器人身体上?

这一期 AGI 原野,我们请到上海交通大学博士研究生薛宇斐。他的研究方向是具身智能与人形机器人全身运动控制,最近一项工作关注的是「跨本体」控制,也就是让已有控制器适配不同的人形机器人。更形象一点说,就是一脑多形

薛宇斐团队与多款人形机器人演示视频

01 PART 运动控制到底控制什么

CONTROL · 从指令到动作

在普通人的直觉里,机器人完成一个动作,可能只是「听懂指令,然后去做」。

但宇斐在访谈里把这个过程拆成了三层。

第一层是语言和视觉感知。机器人要先理解人给出的任务,比如「走过去,把桌上的话筒拿起来,放到沙发上」;同时,它还要通过视觉理解周围环境。

第二层是 Planner,也就是规划器。它会决定机器人接下来怎么走、走到哪里、用哪只手抓取、如何放下。

第三层才是底层运动控制。它负责把规划器给出的轨迹,转化成电机该输出的扭矩、位置、速度,让机器人真的动起来。

如果把机器人类比成人,大脑负责理解和规划,小脑负责把规划变成身体动作,而身体本身决定了动作能不能做、怎么做。

这也是为什么「运动控制」听起来像一个很底层的问题,但它实际上决定了机器人能否稳定、自然、低成本地完成任务。

02 PART 同一个任务,换个身体就变了

BODY · 机器人本体差异

人形机器人看起来都差不多:一个头、两条腿、两只胳膊。

但从控制角度看,不同机器人之间的差异非常大。有的机器人只有 20 千克,有的接近 70 千克;有的腰部有三个自由度,可以俯身;有的腰部没有自由度,只能通过下蹲完成同样的任务。不同厂商的电机性能、关节排布、机械结构,也都会影响控制策略。

所以,同样是「拿起桌上的水杯」,一个机器人可能可以弯腰拿,另一个机器人必须蹲下来拿。

这就带来一个现实问题:过去很多控制器都是为某一台特定机器人设计的。一旦换了新的型号,算法往往不能直接部署,需要工程师重新调试。宇斐在节目里提到,对于有经验的工程师来说,一套新算法适配到新本体上,可能也需要一周左右;如果加上训练时间,周期还会更长。

03 PART 一脑多形,压缩适配时间

ONE BRAIN · MANY BODIES

宇斐团队想解决的问题是:能不能设计一个控制器,让它在训练阶段见过足够多不同的机器人本体,从而对新的未知机器人也具备泛化能力?

他们把这个方向称为「跨本体」,或者「一脑多形」。一个控制策略向多种机器人本体泛化。

在这项工作中,团队在仿真环境中测试了 12 款机器人,在真实环境中测试了 7 台机器人,覆盖了多家厂商和不同类型的人形机器人。真实部署并不轻松。宇斐提到,整个 Sim-to-Real,也就是从仿真迁移到真实机器人的过程,团队花了大约三个月。

但一旦通用控制策略跑起来,新的意义就出现了:当一个新机器人本体出现时,工程师不再需要从头开始做适配,而是在已有控制策略基础上微调。按照宇斐的判断,熟练工程师可能用半天到一天,就能完成过去需要一周左右的工作。

这对机器人公司非常关键。因为整机研发本身就是一个长周期过程。一个新本体设计出来以后,公司需要尽快知道:这个结构合不合理?哪些动作能做?哪些地方有问题?如果控制适配周期被缩短,硬件迭代速度也会随之加快。

04 PART 数据仍然是瓶颈

DATA · 具身经验从哪里来

这期访谈里,一个反复出现的关键词是数据。

训练跨本体控制器,需要让模型见过不同机器人的本体信息。问题是,很多机器人厂商会把自己的 URDF 文件视为资产,并不会公开。宇斐提到,他们调研时看到海内外人形机器人类型已经有 50 多种,但最后真正能拿来测试的只有 12 款。

所以,他们的一个核心贡献,是在数据不足的情况下,想办法高效生成一部分具身数据。

访谈中还聊到机器人操作数据的三种来源:遥操作、UMI 和 Ego 数据。遥操作质量高,但成本高、效率低;UMI 介于两者之间;Ego 数据则更接近「人戴着设备正常工作,同时记录动作过程」,成本更低,也更容易大规模铺开。

遥操作:质量更直接

每一条轨迹都需要机器人参与,数据目标明确,但采集周期和成本更高。

UMI:折中方案

不一定需要整台机器人参与,但仍会影响人的操作效率和动作自由度。

Ego 数据:更容易铺开

让人在真实工作中正常操作,同时记录动作过程,更接近低成本、大范围采集。 

这解释了为什么今天很多具身智能公司和研究团队,都在寻找低成本、可规模化的数据采集方式。机器人不是只缺模型,也缺足够好的身体经验。

05 PART 从实验室到工厂

DEPLOYMENT · 长期运行的问题

实验室里的机器人演示,和工厂里的长期运行,是两件事。

在实验室里,研究者可以为一个任务做很多调试,环境也相对可控。但一旦进入真实场景,机器人需要面对更复杂的地面、更长时间的运行、更少的人为干预。

宇斐提到,真正走向工厂,至少有三个问题要解决。

第一是能耗。算法不只是要让机器人完成任务,还要让它以更低能耗完成任务。否则机器人可能工作一小时就没电,而不是连续运行三小时。

第二是硬件稳定性。电机、控制器、整机结构,都要经得起长时间运行,不能频繁下线。

第三是自主能力。未来机器人要在各种环境中完成操作任务,这对算法提出了更高要求。

所以短期来看,宇斐更看好人形机器人先进入工厂、物流等相对标准化的场景。家庭当然是更令人期待的方向,但家庭环境变量更多,难度也更高。

06 PART 通用和专用不是二选一

GENERAL · SPECIAL

一个很有意思的问题是:未来人形机器人会走向统一,还是越来越多元?

宇斐的判断是,两件事会同时发生。

一方面,机器人产业会出现一定程度的标准化。就像智能手机时代,很多内部元器件、接口会逐渐变得标准化。

另一方面,不同厂商仍然会有不同的系统、形态和产品路线。机器人不会只有一种形态,也不会只有一种操作系统。

在这个类比里,控制器有点像机器人上的 App。一个好的控制策略,不应该只能运行在某一台机器人上,而应该能适配不同型号、不同形态的机器人。

通用控制适合那些大众都会需要的能力,比如行走、搬运、洗衣、做饭;专用控制则适合更具体的场景,比如护理、特定工厂工序、特定家庭需求。它们不是互相替代,而是互补。

07 PART 不只是会跳舞

TREND · 从表演到交互

过去一年,很多人形机器人演示集中在跳舞、翻跟头、表演性动作上。它们让大众第一次感受到机器人运动能力的进步。

但宇斐认为,未来 12 个月,实验室场景中机器人的自主能力会继续增强;在现实生活的展示中,机器人可能会更多进入带交互的运动场景,比如拳击、羽毛球、乒乓球。他希望证明,在某些场景下,人形机器人相比轮式双臂机器人,确实有它不可替代的价值。

图片

当一个控制器可以跨过不同的身体,机器人产业真正获得的,是一种更快迭代、更快部署的能力。

这也是我们觉得这期访谈很值得记录下来的原因。

人形机器人不是单纯的硬件竞赛,也不是单纯的模型竞赛。它是在数据、模型、机器人学、硬件和工程落地之间不断对齐的一整套系统工程。

更完整的访谈内容,已经上传在视频号/小红书/B站/搜狐视频/YouTube。

在完整访谈里,我们还聊到了 Sony AI 打乒乓球的进展、机器人未来进入家庭的可能路径,以及未来 12 个月人形机器人可能出现的变化。本文篇幅有限,这些内容没有全部展开。

感兴趣的朋友可以去看完整视频。节目已经发布在 AGI 原野的微信视频号、B站、小红书和、YouTube和搜狐视频。



欢迎加入 AGI 原野的讨论

如果你正在做人形机器人、具身智能、工厂自动化,或者你手里有真实场景,希望加入技术、产品、产业和投资视角的交叉讨论,欢迎通过 AGI 原野社群和我们联系。

AGI 原野社群里有很多来自 AI、机器人、产业、投资和内容领域的伙伴。长期来看,我们想做的是让真实需求和真实能力更高效地匹配:有人知道问题在哪里,有人知道怎么把它做

图片