盖世汽车讯 为了能够在动态的现实环境中可靠运行,机器人应当能够快速掌握新技能,而无需接受大量额外训练。然而,目前大多数机器人系统主要只能很好地完成训练时所学习的任务。
教会机器人完成新任务既耗时又昂贵。此外,额外训练有时还会影响机器人完成此前已经学会的任务的能力。
据外媒报道,近日,北京理工大学、X SQUARE ROBOT和清华大学的研究人员开发了HOST(Human-to-robot One-Shot Skill AcquisiTion,人到机器人单次技能获取),这是一种有望帮助机器人更快速、更高效地获得新技能的新框架。他们在预印本服务器arXiv上发表的一篇论文中介绍了这一学习方法。该方法允许机器人仅通过观看一段人类演示视频就获得新技能,同时不会损害此前已经掌握的能力。
Guangyan Chen、Meiling Wang及其同事在论文中写道:“对于机器人而言,快速、轻松地获得技能,同时保留已经掌握的技能,是至关重要的。然而,当前方法仍然依赖一种繁琐的训练阶段循环,这一过程成本高、速度慢,同时还会削弱已经掌握的技能。我们提出了HOST框架,使机器人能够仅凭一段人类视频在数秒内获得新技能,同时保留此前已经掌握的技能。”

图片来源:Chen等人
HOST如何将人类演示转化为机器人动作
Chen、Wang及其同事开发的这一框架,只需分析一段展示人类操作过程的视频,就能帮助机器人获得新技能。整个过程主要分为三个阶段。
首先,HOST利用摄像头采集的图像,判断机器人在完成人类视频所示操作流程时已经进行到了哪一步。换言之,它会识别人类演示中与机器人当前阶段相对应的部分。
随后,该框架分析人类演示接下来即将发生的部分,并预测机器人在继续执行任务时应该观察到什么。这一中间步骤帮助HOST考虑人类演示者的身体结构与机器人自身物理结构之间的差异。
最后,HOST根据预测得到的未来观测结果,推导出机器人应当执行的动作。机器人通过反复确定当前进度、预测下一步应该观察到的内容,并选择相应动作,就能够跟随人类演示的操作流程,同时根据自身的身体结构对其进行适配。
尽管HOST无需更新自身参数,仅凭一段视频即可获得新技能,但其底层框架此前已经使用涵盖229项任务的193,462条机器人轨迹进行了训练。随后,该框架又利用5,847段人类演示视频进行了适配,每段视频均与相应演示任务的机器人轨迹配对。
论文作者写道:“HOST通过一系列基于自身状态的预测来解决技能获取问题。它首先估计机器人在演示任务中的进度,然后将接下来的任务进程转化为机器人自身未来的观测结果,最后根据这些预测的观测结果推导出动作。这一系列预测过程的训练目标与视频演示相关联。这些目标通过将机器人轨迹和视频演示映射到一个共享的任务进度流形上获得,随后重新定义每个目标,使其与视频的未来进程保持一致。由此,HOST能够使机器人主动跟随演示流程,并根据机器人自身的本体结构对其进行适配。”
加快机器人技能获取的潜在路径
研究人员利用一个真实世界中的双臂机器人系统对该框架进行了测试。该系统由两台ARX R5六轴机械臂组成,每台机械臂均配备平行夹爪,此外还搭载了三台RGB摄像头。
研究人员让机器人执行50项此前从未见过的实体操作任务。这些任务涉及不同的物体和工具,并要求机器人完成不同的动作。每项任务尝试20次,每次尝试时物体的初始位置或朝向都会有所不同。人类评估人员负责判断每次尝试是否成功。
Chen、Wang及其同事写道:“HOST能够在推理阶段仅凭一段人类视频获取新技能,平均耗时29秒,平均成功率达到62%。在保留此前已掌握技能的同时,其表现比零样本(zero-shot)基线高出45%。HOST甚至超过了针对每项任务使用50次机器人演示进行微调的基线方法,但所需演示次数减少了50倍,同时每项技能的获取速度提高了507倍。”
初步测试结果凸显了HOST在帮助机器人更快速地学习新技能、减少对大量特定任务演示依赖方面的潜力。未来,研究人员可以进一步完善这一框架,提高其成功率,并在其他机器人或更广泛的应用场景中进行测试。