通过观看视频,机器人29秒就能学会一项新技能

一篇发表在arXiv上的研究论文介绍了一套名为HOST的机器人学习框架。这套框架的特殊之处在于,它能让机器人只看一段人类演示的视频,就能在“推理阶段”当场学会一项新的操作技能,而无需重新调整模型内部的参数。

研究作者来自X Square Robot公司及相关学术机构。他们在论文中报告,HOST平均只需29秒就能完成一次新技能的获取,测试中的平均成功率为62%。这个数字来自作者自行设计的实验环境,目前还没有经过第三方机构的独立复测,所以还不能视为通用部署的可靠保证。

和常见的模仿学习思路不同,HOST不需要机器人自己先做一遍演示,也不需要针对每个新任务去做专门的模型微调。它只把人类视频当作一个“指引信号”。系统内部会先判断演示者当前进行到了任务的哪个阶段,然后预测机器人自身应该看到什么样的状态,再根据这个预测来生成下一步动作。

这种设计的关键在于,模型原来的学习权重始终保持不变。每一次新技能的学习,只是把视频当作一个临时的输入条件,而不是新增训练数据。这样一来,既避免了逐个任务微调带来的耗时问题,也降低了遗忘旧技能的风险。

论文给出的对比数据也值得留意:相比一个在50条机器人演示数据上微调过的基线,HOST所需的演示数量减少了50倍,技能获取速度则快了507倍。但作者自己也承认,62%的成功率说明“看一遍就学会”和“稳定可靠地执行”之间还有明显距离。

对于从事机器人开发的团队来说,HOST真正有启发的点在于它的“推理时学习”思路——让一个已经训练好的策略,在外界演示的引导下完成新任务,而不必每次都启动一轮新的优化循环。接下来值得关注的是,其他实验室能否在不同型号的机器人、不同任务场景下复现类似的结果,以及在什么情况下这种进度匹配机制会失效。这些才是衡量这项研究实际价值的关键。

(素材来自:X Square Robot 智算芯能前沿网综合)

标签:机器学习 AI

本文由智算芯能前沿网编辑整理,转载请注明出处。