9月7日晚,宇树科技通过官方微博发布了一段视频,宣布公司首次实现了由世界模型实时驱动的全自主人形机器人格斗。
视频展示的核心技术,是一套名为UnifoLM-X2-1.0的世界-动作大模型。宇树科技方面介绍,该模型突破了瞬时规划、决策和动态交互执行等一系列技术瓶颈。
它让人形机器人能够在格斗场景中,实时完成对自身动作和对手行为的预测与规划。从视频呈现的效果看,机器人全程脱离人类遥控,自主完成了格斗中的各项动态交互。

视频画面
从“执行指令”到“自主决策”
人形机器人的运动控制,长期以来面临一个核心难题:在高度动态和强交互的环境中,如何让机器人实时做出正确决策。传统的做法通常依赖预设程序或人工遥控,机器人的“自主性”非常有限。
UnifoLM-X2-1.0的突破在于,它将“世界模型”引入动作生成链路——机器人在执行动作的同时,能够对“下一刻会发生什么”进行预测,并据此调整自身的动作规划。
格斗场景正是检验这种能力的最佳“考场”。与走路、搬运等相对规整的动作不同,格斗中的对手行为不可预测,接触与碰撞频繁发生,对机器人的瞬时反应、动态平衡和策略调整都提出了极高要求。
UnifoLM-X2-1.0在格斗场景中的成功运行,验证了世界模型驱动的人形机器人在高度动态和强交互环境下大规模落地部署的基础可行性。
为规模化部署扫清关键障碍
过去几年,人形机器人的能力演进大致遵循了一条从“能站”到“能走”再到“能干活”的路径。但无论是行走还是操作,大部分场景仍属于“弱交互”或“可预测交互”——机器人与环境的互动节奏相对固定,对实时决策的要求较低。

图片来自宇树科技官网
全自主格斗的技术难度在于它同时叠加了“高动态”和“强交互”两个维度。高动态意味着机器人自身的运动速度和加速度都处在较高水平;强交互则意味着机器人与外部世界(对手)之间存在持续且不可预测的物理接触。这两者叠加,对控制系统的算力、响应速度和决策模型都构成了严峻考验。
UnifoLM-X2-1.0的突破,意味着人形机器人在处理高度不确定性和实时交互方面的能力上了一个台阶。这为未来人形机器人进入更多需要实时决策和动态交互的复杂场景——比如灾难救援中的搜救作业、复杂地形下的自主导航、甚至工业环境中的协作装配——提供了技术基础。
行业影响
截至目前,宇树科技尚未披露UnifoLM-X2-1.0的更多技术细节,包括模型参数规模、训练数据来源以及具体算力消耗等。视频中展示的格斗场景也经过了剪辑处理,机器人在完整时长内的表现稳定性、失误率等关键指标仍有待更多信息佐证。
但从行业视角看,这次展示的意义在于:它证明了人形机器人从“按预设程序运动”向“在动态环境中自主决策”的跨越,在技术上是可行的。对于正在寻找机器人商业化落地路径的行业来说,这是一个值得关注的技术节点。
(素材来自:宇树科技 智算芯能前沿网综合)
本文由智算芯能前沿网编辑整理,转载请注明出处。
