宇树发布通用人形机器人模型:7项具身推理评测领先参评开源模型

近日,宇树科技发布通用人形机器人基础模型UnifoLM-WLA-1.0。WLA是World-Language-Action,即世界-语言-动作。其具身推理底座UnifoLM-ER-1-4B在16项多模态感知与理解基准中,有7项领先表中参评的开源模型;整体结果与多款闭源模型处于相近水平。项目当前已开放部分模型权重和数据,其他模型、代码与数据仍在后续开放计划中。

这组结果显示,宇树在具身空间感知与推理方面进入开源模型前列。随着模型权重和数据逐步开放,人形机器人行业的竞争也将从本体性能延伸到基础模型、开发接口和应用生态。

宇树发布通用人形机器人模型:7项具身推理评测领先参评开源模型

7项具身推理评测领先,宇树进入开源模型前列

在16项多模态感知与理解基准测试中,宇树科技的UnifoLM-ER-1(基于Qwen3-VL-4B构建)在7项上取得开源模型最佳成绩,整体性能可与头部闭源模型比肩。

从表中结果看,UnifoLM-ER-1的优势主要集中在空间理解与推理。在RefSpatial-Bench、Where2Place、PixMo-Point、BLINK、EmbSpatial、RoboSpatial和VSR等7项基准中,它领先表中参评的开源模型;部分指标也高于Gemini-ER 2等闭源模型。

这些结果表明,UnifoLM-ER-1在空间理解与推理方面达到开源模型前列。该能力决定机器人能否识别目标、理解空间关系,并为后续动作生成提供依据。

这7项结果的意义不在于机器人的运动性能,而在于模型对物体、空间关系和交互条件的理解。运动控制决定机器人能否稳定执行动作,具身推理则为机器人判断目标位置、规划交互过程和生成后续动作提供基础。

这组结果覆盖物体指代、摆放位置、视觉指向和空间关系等多个维度,反映了模型较为完整的空间感知与推理能力。开放模型与评测结果也为后续复现和比较提供了基础。

从这组基准结果看,宇树的具身推理模型已进入开源模型前列。

一个模型覆盖64项任务:从桌面操作到全身操作

UnifoLM-WLA-1.0覆盖64项任务,包括10项全身操作和54项桌面操作。

这64项任务的重点不只是数量,而是由同一个模型覆盖桌面操作和全身操作,并协调机械臂、末端执行器与下肢动作。

过去的人形机器人系统常针对不同任务训练或配置不同策略,开发和迁移成本较高。UnifoLM-WLA-1.0使用一个6B参数模型覆盖64项任务,并支持二指夹爪和多种五指灵巧手。

这表明同一模型能够覆盖多类任务,并适配多种已纳入训练和测试的末端执行器。在整理鞋子、厨房或浴室等全身任务中,机器人需要一边移动,一边连续操作;铺床时,双臂动作也要与身体姿态和下肢平衡协同。

UnifoLM-WLA-1.0中的WLA是World-Language-Action,即世界-语言-动作。模型把具身推理、未来动态区域预测和动作生成纳入统一框架,使机器人先理解当前环境和可能发生的变化,再生成动作。

这种统一模型有望减少为每项任务分别开发策略的重复工作,并提高模型在相近任务和已支持硬件之间的复用效率。与单项演示相比,64项任务展示的是同一模型覆盖多种操作的能力;其跨场景与跨本体泛化仍需通过更多真实环境测试验证。

逐步开放模型与数据,争夺开发者生态

目前,宇树已上线UnifoLM-WLA-1.0项目主页,并开放部分模型权重和数据。后训练代码、UnifoLM-WLA-Base权重、全身遥操作数据集和操作数据集仍列在后续开放计划中。

模型开放之后,开发接口和硬件适配将影响其应用范围。具身模型需要与不同机器人本体、传感器和控制系统连接;被更多开发者和硬件平台采用的模型,更有可能形成广泛使用的接口规范。

宇树既开发机器人本体,也训练基础模型。开放模型可以降低开发者的试用和二次开发成本,吸引更多团队适配其模型接口,并借助外部测试与反馈加快迭代。这些积累可能扩大其模型和接口在行业中的影响力。

短期内,开放的权重和数据可以减少中小型机器人公司与研究机构从零训练基础模型的成本,使其更快开展特定场景的适配与验证。实际部署仍需要结合本体、数据和控制系统进行工程开发。

长期来看,具身基础模型的竞争可能进一步加剧。部分公司将提供可适配多种本体的基础模型和开发平台,另一些公司则专注于机器人硬件、行业数据和场景集成;两类能力也可能在同一家公司内协同发展。

接下来需要观察的是,已开放模型能否在更多真实环境中保持任务成功率和泛化能力,以及开发者能否围绕模型形成持续的复现、适配与应用。(红星新闻网)

免责声明

               

本站转载的文章,版权归原作者所有;旨在传递信息,不代表本站的观点和立场。不对内容真实性负责,仅供用户参考之用,不构成任何投资、使用等行为的建议。如果发现有问题,请联系我们处理。

本站提供的草稿箱预览链接仅用于内容创作者内部测试及协作沟通,不构成正式发布内容。预览链接包含的图文、数据等内容均为未定稿版本,可能存在错误、遗漏或临时性修改,用户不得将其作为决策依据或对外传播。

因预览链接内容不准确、失效或第三方不当使用导致的直接或间接损失(包括但不限于数据错误、商业风险、法律纠纷等),本网站不承担赔偿责任。用户通过预览链接访问第三方资源(如嵌入的图片、外链等),需自行承担相关风险,本网站不对其安全性、合法性负责。

禁止将预览链接用于商业推广、侵权传播或违反公序良俗的行为,违者需自行承担法律责任。如发现预览链接内容涉及侵权或违规,用户应立即停止使用并通过网站指定渠道提交删除请求。

本声明受中华人民共和国法律管辖,争议解决以本网站所在地法院为管辖法院。本网站保留修改免责声明的权利,修改后的声明将同步更新至预览链接页面,用户继续使用即视为接受新条款。

大观网的头像大观网
Previous 7小时前
Next 6小时前

相关推荐