宇树开源UnifoLM-VLA-0大模型,12类复杂操作任务一网打尽
创始人
2026-01-29 21:11:08
0

今日,宇树科技宣布开源UnifoLM-VLA-0大模型,这是UnifoLM系列中面向通用人形机器人操作的视觉-语言-动作(VLA)模型。该模型通过在机器人操作数据上的预训练,实现了从图文理解到具备物理常识的“具身大脑”的进化。它通过深度融合文本指令与2D/3D空间细节,增强了空间感知能力,并构建了全链路动力学预测数据,提升了任务泛化性。在真机验证中,该模型仅需单一策略即可高质量完成12类复杂的操作任务。

基于Qwen2.5-VL-7B开源模型,宇树构建了覆盖机器人与通用场景的多任务数据集,并开展持续预训练。数据集包括2D检测与分割、任务层级分解、3D目标检测等多维数据,有效提升了模型对几何空间与语义逻辑的对齐能力。针对操作类任务,宇树对开源数据集进行了系统化清洗,利用约340小时的真机数据进行离散动作的预测训练。模型集成了动作分块预测及动力学约束,实现对动作序列的统一建模,支持长时序动作规划与决策。

在UnifoLM-VLM-0模型的基础上,宇树集成了动作预测头(ActionHead),构建出UnifoLM-VLA-0。经过仿真环境与真机实验的多任务训练验证,该模型展现了单模型处理多任务的通用能力,在LIBERO仿真基准测试中取得了接近最优的性能。在宇树G1人形机器人平台上,基于高质量真机数据集对UnifoLM-VLA-0进行单一策略网络的统一端到端训练,实验结果表明,该模型能够稳定完成全部12项任务,在外部扰动条件下保持良好的执行鲁棒性与抗干扰能力。

相关内容

热门资讯

谷歌Gemini惊现未公开游戏... 近日,一名独立游戏开发者在谷歌Gemini搜索中意外发现一起数据泄露事件。该开发者发现,有玩家在搜索...
OpenAI AI模型Astr... 8月6日,科技媒体scientificamerican报道称,多名数学家指控OpenAI存在学术不端...
苹果联手阿里巴巴,千问AI功能... 近日,苹果官网发布了一篇名为《在Mac上配合Apple智能使用千问》的支持文档,宣布Apple智能将...
鸿蒙智行享界G9电驱挑战泥水坑... 8月8日,鸿蒙智行享界汽车发布了享界G9的炮弹坑通过性挑战视频,展示了新车首发的华为智擎自适应差速锁...
小米澎程系列汽车9月上市,累计... 今日,小米创办人、董事长兼CEO雷军发文宣布,小米澎程系列汽车自3年半前立项,2年前开始路测,预计将...
华为乾崑智驾新突破:一键代客充... 近日,华为乾崑智能汽车解决方案推出全新功能——代客充电服务。该服务旨在解决电动车主在充电时遇到的不便...
一对智利父子的中医缘:来华同校... 智利人赫克托因一次背痛与中医结缘,从此开启了长达几十年的中医求学路。他的儿子罗德里戈从小受父亲影响,...
当日本社会选择淡忘,他们在东京... “南京大屠杀中有30万人丧生,这些血与泪不能被抹去,这段历史也不能被遗忘……”5日傍晚,在日本东京涩...
媒体做“加法”,乡村得“乘法”... 今年荔枝小年,广东全省已销售荔枝约120万吨,比去年少了约50万吨,销售额却达213.6亿元,较去年...
华为鸿蒙智行G9内饰曝光:三联... 今日,鸿蒙智行享界汽车官方发布了享界G9座舱前排内饰官图。新车配备了寰宇三联屏和实体按键,同时车机预...