腾讯 Robotics X
福田实验室与混元团队
联合发布面向真实世界机器人操作任务的端到端具身智能
Hy-Embodied-0.5-VLA(简称HyVLA-0.5)。
HyVLA-0.5基于自研的亚毫米级高精度指套式 UMI 数据采集软硬件(专利:2025020117CN),构建了超过 10,000 小时的人类示教数据,使模型在监督训练阶段无需任何遥操作数据,也能在多本体真机任务中取得高部署成功率;基于纯自研UMI数据训练的模型,HyVLA-0.5 在 RoboTwin 2.0 仿真基准的简单与复杂设置下均超过 90%,是目前该榜单上SOTA的开源VLA 模型。
在此基础上,HyVLA-0.5 首次将 Proximalized Preference Optimization(PRO,近端偏好优化)系统性引入基于流匹配的 VLA 强化后训练,充分利用真实机器人失败数据,实现真实机器人任务接近 100% 的成功率。
随着VLA模型在机器人连续控制中展现出越来越强的潜力,业界也逐渐意识到,通用机器人能力的形成不能只依赖更大的模型或更强的策略。真实机器人部署需要数据、模型、预训练、后训练和执行系统协同设计,既要能学习复杂操作技能,也要能在真实硬件约束下稳定运行。HyVLA-0.5正是在这一背景下提出,目标是推动VLA从模型能力验证走向可持续迭代、可跨本体迁移、可真实部署的机器人系统。
图:Hy-Embodied-0.5-VLA 的整体系统架构,涵盖数据采集、模型架构、跨本体监督微调、强化学习后训练等关键环节,体现了其从数据到模型再到策略优化的全栈式设计。
• 项目:https://tairos.tencent.com/openSourceModels/hy-embodied-0.5-vla
• 代码:https://github.com/Tencent-Hunyuan/Hy-Embodied-0.5-VLA
• 数据:https://huggingface.co/datasets/tencent/Hy-Embodied-0.5-VLA-Data
一套覆盖“从数据到落地”的机器人学习栈
1、高精度UMI数据采集软硬件:构建万小时具身数据基础
数据是机器人基础模型能力的根基。HyVLA-0.5自研了高精度指套式UMI数据采集装置,并配套运动捕捉定位,实现了面向人类示教的高保真数据采集。该装置不仅能够记录第一视角视觉信息,还能通过外部光学运动捕捉系统获得亚毫米级6-DoF轨迹标注;部分夹爪还集成了末端力/力矩传感能力,使数据天然包含可用于力感知、力控学习的物理交互信息。
基于这套自研采集系统,HyVLA-0.5构建了超过10,000小时、覆盖70类任务、超过100万条episode的Hy-UMI-10K数据集。该数据集涵盖厨房、洗衣、收纳、清洁、工具使用、柔性物体操作等多类日常场景,为学习精细操作、长程任务和跨场景泛化提供了规模化基础。HyVLA-0.5计划开放其中2,000小时自采UMI数据,与学术界和产业界共同推进高质量机器人数据、评测与模型训练范式的共研共建。
图:自研UMI数据采集工作站
图:自采Hy-UMI-10K数据集组成
2、模型架构:基于Hy-Embodied-0.5引入行动、记忆和跨本体能力
在模型侧,HyVLA-0.5基于腾讯Robotics X和混元联合自研的Hy-Embodied-0.5具身视觉语言模型进行扩展,将其面向视觉语言理解的能力进一步连接到机器人连续控制。系统引入基于流匹配的行动专家模块,直接生成连续动作轨迹;同时通过双塔结构将视觉语言理解与动作生成解耦,使语义感知、空间理解和底层控制能够在统一框架中协同工作。
为了支持真实机器人中的时序感知,HyVLA-0.5进一步设计了一个紧凑记忆编码器,将多帧、多视角视觉历史压缩为紧凑的当前帧表示,从而在不显著增加视觉token数量的情况下引入短时记忆。系统还采用增量式动作块表示,让策略预测相对于当前末端执行器状态的增量动作,从而降低对特定机器人关节结构和运动学的依赖,为后续跨本体迁移和统一部署奠定基础。
