⏶185
HY-Embodied-0.5:面向现实世界智能体的使用具身基础模型
发表
由
liuzuyan 提交
作者: Tencent Robotics X, HY Vision Team,
Xumin Yu,
Zuyan Liu,
Ziyi Wang, He Zhang,
Yongming Rao,
Fangfu Liu, Yani Zhang,
Ruowen Zhao, Oran Wang, Yves Liang, Haitao Lin, Minghui Wang, Yubo Dong, Kevin Cheng,
Bolin Ni, Rui Huang, Han Hu, Zhengyou Zhang, Linus, Shunyu Yao
摘要
AI 生成总结
HY-Embodied-0.5 是一个针对具身智能体的基础模型家族,采用混合 Transformer(MoT)架构和迭代后期训练,以增强视觉感知和推理能力。我们推出了 HY-Embodied-0.5,一系列专为真实世界具身智能体设计的基础模型。为了弥补通用视觉语言模型(VLM)与具身智能体需求之间的差距,我们的模型旨在增强具身智能所需的核性能力:空间和时间视觉感知,以及用于预测、交互和规划的高级具身推理。HY-Embodied-0.5 系列包含两个主要变体:一个拥有 20 亿激活参数的高效模型,专为边缘侧部署设计;一个拥有 320 亿激活参数的强大模型,针对复杂推理。为了支持具身任务至关重要的细粒度视觉感知,我们采用了混合 Transformer(MoT)架构以实现模态特定的计算。通过引入潜在 token,该设计有效增强了模型的感知表示。为了提升推理能力,我们引入了一种迭代、自演进的后期训练范式。此外,我们采用在线策略蒸馏将大模型的高级能力迁移到小模型变体,从而最大化紧凑型模型的性能潜力。在涵盖视觉感知、空间推理和具身理解的 22 个基准测试中的广泛评估证明了我们方法的有效性。我们的 MoT-2B 模型在 16 个基准上优于同等规模的最先进模型,而 32B 变体达到了与 Gemini 3.0 Pro 等顶尖模型相当的性能。在下游机器人控制实验中,我们利用强大的 VLM 基础训练了一个有效的视觉-语言-动作(VLA)模型,并在真实世界的物理评估中取得了引人注目的结果。代码和模型已在 https://github.com/Tencent-Hunyuan/HY-Embodied 开源。
GitHub: https://github.com/Tencent-Hunyuan/HY-Embodied
HuggingFace: https://huggingface.co/tencent/HY-Embodied-0.5