arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-04-10 至 2026-04-10 共收录 1 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 部署与泛化 1 篇

2604.07430 2026-04-10 cs.CV 83%

HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents

HY-Embodied-0.5:面向现实世界代理的具身基础模型

Tencent Robotics X, HY Vision Team, :, Xumin Yu, Zuyan Liu, Ziyi Wang, He Zhang, Yongming Rao, Fangfu Liu, Yani Zhang, Ruowen Zhao, Oran Wang, Yves Liang, Haitao Lin, Minghui Wang, Yubo Dong, Kevin Cheng, Bolin Ni, Rui Huang, Han Hu, Zhengyou Zhang, Linus, Shunyu Yao

机构 * Tencent Robotics X(腾讯机器人X实验室) HY Vision Team(HY视觉团队)

专题命中 部署与泛化 :embodied foundation model(title);vision-language-action(abstract);VLA(abstract);分类 cs.CV

AI总结 本文提出HY-Embodied-0.5,旨在提升现实世界代理的具身智能能力,通过混合Transformer架构和迭代自演化训练方法,实现高效和强大的模型变体,验证了其在多个基准测试中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏