arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-22 至 2026-04-22 共收录 2 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人基础模型 2 篇

2604.18791 2026-04-22 cs.LG cs.AI 81%

HELM: Harness-Enhanced Long-horizon Memory for Vision-Language-Action Manipulation

HELM:增强型长时程记忆用于视觉-语言-动作操控

Zijian Zeng, Fei Ding, Huiming Yang, Xianwei Li

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Bengbu University(Bengbu大学)

专题命中 机器人基础模型 :manipulation(title,abstract);分类 cs.AI、cs.LG

AI总结 HELM通过解决记忆、验证和恢复三大缺陷,提升长时程视觉-语言-动作任务性能,其核心贡献是学习的State Verifier在任务成功率上显著优于传统方法。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19728 2026-04-22 cs.RO cs.AI cs.CV cs.LG cs.SE 70%

VLA Foundry: A Unified Framework for Training Vision-Language-Action Models

VLA Foundry:一种统一训练视觉-语言-动作模型的框架

Jean Mercat, Sedrick Keh, Kushal Arora, Isabella Huang, Paarth Shah, Haruki Nishimura, Shun Iwase, Katherine Liu

机构 * Toyota Research Institute(丰田研究院)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 VLA Foundry 提供了一个统一的训练框架,整合了大语言模型、视觉语言模型和视觉-语言-动作模型的训练,支持从头训练和预训练模型,并在 LBM Eval 模拟器上评估了闭合回路策略性能。

Comments 32 pages, 16 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏