arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-05-12 至 2026-05-12 共收录 2 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 部署与泛化 2 篇

2605.09613 2026-05-12 cs.RO cs.CV 86%

SABER: A Scalable Action-Based Embodied Dataset for Real-World VLA Adaptation

SABER:一种可扩展的动作基于具身数据集用于真实世界VLA适应

Narsimha Menga, Parikshit Sakurikar, Amirreza Rouhi, Satya Sai Reddy, Anirudh Govil, Sri Harsha Chittajallu, Rajat Aggarwal, Anoop Namboodiri, Sashi Reddi

机构 * DreamVu

专题命中 部署与泛化 :VLA(title,title_cn);robot foundation model(abstract);分类 cs.RO、cs.CV

AI总结 SABER通过高保真零售机器人动作数据集提升真实世界零售任务的机器人性能,采用多流动作表示方法,实现29.3%的成功率,优于微调基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03895 2026-05-12 cs.RO cs.CV 73%

NoTVLA: Semantics-Preserving Robot Adaptation via Narrative Action Interfaces

NoTVLA:通过叙事动作接口实现语义保留的机器人适应

Zheng Huang, Mingyu Liu, Xiaoyi Lin, Muzhi Zhu, Canyu Zhao, Zongze Du, Ye Lin, Xiaoman Li, Yiduo Jia, Hao Zhong, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 NoTVLA通过稀疏轨迹规划减少灾难性遗忘,提升多任务性能,以更低计算成本和无需腕部摄像头实现高精度与语言能力保留。

详情

展开后加载摘要…

URL PDF HTML 收藏