arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-29 至 2026-05-29 共收录 8 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人基础模型 8 篇

2605.30326 2026-05-29 cs.RO cs.AI 84%

RoboWits: Unexpected Challenges for Robotic Creative Problem Solving

RoboWits:机器人创造性问题解决中的意外挑战

Chunru Lin, Hongxin Zhang, Fenghao Yu, Zhehuan Chen, Thomas L. Griffiths, Yejin Choi, David Held, Chuang Gan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Princeton University(普林斯顿大学) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人基础模型 :robotic(title,abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出RoboWits双臂机器人基准,通过多智能体协作的自动化任务生成流水线评估机器人在几何、材料和装配推理中的认知推理、创造性工具使用及鲁棒性,发现预训练VLA在突变任务中表现脆弱。

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29562 2026-05-29 cs.RO cs.AI cs.CV 75%

VLA-Pro: Cross-Task Procedural Memory Transfer for Vision-Language-Action Models

VLA-Pro:面向视觉-语言-动作模型的跨任务程序性记忆迁移

Shengyu Si, Yuanzhuo Lu, Ruimeng Yang, Ziyi Ye, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) Shanghai Xinzhi Embodied Intelligence Technology Co., Ltd.(上海新智具身智能技术有限公司)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出VLA-Pro框架,通过存储和检索任务相关的LoRA适配器作为程序性记忆,实现跨任务泛化,在仿真和真实任务中成功率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29416 2026-05-29 cs.RO cs.CV 73%

3DVLA: Enhancing Vision-Language-Action Models via 3D Spatial and Instance Understanding

3DVLA:通过3D空间和实例理解增强视觉-语言-动作模型

Zhongyu Xia, Yousen Tang, Bingqing Wei, Yongtao Wang

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出3DVLA框架,通过多视角一致性3D特征编码、实例估计模块和掩码自监督3D编码,解决VLA模型缺乏3D场景理解的问题,在LIBERO-Plus和RoboTwin 2.0上显著提升操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27607 2026-05-29 cs.CV cs.RO 73%

Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model

双流扩散用于世界模型增强的视觉-语言-动作模型

John Won, Kyungmin Lee, Huiwon Jang, Dongyoung Kim, Jinwoo Shin

机构 * Kim Jaechul Graduate School of AI, Korea Advanced Institute of Technology, Seoul, Republic of Korea(金 Jaechul 人工智能研究生院,韩国科学技术院,首尔,大韩民国)

专题命中 机器人基础模型 :world model(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出DUST框架,通过双流扩散Transformer和异步采样方法,解决世界模型增强的视觉-语言-动作模型中的模态差距问题,在模拟和真实任务中取得显著性能提升。

Comments Accepted at ICML 2026. Project page at https://periphanes.github.io/dust (20 pages, 10 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29438 2026-05-29 cs.RO 70%

ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models

ElegantVLA:学习何时思考以实现高效的视觉-语言-动作模型

Ye Li, Huanan Liu, Kangye Ji, Yuan Meng, Jiajun Fan, Yuansong Wang, Shiyu Qin, Chenglei Wu, Shu-Tao Xia, Zhi Wang

机构 * Tsinghua University(清华大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出ElegantVLA,一种即插即用的相位自适应推理框架,通过动态计算调度在视觉编码器、大语言模型和动作头之间分配计算资源,实现VLA模型加速,在GR00T和CogACT上分别获得最高2.55倍和3.77倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29577 2026-05-29 cs.CV 57%

Mitigating State Aliasing in Vision-Language-Action Models via Inverse Dynamics Learning

通过逆动力学学习缓解视觉-语言-动作模型中的状态混叠

Kyujin Lee, Injae Kim, Jihwan Park, Yejun Ju, Minseok Joo, Hyunwoo J. Kim

机构 * KAIST(韩国科学技术院) Korea University(韩国大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.CV

AI总结 提出将逆动力学学习作为辅助目标,直接监督VLA视觉编码器,通过预测当前与未来观测之间的动作来捕捉细粒度视觉差异,从而缓解状态混叠问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01194 2026-05-29 cs.RO 57%

VLA-ATTC: Adaptive Test-Time Compute for VLA Models with Relative Action Critic Model

VLA-ATTC:基于相对动作评判模型的VLA模型自适应测试时计算

Wenhao Li, Xiu Su, Yichao Cao, Hongyan Xu, Xiaobo Xia, Shan You, Yi Chen, Chang Xu

机构 * University of Sydney(悉尼大学) Central South University(中央南大学) University of Science and Technology of China(中国科学技术大学) Sensetime Research(商汤科技研究院) Hong Kong University of Science and Technology(香港理工大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 提出VLA-ATTC框架,通过不确定性驱动的“认知离合器”和相对动作评判模型(RAC)实现自适应测试时计算,在LIBERO-LONG基准上将SOTA模型PI0.5的失败率降低50%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01191 2026-05-29 cs.RO 57%

Sentinel-VLA: A Metacognitive VLA Model with Active Status Monitoring for Dynamic Reasoning and Error Recovery

Sentinel-VLA:一种具有主动状态监控的元认知VLA模型,用于动态推理和错误恢复

Wenhao Li, Xiu Su, Dan Niu, Yichao Cao, Hongyan Xu, Zhe Qu, Lei Fan, Shan You, Chang Xu

机构 * University of Sydney(悉尼大学) Central South University(中央南大学) University of New South Wales(新南威尔士大学) Sensetime Research(商汤科技研究院)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 提出Sentinel-VLA模型,通过主动哨兵模块监控执行状态,仅在必要时触发动态推理或错误恢复,结合自进化持续学习算法和正交持续适配器,在44个任务上提升成功率30%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏