arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-17 至 2026-03-17 共收录 3 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人基础模型 3 篇

2603.14523 2026-03-17 cs.CV cs.AI cs.RO 75%

VLA-Thinker: Boosting Vision-Language-Action Models through Thinking-with-Image Reasoning

VLA-Thinker: 通过图像推理增强视觉-语言-动作模型

Chaoyang Wang, Wenrui Bao, Sicheng Gao, Bingxin Xu, Yu Tian, Yogesh S. Rawat, Yunhao Ge, Yuzhang Shang

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出VLA-Thinker框架,通过动态可调用的推理动作提升视觉语言动作模型的能力,通过两阶段训练流程提升操控性能,在LIBERO和RoboTwin 2.0基准上取得显著成果。

Comments We introduce VLA-Thinker, the first VLA model capable of thinking-with-image reasoning, which models visual perception as a dynamically invocable reasoning action, enabling Multimodal Embodied Chain-of-Thought

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18953 2026-03-17 cs.RO cs.AI 73%

Eva-VLA: Evaluating Vision-Language-Action Models' Robustness Under Real-World Physical Variations

Eva-VLA:评估视觉-语言-动作模型在现实物理变化下的鲁棒性

Hanqing Liu, Shouwei Ruan, Jiahuan Long, Junqi Wu, Jiacheng Hou, Huili Tang, Tingsong Jiang, Weien Zhou, Wen Yao

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出Eva-VLA框架,通过将不可控物理变化转化为连续优化问题,系统评估VLA模型的鲁棒性,发现OpenVLA在三种物理变化下的平均失败率超过90%,并验证了对抗训练提升模型鲁棒性的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13335 2026-03-17 cs.CV cs.AI 62%

Information-Theoretic Constraints for Continual Vision-Language-Action Alignment

信息论视角下的持续视觉-语言-动作对齐约束

Libang Zhao, Qixin Zeng, Hongyin Zhang, Donglin Wang

机构 * Westlake University, China(西湖大学) University of Southampton, UK(南安普顿大学)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 本文提出Info-VLA框架,通过两个互补约束保持跨模态信息结构,解决持续学习中视觉语言动作对齐退化问题,实验表明其在任务保持与适应性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏