arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-30 至 2026-06-30 共收录 9 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人基础模型 9 篇

2606.30613 2026-06-30 cs.RO 83%

Sequential Planning via Anchored Robotic Keypoints

基于锚定机器人关键点的顺序规划

Bryce Grant, Aryeh Rothenberg, Logan Senning, Zonghe Chua, Zach Patterson, Peng Wang

机构 * Department of Electrical, Computer, and Systems Engineering(电气、计算机与系统工程系) Department of Mechanical and Aerospace Engineering(机械与航空航天工程系)

专题命中 机器人基础模型 :robotic(title,abstract);manipulation(abstract);分类 cs.RO

AI总结 提出SPARK,一种无训练神经符号操作系统,通过单一Gemini调用生成类型化行为树,结合SAM3的替代提示检测和恢复循环,在LIBERO-PRO上达到43.7%,超越CaP-Agent0和VLA基线。

Comments 29 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29247 2026-06-30 cs.AI 79%

SurgVLA-Bench: Towards Evaluating Vision-Language-Action Models for Laparoscopic Surgical Robotics

SurgVLA-Bench:面向腹腔镜手术机器人的视觉-语言-动作模型评估基准

Jiashuo Sun, Yue He, Wenxuan Liu, Tao Mao, Jiazheng Wang, Xiang Chen, Min Liu

机构 * the National Engineering Research Center of Robot Visual Perception and Control Technology, China(中国机器人视觉感知与控制技术国家工程研究中心) the national graduate college for elite engineers, Hunan University, Hunan, China(湖南大学精英工程师国家研究生学院) the School of Artificial Intelligence and Robotics, Hunan University, Hunan, China(湖南大学人工智能与机器人学院)

专题命中 机器人基础模型 :robotics(title,abstract);分类 cs.AI

AI总结 提出首个腹腔镜手术机器人VLA模型评估基准SurgVLA-Bench,基于SurRoL平台构建层次化任务体系,系统评估自回归与流匹配两类模型,揭示其语义理解与任务精度的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30456 2026-06-30 cs.RO cs.CV 79%

Vision-Language-Action Models: Experimental Insights from a Real-World UR5 Platform

视觉-语言-动作模型:来自真实世界UR5平台的实验洞察

Mathilde Hochedel, Marc Lalonde

机构 * Luqia Technologies(卢西亚科技)

专题命中 机器人基础模型 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 研究将VLA模型迁移到真实UR5e机器人,发现离线指标与闭环行为之间存在差距,强调数据-模型-控制管线的系统级优化比模型容量提升更重要。

Comments 23 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29384 2026-06-30 cs.CV cs.RO 79%

Event-VLA: Action-Conditioned Event Fusion for Robust Vision-Language-Action Model

Event-VLA: 基于动作条件的事件融合用于鲁棒的视觉-语言-动作模型

Jiaxin Liu, Xun Xu, Zhenhao Zhang, Hanqing Wang, Ruiqi Chen, Shi Chang, Weiyu Guo, Laurent Kneip

专题命中 机器人基础模型 :embodied AI(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 针对现有VLA模型在光照变化下鲁棒性不足的问题,提出Event-VLA框架,通过事件流作为光照鲁棒的运动敏感互补观测,利用动作查询路由和门控交叉注意力融合事件信息,提升低光及近黑暗环境下的操作成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29350 2026-06-30 cs.CV cs.AI 76%

Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs

快得足以行动:面向低延迟机器人视觉语言模型和视觉语言动作模型的时空视觉令牌融合

Junzhou Chen, Jindong Wang, Gang Zhou

机构 * Department of Computer Science(计算机科学系) Department of Data Science(数据科学系) William & Mary(威廉玛丽学院)

专题命中 机器人基础模型 :robotic(title);分类 cs.AI、cs.CV

AI总结 提出ST-Merge框架,在视觉编码阶段通过构建3D时空坐标和多队列并行匹配加权聚合机制高效融合冗余令牌,并引入后融合位置校正消除空间偏差,在Qwen2.5-VL上实现2倍推理加速且精度损失仅1%,在π0.5 VLA策略上实现8.3倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25044 2026-06-30 cs.RO 70%

X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models

X-DiffVLA:面向视觉-语言-动作模型的跨具身扩散动作头

Boyu Li, Chaoyi Xu, Haoqi Yuan, Xinrun Xu, Börje F. Karlsson, Haoran Li, Zongqing Lu, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(SKL-MAIS,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) BeingBeyond School of Computer Science, Peking University(北京大学计算机学院)

专题命中 机器人基础模型 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 针对跨具身数据学习通用策略的挑战,提出X-DiffVLA模型,通过扩散模型和具身强制技术实现异构末端执行器间的知识迁移,在RoboCasa和Isaac Gym上分别提升15.3%和12.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30113 2026-06-30 cs.RO cs.AI 62%

SA-VLA: State-aware tokenizer for improving Vision-Language-Action Models' performance

SA-VLA: 状态感知分词器提升视觉-语言-动作模型性能

Tengyue Jiang, Chunpu Xu, Jiayue Kang, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) East China University of Science and Technology(东华大学) Hong Kong Polytechnic University(香港理工大学) Xi’an University of Electronic Science and Technology(西安电子科技大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出状态感知动作分词器SA-VLA,通过状态条件动作解码减少离散化压缩损失,在12个操作任务上将成功率从0.29提升至0.56。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29201 2026-06-30 cs.RO cs.AI 62%

Behavior Uncloning: Distilling Mode Redirection into Policy Weights without Inference-Time Steering

行为去克隆:将模式重定向蒸馏到策略权重中,无需推理时引导

Hao Wang, Jiuzhou Lei, Dayou Li, Bangya Liu, Minghui Zheng, Manling Li, Ruohan Zhang, Zhiwen Fan

专题命中 机器人基础模型 :robot policy(abstract);分类 cs.RO、cs.AI

AI总结 提出MoRE方法,通过短时“去克隆”步骤将模式分类器的重定向信号蒸馏到策略权重中,抑制不安全行为模式,零推理开销提升部署成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29089 2026-06-30 cs.RO 57%

TAP-VLA: Tactile Annotation Prompting for Vision Language Action Models

TAP-VLA:面向视觉语言动作模型的触觉标注提示

Mark Van der Merwe, Mohamad Louai Shehab, Jayjun Lee, Youngsun Wi, Yinpei Dai, Dmitry Berenson, Nima Fazeli

机构 * Robotics Department, University of Michigan(密歇根大学机器人系) Computer Science and Engineering Department, University of Michigan(密歇根大学计算机科学与工程系)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 提出TAP-VLA框架,通过将触觉剪切场叠加到RGB图像上作为视觉增强,无需修改架构或触觉预训练,即可将触觉反馈融入VLA模型,在接触丰富任务中成功率78%,显著优于基线。

Comments 8 pages + references

详情

展开后加载摘要…

URL PDF HTML 收藏