arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-04 至 2026-08-04 共收录 9 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人基础模型 9 篇

2608.01066 2026-08-04 cs.RO 新提交 86%

OC-VLA++: Monocular Geometry-Guided Cross-View Consistency for Viewpoint-Robust Robotic Manipulation

OC-VLA++:用于视点鲁棒机器人操作的单目几何引导跨视图一致性

Tianyi Zhang, Ziyang Gong, Zhenjie Yang, Zhe Qian, Haonan Duan

专题命中 机器人基础模型 :manipulation(title,abstract);robotic(title);分类 cs.RO

AI总结 该研究针对相机覆盖有限时机器人操作的视点泛化问题,提出OC-VLA++模型,通过几何引导的配对视图监督和跨视图动作等变目标提升未见视点泛化能力,性能优于原模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02257 2026-08-04 cs.RO 新提交 83%

Learning Panorama-Aware VLA for Mobile Manipulation with Whole-Body Teleoperation

面向全身遥操作移动操作的全景感知VLA学习

Donglin Yang, Haoran Chen, Xingyu Chen, Lixing Liu, Manyi Li, Changhe Tu, Ke Xu, Xiaojian Ma, Si Liu

机构 * Beihang University(北京航空航天大学) Shandong University(山东大学) Johns Hopkins University(约翰斯·霍普金斯大学) Delta Intelligence(delta智能公司)

专题命中 机器人基础模型 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 针对移动操作VLA策略的局部视野与全身演示数据收集难题,开发全身遥操作系统与PanoVLA全景感知VLA策略,基于5.5小时多模态数据集,在四项真实任务中平均阶段完成率91.3%、端到端成功率73.4%,性能优于局部视角基线。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00337 2026-08-04 cs.RO 新提交 83%

Action Chunk Scheduling for Batched Robot Policy Serving

用于批量机器人策略服务的动作块调度

Rohan Bansal, David He, Nadun Ranawaka Arachchige, Zhenyang Chen, Soobum Kim, Kexin Rong, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 机器人基础模型 :robot policy(title,abstract);robot foundation model(abstract);分类 cs.RO

AI总结 本文提出从远程GPU向多机器人提供策略服务的调度问题,构建Armory系统,提出考虑机器人异构性的调度算法,使真实场景系统吞吐量最高提升18%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01690 2026-08-04 cs.RO cs.AI 新提交 81%

ProtoAct: Turning Wet-Lab Protocols into Embodied Robotic Actions

ProtoAct:将湿实验室协议转化为具身机器人动作

Zhe Liu, Jiaming Gu, Zhaohui Du, Zhe Wang, Huanbo Jin, Quan Lu, Qi Wang, Ting Xiao, Minting Pan, Dongzhan Zhou

专题命中 机器人基础模型 :robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 研究针对湿实验室协议难转化为机器人动作的问题,提出ProtoAct框架,结合ProtoRAG、RefineChecker、ActSchema处理协议,引入BioP2E数据集,经多模型评估与消融实验验证,可实现仿真及真实机器人的协议执行。

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01826 2026-08-04 cs.RO 新提交 70%

Multi-View Unified Camera Fields: Geometry-Shaped Action-Facing Representations for RGB-Only Multi-Camera VLA Policies

多视图统一相机场:面向仅RGB多相机视觉-语言-动作(VLA)策略的几何形状动作表征

Jiarui Yang, Yehao Lu, Yuning Su, Yufeng Xie, Yu Zhong, Haiyu Lan, Tianjing Hao, Kaixiang Lu, Peiwen Lin, Chuang Wang, Enyu Li, Junwei Liang

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本研究针对多相机VLA策略的动作表征缺陷,提出仅训练用的MVUCF框架,通过几何相关目标优化后部署无额外推理开销,在LIBERO、RoboTwin等任务及真实人形实验中均取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01573 2026-08-04 cs.RO 新提交 70%

Uncovering and Mitigating Positional Blind Spots in Vision-Language-Action Models

揭示并缓解视觉-语言-动作模型中的位置盲区

Dongdong An, Pengjie Zhao, Yihao Huang, Wenbing Tang, Ziming He, Jiayi Zhu, Jifeng Ning, Qin Zhao

机构 * Shanghai Normal University(上海师范大学) East China Normal University(华东师范大学) Northwest A&F University(西北农林科技大学) Xidian University(西安电子科技大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 针对视觉-语言-动作模型存在的位置盲区问题,提出两阶段黑箱框架,通过网格划分与单侧对数似然比检验定位盲区,再经LoRA微调缓解,在五个模型上验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08575 2026-08-04 cs.RO 版本更新 70%

FabriVLA: A Lightweight Vision-Language-Action Model with Conformal Action Chunk Uncertainty

FabriVLA:用于精确多任务操作的轻量级视觉-语言-动作模型

Shiyuan Yang, Borong Zhang, Jizheng Zhang, Zhijia Tao, Junfei Guo, Donglai Ran, Xu Bian, Qingbiao Li

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 研究提出FabriVLA模型,结合视觉-语言主干与流匹配动作头,经单阶段联合优化训练。在Meta-World MT50基准测试中,该模型基于1B规模VLM,不依赖数十亿参数主干,实现90.0%平均成功率,展现强大性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06370 2026-08-04 cs.RO cs.CV cs.LG 版本更新 67%

ActionCache: Training-Free Acceleration for Vision-Language-Action Models with Action Caching and Refinement

基于动作缓存与优化的视觉-语言-动作模型免训练加速

Ryuji Oi, Hikari Otsuka, Kosuke Matsushima, Yuki Ichikawa, Masato Motomura, Tatsuya Kaneko, Daichi Fujiki

机构 * Institute of Science Tokyo(东京科学研究所)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 针对视觉-语言-动作模型动作头计算瓶颈问题,提出ActionCache即插即用外部缓存,利用紧凑多模态键存储中间动作,可跨不同场景检索重用,在模拟和真实环境实验中显著加速推理,提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01013 2026-08-04 cs.RO 新提交 57%

RL Bootstrapping of OpenVLA-OFT for a Novel Robot Embodiment

针对新型机器人实体的OpenVLA-OFT的RL引导

Damir Nurtdinov, Alexei Kornaev, Alexander Maloletov

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 本文针对形态特殊的缆绳驱动并联机器人,无需实体专属数据集,通过仿真中PPO与GRPO两阶段强化学习,提升了OpenVLA-OFT的指令执行成功率,为仅靠RL生成适配全新实体的语言条件控制器提供了证据。

详情

展开后加载摘要…

URL PDF HTML 收藏