arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-05 至 2026-08-05 共收录 4 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人基础模型 4 篇

2608.02326 2026-08-05 cs.RO 版本更新 79%

ChainVLA: Chaining Vision-Language-Action Queries through a Unified Execution State for Long-Horizon Manipulation

ChainVLA:通过统一执行状态串联视觉-语言-动作查询以实现长 horizon 操纵

Yuzhi Huang, Weijue Bu, Ziyi Xiong, Jie Wu, Fanding Huang, Jingyan Jiang, Zhi Wang

专题命中 机器人基础模型 :manipulation(title,abstract);分类 cs.RO

AI总结 ChainVLA 是 12 亿参数的 VLA 策略,通过联合可修订的执行状态串联查询,结合进展上下文与运动尾部,在长 horizon 操纵任务中大幅提升成功率, ablation 验证了两个组件的关键作用。

Comments 13 pages (9 main + 4 appendix), 4 figures. Project page: https://muqy1818.github.io/chainvla-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03231 2026-08-05 cs.RO cs.AI 新提交 73%

Structure-Aware Robust Fine-Tuning: Defending Vision-Language-Action Robots Against Physical Attention Hijacking

结构感知鲁棒微调:防御视觉-语言-动作机器人抵御物理注意力劫持

Jinquan Zhang, Dongfu Yin, Run Yang, Yufeng Yan, Zhen Tian, F. Richard Yu

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本研究针对视觉-语言-动作机器人面临的物理注意力劫持攻击,提出注意力引导语义破坏攻击方法,并开发结构感知鲁棒微调防御方法,大幅降低攻击失败率并提升真实机械臂操控成功率。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03483 2026-08-05 cs.RO cs.AI cs.CV cs.LG 新提交 70%

Continue or Replan? Bernoulli-Continuation Policy Learning for Adaptive Horizon Execution

继续还是重规划?用于自适应执行时长的伯努利继续策略学习

Weichen Xu, Zhenhua Liu, Lin Luo, Yaobo Liang, Chengtang Yao, Qingyu Mei, Jian Cao, Xixin Cao, Xing Zhang, Jiaolong Yang, Baining Guo

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 针对现有VLA模型固定执行时长重规划的局限,提出BCP框架,通过强化学习训练自适应时长选择,在多个仿真任务、真实机器人任务上提升了成功率,且运行时间更短。

Comments Project page: https://fleetfootwork.github.io/BCP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03563 2026-08-05 cs.RO 新提交 57%

Unified Visuomotor Targets: Supervising VLAs Beyond Physical Actions

统一视觉运动目标:监督视觉语言智能体(VLA)超越物理动作

Zhenyang Feng, Unnat Jain

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 本研究针对VLA模型训练中视觉语言高级表示与机器人低级动作的不匹配问题,提出UVT统一视觉运动目标,无需改动架构或额外数据,在仿真与真实双臂任务中提升了VLA的训练效率、性能与鲁棒性

Comments Accepted at IROS 2026. Project page: https://unified-visuomotor-targets.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏