arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-05 至 2026-08-05 共收录 9 信号源:cs.RO, cs.CV, cs.AI, cs.LG
2608.03052 2026-08-05 cs.RO 新提交 93%

How Should Vision-Language-Action Models Use Proprioceptive State?

视觉-语言-动作(VLA)模型应如何使用本体感受状态?

Yiren Zhao, Ziyang Chen, Ziyang Rao, Pengteng Li, He Zhang, Weiyu Guo, Yandong Guo, Rushi Dai

专题命中 VLA模型 :VLA(title_cn,summary_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 本研究针对视觉-语言-动作(VLA)模型的本体感受状态接入方式开展受控实验,探究状态接入位置、历史长度等问题,得出系统性答案并提炼为可验证的VLA模型设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02958 2026-08-05 cs.RO cs.AI 新提交 89%

ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies

ValueFormer:面向半自主视觉-语言-动作策略的、具有阶段感知标签的因果变换价值函数

Inkyu Sa, Konstantin Stulov, Rajat Bhageria

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出 ValueFormer,一种带阶段感知标签的因果变换价值函数,用于半自主 VLA 策略,在真实机器人双手机器人三明治组装任务上提升了任务完成率并降低了服务成本。

Comments 22 pages, 17 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03207 2026-08-05 cs.CV cs.LG 新提交 88%

DRIFT: Derailing Denoising Trajectories of Flow-Matching VLAs with Adversarial Patch Attack

DRIFT:通过对抗性补丁攻击破坏流匹配视觉-语言-动作(VLA)模型的去噪轨迹

Hoseong Tae, Jong-Seok Lee

专题命中 VLA模型 :VLA(title_cn,summary_cn);vision-language-action(abstract);分类 cs.CV、cs.LG

AI总结 该研究提出DRIFT对抗性补丁攻击方法,针对流匹配VLA模型pi0等,通过攻击首个去噪步骤破坏其去噪轨迹,在LIBERO套件上高效破解原本可解决的机器人任务,效果优于相关基线攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03483 2026-08-05 cs.RO cs.AI cs.CV cs.LG 新提交 88%

Continue or Replan? Bernoulli-Continuation Policy Learning for Adaptive Horizon Execution

继续还是重规划?用于自适应执行时长的伯努利继续策略学习

Weichen Xu, Zhenhua Liu, Lin Luo, Yaobo Liang, Chengtang Yao, Qingyu Mei, Jian Cao, Xixin Cao, Xing Zhang, Jiaolong Yang, Baining Guo

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract,abstract_cn);分类 cs.RO、cs.CV、cs.AI

AI总结 针对现有VLA模型固定执行时长重规划的局限,提出BCP框架,通过强化学习训练自适应时长选择,在多个仿真任务、真实机器人任务上提升了成功率,且运行时间更短。

Comments Project page: https://fleetfootwork.github.io/BCP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03563 2026-08-05 cs.RO 新提交 86%

Unified Visuomotor Targets: Supervising VLAs Beyond Physical Actions

统一视觉运动目标:监督视觉语言智能体(VLA)超越物理动作

Zhenyang Feng, Unnat Jain

专题命中 VLA模型 :VLA(title_cn,summary_cn);分类 cs.RO

AI总结 本研究针对VLA模型训练中视觉语言高级表示与机器人低级动作的不匹配问题,提出UVT统一视觉运动目标,无需改动架构或额外数据,在仿真与真实双臂任务中提升了VLA的训练效率、性能与鲁棒性

Comments Accepted at IROS 2026. Project page: https://unified-visuomotor-targets.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03231 2026-08-05 cs.RO cs.AI 新提交 86%

Structure-Aware Robust Fine-Tuning: Defending Vision-Language-Action Robots Against Physical Attention Hijacking

结构感知鲁棒微调:防御视觉-语言-动作机器人抵御物理注意力劫持

Jinquan Zhang, Dongfu Yin, Run Yang, Yufeng Yan, Zhen Tian, F. Richard Yu

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 本研究针对视觉-语言-动作机器人面临的物理注意力劫持攻击,提出注意力引导语义破坏攻击方法,并开发结构感知鲁棒微调防御方法,大幅降低攻击失败率并提升真实机械臂操控成功率。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03727 2026-08-05 cs.RO 新提交 85%

Track4Action: Distilling World-Centric 3D Tracker into Vision-Language-Action Policies

Track4Action:将以世界为中心的3D跟踪器提炼为视觉-语言-动作策略

Chenyi Wang, Xinkai Wang, Bokai Lin, Jialin Tian, Fucheng Zhang, Cewu Lu, Lixin Yang

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 Track4Action框架将以世界为中心的冻结3D跟踪器提炼为视觉-语言-动作策略,在多个机器人任务基准上显著提升性能,验证了动作对齐的3D跟踪器特征作为监督的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03701 2026-08-05 cs.RO cs.AI 新提交 81%

LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation

LiLa-WAM:用于机器人操控的轻量级隐式推理世界-动作模型

Fan Yang, Yuting Su, Xiaobo Wang, Yuncheng You, Fugui Fan, Yuting Wu, Minghui Wu, Chenxu Zhao, JiaHong Ning, Peiguang Jing

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 本研究提出轻量级世界-动作模型LiLa-WAM,通过联合未来状态预测与动作生成的紧凑隐式空间设计实现端到端单GPU训练,结合视觉转换令牌完成任务指定,在RoboTwin等任务上取得90.48%的成功率,提升了机器人操控的效率与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02847 2026-08-05 astro-ph.SR 新提交 71%

New Spatially Resolved Observations of Betelgeuse from the VLA and ALMA: Evidence for Atmospheric Perturbations from a Close Companion

L. D. Matthews, A. K. Dupree, A. M. S. Richards, W. R. F. Dent

专题命中 VLA模型 :VLA(title)

Comments 23 pages, 13 figures, 6 tables. Accepted to the Astronomical Journal

详情

展开后加载摘要…

URL PDF HTML 收藏