arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-06 至 2026-08-06 共收录 13 信号源:cs.RO, cs.CV, cs.AI, cs.LG
2608.04633 2026-08-06 cs.RO 新提交 94%

Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models

Mind-VLA:面向视觉-语言-动作模型的指令感知空间表示对齐方法

Xingyu Ding, Yuzhong Zhao, Yang Wu, Chaoyang Zhao, Chunhai Zhao, Yifan Zhang, Jian Cheng

机构 * Nanjing University(南京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 本文针对现有VLA方法忽略指令指定目标物体3D几何的问题,提出Mind-VLA方法,通过对齐目标物体相关特征实现指令感知3D理解,在LIBERO、CALVIN及真实机器人遮挡任务上性能显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04396 2026-08-06 cs.CV 新提交 91%

CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention

CofactVLA:通过反事实干预消除视觉-语言-动作模型的混淆

Yan Zhang, Yinan Wu, Haoran Duan, Jungong Han

机构 * Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.CV

AI总结 针对VLA模型的视觉优先与因果混淆问题,提出CofactVLA框架,通过OPG和CCR机制消除视觉混淆,在仿真基准和真实机器人实验中均实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04692 2026-08-06 cs.RO cs.LG 新提交 91%

Suppression Sticks, Locality Is Fragile: A Closed-Loop Target-and-Control Audit of Task-Vector Negation in VLA Policies

抑制会“卡住”,局部性很脆弱:对VLA策略中任务向量取反的闭环目标与控制审计

Shaoguang Wang, Weiyu Guo, Rushi Dai, Yiren Zhao, Yandong Guo, Hui Xiong

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.LG

AI总结 本研究通过对VLA策略的闭环审计,发现任务向量减法作为快速模型编辑方法存在局部性脆弱问题,会引发目标控制分离、抗性或全局崩溃等多种不良情况,凸显了闭环评估的必要性。

Comments 28 pages, 14 figures, 40 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04428 2026-08-06 cs.AR cs.LG 新提交 91%

Deltoris: Enabling Real-time VLA Inference in Embodied AI via Bit-level Sparsity and Speculative Inference

Deltoris:通过比特级稀疏性和推测性推理实现具身AI中的实时VLA推理

Zheng Liu, Zeyu Guo, Zihan Liu, Anbang Wu, Han Zhao, Fangxin Liu, Zhezhi He, Yinhe Han, Jingwen Leng, Minyi Guo, Yiming Gan, Yu Feng

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.LG

AI总结 Deltoris作为算法-硬件协同设计框架,通过时间感知比特级稀疏性、推测性推理及定制加速器,实现具身AI中实时VLA推理,加速比显著且精度相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04246 2026-08-06 cs.RO cs.CV 新提交 90%

SAFECAST: Robust Failure Detection for VLA Policies with Contrast-Set Training and Calibration

SAFECAST:结合对比集训练与校准的VLA策略鲁棒故障检测

Harshitha Rajaprakash, Aditeya Prajapati, Rong Xue, Abrar Anwar, Jesse Thomason

机构 * University of Southern California(南加州大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 SAFECAST 借助对比集扰动优化隐状态探测器训练与校准,在真实和模拟实验中显著提升 VLA 策略故障检测 ROC-AUC,且视觉与语言对比集扰动结合时效果最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04765 2026-08-06 cs.RO cs.AI cs.CV 新提交 90%

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models

用于视觉-语言-动作模型长程规划的显式语言记忆

Houze Xu, Jizhong Li, Ziyi Ye

机构 * Fudan University(复旦大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV、cs.AI

AI总结 该研究针对视觉-语言-动作模型长程规划的挑战,提出带显式语言记忆模块的分层架构,经仿真与实机实验验证,可提升复杂长程任务的成功率、鲁棒性与决策可解释性。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05042 2026-08-06 cs.RO 新提交 89%

BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation

BridgeVLA++:一种面向三维操作的数据高效、可泛化且内存增强的视觉-语言-动作框架

Peiyan Li, Yuze Zhu, Yixiang Chen, Qisen Ma, Yuan Xu, Jiabing Yang, He Guan, Yan Huang, Hongtao Wu, Xiao Ma, Tao Kong, Liang Wang, Tieniu Tan

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室(NLPR)) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges ByteDance Seed(字节跳动种子实验室)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO

AI总结 本研究提出内存增强的三维VLA框架BridgeVLA++,通过新增时空记忆架构,在保留原模型数据效率与泛化能力的同时,提升了记忆相关操作性能,且在多任务与真实平台上验证了其有效性。

Comments This work has been submitted to the IEEE TPAMI for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04510 2026-08-06 cs.RO cs.AI 新提交 88%

GUARD: Grounding Uncertainty and Ablation-Based Risk Detection for Diffusion-Based VLAs

GUARD:面向扩散型视觉-语言动作(VLA)的不确定性与基于消融的风险检测

Suhas Hegde, Jitendra Yasaswi Bharadwaj Katta

专题命中 VLA模型 :VLA(title_cn,summary_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文提出GUARD方法,无需修改预训练扩散型VLA策略即可检测其故障,在多基准测试中提升未见过任务的ROC-AUC,提供可跨多维度迁移的故障信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04196 2026-08-06 cs.RO cs.CV cs.LG 新提交 83%

SiMDex: Mining Similar Egocentric Videos for Cross-Embodiment Dexterous Manipulation

SiMDex:挖掘相似的自我中心视频以实现跨 embodiment 的灵巧操作

Nie Lin, Takehiko Ohkawa, Sijin Chen, Ruoshi Wen, Zhuohang Li, Liqun Huang, Zhengming Zhu, Yiming Bao, Yunfei Li, Minjie Cai, Xiao Ma, Wei Xu, Yoichi Sato

机构 * The University of Tokyo(东京大学) ByteDance Seed(字节跳动 Seed) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 该研究提出SiMDex框架,通过三层流程从海量自我中心人类视频中挖掘与任务相关的子集,用于VLA后训练,仅用少量样本便显著提升了机器人灵巧操作的成功率,证明选择性数据整理更有效。

Comments 12 pages, 4 figures. Project page: https://lin-nie.github.io/SiMDex/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04996 2026-08-06 cs.RO 新提交 83%

DreamWAM: Beyond RGB Future Prediction for World Action Models

DreamWAM:超越RGB未来预测的世界动作模型

Shanglin Yuan, Weiheng Zhao, Xin Shi, Haoyi Jiang, Xianda Guo, Liu Liu, Wenyu Liu, Wei Sui, Xinggang Wang

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 DreamWAM通过结构化超越RGB的世界建模,在LIBERO及真实操作任务中提升了世界动作模型的鲁棒性与成功率,相关代码模型已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04404 2026-08-06 cs.CV 新提交 83%

Faster-WAM: Efficient Inference-Time Future Conditioning for Robust World Action Models

Faster-WAM:面向鲁棒世界动作模型的高效推理时未来条件化方法

Weiheng Zhao, Haoyi Jiang, Xin Shi, Liu Liu, Fan Huang, Zhizhong Su, Wei Sui, Xinggang Wang

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 本文提出Faster-WAM,通过稀疏未来条件化框架等技术解决现有WAMs的性能效率矛盾,在多个机器人操控基准上实现更优权衡,提升了分布外泛化能力与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04854 2026-08-06 eess.SY cs.SY 新提交 50%

Transforming Remanufacturing Automation with Large Language Models: A Forward-Looking Analysis with Case Studies

用大语言模型推动再制造自动化:前瞻性分析与案例研究

Chang Liu, Sara Behdad, Prabhakar Pagilla, Xiao Liang, Minghui Zheng

专题命中 VLA模型 :action model(abstract)

AI总结 本文通过前瞻性分析与案例研究,提出ReManGPT概念框架,探讨大语言模型在再制造自动化中的应用,以应对报废产品变异性等挑战,同时分析其部署障碍与未来方向。

Journal ref Robotics and Computer-Integrated Manufacturing 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04997 2026-08-06 nucl-ex hep-ph nucl-th 新提交 50%

First Results on Nucleon Resonance Electroexcitation Amplitudes from $ep \to e'π^+π^-p'$ Cross Sections at $W$ from $1.56-1.76$ GeV and $Q^2$ from $2.0-5.0$ GeV$^2$

从W为1.56-1.76 GeV、Q²为2.0-5.0 GeV²的ep→e'π⁺π⁻p'截面得到的核子共振电激发振幅的首批结果

V. I. Mokeev, P. Achenbach, V. D. Burkert, D. S. Carman, R. W. Gothe, E. L. Isupov, K. Joo, K. Neupane, Y. Wunderlich

专题命中 VLA模型 :action model(abstract)

AI总结 本研究利用CLAS探测器数据和JM反应模型,首次得到第三共振区核子共振的电耦合结果,证实了反应模型的提取能力,为强QCD机制研究提供新机遇。

Comments 25 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏