arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-03-20 至 2026-03-20 共收录 10 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 10 篇

2603.19131 2026-03-20 cs.LG cs.RO 88%

From Inference Efficiency to Embodied Efficiency: Revisiting Efficiency Metrics for Vision-Language-Action Models

从推理效率到具身效率:重新审视视觉-语言-动作模型的效率指标

Zhuofan Li, Hongkun Yang, Zhenyang Chen, Yangxuan Chen, Yingyan, Lin, Chaojian Li

机构 * Hong Kong University of Science and Technology(香港理工大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.LG

AI总结 本文重新审视视觉-语言-动作模型的效率指标,发现传统参数、FLOPs或token解码吞吐量无法反映机器人平台的实际表现,提出具身效率指标如任务完成时间、轨迹平滑度等,揭示传统方法在具身效率上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18091 2026-03-20 cs.CV cs.RO 88%

Action Draft and Verify: A Self-Verifying Framework for Vision-Language-Action Model

动作草稿与验证:一种用于视觉-语言-动作模型的自验证框架

Chen Zhao, Zhuoran Wang, Haoyang Li, Shifeng Bao, Guanlin Li, Youhe Feng, Yang Li, Jie Tang, Jing Zhang

机构 * Key Laboratory of Data Engineering(数据工程与知识工程重点实验室) Tsinghua University(清华大学) Beijing University of Posts(北京邮电大学) School of Information, Renmin University of China(中国人民大学信息学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Action-Draft-and-Verify框架,结合扩散动作专家和VLM,通过单次前向传递选择最优动作片段,提升模拟和现实场景中的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19233 2026-03-20 cs.RO 88%

Not All Features Are Created Equal: A Mechanistic Study of Vision-Language-Action Models

并非所有特征都具有同等价值:一种视觉-语言-动作模型的机制研究

Bryce Grant, Xijia Zhao, Peng Wang

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 研究通过激活注入、稀疏自编码器和线性探针分析视觉-语言-动作模型,发现视觉路径主导动作生成,语言敏感性取决于任务结构而非模型设计,且专家路径编码运动程序,VLM路径编码目标语义,释放Action Atlas供探索。

Comments Accepted to Multimodal Intelligence Workshop @ ICLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26642 2026-03-20 cs.RO 85%

MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation

MLA:一种多感官语言-动作模型,用于机器人操作中的多模态理解和预测

Zhuoyang Liu, Jiaming Liu, Jiadong Xu, Nuowei Han, Chenyang Gu, Hao Chen, Kaichen Zhou, Renrui Zhang, Kai Chin Hsieh, Kun Wu, Zhengping Che, Jian Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Beijing Innovation Center of Humanoid Robotics (X-Humanoid)(北京类人机器人创新中心(X-Humanoid)) The Chinese University of Hong Kong (CUHK)(香港中文大学(CUHK))

专题命中 VLA模型 :action model(title,abstract);vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文提出MLA模型,通过多感官融合与未来目标预测,提升机器人在复杂接触任务中的操控能力,实验显示其在2D和3D任务中性能优于现有方法。

Comments Project page: https://robotic-mla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18342 2026-03-20 cs.RO cs.AI cs.LG 85%

Shifting Uncertainty to Critical Moments: Towards Reliable Uncertainty Quantification for VLA Model

将不确定性移至关键时刻:面向VLA模型可靠不确定性的量化

Yanchuan Tang, Taowen Wang, Yuefei Chen, Boxuan Zhang, Qiang Guan, Ruixiang Tang

机构 * Rutgers University(罗格斯大学) Kent State University(肯特州立大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出统一的不确定性量化方法,通过最大值滑动窗口池化保留瞬时风险信号,结合运动感知稳定性加权强调不稳定行为的高频动作振荡,并通过贝叶斯优化进行DOF自适应校准,提升失败预测准确性和故障检测可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19219 2026-03-20 cs.CV cs.LG 73%

DriveTok: 3D Driving Scene Tokenization for Unified Multi-View Reconstruction and Understanding

DriveTok: 3D驾驶场景分词用于统一多视角重建与理解

Dong Zhuo, Wenzhao Zheng, Sicheng Zuo, Siming Yan, Lu Hou, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学) Yinwang Intelligent Technology Co. Ltd.(云网智能科技有限公司)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.CV、cs.LG

AI总结 DriveTok通过3D变形交叉注意力实现高效多视角重建与理解,整合语义、几何与纹理信息,提升多视角分词效率与一致性。

Comments Project Page: https://paryi555.github.io/DriveTok/ Code: https://github.com/paryi555/DriveTok

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18912 2026-03-20 cs.CV 57%

GHOST: Fast Category-agnostic Hand-Object Interaction Reconstruction from RGB Videos using Gaussian Splatting

GHOST:基于RGB视频的快速无类别手-物体交互重建方法(使用高斯散射)

Ahmed Tawfik Aboukhadra, Marcel Rogge, Nadia Robertini, Abdalla Arafa, Jameel Malik, Ahmed Elhayek, Didier Stricker

机构 * RPTU(鲁尔大学图灵学院) DFKI-AV Kaiserslautern(德累斯顿-费尔德基辛人工智能研究所) UPM Saudi Arabia(西班牙国际大学沙特分校) NUST-SEECS Pakistan(奈瓦扎巴德大学信息与电子科学学院)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 GHOST通过高斯散射技术实现快速且无类别的手-物体交互重建,解决了现有方法在物理一致性上的不足,实验表明其在3D重建和2D渲染质量上达到领先水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14115 2026-03-20 cs.HC cs.LG 57%

Visualization Tasks for Unlabeled Graphs

无标签图的可视化任务

Matt I. B. Oddo, Ryan Smith, Stephen Kobourov, Tamara Munzner

机构 * Department of Computer Science, University of British Columbia(不列颠哥伦比亚大学计算机科学系) Department of Computer Science at the Technical University of Munich(慕尼黑技术大学计算机科学系)

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 本文提出了一种数据抽象模型,区分无标签与有标签、属性和增强的图情境,通过分析任务并建立分类体系,探讨无标签图的可视化任务及其评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15274 2026-03-20 astro-ph.SR astro-ph.GA 50%

IRAM 04191+1522: a compact proto-brown dwarf binary candidate

IRAM 04191+1522:一个紧凑的原棕矮星双星候选体

N. Huélamo, I. de Gregorio-Monsalvo, Aina Palau, C. Carrasco-González, A. Ribas, H. Bouy, R. Pandey, D. Barrado, N. Otten, V. D. Ivanov, M. F. Sterzik, M. Dunham, L. A. Zapata, E. Pantin, E. Macías

专题命中 VLA模型 :VLA(abstract)

AI总结 研究IRAM 04191+1522的双星性,发现其为紧凑双星候选体,揭示了低光度天体的形成机制。

Comments Accepted for publication in A&A (7 pages including Appendix, 7 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18535 2026-03-20 cs.HC 50%

Align-to-Scale: Mode Switching Technique for Unimanual 3D Object Manipulation with Gaze-Hand-Object Alignment in Extended Reality

对齐到尺度:用于增强现实中的单手3D物体操控的模式切换技术

Min-yung Kim, Jinwook Kim, Ken Pfeuffer, Sang Ho Yoon

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出一种基于 gaze-hand-object 对齐的单手3D操控模式切换技术,通过空间对齐实现单手缩放,评估了多种单手缩放方法的可用性,并提出设计指南以支持未来的3D界面。

Comments 19 pages, 6 figures, Presented at ACM ETRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏