arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-03-20 至 2026-03-20 共收录 14 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 10 篇

2603.19131 2026-03-20 cs.LG cs.RO 88%

From Inference Efficiency to Embodied Efficiency: Revisiting Efficiency Metrics for Vision-Language-Action Models

从推理效率到具身效率:重新审视视觉-语言-动作模型的效率指标

Zhuofan Li, Hongkun Yang, Zhenyang Chen, Yangxuan Chen, Yingyan, Lin, Chaojian Li

机构 * Hong Kong University of Science and Technology(香港理工大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.LG

AI总结 本文重新审视视觉-语言-动作模型的效率指标,发现传统参数、FLOPs或token解码吞吐量无法反映机器人平台的实际表现,提出具身效率指标如任务完成时间、轨迹平滑度等,揭示传统方法在具身效率上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18091 2026-03-20 cs.CV cs.RO 88%

Action Draft and Verify: A Self-Verifying Framework for Vision-Language-Action Model

动作草稿与验证:一种用于视觉-语言-动作模型的自验证框架

Chen Zhao, Zhuoran Wang, Haoyang Li, Shifeng Bao, Guanlin Li, Youhe Feng, Yang Li, Jie Tang, Jing Zhang

机构 * Key Laboratory of Data Engineering(数据工程与知识工程重点实验室) Tsinghua University(清华大学) Beijing University of Posts(北京邮电大学) School of Information, Renmin University of China(中国人民大学信息学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Action-Draft-and-Verify框架,结合扩散动作专家和VLM,通过单次前向传递选择最优动作片段,提升模拟和现实场景中的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19233 2026-03-20 cs.RO 88%

Not All Features Are Created Equal: A Mechanistic Study of Vision-Language-Action Models

并非所有特征都具有同等价值:一种视觉-语言-动作模型的机制研究

Bryce Grant, Xijia Zhao, Peng Wang

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 研究通过激活注入、稀疏自编码器和线性探针分析视觉-语言-动作模型,发现视觉路径主导动作生成,语言敏感性取决于任务结构而非模型设计,且专家路径编码运动程序,VLM路径编码目标语义,释放Action Atlas供探索。

Comments Accepted to Multimodal Intelligence Workshop @ ICLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26642 2026-03-20 cs.RO 85%

MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation

MLA:一种多感官语言-动作模型,用于机器人操作中的多模态理解和预测

Zhuoyang Liu, Jiaming Liu, Jiadong Xu, Nuowei Han, Chenyang Gu, Hao Chen, Kaichen Zhou, Renrui Zhang, Kai Chin Hsieh, Kun Wu, Zhengping Che, Jian Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Beijing Innovation Center of Humanoid Robotics (X-Humanoid)(北京类人机器人创新中心(X-Humanoid)) The Chinese University of Hong Kong (CUHK)(香港中文大学(CUHK))

专题命中 VLA模型 :action model(title,abstract);vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文提出MLA模型,通过多感官融合与未来目标预测,提升机器人在复杂接触任务中的操控能力,实验显示其在2D和3D任务中性能优于现有方法。

Comments Project page: https://robotic-mla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18342 2026-03-20 cs.RO cs.AI cs.LG 85%

Shifting Uncertainty to Critical Moments: Towards Reliable Uncertainty Quantification for VLA Model

将不确定性移至关键时刻:面向VLA模型可靠不确定性的量化

Yanchuan Tang, Taowen Wang, Yuefei Chen, Boxuan Zhang, Qiang Guan, Ruixiang Tang

机构 * Rutgers University(罗格斯大学) Kent State University(肯特州立大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出统一的不确定性量化方法,通过最大值滑动窗口池化保留瞬时风险信号,结合运动感知稳定性加权强调不稳定行为的高频动作振荡,并通过贝叶斯优化进行DOF自适应校准,提升失败预测准确性和故障检测可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19219 2026-03-20 cs.CV cs.LG 73%

DriveTok: 3D Driving Scene Tokenization for Unified Multi-View Reconstruction and Understanding

DriveTok: 3D驾驶场景分词用于统一多视角重建与理解

Dong Zhuo, Wenzhao Zheng, Sicheng Zuo, Siming Yan, Lu Hou, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学) Yinwang Intelligent Technology Co. Ltd.(云网智能科技有限公司)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.CV、cs.LG

AI总结 DriveTok通过3D变形交叉注意力实现高效多视角重建与理解,整合语义、几何与纹理信息,提升多视角分词效率与一致性。

Comments Project Page: https://paryi555.github.io/DriveTok/ Code: https://github.com/paryi555/DriveTok

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18912 2026-03-20 cs.CV 57%

GHOST: Fast Category-agnostic Hand-Object Interaction Reconstruction from RGB Videos using Gaussian Splatting

GHOST:基于RGB视频的快速无类别手-物体交互重建方法(使用高斯散射)

Ahmed Tawfik Aboukhadra, Marcel Rogge, Nadia Robertini, Abdalla Arafa, Jameel Malik, Ahmed Elhayek, Didier Stricker

机构 * RPTU(鲁尔大学图灵学院) DFKI-AV Kaiserslautern(德累斯顿-费尔德基辛人工智能研究所) UPM Saudi Arabia(西班牙国际大学沙特分校) NUST-SEECS Pakistan(奈瓦扎巴德大学信息与电子科学学院)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 GHOST通过高斯散射技术实现快速且无类别的手-物体交互重建,解决了现有方法在物理一致性上的不足,实验表明其在3D重建和2D渲染质量上达到领先水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14115 2026-03-20 cs.HC cs.LG 57%

Visualization Tasks for Unlabeled Graphs

无标签图的可视化任务

Matt I. B. Oddo, Ryan Smith, Stephen Kobourov, Tamara Munzner

机构 * Department of Computer Science, University of British Columbia(不列颠哥伦比亚大学计算机科学系) Department of Computer Science at the Technical University of Munich(慕尼黑技术大学计算机科学系)

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 本文提出了一种数据抽象模型,区分无标签与有标签、属性和增强的图情境,通过分析任务并建立分类体系,探讨无标签图的可视化任务及其评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15274 2026-03-20 astro-ph.SR astro-ph.GA 50%

IRAM 04191+1522: a compact proto-brown dwarf binary candidate

IRAM 04191+1522:一个紧凑的原棕矮星双星候选体

N. Huélamo, I. de Gregorio-Monsalvo, Aina Palau, C. Carrasco-González, A. Ribas, H. Bouy, R. Pandey, D. Barrado, N. Otten, V. D. Ivanov, M. F. Sterzik, M. Dunham, L. A. Zapata, E. Pantin, E. Macías

专题命中 VLA模型 :VLA(abstract)

AI总结 研究IRAM 04191+1522的双星性,发现其为紧凑双星候选体,揭示了低光度天体的形成机制。

Comments Accepted for publication in A&A (7 pages including Appendix, 7 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18535 2026-03-20 cs.HC 50%

Align-to-Scale: Mode Switching Technique for Unimanual 3D Object Manipulation with Gaze-Hand-Object Alignment in Extended Reality

对齐到尺度:用于增强现实中的单手3D物体操控的模式切换技术

Min-yung Kim, Jinwook Kim, Ken Pfeuffer, Sang Ho Yoon

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出一种基于 gaze-hand-object 对齐的单手3D操控模式切换技术,通过空间对齐实现单手缩放,评估了多种单手缩放方法的可用性,并提出设计指南以支持未来的3D界面。

Comments 19 pages, 6 figures, Presented at ACM ETRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 1 篇

2509.11839 2026-03-20 cs.RO cs.CV 79%

TrajBooster: Boosting Humanoid Whole-Body Manipulation via Trajectory-Centric Learning

TrajBooster:通过轨迹中心学习提升双足人形机器人的整体操作

Jiacheng Liu, Pengxiang Ding, Qihang Zhou, Yuxuan Wu, Da Huang, Zimian Peng, Wei Xiao, Weinan Zhang, Lixin Yang, Cewu Lu, Donglin Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 TrajBooster通过利用轮式人形数据提升双足VLA性能,采用末端执行器轨迹作为通用接口,通过仿真重定向和预训练实现高效任务执行,减少对同构数据的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 1 篇

2603.16952 2026-03-20 cs.RO cs.AI 84%

Embodied Foundation Models at the Edge: A Survey of Deployment Constraints and Mitigation Strategies

边缘端具身基础模型:部署约束及缓解策略综述

Utkarsh Grover, Ravi Ranjan, Mingyang Mao, Trung Tien Dong, Satvik Praveen, Zhenqi Wu, J. Morris Chang, Tinoosh Mohsenin, Yi Sheng, Agoritsa Polyzou, Eiman Kanjo, Xiaomin Lin

机构 * University of South Florida(佛罗里达州立大学) Florida International University(佛罗里达国际大学) Johns Hopkins University(约翰霍普金斯大学) Nottingham Trent University(诺丁汉特伦特大学) Imperial College London(伦敦帝国理工学院)

专题命中 机器人基础模型 :embodied foundation model(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文综述了在边缘端部署具身基础模型时面临的系统性约束及缓解策略,重点探讨了内存带宽、计算延迟和执行成本等关键因素对自动回归视觉-语言-动作策略和扩散控制器的影响,强调了内存、调度、通信和模型架构的协同设计的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 数据集与评测 1 篇

2603.18892 2026-03-20 cs.CV cs.AI 73%

MultihopSpatial: Multi-hop Compositional Spatial Reasoning Benchmark for Vision-Language Model

MultihopSpatial: 用于视觉语言模型的多跳组合空间推理基准

Youngwan Lee, Soojin Jang, Yoorhim Cho, Seunghwan Lee, Yong-Ju Lee, Sung Ju Hwang

机构 * Electronics and Telecommunications Research Institute, South Korea(韩国电信研究院) Korea Advanced Institute of Science and Technology, South Korea(韩国科学技术院) Sungkyunkwan University, South Korea(成均馆大学) DeepAuto, South Korea(DeepAuto)

专题命中 数据集与评测 :vision-language-action(abstract);VLA(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MultihopSpatial基准,针对多跳组合空间推理问题,引入Acc@50IoU指标,并通过大规模训练集提升视觉语言模型的空间推理能力。

Comments Project page: https://youngwanlee.github.io/multihopspatial

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 部署与泛化 1 篇

2508.12987 2026-03-20 hep-ph cs.LG hep-ex nucl-ex physics.comp-ph 57%

Transfer Learning for Neutrino Scattering: Domain Adaptation with GANs

迁移学习用于中微子散射:基于GANs的领域适应

Jose L. Bonilla, Krzysztof M. Graczyk, Artur M. Ankowski, Rwik Dharmapal Banerjee, Beata E. Kowal, Hemant Prasad, Jan T. Sobczyk

机构 * Institute of Theoretical Physics, University of Wroc aw(沃拉夫大学理论物理研究所)

专题命中 部署与泛化 :action model(abstract);分类 cs.LG

AI总结 本文研究了通过GANs进行迁移学习在中微子散射过程中的应用,探讨了不同目标和过程间基本动力学的共享程度,并验证了在不同模型下迁移学习的有效性。

Comments 23 pages, 22 figures, together with supplement, as published in Phys. Rev. D

Journal ref Phys.Rev.D 113 (2026) 5, 053001

详情

展开后加载摘要…

URL PDF HTML 收藏