arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-03-18 至 2026-03-18 共收录 13 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 12 篇

2602.22896 2026-03-18 cs.RO 91%

DySL-VLA: Efficient Vision-Language-Action Model Inference via Dynamic-Static Layer-Skipping for Robot Manipulation

DySL-VLA:通过动态-静态层跳过实现高效的视觉-语言-动作模型推理以用于机器人操作

Zebin Yang, Yijiahao Qi, Tong Xie, Bo Yu, Shaoshan Liu, Meng Li

机构 * Institute for Artificial Intelligence(人工智能研究院) School of Integrated Circuits, Peking University(集成电路学院,北京大学) Shenzhen Institute of Artificial Intelligence(深圳人工智能研究所) School of Electronics Engineering and Computer Science, Peking University(电子工程与计算机科学学院,北京大学) Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路先进制造创新中心)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO

AI总结 本文提出DySL-VLA框架,通过动态跳过视觉-语言-动作层来降低计算成本,提升机器人操作任务的实时性能,实验表明在Calvin数据集上成功长度提升2.1%,参数减少85.7倍,速度提升3.75倍。

Comments DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16218 2026-03-18 cs.RO 88%

Enabling Dynamic Tracking in Vision-Language-Action Models via Time-Discrete and Time-Continuous Velocity Feedforward

通过时间离散和时间连续速度前馈实现视觉-语言-动作模型中的动态跟踪

Johannes Hechtl, Philipp Schmitt, Georg von Wichert, Wolfram Burgard

机构 * Siemens Foundational Technologies(西门子基础技术) Department of Computer Science & Artificial Intelligence, University of Technology Nuremberg(技术大学纽伦堡计算机科学与人工智能系)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 本文提出两种方法提取VLAs中的速度目标,通过有限差分和连续三次B样条空间,改进VLA策略以解决合规性与响应性之间的权衡,提升任务执行速度和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15618 2026-03-18 cs.CV 88%

Look Before Acting: Enhancing Vision Foundation Representations for Vision-Language-Action Models

先看再行动:增强视觉基础表示以用于视觉-语言-动作模型

Yulin Luo, Hao Chen, Zhuangzhe Wu, Bowen Sui, Jiaming Liu, Chenyang Gu, Zhuoyang Liu, Qiuxuan Feng, Jiale Yu, Shuo Gu, Peng Jia, Pheng-Ann Heng, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Simplexity Robotics(Simplexity机器人公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV

AI总结 本文提出DeepVision-VLA框架,通过视觉-语言混合变压器提升视觉表示,引入动作引导视觉剪枝技术,实现在模拟和现实任务中提升9.0%和7.5%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16044 2026-03-18 cs.AI 83%

Enhancing Linguistic Generalization of VLA: Fine-Tuning OpenVLA via Synthetic Instruction Augmentation

增强 VLA 的语言泛化能力:通过合成指令增强细调 OpenVLA

Dongik Shin

专题命中 VLA模型 :VLA(title);vision-language-action(abstract);action model(abstract);分类 cs.AI

AI总结 本文提出通过合成指令集提升 OpenVLA 的语言泛化能力,利用 LoRA 技术在增强数据上微调,增强复杂自然语言意图与机器人动作之间的桥梁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16086 2026-03-18 cs.RO cs.AI cs.CV cs.SD 75%

Towards the Vision-Sound-Language-Action Paradigm: The HEAR Framework for Sound-Centric Manipulation

迈向视觉-声音-语言-动作范式:用于以声音为中心的操作的HEAR框架

Chang Nie, Tianchen Deng, Guangming Wang, Zhe Liu, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University and Shanghai Key Laboratory of Navigation and Location Based Services(自动化与智能感知学院,上海交通大学,导航与基于位置的服务重点实验室) Department of Engineering, Cambridge University(工程系,剑桥大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出HEAR框架,通过整合声音、视觉、语言和本体感知,解决实时声音中心操作中的关键声音遗漏问题,强调因果持续性和显式时间学习的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22579 2026-03-18 cs.RO cs.SE 70%

Metamorphic Testing of Vision-Language Action-Enabled Robots

视觉-语言-动作机器人元测试

Pablo Valle, Sergio Segura, Shaukat Ali, Aitor Arrieta

机构 * Mondragon University(蒙达龙大学) University of Seville(塞维利亚大学) Simula Research Laboratory(Simula研究实验室)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文探讨元测试能否缓解视觉-语言-动作机器人测试 oracle 问题,提出两种关系模式和五种关系,通过实验证明其有效性,并展示其在不同任务和机器人上的通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15541 2026-03-18 cs.RO 70%

CompliantVLA-adaptor: VLM-Guided Variable Impedance Action for Safe Contact-Rich Manipulation

CompliantVLA-adaptor:基于视觉-语言模型的变量阻抗控制用于安全的高接触密度操作

Heng Zhang, Wei-Hsing Huang, Qiyi Tong, Gokhan Solak, Puze Liu, Kaidi Zhang, Sheng Liu, Jan Peters, Yu She, Arash Ajoudani

机构 * Human-Robot Interfaces and Interaction Lab, Istituto Italiano di Tecnologia, Genoa, Italy(人机交互实验室,意大利理工学院,热那亚,意大利) Ph.D. program of national interest in Robotics and Intelligent Machines (DRIM) and Università di Genova, Genoa, Italy(机器人与智能机器国家利益博士项目和热那亚大学,热那亚,意大利) Edwardson School of Industrial Engineering, Purdue University, West Lafayette, IN 47907, USA(工业工程埃德华森学校,普渡大学,西拉法克萨,印第安纳州47907,美国) Georgia Institute of Technology, Atlanta, USA(佐治亚理工学院,亚特兰大,美国) German Research Center for AI, Germany(德国人工智能研究中心,德国) TU Darmstadt, Darmstadt, Germany(图宾根大学,图宾根,德国) Karlsruhe Institute of Technology, Karlsruhe, Germany(卡尔斯鲁厄理工学院,卡尔斯鲁厄,德国)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文提出CompliantVLA-adaptor,通过引入基于视觉语言模型的上下文感知变量阻抗控制,提升接触密集任务的安全性和有效性。方法通过图像和自然语言解读任务上下文,调节阻抗控制器的刚度和阻尼参数,并利用实时力/扭矩反馈确保安全。实验表明在模拟和现实任务中均优于基线方法。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15927 2026-03-18 cs.LG cs.NA math.DS math.NA 57%

Discovery of interaction and diffusion kernels in particle-to-mean-field multi-agent systems

粒子到均场多智能体系统中相互作用和扩散核的发现

Giacomo Albi, Alessandro Alla, Elisa Calzola

机构 * Department of Computer Science, University of Verona(威尼斯大学计算机科学系) Department of Mathematics, La Sapienza University of Rome(罗马拉维拉大学数学系)

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 本文提出了一种数据驱动框架,通过轨迹数据直接学习多智能体系统中的非局部相互作用和扩散项,无需先验知识。通过随机批采样和均场近似策略,有效重建了相互作用和扩散核。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18209 2026-03-18 astro-ph.GA 50%

The GUAPOS project -- VII: Physical structure and molecular environment of the G31.41+0.31 HII region

GUAPOS项目——VII:G31.41+0.31 HII区域的物理结构和分子环境

R. Cesaroni, M. T. Beltrán, V. M. Rivilla, Á. Sánchez-Monge, L. Colzi, F. Fontani, Á. López-Gallifa, A. Lorenzani, C. Mininni

专题命中 VLA模型 :VLA(abstract)

AI总结 研究G31.41+0.31 HII区域的气体密度、温度及空间分布,利用ALMA和VLA观测数据揭示其三维结构和分子云相互作用。

Journal ref A&A 707, A327 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03331 2026-03-18 astro-ph.GA 50%

Radio Detection of a Local Little Red Dot

本地小红点的射电探测

L. F. Rodriguez, I. F. Mirabel

专题命中 VLA模型 :VLA(abstract)

AI总结 研究通过射电观测分析本地宇宙中的小红点候选体,发现其可能由吸积的中等质量或超大质量黑洞或频繁的超新星产生射电辐射,结果支持中等质量黑洞假说。

Comments 6 pages, 3 figures, submitted to A&A

Journal ref A&A 707, L17 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16087 2026-03-18 cond-mat.str-el 50%

Theory of Magnetoacoustic Resonance to Probe Multipole Effects Due to a Crystal Field Quartet

磁声共振理论用于探测晶场四重态的多极效应

Mikito Koga, Masashige Matsumoto

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出一种通过声波驱动共振探测八极和隐藏的四极自由度的方法,通过各向异性共振跃迁率和Zeeman分裂探讨四极-应变耦合及八极效应。

Comments 13 pages, 4 figures

Journal ref J. Phys. Soc. Jpn. 93, 114701 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15721 2026-03-18 cs.CR cs.HC 50%

Grant, Verify, Revoke: A User-Centric Pattern for Blockchain Compliance

授权、验证、撤销:一种以用户为中心的区块链合规模式

Supriya Khadka, Sanchari Das

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出ZK-Compliance框架,通过浏览器零知识证明实现用户隐私与合规性的平衡,允许用户本地证明属性而不泄露数据,提供可撤销的授权流程。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 1 篇

2512.13644 2026-03-18 cs.RO cs.AI cs.CV 67%

World Models for Learning Dexterous Hand-Object Interactions from Human Videos

为从人类视频学习灵巧手-物体交互构建世界模型

Raktim Gautam Goswami, Amir Bar, David Fan, Tsung-Yen Yang, Gaoyue Zhou, Prashanth Krishnamurthy, Michael Rabbat, Farshad Khorrami, Yann LeCun

机构 * FAIR at Meta(Meta 的 FAIR 部门) New York University(纽约大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出DexWM模型,通过手部关键点提取实现对精细手部动作的建模,提升未来状态预测和零样本迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏