arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-03-11 至 2026-03-11 共收录 16 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 16 篇

2603.09542 2026-03-11 cs.RO 91%

NS-VLA: Towards Neuro-Symbolic Vision-Language-Action Models

NS-VLA:迈向神经符号视觉-语言-动作模型

Ziyue Zhu, Shangyang Wu, Shuai Zhao, Zhiqiu Zhao, Shengjie Li, Yi Wang, Fang Li, Haoran Luo

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO

AI总结 NS-VLA通过在线强化学习提出神经符号视觉-语言-动作模型,解决VLA在学习可重用原始构件、减少数据依赖和扩展探索能力方面的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09079 2026-03-11 cs.CV cs.AI cs.RO 90%

GST-VLA: Structured Gaussian Spatial Tokens for 3D Depth-Aware Vision-Language-Action Models

GST-VLA: 结构化高斯空间标记用于3D深度感知视觉-语言-动作模型

Md Selim Sarowar, Omer Tariq, Sungho Kim

机构 * Yeungnam University(延世大学) Korea Advanced Institute of Science and Technology, KAIST(韩国科学技术院)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(title);action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 GST-VLA通过结构化高斯空间标记和深度感知链式思维提升3D视觉-语言-动作模型的精度和性能。

Comments The results presented in this paper are preliminary. Please note that the experiments are currently ongoing, and the final data is subject to change upon the completion of the study. All ideas, results, methods, and any content herein are the sole property of the authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17439 2026-03-11 cs.RO cs.AI cs.CV cs.LG 90%

From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors

从空间到动作:在空间先验基础上构建视觉-语言-动作模型

Zhengshen Zhang, Hao Li, Yalun Dai, Zhengbang Zhu, Lei Zhou, Chenchen Liu, Dong Wang, Francis E. H. Tay, Sijin Chen, Ziwei Liu, Yuxiao Liu, Xinghang Li, Pan Zhou

机构 * ByteDance Seed(字节跳动种子) NUS(新加坡国立大学) NTU(国立技术大学) THU(清华大学) SMU(南方大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,comments);分类 cs.RO、cs.CV、cs.AI

AI总结 FALCON通过引入丰富的3D空间标记,改进了视觉-语言-动作模型的空间表示、模态可转移性和对齐能力,在多个基准和现实任务中取得最佳性能。

Comments Accepted at ICLR 2026. Project page: https://falcon-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01549 2026-03-11 cs.CV cs.AI cs.RO 89%

Pri4R: Learning World Dynamics for Vision-Language-Action Models with Privileged 4D Representation

Pri4R: 通过特权4D表示学习视觉-语言-动作模型的世界动态

Jisoo Kim, Jungbin Cho, Sanghyeok Chu, Ananya Bal, Jinhyung Kim, Gunhee Lee, Sihaeng Lee, Seung Hwan Kim, Bohyung Han, Hyunmin Lee, Laszlo A. Jeni, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究中心) LG AI Research(LG人工智能研究) Yonsei University(延世大学) Seoul National University(首尔国立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 Pri4R通过特权4D表示学习视觉-语言-动作模型的世界动态,提升操控任务性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09121 2026-03-11 cs.RO cs.AI 88%

DexHiL: A Human-in-the-Loop Framework for Vision-Language-Action Model Post-Training in Dexterous Manipulation

DexHiL: 一种用于灵巧操作中视觉-语言-动作模型后训练的人机协同框架

Yifan Han, Zhongxi Chen, Yuxuan Zhao, Congsheng Xu, Yanming Shao, Yichuan Peng, Yao Mu, Wenzhao Lian

机构 * CASIA(中国科学院自动化研究所) SJTU(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI

AI总结 DexHiL是一种用于灵巧操作中视觉-语言-动作模型后训练的人机协同框架,通过干预意识的数据采样策略和轻量级远程操作界面,显著提升了模型在不同任务中的成功率。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21192 2026-03-11 cs.CV cs.AI 88%

When Robots Obey the Patch: Universal Transferable Patch Attacks on Vision-Language-Action Models

当机器人服从补丁:对视觉-语言-动作模型的通用可转移补丁攻击

Hui Lu, Yi Yu, Yiming Yang, Chenyu Yi, Qixin Zhang, Bingquan Shen, Alex C. Kot, Xudong Jiang

机构 * ROSE Lab, Interdisciplinary Graduate Programme, Nanyang Technological University(罗思实验室,跨学科研究生项目,南洋理工大学) ROSE Lab, School of Electrical and Electronic Engineering, Nanyang Technological University(罗思实验室,电子与电气工程学院,南洋理工大学) CCDS, Nanyang Technological University(CCDS,南洋理工大学) DSO National Laboratories(国防科学局实验室)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV、cs.AI

AI总结 本文提出UPA-RFAS框架,通过鲁棒特征、注意和语义方法,实现对视觉-语言-动作模型的通用可转移补丁攻击,揭示了基于补丁的攻击面并为未来防御提供基线。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09482 2026-03-11 cs.RO 88%

StyleVLA: Driving Style-Aware Vision Language Action Model for Autonomous Driving

StyleVLA: 驾驶风格感知的视觉语言动作模型用于自动驾驶

Yuan Gao, Dengyuan Hua, Mattia Piccinini, Finn Rasmus Schäfer, Korbinian Moller, Lin Li, Johannes Betz

专题命中 VLA模型 :vision language action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 StyleVLA通过引入物理约束和混合损失,生成多样且物理合理的驾驶行为,优于现有专有和先进模型。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14932 2026-03-11 cs.RO cs.LG 79%

Robot Control Stack: A Lean Ecosystem for Robot Learning at Scale

机器人控制栈:一个用于大规模机器人学习的轻量生态系统

Tobias Jülg, Pierre Krack, Seongjin Bien, Yannik Blei, Khaled Gamal, Ken Nakahara, Johannes Hechtl, Roberto Calandra, Wolfram Burgard, Florian Walter

机构 * Department of Computer Science & Artificial Intelligence, University of Technology Nuremberg(技术大学纽伦堡计算机科学与人工智能系) Learning, Adaptive Systems and Robotics (LASR) Lab, Faculty of Computer Science, TU Dresden(德累斯顿技术大学计算机科学学院学习、适应系统与机器人实验室) Siemens Foundational Technologies, Siemens AG(西门子基础技术部,西门子股份公司) Chair for Robotics, Artificial Intelligence and Real-Time Systems, TUM School of Computation, Information and Technology, Technical University of Munich(慕尼黑技术大学计算、信息与技术学院机器人、人工智能与实时系统教授职位)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);action model(abstract);分类 cs.RO、cs.LG

AI总结 机器人控制栈(RCS)是一个为大规模机器人学习设计的轻量生态系统,通过模块化架构和统一接口,促进模拟到现实的迁移,并评估了多种策略在不同机器人上的性能。

Comments Accepted at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09001 2026-03-11 astro-ph.IM 78%

Correcting Ionospheric Faraday Rotation for the VLA and MeerKAT

校正VLBA和MeerKAT的电离层法拉第旋转

Richard A. Perley, Bryan J. Butler, Eric W. Greisen, Benjamin V. Hugo, Evangelia Tremou, A. G. Willis

专题命中 VLA模型 :VLA(title,abstract)

AI总结 本文通过比较传统方法与ALBUS软件,校正VLBA和MeerKAT的电离层法拉第旋转测量误差,提高观测精度。

Comments Accepted for publication in ApJS

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01068 2026-03-11 cs.RO cs.LG 73%

Compose Your Policies! Improving Diffusion-based or Flow-based Robot Policies via Test-time Distribution-level Composition

制定你的策略!通过测试时的分布级组合改进扩散型或流型机器人策略

Jiahang Cao, Yize Huang, Hanzhong Guo, Rui Zhang, Mu Nan, Weijian Mai, Jiaxu Wang, Hao Cheng, Jingkai Sun, Gang Han, Wen Zhao, Qiang Zhang, Yijie Guo, Qihao Zheng, Chunfeng Song, Xiao Li, Ping Luo, Andrew F. Luo

机构 * The University of Hong Kong(香港大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.LG

AI总结 本研究提出无需训练的通用策略组合方法,通过测试时分布级组合提升机器人策略性能。

Comments Accepted to ICLR 2026. Project Page: https://sagecao1125.github.io/GPC-Site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09778 2026-03-11 hep-ph cs.AI hep-ex physics.comp-ph 57%

First Estimation of Model Parameters for Neutrino-Induced Nucleon Knockout Using Simulation-Based Inference

利用基于模拟的推断对中微子诱导的核子击穿进行首次参数估计

Karla Tame-Narvaez, Steven Gardiner, Aleksandra Ćiprijanović, Giuseppe Cerati

机构 * Fermi National Accelerator Laboratory(费米国家加速器实验室) University of Chicago(芝加哥大学) NSF-Simons AI Institute for the Sky (SkAI)(国家科学基金会-Simon人工智能研究所(SkAI))

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 本文利用基于模拟的推断方法对中微子诱导核子击穿过程中的参数进行首次估计,并验证了该方法在提高模拟精度和适应复杂性增长方面的潜力。

Comments 13 pages, 10 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17901 2026-03-11 q-bio.BM cs.LG 57%

Molecular Fingerprints Are Strong Models for Peptide Function Prediction

分子指纹是预测肽功能的强大模型

Jakub Adamczyk, Piotr Ludynia, Wojciech Czech

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 本研究证明分子指纹在无需长程相互作用建模的情况下,能高效准确预测肽功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09228 2026-03-11 astro-ph.HE 50%

Searching for Black Hole Candidates in Quiescence by Using Multi-band Observations in Globular Cluster M22 (NGC6656)

通过多波段观测在球状星团M22(NGC6656)中寻找黑洞候选者

Yu-Jing Xu, Wei-Min Gu, Xin-Yu Fang, Shan-Shan Weng, Tao An

专题命中 VLA模型 :VLA(abstract)

AI总结 通过多波段观测在球状星团M22中发现恒星级质量黑洞候选者VLA22,并验证其符合黑洞低质量X射线双星的辐射特征。

Comments 10 pages, 4 figures, 1 table, to be submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09135 2026-03-11 quant-ph 50%

Critical States Preparation With Deep Reinforcement Learning

临界态制备与深度强化学习

Jia-Wen Yu, Yi-Ming Yu, Ke-Xiong Yan, Jun-Hao Lin, Jie Song, Ye-Hong Chen, Yan Xia

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出利用深度强化学习快速制备量子临界态,并应用于量子拉比模型,实现高保真度的临界态制备。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.02508 2026-03-11 eess.SY cs.NA cs.SC cs.SY math.NA 50%

Dissipative quadratizations of polynomial ODE systems

耗散二次化多项式常微分方程系统

Yubo Cai, Gleb Pogudin

专题命中 VLA模型 :action model(abstract)

AI总结 本研究提出了一种保持原始模型耗散性的二次化方法,用于多项式常微分方程系统的分析与应用。

Comments Accepted by 30th International Conference on Tools and Algorithms for the Construction and Analysis of Systems (TACAS24)

Journal ref Tools and Algorithms for the Construction and Analysis of Systems. TACAS 2024. Lecture Notes in Computer Science, vol 14571. Springer, Cham, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17327 2026-03-11 astro-ph.GA 50%

Radio Spectral Energy Distribution of Low-$z$ Metal Poor Extreme Starburst Galaxies: Novel insights on the escape of ionizing photons

低红移金属贫乏极端恒星burst星系的无线电能谱分布:关于电离光子逃逸的新见解

Omkar Bait, Daniel Schaerer, Yuri I. Izotov, Biny Sebastian

专题命中 VLA模型 :VLA(abstract)

AI总结 研究低红移金属贫乏极端恒星burst星系的无线电能谱分布,发现其频谱特征与高热分数和自由-自由吸收有关,并确认Lyman连续体逃逸分数与电离状态的相关性。

Comments 20 pages, 9 figures, 7 tables; Accepted for publication in MNRAS

详情

展开后加载摘要…

URL PDF HTML 收藏