arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-03-31 至 2026-03-31 共收录 17 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 17 篇

2601.11404 2026-03-31 cs.RO 92%

ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models

ACoT-VLA:面向视觉-语言-动作模型的行动链式推理

Linqing Zhong, Yi Liu, Yifei Wei, Ziyu Xiong, Maoqing Yao, Si Liu, Guanghui Ren

机构 * Beihang University(北京航空航天大学) AgiBot

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title,abstract);分类 cs.RO

AI总结 本文提出ACoT-VLA,通过在动作空间中直接进行推理,改进视觉-语言-动作模型的行动生成,引入显式和隐式动作推理器,实验证明其在真实和仿真环境中的优越性。

Comments Accepted by Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05800 2026-03-31 cs.RO cs.CV 89%

3D CAVLA: Leveraging Depth and 3D Context to Generalize Vision Language Action Models for Unseen Tasks

3D CAVLA:利用深度和3D上下文来泛化视觉语言动作模型以应对未见任务

Vineet Bhat, Yu-Hsiang Lan, Prashanth Krishnamurthy, Ramesh Karri, Farshad Khorrami

机构 * New York University Tandon School of Engineering(纽约大学坦登工程学院) New York University Courant Institute of Mathematical Sciences(纽约大学库朗数学科学研究所)

专题命中 VLA模型 :vision language action(title);action model(title);VLA(abstract,comments);vision-language-action(abstract)

AI总结 本文提出3D-CAVLA框架,通过引入链式推理、深度感知和任务导向的感兴趣区域检测,提升视觉语言动作模型在未见任务中的泛化能力,实验表明其在模拟和现实任务中均表现出色。

Comments Accepted at the 1st Workshop on 3D LLM/VLA, CVPR 2025. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28565 2026-03-31 cs.RO cs.CV 88%

StreamingVLA: Streaming Vision-Language-Action Model with Action Flow Matching and Adaptive Early Observation

StreamingVLA: 流式视觉-语言-动作模型与动作流匹配及自适应早期观察

Yiran Shi, Dongqi Guo, Tianchen Zhao, Feng Gao, Liangzhi Shi, Chao Yu, ZhiJian Mo, Qihua Xiao, XiaoShuai Peng, Qingmin Liao, Yu Wang

机构 * Tsinghua University(清华大学) Lenovo Group Ltd.(联想集团有限公司)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文提出StreamingVLA模型,通过异步并行化视觉-语言-动作阶段,减少延迟和中断,实现2.4倍的延迟提升和6.5倍的执行中断减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28740 2026-03-31 cs.RO 88%

FocusVLA: Focused Visual Utilization for Vision-Language-Action Models

FocusVLA: 用于视觉-语言-动作模型的聚焦视觉利用

Yichi Zhang, Weihao Yuan, Yizhuo Zhang, Xidong Zhang, Jia Wan

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) DaiMon Robotics, China(戴蒙机器人公司) Nanjing University, Nanjing, China(南京大学) Renmin University of China, Beijing, China(中国人民大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 本文提出FocusVLA,通过聚焦任务相关视觉区域提升视觉-语言-动作模型的性能,解决视觉信息利用不足的问题。

Comments 25 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21428 2026-03-31 cs.CV cs.AI cs.RO 85%

From Observation to Action: Latent Action-based Primitive Segmentation for VLA Pre-training in Industrial Settings

从观察到行动:用于工业场景中VLA预训练的基于动作的潜在原始分割

Jiajie Zhang, Sören Schwertfeger, Alexander Kleiner

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出了一种无监督框架,利用连续工业视频流中的大量未标记人类示范数据进行VLA模型预训练。方法首先训练了一个轻量级运动分词器来编码运动动态,然后利用新的'潜在动作能量'度量来发现和分割语义连贯的动作原始片段。

Comments 10 pages, 5 figures, Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27287 2026-03-31 cs.RO cs.CV 84%

Uni-World VLA: Interleaved World Modeling and Planning for Autonomous Driving

Uni-World VLA:自主驾驶中的交织世界建模与规划

Qiqi Liu, Huan Xu, Jingyu Li, Bin Sun, Zhihui Hao, Dangen She, Xiatian Zhu, Li Zhang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Li Auto Inc.(理想汽车) University of Surrey(萨里大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Uni-World VLA模型,通过交织未来帧预测与轨迹规划提升自主驾驶决策能力,结合单目深度信息增强场景预测。

Comments 22 pages, 8 figures. Submitted to ECCV 2026. Code will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28301 2026-03-31 cs.LG 83%

LIBERO-Para: A Diagnostic Benchmark and Metrics for Paraphrase Robustness in VLA Models

LIBERO-Para:一种用于视觉语言动作模型中同义词鲁棒性诊断的基准和指标

Chanyoung Kim, Minwoo Kim, Minseok Kang, Hyunwoo Kim, Dahuin Jung

机构 * Soongsil University(崇实大学) Chung-Ang University(中央大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.LG

AI总结 本文提出LIBERO-Para基准,通过独立变化动作表达和物体参考,分析语言泛化能力。研究发现,不同规模的VLA模型在同义词替换下性能下降22-52个百分点,主要由物体层面的词汇变化导致。提出PRIDE指标量化同义词难度,揭示模型对任务识别的依赖。

Comments 32 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23919 2026-03-31 cs.RO 83%

Goal-VLA: Image-Generative VLMs as Object-Centric World Models Empowering Zero-shot Robot Manipulation

Goal-VLA: 图像生成视觉语言模型作为对象中心世界模型,赋能零样本机器人操作

Haonan Chen, Jingxiang Guo, Bangjun Wang, Tianrui Zhang, Xuchuan Huang, Boren Zheng, Yiwen Hou, Chenrui Tie, Jiajun Deng, Lin Shao

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) The HKU Musketeers Foundation Institute of Data Science, The University of Hong Kong(香港大学数据科学研究院) Yuanpei College, Peking University(北京大学元培学院) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 本文提出Goal-VLA框架,利用图像生成视觉语言模型生成目标状态,通过对象状态表示分离高阶与低阶策略,提升机器人操作的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28233 2026-03-31 cs.CV cs.AI 76%

TwinMixing: A Shuffle-Aware Feature Interaction Model for Multi-Task Segmentation

TwinMixing:一种面向多任务分割的洗牌感知特征交互模型

Minh-Khoi Do, Huy Che, Dinh-Duy Phan, Duc-Khai Lam, Duc-Lung Vu

机构 * University of Information Technology(信息技术大学) Vietnam National University(越南国立大学)

专题命中 VLA模型 :action model(title);分类 cs.CV、cs.AI

AI总结 本文提出TwinMixing模型,通过共享编码器和任务专用解码器实现特征共享与任务专精,结合高效金字塔混合模块和双分支上采样块,在BDD100K数据集上验证了其在 drivable-area 和 lane 分割中的高效准确性能。

Journal ref Results in Engineering 30 (2026) 109982

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27967 2026-03-31 cs.CV 70%

Learning Multi-View Spatial Reasoning from Cross-View Relations

从跨视图关系学习多视图空间推理

Suchae Jeong, Jaehwi Song, Haeone Lee, Hanna Kim, Jian Kim, Dongjun Lee, Dong Kyu Shin, Changyeon Kim, Dongyoon Hahm, Woogyeol Jin, Juheon Choi, Kimin Lee

机构 * KAIST(韩国科学技术院) Config Hanyang University(汉阳大学) Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.CV

AI总结 本文提出Cross-View Relations数据集,通过训练视觉语言模型提升多视图空间推理能力,在MindCube和RoboSpatial基准测试中取得显著提升,并在RoboCasa任务中提高机器人操作成功率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01022 2026-03-31 cs.RO 70%

CycleManip: Enabling Cyclic Task Manipulation via Effective Historical Perception and Understanding

CycleManip: 通过有效的历史感知和理解实现循环任务操控

Yi-Lin Wei, Haoran Liao, Yuhao Lin, Pengyue Wang, Zhizhao Liang, Guiliang Liu, Wei-Shi Zheng

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文提出CycleManip框架,通过端到端模仿方法实现循环任务操控,解决了历史利用不足和缺乏评估基准的问题,实验表明方法在模拟和现实环境中均表现出高成功率和良好的适应性。

Comments Accepted by CVPR2026. Project page: https://isee-laboratory.github.io/CycleManip/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27950 2026-03-31 cs.LG 57%

Scaling Atomistic Protein Binder Design with Generative Pretraining and Test-Time Compute

基于生成预训练和测试时计算的原子级蛋白质结合物设计扩展

Kieran Didi, Zuobai Zhang, Guoqing Zhou, Danny Reidenbach, Zhonglin Cao, Sooyoung Cha, Tomas Geffner, Christian Dallago, Jian Tang, Michael M. Bronstein, Martin Steinegger, Emine Kucukbenli, Arash Vahdat, Karsten Kreis

机构 * NVIDIA(英伟达) University of Oxford(牛津大学) Mila - Québec AI Institute(米拉-魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) HEC Montréal(蒙特利尔高等商学院) CIFAR AI Chair(CIFAR人工智能主席) AITHYRA School of Biological Sciences, Seoul National University(首尔大学生物科学学院) Interdisciplinary Program in Bioinformatics, Seoul National University(首尔大学生物信息学跨学科项目) Institute of Molecular Biology and Genetics, Seoul National University(首尔大学分子生物学与遗传学研究所) Artificial Intelligence Institute, Seoul National University(首尔大学人工智能研究所)

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 本文提出Proteina-Complexa方法,结合生成模型与结构预测,实现高精度蛋白质结合物设计,优于现有生成和幻觉方法,同时扩展至小分子和酶设计。

Comments ICLR 2026 Oral Presentation. Project page: https://research.nvidia.com/labs/genair/proteina-complexa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27304 2026-03-31 cs.AI cs.MA 57%

EpochX: Building the Infrastructure for an Emergent Agent Civilization

EpochX:构建一个涌现代理文明的基础设施

Huacan Wang, Chaofa Yuan, Xialie Zhuang, Tu Hu, Shuo Zhang, Jun Han, Shi Wei, Daiqiang Li, Jingping Liu, Kunyi Wang, Zihan Yin, Zhenheng Tang, Andy Wang, Henry Peng Zou, Philip S. Yu, Sen Hu, Qizhen Lan, Ronghao Chen

机构 * QuantaAlpha

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 EpochX通过引入信用原生市场基础设施,重构代理AI为组织设计问题,实现可验证工作留下的持久可重用资产,支持可持续的人机协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27103 2026-03-31 cs.CV 57%

LLM Enhanced Action Recognition via Hierarchical Global-Local Skeleton-Language Model

通过分层全局-局部骨架-语言模型增强动作识别

Ruosi Wang, Fangwei Zuo, Lei Li, Zhaoqiang Xia

机构 * Northwestern Polytechnical University(西北工业大学) Shandong University of Finance and Economics(山东财经大学)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 本文提出HocSLM模型,通过分层全局-局部网络和大视觉-语言模型融合骨架与文本信息,提升动作识别的语义表达和跨模态理解能力,实验表明在三个主流数据集上达到最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28044 2026-03-31 astro-ph.GA 50%

A Wide and Deep Exploration of Radio-detected Active Galactic Nuclei with Subaru HSC (WERGS). XIII. High-Redshift Radio Quasar candidates beyond Ultra-Steep Spectrum Selection: Dropout selection from HSC--VLASS over $\sim$1200 deg$^2$

利用 Subaru HSC 进行宽深探索的射电检测活动星系核(WERGS)。XIII. 超过超陡谱选择的高红移射电类星体候选者:来自 HSC--VLASS 的断续选择(超过 ~1200 平方度)

Youwen Kong, Kohei Ichikawa, Hisakazu Uchiyama, Yuxing Zhong, Xiaoyang Chen, Kotaro Kohno, Tohru Nagao, Kianhong Lee, Bovornpratch Vijarnwannaluk, Yoshiki Matsuoka, Yoshiki Toba, Itsna Khoirul Fitriana, Sakiko Obuchi, Yuta Ishikawa, Victor Kadri

专题命中 VLA模型 :VLA(abstract)

AI总结 本研究利用Subaru HSC与VLASS数据,发现高红移射电类星体候选者,揭示传统超陡谱选择方法遗漏大量源,通过SED拟合显示AGN在典型光度下聚类,并发现样本在再电离时期可能消失。

Comments 24 pages, 17 figures, submitted to ApJS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27097 2026-03-31 astro-ph.GA 50%

A MeerKAT view of the Neutral Atomic Gas in Stephan's Quintet

梅尔凯特望远镜对史蒂芬五重星系中中性原子气体的观测

K. Rajpurohit, E. O'Sullivan, G. Schellenberger, J. M. Vrtilek, L. P. David, S. Giacintucci, P. N. Appleton, C. K. Xu, C. Cheng, T. Deb

专题命中 VLA模型 :VLA(abstract)

AI总结 本文利用梅尔凯特望远镜的21厘米谱线观测,揭示了史蒂芬五重星系中中性氢气体的分布和运动学特征,发现新的HI成分并探讨了气体起源。

Comments 27 pages, 16 figures, Accepted for publication in ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26733 2026-03-31 cs.CR 50%

Constraint Migration: A Formal Theory of Throughput in AI Cybersecurity Pipelines

约束迁移:AI网络安全流水线中吞吐量的正式理论

Surasak Phetmanee

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出了一种有限串行流水线系统中吞吐量的正式理论,考虑阶段乘法容量扰动。通过五个定理和一个命题,分析了瓶颈和吞吐量变化的条件,以及攻击者防御者流水线的吞吐量比影响。

详情

展开后加载摘要…

URL PDF HTML 收藏