arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-03-26 至 2026-03-26 共收录 15 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 12 篇

2511.01718 2026-03-26 cs.RO cs.CV 91%

Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process

统一扩散VLA:通过联合离散去噪扩散过程实现视觉-语言-动作模型

Jiayi Chen, Wenxuan Song, Pengxiang Ding, Ziyang Zhou, Han Zhao, Feilong Tang, Donglin Wang, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Westlake University(西交大学) Zhejiang University(浙江大学) Monash University(墨尔本大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 本文提出统一扩散VLA模型,通过联合离散去噪扩散过程实现视觉语言动作的协同生成与执行,提升多模态任务的效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24393 2026-03-26 cs.RO 91%

3D-Mix for VLA: A Plug-and-Play Module for Integrating VGGT-based 3D Information into Vision-Language-Action Models

3D-Mix用于VLA:一种用于将基于VGGT的3D信息整合到视觉-语言-动作模型中的即插即用模块

Bin Yu, Shijie Lian, Xiaopeng Lin, Zhaolong Shen, Yuliang Wei, Haishan Liu, Changti Wu, Hang Yuan, Bailing Wang, Cong Huang, Kai Chen

机构 * HIT(哈尔滨工业大学) ZGCA(中钢集团自动化研究院) ZGCI(中钢集团信息研究院) HUST(华中科技大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ECNU(华东师范大学) DeepCybo

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO

AI总结 本文提出3D-Mix模块,通过语义条件门控融合机制提升视觉-语言-动作模型的3D感知能力,在标准化基准测试中实现最佳性能。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12684 2026-03-26 cs.RO cs.LG 88%

Xiaomi-Robotics-0: An Open-Sourced Vision-Language-Action Model with Real-Time Execution

Xiaomi-Robotics-0:一个具有实时执行能力的开源视觉-语言-动作模型

Rui Cai, Jun Guo, Xinze He, Piaopiao Jin, Jie Li, Bingxuan Lin, Futeng Liu, Wei Liu, Fei Ma, Kun Ma, Feng Qiu, Heng Qu, Yifei Su, Qiao Sun, Dong Wang, Donghao Wang, Yunhong Wang, Rujie Wu, Diyun Xiang, Yu Yang, Hangjun Ye, Yuan Zhang, Quanyun Zhou

机构 * Xiaomi Robotics(小米机器人)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.LG

AI总结 本文提出Xiaomi-Robotics-0,通过精心设计的训练配方和部署策略,实现了高效且流畅的实时执行。模型在大规模跨体机器人轨迹和视觉语言数据上预训练,支持广泛的动作生成能力,并在真实机器人任务中表现出色。

Comments Project page: https://xiaomi-robotics-0.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22201 2026-03-26 cs.RO 88%

ACG: Action Coherence Guidance for Flow-based Vision-Language-Action models

ACG:基于流的视觉-语言-动作模型中的动作一致性指导

Minho Park, Kinam Kim, Junha Hyung, Hyojin Jang, Hoiyeong Jin, Jooyeol Yun, Hojoon Lee, Jaegul Choo

机构 * DAVIAN-Robotics, KAIST AI(DAVIAN机器人实验室,韩国科学技术院人工智能研究所)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 本文提出ACG算法,通过测试时指导提升视觉-语言-动作模型的动作一致性,从而在多种操作任务中提高成功率。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24584 2026-03-26 cs.CV cs.RO 87%

TAG: Target-Agnostic Guidance for Stable Object-Centric Inference in Vision-Language-Action Models

目标无关引导:用于视觉-语言-动作模型中稳定对象中心推断的指导

Jiaying Zhou, Zhihao Zhan, Ruifeng Zhai, Qinhan Lyu, Hao Liu, Keze Wang, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Lab of Big Data Analysis & Processing(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室)

专题命中 VLA模型 :vision-language-action(title);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文提出TAG目标无关引导,通过对比原始观察和物体擦除观察下的策略预测差异,减少干扰和外观偏差,提升视觉-语言-动作模型在复杂场景中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21542 2026-03-26 cs.RO cs.AI cs.CV cs.LG 85%

E0: Enhancing Generalization and Fine-Grained Control in VLA Models via Tweedie Discrete Diffusion

E0: 通过 Tweedie 离散扩散增强 VLA 模型的泛化能力与细粒度控制

Zhihao Zhan, Jiaying Zhou, Likui Zhang, Qinhan Lv, Hao Liu, Jusheng Zhang, Weizheng Li, Ziliang Chen, Tianshui Chen, Ruifeng Zhai, Keze Wang, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室) Guangdong University of Technology(广东工业大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出 E0 框架,通过离散扩散方法提升 VLA 模型在多任务和多视角下的泛化能力,并实现精细可控的动作生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12665 2026-03-26 cs.RO 83%

TacVLA: Contact-Aware Tactile Fusion for Robust Vision-Language-Action Manipulation

TacVLA: 基于接触感知的触觉融合用于鲁棒的视觉-语言-动作操控

Kaidi Zhang, Heng Zhang, Zhengtong Xu, Zhiyuan Zhang, Md Rakibul Islam Prince, Xiang Li, Xiaojing Han, Yuhao Zhou, Arash Ajoudani, Yu She

机构 * Human-Robot Interfaces and Interaction Lab, Istituto Italiano di Tecnologia(人机交互实验室,意大利理工学院) Ph.D. program of national interest in Robotics and Intelligent Machines (DRIM) and Università di Genova(机器人与智能机器国家级博士项目(DRIM)和热那亚大学) Edwardson School of Industrial Engineering, Purdue University(工业工程学院,普渡大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO

AI总结 TacVLA通过引入触觉模态提升视觉-语言-动作操控的鲁棒性,采用接触感知门控机制实现多模态融合,实验显示在拆解、箱内拾取和视觉遮挡场景中性能提升显著。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24581 2026-03-26 cs.CV cs.RO 76%

Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving

潜在世界动作建模:端到端自动驾驶的潜在世界建模

Linbo Wang, Yupeng Zheng, Qiang Chen, Shiwei Li, Yichen Zhang, Zebin Xing, Qichao Zhang, Xiang Li, Deheng Qian, Pengxuan Yang, Yihang Dong, Ce Hao, Xiaoqing Ye, Junyu han, Yifeng Pan, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Chongqing Chang’an Technology Co., Ltd(重庆长安科技有限公司) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) College of AI, Tsinghua University(清华大学人工智能学院) Zhongguancun Academy(中关村学院)

专题命中 VLA模型 :action model(title);分类 cs.RO、cs.CV

AI总结 本文提出Latent-WAM框架,通过空间感知和动态感知的潜在世界表示实现高效端到端自动驾驶,实验显示在NAVSIM v2和HUGSIM上取得新的SOTA结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24454 2026-03-26 cs.CV 57%

Unleashing Vision-Language Semantics for Deepfake Video Detection

释放视觉-语言语义以进行深度伪造视频检测

Jiawen Zhu, Yunqi Miao, Xueyi Zhang, Jiankang Deng, Guansong Pang

机构 * Singapore Management University(新加坡管理学院) The University of Warwick(沃里克大学) Nanyang Technological University(南洋理工大学) Imperial College London(伦敦帝国理工学院)

专题命中 VLA模型 :VLA(abstract);分类 cs.CV

AI总结 本文提出VLAForge框架,通过ForgePerceiver增强视觉感知并引入身份感知VLA评分,利用跨模态语义提升深度伪造检测的判别能力。

Comments 14 pages, 7 figures, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11453 2026-03-26 astro-ph.CO gr-qc 50%

Quadratic energy-momentum squared gravity: constraints from big bang nucleosynthesis

二次能量动量平方引力:来自大爆炸核合成的约束

Ozgur Akarsu, Mariam Bouhmadi-López, Nihan Katirci, N. Merve Uzun

专题命中 VLA模型 :action model(abstract)

AI总结 本文在二次能量动量平方引力框架下扩展标准宇宙模型,研究能量动量场与伴场的非最小相互作用对大爆炸核合成动态的影响,通过分析揭示参数α的严格宇宙学约束。

Comments 16 pages, 2 figures, 1 table; matches the version published in Physics of the Dark Universe

Journal ref Phys. Dark Univ. 45 (2024) 101505

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23587 2026-03-26 astro-ph.CO astro-ph.GA 50%

Investigating the radio emission in the Perseus cluster with LOFAR sub-80 MHz LBA

利用LOFAR子80MHz LBA研究Perseus团的无线电发射

C. Groeneveld, R. J. van Weeren, M. -L. Gendron-Marsolais, E. Osinga, A. Botteon, F. de Gasperin, M. Cianfaglione, G. di Gennaro, G. Brunetti, R. Cassano

专题命中 VLA模型 :VLA(abstract)

AI总结 本文通过LOFAR LBA观测Perseus团低频无线电发射,发现迷你射电晕和巨射电晕,并测量其频谱指数,揭示了射电晕与X射线'幽灵空洞'的关联。

Comments Accepted for publication in A&A. 16 pages, 2 tables, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21334 2026-03-26 cs.HC 50%

Software as Content: Dynamic Applications as the Human-Agent Interaction Layer

软件作为内容:动态应用作为人-智能体交互层

Mulong Xie, Yang Xie

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出软件作为内容(SaC)范式,通过动态生成的智能体应用作为人-智能体交互媒介,解决传统自然语言接口在结构信息处理和复杂任务中的局限性,展示其在选择、探索和执行任务中的可行性。

Comments 37 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 1 篇

2601.16212 2026-03-26 cs.RO 57%

Point Bridge: 3D Representations for Cross Domain Policy Learning

点桥:跨领域策略学习的3D表示

Siddhant Haldar, Lars Johannsmeier, Lerrel Pinto, Abhishek Gupta, Dieter Fox, Yashraj Narang, Ajay Mandlekar

机构 * NVIDIA New York University(纽约大学) University of Washington(华盛顿大学)

专题命中 动作表示与策略 :robot foundation model(abstract);分类 cs.RO

AI总结 点桥通过统一的点表示实现跨领域策略学习,利用视觉语言模型提取点表示,结合Transformer策略学习,无需显式视觉或物体对齐,提升仿真到现实的零样本迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 数据集与评测 2 篇

2603.24440 2026-03-26 cs.LG cs.AI cs.CV 67%

CUA-Suite: Massive Human-annotated Video Demonstrations for Computer-Use Agents

CUA-Suite:大规模人工标注的视频演示用于计算机使用代理

Xiangru Jian, Shravan Nayak, Kevin Qinghong Lin, Aarash Feizi, Kaixin Li, Patrice Bechard, Spandana Gella, Sai Rajeswar

机构 * ServiceNow University of Waterloo(多伦多大学) Mila Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学)

专题命中 数据集与评测 :action model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 CUA-Suite通过提供连续高质量视频演示和密集标注,解决计算机使用代理训练中视频数据不足的问题,包含约55小时的专家视频和600万帧数据,支持多模态研究。

Comments Project Page: https://cua-suite.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13119 2026-03-26 cs.CV cs.AI 62%

Geometry-Guided Camera Motion Understanding in VideoLLMs

基于几何的视频LLMs中相机运动理解

Haoan Feng, Sri Harsha Musunuri, Guan-Ming Su

机构 * University of Maryland, College Park(马里兰大学College Park分校) Dolby Laboratories Inc.(杜比实验室)

专题命中 数据集与评测 :VLA(abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过基准测试、诊断和注入框架,解决视频LLMs中相机运动表示不足的问题,通过CameraMotionDataset和CameraMotionVQA基准,提升模型对相机运动的识别能力。

Comments 10 pages, 7 figures, supplementary included CVPR2026 PVUW

详情

展开后加载摘要…

URL PDF HTML 收藏