arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9132 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9132 篇

2604.16067 2026-04-20 cs.LG cs.CV 76%

AEGIS: Anchor-Enforced Gradient Isolation for Knowledge-Preserving Vision-Language-Action Fine-Tuning

AEGIS:锚定强化梯度隔离用于知识保留的视觉-语言-动作微调

Guransh Singh

机构 * Independent Researcher(独立研究者)

专题命中 VLA模型 :vision-language-action(title);分类 cs.CV、cs.LG

AI总结 本文提出AEGIS方法,通过层间梯度投影保留预训练的视觉问答能力,避免因梯度不对称导致的性能下降,无需额外数据或缓冲区。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28233 2026-03-31 cs.CV cs.AI 76%

TwinMixing: A Shuffle-Aware Feature Interaction Model for Multi-Task Segmentation

TwinMixing:一种面向多任务分割的洗牌感知特征交互模型

Minh-Khoi Do, Huy Che, Dinh-Duy Phan, Duc-Khai Lam, Duc-Lung Vu

机构 * University of Information Technology(信息技术大学) Vietnam National University(越南国立大学)

专题命中 VLA模型 :action model(title);分类 cs.CV、cs.AI

AI总结 本文提出TwinMixing模型,通过共享编码器和任务专用解码器实现特征共享与任务专精,结合高效金字塔混合模块和双分支上采样块,在BDD100K数据集上验证了其在 drivable-area 和 lane 分割中的高效准确性能。

Journal ref Results in Engineering 30 (2026) 109982

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24581 2026-03-26 cs.CV cs.RO 76%

Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving

潜在世界动作建模:端到端自动驾驶的潜在世界建模

Linbo Wang, Yupeng Zheng, Qiang Chen, Shiwei Li, Yichen Zhang, Zebin Xing, Qichao Zhang, Xiang Li, Deheng Qian, Pengxuan Yang, Yihang Dong, Ce Hao, Xiaoqing Ye, Junyu han, Yifeng Pan, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Chongqing Chang’an Technology Co., Ltd(重庆长安科技有限公司) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) College of AI, Tsinghua University(清华大学人工智能学院) Zhongguancun Academy(中关村学院)

专题命中 VLA模型 :action model(title);分类 cs.RO、cs.CV

AI总结 本文提出Latent-WAM框架,通过空间感知和动态感知的潜在世界表示实现高效端到端自动驾驶,实验显示在NAVSIM v2和HUGSIM上取得新的SOTA结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08333 2026-03-03 cs.RO cs.AI 76%

Robust Finetuning of Vision-Language-Action Robot Policies via Parameter Merging

通过参数合并实现视觉-语言-动作机器人策略的鲁棒微调

Yajat Yadav, Zhiyuan Zhou, Andrew Wagenmaker, Karl Pertsch, Sergey Levine

机构 * UC Berkeley(伯克利大学)

专题命中 VLA模型 :vision-language-action(title);分类 cs.RO、cs.AI

AI总结 通过参数合并实现视觉-语言-动作机器人策略的鲁棒微调,使策略在保持泛化能力的同时有效学习新技能。

Journal ref The Fourteenth International Conference on Learning Representations 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13476 2026-02-17 cs.RO cs.LG 76%

AsyncVLA: An Asynchronous VLA for Fast and Robust Navigation on the Edge

AsyncVLA: 一种异步VLA用于边缘设备上的快速稳健导航

Noriaki Hirose, Catherine Glossop, Dhruv Shah, Sergey Levine

机构 * University of California, Berkeley(加州大学伯克利分校) Toyota Motor North America(丰田汽车北美公司) Princeton University(普林斯顿大学)

专题命中 VLA模型 :VLA(title);分类 cs.RO、cs.LG

AI总结 AsyncVLA通过异步框架结合远程大模型与本地轻量级模块,实现边缘设备上的高效稳健导航,成功率达40%。

Comments 13 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06214 2026-01-13 cs.LG cs.AI q-bio.QM 76%

Dynamics-inspired Structure Hallucination for Protein-protein Interaction Modeling

受动力学启发的结构幻想用于蛋白质-蛋白质相互作用建模

Fang Wu, Stan Z. Li

机构 * Department of Computer Science(计算机科学系) Stanford University(斯坦福大学) School of Engineering(工程学院) Westlake University(西湖大学)

专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG

AI总结 本文提出Refine-PPI框架,通过结构细化模块和概率密度云网络,解决突变蛋白质结构获取困难和动态几何不确定性建模问题。

Journal ref Transactions on Machine Learning Research 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20900 2025-11-18 cs.RO cs.AI 76%

DexGraspVLA: A Vision-Language-Action Framework Towards General Dexterous Grasping

Yifan Zhong, Xuchuan Huang, Ruochong Li, Ceyao Zhang, Zhang Chen, Tianrui Guan, Fanlian Zeng, Ka Num Lui, Yuyao Ye, Yitao Liang, Yaodong Yang, Yuanpei Chen

专题命中 VLA模型 :vision-language-action(title);分类 cs.RO、cs.AI

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06828 2025-10-09 cs.LG cs.AI 76%

Recurrence-Complete Frame-based Action Models

Michael Keiblinger

机构 * Prime Intellect

专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11093 2025-08-18 cs.RO cs.AI cs.HC 76%

Utilizing Vision-Language Models as Action Models for Intent Recognition and Assistance

Cesar Alan Contreras, Manolis Chiou, Alireza Rastegarpanah, Michal Szulik, Rustam Stolkin

机构 * University of Birmingham(伯明翰大学) Queen Mary University of London(伦敦大学女王学院) Aston University(阿斯顿大学) United Kingdom National Nuclear Laboratory Ltd.(英国国家核实验室有限公司)

专题命中 VLA模型 :action model(title);分类 cs.RO、cs.AI

Comments Accepted at Human-Centered Robot Autonomy for Human-Robot Teams (HuRoboT) at IEEE RO-MAN 2025, Eindhoven, the Netherlands

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15029 2025-03-20 cs.RO cs.CV 76%

DRoPE: Directional Rotary Position Embedding for Efficient Agent Interaction Modeling

Jianbo Zhao, Taiyu Ban, Zhihao Liu, Hangning Zhou, Xiyang Wang, Qibin Zhou, Hailong Qin, Mu Yang, Lei Liu, Bin Li

专题命中 VLA模型 :action model(title);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.11866 2025-02-24 cs.LG cs.AI cs.IR 76%

GraphFM: Graph Factorization Machines for Feature Interaction Modeling

Shu Wu, Zekun Li, Yunyue Su, Zeyu Cui, Xiaoyu Zhang, Liang Wang

专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG

Comments The code and data are available at https://github.com/CRIPAC-DIG/GraphCTR

Journal ref Mach. Intell. Res. (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17622 2024-09-27 cs.LG cs.AI 76%

Neural P$^3$M: A Long-Range Interaction Modeling Enhancer for Geometric GNNs

Yusong Wang, Chaoran Cheng, Shaoning Li, Yuxuan Ren, Bin Shao, Ge Liu, Pheng-Ann Heng, Nanning Zheng

专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG

Comments Published as a conference paper at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09685 2024-07-18 cs.LG cs.AI q-bio.QM 76%

Accelerating the inference of string generation-based chemical reaction models for industrial applications

Mikhail Andronov, Natalia Andronova, Michael Wand, Jürgen Schmidhuber, Djork-Arné Clevert

专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.08139 2023-01-20 cs.IR cs.AI cs.LG 76%

DynInt: Dynamic Interaction Modeling for Large-scale Click-Through Rate Prediction

YaChen Yan, Liubo Li

专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG

Comments arXiv admin note: text overlap with arXiv:2301.01089

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.13848 2022-11-01 cs.AI cs.RO 76%

ProspectNet: Weighted Conditional Attention for Future Interaction Modeling in Behavior Prediction

Yutian Pang, Zehua Guo, Binnan Zhuang

专题命中 VLA模型 :action model(title);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.02140 2022-08-04 cs.CL cs.AI cs.LG 76%

KPI-BERT: A Joint Named Entity Recognition and Relation Extraction Model for Financial Reports

Lars Hillebrand, Tobias Deußer, Tim Dilmaghani, Bernd Kliem, Rüdiger Loitz, Christian Bauckhage, Rafet Sifa

专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG

Comments Accepted at ICPR 2022, 8 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.04313 2021-05-11 cs.CV cs.LG 76%

DocReader: Bounding-Box Free Training of a Document Information Extraction Model

Shachar Klaiman, Marius Lehne

专题命中 VLA模型 :action model(title);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.02148 2021-03-26 cs.CV cs.RO 76%

Graph-SIM: A Graph-based Spatiotemporal Interaction Modelling for Pedestrian Action Prediction

Tiffany Yau, Saber Malekmohammadi, Amir Rasouli, Peter Lakner, Mohsen Rohani, Jun Luo

专题命中 VLA模型 :action model(title);分类 cs.RO、cs.CV

Comments 7 pages, 3 figures, 4 tables, accepted at ICRA 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09045 2026-07-13 eess.SY cs.SY 新提交 75%

Can the Cloud Drive? Infrastructure Feasibility of Offloading Autonomous Driving Across 5G and 6G

云能驱动自动驾驶吗?跨5G和6G卸载自动驾驶的基础设施可行性

Pouya Parsa, Kawon Han, Seongjin Choi

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract)

AI总结 探讨云能否驱动自动驾驶,通过耦合通信限制、GPU服务模型等构建分析框架,应用于纽约市,研究发现通信、计算、成本依次起约束作用,延迟决定模型可行性,成本决定是否经济。

Comments 25 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04146 2026-07-07 cs.RO cs.AI cs.CL cs.CR cs.LG 新提交 75%

!Imperio, smolVLA: The Implications of Data Poisoning on Open Source Robotics

!帝国,小型甚大阵:数据投毒对开源机器人技术的影响

Stefan Bühler, Mark Schutera

机构 * Duale Hochschule Baden-Württemberg, Ravensburg(巴登-符腾堡双元制应用技术大学拉文斯堡分校)

专题命中 VLA模型 :vision language action(abstract);action model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究视觉语言动作模型的触发词数据投毒对开源机器人技术的影响,通过在真实任务中对小型甚大阵进行实验,发现少量投毒样本可嵌入后门致机器人失效,攻击具实用性、低成本且隐蔽。

Comments Accepted at KI2026. Repo: https://github.com/StefanBuhler/ImperioVLAPoisoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14801 2026-06-16 cs.LG cs.AI cs.RO 新提交 75%

QPILOTS: Efficient Test-Time Q-Steering for Flow Policies

QPILOTS:面向流策略的高效测试时Q引导

Yifan Ruan, Chenyang Cao, Andreas Burger, Ali Pesaranghader, Kaveh Kamali, Jaehong Kim, Nandita Vijaykumar, Alan Aspuru-Guzik, Igor Gilitschenski, Nicholas Rhinehart

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) LG Electronics(LG电子)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 提出QPILOTS方法,在推理时通过投影去噪中间状态到最终动作估计并计算评论家梯度来引导流匹配和扩散策略,无需修改原策略,在离线到在线RL基准上达到90%平均成功率。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18714 2026-06-16 cs.RO cs.AI cs.LG 版本更新 75%

Explainable deep learning improves human mental models of self-driving cars

可解释深度学习提升人类对自动驾驶汽车的心理模型

Eoin M. Kenny, Akshay Dharmavaram, Sang Uk Lee, Tung Phan-Minh, Shreyas Rajesh, Yunqing Hu, Laura Major, Momchil S. Tomov, Julie A. Shah

机构 * Computer Science & Artificial Intelligence Laboratory (CSAIL), Massachusetts Institute of Technology(计算机科学与人工智能实验室(CSAIL),麻省理工学院) Motional AD Inc.(Motional AD公司) Department of Psychology and Center for Brain Science, Harvard University(心理学系和大脑科学中心,哈佛大学) Department of Aeronautics and Astronautics, Massachusetts Institute of Technology(航空与宇航系,麻省理工学院)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出概念包装网络(CW-Net),在真实自动驾驶车上实现可解释规划,通过因果性概念解释提升驾驶员对车辆行为的预测能力,尤其在意外场景中。

Comments MST & JAS contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05271 2026-06-05 cs.AR 75%

BIDENT: Heterogeneous Operator-level Mapping for Efficient Edge Inference

BIDENT:面向高效边缘推理的异构算子级映射

Hoseok Kim, Arghadip Das, Soumendu Ghosh, Arnab Raha, Vijay Raghunathan

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract)

AI总结 提出BIDENT框架,通过将算子映射到最合适的处理单元,实现边缘异构SoC上的高效推理,支持延迟和能量优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23163 2026-05-26 cs.CL 75%

Fast-dDrive: Efficient Block-Diffusion VLM for Autonomous Driving

Fast-dDrive:面向自动驾驶的高效块扩散视觉语言模型

Kewei Zhang, Jin Wang, Sensen Gao, Chengyue Wu, Yulong Cao, Songyang Han, Boris Ivanovic, Langechuan Liu, Marco Pavone, Song Han, Daquan Zhou, Enze Xie

机构 * Peking University(北京大学) NVIDIA The University of Hong Kong(香港大学) MIT(麻省理工学院)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract)

AI总结 提出Fast-dDrive,一种块扩散视觉语言动作模型,通过语义单元内双向细化与跨单元因果约束,结合结构化令牌冻结、分段感知训练和推测解码,实现高保真轨迹规划与高效推理,在WOD-E2E和nuScenes上达到最优性能,推理速度提升12倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15407 2026-05-26 cs.AI cs.CV cs.LG 75%

IPR-1: Interactive Physical Reasoner

IPR-1:交互式物理推理器

Mingyu Zhang, Lifeng Zhuo, Tianxi Tan, Guocan Xie, Xian Nie, Yan Li, Renjie Zhao, Zizhu He, Ziyu Wang, Jiting Cai, Yong-Lu Li

机构 * CARNEGIE MELLON UNIVERSITY(卡内基梅隆大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 提出IPR模型,通过世界模型滚动评分和强化VLM策略,结合物理中心动作代码PhysCode,在1000+异构游戏基准上实现鲁棒的物理推理,性能超越GPT-5并零样本迁移至未见游戏。

Comments Accepted by CVPR 2026. 13 pages of main text and 20 pages of appendices. Project page: https://mybearyzhang.github.io/ipr-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21971 2026-05-12 cs.RO cs.AI cs.LG 75%

Supervised Mixture-of-Experts for Surgical Grasping and Retraction

监督混合专家架构用于手术抓取与牵开

Lorenzo Mazza, Ariel Rodriguez, Rayan Younis, Martin Lelis, Ortrun Hellig, Chenpan Li, Sebastian Bodenstedt, Martin Wagner, Stefanie Speidel

机构 * Department of Translational Surgical Oncology, NCT/UCC Dresden, Faculty of Medicine and University Hospital Carl Gustav Carus, TUD, Dresden, Germany(translational Surgical Oncology部门,NCT/UCC Dresden,医学院和Carl Gustav Carus大学医院,TUD,德累斯顿,德国) National Center for Tumor Diseases (NCT), NCT/UCC Dresden, a partnership between DKFZ, Faculty of Medicine and University Hospital Carl Gustav Carus, TUD, and HZDR, Dresden, Germany(肿瘤疾病国家中心(NCT),NCT/UCC德累斯顿,DKFZ、医学院和Carl Gustav Carus大学医院、TUD以及HZDR之间的合作,德累斯顿,德国) Faculty of Computer Science, TUD, Dresden, Germany(计算机科学系,TUD,德累斯顿,德国) The Center for Tactile Internet with Human-in-the-Loop (CeTI), TUD, Dresden, Germany(带有Human-in-the-Loop的触觉互联网中心(CeTI),TUD,德累斯顿,德国) Department of Visceral, Thoracic and Vascular Surgery, Faculty of Medicine and University Hospital Carl Gustav Carus, TUD, Dresden, Germany(visceral、胸腔和血管外科部门,医学院和Carl Gustav Carus大学医院,TUD,德累斯顿,德国)

专题命中 VLA模型 :vision language action(abstract);action model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出一种监督混合专家架构,用于结构化手术任务,通过轻量动作解码器政策实现复杂操作,展示了在少样本下优于传统方法的性能。

Comments Accepted at Robotics:Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03037 2026-04-22 cs.RO cs.AI cs.CV 75%

ARM: Advantage Reward Modeling for Long-Horizon Manipulation

ARM:用于长 horizon 操控的优势奖励建模

Yiming Mao, Zixi Yu, Weixin Mao, Yinhao Li, Qirui Hu, Zihan Lan, Minzhao Zhu, Hua Chen

机构 * LimX Dynamics(LimX动力学) Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University(浙江大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出ARM框架,通过三态标签策略提升长 horizon 操控任务的奖励建模,实现高效稳定的数据利用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08548 2026-04-07 cs.RO cs.AI cs.LG 75%

From Seeing to Doing: Bridging Reasoning and Decision for Robotic Manipulation

从感知到行动:弥合推理与决策以实现机器人操作

Yifu Yuan, Haiqin Cui, Yibin Chen, Zibin Dong, Fei Ni, Longxin Kou, Jinyi Liu, Pengyi Li, Yan Zheng, Jianye Hao

机构 * Tianjin University(天津大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出FSD模型,通过空间关系推理生成中间表示,提升机器人操作的泛化能力,在8个基准测试中表现优异,且在零样本任务中实现显著性能提升。

Comments Published as a conference paper at ICLR 2026. Our project homepage: https://embodied-fsd.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01371 2026-04-03 cs.CV cs.AI cs.RO eess.IV 75%

AffordTissue: Dense Affordance Prediction for Tool-Action Specific Tissue Interaction

AffordTissue: 密集的工具-动作特定组织交互 affordance 预测

Aiza Maksutova, Lalithkumar Seenivasan, Hao Ding, Jiru Xu, Chenhao Yu, Chenyan Jing, Yiqing Shen, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出AffordTissue框架,通过多模态方法预测手术中工具-动作特定的组织affordance区域,改进了视觉语言模型在密集手术affordance预测中的表现,为安全手术自动化提供空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16086 2026-03-18 cs.RO cs.AI cs.CV cs.SD 75%

Towards the Vision-Sound-Language-Action Paradigm: The HEAR Framework for Sound-Centric Manipulation

迈向视觉-声音-语言-动作范式:用于以声音为中心的操作的HEAR框架

Chang Nie, Tianchen Deng, Guangming Wang, Zhe Liu, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University and Shanghai Key Laboratory of Navigation and Location Based Services(自动化与智能感知学院,上海交通大学,导航与基于位置的服务重点实验室) Department of Engineering, Cambridge University(工程系,剑桥大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出HEAR框架,通过整合声音、视觉、语言和本体感知,解决实时声音中心操作中的关键声音遗漏问题,强调因果持续性和显式时间学习的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏