arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9800 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9132 篇

2011.13277 2020-11-30 cs.AI 79%

AMLSI: A Novel Accurate Action Model Learning Algorithm

Maxence Grand, Humbert Fiorino, Damien Pellier

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

Comments 8 pages

Journal ref Proceedings of the International Workshop on Knowledge Engineering for Planning and Scheduling (KEPS), ICAPS, Oct 2020, Nancy, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.08947 2020-09-21 cs.IR cs.LG stat.ML 79%

Content Based Player and Game Interaction Model for Game Recommendation in the Cold Start setting

Markus Viljanen, Jukka Vahlo, Aki Koponen, Tapio Pahikkala

专题命中 VLA模型 :action model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.05991 2020-09-15 cs.AI 79%

GIKT: A Graph-based Interaction Model for Knowledge Tracing

Yang Yang, Jian Shen, Yanru Qu, Yunfei Liu, Kerong Wang, Yaoming Zhu, Weinan Zhang, Yong Yu

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

Comments 16 pages,2 figures, ECMLPKDD2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.15763 2020-06-30 cs.LG stat.ML 79%

Structural Landmarking and Interaction Modelling: on Resolution Dilemmas in Graph Classification

Kai Zhang, Yaokang Zhu, Jun Wang, Jie Zhang, Hongyuan Zha

专题命中 VLA模型 :action model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.02113 2020-05-06 cs.CV 79%

Adaptive Interaction Modeling via Graph Operations Search

Haoxin Li, Wei-Shi Zheng, Yu Tao, Haifeng Hu, Jian-Huang Lai

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.09800 2019-09-10 cs.AI 79%

Learning Action Models from Disordered and Noisy Plan Traces

Hankz Hankui Zhuo, Jing Peng, Subbarao Kambhampati

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.10802 2019-09-05 cs.LG cs.CL stat.ML 79%

Hyperbolic Interaction Model For Hierarchical Multi-Label Classification

Boli Chen, Xin Huang, Lin Xiao, Zixin Cai, Liping Jing

专题命中 VLA模型 :action model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.01153 2019-03-05 cs.AI 79%

Learning STRIPS Action Models with Classical Planning

Diego Aineto, Sergio Jiménez, Eva Onaindia

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

Comments 8+1 pages, 4 figures, 6 tables

Journal ref Twenty-Eighth International Conference on Automated Planning and Scheduling (ICAPS 2018), pp. 399-407, Year 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.09386 2018-11-26 cs.CL cs.LG 79%

Explicit Interaction Model towards Text Classification

Cunxiao Du, Zhaozheng Chin, Fuli Feng, Lei Zhu, Tian Gan, Liqiang Nie

专题命中 VLA模型 :action model(title,abstract);分类 cs.LG

Comments 8 pages

Journal ref AAAI 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.09245 2018-11-02 cs.AI 79%

A Review on Learning Planning Action Models for Socio-Communicative HRI

Ankuj Arora, Humbert Fiorino, Damien Pellier, Sylvie Pesty

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

Comments Workshop on Affect, Artifcial Compagnon and Interaction, 2016

Journal ref Workshop on Affect, Artifcial Compagnon and Interaction, 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
1712.00556 2017-12-05 stat.ML cs.LG 79%

A global feature extraction model for the effective computer aided diagnosis of mild cognitive impairment using structural MRI images

Chen Fang, Panuwat Janwattanapong, Chunfei Li, Malek Adjouadi

专题命中 VLA模型 :action model(title,abstract);分类 cs.LG

Comments 4 pages, NIPS ML4H 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.08961 2017-05-26 cs.AI 79%

Efficient, Safe, and Probably Approximately Complete Learning of Action Models

Roni Stern, Brendan Juba

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

Journal ref International Joint Conference on Artificial Intelligence (IJCAI) 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1506.05573 2015-06-19 cs.HC cs.AI 79%

Emergence of synchrony in an Adaptive Interaction Model

Kevin Sanlaville, Gérard Assayag, Frédéric Bevilacqua, Catherine Pelachaud

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

Comments Intelligent Virtual Agents 2015 Doctoral Consortium, Aug 2015, Delft, Netherlands. IVA Doctoral Consortium, 2015

详情

展开后加载摘要…

URL PDF HTML 收藏
1505.02137 2015-05-29 cs.CY cs.LG 79%

Human Social Interaction Modeling Using Temporal Deep Networks

Mohamed R. Amer, Behjat Siddiquie, Amir Tamrakar, David A. Salter, Brian Lande, Darius Mehri, Ajay Divakaran

专题命中 VLA模型 :action model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1401.3437 2014-01-16 cs.AI 79%

Learning Partially Observable Deterministic Action Models

Eyal Amir, Allen Chang

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

Journal ref Journal Of Artificial Intelligence Research, Volume 33, pages 349-402, 2008

详情

展开后加载摘要…

URL PDF HTML 收藏
1109.6030 2011-09-29 cs.AI 79%

Probabilistic Hybrid Action Models for Predicting Concurrent Percept-driven Robot Behavior

M. Beetz, H. Grosskreutz

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

Journal ref Journal Of Artificial Intelligence Research, Volume 24, pages 799-849, 2005

详情

展开后加载摘要…

URL PDF HTML 收藏
0905.1174 2015-05-13 astro-ph.GA 79%

The RMS Survey: 6 cm continuum VLA observations towards candidate massive YSOs in the northern hemisphere

J. S. Urquhart, M. G. Hoare, C. R. Purcell, S. L. Lumsden, R. D. Oudmaijer, T. J. T. Moore, A. L. Busfield, J. C. Mottram, B. Davies

专题命中 VLA模型 :VLA(title,abstract)

Comments Accepted for publication in Astronomy and Astrophysics. 15 pages, 9 figures and 5 tables. Full versions of Tables 3, 4 and 5 and Figs. 2, 4 and 7 will only be available via CDS or the RMS website at http:/www.ast.leeds.ac.uk/cgi-bin/RMS/RMS_VLA_IMAGES.cgi

详情

展开后加载摘要…

URL PDF HTML 收藏
1401.1875 2014-06-19 astro-ph.GA astro-ph.CO 79%

A Wideband Polarization Survey of the Extragalactic Sky at 2-4 GHz: A Science White Paper for the VLA Sky Survey

Sui Ann Mao, Julie Banfield, Bryan Gaensler, Lawrence Rudnick, Jeroen Stil, Cormac Purcell, Rainer Beck, Jamie Farnes, Shane O'Sullivan, Dominic Schnitzeler, Tony Willis, Xiaohui Sun, Ettore Carretti, Klaus Dolag, Dmitry Sokoloff, Roland Kothes, Maik Wolleben, George Heald, Joern Geisbuesch, Tim Robishaw, Jose Afonso, Antonio Mario Magalhães, Britt Lundgren, Marijke Haverkorn, Niels Oppermann, Russ Taylor

专题命中 VLA模型 :VLA(title,abstract)

Comments submitted in response to NRAO's call for Community White Papers for a potential VLA Sky Survey

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15680 2026-08-18 cs.RO cs.AI 新提交 79%

Robo-Dopamine 2.0: History-Conditioned and OOD-Aware Process Reward Modeling for Robotic Manipulation

Robo-Dopamine 2.0:面向机器人操纵的历史条件感知与分布外感知过程奖励建模

Yijie Xu, Haopeng Jin, Run Zhou, Shengbang Liu, Sixiang Chen, Hongyang Cheng, Sicheng Hu, Peterson Co, Jinwen Luo, Huajie Tan, Shanghang Zhang

机构 * Peterson Co(彼得森公司)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文提出Robo-Dopamine 2.0,一种历史条件与分布外感知的过程奖励模型,结合带符号跳课程训练,提升了机器人操纵的视觉顺序一致性与分布外鲁棒性,在下游强化学习中取得优异的真实世界任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09467 2026-08-11 cs.CV cs.AI 新提交 79%

RecoverFly: A Failure-Aware Reinforcement Learning Post-Training Framework for Aerial Vision-Language Navigation

RecoverFly:面向空中视觉语言导航的故障感知强化学习后训练框架

Boxiong Wang, Hui Kang, Geng Sun, Jiahui Li, Chao Yu, Daxin Tian

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.CV、cs.AI

AI总结 RecoverFly是面向端到端无人机视觉-语言-动作策略的故障感知强化学习后训练框架,在TravelUAV基准上实现了优于AerialVLA的性能,提升了导航成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24744 2026-08-11 cs.RO cs.CV 版本更新 79%

Data Pyramid for Embodied Manipulation: A Survey

用于具身操纵的数据金字塔

Yifan Ye, Yankai Fu, Yaoxu Lv, Bohan Hou, Jun Cen, Lingdong Kong, Duo Zheng, Tianxing Chen, Jiaming Liu, Ziang Cao, Yunfan Lou, Wei Chow, Xian Sun, Yingshuo Wang, Kuangzhi Ge, Xiaowei Chi, Xidong Zhang, Zhibo Pang, Yiwu Zhong, Sirui Han, Zhihe Lu, Weihao Yuan, Qifeng Chen, Michael Yu Wang, Yao Mu, Ziwei Liu, Jianfei Yang, Ping Luo, Shanghang Zhang

机构 * PKU(北京大学) NTU(南洋理工大学) HKUST(香港科技大学) NUS(新加坡国立大学) CUHK(香港中文大学) HKU(香港大学) Duke(杜克大学) UCB(加州大学伯克利分校) GBU(未提及具体中文名的机构) NJU(南京大学) SJTU(上海交通大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);embodied foundation model(abstract);分类 cs.RO、cs.CV

AI总结 研究围绕具身操纵数据生态系统展开,构建跨越五个互补数据源的“数据金字塔”,通过数据配方分析具身基础模型,将数据组成与多种能力联系起来,并讨论了六个开放挑战,为下一代具身系统设计奠定基础。

Comments Awesome Embodied Data Pyramid; Project Page at https://jasper-aaa.github.io/embodied-data-pyramid/ GitHub Repo at https://github.com/worldbench/awesome-embodied-data-pyramid

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01851 2026-08-04 cs.RO cs.AI 新提交 79%

Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills

权重还是技能?机器人学习技术综述:从动作预测权重到自主编写技能的机器人

Gaytri Jena, Kapil Wanaskar, Vinija Jain, Aman Chadha, Vasu Sharma, Amitava Das

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本综述围绕机器人学习的“权重vs技能”轴,梳理两类技术的分类、自我提升机制与开放问题,考察77个代表性系统,为机器人学习领域提供分析框架。

Comments 40 pages, 11 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01402 2026-08-04 cs.RO cs.AI 新提交 79%

Demystifying When and Why VLAs Fail in Contact-Rich Tasks and How to Fix Them

揭秘视觉-语言-动作模型在接触丰富任务中的失效时机、原因及修复方法

Carlota Parés-Morlans, Nils Kuhn, Isabel Liu, Alberta Longhini, Jeannette Bohg

机构 * Stanford University(斯坦福大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract_cn);action model(abstract);分类 cs.RO、cs.AI

AI总结 该研究揭示视觉-语言-动作模型在接触丰富操纵任务中的两种失效模式,提出针对性机制整合而成的FACT模型,在5项任务上平均成功率达66%,优于现有基线。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00315 2026-08-04 cs.RO cs.LG cs.SY eess.SY 新提交 79%

Towards General Language-Conditioned Latent Safety Filters

面向通用语言条件的潜在安全过滤器

Ihab Tabbara, Yuxuan Yang, Hussein Sibai

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.LG

AI总结 该研究提出语言条件安全过滤器,结合哈密顿-雅可比安全演员与评论家,在多种视觉机器人任务中减少约束违规并实现部分未见过约束实例的迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10719 2026-08-04 cs.RO cs.CV 版本更新 79%

From Representational Complementarity to Dual Systems: Synergizing VLM and Vision-Only Backbones for End-to-End Driving

从表征互补性到双系统:协同VLM和纯视觉骨干网络用于端到端驾驶

Sining Ang, Yuguang Yang, Chenxu Dang, Canyu Chen, Cheng Chi, Haiyan Liu, Xuanyao Mao, Jason Bao, Xuliang, Bingchuan Sun, Yan Wang

机构 * Department of Automation, University of Science and Technology of China(中国科学技术大学自动化系) School of Electronic Information Engineering, Beihang University(北京航空航天大学电子信息工程学院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) National Superior College for Engineers, Beihang University(北京航空航天大学国家级工程师学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Lenovo Group Limited(联想集团有限公司) Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 本文通过协同VLM和纯视觉骨干网络,提出HybridDriveVLA和DualDriveVLA,提升端到端驾驶的PDMS性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29172 2026-08-03 cs.RO cs.AI 新提交 79%

CLIFT: Turning Gemini Robotics On-Device into Humanoid Specialists via Non-Invasive Closed-Loop Iterative Fine-Tuning

CLIFT:通过非侵入式闭环迭代微调将Gemini机器人端侧模型转化为人形机器人专家

Yuxin Chen, Hari Srikanth, Nathan Jew, Menglin Wu, Pengcheng Wang, Junli Ren, Masayoshi Tomizuka, Peng Xu, Jinyu Xie, Thomas Tian

机构 * University of California, Berkeley(加州大学伯克利分校) Google DeepMind(谷歌DeepMind) NVIDIA Research(英伟达研究院)

专题命中 VLA模型 :VLA(abstract,abstract_cn);robot foundation model(abstract);分类 cs.RO、cs.AI

AI总结 本研究针对闭源机器人模型的托管式SFT API范式,提出CLIFT方法,在不访问模型内部机制的情况下,将Gemini机器人端侧模型经两次飞轮循环提升至接近完美的敏捷接触任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24125 2026-07-28 cs.RO cs.AI 版本更新 79%

Unified Embodied VLM Reasoning with Robotic Action via Autoregressive Discretized Pre-training

通过自回归离散预训练实现机器人动作的统一具身VLM推理

Yi Liu, Sukai Wang, Dafeng Wei, Xiaowei Cai, Linqing Zhong, Jiange Yang, Guanghui Ren, Jinyu Zhang, Maoqing Yao, Chuankang Li, Xindong He, Liliang Chen, Jianlan Luo

机构 * AgiBot Research(AgiBot研究机构) AgiBot(AgiBot公司) Shanghai Innovation Institute(上海创新研究院)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文提出ERIQ基准和FACT模型,通过统一空间优化推理与动作,提升机器人在开放环境中的泛化与精确执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09776 2026-07-16 cs.RO cs.AI 版本更新 79%

HELP: Human-Efficient Large-Scale Robot Post-Training with Rollout Segmentation

通过 VLAC-Cut 引导的管道最大化大规模机器人训练后人类效率

Shaopeng Zhai, Qi Zhang, Tianyi Zhang, Haoran Zhang, Fuxian Huang, Zhanhui Lin, Zijun Xu, Weinan Zhang

机构 * Shanghai AI Lab(上海人工智能实验室)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision language action(abstract);分类 cs.RO、cs.AI

AI总结 研究旨在最大化机器人训练后人类效率,提出含专门分工的高效训练后管道,引入 VLAC-CUT 工具提高数据利用效率,经四个实际任务验证,最终策略成功率达 80% - 95%,吞吐量提升 1.7 倍至 4.2 倍,优于仅人工参与训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11119 2026-07-14 cs.RO cs.AI 新提交 79%

VIA: Visual Interface Agent for Robot Control

VIA:用于机器人控制的视觉接口代理

Hengyuan Hu, Priya Sundaresan, Jensen Gao, Dorsa Sadigh

机构 * Stanford University(斯坦福大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 研究探索能否用基础模型通过视觉接口控制机器人,提出 VIA 框架,将机器人控制转为代理任务,该框架无需特定微调及特权信息,能零样本解决多种桌面操作任务,凭借基础模型能力提升取得高成功率,证明前沿代理技能可借合适接口用于机器人控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02841 2026-07-07 cs.RO cs.CV 新提交 79%

CLEAR: Closed-Loop Reinforcement Learning at Scale for End-to-End Autonomous Driving

CLEAR:用于端到端自动驾驶的大规模闭环强化学习

Yunxiao Shi, Hong Cai, Mohammad Ghavamzadeh, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究中心)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 研究端到端自动驾驶,针对现有基于视觉语言动作模型的策略多采用模仿学习致闭环规划性能欠佳的问题,提出CLEAR系统,用强化学习进行闭环训练,设计异构管道增加并行模拟环境数量,性能优于先前方法。

详情

展开后加载摘要…

URL PDF HTML 收藏