arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9810 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9139 篇

2112.04286 2021-12-09 cs.AI 74%

TempAMLSI : Temporal Action Model Learning based on Grammar Induction

Maxence Grand, Damien Pellier, Humbert Fiorino

专题命中 VLA模型 :action model(title);分类 cs.AI

Comments Proceedings of the International workshop of Knowledge Engineering for Planning and Scheduling (ICAPS), 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.13156 2021-11-29 cs.CV 74%

Global Interaction Modelling in Vision Transformer via Super Tokens

Ammarah Farooq, Muhammad Awais, Sara Ahmed, Josef Kittler

专题命中 VLA模型 :action model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.02019 2021-10-11 cs.CL cs.LG 74%

FoodChem: A food-chemical relation extraction model

Gjorgjina Cenikj, Barbara Koroušić Seljak, Tome Eftimov

专题命中 VLA模型 :action model(title);分类 cs.LG

Comments 8 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.02246 2021-07-07 math.ST cs.LG physics.data-an stat.TH 74%

Stochastic Local Interaction Model: Geostatistics without Kriging

Dionissios T. Hristopulos, Andreas Pavlides, Vasiliki D. Agou, Panagiota Gkafa

专题命中 VLA模型 :action model(title);分类 cs.LG

Comments 42 pages, 15 figures

Journal ref Mathematical Geosciences, pp.1-43 (2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.01716 2021-04-13 cs.IR cs.LG 74%

Quaternion Factorization Machines: A Lightweight Solution to Intricate Feature Interaction Modelling

Tong Chen, Hongzhi Yin, Xiangliang Zhang, Zi Huang, Yang Wang, Meng Wang

专题命中 VLA模型 :action model(title);分类 cs.LG

Comments Manuscript is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.12613 2021-04-12 cs.AI 74%

Asking the Right Questions: Learning Interpretable Action Models Through Query Answering

Pulkit Verma, Shashank Rao Marpally, Siddharth Srivastava

专题命中 VLA模型 :action model(title);分类 cs.AI

Comments AAAI 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.09662 2021-01-26 cs.MA cs.AI cs.IR 74%

Medical Information Retrieval and Interpretation: A Question-Answer based Interaction Model

Nilanjan Sinhababu, Rahul Saxena, Monalisa Sarma, Debasis Samanta

专题命中 VLA模型 :action model(title);分类 cs.AI

Comments 39 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.01278 2020-04-06 cs.CV 74%

Knowing What, Where and When to Look: Efficient Video Action Modeling with Attention

Juan-Manuel Perez-Rua, Brais Martinez, Xiatian Zhu, Antoine Toisoul, Victor Escorcia, Tao Xiang

专题命中 VLA模型 :action model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.11062 2019-12-02 cs.IR cs.CL cs.LG 74%

Automatic Detection of Satire in Bangla Documents: A CNN Approach Based on Hybrid Feature Extraction Model

Arnab Sen Sharma, Maruf Ahmed Mridul, Md Saiful Islam

专题命中 VLA模型 :action model(title);分类 cs.LG

Comments 5 pages, Conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.10013 2019-01-30 cs.RO cs.GT 74%

How Shall I Drive? Interaction Modeling and Motion Planning towards Empathetic and Socially-Graceful Driving

Yi Ren, Steven Elliott, Yiwei Wang, Yezhou Yang, Wenlong Zhang

专题命中 VLA模型 :action model(title);分类 cs.RO

Comments accepted to 2019 International Conference on Robotics and Automation

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.05242 2018-11-14 cs.CL cs.LG 74%

A Multi-layer LSTM-based Approach for Robot Command Interaction Modeling

Martino Mensio, Emanuele Bastianelli, Ilaria Tiddi, Giuseppe Rizzo

专题命中 VLA模型 :action model(title);分类 cs.LG

Comments Workshop on Language and Robotics, IROS 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.05980 2018-02-19 q-bio.QM cs.LG stat.ML 74%

WHInter: A Working set algorithm for High-dimensional sparse second order Interaction models

Marine Le Morvan, Jean-Philippe Vert

专题命中 VLA模型 :action model(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1710.11354 2017-11-01 cs.CV 74%

Spatio-temporal interaction model for crowd video analysis

Neha Bhargava, Subhasis Chaudhuri

专题命中 VLA模型 :action model(title);分类 cs.CV

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1511.06181 2015-12-02 cs.CV 74%

What Players do with the Ball: A Physically Constrained Interaction Modeling

Andrii Maksai, Xinchao Wang, Pascal Fua

专题命中 VLA模型 :action model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1405.2941 2014-05-14 cs.CV 74%

Cross-view Action Modeling, Learning and Recognition

Jiang wang, Xiaohan Nie, Yin Xia, Ying Wu, Song-Chun Zhu

专题命中 VLA模型 :action model(title);分类 cs.CV

Comments CVPR 2014

详情

展开后加载摘要…

URL PDF HTML 收藏
1301.3755 2013-01-17 cs.CV 74%

Gradient Driven Learning for Pooling in Visual Pipeline Feature Extraction Models

Derek Rose, Itamar Arel

专题命中 VLA模型 :action model(title);分类 cs.CV

Comments 3 pages, 2 figures, submitted to ICLR2013 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
1110.2204 2011-10-12 cs.AI 74%

Consistency and Random Constraint Satisfaction Models

J. Culberson, Y. Gao

专题命中 VLA模型 :action model(title);分类 cs.AI

Journal ref Journal Of Artificial Intelligence Research, Volume 28, pages 517-557, 2007

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.06594 2018-10-17 astro-ph.IM astro-ph.CO 73%

Science with the Next-Generation VLA and Pulsar Timing Arrays

NANOGrav Collaboration

专题命中 VLA模型 :VLA(title,comments)

Comments To be published in the ASP Monograph Series, "Science with a Next-Generation VLA", ed. E. J. Murphy (ASP, San Francisco, CA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16806 2026-08-20 cs.RO cs.AI 版本更新 73%

Breaking Planner Integrity Boundary: Enviroment State-Text Injection Attack on LLM-Driven Embodied Agents

当状态成为攻击面:大语言模型驱动的具身智能体中的状态语义注入

Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang, Jinlin Fan, Bowen Xiao, Chi Guo, Keyan Guo, Hongxin Hu

机构 * Wuhan University(武汉大学) University at Buffalo(布法罗大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 该文聚焦LLM驱动的具身智能体,梳理其技术演进与现有模型,指出其需结合多类信息完成任务落地后执行,为后续状态语义注入攻击研究奠定基础。

Comments submitted to USENIX Security 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17163 2026-08-19 cs.LG cs.AI 新提交 73%

Q-Learning With World Models

结合世界模型的Q学习

Perry Dong, Yueru Jia, Chelsea Finn, Dorsa Sadigh

机构 * Stanford University(斯坦福大学) Peking University(北京大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出QWM框架,将世界模型与标准Q学习结合,在真实环境训练中避免复合模型偏差,在Robomimic和LIBERO基准上的样本效率与性能均优于现有SOTA方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08837 2026-08-13 cs.LG cs.AI 版本更新 73%

Prompt-Driven Exploration

提示驱动的探索

Sunshine Jiang, John Marangola, David Zhang, Raghuram Kowdeed, Ruiyang Luo, Nitish Dashora, Richard Li, Pulkit Agrawal, Zhang-Wei Hong

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT-IBM Computing Research Lab(麻省理工学院-IBM计算研究实验室) Improbable AI Lab(英普罗巴布尔人工智能实验室)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.AI、cs.LG

AI总结 研究针对强化学习中探索难的问题,提出提示驱动的探索策略(PDE),利用视觉-语言模型对轨迹视频推理,从弱策略轨迹中优化提示,实现后验采样,能让强化学习从零奖励起步学习成功策略并提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01690 2026-08-04 cs.RO cs.AI 新提交 73%

ProtoAct: Turning Wet-Lab Protocols into Embodied Robotic Actions

ProtoAct:将湿实验室协议转化为具身机器人动作

Zhe Liu, Jiaming Gu, Zhaohui Du, Zhe Wang, Huanbo Jin, Quan Lu, Qi Wang, Ting Xiao, Minting Pan, Dongzhan Zhou

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 研究针对湿实验室协议难转化为机器人动作的问题,提出ProtoAct框架,结合ProtoRAG、RefineChecker、ActSchema处理协议,引入BioP2E数据集,经多模型评估与消融实验验证,可实现仿真及真实机器人的协议执行。

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19695 2026-07-23 cs.RO cs.CV 新提交 73%

NavVerse: Benchmarking Indoor-to-Outdoor Embodied Navigation in Continuous Robot Simulation

NavVerse:在连续机器人模拟中对室内到室外的具身导航进行基准测试

Junzhe Wu, Yue Hu, Zeyu Han, Po-Hsun Chang, Yinan Dong, Behrad Rabiei, Maani Ghaffari

机构 * University of Michigan(密歇根大学) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 研究针对机器人在连续场景中从室内到室外的导航问题,引入NavVerse基准,涵盖多种场景和任务。通过可执行接口用多指标评估智能体,零样本实验显示当前智能体在跨上下文导航上差距大,适应是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10350 2026-07-20 cs.AI cs.RO 版本更新 73%

ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory

ABot-AgentOS:一个具有终身多模态记忆的通用机器人智能体操作系统

Jiayi Tian, Shiao Liu, Yuting Xu, Jia Lu, Zihao Guan, Honglin Han, Di Yang, Minqi Gu, Yifei Qian, Tianlin Zhang, Yanqing Zhu, Zeqian Ye, Menglin Yang, Fei Wang, Xu Hu, Xiuxian Li, Wei Zhang, Shihui Su, Yiyan Ji, Jingbo Wang, Ziteng Feng, Jiaheng Liu, Zhaoxiang Zhang, Xiaolong Wu, Zixiao Tang, Zhining Gu, Yang Cai, Linbo Zheng, Jingjing Ma, Mingyang Yin, Zedong Chu, Wenbin Tang, Mu Xu

机构 * AMAP CV Lab(AMAP计算机视觉实验室)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 研究针对长期具身智能体运行需求,提出ABot-AgentOS通用机器人智能体操作系统,引入EmbodiedWorldBench基准,采用通用多模态图记忆及失败驱动自我进化循环,在相关测试中表现良好,证明该系统层可提升具身执行并提供持久记忆。

Comments Code: https://github.com/amap-cvlab/ABot-AgentOS Project page: https://amap-cvlab.github.io/ABot-AgentOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12892 2026-07-15 cs.RO cs.AI 新提交 73%

UR-VC: Unsupervised Robotic Value Correction for Time-Derived Progress Proxies

UR-VC:用于时间衍生进度代理的无监督机器人价值校正

Lirui Zhao, Modi Shi, Li Chen, Qi Liu, Ping Luo, Hongyang Li

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 研究针对机器人学习中时间衍生进度标签不准确问题,提出无监督机器人价值校正方法UR-VC,利用演示数据中相似状态不同时出现的规律校正标签,在真实双手布料操作任务中取得积极效果,还能用于构建优势标签。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08072 2026-07-15 cs.CV cs.RO 版本更新 73%

Post-Training in End-to-End Autonomous Driving

端到端自动驾驶中的训练后处理

Ruining Yang, Muxing Wang, Yixiao Chen, Tongfei Guo, Yi Xu, Can Cui, Zichong Yang, Yitian Zhang, Ziran Wang, Yun Fu, Lili Su

机构 * Northeastern University(东北大学) Purdue University(普渡大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 探讨端到端自动驾驶中训练后处理技术,针对传统方法不足,将现有文献按监督形式分四类,阐述各分类的能力、局限与挑战,助力系统理解该领域并推动相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09590 2026-07-13 cs.RO cs.AI 新提交 73%

PAC-ACT: Post-training Actor-Critic for Action Chunking Transformers

PAC-ACT:用于动作分块变换器的训练后演员评论家方法

Yujie Pang, Zudong Li

机构 * LeRobot

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 针对精密工业接触操纵问题,提出PAC-ACT框架,通过在块级别重新制定策略优化、构建特定架构并引入混合行为先验约束,提升了机器人策略在姿态扰动和接触力约束下的性能,实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21241 2026-07-07 cs.RO cs.AI 版本更新 73%

CorridorVLA: Explicit Spatial Constraints for Generative Action Heads via Sparse Anchors

CorridorVLA:通过稀疏锚点实现生成动作头的显式空间约束

Dachong Li, ZhuangZhuang Chen, Jin Zhang, Jianqiang Li

机构 * College of Computer Science and Software Engineering(计算机科学与软件工程学院) National Engineering Laboratory for Big Data System Computing Technology(大数据系统计算技术国家工程实验室)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 CorridorVLA通过稀疏锚点提供显式空间约束,提升动作生成性能,在LIBERO-Plus基准上改进成功率3.4%-12.4%。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23864 2026-06-30 cs.RO cs.CV 73%

Learning to Feel the Future: DreamTacVLA for Contact-Rich Manipulation

学习感知未来:DreamTacVLA用于接触丰富的 manipulation

Guo Ye, Zexi Zhang, Xu Zhao, Shang Wu, Haoran Lu, Shihan Lu, Han Liu

机构 * Northwestern University(西北大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 DreamTacVLA通过结合高分辨率触觉图像与多尺度视觉信息,提升接触丰富任务的鲁棒性,实现95%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28133 2026-06-29 cs.RO cs.CV 新提交 73%

Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots

翻译作为桥接动作:将操作技能从人类迁移到机器人

Sijin Chen, Kaixuan Jiang, Haixin Shi, Yanhui Wang, Weiheng Zhong, Haosheng Li, Bo Jiang, Yuxiao Liu, Xihui Liu

机构 * HKU-MMLab(香港大学多媒体实验室) ByteDance Seed(字节跳动Seed)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 提出以相对手腕平移作为桥接动作表示,结合π₀类视觉-语言-动作模型,从人类数据中迁移操作技能到双臂平行夹爪机器人,有效提升迁移效果并随数据量扩展。

Comments Project Page: https://translation-as-a-bridging-action.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏