arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9132 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9132 篇

2104.01716 2021-04-13 cs.IR cs.LG 74%

Quaternion Factorization Machines: A Lightweight Solution to Intricate Feature Interaction Modelling

Tong Chen, Hongzhi Yin, Xiangliang Zhang, Zi Huang, Yang Wang, Meng Wang

专题命中 VLA模型 :action model(title);分类 cs.LG

Comments Manuscript is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.12613 2021-04-12 cs.AI 74%

Asking the Right Questions: Learning Interpretable Action Models Through Query Answering

Pulkit Verma, Shashank Rao Marpally, Siddharth Srivastava

专题命中 VLA模型 :action model(title);分类 cs.AI

Comments AAAI 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.09662 2021-01-26 cs.MA cs.AI cs.IR 74%

Medical Information Retrieval and Interpretation: A Question-Answer based Interaction Model

Nilanjan Sinhababu, Rahul Saxena, Monalisa Sarma, Debasis Samanta

专题命中 VLA模型 :action model(title);分类 cs.AI

Comments 39 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.01278 2020-04-06 cs.CV 74%

Knowing What, Where and When to Look: Efficient Video Action Modeling with Attention

Juan-Manuel Perez-Rua, Brais Martinez, Xiatian Zhu, Antoine Toisoul, Victor Escorcia, Tao Xiang

专题命中 VLA模型 :action model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.11062 2019-12-02 cs.IR cs.CL cs.LG 74%

Automatic Detection of Satire in Bangla Documents: A CNN Approach Based on Hybrid Feature Extraction Model

Arnab Sen Sharma, Maruf Ahmed Mridul, Md Saiful Islam

专题命中 VLA模型 :action model(title);分类 cs.LG

Comments 5 pages, Conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.10013 2019-01-30 cs.RO cs.GT 74%

How Shall I Drive? Interaction Modeling and Motion Planning towards Empathetic and Socially-Graceful Driving

Yi Ren, Steven Elliott, Yiwei Wang, Yezhou Yang, Wenlong Zhang

专题命中 VLA模型 :action model(title);分类 cs.RO

Comments accepted to 2019 International Conference on Robotics and Automation

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.05242 2018-11-14 cs.CL cs.LG 74%

A Multi-layer LSTM-based Approach for Robot Command Interaction Modeling

Martino Mensio, Emanuele Bastianelli, Ilaria Tiddi, Giuseppe Rizzo

专题命中 VLA模型 :action model(title);分类 cs.LG

Comments Workshop on Language and Robotics, IROS 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.05980 2018-02-19 q-bio.QM cs.LG stat.ML 74%

WHInter: A Working set algorithm for High-dimensional sparse second order Interaction models

Marine Le Morvan, Jean-Philippe Vert

专题命中 VLA模型 :action model(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1710.11354 2017-11-01 cs.CV 74%

Spatio-temporal interaction model for crowd video analysis

Neha Bhargava, Subhasis Chaudhuri

专题命中 VLA模型 :action model(title);分类 cs.CV

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1511.06181 2015-12-02 cs.CV 74%

What Players do with the Ball: A Physically Constrained Interaction Modeling

Andrii Maksai, Xinchao Wang, Pascal Fua

专题命中 VLA模型 :action model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1405.2941 2014-05-14 cs.CV 74%

Cross-view Action Modeling, Learning and Recognition

Jiang wang, Xiaohan Nie, Yin Xia, Ying Wu, Song-Chun Zhu

专题命中 VLA模型 :action model(title);分类 cs.CV

Comments CVPR 2014

详情

展开后加载摘要…

URL PDF HTML 收藏
1301.3755 2013-01-17 cs.CV 74%

Gradient Driven Learning for Pooling in Visual Pipeline Feature Extraction Models

Derek Rose, Itamar Arel

专题命中 VLA模型 :action model(title);分类 cs.CV

Comments 3 pages, 2 figures, submitted to ICLR2013 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
1110.2204 2011-10-12 cs.AI 74%

Consistency and Random Constraint Satisfaction Models

J. Culberson, Y. Gao

专题命中 VLA模型 :action model(title);分类 cs.AI

Journal ref Journal Of Artificial Intelligence Research, Volume 28, pages 517-557, 2007

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.06594 2018-10-17 astro-ph.IM astro-ph.CO 73%

Science with the Next-Generation VLA and Pulsar Timing Arrays

NANOGrav Collaboration

专题命中 VLA模型 :VLA(title,comments)

Comments To be published in the ASP Monograph Series, "Science with a Next-Generation VLA", ed. E. J. Murphy (ASP, San Francisco, CA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17163 2026-08-19 cs.LG cs.AI 新提交 73%

Q-Learning With World Models

结合世界模型的Q学习

Perry Dong, Yueru Jia, Chelsea Finn, Dorsa Sadigh

机构 * Stanford University(斯坦福大学) Peking University(北京大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出QWM框架,将世界模型与标准Q学习结合,在真实环境训练中避免复合模型偏差,在Robomimic和LIBERO基准上的样本效率与性能均优于现有SOTA方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16806 2026-08-18 cs.RO cs.AI 新提交 73%

When State Becomes an Attack Surface: State-Semantic Injection in LLM-Driven Embodied Agents

当状态成为攻击面:大语言模型驱动的具身智能体中的状态语义注入

Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang, Jinlin Fan, Bowen Xiao, Chi Guo, Keyan Guo, Hongxin Hu

机构 * Wuhan University(武汉大学) University at Buffalo(布法罗大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 该文聚焦LLM驱动的具身智能体,梳理其技术演进与现有模型,指出其需结合多类信息完成任务落地后执行,为后续状态语义注入攻击研究奠定基础。

Comments submitted to USENIX Security 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08837 2026-08-13 cs.LG cs.AI 版本更新 73%

Prompt-Driven Exploration

提示驱动的探索

Sunshine Jiang, John Marangola, David Zhang, Raghuram Kowdeed, Ruiyang Luo, Nitish Dashora, Richard Li, Pulkit Agrawal, Zhang-Wei Hong

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT-IBM Computing Research Lab(麻省理工学院-IBM计算研究实验室) Improbable AI Lab(英普罗巴布尔人工智能实验室)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.AI、cs.LG

AI总结 研究针对强化学习中探索难的问题,提出提示驱动的探索策略(PDE),利用视觉-语言模型对轨迹视频推理,从弱策略轨迹中优化提示,实现后验采样,能让强化学习从零奖励起步学习成功策略并提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01690 2026-08-04 cs.RO cs.AI 新提交 73%

ProtoAct: Turning Wet-Lab Protocols into Embodied Robotic Actions

ProtoAct:将湿实验室协议转化为具身机器人动作

Zhe Liu, Jiaming Gu, Zhaohui Du, Zhe Wang, Huanbo Jin, Quan Lu, Qi Wang, Ting Xiao, Minting Pan, Dongzhan Zhou

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 研究针对湿实验室协议难转化为机器人动作的问题,提出ProtoAct框架,结合ProtoRAG、RefineChecker、ActSchema处理协议,引入BioP2E数据集,经多模型评估与消融实验验证,可实现仿真及真实机器人的协议执行。

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19695 2026-07-23 cs.RO cs.CV 新提交 73%

NavVerse: Benchmarking Indoor-to-Outdoor Embodied Navigation in Continuous Robot Simulation

NavVerse:在连续机器人模拟中对室内到室外的具身导航进行基准测试

Junzhe Wu, Yue Hu, Zeyu Han, Po-Hsun Chang, Yinan Dong, Behrad Rabiei, Maani Ghaffari

机构 * University of Michigan(密歇根大学) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 研究针对机器人在连续场景中从室内到室外的导航问题,引入NavVerse基准,涵盖多种场景和任务。通过可执行接口用多指标评估智能体,零样本实验显示当前智能体在跨上下文导航上差距大,适应是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10350 2026-07-20 cs.AI cs.RO 版本更新 73%

ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory

ABot-AgentOS:一个具有终身多模态记忆的通用机器人智能体操作系统

Jiayi Tian, Shiao Liu, Yuting Xu, Jia Lu, Zihao Guan, Honglin Han, Di Yang, Minqi Gu, Yifei Qian, Tianlin Zhang, Yanqing Zhu, Zeqian Ye, Menglin Yang, Fei Wang, Xu Hu, Xiuxian Li, Wei Zhang, Shihui Su, Yiyan Ji, Jingbo Wang, Ziteng Feng, Jiaheng Liu, Zhaoxiang Zhang, Xiaolong Wu, Zixiao Tang, Zhining Gu, Yang Cai, Linbo Zheng, Jingjing Ma, Mingyang Yin, Zedong Chu, Wenbin Tang, Mu Xu

机构 * AMAP CV Lab(AMAP计算机视觉实验室)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 研究针对长期具身智能体运行需求,提出ABot-AgentOS通用机器人智能体操作系统,引入EmbodiedWorldBench基准,采用通用多模态图记忆及失败驱动自我进化循环,在相关测试中表现良好,证明该系统层可提升具身执行并提供持久记忆。

Comments Code: https://github.com/amap-cvlab/ABot-AgentOS Project page: https://amap-cvlab.github.io/ABot-AgentOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12892 2026-07-15 cs.RO cs.AI 新提交 73%

UR-VC: Unsupervised Robotic Value Correction for Time-Derived Progress Proxies

UR-VC:用于时间衍生进度代理的无监督机器人价值校正

Lirui Zhao, Modi Shi, Li Chen, Qi Liu, Ping Luo, Hongyang Li

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 研究针对机器人学习中时间衍生进度标签不准确问题,提出无监督机器人价值校正方法UR-VC,利用演示数据中相似状态不同时出现的规律校正标签,在真实双手布料操作任务中取得积极效果,还能用于构建优势标签。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08072 2026-07-15 cs.CV cs.RO 版本更新 73%

Post-Training in End-to-End Autonomous Driving

端到端自动驾驶中的训练后处理

Ruining Yang, Muxing Wang, Yixiao Chen, Tongfei Guo, Yi Xu, Can Cui, Zichong Yang, Yitian Zhang, Ziran Wang, Yun Fu, Lili Su

机构 * Northeastern University(东北大学) Purdue University(普渡大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 探讨端到端自动驾驶中训练后处理技术,针对传统方法不足,将现有文献按监督形式分四类,阐述各分类的能力、局限与挑战,助力系统理解该领域并推动相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09590 2026-07-13 cs.RO cs.AI 新提交 73%

PAC-ACT: Post-training Actor-Critic for Action Chunking Transformers

PAC-ACT:用于动作分块变换器的训练后演员评论家方法

Yujie Pang, Zudong Li

机构 * LeRobot

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 针对精密工业接触操纵问题,提出PAC-ACT框架,通过在块级别重新制定策略优化、构建特定架构并引入混合行为先验约束,提升了机器人策略在姿态扰动和接触力约束下的性能,实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21241 2026-07-07 cs.RO cs.AI 版本更新 73%

CorridorVLA: Explicit Spatial Constraints for Generative Action Heads via Sparse Anchors

CorridorVLA:通过稀疏锚点实现生成动作头的显式空间约束

Dachong Li, ZhuangZhuang Chen, Jin Zhang, Jianqiang Li

机构 * College of Computer Science and Software Engineering(计算机科学与软件工程学院) National Engineering Laboratory for Big Data System Computing Technology(大数据系统计算技术国家工程实验室)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 CorridorVLA通过稀疏锚点提供显式空间约束,提升动作生成性能,在LIBERO-Plus基准上改进成功率3.4%-12.4%。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23864 2026-06-30 cs.RO cs.CV 73%

Learning to Feel the Future: DreamTacVLA for Contact-Rich Manipulation

学习感知未来:DreamTacVLA用于接触丰富的 manipulation

Guo Ye, Zexi Zhang, Xu Zhao, Shang Wu, Haoran Lu, Shihan Lu, Han Liu

机构 * Northwestern University(西北大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 DreamTacVLA通过结合高分辨率触觉图像与多尺度视觉信息,提升接触丰富任务的鲁棒性,实现95%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28133 2026-06-29 cs.RO cs.CV 新提交 73%

Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots

翻译作为桥接动作:将操作技能从人类迁移到机器人

Sijin Chen, Kaixuan Jiang, Haixin Shi, Yanhui Wang, Weiheng Zhong, Haosheng Li, Bo Jiang, Yuxiao Liu, Xihui Liu

机构 * HKU-MMLab(香港大学多媒体实验室) ByteDance Seed(字节跳动Seed)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 提出以相对手腕平移作为桥接动作表示,结合π₀类视觉-语言-动作模型,从人类数据中迁移操作技能到双臂平行夹爪机器人,有效提升迁移效果并随数据量扩展。

Comments Project Page: https://translation-as-a-bridging-action.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27268 2026-06-26 cs.RO cs.AI 新提交 73%

E-TTS: A New Embodied Test-Time Scaling Framework for Robotic Manipulation

E-TTS:一种新的机器人操作具身测试时缩放框架

Wen Ye, Peiyan Li, Tingyu Yuan, Yuan Xu, Xiangnan Wu, Chaoyang Zhao, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) FiveAges(五时代)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 提出E-TTS框架,通过历史感知迭代精炼和视觉语言验证器统一推理与动作缩放,解决具身任务中推理缩放和历史信息利用不足的问题,在仿真和真实场景中分别提升33.14%和26.62%的性能。

Comments Accepted to ECCV 2026. 44 pages, 11 figures. Project page: https://27yw.github.io/E-TTS-Web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27251 2026-06-26 cs.RO cs.AI 新提交 73%

Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy

推进全模态具身智能体:从孤立技能到日常物理自主

Junhao Shi, Zezheng Huai, Siyin Wang, Jia Chen, Yubang Wang, Zhaoye Fei, Hechang Chen, Jingjing Gong, Xipeng Qiu, Yu-Gang Jiang

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 提出OmniAct框架,通过分层异步架构统一规划、记忆和验证,实现机器人在非结构化环境中的持久自主,在40项真实任务中提升成功率并降低token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23754 2026-06-24 cs.RO cs.LG 新提交 73%

Verifiable Foundation Models for Robot Safety

机器人安全的可验证基础模型

Davide Corsi, Kyungmin Kim, Roy Fox

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.LG

AI总结 提出FEARL框架,将策略分解为大控制器和小安全模块,使形式化验证仅应用于安全模块,从而在保持控制器表达能力的同时实现可验证的机器人安全控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15757 2026-06-23 cs.RO cs.AI 版本更新 73%

You've Got a Golden Ticket: Improving Generative Robot Policies With A Single Noise Vector

你有一张金票:用单一噪声向量改进生成式机器人策略

Omkar Patil, Ondrej Biza, Thomas Weng, Karl Schmeckpeper, Wil Thomason, Xiaohan Zhang, Kausik Sivakumar, Robin Walters, Nakul Gopalan, Sebastian Castro, Stephen Hart, Eric Rosen

机构 * Robotics and AI Institute(机器人与人工智能研究所) Arizona State University(亚利桑那州立大学) Northeastern University(东北大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 提出用固定初始噪声替换高斯采样,通过蒙特卡洛搜索找到“金票”,无需训练即可提升预训练扩散/流匹配策略在46/51个任务中的成功率,最高提升55%。

Comments 34 pages, 14 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏