arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-05-11 至 2026-05-11 共收录 15 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 15 篇

2602.01166 2026-05-11 cs.RO 94%

Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models

隐式推理VLA:面向视觉-语言-动作模型的隐式思考与预测

Shuanghao Bai, Jing Lyu, Wanqi Zhou, Zhe Li, Dakai Wang, Lei Xing, Xiaoguang Zhao, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Badong Chen, Shanghang Zhang

机构 * Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Automation, University of Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 本文提出LaRA-VLA框架,通过连续潜在表示实现多模态推理,减少推理开销,提升机器人实时控制效率。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06175 2026-05-11 cs.RO 92%

VLA-GSE: Boosting Parameter-Efficient Fine-Tuning in VLA with Generalized and Specialized Experts

VLA-GSE: 提升VLA中基于通用和专用专家的参数高效微调

Yuhua Jiang, Junjie Lu, Xinyao Qin, Xiaoyu Chen, Kaixin Wang, Feifei Gao, Li Zhao

机构 * Microsoft Research Asia(微软亚洲研究院) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract,abstract_cn);分类 cs.RO

AI总结 VLA-GSE通过通用和专用专家机制提升VLA在机器人控制中的参数高效微调效果,保留预训练知识的同时提高适应能力,实验表明其在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18085 2026-05-11 cs.RO cs.AI 91%

Continually Evolving Skill Knowledge in Vision Language Action Model

视觉语言动作模型中的持续演进技能知识

Yuxuan Wu, Guangming Wang, Zhiheng Yang, Tianchen Deng, Maoqing Yao, Brian Sheil, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) University of Cambridge(剑桥大学) Beihang University(北京航空航天大学) Nanyang Technological University(南洋理工大学) MIT SMART(麻省理工学院SMART实验室) AgiBot

专题命中 VLA模型 :VLA(summary_cn,abstract);vision language action(title);action model(title);vision-language-action(abstract)

AI总结 本文提出Stellar VLA框架,通过无需增加参数的持续模仿学习方法,实现视觉语言动作模型的持续知识积累,实验表明其在任务专精和知识转移方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07288 2026-05-11 cs.CV cs.AI 91%

Sword: Style-Robust World Models as Simulators via Dynamic Latent Bootstrapping for VLA Policy Post-Training

Sword: 通过动态潜在自举实现风格鲁棒的世界模型作为模拟器用于VLA策略后训练

Jiaxuan Gao, Yongjian Guo, Zhong Guan, Wen Huang, Wanlun Ma, Xi Xiao, Junwu Xiong, Sheng Wen

机构 * Tianjin University(天津大学) Tsinghua University(清华大学) Swinburne University of Technology(西敏大学) JDT AI Infra(JDT AI基础设施)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Sword框架,通过结构引导的风格增强和动态潜在自举提升VLA模型在特定环境中的泛化能力、生成质量和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07088 2026-05-11 cs.CR 91%

Membership Inference Attacks on Vision-Language-Action Models

针对视觉-语言-动作模型的成员推断攻击

Yuefeng Peng, Mingzhe Li, Kejing Xia, Renhao Zhang, Amir Houmansadr

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title)

AI总结 本文首次系统研究了针对视觉-语言-动作(VLA)模型的成员推断攻击(MIAs),提出了样本级和轨迹级的攻击设置,并展示了在多个VLA基准和模型上,攻击方法在黑盒环境下表现出色,揭示了VLA模型在隐私方面的高风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07474 2026-05-11 cs.CV cs.AI 89%

ForgeVLA: Federated Vision-Language-Action Learning without Language Annotations

ForgeVLA:无需语言标注的联邦视觉-语言-动作学习

Yuhao Zhou, Yunpeng Zhu, Yang Zhou, Jindi Lyu, Jian Lan, Zhangyuan Wang, Dan Si, Thomas Seidl, Qing Ye, Jiancheng Lyu

机构 * Sichuan University(四川大学) Zhejiang University(浙江大学) Ludwig-Maximilians-Universität München(慕尼黑路德维希-马克西米利安大学) Lenovo Group Limited(联想集团有限公司) Engineering Research Center of Machine Learning and Industry Intelligence, Ministry of Education(教育部机器学习与工业智能工程研究中心)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出ForgeVLA框架,通过分布式视觉-动作对训练联邦VLA模型,无需集中数据或人工标注。通过客户端指令分类器构建完整三元组,并引入对比规划损失和自适应聚合策略以解决特征坍塌问题,实验表明性能优于基线模型。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07514 2026-05-11 cs.RO cs.CV 81%

Is the Future Compatible? Diagnosing Dynamic Consistency in World Action Models

未来是否兼容?世界动作模型中的动态一致性诊断

Bo-Kai Ruan, Teng-Fang Hsiao, Ling Lo, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 本文研究了世界动作模型中动作-状态一致性作为可靠性指标的重要性,提出了一种无需额外训练的共识策略提升规划效果。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06805 2026-05-11 astro-ph.SR astro-ph.GA 80%

Radio Continuum and Water Maser Monitoring of the Outburst in HOPS 373: Free-Free Emission Does Not Respond to the Outburst

HOPS 373爆发的无线电连续波和水激光监测:自由-自由辐射未对爆发作出反应

John Tobin, Doug Johnstone, Greg Herczeg, Jeong-Eun Lee, Ho-Gyu Lee, Carlos Contreras-Pena, Sung-Yong Yoon, Steve Mairs

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 研究通过VLA和水激光监测HOPS 373爆发期间的自由-自由辐射和水激光发射,发现自由-自由辐射未随爆发变化,而水激光发射高度波动,可能与爆发无直接关联。

Comments 47 pages, 17 figures, 9 Tables, accepted to ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07642 2026-05-11 cs.CV 77%

EggHand: A Multimodal Foundation Model for Egocentric Hand Pose Forecasting

EggHand:一种用于第一人称手姿态预测的多模态基础模型

Jaeyoung Choi, Hyeondong Kim, Yujin Kim, Daehee Park

机构 * DGIST, Republic of Korea(韩国忠南科学技术院)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.CV

AI总结 本文提出EggHand模型,通过结合视觉-语言-动作模型的动作解码器和第一人称视频-文本编码器,实现对第一人称视频中手姿态序列的预测,提升了在剧烈视角变化下的鲁棒性和可控性。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07684 2026-05-11 astro-ph.GA 67%

The diverse morphologies and evolution of low-luminosity edge-brightened radio galaxies

低亮度边缘明亮化射电星系的多样性及演化

B. Barkus, J. H. Croston, B. Mingo, M. J. Hardcastle, G. Gürkan, V. H. Mahatma

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 研究低亮度FRII星系的形态和演化,发现其在低射电亮度下仍存在活跃活动,且形态多样性显著,需谨慎使用二元分类法。

Comments 16 pages, 7 figures, 8 tables. Accepted for publication in MNRAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06298 2026-05-11 cs.CV cs.AI 62%

Render, Don't Decode: Weight-Space World Models with Latent Structural Disentanglement

渲染,而非解码:具有潜在结构解耦的权重空间世界模型

Roussel Desmond Nzoyem, Mauro Comi

机构 * Department of Computer Science(计算机科学系) University of Manchester(曼彻斯特大学) University of Bristol(布里斯托大学)

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出NOVA框架,通过权重和偏置构建隐式神经表示,实现高效且可解释的世界模型,支持结构场景组件的解耦与编辑。

Comments 35 pages, 30 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07859 2026-05-11 cs.CV 57%

EyeCue: Driver Cognitive Distraction Detection via Gaze-Empowered Egocentric Video Understanding

EyeCue:通过眼动增强的视点视频理解进行驾驶员认知分心检测

Lang Zhang, JinYi Yoon, Matthew Corbett, Abhijit Sarkar, Bo Ji

机构 * Virginia Tech(弗吉尼亚理工大学) Inha University(inha大学) Army Cyber Institute at West Point(西点军营陆军网络学院)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 本文提出EyeCue框架,通过眼动与视觉上下文的交互建模,实现驾驶员认知分心检测,利用CogDrive数据集验证其在多种驾驶场景下的高准确率和泛化能力。

Comments Accepted to the 35th International Joint Conference on Artificial Intelligence (IJCAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07213 2026-05-11 cs.CV 57%

LoHGNet: Infrared Small Target Detection through Lorentz Geometric Encoding with High-Order Relation Learning

LoHGNet:通过洛伦兹几何编码与高阶关系学习进行红外小目标检测

Qianwen Ma, Yang Xu, Shangwei Deng, Xiaobo Li, Haofeng Hu

机构 * School of Marine Science and Technology, Tianjin University(天津大学海洋科学与技术学院) Jiangxi Key Laboratory of Advanced Electronic Materials and Device, Jiangxi Science and Technology Normal University(江西省先进电子材料与器件重点实验室,江西科技师范大学)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 LoHGNet通过洛伦兹几何编码和高阶关系学习提升红外小目标检测性能,改进弱目标特征表示和背景关系建模,实验证明其在检测精度和复杂场景适应性上的竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15122 2026-05-11 hep-ph hep-th 50%

Symmetry Preserving Contact Interaction Approaches: An Overview of Meson and Diquark Form Factors

保持对称性的接触相互作用方法:介子和双夸克因子的综述

L. X. Gutiérrez-Guerrero, Roger José Hernández-Pinto

专题命中 VLA模型 :action model(abstract)

AI总结 综述介绍了保持对称性的接触相互作用模型,用于描述介子和双夸克的质谱和内部结构,更新了模型预测并与最新文献结果比较,探讨了其在强子结构研究中的应用前景。

Comments 45 pages, 18 figures, review article. Accepted for publication in Particles (MDPI), 2026

Journal ref 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02311 2026-05-11 hep-ph cond-mat.mes-hall hep-th quant-ph 50%

Oscillating Fields, Emergent Gravity and Particle Traps

振荡场、涌现引力与粒子陷阱

Alexander A. Penin, Aneca Su

专题命中 VLA模型 :action model(abstract)

AI总结 研究快速振荡场中带电粒子的大尺度动力学,建立其经典和量子有效理论描述,揭示涌现曲率和光速由场分布和频率决定,为高精度粒子陷阱设计和Floquet量子材料提供理论支持。

Comments 5 pages, 2 figures, typos corrected

详情

展开后加载摘要…

URL PDF HTML 收藏