arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-07-17 至 2026-07-17 共收录 17 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 17 篇

2607.15004 2026-07-17 cs.RO 新提交 94%

CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking

CosFly-VLA:一种用于无人机跟踪的空间感知视觉-语言-动作模型

Ruilong Ren, Songsheng Cheng, Yunpeng Zhou, Hanxuan Chen, Xiangyue Wang, Tianle Zeng, Shuai Yuan, Binbo Li, Hanzhong Guo, Ji Pei, Da Zhang, Kangli Wang

机构 * Autel Robotics(大疆创新科技有限公司) Northeast Normal University(东北师范大学) Southern University of Science and Technology(南方科技大学) Peking University(北京大学) University of Hong Kong(香港大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 针对复杂城市环境中无人机动态目标跟踪问题,提出CosFly-VLA模型,通过结构化预测接口联合定位目标、估计可见性并生成飞行动作。经多阶段训练,该模型在开环误差和闭环成功率上有显著提升,实现从可见帧模仿到空间基础动作闭环控制的进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05754 2026-07-17 cs.RO 版本更新 94%

Safe-Night VLA: Seeing the Unseen via Thermal-Perceptive Vision-Language-Action Models for Safety-Critical Manipulation

Safe-Night VLA: 通过热感知视觉-语言-动作模型看见未见事物以实现安全关键操作

Dian Yu, Qingchuan Zhou, Bingkun Huang, Majid Khadiv, Zewen Yang

机构 * Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM)(慕尼黑机器人与机器智能研究所(MIRMI),技术大学慕尼黑(TUM))

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 Safe-Night VLA通过整合热感知技术,实现了安全关键操作中的非可见领域感知与稳健执行。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14635 2026-07-17 cs.AI cs.CV cs.RO 新提交 92%

Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models

动作QFormer:视觉-语言-动作模型中动作监督下的结构化表示塑造

Yufeng Ji, Wenhao Tang, Haoyi Niu, Koushil Sreenath, Yi Wu, Zhongyu Li

机构 * Shanghai Qizhi Institute(上海期智研究院) The Chinese University of Hong Kong(香港中文大学) Hong Kong Embodied AI Lab(香港具身人工智能实验室) Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 研究视觉-语言-动作模型中动作监督问题,提出动作QFormer,通过基于指令的查询重组多模态信息。在零样本模拟到真实导航中提升了任务成功率、动作生成正确性等,还改变动作监督塑造多模态表示的方式,为提高VLA性能提供新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14739 2026-07-17 cs.CV cs.AI 新提交 91%

FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models

FoMoVLA:为视觉-语言-动作模型架起视觉预见与运动引导的桥梁

Wei Li, Peijin Jia, Yuan Ma, Xuefeng Jiang, Titong Jiang, Sheng Sun, Yujian Li, Xin Wen, Han Hong, Zhikang Liu, Bailin Li, Kun Zhan

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.CV、cs.AI

AI总结 研究针对视觉-语言-动作模型缺乏对世界动态向前预测及运动引导不足问题,提出FoMoVLA框架,联合学习未来特征预见与稀疏点跟踪增强VLA表示,经实验验证其性能先进且泛化能力强。

Comments 12 pages, 7 figures, 8 tables. Project page: https://liauto-research.github.io/FoMoVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14695 2026-07-17 cs.RO 新提交 91%

Reflex: Real-Time VLA Control through Streaming Inference

Reflex:通过流推理实现实时VLA控制

Yuanchun Guo, Bingyan Liu

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 研究针对流匹配VLA模型与实时机器人技术的不兼容问题,提出Reflex框架,利用时间步不变性属性实现实时流推理,通过分区缓存更新、引入自适应归一化层、异步管道和算子融合等方法,在基准测试中实现推理加速和稳定流,减少反应延迟。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12356 2026-07-17 cs.RO 版本更新 91%

VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation

VistaVLA:用于机器人操作的几何和语义感知3D高斯基础VLA

Mohan Liu, Zhihao Gu, Xuanyu Chen, Haitian Zhang, Kaimin Mao, Yan Wu, Wei-Yun Yau, Lin Wang

机构 * EmPACT Lab, Nanyang Technological University(南洋理工大学EmPACT实验室) Institute for Infocomm Research (I2R), A*STAR(资讯通信研究院(I2R),新加坡科技研究局)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 研究针对VLA模型缺乏3D表示的问题,提出VistaVLA框架,通过3D高斯原语构建几何和语义感知的3D认知表示,利用MtQ机制压缩令牌,在模拟和真实环境评估中有效提升VLA性能,尤其在真实场景中显著提高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10821 2026-07-17 cs.RO 版本更新 91%

UniSteer: Unified Noise Steering for Efficient Human-Guided VLA Adaptation

统一噪声引导用于高效的人类引导VLA适应

Junjie Lu, Xinyao Qin, Yuhua Jiang, Kaixin Wang, Chuheng Zhang, Bin Liang, Jun Yang, Min Xu, Li Zhao

机构 * University of Technology Sydney(悉尼技术大学) Tsinghua University(清华大学) Microsoft Research(微软研究院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 本文提出UniSteer框架,结合人类纠正指导与噪声空间RL,通过近似动作到噪声的逆向转换提升VLA在真实世界中的适应效率,实验显示成功率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14280 2026-07-17 cs.RO cs.LG 新提交 90%

DiMaS: Distribution Matching for Steering Vision-Language-Action Models

DiMaS:用于引导视觉-语言-动作模型的分布匹配

Pegah Khayatan, Sara Meziane, Jayneel Parekh, Matthieu Cord

机构 * ISIR, Sorbonne Université(法国国家信息与自动化研究所,索邦大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 研究针对基于流匹配的视觉-语言-动作模型细粒度行为控制不足的问题,提出DiMaS分布匹配引导策略,能有效控制行为,研究其泛化性并分析原因,推动了视觉运动设置下的分布匹配设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14236 2026-07-17 cs.RO cs.AI cs.LG 新提交 89%

Never Too Late for Force: Accelerating VLA Post-Training with Reactive Force Injection

力,永不嫌迟:通过反应式力注入加速视觉-语言-动作模型的训练后优化

Yi Wang, Wendi Chen, Zimo Wen, Han Xue, Xueqi Li, Wenye Yu, Zhijie Chen, Hao Yang, Jun Lv, Chuan Wen, Cewu Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Southern University of Science and Technology(南方科技大学) Noematrix Ltd.(诺玛矩阵有限公司)

专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究针对预训练VLA策略在接触状态下表现不佳的问题,提出LIFT框架,通过嫁接反应式动作专家、注入力及结合在线DAgger循环,提升其在富含接触操作任务中的性能,且证明相关组件对稳健操作很重要。

Comments Project page: https://lift-policy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14698 2026-07-17 cs.RO 新提交 89%

Lights, Camera, Malfunction: When Illumination Robustness Leaves VLA Models Blind to Color

灯光、相机、故障:当光照鲁棒性使视觉语言动作模型对颜色视而不见时

Marino Watanabe, Takami Sato, Kentaro Yoshioka

机构 * Keio University(庆应义塾大学)

专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(abstract);分类 cs.RO

AI总结 研究VLA模型在现实环境中对光照干扰的脆弱性,提出FLARE攻击框架和ChromaGuard对抗训练方法,通过实验验证ChromaGuard能有效提升模型在颜色相关任务中的成功率,保障模型在复杂环境下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14609 2026-07-17 cs.RO 新提交 84%

Representation-Aligned Tactile Grounding for Contact-Rich Robotic Manipulation

用于接触丰富的机器人操作的表示对齐触觉基础

Ruilin Chen, Jingkai Jia, Tong Yang, Xinyu Zhou, Qiao Sun, Jiangwei Zhong, Shizeng Zhang, Nuo Chen, Bailin He, Wei Li, Wenqiang Zhang

机构 * Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院智能信息处理上海市重点实验室) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Lenovo CTO Organization(联想首席技术官组织) Nanyang Technological University(南洋理工大学) TeleAl, China Telecom(中国电信天翼人工智能公司)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 研究接触丰富的机器人操作中,针对VLA策略不同表示作用下触觉监督应用位置不明的问题,通过线性探针分析找到可预测未来触觉状态的中间动作专家特征,引入LTP,实验证明表示对齐的触觉基础效果更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14997 2026-07-17 cs.RO 新提交 83%

AeroAct: Action-Centered World-Action Models for Language-Conditioned Quadrotor Flight

AeroAct:用于语言条件四旋翼飞行的以动作中心的世界-动作模型

Xinhong Zhang, Qiyuan Zhu, Yubo Huang, Haolin Chen, Runqing Wang, Yuhao Mo, Zhongxin Chen, Yu Hu, Xinjiang Wang, Jian Sun, Gang Wang

机构 * School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院)

专题命中 VLA模型 :action model(title,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 研究语言条件下四旋翼飞行问题,提出AeroAct模型,利用预训练视频扩散Transformer,结合相关采集设备和程序获取数据,经实验验证该模型能提升四旋翼飞行的目标跟踪和物体搜索性能,且对应策略可在实体四旋翼上执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12936 2026-07-17 cs.RO cs.AI 版本更新 82%

Pipette: An Embodied Simulation Platform, Benchmark, and Data-Efficient Augmentation Framework for Wet-Lab Robotics

面向湿实验室机器人的具身仿真平台、基准测试及数据高效增强框架

Zhe Liu, Huanbo Jin, Zhaohui Du, Zhe Wang, Dongzhan Zhou, Minting Pan, He Xu, Peijia Li, Jiaming Gu, Quan Lu, Qi Wang, Bin Ji, Ting Xiao

机构 * Key Laboratory of Smart Manufacturing in Energy Chemical Process Ministry of Education(能源化工过程智能制造国家重点实验室) Department of Computer Science and Engineering(计算机科学与工程系) Department of Laboratory Medicine(实验室医学系) Shanghai Jiao Tong University School of Medicine(上海交通大学医学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.RO、cs.AI

AI总结 提出Pipette平台,包含可编辑资产、仿真数据增强管道和11任务基准测试,将30次演示的VLA成功率从44.1%提升至74.7%。

Comments 19 pages, 19figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15207 2026-07-17 cs.LG cs.RO 新提交 81%

BadWAM: When World-Action Models Dream Right but Act Wrong

BadWAM:当世界-动作模型想得对但做得错时

Qi Li, Xingyi Yang, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.LG

AI总结 研究针对世界-动作模型(WAMs)提出BadWAM框架,用于建模和评估世界-动作漂移攻击,包括仅动作攻击和保持想象攻击,通过不同标准刻画攻击面,评估结果显示能大幅降低任务成功率,揭示WAM漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14428 2026-07-17 astro-ph.GA 新提交 67%

Accurate proper motions of the protostellar system VLA1623-2417

原恒星系统VLA1623 - 2417的精确自行

Ricardo Hernández Garnica, Laurent Loinard, Carlos Carrasco-González, Jazmín Ordóñez-Toro, Johanan Ramírez-Arellano, María José Maureira, Isaac C. Radley, Eleonora Bianchi, Claire J. Chandler, Luis F. Rodríguez, Rosa M. Torres, Aina Palau

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 对原恒星系统VLA1623 - 2417进行天体测量分析,结合多阵列观测数据得出各分量自行。Aa/Ab有轨道运动但难估质量,W与A、B投影距离减小,其运动不符弹出情景,推测W与A/B关系及轨道情况。

Comments Submitted to MNRAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14942 2026-07-17 hep-ex nucl-ex 新提交 50%

A Differential Neutral-to-Charged Current Double-Proton Observable for Studying Short-Range Correlations in Neutrino--Argon Scattering

用于研究中微子 - 氩散射中短程关联的微分中性流到带电流双质子可观测量

A. Bueno, D. Garcia-Gamez, C. Martin-Morales

专题命中 VLA模型 :action model(abstract)

AI总结 提出以中微子 - 氩相互作用中中性流与带电流双质子产生比率为可观测量研究短程关联,通过带电流与中性流相互作用差异及模拟预测比率变化,可利用现有设备测量,首次直接探测弱双核子发射同位旋结构。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01772 2026-07-17 cs.SE 版本更新 50%

Faster than the Team, Faster than the Customer: Tool Integration, Collaboration, and Organisational Lag in AI-assisted RE

比团队更快,比客户更快:AI辅助需求工程中的工具集成、协作与组织滞后

Jan-Philipp Steghöfer

专题命中 VLA模型 :action model(abstract)

AI总结 本文通过调查XITASO公司中AI辅助需求工程工具的使用情况,发现工具集成而非工具能力是主要约束,AI进展快于组织系统,导致收益集中在个人而团队和客户成为限制因素。

Comments Accepted for publication at the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026) -- Software Engineering in Practice Track (SEIP)

详情

展开后加载摘要…

URL PDF HTML 收藏