arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-07-09 至 2026-07-09 共收录 18 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 18 篇

2607.06706 2026-07-09 cs.RO cs.AI cs.LG 新提交 93%

Vision Language Action (VLA) Models for Unmanned Aerial Robotics and Bimanual Manipulation: A Review

用于无人机机器人和双手操作的视觉语言动作(VLA)模型综述

Inkyu Sa, Chanoh Park, Hea-Min Lee, Donghee Noh, Ho Seok Ahn

机构 * Chef Robotics RovifyLab IT Application Research Center, Jeonbuk Regional Branch Department of Electrical, Computer and Software Engineering(电气与计算机软件工程系)

专题命中 VLA模型 :VLA(title,title_cn);vision language action(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 综述2017 - 2026年183篇文献,围绕视觉语言动作模型在无人机机器人和双手操作方面的应用,涵盖多维度,表明双手VLA相关策略可转移至无人机系统,还确定了两领域的14个研究方向。

Comments 56 pages, 11 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05693 2026-07-09 cs.RO cs.AI 版本更新 92%

HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies

HiMoE-VLA:用于通用视觉-语言-动作策略的分层专家混合模型

Zhiying Du, Bei Liu, Yaobo Liang, Yichao Shen, Haidong Cao, Xiangyu Zheng, Zhiyuan Feng, Zuxuan Wu, Jiaolong Yang, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Xi’an Jiaotong University(西安交通大学) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title);分类 cs.RO、cs.AI

AI总结 研究通用视觉-语言-动作策略训练中异构性引发的负迁移问题,提出HiMoE-VLA框架,通过分层专家混合动作模块及两个辅助目标来解决,在多项任务上取得较好结果,还能将负迁移转化为正迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07608 2026-07-09 cs.RO cs.CV 新提交 92%

Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation

用于机器人操作的视觉-语言-动作模型中的双潜记忆

Hongyu Qu, Jianzhe Gao, Xiaobin Hu, Shaohuan Yang, Xinlei Yu, Rui Yan, Wenguan Wang, Xiangbo Shu, Shuicheng Yan

机构 * Nanjing University of Science and Technology(南京理工大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 研究针对主流VLA模型处理长期任务的不足,提出LaMem-VLA框架,通过四个协调组件将历史经验重构为潜记忆令牌并与VLA推理直接交织,实现在同一潜空间处理历史经验,经实验验证该框架具有优越性。

Comments Project page: https://github.com/quhongyu/LaMem-VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05116 2026-07-09 cs.CV cs.AI cs.RO 版本更新 89%

VOTE: Vision-Language-Action Optimization with Trajectory Ensemble Voting

VOTE:基于轨迹集成投票的视觉-语言-动作优化

Juyi Lin, Amir Taherin, Arash Akbari, Arman Akbari, Lei Lu, Guangyu Chen, Taskin Padir, Xiaomeng Yang, Weiwei Chen, Yiqian Li, Xue Lin, David Kaeli, Pu Zhao, Yanzhi Wang

机构 * Northeastern University(东北大学) Cisco(思科) EmbodyX

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title);vision language action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 针对VLA模型生成令牌多、动作利用不足的问题,开发训练框架微调模型减少令牌生成,引入基于投票的集成策略优化推理,相比现有模型性能更优,推理更快,证明了实际可部署性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06678 2026-07-09 cs.RO 新提交 84%

NativeMEM: Native Memory Compression for Long-Horizon Robotic Manipulation

NativeMEM:用于长期机器人操作的原生内存压缩

Ziye Wang, Modi Shi, Chaojun Ni, Jiazhi Yang, Mengdi Li, Zhizhong Su, Tianwei Lin, Hongyang Li

机构 * The University of Hong Kong(香港大学) Beihang University(北京航空航天大学) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学) Horizon Robotics(地平线机器人)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 研究如何让预训练VLA模型高频更新时保留长期视觉历史且高效。提出NativeMEM策略,用原生内存压缩编码,通过开发分词器对齐内存令牌与策略,该方法在模拟和真实机器人实验中效果好,数据效率高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24892 2026-07-09 cs.CV 版本更新 84%

X-Foresight: A Joint Vision-Action Causal Forecasting Network via Predictive World Modeling

X-Foresight:一种通过预测世界建模的联合视觉-动作因果预测网络

Baolu Li, Jingyu Qian, Rui Guo, Yilun Chen, Hanpeng Liu, Yuan Lin, Junhong Zhou, Ruixin Liu, Liu Yang, Yutong Zheng, Zhenli Zhang, Sean Li, Chaoda Zheng, Boyang Wang, Tenglong, Gu, Zhuangzhuang Ding, Pengkun Zheng, Yu Zhang, Xianming Liu

机构 * PWM Team(PWM团队) XPeng Inc.(XPeng公司)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.CV

AI总结 提出X-Foresight,一种将预测世界模型直接集成到VLA架构中的方法,通过长程分块自回归策略和课程学习,联合学习世界建模与实时动作控制,以解决视频预测中的低熵冗余和长程因果建模难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06777 2026-07-09 astro-ph.HE 新提交 80%

Radio Observations of the Unusual Tidal Disruption Event AT 2022wtn: a Fast and Highly Energetic Outflow

对异常潮汐瓦解事件AT 2022wtn的射电观测:快速且高能的外流

Gavin Farley, Tanmoy Laskar, Noah Franz, Collin T. Christy, Coleman Rohde, A. J. Goodwin, Kate D. Alexander, Edo Berger, Yvette Cendes, Ryan Chornock, Tarraneh Eftekhari, Walter W. Golay, Wenbin Lu, Raffaella Margutti

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 该研究通过VLA和GMRT对潮汐瓦解事件AT 2022wtn进行多时期多频率射电观测,利用均分分析框架建模并估计物理参数,对比不同几何模型,排除相对论性喷流,探讨外流起源,发现吸积盘状态转变外流符合结果,此TDE独特且强大。

Comments 20 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06712 2026-07-09 astro-ph.GA 新提交 80%

The nature of Cloud-9: a compact core embedded in a diffuse envelope

云九的本质:嵌入弥散包层的致密核心

Ruilei Zhou, Ming Zhu, Chuan-Peng Zhang, Jinlong Xu

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 该研究利用FAST和VLA数据观测云九,发现其HI有双组分结构,核心致密静止,包层延展且有速度梯度,不支持旋转,与环境相互作用有关,排除恒星组分后表明云九是暗物质主导系统,符合剥离的重子遗迹情景。

Comments 6 pages, 5 figures, Accepted by MNRAS Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07403 2026-07-09 cs.MA cs.RO 新提交 77%

Multi-Agent Robotic Control with Onboard Vision-Language Models

基于机载视觉语言模型的多智能体机器人控制

Kajetan Rachwał, Maciej Majek, Bartłomiej Boczek, Jakub Matejczyk, Dominik Matejkowski, Adam Dąbrowski, Tim Seyde, Alexander Amini, Maria Ganzha

机构 * Faculty of Mathematics and Information Science, Warsaw University of Technology(华沙技术大学数学与信息科学学院)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision language action(abstract);分类 cs.RO

AI总结 研究针对视觉语言模型用于机器人控制的挑战,提出多智能体系统架构,在机载硬件部署智能体,用紧凑型VLMs并经微调及新型编排智能体,经硬件在环模拟验证,证明该机载架构可行高效,有实际应用潜力且模拟环境已开源。

Comments 6 pages, 2 figures, accepted to 24th International Conference on Practical applications of Agents and Multi-Agent Systems (PAAMS'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05945 2026-07-09 cs.CV cs.CL 77%

MobileEgo Anywhere: Open Infrastructure for long horizon egocentric data on commodity hardware

MobileEgo Anywhere:基于商用硬件的长时域自我中心数据开放基础设施

Senthil Palanisamy, Abhishek Anand, Satpal Singh Rathore, Pratyush Patnaik, Shubhanshu Khatana, Ekaksh Janweja

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) University of Washington(华盛顿大学) University of California, Los Angeles(加州大学洛杉矶分校) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.CV

AI总结 提出MobileEgo Anywhere框架,利用智能手机传感器实现超过一小时的自我中心轨迹采集,并发布开源处理流水线STERA、移动应用及200小时数据集,验证其在视觉-语言-动作模型训练中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02076 2026-07-09 cs.LG cs.AI 版本更新 76%

FDRMFL: Multimodal Federated Feature Extraction Model Based on Information Maximization and Contrastive Learning

FDRMFL:基于信息最大化和对比学习的多模态联邦特征提取模型

Haozhe Wu

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG

AI总结 针对非IID数据分布下联邦回归的多模态特征提取难题,提出FDRMFL框架,通过统一的四项局部目标应对挑战,实验表明该框架能有效降低平均MSE,在六种联邦算法中表现最佳。

Comments Accepted author manuscript; published version DOI: 10.1016/j.asoc.2026.115874

Journal ref Applied Soft Computing 202 (2026) 115874

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31832 2026-07-09 physics.comp-ph cond-mat.stat-mech 新提交 71%

Navigating committor landscape of biomolecules with a general pairwise interaction model

利用通用成对相互作用模型导航生物分子的提交者景观

Jintu Zhang, Zichang Jin, Huifeng Zhao, Kai Zhu, Bowei Zhao, Xujun Zhang, Peilin Kang, Tingjun Hou

专题命中 VLA模型 :action model(title)

AI总结 提出基于AlphaFold 3范式的提交者学习框架,通过轻量级原子嵌入和简化Pairformer架构,准确捕捉生物系统动力学特征,揭示了chignolin折叠的过渡态结构和杯芳烃主客体系统的结合路径调控机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16752 2026-07-09 quant-ph 版本更新 71%

Characterizing Phase Fragility via Algorithmically Prepared Ancillas in Repeated-Interaction Models

通过重复相互作用模型中算法制备的辅助量子比特表征相位脆弱性

S. Elham Mousavigharalari, Deniz Türkpençe

专题命中 VLA模型 :action model(title)

AI总结 研究通过单比特门序列编码的相位参数$\phi$在噪声动力学下的量子费希尔信息,采用碰撞模型和脉冲分辨开放系统模拟两种方法,结果表明二者QFI分布对相位依赖性相似,稳态框架可表征相位敏感性,还给出未来应用方向。

Comments 21 pages, 5 figures. This work presents an analytic and simulation-based study of phase sensitivity in noisy quantum devices, linking collision models and device-level simulations via quantum Fisher information, and will be of interest to readers in quantum computing and quantum metrology

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04443 2026-07-09 cs.CV cs.AI cs.GR cs.LG 新提交 67%

Wan-Streamer v0.2: Higher Resolution, Same Latency

万流播器v0.2:更高分辨率,相同延迟

Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zoubin Bi

机构 * Alibaba Group(阿里巴巴集团)

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 介绍万流播器v0.2,它保持v0.1建模公式,将交互输出流分辨率提高,在保持低延迟下支持场景中景智能体。核心方法是优化架构,主要贡献是提升分辨率同时保持低延迟,集中硬件于视觉生成。

Comments Website: https://wan-streamer.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28469 2026-07-09 cs.RO cs.HC 版本更新 57%

When May I Help You? On The Effect of Proactivity on Group Human-Robot Collaboration

我何时能帮你?主动性对群体人机协作的影响

Thomas Vitry, Vanessa Maeder, Kieran von Valeburg, Asihati Hazaiti, Doga Deniz Ates, Connor Gäde, Jan-Gerrit Habekost, Dennis Becker, Stefan Wermter

机构 * Knowledge Technology, University of Hamburg(汉堡大学知识技术研究所) Ecole Normale Superieure de Rennes(里昂大学)

专题命中 VLA模型 :action model(abstract);分类 cs.RO

AI总结 研究在多人协作逃生室中,机器人采用反应式(仅被叫时响应)与主动式(持续监听并自主贡献)交互模型对协作效果的影响,发现主动模型增加交互频率但反应模型成功率更高,且用户先前经验和性格显著调节效果。

Comments Published at the RO-MAN 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07182 2026-07-09 astro-ph.IM 新提交 50%

A search for narrowband technosignatures from LTT 3780 with the Allen Telescope Array and the Karl G. Jansky Very Large Array

利用艾伦望远镜阵列和卡尔·G·扬斯基甚大阵列对LTT 3780的窄带技术信号进行搜索

Chenoa D. Tremblay, Sofia Z. Sheikh, Vishal Gajjar, Nikku Madhusudhan, Isabel Gerrard, Daniel Czech, Talon Myburgh, David E. MacMahon, Ross A. Donnachie, Andrew P. V. Siemion, Matthew Lebofsky, Alex W. Pollak

专题命中 VLA模型 :VLA(abstract)

AI总结 该研究利用艾伦望远镜阵列和卡尔·G·扬斯基甚大阵列,对LTT 3780系统进行无线电技术特征观测,搜索1-10GHz窄带多普勒漂移信号,未发现候选信号,给出功率限制,展示了互补策略用于系外行星研究,为未来联合调查探路。

Comments Accepted in ApJ Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07598 2026-07-09 math.PR math.AP 新提交 50%

Universal Central Limit Theorem for non-exchangeable interacting diffusions

非可交换相互作用扩散的泛中心极限定理

Mykhaylo Shkolnikov, Lane Chun Yeung

专题命中 VLA模型 :action model(abstract)

AI总结 研究非可交换相互作用扩散,在适当条件下证明其全局涨落场的泛中心极限定理,粒子数\(n\)变大时依分布收敛到随机偏微分方程的唯一解,结果适用于特定正则图,还表明\(n^{-1/2}\)稠密性阈值是尖锐的。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07662 2026-07-09 nlin.AO physics.app-ph physics.comp-ph 新提交 50%

Impact of Channel Dynamics on Higher-order Interactions of Oscillators

通道动力学对振荡器高阶相互作用的影响

Gabriel Marghoti, Isabela A. Martins, Giovana S. Spezzatto, Emanuel B. S. A. Cambraia, Sergio R. Lopes, Thiago L. Prado

专题命中 VLA模型 :action model(abstract)

AI总结 研究通道动力学对振荡器高阶相互作用的影响,证明标准三体Kuramoto耦合与由潜在变量调制的成对连接等效,指出放松绝热约束后潜在通道时间尺度决定宏观状态,还阐述了传输惯性等作用,表明整合潜在变量可弥补仅依赖静态拓扑的局限。

Comments 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏