arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-07-21 至 2026-07-21 共收录 23 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 23 篇

2607.18231 2026-07-21 cs.RO 新提交 94%

FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich Manipulation

FM-VLA:用于接触丰富操作中视觉-语言-动作模型的基于力的记忆

Ruicheng Li, Qixiu Li, Ruichun Ma, Yu Deng, Lin Luo, Zhiying Du, Jianfeng Xiang, Huizhi Liang, Ruicheng Wang, Jiaolong Yang, Baining Guo

机构 * Tsinghua University(清华大学) Microsoft Research(微软研究院) Fudan University(复旦大学) USTC(中国科学技术大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 研究针对视觉-语言-动作模型在接触丰富操作中的时间上下文推理问题,提出FM-VLA模型,通过基于力的记忆编码及投影,利用累积接触事件历史指导操作,在相关任务上评估,轻量级力记忆表现出色,显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14409 2026-07-21 cs.RO cs.AI 版本更新 92%

Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack

Hy-Embodied-0.5-VLA:从视觉-语言-动作模型到真实世界机器人学习栈

He Zhang, Lingzhu Xiang, Haitao Lin, Zeyu Huang, Minghui Wang, Dingyan Zhong, Yubo Dong, Yihao Wu, Yongming Rao, Dongsheng Zhang, Wanjia He, Ling Chen, Kai Huang, Jiahao Chen, Sichang Su, Xumin Yu, Ziyi Wang, Chengwei Zhu, Xiao Teng, Yuchun Guo, Yufeng Zhang, Yuandong Liu, Rui Wang, Zisheng Lu, Han Hu, Zhengyou Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title);action model(title);分类 cs.RO、cs.AI

AI总结 提出端到端机器人学习栈HyVLA-0.5,涵盖数据收集、模型设计、预训练与微调、RL后训练及真实部署,各组件协同工作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16506 2026-07-21 cs.RO cs.LG 新提交 91%

Foresight Residual RL for Long-Horizon Robot Manipulation with Vision-Language-Action Models

用于基于视觉-语言-动作模型的长时机器人操作的前瞻性残差强化学习

Yuhan Liu, Xinyu Zhang, Litao Liu, Abdeslam Boularias

机构 * Department of Computer Science, Rutgers University(罗格斯大学计算机科学系)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.LG

AI总结 研究针对长时机器人操作中VLA策略的不足,提出前瞻性残差强化学习,通过离线估计前瞻性值优化交接质量,在螺母拧紧装配任务中,该方法全任务成功率高,优于标准方法和基线,强调塑造子任务成功状态对提升长时性能的重要性。

Comments Accepted at IROS2026. Project website: https://jaysparrow.github.io/foresight-residual-rl

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08015 2026-07-21 cs.RO 版本更新 91%

Q-VGM: Q-Value-Gradient Matching for Off-Policy Reinforcement Learning of Flow-Matching VLA

Q-VGM: 基于Q引导的值梯度匹配的流匹配VLA策略

Ziqian Wang, Yitian Liu, Xingjian Mao, Minqian Wang, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) University of Electronic Science and Technology of China(电子科技大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出Q-VGM离线强化学习方法,通过将值梯度转化为去噪时间上的值梯度场,避免反向传播去噪链,高效微调流匹配VLA策略,在LIBERO等任务上显著提升成功率。

Comments 13 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17157 2026-07-21 cs.CV cs.AI 新提交 90%

VLA-ReID: Video-Level Association for Re-Identification in Multi-Object Tracking with Highly Similar Objects

VLA-ReID:具有高度相似对象的多目标跟踪中用于重新识别的视频级关联

Yanrong Qin, Xiaoyan Cao, Yao Yao

机构 * Glasgow College, University of Electronic Science and Technology of China(电子科技大学格拉斯哥学院) Key Laboratory for Urban Habitat Environmental Science and Technology, School of Environment and Energy, Peking University Shenzhen Graduate School(北京大学深圳研究生院环境与能源学院城市人居环境科学与技术重点实验室) School of Management Science and Real Estate, Chongqing University(重庆大学管理科学与房地产学院)

专题命中 VLA模型 :VLA(title,title_cn);分类 cs.CV、cs.AI

AI总结 针对多目标跟踪中对象外观相似时身份保持难的问题,提出VLA-ReID方法,将重新识别建模为视频级关联,通过聚合历史轨迹特征等进行全局关联优化,实验显示该方法有效提升多项指标并减少身份切换。

Comments 11 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17786 2026-07-21 cs.RO cs.AI cs.CR cs.LG 新提交 90%

Reasoning as a Double-Edged Sword: Architecture and Cross-Stage Robustness in Vision-Language-Action Models

推理是一把双刃剑:视觉-语言-动作模型中的架构与跨阶段鲁棒性

Tuan Duong Trinh, Naveed Akhtar, Basim Azam

机构 * University of Melbourne(墨尔本大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 研究视觉-语言-动作模型中添加推理步骤对模型鲁棒性的影响,通过在三个模型上进行实验,发现潜在迭代模型鲁棒性最差,推理输出监测在公平测试下失败,计划-行动一致性探测器在自适应攻击下效果不佳,为可行防御设定了前提条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00037 2026-07-21 cs.CV cs.AI cs.RO 版本更新 89%

RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations

针对多模态扰动的视觉-语言-动作模型的鲁棒性

Jianing Guo, Zhenhong Wu, Chang Tu, Yiyao Ma, Xiangqi Kong, Zhiqian Liu, Jiaming Ji, Shuning Zhang, Yuanpei Chen, Kai Chen, Qi Dou, Yaodong Yang, Xianglong Liu, Huijie Zhao, Weifeng Lv, Simin Li

专题命中 VLA模型 :vision-language-action(title);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV、cs.AI

AI总结 本研究提出RobustVLA,通过多模态鲁棒优化提升视觉-语言-动作模型在多种扰动下的鲁棒性,实验表明其在性能和推理速度上均优于现有方法。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13458 2026-07-21 cs.NI 版本更新 88%

From Traditional Automation to Embodied Wireless Intelligence: Vision-Language-Action Empowered Physics-Aware Communication Networks

从传统自动化到具身无线智能:视觉-语言-动作赋能的物理感知通信网络

Genze Jiang, Kezhi Wang, Xiaomin Chen, Yizhou Huang

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract)

AI总结 提出具身智能基站(eBS)范式,采用视觉-语言-动作(VLA)流水线,使基站具备环境感知、因果物理推理和物理感知动作生成能力,实现从规则自动化到具身智能的转变。

Comments submitted for possible jounal publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06491 2026-07-21 cs.RO cs.AI 版本更新 88%

TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies

TempoVLA: 学习速度可控的视觉-语言-动作策略

Dong Jing, Jingchen Nie, Tianqi Zhang, Jiaqi Liu, Huaxiu Yao, Zhiwu Lu, Mingyu Ding

机构 * RUC(中国人民大学) FDU(福建大学) UNC(北卡罗来纳大学教堂山分校)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);action model(abstract);分类 cs.RO、cs.AI

AI总结 提出TempoVLA,通过可变速度轨迹增强和速度条件机制,实现机器人操作中速度的双向灵活控制,并支持动态速度调节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16938 2026-07-21 cs.CV cs.AI cs.LG cs.RO 新提交 86%

What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning

他们看到了什么?通过视觉-语言-动作模型的视角解读复杂道路场景以实现安全可靠的自动驾驶学习

Kalpana Panda, Wesley Maia, Vinti Agarwal, Ross Greer

机构 * Birla Institute of Technology and Science, Pilani(贝拉理工科学学院皮拉尼分校) University of California, Merced(加州大学默塞德分校)

专题命中 VLA模型 :vision-language-action(title);action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 研究自动驾驶模型内部逻辑不透明问题,提出反事实消融框架CVAA,通过移除摄像头图像中物体创建反事实集评估模型响应差异,应用于阿尔帕马约1轨迹预测器,分析物体因果影响,还通过可解释性技术深入理解模型,创建可解释驾驶系统巩固人机信任。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13597 2026-07-21 cs.RO cs.AI cs.CV 版本更新 86%

Semantic Anchoring for Robotic Action Representations

用于机器人动作表示的语义锚定

Yuan Xu, Youheng Shi, Chengyang Li, Wentao Zhu, Yizhou Wang

机构 * Peking University(北京大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 研究VLA模型微调后动作表示结构受损问题,受镜像神经元理论启发,通过系统探测证实结构变化与任务表现相关。提出即插即用方法,将动作表示锚定到语义流形并分解通道,经多基准测试验证,有效提升了模型在真实世界任务中的表现。

Comments Project Page: https://xy02-05.github.io/SemanticMN

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16636 2026-07-21 cs.RO 新提交 81%

PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution

PhyAgentOS:一种用于具身智能体的自进化操作系统,具有解耦的认知规划和物理执行

Yang Liu, Weixing Chen, Xinshuai Song, Tao Pu, Siwen Mo, Yongjie Bai, Zihao Chen, Qianran Sun, Liruo Zhong, Ying Shen, Liang Lin

机构 * X-Era Lab(X-Era实验室) HCP Lab, Sun Yat-sen University(中山大学HCP实验室) Peng Cheng Laboratory(鹏城实验室)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 研究为具身智能体提出PhyAgentOS操作系统,其以会话为最小调度单位,用文件系统解耦认知与物理执行,通过会话验证器区分执行与任务完成,经认知记忆整合结果,有分层安全约束,在多模型和实体上验证并优于其他系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27163 2026-07-21 cs.RO cs.AI cs.LG 版本更新 80%

Learning to Fold: prizewinning solution at LeHome Challenge 2026 (1st place online, 2nd offline)

学习折叠:LeHome Challenge 2026 获奖解决方案(在线第一名,离线第二名)

Ilia Larchenko

机构 * Independent Researcher(独立研究员)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出一种结合强化学习循环的视觉-语言-动作策略,通过自值函数实现优势估计、故障检测和候选选择,在LeHome Challenge 2026中获得在线第一名和离线第二名。

Comments Solution of the LeHome Challenge at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17454 2026-07-21 cs.RO 新提交 79%

Test-Time Scaling for World Action Models via Zero-Shot Geometric Evaluation

通过零样本几何评估实现世界行动模型的测试时缩放

Zesen Zhao, Minkyoung Cho, Hui shen, Boyuan Zheng, Kunxiao Gao, Yulong Cao, Z. Morley Mao

机构 * University of Michigan(密歇根大学) NVIDIA(英伟达)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 研究针对世界行动模型,提出无需训练的选择性测试时缩放框架\methodgated,基于预测未来的跨视图深度重投影一致性排序,经实验验证该方法能提高任务成功率,同时减少额外采样决策点,还识别出相关失败模式。

Comments Extened version of CVPR 2026 EAI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17115 2026-07-21 math.AP 新提交 78%

Enhanced stability and asymptotic limits to the non-isentropic compressible fluid-particle interaction model with thermal effects

具有热效应的非等熵可压缩流体-粒子相互作用模型的增强稳定性和渐近极限

Fucai Li, Jinkai Ni, Zhouping Xin

专题命中 VLA模型 :action model(title,abstract)

AI总结 研究具有热效应的非等熵可压缩流体-粒子相互作用模型。通过建立先验估计并取极限,证明该模型存在全局经典解且有最优衰减率,改进前人结果,证实爱因斯坦预测,揭示粒子对模型产生新耗散效应,开发新思想技术克服相关障碍。

Comments 76 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03387 2026-07-21 cs.RO 版本更新 77%

Feeling the Unexpected: ResTacVLA for Contact-Rich Manipulation via Residual Tactile Representation

感受意外:通过残差触觉表示实现用于丰富接触操作的ResTacVLA

Pengwei Zhang, Bin Xie, Xinpan Meng, Xinyu Guo, Ce Hao, Fang Deng, Long Cheng, Tiancai Wang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村科学城) Dexmal(德克斯马尔)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 为解决触觉感知融入视觉语言动作模型时的模态坍塌问题,提出ResTacVLA,将触觉数据转为残差触觉表示,过滤视觉可预测动态,经矢量量化瓶颈离散化,利用视觉先验不确定性自适应控制触觉整合。

Comments 8 pages, 6 figures, 3 tables. Accepted by IROS 2026, Project page: https://awilekong.github.io/ResTacVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28634 2026-07-21 cs.RO 版本更新 77%

PrimitiveVLA: Learning Reusable Motion Primitives for Efficient and Generalizable Robotic Manipulation

PrimitiveVLA:学习可复用的运动基元以实现高效且可泛化的机器人操作

Yutai Li, Shaohui Peng, Jiaming Guo, Di Huang, Zihao Zhang, Yuxuan Guo, Yunkai Gao, Siming Lan, Ling Li, Xing Hu, Yunji Chen

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) Jiangsu Key Laboratory of AI for Industries, Institute of AI for Industries, CAS(江苏人工智能工业重点实验室,人工智能工业研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Cambricon Technologies(寒武科技) Intelligent Software Research Center, Institute of Software, CAS(软件研究所智能软件研究中心,中国科学院) University of Science and Technology of China(中国科学技术大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出PrimitiveVLA框架,通过将视觉-语言-动作模型从直接指令到控制映射转向以基元为中心的拆解与组装范式,利用多模态规范表示和自动化流水线,提升数据效率并实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17776 2026-07-21 astro-ph.GA 新提交 67%

Structural and dynamical properties of Tidal dwarf galaxies in the tails and bridge of the Guitar galaxy Arp 105

吉他星系Arp 105尾巴和桥中潮汐矮星系的结构与动力学性质

Jyoti Prakash, Kanak Saha

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 研究阿贝尔1185星系团中Arp 105系统内潮汐矮星系及潮汐桥,通过多波长分析其恒星形成、金属度等性质,利用光谱能量分布建模得恒星质量,还估计动力学质量比,发现暗物质不足,后续观测或增进对潮汐矮星系形成的理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17867 2026-07-21 eess.AS 新提交 50%

The tttAI System for the TSA-ASR Task of the SmartGlasses Challenge 2026

用于2026年智能眼镜挑战赛TSA-ASR任务的tttAI系统

Xuanji He, Gaoyang Dong, Xiaoxiao Li, Minchuan Chen, Fengjie Zhu

专题命中 VLA模型 :action model(abstract)

AI总结 介绍用于2026年智能眼镜挑战赛TSA-ASR任务的tttAI系统,针对长音频、多说话人及语音重叠挑战,提出级联架构,含说话人日记化等模块,最终系统用特定模型和通道,在赛道2获34.04%的tcpCER并排名第二。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17092 2026-07-21 cs.IR 新提交 50%

Uncertainty as Remedy: Mitigating Satisfaction Label Bias in Short Video Multi-Objective Ensemble Ranking

不确定性作为补救措施:减轻短视频多目标集成排序中的满意度标签偏差

Zonghe Shao, Tiantian He, Xiaoxiao Xu, Jiaqi Yu, Minzhi Xie, Jinfang Gu, Yongqi Liu, Kaiqiao Zhan, Kun Gai

专题命中 VLA模型 :action model(abstract)

AI总结 研究短视频推荐中多目标集成排序模型因用户行为信号带来的满意度标签偏差问题,提出UAME框架,将模型预测表示为高斯评分变量,设计概率成对排序损失和加权方案减轻偏差,实验证明其能改进现有范式并与用户满意度更好对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17723 2026-07-21 math.NA cs.NA 新提交 50%

A domain decomposition online-learning-enhanced nonlinear elimination preconditioner

一种区域分解在线学习增强的非线性消除预条件器

Pai Zhang, Linyan Gu, Li Luo

专题命中 VLA模型 :action model(abstract)

AI总结 针对非线性消除预处理中识别收敛慢分量的挑战,提出在线学习增强的NE预条件器,从残差主导结构识别不良子集,集成到并行区域分解框架,实验表明该方法能产生可靠连贯的不良子集,收敛性优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17488 2026-07-21 astro-ph.SR astro-ph.HE astro-ph.IM 新提交 50%

Surrogate models for type II supernovae: Probing low-energy explosions and interaction-free regimes

II型超新星的替代模型:探索低能量爆炸和无相互作用状态

Zhengyang Zhang, Shuai Zha, Nikhil Sarin, Takashi J. Moriya, Chengyuan Wu, Bo Wang

专题命中 VLA模型 :action model(abstract)

AI总结 针对II型超新星样本分析的计算瓶颈,提出基于STELLA的两个神经网络替代模型,利用自动编码器、模拟器及正则化等技术,应用于多个超新星,能快速进行物理特征描述并大幅减少贝叶斯推断时间。

Comments 29 pages, 7 figures; accepted for publication in Physical Review D

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15634 2026-07-21 astro-ph.HE astro-ph.CO 版本更新 50%

Simulating the LOcal Web (SLOW) -- VI: Gamma-ray Emission in the Local Universe

模拟本地宇宙(SLOW)——VI:本地宇宙中的伽马射线发射

Ludwig M. Böss, Ildar Khabibullin, Daniel Karner, Klaus Dolag, Ulrich P. Steinwandel, Elena Hernandez-Martinez, Jenny G. Sorce

专题命中 VLA模型 :action model(abstract)

AI总结 该研究旨在估计本地宇宙中星系团和宇宙网在Fermi-LAT波段的弥漫伽马射线发射,通过首个带即时光谱CR模型 的宇宙学磁流体动力学模拟,发现CR质子加速及相关发射情况,为相关研究提供了下限参考。

Comments 13 pages, 9 figures, accepted in A&A. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏