arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-05-21 至 2026-05-21 共收录 14 信号源:cs.RO, cs.CV, cs.AI, cs.LG
2605.20774 2026-05-21 cs.RO 94%

VLA-REPLICA: A Low-Cost, Reproducible Benchmark for Real-World Evaluation of Vision-Language-Action Models

VLA-REPLICA: 一种低成本、可重复的现实世界评估视觉-语言-动作模型的基准

Alex S. Huang, Jiahui Zhang, Shiqing Tang, Yu Xiang

机构 * Intelligent Robotics and Vision Lab, University of Texas at Dallas(德克萨斯大学达拉斯分校智能机器人与视觉实验室) Allen High School(艾伦高中)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 本文提出VLA-REPLICA,一种低成本、可重复的现实世界评估视觉-语言-动作模型的基准,通过使用现成组件构建,提供一致的环境用于政策评估,并包含多样化的操作任务和小规模演示数据集,用于目标域适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18532 2026-05-21 cs.CV cs.AI cs.RO 92%

VLANeXt: Recipes for Building Strong VLA Models

VLANeXt: 构建强大VLA模型的配方

Xiao-Ming Wu, Bin Fan, Kang Liao, Jian-Jian Jiang, Runze Yang, Yihang Luo, Zhonghua Wu, Wei-Shi Zheng, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院) Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文通过统一框架和评估设置重新审视VLA设计空间,系统分析了基础组件、感知要素和动作建模视角,总结出12项关键发现,提出了一种简单有效的VLA模型VLANeXt,并在LIBERO和LIBERO-plus基准测试中超越了现有方法,同时提供了易于使用的代码库。

Comments Accepted in ICML 2026, Project Page: https://dravenalg.github.io/VLANeXt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21061 2026-05-21 cs.CV cs.AI cs.RO 90%

Grounding Driving VLA via Inverse Kinematics

通过逆运动学接地驾驶VLA

Junsung Park, Hyunjung Shim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) KimJaeChul AI Graduate School(金 JaeChul人工智能研究生院)

专题命中 VLA模型 :VLA(title,title_cn);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出通过逆运动学求解器重新设计驾驶VLA,以解决轨迹预测中对视觉token的忽略问题,通过引入视觉状态预测和逆运动学网络,提升了视觉接地和轨迹规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15157 2026-05-21 cs.RO cs.LG 90%

Hand-in-the-Loop: Improving VLA Policies for Dexterous Manipulation via Seamless Hand-Arm Intervention

手在环中:通过无缝手臂干预改进VLA策略以实现灵巧操作

Zhuohang Li, Liqun Huang, Wei Xu, Zhengming Zhu, Nie Lin, Xiao Ma, Xinjun Sheng, Ruoshi Wen

机构 * State Key Laboratory of Mechanical System and Vibration, School of Mechanical Engineering, Shanghai Jiao Tong University(机械系统与振动国家重点实验室,机械工程学院,上海交通大学) Shanghai Key Laboratory of Intelligent Robotics, Meta Robotics Institute, Shanghai Jiao Tong University, Shanghai 200240, China(智能机器人上海市重点实验室,元机器人研究院,上海交通大学,上海200240,中国) The University of Tokyo(东京大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 本文提出Hand-in-the-Loop方法,通过无缝整合人类干预与自主策略执行,减少手部操作中的突兀变化,提升双臂灵巧操作的鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21414 2026-05-21 cs.RO cs.CV 90%

PointACT: Vision-Language-Action Models with Multi-Scale Point-Action Interaction

PointACT: 多尺度点-动作交互的视觉-语言-动作模型

Shizhe Chen, Paul Pacaud, Cordelia Schmid

机构 * Inria(法国国家信息与自动化研究所) École normale supérieure(法国高等科学研究院) CNRS(法国国家科学研究中心) PSL Research University(巴黎综合理工研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 本文提出PointACT,一种集成层次化3D点云表示的3D感知视觉-语言-动作政策,通过多尺度点-动作交互机制提升机器人在3D环境中的精细几何推理和空间定位能力。

Comments Accepted to RSS 2026; project webpage: https://cshizhe.github.io/projects/pointact.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12334 2026-05-21 cs.AI 84%

Reinforcing VLAs in Task-Agnostic World Models

在任务无关的世界模型中强化视觉-语言-动作

Yucen Wang, Rui Yu, Fengming Zhang, Junjie Lu, Xinyao Qin, Tianxiang Zhang, Kaixin Wang, Li Zhao

机构 * Microsoft Research Asia(微软亚洲研究院) Nanjing University(南京大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Wuhan University(武汉大学) University of Technology Sydney(悉尼科技大学) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.AI

AI总结 本文提出RAW-Dream方法,通过分离世界模型学习与下游任务依赖,利用预训练的世界模型和现成的视觉-语言模型,实现零样本推理,从而在无需任务特定数据的情况下提高VLA适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14201 2026-05-21 cs.RO cs.CV 79%

MAPLE: Latent Multi-Agent Play for End-to-End Autonomous Driving

MAPLE:基于潜在空间的多智能体交互用于端到端自动驾驶

Rajeev Yasarla, Deepti Hegde, Hsin-Pai Cheng, Shizhong Han, Yunxiao Shi, Meysam Sadeghigooghari, Hanno Ackermann, Litian Liu, Pranav Desai, Fatih Porikli, Mohammad Ghavamzadeh, Hong Cai

机构 * Qualcomm AI Research(英矽人工智能研究)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 本文提出MAPLE框架,通过在视觉-语言-动作模型的潜在空间中实现反应式多智能体滚动,以解决传统模仿学习框架下闭环设置中模型易碎的问题,通过监督微调和强化学习结合多样性奖励,实现了可扩展且无需外部模拟器的闭环训练,提升了端到端自动驾驶系统的鲁棒性。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11151 2026-05-21 cs.AI cs.RO 79%

RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking

RankQ: 通过自监督动作排名实现离线到在线强化学习

Andrew Choi, Wei Xu

机构 * Horizon Robotics(地平线机器人)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 该研究提出RankQ方法,通过自监督多项排名损失增强时序差分学习,以在大状态-动作空间中更准确地学习批评器,从而在稀疏奖励D4RL基准和基于视觉的机器人学习中实现更高效的离线到在线微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17568 2026-05-21 cs.LG 74%

Structured Neural Marked Point Processes for Interpretable Event Interaction Modeling

结构化神经标记点过程用于可解释的事件交互建模

Zhitong Xu, Qiwei Yuan, Yinghao Chen, Shandian Zhe, Bin Shen

机构 * Kahlert School of Computing, University of Utah(犹他大学计算学院) Celonis AI

专题命中 VLA模型 :action model(title);分类 cs.LG

AI总结 本文提出了一种结构化神经标记点过程(SNMPP),通过显式发现事件级和类别级的关系,实现高灵活性的建模,同时在合成和现实数据集上验证了其揭示结构关系和强预测性能的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21068 2026-05-21 astro-ph.HE 67%

The radio emission from radiative filaments of Cygnus Loop

天鹅圈辐射丝的无线电发射

D. Urošević, M. Andjelić, M. D. Filipović, Z. J. Smeaton, E. Crawford, J. Raymond, D. Onić

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 研究天鹅圈中非辐射和辐射丝的无线电频谱指数,发现其辐射丝主要通过热布鲁姆斯特拉赫尔机制发射无线电波,与超新星残骸的非热谱斜率不同。

Comments 8 pages, 3 figures, ApJ accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10455 2026-05-21 cs.IR cs.LG 57%

Compute Only Once: UG-Separation for Efficient Large Recommendation Models

只计算一次:用于高效大规模推荐模型的UG分离

Hui Lu, Zheng Chai, Shipeng Bai, Hao Zhang, Zhifang Fan, Kunmin Bai, Ke Sun, Yingwen Wu, Bingzheng Wei, Xiang Sun, Ziyan Gong, Tianyi Liu, Hua Chen, Deping Xie, Zhongkai Chen, Zhiliang Guo, Qiwei Chen, Yuchao Zheng

机构 * ByteDance AML(字节跳动人工智能实验室)

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 本文提出UG分离方法,通过在TokenMixer密集交互模型中显式分离用户侧和物品侧的信息流,实现用户侧计算的重用,从而减少冗余推理成本,并通过信息补偿策略和权重量化技术提升效率。

Comments Large Recommender Model, Industrial Recommenders, Scaling Law

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20223 2026-05-21 cs.CV 57%

Why Latent Actions Fail, and How to Prevent It

为何潜在动作失效,以及如何防止它

Jung Min Lee, Taehyun Cho, Li Zhao, Jungwoo Lee

机构 * Seoul National University(首尔国立大学) Microsoft Research(微软研究院)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 本文研究了潜在动作模型中外部状态对动作学习的干扰问题,并提出通过聚焦内生成分来缓解噪声干扰的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20212 2026-05-21 math.GM 50%

Robust Chance Constrained Complex Zero-Sum Games

鲁棒机会约束复零和博弈

Raneem Madani, Abdel Lisser, Zeno Toffano

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出了一种统一的零和博弈框架,其中纯策略和收益矩阵都包含复数元素。通过利用复数和实向量空间之间的线性同构关系,将实值凸分析的关键结果扩展到复数域,建立了极小极大定理的有效性和鞍点结构的保持。在此基础上,提出了一种复零和博弈模型,使混合策略能够与收益矩阵的实部和虚部相互作用,并通过关联的对偶问题来表征其鞍点均衡。为引入不确定性,我们引入了一个复机会约束零和博弈模型(3CP),该模型处理由复线性泛函定义的个体概率约束。首先在已知的精确分布下研究3CP公式,专注于复椭圆对称随机变量,这扩展了复高斯家族。然后将框架扩展到基于矩的模糊集,包括:(i) 具有已知第一二矩的分布,(ii) 具有未知二阶矩的分布,以及(iii) 完全分布未知矩的分布。在所有情况下,概率约束都允许确定性的二次锥表示,确保了凸可行策略集,并能够显式表征复博弈值。数值实验,包括发射机-干扰机波形交互模型,展示了所提框架如何捕捉复混合策略的行为。此外,我们评估了外推率,并确认了实际行为与理论保证高度一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01355 2026-05-21 stat.ME econ.EM 50%

A Practical Guide to Estimating Conditional Marginal Effects: Modern Approaches

一种估计条件边际效应的实用指南:现代方法

Jiehan Liu, Ziyi Liu, Yiqing Xu

专题命中 VLA模型 :action model(abstract)

AI总结 本文提供了一种使用现代统计方法估计条件边际效应的实用指南,讨论了处理效应如何随调节变量变化,并改进了现有解决方案,如半参数核估计器,引入了稳健的估计策略,如AIPW-Lasso和DML,并通过模拟和实证例子评估了每种方法,提供了针对样本量和研究背景的实用建议。

详情

展开后加载摘要…

URL PDF HTML 收藏