arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-06-02 至 2026-06-02 共收录 51 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 45 篇

2605.12369 2026-06-02 cs.RO 84%

GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization

GuidedVLA: 通过即插即用的动作注意力特化指定任务相关因素

Xiaosong Jia, Bowen Yang, Zuhao Ge, Xian Nie, Yuchen Zhou, Cunxin Fan, Yufeng Li, Yilin Chai, Chao Jing, Zijian Liang, Qingwen Bu, Haidong Cao, Chao Wu, Qifeng Li, Zhenjie Yang, Chenhe Zhang, Hongyang Li, Zuxuan Wu, Junchi Yan, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI (TEAI)(可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) Shanghai Jiao Tong University(上海交通大学) OpenDriveLab, The University of Hong Kong(OpenDrive实验室,香港大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 提出GuidedVLA框架,通过为动作解码器中的注意力头分配人工定义的辅助信号(如物体定位、空间几何、时序技能逻辑),显式引导模型关注任务相关因素,提升VLA模型在域内和域外场景的成功率。

Comments Accepted to RSS 2026. Project page: https://guidedvla.github.io/project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01847 2026-06-02 cs.RO cs.LG 81%

The Lie We Tell: Correcting the Euclidean Fallacy in Vision Language Action Policies via Score Matching on Tangent Space

我们说的谎言:通过切空间上的分数匹配纠正视觉-语言-动作策略中的欧几里得谬误

Bing-Cheng Chuang, I-Hsuan Chu, Bor-Jiun Lin, YuanFu Yang, Min Sun, Chun-Yi Lee

机构 * National Taiwan University(台湾大学)

专题命中 VLA模型 :vision language action(title);vision-language-action(abstract);分类 cs.RO、cs.LG

AI总结 针对扩散视觉-语言-动作策略将SE(3)位姿表示为平坦R^12向量导致的欧几里得谬误,提出Lie Diffuser Actor (LDA)框架,通过左不变SDE注入噪声、在切空间预测分数并利用指数映射回缩样本,从根本上消除流形漂移、保证坐标框架等变性和测地线最优性,在CALVIN ABC→D上平均任务长度从3.27提升至3.51。

Comments ICML 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00252 2026-06-02 cs.RO cs.LG 79%

HOIST: Humanoid Optimization with Imitation and Sample-efficient Tuning for Manipulating Suspended Loads

HOIST: 基于模仿和样本高效微调的人形机器人悬挂负载操作优化

Songyang Liu, Shunyu Yao, Dingyuan Huang, Shuai Li

机构 * Department of Civil and Coastal Engineering, University of Florida(土木与海岸工程系,佛罗里达大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.LG

AI总结 提出HOIST方法,结合模仿学习和样本高效的批量强化学习,优化人形机器人操控悬挂负载的放置精度和停止行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00090 2026-06-02 cs.RO cs.AI 79%

Silent Failures in Physical AI: A Literature Review of Runtime Action Authorization for Autonomous Systems

物理AI中的静默故障:自主系统运行时动作授权的文献综述

Barak Or

机构 * STATE16

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);embodied foundation model(abstract);分类 cs.RO、cs.AI

AI总结 本文综述了物理AI系统中黑箱模型发出看似合理但实际错误的物理动作导致的静默故障问题,提出了运行时防护栏的分类和评估要求。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10276 2026-06-02 cs.RO cs.AI 79%

RoboBenchMart: Benchmarking Robots in Retail Environment

RoboBenchMart:零售环境中的机器人基准测试

Konstantin Soshin, Alexander Krapukhin, Andrei Spiridonov, Gregorii Bukhtuev, Andrey Kuznetsov, Vlad Shakhuro, Denis Shepelev

机构 * FusionBrain Lab, Robotics Group(融合大脑实验室,机器人组) NUST MISIS Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学)

专题命中 VLA模型 :VLA(summary_cn,abstract_cn);分类 cs.RO、cs.AI

AI总结 针对零售环境中的移动操作任务,提出RoboBenchMart开源模拟基准,通过密集杂乱物品和复杂空间配置评估通用视觉-语言-动作模型(VLA),发现现有模型在常见零售任务中仍表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00449 2026-06-02 cs.RO 77%

ROG-Grasp: Root-Oriented Geometry for Robotic Grasping and Placement

ROG-Grasp:面向根部的几何方法用于机器人抓取与放置

Zijian An, Augustus Sroka, Ran Yang, Bill Cai, Satoru Eto, Brian Poon, Kelvin Cai, Shijie Geng, Feng Liu, Yiming Feng, Lifeng Zhou

机构 * Department of Electrical and Computer Engineering, Drexel University(德雷塞尔大学电气与计算机工程系) Virginia Seafood Agricultural Research and Extension Center, and Department of Biological Systems Engineering, Virginia Tech(弗吉尼亚理工学院生物系统工程系和弗吉尼亚海鲜农业研究与推广中心) Amazon Store Foundation AI (SFAI)(亚马逊商店基金会人工智能(SFAI))

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出基于根部表面几何的ROG-Grasp框架,通过RGB-D感知估计农产品朝向,结合YOLO检测器和点云平面拟合生成稳定抓取姿态,在番茄和洋葱实验中实现高成功率与快速执行。

Comments Comments: 7 pages, 6 figures. Video: https://youtu.be/Ir2UtGODdMo

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00113 2026-06-02 cs.RO 70%

World Models for Robotic Manipulation: A Survey

机器人操作的世界模型:综述

Fangyuan Wang, Ziyuan Wang, Guorui Pei, Mengshi Zhang, Canxi Liang, Jun Hu, Zhongxuan Li, Jinsong Wu, Ning Han, Zeqing Zhang, Jiaming Qi, Hongmin Wu, Shiyao Zhang, Pai Zheng, Jia Pan, David Navarro-Alarcon, Sichao Liu, Peng Zhou

机构 * Department of Mechanical Engineering, The Hong Kong Polytechnic University(香港理工大学机械工程系) Department of Mechanical Engineering and Automation, Harbin Institute of Technology(哈尔滨工业大学机械工程与自动化系) School of Advanced Engineering, Great Bay University(大湾大学先进工程学院) College of Robotics Science and Engineering, Taiyuan University of Technology(太原科技大学机器人科学与工程学院) School of Data Science, City University of Hong Kong (Dongguan)(香港城市大学(东莞)数据科学学院) Department of Mechatronic Engineering, Guangdong Polytechnic Normal University(广东 polytechnic 正常大学机电工程系) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) College of Mechanical and Electrical Engineering, Northeast Forestry University(东北林业大学机械与电气工程学院) Greater Bay Area National Center of Technology Innovation(粤港澳大湾区国家技术创新中心) Department of Industrial and Systems Engineering, The Hong Kong Polytechnic University(香港理工大学工业与系统工程系)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 本文通过三个问题(预测什么未来表示、预测如何与动作连接、何时在机器人学习流程中使用预测)系统综述了机器人操作中的世界模型,将其定义为动作条件预测系统,并分类为五种表示族,提出了功能分类法,总结了基础设施角色、数据集和评估协议,揭示了从任务特定动力学预测器向预测基础设施的演变及开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00136 2026-06-02 cs.LG cs.AI cs.CL cs.CR cs.SI 62%

Generative AI and Digital Ecosystem Resilience: A Proactive Lifecycle-Based Survey

生成式AI与数字生态系统韧性:基于生命周期的主动式综述

Jonghyun Chung, Rishabh Chaddha, Sanket Badhe, Debanshu Das, Nathan Huang, Amanpreet Kaur

机构 * Google LLC(谷歌有限公司)

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

AI总结 本文采用基于生命周期的C5交互模型,综合机器学习与社会科学方法,系统综述了针对生成式AI驱动的对抗性合成内容的主动检测技术,包括协调不真实行为分析、流行病学建模和霍克斯过程等,旨在构建更具韧性的信息生态系统。

Comments 14 pages, 3 figures, 3 tables. Accepted for publication in IEEE Access (May 2026)

Journal ref IEEE Access (2026) IEEE Access (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01027 2026-06-02 cs.RO 57%

$τ_0$-WM: A Unified Video-Action World Model for Robotic Manipulation

$\tau_0$-WM:一种用于机器人操作的统一视频-动作世界模型

Pengfei Zhou, Shengcong Chen, Di Chen, Jiaxu Wang, Rongjun Jin, Bingwen Zhu, Yike Pan, Songen Gu, Kuanning Wang, Shufeng Nan, Xingyu Qiu, Chenhao Qiu, Pu Yang, Yunuo Cai, Jianxiong Gao, Yifan Li, Yanwei Fu, Xiangyu Yue, Zhi Chen, Jianlan Luo

机构 * Shanghai Innovation Institute(上海创新研究院) AGIBOT Finch

专题命中 VLA模型 :action model(abstract);分类 cs.RO

AI总结 提出$\tau_0$-WM,一个统一视频-动作世界模型,通过共享视频扩散骨干集成策略学习、视频预测和动作评估,在长时域和精细操作任务上优于基线。

Comments Our project homepge: https://finch.agibot.com/research/tau0-wm

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00422 2026-06-02 cs.IR cs.LG 57%

UniPinRec: Unifying Generative Retrieval and Ranking at Pinterest Scale

UniPinRec:在Pinterest规模下统一生成式检索与排序

Hanyu Li, Yi-Ping Hsu, Aditya Mantha, Prabhat Agarwal, Laksh Bhasin, Jialu Wang, Hongtao Lin, Bella Huang, Yaxin Li, Xinyi Li, Chuxi Wang, Kousik Rajesh, Hooshmand Shokri Razaghi, Shunyao Li, Zongyue Qin, Jaewon Yang, James Li, Dhruvil Deven Badani, Jiajing Xu, Charles Rosenberg

机构 * Pinterest

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 提出UniPinRec,通过共享Transformer编码用户行为序列,结合掩码动作建模、混合训练样本和跨阶段KV缓存共享,在Pinterest生产系统中首次实现检索与排序的全栈统一,提升在线参与度并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06182 2026-06-02 cs.RO cs.SY eess.SY 57%

Situation-Aware Interactive MPC Switching for Autonomous Driving

自动驾驶中的情境感知交互式MPC切换

Shuhao Qi, Qiling Aori, Luyao Zhang, Mircea Lazar, Sofie Haesaert

机构 * Eindhoven University of Technology(埃因霍温理工大学) Delft University of Technology(代尔夫特理工大学)

专题命中 VLA模型 :action model(abstract);分类 cs.RO

AI总结 针对自动驾驶中交互场景的挑战,提出一种基于神经网络的分类器,根据情境需求在不同MPC控制器间切换,以平衡性能和计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02425 2026-06-02 cs.HC cs.MM 50%

Fostering Emotional Perspective-Taking: An Exploration of Affective Face-Tracking Interactions in the VR Narrative Rekindle

培养情感视角转换:VR叙事《Rekindle》中情感面部追踪交互的探索

Hector Fan, Casper Hartveld, Mark Sivak

专题命中 VLA模型 :action model(abstract)

AI总结 提出利用VR头显内置面部追踪识别玩家情绪,促进玩家与故事角色之间的情感视角转换,从而加深情感联系和叙事参与。

Comments 5 pages, 5 figures. Interactivity paper accepted to DIS Companion '26 (Designing Interactive Systems Conference), Singapore, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02017 2026-06-02 stat.ME stat.AP stat.ML 50%

PliableBVS: A flexible Bayesian variable selection method for modeling interactions with mandatory modifying variables

PliableBVS:一种用于建模与强制修改变量交互的灵活贝叶斯变量选择方法

Theophilus Quachie Asenso, Zhi Zhao, Maren-Helene Langeland Degnes, Marie Cecilie Paasche Roland, Trond Melbye Michelsen, Manuela Zucknick

专题命中 VLA模型 :action model(abstract)

AI总结 提出PliableBVS方法,通过分层尖峰-板先验在贝叶斯框架下实现高维交互效应与主效应的同时选择,保留弱层次约束,优于可塑套索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00745 2026-06-02 hep-ex 50%

Comparisons of triple-differential cross sections for quasielastic-like $ν_μ$-hydrocarbon interactions using $\langle E_ν\rangle \sim$ 3~GeV versus $\sim$ 6~GeV beams in MINERvA

准弹性类 $ν_μ$-碳氢化合物相互作用的三重微分截面的比较:使用MINERvA中 $\langle E_ν angle \sim$ 3 GeV 与 $\sim$ 6 GeV 束流

D. Ruterbories, S. Akhter, Z. Ahmad Dar, M. Sajjad Athar, M. Betancourt, S. Boyd, H. da Motta, J. Felix, L. Fields, R. Fine, A. M. Gago, H. Gallagher, P. K. Gaur, S. M. Gilligan, R. Gran, E. Granados, D. A. Harris, A. L. Hart, A. Klustová, M. Kordosky, D. Last, Z. Lin, A. Lozano, S. Manly, W. A. Mann, C. Mauger, K. S. McFarland, M. Mehmood, O. Moreno, J. G. Morfín, J. K. Nelson, C. Nguyen, V. Paolone, G. N. Perdue, C. Pernas, M. A. Ramírez, R. D. Ransome, N. Roy, H. Schellman, C. J. Solano Salinas, N. H. Vaughan, A. V. Waldron, L. Zazueta

专题命中 VLA模型 :action model(abstract)

AI总结 通过比较MINERvA实验中两种不同能量中微子束流下的准弹性类散射三重微分截面,研究核介质效应并检验中微子相互作用模型。

Comments submitted to Physical Review D

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20730 2026-06-02 math.AP 50%

Large-friction and incompressible limits for pressureless Euler-Navier-Stokes flows

无压欧拉-纳维-斯托克斯流的大摩擦和不可压缩极限

Hai-Liang Li, Ling-Yun Shou, Yue Zhang

专题命中 VLA模型 :action model(abstract)

AI总结 研究喷雾动力学中无压欧拉-纳维-斯托克斯系统在奇异拖拽力作用下的全局极限,通过引入有效混合速度获得显式收敛率,并证明大摩擦和不可压缩联合极限。

Comments 57 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 2 篇

2606.02105 2026-06-02 cs.CV 57%

Multimodal Action Diffusion for Robust End-to-End Autonomous Driving

多模态动作扩散用于鲁棒的端到端自动驾驶

Jorge Daniel Rodríguez-Vidal, Diego Porres, Gabriel Villalonga Pineda, Antonio M. López Peña

机构 * Computer Vision Center (CVC)(计算机视觉中心) Universitat Autònoma de Barcelona (UAB)(巴塞罗那自治大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.CV

AI总结 提出动作扩散变换器(ADT),通过多模态动作建模和最近邻匹配,在闭环Bench2Drive基准上超越先前最优方法,同时延迟降低十倍。

Comments Preprint. June 1st, 2026. Corresponding author: Jorge Daniel Rodríguez-Vidal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01597 2026-06-02 cs.RO cs.MA 57%

Physics-Informed Modeling and Control of Emergent Behaviors in Robot Swarms

机器人群体涌现行为的物理信息建模与控制

Zixuan Jin, Wenzhuo Zhang, Shuxian Quan, Zirui Dong, Fangwen Ye, Yuchen Shi, Cheng Xu

机构 * School of Computer and Communication Engineering, University of Science and Technology Beijing(北京科技大学计算机与通信工程学院) Shunde Innovation School, University of Science and Technology Beijing(北京科技大学顺德创新学院)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO

AI总结 提出PhySwarm框架,利用多阶段对流-扩散-反应宏观模型和等效确定性运动微观模型,结合神经物理控制器,实现机器人群体多阶段涌现行为的建模与控制。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 1 篇

2605.13548 2026-06-02 cs.RO cs.AI 82%

AttenA+: Rectifying Action Inequality in Robotic Foundation Models

AttenA+: 纠正机器人基础模型中的动作不平等性

Daojie Peng, Fulong Ma, Jiahang Cao, Qiang Zhang, Xupeng Xie, Jian Guo, Ping Luo, Andrew F. Luo, Boyu Zhou, Jun Ma

机构 * HKUST(GZ)(香港科技大学(广州)) HKU(香港大学) USTC(中国科学技术大学) IDEA Research(IDEA研究院) SUSTech(南方科技大学) X-Humaniod

专题命中 机器人基础模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 针对机器人基础模型忽视动作物理重要性的问题,提出AttenA+框架,通过速度驱动的动作注意力重加权训练目标,提升复杂长程任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 数据集与评测 3 篇

2606.01425 2026-06-02 cs.LG 57%

Learning-based Directed Graph Abstraction of Combinatorial Spaces for Order-Preserving Search in Mixed-Combinatorial Nonlinear Optimization

基于学习的组合空间有向图抽象用于混合组合非线性优化中的保序搜索

Gishnu Madhu, Feng Liu, Souma Chowdhury

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Department of Mechanical and Aerospace Engineering(机械与航空航天工程系)

专题命中 数据集与评测 :action model(abstract);分类 cs.LG

AI总结 提出一种基于图神经网络的有向图抽象方法,将组合空间映射为有向图,以改进混合组合非线性规划问题的搜索效率。

Comments Accepted for presentation at 2026, ASME IDETC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18326 2026-06-02 cs.CV 57%

OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation

OmniHuman:面向以人为中心的视频生成的大规模数据集与基准

Lei Zhu, Xing Cai, Yingjie Chen, Yiheng Li, Binxin Yang, Hao Liu, Jie Chen, Chen Li, Jing LYu

机构 * Peking University(北京大学) WeChat Lab(微信实验室) Chinese Academy of Sciences(中国科学院)

专题命中 数据集与评测 :action model(abstract);分类 cs.CV

AI总结 为解决现有数据集在场景多样性、交互建模和属性对齐方面的结构性缺陷,提出OmniHuman大规模多场景数据集及全自动标注流程,并建立OHBench三级评估体系,实现与人类感知高度一致的诊断。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30980 2026-06-02 nucl-th 50%

High-Dimensional Bayesian Calibration of Expensive Nuclear Models with Differentiable Emulation

高维贝叶斯校准昂贵核模型的可微仿真

Jin Lei

专题命中 数据集与评测 :action model(abstract)

AI总结 提出DREAM可微校准策略,通过离线采样、奇异值分解压缩和在线可微重建,利用自动微分提供精确似然梯度,实现高维核模型的全贝叶斯校准,应用于d+⁵⁸Ni弹性散射的CDCC分析,在单GPU上十分钟内收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏