arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9119 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9119 篇

2510.07869 2026-05-25 cs.RO 85%

USIM and U0: A Vision-Language-Action Dataset and Model for General Underwater Robots

USIM 和 U0:面向通用水下机器人的视觉-语言-动作数据集与模型

Junwen Gu, Zhiheng Wu, Pengxuan Si, Shuang Qiu, Zhentao Zhang, Yukai Feng, Luoyang Sun, Laien Luo, Lianyi Yu, Jian Wang, Zhengxing Wu

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院) Baidu Inc.(百度公司) The School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出一个统一框架,通过数据合成管道构建模拟数据集 USIM 和视觉-语言-动作模型 U0,实现水下机器人从避障导航到三维移动操作的多任务执行,在离线动作预测误差和在线成功率上达到最优。

Comments Project Page: https://vincentgu2000.github.io/u0project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22283 2026-05-22 cs.RO 85%

Spatial Memory for Out-of-Vision Manipulation in Vision-Language-Action

视觉-语言-动作中视界外操作的空间记忆

Pengteng Li, Weiyu Guo, He Zhang, Tiefu Cai, Xiao He, Yandong Guo, Hui Xiong

机构 * Thrust of Artificial Intelligence, The Hong Kong University of Science(人工智能推动部,香港科学大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出SOMA框架,用于解决视觉-语言-动作模型中视界外操作的问题,通过构建持久的空间记忆,使模型能够超越当前视觉范围进行推理,提升任务成功率和操作行为质量。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00884 2026-05-12 cs.CV 85%

LiteVLA-H: Dual-Rate Vision-Language-Action Inference for Onboard Aerial Guidance and Semantic Perception

LiteVLA-H: 双速率视觉-语言-动作推断用于机载空中引导与语义感知

Justin williams, Kishor Datta Gupta, Roy George, Mrinmoy Sarkar

机构 * Department of Cyber Physical Systems, Clark Atlanta University(克劳克阿特拉大学网络物理系统系)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.CV

AI总结 LiteVLA-H通过双速率操作在边缘设备上实现高效视觉-语言-动作推断,兼顾快速动作输出与语义理解,提升空中引导与场景感知性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27366 2026-05-01 cs.CV 85%

Judge, Then Drive: A Critic-Centric Vision Language Action Framework for Autonomous Driving

评判,然后驾驶:一种以评判为中心的视觉语言动作框架用于自动驾驶

Lijin Yang, Jianing Huang, Zhongzhan Huang, Shu Liu, Hao Yang

机构 * Bosch Research(博世研究院)

专题命中 VLA模型 :vision language action(title,abstract);VLA(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出CriticVLA框架,通过多模态评估和单步优化提升自动驾驶决策质量,实验显示其在复杂场景中性能显著优于现有方法。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06748 2026-04-08 cs.RO 85%

On-the-Fly VLA Adaptation via Test-Time Reinforcement Learning

实时VLA适应 via 测试时强化学习

Changyu Liu, Yiyang Liu, Taowen Wang, Qiao Zhuang, James Chenhao Liang, Wenhao Yang, Renjing Xu, Qifan Wang, Dongfang Liu, Cheng Han

机构 * University of Missouri–Kansas City(密苏里大学堪萨斯城分校) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) U. S. Naval Research Laboratory(美国海军研究实验室) Lamar University(拉马尔大学) Meta AI Rochester Institute of Technology(罗彻斯特理工学院)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 本文提出TT-VLA框架,通过测试时强化学习实现VLA模型的实时策略适应,提升机器人在动态环境中的适应性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21542 2026-03-26 cs.RO cs.AI cs.CV cs.LG 85%

E0: Enhancing Generalization and Fine-Grained Control in VLA Models via Tweedie Discrete Diffusion

E0: 通过 Tweedie 离散扩散增强 VLA 模型的泛化能力与细粒度控制

Zhihao Zhan, Jiaying Zhou, Likui Zhang, Qinhan Lv, Hao Liu, Jusheng Zhang, Weizheng Li, Ziliang Chen, Tianshui Chen, Ruifeng Zhai, Keze Wang, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室) Guangdong University of Technology(广东工业大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出 E0 框架,通过离散扩散方法提升 VLA 模型在多任务和多视角下的泛化能力,并实现精细可控的动作生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23481 2026-03-25 cs.RO cs.AI cs.CV cs.LG 85%

VTAM: Video-Tactile-Action Models for Complex Physical Interaction Beyond VLAs

VTAM:用于复杂物理交互的视频-触觉-动作模型超越VLAs

Haoran Yuan, Weigang Yi, Zhenyu Zhang, Wendi Chen, Yuchen Mo, Jiashi Yin, Xinzhuo Li, Xiangyu Zeng, Chuan Wen, Cewu Lu, Katherine Driggs-Campbell, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :action model(title,abstract);embodied foundation model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 VTAM通过整合触觉感知提升复杂物理交互的稳定性,其多模态框架在接触密集任务中表现优异,成功率达到90%。

Comments https://plan-lab.github.io/projects/vtam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26642 2026-03-20 cs.RO 85%

MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation

MLA:一种多感官语言-动作模型,用于机器人操作中的多模态理解和预测

Zhuoyang Liu, Jiaming Liu, Jiadong Xu, Nuowei Han, Chenyang Gu, Hao Chen, Kaichen Zhou, Renrui Zhang, Kai Chin Hsieh, Kun Wu, Zhengping Che, Jian Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Beijing Innovation Center of Humanoid Robotics (X-Humanoid)(北京类人机器人创新中心(X-Humanoid)) The Chinese University of Hong Kong (CUHK)(香港中文大学(CUHK))

专题命中 VLA模型 :action model(title,abstract);vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文提出MLA模型,通过多感官融合与未来目标预测,提升机器人在复杂接触任务中的操控能力,实验显示其在2D和3D任务中性能优于现有方法。

Comments Project page: https://robotic-mla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21736 2026-02-26 cs.RO 85%

Joint-Aligned Latent Action: Towards Scalable VLA Pretraining in the Wild

联合对齐的潜在动作:迈向大规模野外VLA预训练

Hao Luo, Ye Wang, Wanpeng Zhang, Haoqi Yuan, Yicheng Feng, Haiweng Xu, Sipeng Zheng, Zongqing Lu

机构 * Peking University(北京大学) Renmin University of China(中国人民大学) BeingBeyond

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 JALA通过联合对齐的潜在动作预训练框架,提升从人类数据中大规模预训练视觉-语言-动作模型的效率与性能。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21531 2026-02-26 cs.RO cs.AI cs.CV cs.LG cs.SY eess.SY 85%

LiLo-VLA: Compositional Long-Horizon Manipulation via Linked Object-Centric Policies

LiLo-VLA:通过链接的对象为中心策略实现组合长周期操控

Yue Yang, Shuo Cheng, Yu Fang, Homanga Bharadhwaj, Mingyu Ding, Gedas Bertasius, Daniel Szafir

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Georgia Institute of Technology(佐治亚理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 LiLo-VLA通过链接的对象为中心策略实现长周期操控,通过模块化框架实现零样本泛化,提升机器人任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09708 2026-02-25 cs.CV cs.AI cs.LG cs.RO 85%

Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planning

Fast-ThinkAct: 通过可言说的潜在规划实现高效的视觉-语言-动作推理

Chi-Pin Huang, Yunze Man, Zhiding Yu, Min-Hung Chen, Jan Kautz, Yu-Chiang Frank Wang, Fu-En Yang

机构 * NVIDIA(英伟达)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 Fast-ThinkAct通过可言说的潜在规划实现高效的视觉-语言-动作推理,显著降低推理延迟并保持长周期规划能力。

Comments CVPR 2026. Project page: https://jasper0314-huang.github.io/fast-thinkact/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11250 2026-01-19 cs.RO 85%

VLAgents: A Policy Server for Efficient VLA Inference

VLAgents: 一种高效的VLA推理政策服务器

Tobias Jülg, Khaled Gamal, Nisarga Nilavadi, Pierre Krack, Seongjin Bien, Michael Krawez, Florian Walter, Wolfram Burgard

机构 * University of Technology Nuremberg(图恩大学) Technical University of Munich(慕尼黑技术大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 VLAgents是一种高效的VLA推理政策服务器,通过统一协议和上下文适应通信层,提升了机器人中VLAs的部署效率和性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19878 2025-11-26 cs.CV cs.AI cs.CL cs.LG cs.RO 85%

MAPS: Preserving Vision-Language Representations via Module-Wise Proximity Scheduling for Better Vision-Language-Action Generalization

MAPS: 通过模块级接近调度保留视觉-语言表示以实现更好的视觉-语言-动作泛化

Chengyue Huang, Mellon M. Zhang, Robert Azarcon, Glen Chou, Zsolt Kira

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 MAPS通过模块级接近调度优化VLA微调,提升视觉-语言-动作任务的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09577 2025-05-15 cs.RO 85%

VTLA: Vision-Tactile-Language-Action Model with Preference Learning for Insertion Manipulation

Chaofan Zhang, Peng Hao, Xiaoge Cao, Xiaoshuai Hao, Shaowei Cui, Shuo Wang

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) Samsung R&D Institute China–Beijing(三星中国北京研发中心) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 VLA模型 :action model(title,abstract);VLA(abstract);language-conditioned robot(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16837 2026-08-18 cs.RO cs.AI 新提交 85%

HAF: Adapting Generalist VLAs to Humanoid Whole-Body Loco-manipulation via Hierarchical Action Flow and Spectral Latent RL

HAF:通过分层动作流与谱潜在线性RL将通用VLAs适配至人形机器人全身运动操作

Langzhe Gu, Chengkai Hou, Meng Li, Xinhua Wang, Jiaming Liu, Xinyuan Lv, Bowei Zhang, Shuanghao Bai, Guangrun Li, Jingyang He, Gaole Dai, Ziluo Ding, Zhiyuan Xu, Kuan Cheng, Jian Tang, Zhengping Che, Shanghang Zhang

机构 * Xi’an Jiaotong University(西安交通大学) Peking University(北京大学) Nankai University(南开大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 研究针对通用VLAs难以适配人形机器人全身运动操作的问题,提出HAF框架,通过分层动作流生成器与潜空间RL流水线实现高效迁移优化,在7项任务上性能优于单阶段VLA基线。

Comments Project page: this https URL (https://grange007.github.io/HAF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11739 2026-08-13 cs.RO cs.AI 新提交 85%

G0.5: One Autoregressive Stream for Robot Reasoning and Action

G0.5:用于机器人推理与动作的单自回归流

Yicheng Liu, Zibin Dong, Baijun Ye, Tianyuan Yuan, Tao Jiang, Anqi Yang, Shicheng Cao, Haonan Liu, Yue Sun, Zihan Guo, Xiao Liu, Dong Ke, Changxun Pan, Chenru Wu, Tailai Cheng, Xiaoshu Ren, Xinlei Zhang, Jianning Cui, Zijie Zhao, Haoyu Zhang, Kaiming Xu, Haodong Yang, Bowen Zhang, Jiahui Niu, Shaoting Zhu, Shiduo Zhang, Hang Zhao

机构 * Galaxea(星系科技(Galaxea))

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文提出G0.5,一种单自回归流的VLA模型,通过三个关键组件实现推理与动作统一,在7项基准中超越现有最优模型,展现出良好的泛化与指令跟随能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05369 2026-08-07 cs.RO cs.CV 新提交 85%

World-to-Wrist: Task-Conditioned Future Wrist Modeling for Fine-Grained Robot Manipulation

世界到手腕:面向精细机器人操作的任务条件未来手腕建模

Yuhao Pan, Haosong Peng, Zhengshen Zhang, Zhengyang Yan, Yalun Dai, Fushuo Huo, Chujie Wang, Tianyu Qi, Xiucheng Wang, Nan Cheng, Wenchao Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学) Sun Yat-sen University(中山大学) Xidian University(西安电子科技大学) Southeast University(东南大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 本研究提出W2-VLA模型,通过任务条件未来手腕建模结合W2-CoT辅助监督,在LIBERO等数据集及真实任务中提升了机器人精细接触敏感操作能力,动作生成速率超80Hz。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12659 2026-08-04 cs.RO cs.AI 版本更新 85%

Jetson-PI: Towards Onboard Real-Time Robot Control via Foresight-Aligned Asynchronous Inference

Jetson-PI:通过前瞻对齐异步推理实现机载实时机器人控制

Zebin Yang, Qi Wang, Yunhe Wang, Xiurui Guo, Bo Yu, Shaoshan Liu, Jiafeng Xu, Hao Dong, Meng Li

机构 * Peking University(北京大学) AIRS(无合适中文名,保留英文) PrimeBot Research Institute(PrimeBot 研究院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 研究针对低功耗机载设备部署VLA模型的挑战,提出Jetson-PI方法。通过训练轻量级未来校正模块解决感知-执行未对齐,引入基于置信度的调度优化减少反应时间,辅以系统级加速,实验显示其显著提升控制频率和成功率。

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07383 2026-07-20 cs.RO cs.LG 版本更新 85%

RhinoVLA Technical Report

RhinoVLA 技术报告

Huixi Technology, :, Chen Zhang, Chenyang Zhou, Guanglei Ding, Guanghui He, Haibin Gao, Jiajia Chen, Jianyong Zhang, Lianyi Yu, Ningyi Xu, Ping Xu, Qingchen Li, Yingjun Hu, Yijia Zhang, Yuxi Liu

机构 * Huixi Intelligence(慧溪智能)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.LG

AI总结 针对边缘硬件上VLA模型部署延迟问题,提出RhinoVLA,通过令牌高效骨干、连续动作专家和统一接口实现实时闭环控制,在Huixi R1上达到11.69 Hz推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13056 2026-07-16 cs.RO cs.LG 新提交 85%

HRIBench: Benchmarking Interaction-Centric Human-Robot Collaboration

HRIBench:以交互为中心的人机协作基准测试

Chang Liu, Jiawei Zhang, Tao Zhang, Ye Wang, Hongyu Zhou, Qin Jin

机构 * Renmin University of China(中国人民大学) Beijing Normal University(北京师范大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.LG

AI总结 研究针对当前VLA基准未充分考量人机交互结构的问题,引入HRIBench基准,它以结构化场景脚本定义协作任务与交互角色,含多项可解释指标。通过实验表明该基准能暴露机器人策略局限,提升协作性能,推动以交互为中心的机器人学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26025 2026-07-07 cs.RO cs.CV 新提交 85%

In-Context World Modeling for Robotic Control

面向机器人控制的上下文世界建模

Siyin Wang, Junhao Shi, Senyu Fei, Zhaoyang Fu, Li Ji, Jingjing Gong, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Tongji University(同济大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 提出上下文世界建模(ICWM)框架,通过任务无关的交互历史推断系统变量,使机器人策略无需参数更新即可适应新配置,在仿真和真实实验中显著优于标准VLA基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29350 2026-06-30 cs.CV cs.AI 85%

Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs

快得足以行动:面向低延迟机器人视觉语言模型和视觉语言动作模型的时空视觉令牌融合

Junzhou Chen, Jindong Wang, Gang Zhou

机构 * Department of Computer Science(计算机科学系) Department of Data Science(数据科学系) William & Mary(威廉玛丽学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);action model(abstract);分类 cs.CV、cs.AI

AI总结 提出ST-Merge框架,在视觉编码阶段通过构建3D时空坐标和多队列并行匹配加权聚合机制高效融合冗余令牌,并引入后融合位置校正消除空间偏差,在Qwen2.5-VL上实现2倍推理加速且精度损失仅1%,在π0.5 VLA策略上实现8.3倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20118 2026-06-23 cs.RO cs.LG 新提交 85%

Pose6DAug: Physically Plausible Multi-view Object Swapping for Robot Data Augmentation

Pose6DAug: 用于机器人数据增强的物理合理多视图物体替换

Jonghoon Lee, Seong Hyeon Park, Byungwoo Jeon, Minha Lee, Jinwoo Shin

机构 * KAIST(韩国科学技术院) Korea University(韩国大学) RLWRLD

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.LG

AI总结 提出Pose6DAug,一种基于失败驱动的数据增强框架,通过3D网格和6D姿态轨迹替换成功轨迹中的物体,生成多视图一致的物理合理演示,无需额外数据收集,在新型物体上提升VLA策略成功率16.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17463 2026-06-17 cs.CV cs.RO 新提交 85%

WeaveLA: Event Driven Cross-Subtask Latent Memory Weaving for Repetitive Robot Manipulation

WeaveLA: 面向重复机器人操作的基于事件驱动的跨子任务潜在记忆编织

Shoujing Zhu, Zhenyang Liu, Fungmiu Wang, Jiafeng Wang, Bo Yue, Guiliang Liu, Simo Wu, Xiangyang Xue, Taiping Zeng

机构 * Fudan University(复旦大学) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Shanghai Innovation Institute(上海创新研究院) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 针对短窗口VLA策略缺乏跨子任务信息传递的问题,提出WeaveLA,通过事件触发将完成子任务压缩为潜在令牌并注入下一子任务的动作生成路径,在保持基础策略短窗口接口的同时实现轻量级跨子任务通道,在困难重复任务上成功率从0%提升至47.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15142 2026-06-16 cs.CV cs.RO 新提交 85%

MotionVLA: Vision-Language-Action Model for Humanoid Motion

MotionVLA:面向人形运动的视觉-语言-动作模型

Nonghai Zhang, Siyu Zhai, Yanjun Li, Zeyu Zhang, Zhihan Yin, Yandong Guo, Boxin Shi, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) AI 2 Robotics

专题命中 VLA模型 :vision-language-action(title);action model(title);分类 cs.RO、cs.CV

AI总结 针对人形运动生成中低频姿态与高频物理信号量化不匹配的问题,提出双流频率分词器DSFT和基于Qwen3.5的MotionVLA模型,在HumanML3D和MBench上显著提升多样性一致性和运动条件一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06904 2026-06-11 cs.RO cs.CV 版本更新 85%

ActionMap: Robot Policy Learning via Voxel Action Heatmap

ActionMap: 基于体素动作热图的机器人策略学习

Pei Yang, Hai Ci, Yanzhe Chen, Qi Lv, Han Cai, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室) NVIDIA(英伟达)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 提出ActionMap,一种将动作空间建模为体素热图的动作解码器,替代现有VLA模型中的单点预测器,在LIBERO仿真和真实Franka操作中提升性能和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21446 2026-06-04 cs.RO cs.AI 85%

Lost in Fog: Sensor Perturbations Expose Reasoning Fragility in Driving VLAs

迷失在雾中:传感器扰动暴露驾驶VLA的推理脆弱性

Abhinaw Priyadershi, Jelena Frtunikj

机构 * NVIDIA Corporation, USA(NVIDIA公司,美国) NVIDIA GmbH, Germany(NVIDIA德国公司)

专题命中 VLA模型 :VLA(title_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 通过受控传感器扰动实验,发现因果链解释的一致性可作为轨迹可靠性的高保真指标,并证明启用因果链生成可提升轨迹精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00145 2026-06-02 cs.RO cs.AI 85%

Completion at the Boundary (CaB): Deployable Switching with Completion-Aware Control under Limited Calibration

边界完成(CaB):有限校准下具有完成感知的可部署切换

Yusuke Sano, Takeshi Itoga

机构 * Intelligent Systems Laboratory, SECOM Co., Ltd.(SECOM公司智能系统实验室)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 提出Completion at the Boundary (CaB)方法,通过边界阶段令牌(Before/Hit/After)保留双边证据,在有限校准条件下实现VLA代理的完成感知切换,提升复合指令执行和交接质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04639 2026-05-27 cs.RO cs.AI 85%

RoboMME: Benchmarking and Understanding Memory for Robotic Generalist Policies

RoboMME:机器人通用策略的记忆基准与理解

Yinpei Dai, Hongze Fu, Jayjun Lee, Yuejiang Liu, Haoran Zhang, Jianing Yang, Chelsea Finn, Nima Fazeli, Joyce Chai

机构 * University of Michigan(密歇根大学) Stanford University(斯坦福大学) Figure AI

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 提出RoboMME基准,通过16个操作任务评估VLA模型在长时程和历史依赖场景中的记忆能力,并基于π0.5骨干网络探索14种记忆增强变体,发现记忆表示的有效性高度依赖于任务。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00880 2026-05-05 cs.CV cs.AI 85%

Adversarial Flow Matching for Imperceptible Attacks on End-to-End Autonomous Driving

对抗流匹配用于端到端自动驾驶中的不可察觉攻击

Xinyu Zeng, Xiangkun He, Lei Tao, Chen Lv, Hong Cheng

机构 * Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(深圳先进研究院,电子科技大学) School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院) School of Mechanical and Electrical Engineering, University of Electronic Science and Technology of China(电子科技大学机械与电气工程学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.CV、cs.AI

AI总结 本文提出对抗流匹配(AFM)框架,通过利用Transformer结构漏洞生成高效且视觉不可察觉的对抗样本,有效降级VLA和模块化自动驾驶代理性能,同时保持先进的视觉不可察觉性及跨模型迁移能力。

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏