arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 634 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 544 篇

2607.14997 2026-07-17 cs.RO 新提交 83%

AeroAct: Action-Centered World-Action Models for Language-Conditioned Quadrotor Flight

AeroAct:用于语言条件四旋翼飞行的以动作中心的世界-动作模型

Xinhong Zhang, Qiyuan Zhu, Yubo Huang, Haolin Chen, Runqing Wang, Yuhao Mo, Zhongxin Chen, Yu Hu, Xinjiang Wang, Jian Sun, Gang Wang

机构 * School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院)

专题命中 VLA模型 :action model(title,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 研究语言条件下四旋翼飞行问题,提出AeroAct模型,利用预训练视频扩散Transformer,结合相关采集设备和程序获取数据,经实验验证该模型能提升四旋翼飞行的目标跟踪和物体搜索性能,且对应策略可在实体四旋翼上执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20698 2026-06-23 cs.RO 新提交 83%

SafeDojo: Safe Reinforcement Learning for VLA via Interactive World Model

SafeDojo:基于交互世界模型的安全强化学习用于视觉-语言-动作模型

Kai Tang, Peidong Jia, Zhong Chu, Jixian Wu, Rui Ma, Jiajun Cao, Fangyuan Zhao, Sixiang Chen, Yichen Guo, Xiaowei Chi, Chun-Kai Fan, Kevin Zhang, Jinchang Xu, Fubing Yang, Weishi Mi, Xiaozhu Ju, Jian Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology(香港科技大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 VLA模型 :VLA(title);vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 提出SafeDojo,首个基于模型的安全强化学习框架,通过交互式视频世界模型进行想象学习安全动作,结合解耦的任务奖励和安全代价信号,在SafeLIBERO和真实机器人上取得最佳安全成功率。

Comments 20 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15869 2026-06-16 cs.CV 新提交 83%

Metis: A Generalizable and Efficient World-Action Model for Autonomous Driving and Urban Navigation

Metis: 一种用于自动驾驶和城市导航的通用高效世界-动作模型

Jingyu Li, Zhe Liu, Dongnan Hu, Junjie Wu, Zipei Ma, Wenxiao Wu, Chao Han, Zhihui Hao, Zhikang Liu, Kun Zhan, Jiankang Deng, Xiatian Zhu, Li Zhang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The University of Hong Kong(香港大学) Tongji University(同济大学) Li Auto Inc.(理想汽车) Huazhong University of Science and Technology(华中科技大学) Imperial College London(伦敦帝国理工学院) University of Surrey(萨里大学)

专题命中 VLA模型 :action model(title,abstract);vision-language-action(abstract);分类 cs.CV

AI总结 提出Metis框架,通过解耦视频生成与动作预测,采用混合专家架构和不对称注意力掩码,实现高效推理与泛化,在多个导航基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12308 2026-08-13 cs.CV cs.AI 新提交 82%

DreamFly: Causal Memory and Receding-Horizon Diffusion Planning for Aerial Vision-Language Navigation

DreamFly:面向空中视觉语言导航的因果记忆与后退时域扩散规划

Yan Deng, Fei Xu

机构 * School of Electronic Information Engineering, Xi’an Technological University(西安工业大学电子信息工程学院) School of Computer Science and Engineering, Xi’an Technological University(西安工业大学计算机科学与工程学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 DreamFly是基于Dream-VLA的扩散式空中VLN框架,通过因果记忆、后退时域扩散规划和LiteStop解耦终止,在OpenFly基准上显著优于对比方法。

Comments 24 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10756 2026-08-12 cs.RO cs.CV 新提交 82%

Embodied Multimodal Grounding for Open-Vocabulary Mobile Manipulation via Semantic 3D Gaussian Splatting

基于语义三维高斯溅射的开放词汇移动操作具身多模态定位

Huosen Ou, Dongni Song, Yuncong Wang, Tao Zhou, Yiding Ji

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Midea Group(美的集团) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 本文针对家庭场景开放词汇移动操作的目标定位问题,提出整合Semantic-3DGS的具身多模态框架,经50次真实机器人试验,在长 horizon、杂乱场景等任务中优于PointVLA等基线方法,提升了操作鲁棒性。

Comments 9 pages, 11 figures. Accepted to ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11270 2026-07-14 cs.RO cs.AI 新提交 82%

Towards Predictive, Aligned, and Scalable Robot Learning

迈向可预测、对齐且可扩展的机器人学习

Peijun Tang, Shangjin Xie, Baifu Huang, Binyan Sun, Haotian Yang, Kuncheng Luo, Weiqi Jin, Shilin Fang, Jianan Wang

机构 * Astribot Team(Astribot团队)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 研究旨在实现可预测、对齐且可扩展的机器人学习。核心方法是引入Lumo - 2潜在世界 - 动作模型,提出多阶段模态预对齐策略。主要贡献是该模型在实证研究中表现出色,优于基线,验证了结构化多模态对齐和预测推理对具身智能的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22966 2026-06-23 cs.LG cs.AI cs.CR 新提交 82%

Attacking the Trusted Imagination: Oracle-Level Integrity Attacks on Imagine-then-Act World Models

攻击可信想象:对“先想象后行动”世界模型的预言机级完整性攻击

Linghan Chen, Kaiyan Ji, Minyu Guo

机构 * Adelaide University(阿德莱德大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.AI、cs.LG

AI总结 针对“先想象后行动”的视觉-语言-动作策略,发现世界模型中的想象轨迹是暴露的攻击面,通过有界观测扰动破坏想象,并设计无参数去噪检测器,实验显示非定向破坏效果显著,但定向控制受限。

Comments 13 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20999 2026-06-23 cs.RO cs.LG 新提交 82%

Inductive Generalization for Robotic Manipulation

机器人操作的归纳泛化

Annabella Macaluso, Haochen Zhang, Ishaan Masilamony, Yingshan Chang, Yonatan Bisk

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLA模型 :VLA(summary_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.LG

AI总结 提出归纳泛化概念,通过轴基评估测试策略在分布外任务变体上的泛化能力,发现现有范式(如VLA模型)失败,揭示了与数据规模正交的学习挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13515 2026-06-12 cs.CV cs.LG cs.RO 新提交 82%

MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models

MaskWAM:统一掩码提示与预测的世界-动作模型

Hanyang Yu, Haitao Lin, Jingbo Zhang, Wenyao Zhang, Chenghao Gu, Heng Li, Ping Tan

机构 * The Hong Kong University of Science and Technology(香港科技大学) Tencent Robotics X(腾讯机器人X实验室) Tsinghua University(清华大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出MaskWAM,通过统一掩码输入与预测的混合Transformer架构,解决世界-动作模型的空间瓶颈,提升策略泛化能力,在LIBERO等任务上显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12217 2026-06-11 cs.CV cs.AI cs.RO 新提交 82%

Making Foresight Actionable: Repurposing Representation Alignment in World Action Models

使远见可操作:在世界动作模型中重新利用表示对齐

Lu Qiu, Yizhuo Li, Yi Chen, Yuying Ge, Yixiao Ge, Xihui Liu

机构 * The University of Hong Kong(香港大学) XPENG Robotics(小鹏机器人)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 针对世界动作模型中视觉预测与动作提取不匹配的问题,提出AGRA方法,通过对齐视频扩散特征与语义表示,提升动作解码器对任务相关区域的关注,从而改善操作任务的性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09811 2026-06-09 cs.RO cs.AI cs.CV 新提交 82%

AHA-WAM:Asynchronous Horizon-Adaptive World-Action Modeling with Observation-Guided Context Routing

AHA-WAM:异步自适应时域世界-动作建模与观测引导的上下文路由

Jisong Cai, Long Ling, Shiwei Chu, Zhongshan Liu, Jiayue Kang, Zhixuan Liang, Wenjie Xu, Yinan Mao, Weinan Zhang, Xiaokang Yang, Ru Ying, Ran Zheng, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Baidu AI Cloud(百度智能云) The University of Hong Kong(香港大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 提出AHA-WAM,一种基于双扩散Transformer的异步时域自适应世界-动作模型,通过低频世界规划器和高频动作执行器解耦时序,实现高效闭环控制,在RoboTwin和真实任务上达到SOTA性能。

Comments Project page: https://serene-sivy.github.io/aha-wam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08749 2026-08-11 cs.RO 新提交 81%

OnEvoMemory: Evolving Memory through Online Robot Rollouts for Pretrained Robot Policies

OnEvoMemory:通过机器人在线试跑演化预训练机器人策略的记忆机制

Zhongxi Chen, Shenqi Zong

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.RO

AI总结 针对现有机器人记忆机制依赖外部模型的问题,提出OnEvoMemory价值引导记忆模块,结合离线初始化与在线试跑优化记忆选择,提升了基础VLA策略在长时程机器人操作中的性能。

Comments 6 pages, 1 figure. Accepted as a poster at the ECCV 2026 Workshop on Embodied Multimodal Reasoning in Physical Environments (EMR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01824 2026-08-04 cs.RO 新提交 81%

ReTouch: Empowering Contact-Rich Dexterous Manipulation with Online-Refined Tactile Prediction

ReTouch:利用在线优化的触觉预测实现接触丰富的灵巧操作

Shiqi Zhang, Xin Zhang, Yedong Shen, Jiajun Deng, Yuxuan Gao, Sha Zhang, Yuan Zhang, Kaixue Long, Jiajia Wu, Jia Pan, Yao Li, Yanyong Zhang

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 本研究提出视觉-语言-动作模型ReTouch,通过在线优化触觉预测实现接触丰富的灵巧操作,在真实机器人实验中,其平均成功率较最强基线提升18.4至23.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00337 2026-08-04 cs.RO 新提交 81%

Action Chunk Scheduling for Batched Robot Policy Serving

用于批量机器人策略服务的动作块调度

Rohan Bansal, David He, Nadun Ranawaka Arachchige, Zhenyang Chen, Soobum Kim, Kexin Rong, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);robot foundation model(abstract);分类 cs.RO

AI总结 本文提出从远程GPU向多机器人提供策略服务的调度问题,构建Armory系统,提出考虑机器人异构性的调度算法,使真实场景系统吞吐量最高提升18%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27549 2026-07-31 cs.RO cs.AI cs.CV cs.LG 新提交 81%

Cross-Embodiment Transfer via Behavior-Aligned Representations

基于行为对齐表征的跨具身迁移

Ajay Sridhar, Jensen Gao, Jonathan Yang, Jean Mercat, Suneel Belkhale, Dorsa Sadigh

机构 * Stanford University(斯坦福大学) Toyota Research Institute(丰田研究所)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本研究提出在视觉-语言-动作模型中采用行为对齐表征,开发仿真基准验证其可提升跨具身迁移,使真实机器人任务完成进度提升28%。

Comments Project page: https://ajaysridhar.com/barx/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18580 2026-07-22 cs.RO 新提交 81%

STeP: Signal Temporal Logic for Precise Specifications for Action Generation with Vision Language Models

STeP:用于视觉语言模型动作生成精确规范的信号时序逻辑

Kasra Torshizi, Anukriti Singh, Sidharth Mathur, Khuzema Habib, Leo Du, Pratap Tokekar

机构 * University of Maryland(马里兰大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);language-conditioned robot(abstract);分类 cs.RO

AI总结 针对视觉语言动作模型缺乏可解释性及难以遵循精确自然语言指令的问题,提出用信号时序逻辑(STL)连接高级语言理解与低级机器人执行的分层框架,经实验验证该框架能提高语言条件下机器人规划的精度、可靠性和可解释性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16636 2026-07-21 cs.RO 新提交 81%

PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution

PhyAgentOS:一种用于具身智能体的自进化操作系统,具有解耦的认知规划和物理执行

Yang Liu, Weixing Chen, Xinshuai Song, Tao Pu, Siwen Mo, Yongjie Bai, Zihao Chen, Qianran Sun, Liruo Zhong, Ying Shen, Liang Lin

机构 * X-Era Lab(X-Era实验室) HCP Lab, Sun Yat-sen University(中山大学HCP实验室) Peng Cheng Laboratory(鹏城实验室)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 研究为具身智能体提出PhyAgentOS操作系统,其以会话为最小调度单位,用文件系统解耦认知与物理执行,通过会话验证器区分执行与任务完成,经认知记忆整合结果,有分层安全约束,在多模型和实体上验证并优于其他系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03372 2026-07-07 cs.CV 新提交 81%

Present but Not Remembered: Auditing How Frozen VLAs Encode, Deploy, and Steer Visual History

存在但未被记住:审视冻结的视觉语言动作模型如何编码、部署和引导视觉历史

Chih-Ting Liao, Xin Cao

机构 * University of New South Wales(新南威尔士大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.CV

AI总结 研究通过线性探测和因果互换干预,探讨冻结的视觉语言动作模型对视觉历史的编码、部署和引导方式,发现模型对历史的处理存在三部分解离,并引入免训练的时间部署审计区分不同机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22136 2026-06-24 cs.RO 新提交 81%

Wh0: Generative World Models as Scalable Sources of Egocentric Human Hand Manipulation Data

Wh0: 生成式世界模型作为自我中心人类手部操作数据的可扩展来源

Yangtao Chen, Zixuan Chen, Peiyang Wang, Yong-Lu Li, Jing Huo, Jieqi Shi, Yang Gao

机构 * Shanghai Innovation Institute(上海创新研究院) Nanjing University(南京大学) Shanghai Jiaotong University(上海交通大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.RO

AI总结 提出Wh0框架,利用生成式视频世界模型产生自我中心人-物交互数据集WM-H,通过手部运动重建和视觉编辑转化为机器人可训练监督,提升预训练灵巧VLA模型在真实任务上的零样本成功率。

Comments Under review. The first three authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15338 2026-06-16 cs.RO 新提交 81%

SimWeaver: Zero-Shot RGB Sim-to-Real for Deformable Manipulation

SimWeaver:面向可变形操作的零样本RGB仿真到现实

Wenkang Hu, Haoran Wang, Yitong Li, Liu Liu, Mengao Zhao, Lai Jiang, Xincheng Tang, Junhang Wei, Zhengjie Shu, Zhendong Wang, Zhizhong Su, Huamin Wang, Ruigang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Horizon Robotics(地平线机器人) Style3D Research(Style3D研究院)

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.RO

AI总结 提出SimWeaver框架,通过200条仿真演示训练零样本RGB VLA策略,在5种可变形任务中达到91%平均真实成功率,无需遥操作或任务校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08278 2026-06-09 cs.RO 新提交 81%

SIMPLE: Simulation-Based Policy Learning and Evaluation for Humanoid Loco-manipulation

SIMPLE:基于仿真的人形机器人全身操作策略学习与评估

Songlin Wei, Zhenhao Ni, Jie Liu, Zhenyu Zhao, Junjie Ye, Hongyi Jing, Junkai Xia, Xiawei Liu, Michael Leong, Liang Heng, Di Huang, Yue Wang

机构 * USC Physical Superintelligence (PSI) Lab(南加州大学物理超级智能实验室)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 提出SIMPLE仿真平台,结合MuJoCo动力学与IsaacSim渲染,包含60个全身任务、50个室内场景和1000+物体资产,支持自动化轨迹生成和VR遥操作数据采集,并集成多种主流策略,实验证明仿真与真实世界性能强相关,可实现零样本迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07723 2026-06-09 cs.RO 新提交 81%

VoLo: A Physical Orchestrator for Open-Vocabulary Long-Horizon Manipulation

VoLo: 面向开放词汇长时程操控的物理编排器

Siyi Chen, Hugo Hadfield, Alex Zook, Mikaela Angelina Uy, Chan Hee Song, Erwin Coumans, Xuning Yang, Faisal Ladhak, Qing Qu, Stan Birchfield, Jonathan Tremblay, Valts Blukis

机构 * NVIDIA(英伟达) University of Michigan(密歇根大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.RO

AI总结 提出VoLoAgent,利用VLM将VLA/WAM作为可中断工具进行物理编排,实现开放词汇长时程操控,并在新基准RoboVoLo上显著优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03701 2026-08-05 cs.RO cs.AI 新提交 81%

LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation

LiLa-WAM:用于机器人操控的轻量级隐式推理世界-动作模型

Fan Yang, Yuting Su, Xiaobo Wang, Yuncheng You, Fugui Fan, Yuting Wu, Minghui Wu, Chenxu Zhao, JiaHong Ning, Peiguang Jing

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 本研究提出轻量级世界-动作模型LiLa-WAM,通过联合未来状态预测与动作生成的紧凑隐式空间设计实现端到端单GPU训练,结合视觉转换令牌完成任务指定,在RoboTwin等任务上取得90.48%的成功率,提升了机器人操控的效率与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29235 2026-08-03 cs.RO cs.AI cs.SY eess.SY 新提交 81%

FBFM: A Training-Free Asynchronous Feedback Mechanism for Flow-Matching in World-Action Models Execution

FBFM:一种用于世界-动作模型执行中流匹配的无训练异步反馈机制

Peize Li, Ruimeng Zhang, Ru Zhang, Cong Huang, Kai Chen, Shanghang Zhang

机构 * Peking University(北京大学) Tsinghua University(清华大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 该研究针对世界-动作模型分块反馈时间粒度粗、无法逐时间步纠错的问题,提出无训练异步反馈机制FBFM,在两类WAM上使LIBERO等任务成功率提升超5%,实现开环流生成与闭环真实世界动力学的桥接。

Comments 29 pages, 5 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28993 2026-08-03 cs.RO cs.CV 新提交 81%

ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts

ST-WAM:面向视觉分布偏移下鲁棒操作的语义-时间世界动作模型

Mingxin Wang, Bin Hu, Bin Qian, Kaitao Jiang, Haoning Wu, Feng Yan, Bowen Jing, Ruiyang Hao, Enyi Wang, Kangning Niu, Yandan Yang, Mu Xu, Yan Wang, Houde Liu, Tianlun Li

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 该研究针对视觉分布偏移下机器人操作的鲁棒性问题,提出ST-WAM模型,采用DINOv3等技术,在多个基准测试中取得优异性能,大幅提升了偏移场景下的零样本操作表现。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15207 2026-07-17 cs.LG cs.RO 新提交 81%

BadWAM: When World-Action Models Dream Right but Act Wrong

BadWAM:当世界-动作模型想得对但做得错时

Qi Li, Xingyi Yang, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.LG

AI总结 研究针对世界-动作模型(WAMs)提出BadWAM框架,用于建模和评估世界-动作漂移攻击,包括仅动作攻击和保持想象攻击,通过不同标准刻画攻击面,评估结果显示能大幅降低任务成功率,揭示WAM漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09185 2026-07-13 cs.CV cs.RO 新提交 81%

Causally Debiased Latent Action Model for Embodied Action Conditioned World Models

用于具身动作条件世界模型的因果去偏潜行动模型

Yufan Wei, Kun Zhou, Lingjun Mao, Zijun Zhang, Ziming Xu, Ziqiao Xi, Shuang Liang, Ruobing Han, Yuchen Yan, Xinyue Wang, Fan Feng, Biwei Huang

机构 * Aether AI University of California, San Diego(加州大学圣地亚哥分校)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 研究针对动作条件世界模型学习需大量标记数据的问题,提出基于潜行动模型的因果去偏框架CD-LAM,通过三个微调目标改进模型,提升了潜行动可控性等多方面性能,减少了机器人动作适应更新次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08436 2026-07-10 cs.RO cs.AI 新提交 81%

EgoWAM: World Action Models Beyond Pixels with In-the-Wild Egocentric Human Data

EgoWAM:利用野外自我中心人类数据超越像素的世界行动模型

Baoyu Li, Xinchen Yin, Mengying Lin, Yixin Zhang, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 研究利用野外自我中心人类数据训练机器人操纵模型,引入EgoWAM框架,固定部分设置仅改变世界预测目标,比较不同方法。结果表明WAM协同训练更有效,DINO和3D流提升显著,为机器人操纵提供新训练思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05468 2026-07-08 cs.RO cs.AI 新提交 81%

Learning 4D Geometric Priors for Inference-Efficient World Action Models

学习用于高效推理世界行动模型的4D几何先验

Jianjun Zhang, Jian Zhu, Taiyi Su, Chong Ma, Zitai Huang, Yi Xu, Hanli Wang

机构 * Midea AI Research Centers(美的人工智能研究中心)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 研究针对世界行动模型在捕捉操作所需几何信息不足的问题,提出MECo-WAM模型,通过注入4D几何先验、采用多专家协同训练等方法,在不增加推理成本的情况下提升了机器人操作性能。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14048 2026-07-08 cs.CV cs.RO 新提交 81%

WAM4D: Fast 4D World Action Model via Spatial Register Tokens

WAM4D:通过空间注册令牌实现快速4D世界动作模型

Ying Li, Xiaobao Wei, Jiajun Cao, Hao Wang, Xiaowei Chi, Chengyu Bai, Qianpu Sun, Jiajun Li, Xiaojie Zhang, Peidong Jia, Jian Tang, Sirui Han, Shanghang Zhang

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 提出WAM4D,利用轻量级空间注册令牌将预训练几何先验迁移至因果视频-动作变换器,实现高效4D世界动作建模,在RoboTwin 2.0和真实操作任务中提升空间一致性并保持快速推理。

Comments 15 pages, 7figures, 9tables

详情

展开后加载摘要…

URL PDF HTML 收藏