arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 238 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 动作表示与策略 238 篇

2204.08770 2022-04-21 cs.CV cs.LG 62%

GroupNet: Multiscale Hypergraph Neural Networks for Trajectory Prediction with Relational Reasoning

Chenxin Xu, Maosen Li, Zhenyang Ni, Ya Zhang, Siheng Chen

专题命中 动作表示与策略 :action model(abstract);分类 cs.CV、cs.LG

Comments Accepted by CVPR2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.07056 2022-02-04 cs.RO cs.CV 62%

Learning Sparse Interaction Graphs of Partially Detected Pedestrians for Trajectory Prediction

Zhe Huang, Ruohua Li, Kazuki Shin, Katherine Driggs-Campbell

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV

Comments 8 pages, 6 figures, Accepted by RA-L with ICRA 2022 presentation option

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.17045 2021-04-01 cs.CV cs.AI 62%

SRA-LSTM: Social Relationship Attention LSTM for Human Trajectory Prediction

Yusheng Peng, Gaofeng Zhang, Jun Shi, Benzhu Xu, Liping Zheng

专题命中 动作表示与策略 :action model(abstract);分类 cs.CV、cs.AI

Comments Submitted to Neural Computing and Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.13185 2021-03-01 cs.LG cs.AI 62%

Off-Policy Imitation Learning from Observations

Zhuangdi Zhu, Kaixiang Lin, Bo Dai, Jiayu Zhou

专题命中 动作表示与策略 :action model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.07599 2021-01-20 cs.RO cs.AI 62%

Meta-Reinforcement Learning for Adaptive Motor Control in Changing Robot Dynamics and Environments

Timothée Anne, Jack Wilkinson, Zhibin Li

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.07501 2020-01-28 cs.RO cs.AI 62%

Learning efficient haptic shape exploration with a rigid tactile sensor array

Sascha Fleer, Alexandra Moringen, Roberta L. Klatzky, Helge Ritter

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.AI

Journal ref PLOS ONE 15(1): e0226880 (2020)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26742 2025-10-31 cs.RO 61%

Running VLAs at Real-time Speed

Yunchao Ma, Yizhuang Zhou, Yunhuan Yang, Tiancai Wang, Haoqiang Fan

机构 * Dexmal StepFun

专题命中 动作表示与策略 :VLA(abstract,comments);分类 cs.RO

Comments Code is available at https://github.com/Dexmal/realtime-vla

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12436 2026-08-14 cs.LG cs.MA cs.NI 新提交 57%

Multi-AUV Ad-hoc network-based Target Tracking: A Value Gradient Guidance Multi-Agent Diffusion Reinforcement Learning Approach

基于多AUV自组织网络的目标跟踪:一种值梯度引导多智能体扩散强化学习方法

Jiaao Ma, Chuan Lin, Guangjie Han, Shengchao Zhu, Qian Zhu, Ying Liu, Zhenyu Wang

机构 * Software College, Northeastern University(东北大学软件学院) Hohai University(河海大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.LG

AI总结 针对多AUV自组织网络目标跟踪的训练不稳定、跟踪性能差问题,提出VGG-MADiffRL算法与MDCA架构,实现了更快收敛、更高跟踪精度与平稳训练动态,具有工程应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05706 2026-08-07 cs.CV 新提交 57%

LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models

LAWM-3D:从人类视频中学习具有3D感知能力的潜在动作以构建可泛化的机器人世界模型

Jiarui Yang, Jiale Zhange, Jiawei Li, Hang Guo, Wen Huang, Jinpeng Wang, Peidong Liu, Shu-Tao Xia

专题命中 动作表示与策略 :action model(abstract);分类 cs.CV

AI总结 本研究针对现有潜在动作模型缺乏3D感知能力的问题,提出LAWM-3D模型,通过多视图动作 token 化、几何对齐约束和RGB-D联合重建目标,实现了性能SOTA的机器人世界模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07386 2026-08-04 cs.RO 版本更新 57%

Spline Policy: A Structured Representation for Robot Policies

样条策略:机器人策略的结构化表示

Mengze Tian, Yiming Li, Sichao Liu, Auke Ijspeert, Sylvain Calinon

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL)) Idiap Research Institute(Idiap研究 institute)

专题命中 动作表示与策略 :vision-language-action(abstract);分类 cs.RO

AI总结 提出样条策略(SP),用样条参数替代动作块,保留策略主干,支持连续轨迹解码、时域重采样、参数空间编辑及下游控制,并具有局部修正机制。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18060 2026-07-29 cs.RO 版本更新 57%

RoboHarness: Memory-Driven Orchestration of Heterogeneous Robot Policies for Long-Horizon Planning

RoboHarness:用于长期规划的异构机器人策略的内存驱动编排

Jinbang Huang, Yuanzhao Hu, Zhiyuan Li, Ran Qi, Yixin Xiao, Zhanguang Zhang, Mark Coates, Tongtong Cao, Yingxue Zhang

机构 * Huawei Noah’s Ark Lab(华为诺亚方舟实验室) University of British Columbia(英属哥伦比亚大学) University of Toronto(多伦多大学) McGill University(麦吉尔大学) Labs(2012实验室)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO

AI总结 针对长期机器人任务需多种能力、异构策略编排难的问题,提出RoboHarness框架,通过多模态执行内存等表征策略能力边界,经内存桥接稳定策略交接,实验验证其在长期规划和分布外鲁棒性上有显著提升。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13960 2026-07-20 cs.RO 版本更新 57%

GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch

GigaWorld-Policy-0.5:由自动研究赋能的更快更强的世界行动模型

GigaWorld Team, Angen Ye, Angyuan Ma, Boyuan Wang, Chaojun Ni, Fangzheng Ye, Guan Huang, Guo Li, Guosheng Zhao, Haodong Yan, Hengtao Li, Jiwen Lu, Kai Wang, Mingming Yu, Qitang Hu, Qiuping Deng, Songling Liu, Xiaoyu Tian, Xiaofeng Wang, Xinyu Zhou, Xiuwei Xu, Xinze Chen, Yang Wang, Yejun Zeng, Yifan Chang, Yun Ye, Zhenyu Wu, Zhanqian Wu, Zheng Zhu

机构 * GigaAI(字节跳动人工智能实验室) Tsinghua University(清华大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO

AI总结 研究旨在改进机器人策略学习,提出GigaWorld-Policy-0.5这一增强型以动作中心的WAM。预训练采用混合策略加强视觉与动作耦合,推理引入新架构提升效率,还用自动研究管道搜索训练配置,有效提升了机器人控制推理效率并保留训练优势。

Comments project page: https://open-gigaai.github.io/giga-world-policy/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11397 2026-07-14 cs.RO 新提交 57%

WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos

WALA:从带动作标签的演示和无动作视频中学习可执行的潜在动作

Jiahao Liu, Zhongpu Xia, Shuai Tian, Huangrui Li, Yuhang Zheng, Ning Ma, Xin Fu, Xiaotian Liu, Jing Li, Yixian Li, ShangQing Zhou, Zebin Xing, Linbo Wang, Chaoyue Li, Haoran Li, Dongbin Zhao

机构 * CASIA(中国科学院自动化所) Anyverse Dynamics(Anyverse动力学公司) UCAS(中国科学院大学) NUS(新加坡国立大学) XJYLU(西安交通大学利物浦大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO

AI总结 研究从带动作标签演示和无动作视频学习可执行潜在动作的问题,提出WALA框架,先预训练语义几何潜在动作模型,策略训练时编码器和解码器协同,由多方面联合监督潜在动作,实验证明其提升了机器人策略性能和泛化能力。

Comments Project page: https://liujiahao2077.github.io/WALA.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04991 2026-07-01 cs.RO 版本更新 57%

Wavelet Policy: Imitation Learning in the Scale Domain with World Prior Memory

小波策略:基于世界先验记忆的尺度域模仿学习

Changchuan Yang, Haoxuan Xu, Yuhang Dong, Guanzhong Tian, Haizhou Ge, Hongrui Zhu

机构 * Zhejiang University(浙江大学) Tsinghua University, DISCOVER Robotics(清华大学,DISCOVER机器人实验室) Hangzhou TaiWeave Robotics Co., Ltd.(杭州太 weave 机器人有限公司)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO

AI总结 本文提出小波策略,结合世界先验记忆与小波多尺度动作建模,通过编码静态背景图像中的持久物理场景结构,提升长周期机器人操作的效率与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27325 2026-06-26 cs.CV 新提交 57%

Not All Actions Are Equal: Rethinking Conditioning for Dexterous World Model

并非所有动作都同等重要:重新思考灵巧世界模型的条件化

Zizhao Yuan, Zhengtu Liang, Taowen Wang, Qiwei Liang, Yichi Wang, Yunheng Wang, Yuetong Fang, Lusong Li, Zecui Zeng, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shenzhen University(深圳大学) Beijing University of Technology(北京工业大学) JD Explore Academy(京东探索研究院)

专题命中 动作表示与策略 :action model(abstract);分类 cs.CV

AI总结 针对高自由度灵巧动作中不同分量重要性不均导致优化失衡的问题,提出DexAC-WM,通过动作标记化保留维度级语义,结合局部细化与全局调制对齐动作与视觉动态,并引入语义分支提供物体场景先验,显著提升视频预测的真实感和动作一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21144 2026-06-23 cs.CL cs.AI 新提交 57%

AdaMem: Learning What to Remember for Personalized Long-Horizon LLM Agents

AdaMem: 学习为个性化长时程LLM代理记住什么

Xingyu Chen, Rui Wang, Zhaopeng Tu, Liefeng Bo

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

专题命中 动作表示与策略 :action model(abstract);分类 cs.AI

AI总结 针对长时程LLM代理中记忆膨胀导致QA准确率下降的问题,提出AdaMem方法,通过角色特定的记忆策略和基于反馈的轻量级自反思步骤,学习为每个用户记住重要信息,在减少9%记忆量的同时提升QA准确率最高9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03868 2026-06-03 cs.CV 57%

Unified Video-Action Joint Denoising for Dexterous Action and Data Generation

统一视频-动作联合去噪用于灵巧动作与数据生成

Dingrui Wang, YuAn Wang, Jinkun Liu, Yue Zhang, Mattia Piccinini, Yu Sun, Johannes Betz

机构 * Technical University of Munich(慕尼黑技术大学) ByteDance(字节跳动) Tsinghua University(清华大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.CV

AI总结 提出Donk模型,通过联合建模交互视频与手部轨迹的分布,实现灵巧手的动作生成与数据增强。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02105 2026-06-02 cs.CV 57%

Multimodal Action Diffusion for Robust End-to-End Autonomous Driving

多模态动作扩散用于鲁棒的端到端自动驾驶

Jorge Daniel Rodríguez-Vidal, Diego Porres, Gabriel Villalonga Pineda, Antonio M. López Peña

机构 * Computer Vision Center (CVC)(计算机视觉中心) Universitat Autònoma de Barcelona (UAB)(巴塞罗那自治大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.CV

AI总结 提出动作扩散变换器(ADT),通过多模态动作建模和最近邻匹配,在闭环Bench2Drive基准上超越先前最优方法,同时延迟降低十倍。

Comments Preprint. June 1st, 2026. Corresponding author: Jorge Daniel Rodríguez-Vidal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01597 2026-06-02 cs.RO cs.MA 57%

Physics-Informed Modeling and Control of Emergent Behaviors in Robot Swarms

机器人群体涌现行为的物理信息建模与控制

Zixuan Jin, Wenzhuo Zhang, Shuxian Quan, Zirui Dong, Fangwen Ye, Yuchen Shi, Cheng Xu

机构 * School of Computer and Communication Engineering, University of Science and Technology Beijing(北京科技大学计算机与通信工程学院) Shunde Innovation School, University of Science and Technology Beijing(北京科技大学顺德创新学院)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO

AI总结 提出PhySwarm框架,利用多阶段对流-扩散-反应宏观模型和等效确定性运动微观模型,结合神经物理控制器,实现机器人群体多阶段涌现行为的建模与控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16229 2026-05-26 cs.LG 57%

Factored Latent Action World Models

因子化潜在动作世界模型

Zizhao Wang, Chang Shi, Jiaheng Hu, Kevin Rohling, Roberto Martín-Martín, Amy Zhang, Peter Stone

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 动作表示与策略 :action model(abstract);分类 cs.LG

AI总结 提出因子化潜在动作模型(FLAM),通过将场景分解为独立因子并学习各自的潜在动作,提升了无动作视频中多实体动态建模的准确性和视频生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25058 2026-05-26 cs.HC cs.AI 57%

Intent Signal Theory: A Computational Framework for Intent-State Control in Human-AI Interaction

意图信号理论:人机交互中意图状态控制的计算框架

Gang Peng

机构 * Huizhou Lateni AI Technology Co., Ltd.(惠州莱尼人工智能技术有限公司) Huizhou University(惠州大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.AI

AI总结 提出意图信号理论(IST),通过区分潜在源意图、可观测意图代理、编码载体和模型输出四个对象,形式化意图丢失定理,并基于六种大语言模型、三种语言和三个任务领域的实验验证了结构-保真度分裂等预测,将提示工程重新定义为意图协议设计。

Comments 10 pages, 2 figures. Theoretical framework paper grounded in four companion empirical studies. Data and code repository: https://github.com/PGlarry/prompt-protocol-specification

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24681 2026-05-22 cs.RO 57%

Learning Human-Intention Priors from Large-Scale Human Demonstrations for Robotic Manipulation

从大规模人类示范中学习人类意图先验以用于机器人操作

Yifan Xie, YuAn Wang, Guangyu Chen, Jinkun Liu, Yu Sun, Wenbo Ding

机构 * Tsinghua University(清华大学) ByteDance(字节跳动)

专题命中 动作表示与策略 :vision-language-action(abstract);分类 cs.RO

AI总结 本文提出MoT-HRA框架,通过大规模人类示范学习人类意图先验,用于机器人操作,通过构建HA-2.2M数据集和三个耦合专家提升动作合理性和鲁棒性。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17681 2026-05-19 cs.RO 57%

PRIME: Physically-consistent Robotic Inertial and Motion Estimation for Legged and Humanoid Robots

PRIME: 为四足机器人和人形机器人提供物理一致的机器人惯性与运动估计

Jiarong Kang, Kunzhao Ren, Tao Pang, Xiaobin Xiong

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Shanghai Innovation Institute(上海创新研究院)

专题命中 动作表示与策略 :robot foundation model(abstract);分类 cs.RO

AI总结 该研究提出PRIME方法,通过结合可微接触动力学和光滑互补约束,实现从 onboard 传感器数据中获得物理一致的运动轨迹和惯性参数估计,从而提升机器人运动估计的准确性。

Comments Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15352 2026-05-18 cs.RO 57%

Diffusion Policy for Coordinated Control of a Nonholonomic Mobile Base and Dual Arms in Door Opening and Passing

扩散策略用于非holonomic移动基底和双臂的协调控制以开门和通过

Shangqun Yu, Matthew En, Daniel Wu, Sangjun Park, Ziyi Zhou, Seyed Fakoorian, Donghyun Kim

机构 * Manning College of Information and Computer Sciences, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校信息与计算机科学学院) alpha-z

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO

AI总结 本文提出基于扩散的视觉-运动控制策略,实现非holonomic移动基底与双臂的协调控制,以完成开门和通过任务,展示了在复杂约束下的高成功率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03540 2026-04-22 cs.RO 57%

Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control

基于漂移的策略优化:面向在线机器人控制的原生一步生成策略

Yuxuan Gao, Yedong Shen, Shiqi Zhang, Wenhao Yu, Yifan Duan, Jia pan, Jiajia Wu, Jiajun Deng, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO

AI总结 本文提出一种原生一步生成策略框架,通过将迭代细化移至训练阶段,提升在线机器人控制的效率与稳定性,实验显示其在推理速度和性能上优于多步扩散策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01860 2026-04-03 cs.RO 57%

Posterior Optimization with Clipped Objective for Bridging Efficiency and Stability in Generative Policy Learning

后验优化与截断目标:在生成策略学习中平衡效率与稳定性

Yuhui Chen, Haoran Li, Zhennan Jiang, Yuxing Qin, Yuxuan Wan, Weiheng Liu, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) CFCS, School of Computer Science, Peking University(北京大学计算机学院前沿计算研究中心) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 动作表示与策略 :VLA(abstract);分类 cs.RO

AI总结 本文提出POCO框架,通过后验推断方法改进策略,结合离线到在线范式,提升生成模型在机器人操控中的稳定性和效率,实验证明其在多个任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16212 2026-03-26 cs.RO 57%

Point Bridge: 3D Representations for Cross Domain Policy Learning

点桥:跨领域策略学习的3D表示

Siddhant Haldar, Lars Johannsmeier, Lerrel Pinto, Abhishek Gupta, Dieter Fox, Yashraj Narang, Ajay Mandlekar

机构 * NVIDIA New York University(纽约大学) University of Washington(华盛顿大学)

专题命中 动作表示与策略 :robot foundation model(abstract);分类 cs.RO

AI总结 点桥通过统一的点表示实现跨领域策略学习,利用视觉语言模型提取点表示,结合Transformer策略学习,无需显式视觉或物体对齐,提升仿真到现实的零样本迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03044 2026-03-25 cs.RO 57%

Video2Act: A Dual-System Video Diffusion Policy with Robotic Spatio-Motional Modeling

Video2Act:一种双系统视频扩散策略,具有机器人空间-运动建模

Yueru Jia, Jiaming Liu, Shengbang Liu, Rui Zhou, Wanhe Yu, Yuyang Yan, Xiaowei Chi, Yandong Guo, Boxin Shi, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,北京大学计算机学院) AI 2 Robotics(AI与机器人) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 动作表示与策略 :VLA(abstract);分类 cs.RO

AI总结 Video2Act通过整合空间和运动感知表示,提升机器人动作学习效率,其双系统设计在仿真和现实任务中均取得显著成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16407 2026-03-24 cs.RO 57%

LAOF: Robust Latent Action Learning with Optical Flow Constraints

LAOF:基于光流约束的鲁棒潜在动作学习

Xizhou Bu, Jiexi Lyu, Fulei Sun, Ruichen Yang, Zhiqiang Ma, Wei Li

机构 * Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学)

专题命中 动作表示与策略 :embodied foundation model(abstract);分类 cs.RO

AI总结 本文提出LAOF方法,通过利用光流作为动作驱动信号,学习鲁棒的潜在动作表示,以应对动作无关的干扰。实验表明,LAOF在下游模仿学习和强化学习任务中表现优异,尤其在标注稀缺条件下效果显著。

Comments CVPR 2026; Project page: https://github.com/XizoB/LAOF

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20538 2026-03-24 cs.LG stat.ML 57%

Understanding Behavior Cloning with Action Quantization

通过动作量化理解行为克隆

Haoqun Cao, Tengyang Xie

机构 * Department of Computer Sciences, University of Wisconsin–Madison, Madison, WI, USA(威斯康星大学麦迪逊分校计算机科学系)

专题命中 动作表示与策略 :vision-language-action(abstract);分类 cs.LG

AI总结 本文研究行为克隆中动作量化的影响,分析量化误差传播与统计样本复杂度的相互作用,证明量化行为克隆在稳定动态和概率光滑性条件下可达到最优样本复杂度,提出基于模型的增强方法以改进误差界。

详情

展开后加载摘要…

URL PDF HTML 收藏