arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 238 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 动作表示与策略 238 篇

2606.27567 2026-06-29 cs.CR cs.AI cs.LG 新提交 62%

On the Inseparability of Instructions and Data in Shared-Embedding Sequence Models

论共享嵌入序列模型中指令与数据的不可分离性

Dewank Pant, Shruti Lohani, Avijit Kumar

机构 * Independent Researcher(独立研究员)

专题命中 动作表示与策略 :action model(abstract);分类 cs.AI、cs.LG

AI总结 本文证明在共享嵌入架构中,由于缺乏强制控制-数据分离,完美防御提示注入在数学上是不可能的,并提出了语义忠实控制(SFC)的概念,通过三个理论结果揭示了其根本原因,类比冯·诺依曼架构的代码-数据混淆问题。

Comments 18 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23537 2026-06-23 cs.DB cs.AI cs.LG 新提交 62%

SQLConductor: Search-to-Policy Learning for Step-wise Text-to-SQL Orchestration

SQLConductor:面向逐步文本到SQL编排的搜索到策略学习

Yizhang Zhu, Zhangyang Peng, Boyan Li, Yuyu Luo

机构 * HKUST(GZ)(香港科技大学(广州))

专题命中 动作表示与策略 :action model(abstract);分类 cs.AI、cs.LG

AI总结 提出SQLConductor框架,通过搜索到策略学习将文本到SQL任务分解为动作序列,用蒙特卡洛树搜索探索工作流并训练策略模型逐步编排,在BIRD-Dev上达73.2%执行准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20135 2026-06-19 cs.RO cs.AI 新提交 62%

Frequency-Aware Flow Matching for Continuous and Consistent Robotic Action Generation

频率感知流匹配用于连续且一致的机器人动作生成

Jianing Guo, Fangzheng Chen, Zihao Mao, Wong Lik Hang Kenny, Zhenhong Wu, Yu Li, Yishuai Cai, Yuanpei Chen, Yikun Ban, Kai Chen, Qi Dou, Yaodong Yang, Xianglong Liu, Huijie Zhao, Simin Li

机构 * Beihang University(北京航空航天大学) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学) PKU-Psibot Lab(北大-智源机器人实验室) Zhongguancun Laboratory(中关村实验室) Hefei Comprehensive National Science Center(合肥综合性国家科学中心)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.AI

AI总结 提出频率感知流匹配(FAFM),通过离散余弦变换将离散动作序列转换到频域进行流匹配,并正则化一阶时间导数以生成平滑连续的动作,提升成功率、多模态表达性和运动平滑性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08495 2026-06-09 cs.RO cs.CV 新提交 62%

EgoPriMo: Egocentric Motion Generation for Interactive Humanoid Control

EgoPriMo:面向交互式人形控制的自我中心运动生成

Haoyang Ge, Peng Ren, Yukun Shi, Cong Huang, Kun Li, Kai Chen

机构 * Tianjin University(天津大学) Zhongguancun Academy(中关村学院) Beihang University(北京航空航天大学) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) DeepCybo

专题命中 动作表示与策略 :vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 提出EgoPriMo框架,通过自我中心人类演示学习全身运动先验,利用三流DiT联合建模身体动态、视觉上下文和文本,支持重建、生成和预测,并在Unitree人形机器人上执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10642 2026-05-14 cs.RO cs.AI 62%

UniJEPA: Enhancing Robot Policy via Unified Continuous and Discrete Representation Learning

UniJEPA:通过统一的连续和离散表示学习增强机器人策略

Jianke Zhang, Yucheng Hu, Yanjiang Guo, Xiaoyu Chen, Yichen Liu, Wenna Chen, Chaochao Lu, Jianyu Chen

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University, Beijing, China.(清华大学交叉信息研究院) Shanghai Qi Zhi Institute, Shanghai, China(上海启智研究院) Peking University, Beijing, China(北京大学) Shanghai AI Lab, Shanghai, China(上海人工智能实验室)

专题命中 动作表示与策略 :VLA(abstract);分类 cs.RO、cs.AI

AI总结 本文提出UniJEPA,通过大规模预训练学习高维视觉特征,结合理解、规划和连续未来表示学习,提升机器人在开放环境中的任务执行能力。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02600 2026-05-13 cs.RO cs.AI 62%

CoRAL: Contact-Rich Adaptive LLM-based Control for Robotic Manipulation

CoRAL:富含接触的自适应LLM基于控制用于机械臂操作

Berk Çiçek, Mert K. Er, Ozgur S. Oguz

机构 * LiRA Lab, Department of Computer Engineering Bilkent University(LiRA实验室,计算机工程系,比尔肯特大学)

专题命中 动作表示与策略 :VLA(abstract);分类 cs.RO、cs.AI

AI总结 CoRAL通过解耦高层推理与低层控制,利用LLM设计成本函数,结合神经符号适应循环和记忆单元,实现接触密集任务的自适应控制,提升成功率50%以上。

Comments 22 pages, 9 figures, 3 tables. Accepted to Robotics: Science and Systems (RSS) 2026. Updated to camera-ready version with appendix and text/formatting revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00475 2026-05-04 cs.RO cs.CV 62%

MSACT: Multistage Spatial Alignment for Stable Low-Latency Fine Manipulation

MSACT:多阶段空间对齐用于稳定低延迟精细操控

Xianbo Cai, Hideyuki Ichiwara, Masaki Yoshikawa, Tetsuya Ogata

机构 * Department of Intermedia Art and Science, Waseda University(武藏大学多媒体艺术与科学系) National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院)

专题命中 动作表示与策略 :vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 本文提出MSACT,通过多阶段空间对齐模块提升低延迟精细操控的稳定性,结合预训练ResNet视觉先验,增强视觉到动作的映射稳定性,实验证明在模拟和真实任务中提升了定位稳定性和任务性能。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19734 2026-04-22 cs.RO cs.AI 62%

UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling

UniT:迈向人类到人形机器人政策学习和世界建模的统一物理语言

Boyu Chen, Yi Chen, Lu Qiu, Jerry Bai, Yuying Ge, Yixiao Ge

机构 * XPENG Robotics(小鹏机器人) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 动作表示与策略 :VLA(abstract);分类 cs.RO、cs.AI

AI总结 UniT通过三分支交叉重建机制建立统一物理语言,实现人类到人形机器人的跨身体迁移,提升政策学习和世界建模的效率与鲁棒性。

Comments Project page: https://xpeng-robotics.github.io/unit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06168 2026-04-16 cs.CV cs.RO 62%

Action Images: End-to-End Policy Learning via Multiview Video Generation

动作图像:通过多视图视频生成实现端到端策略学习

Haoyu Zhen, Zixian Gao, Qiao Sun, Yilin Zhao, Yuncong Yang, Yilun Du, Pengsheng Guo, Tsun-Hsuan Wang, Yi-Ling Qiao, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) NVIDIA(英伟达) Harvard University(哈佛大学) Genesis AI

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Action Images,通过多视图视频生成实现策略学习,利用像素化的动作表示,使视频模型本身成为零样本策略,提升视频-动作联合生成质量。

Comments Project Page: https://actionimages.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22652 2026-04-03 cs.RO cs.CV 62%

Pixel Motion Diffusion is What We Need for Robot Control

我们为机器人控制需要像素运动扩散

E-Ro Nguyen, Yichi Zhang, Kanchana Ranasinghe, Xiang Li, Michael S. Ryoo

机构 * Stony Brook University(石溪大学)

专题命中 动作表示与策略 :language-conditioned robot(abstract);分类 cs.RO、cs.CV

AI总结 DAWN框架通过结构化像素运动表示连接高层运动意图与底层机器人动作,实现端到端可训练系统,展示多任务性能和现实迁移能力。

Comments Accepted to CVPR 2026. Project page: https://eronguyen.github.io/DAWN

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12882 2026-04-01 cs.RO cs.AI 62%

Towards High-Consistency Embodied World Model with Multi-View Trajectory Videos

面向多视角轨迹视频的高一致性具身世界模型

Taiyi Su, Jian Zhu, Yaxuan Li, Chong Ma, Jianjun Zhang, Zitai Huang, Hanli Wang, Yi Xu

机构 * Midea Group(美的集团) Tongji University(同济大学) East China Normal University(华东师范大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.AI

AI总结 本文提出MTV-World模型,通过多视角轨迹视频控制实现精准的视觉-运动预测,解决低层次动作与真实物理交互不一致的问题,实验表明其在复杂双臂场景中表现优异。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11110 2026-03-13 cs.RO cs.AI 62%

ResWM: Residual-Action World Model for Visual RL

ResWM:基于视觉强化学习的残差动作世界模型

Jseen Zhang, Gabriel Adineera, Jinzhou Tan, Jinoh Kim

机构 * University of California, San Diego(加州大学圣地亚哥分校) Texas A&M University-Commerce(德克萨斯A&M大学-科摩斯)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.AI

AI总结 ResWM通过将控制变量从绝对动作转换为残差动作,提升了视觉强化学习中世界模型的预测能力和稳定性,实现了更高效的样本利用和更平滑的控制策略。

Comments Submit KDD2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11214 2026-02-13 cs.CV cs.RO 62%

DD-MDN: Human Trajectory Forecasting with Diffusion-Based Dual Mixture Density Networks and Uncertainty Self-Calibration

DD-MDN: 基于扩散的双混合密度网络与不确定性自校准的人体轨迹预测

Manuel Hetzel, Kerim Turacan, Hannes Reichert, Konrad Doll, Bernhard Sick

机构 * Faculty of Engineering, University of Applied Sciences Aschaffenburg(亚琛应用科学大学工程学院) Intelligent Embedded Systems Lab, University of Kassel(卡塞尔大学智能嵌入式系统实验室)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV

AI总结 DD-MDN通过结合扩散模型和双混合密度网络,实现高精度的人体轨迹预测,具备自校准的不确定性建模和对短观察期的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16411 2025-12-04 cs.RO cs.LG 62%

The Duality of Generative AI and Reinforcement Learning in Robotics: A Review

生成式人工智能与强化学习在机器人中的双重性:综述

Angelo Moroncelli, Vishal Soni, Marco Forgione, Dario Piga, Blerina Spahiu, Loris Roveda

机构 * SUPSI(瑞士苏黎世联邦理工学院)

专题命中 动作表示与策略 :VLA(abstract);分类 cs.RO、cs.LG

AI总结 本文综述了生成式人工智能与强化学习在机器人中的双重性,探讨了两者的整合方法、挑战及未来研究方向。

Comments Submitted for publication to Information Fusion

Journal ref Information Fusion Volume 129, May 2026, 104003

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20578 2025-10-24 cs.CV cs.RO 62%

EmbodiedBrain: Expanding Performance Boundaries of Task Planning for Embodied Intelligence

Ding Zou, Feifan Wang, Mengyu Ge, Siyuan Fan, Zongbing Zhang, Wei Chen, Lingfeng Wang, Zhongyou Hu, Wenrui Yan, Zhengwei Gao, Hao Wang, Weizhao Jin, Yu Zhang, Hainan Zhao, Mingliang Zhang, Xianxian Xi, Yaru Zhang, Wenyuan Li, Zhengguang Gao, Yurui Zhu

机构 * ZTE NebulaBrain Team(ZTE NebulaBrain团队)

专题命中 动作表示与策略 :embodied foundation model(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14952 2025-10-20 cs.RO cs.CV 62%

From Language to Locomotion: Retargeting-free Humanoid Control via Motion Latent Guidance

Zhe Li, Cheng Chi, Yangyang Wei, Boan Zhu, Yibo Peng, Tao Huang, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang, Chang Xu

机构 * University of Sydney(悉尼大学) BAAI(北京人工智能研究院) Harbin Institute of Technology(哈尔滨工业大学) Hong Kong University of Science and Technology(香港科学与技术大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 动作表示与策略 :vision-language-action(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12483 2025-10-15 cs.RO cs.CV 62%

Fast Visuomotor Policy for Robotic Manipulation

Jingkai Jia, Tong Yang, Xueyao Chen, Chenhuan Liu, Wenqiang Zhang

机构 * Fudan University(复旦大学) MEGVII Technology(MEGVII科技)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00613 2025-10-01 cs.RO cs.AI 62%

WorldGym: World Model as An Environment for Policy Evaluation

Julian Quevedo, Ansh Kumar Sharma, Yixiang Sun, Varad Suryavanshi, Percy Liang, Sherry Yang

机构 * Stanford University(斯坦福大学) NYU(纽约大学) Google DeepMind(谷歌DeepMind)

专题命中 动作表示与策略 :VLA(abstract);分类 cs.RO、cs.AI

Comments https://world-model-eval.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07817 2025-08-29 cs.RO cs.CV 62%

Pixel Motion as Universal Representation for Robot Control

Kanchana Ranasinghe, Xiang Li, E-Ro Nguyen, Cristina Mata, Jongwoo Park, Michael S Ryoo

机构 * Stony Brook University(石溪大学)

专题命中 动作表示与策略 :vision-language-action(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04634 2025-07-08 cs.CV cs.AI 62%

LTMSformer: A Local Trend-Aware Attention and Motion State Encoding Transformer for Multi-Agent Trajectory Prediction

Yixin Yan, Yang Li, Yuanfan Wang, Xiaozhou Zhou, Beihao Xia, Manjiang Hu, Hongmao Qin

机构 * College of Mechanical and Vehicle Engineering, Hunan University(湖南大学机械与车辆工程学院) School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院)

专题命中 动作表示与策略 :action model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00785 2024-11-05 cs.RO cs.AI 62%

IGOR: Image-GOal Representations are the Atomic Control Units for Foundation Models in Embodied AI

Xiaoyu Chen, Junliang Guo, Tianyu He, Chuheng Zhang, Pushi Zhang, Derek Cathera Yang, Li Zhao, Jiang Bian

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.15321 2024-10-28 cs.CV cs.LG 62%

Soft Attention: Does it Actually Help to Learn Social Interactions in Pedestrian Trajectory Prediction?

Laurent Boucaud, Daniel Aloise, Nicolas Saunier

专题命中 动作表示与策略 :action model(abstract);分类 cs.CV、cs.LG

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.19075 2024-09-13 cs.RO cs.AI 62%

Language-Conditioned Imitation Learning with Base Skill Priors under Unstructured Data

Hongkuan Zhou, Zhenshan Bing, Xiangtong Yao, Xiaojie Su, Chenguang Yang, Kai Huang, Alois Knoll

专题命中 动作表示与策略 :language-conditioned robot(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17511 2024-02-28 cs.RO cs.AI 62%

Rethinking Mutual Information for Language Conditioned Skill Discovery on Imitation Learning

Zhaoxun Ju, Chao Yang, Hongbo Wang, Yu Qiao, Fuchun Sun

专题命中 动作表示与策略 :language-conditioned robot(abstract);分类 cs.RO、cs.AI

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17339 2024-02-28 cs.CV cs.AI 62%

SocialCVAE: Predicting Pedestrian Trajectory via Interaction Conditioned Latents

Wei Xiang, Haoteng Yin, He Wang, Xiaogang Jin

专题命中 动作表示与策略 :action model(abstract);分类 cs.CV、cs.AI

Comments Accepted by AAAI'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.06292 2023-10-13 cs.RO cs.LG 62%

Joint Metrics Matter: A Better Standard for Trajectory Forecasting

Erica Weng, Hana Hoshino, Deva Ramanan, Kris Kitani

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.LG

Comments Published as a conference paper at ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.00575 2023-05-02 cs.CV cs.RO 62%

IPCC-TP: Utilizing Incremental Pearson Correlation Coefficient for Joint Multi-Agent Trajectory Prediction

Dekai Zhu, Guangyao Zhai, Yan Di, Fabian Manhardt, Hendrik Berkemeyer, Tuan Tran, Nassir Navab, Federico Tombari, Benjamin Busam

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV

Comments CVPR 2023 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.10677 2023-03-06 cs.AI cs.LG stat.ML 62%

Imitating Human Behaviour with Diffusion Models

Tim Pearce, Tabish Rashid, Anssi Kanervisto, Dave Bignell, Mingfei Sun, Raluca Georgescu, Sergio Valcarcel Macua, Shan Zheng Tan, Ida Momennejad, Katja Hofmann, Sam Devlin

专题命中 动作表示与策略 :action model(abstract);分类 cs.AI、cs.LG

Comments Published in ICLR 2023

Journal ref ICLR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.14164 2023-01-24 cs.LG cs.AI 62%

On Transforming Reinforcement Learning by Transformer: The Development Trajectory

Shengchao Hu, Li Shen, Ya Zhang, Yixin Chen, Dacheng Tao

专题命中 动作表示与策略 :action model(abstract);分类 cs.AI、cs.LG

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.04822 2022-08-31 cs.LG cs.AI 62%

Generalized Reinforcement Learning: Experience Particles, Action Operator, Reinforcement Field, Memory Association, and Decision Concepts

Po-Hsiang Chiu, Manfred Huber

专题命中 动作表示与策略 :action model(abstract);分类 cs.AI、cs.LG

Comments 37 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏