arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 238 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 动作表示与策略 238 篇

2601.20334 2026-06-30 cs.RO cs.AI cs.LG 75%

Demonstration-Free Robotic Control via LLM Agents

无需演示的机器人控制 via LLM 代理

Brian Y. Tsui, Alan Y. Fang, Tiffany J. Hwu

机构 * independent researchers(独立研究人员)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出FAEA框架,利用通用大语言模型实现无需演示的机器人操控,通过迭代推理生成操控策略,在多个基准测试中取得高成功率,展示了通用代理在任务规划中的有效性。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10614 2026-06-10 cs.RO cs.CV cs.LG 新提交 75%

Dexterous Point Policy: Learning Point-based Dexterous Hand Policies from Human Demonstrations

灵巧点策略:从人类演示中学习基于点的灵巧手策略

Beomjun Kim, Seong Hyeon Park, Seunghoon Sim, Seungjun Moon, Sanghyeok Lee, Jinwoo Shin

机构 * KAIST(韩国科学技术院)

专题命中 动作表示与策略 :VLA(abstract,abstract_cn);分类 cs.RO、cs.CV、cs.LG

AI总结 提出Dexterous Point Policy框架,通过统一3D关键点表示从人类视频学习灵巧操作策略,无需机器人演示,在真实任务中达到75%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15219 2026-03-30 cs.CV cs.LG cs.MA cs.MM cs.RO 75%

Out-of-Sight Embodied Agents: Multimodal Tracking, Sensor Fusion, and Trajectory Forecasting

视线外的具身智能体:多模态跟踪、传感器融合与轨迹预测

Haichao Zhang, Yi Xu, Yun Fu

机构 * Department of Electrical and Computer Engineering, Northeastern University(东北大学电气与计算机工程系) Khoury College of Computer Sciences, Northeastern University(东北大学库里计算机科学学院)

专题命中 动作表示与策略 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出改进的视线外轨迹预测方法,通过视觉定位去噪模块提升轨迹预测性能,实验表明在Vi-Fi和JRDB数据集上达到最优效果,为自动驾驶、机器人和监控提供新方向。

Comments Published in IEEE Transactions on Pattern Analysis and Machine Intelligence (Early Access), pp. 1-14, March 23, 2026

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20328 2025-10-24 cs.RO cs.AI cs.LG 75%

MemER: Scaling Up Memory for Robot Control via Experience Retrieval

Ajay Sridhar, Jennifer Pan, Satvik Sharma, Chelsea Finn

机构 * Stanford University(斯坦福大学)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI、cs.LG

Comments Project page: https://jen-pan.github.io/memer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05273 2025-02-04 cs.CV cs.AI cs.RO 75%

HiRT: Enhancing Robotic Control with Hierarchical Robot Transformers

Jianke Zhang, Yanjiang Guo, Xiaoyu Chen, Yen-Jen Wang, Yucheng Hu, Chengming Shi, Jianyu Chen

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

Comments Accepted to CORL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01034 2024-12-03 cs.RO cs.CV cs.LG 75%

Quantization-Aware Imitation-Learning for Resource-Efficient Robotic Control

Seongmin Park, Hyungmin Kim, Wonseok Jeon, Juyoung Yang, Byeongwook Jeon, Yoonseon Oh, Jungwook Choi

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05855 2025-08-12 cs.RO cs.CV 74%

DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control

Junjie Wen, Yichen Zhu, Jinming Li, Zhibin Tang, Chaomin Shen, Feifei Feng

专题命中 动作表示与策略 :VLA(abstract,comments);vision-language-action(abstract);分类 cs.RO、cs.CV

Comments The webpage is at https://dex-vla.github.io/. DexVLA is accepted by CoRL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23782 2026-07-28 cs.RO 新提交 74%

$N_0$-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens

$N_0$-VTLA:使用潜在触觉令牌扩展视觉-触觉-语言-动作模型

NeoteAI Team, Fudan TEAI Team

机构 * NeoteAI Team(NeoteAI团队) Fudan TEAI Team(复旦大学TEAI团队)

专题命中 动作表示与策略 :action model(title);分类 cs.RO

AI总结 研究提出$N_0$-VTLA模型,基于视觉主干,通过视觉-触觉预训练、分阶段触觉路径集成和优势条件离线策略改进进行触觉集成训练。该模型在丰富接触基准测试中表现出色,为通用触觉驱动操作策略奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14956 2026-06-16 cs.LG 新提交 74%

A Comparative Study of Graph Neural Network Layer Selection for Interaction Modelling in Driving Trajectory Prediction

图神经网络层选择用于驾驶轨迹预测中交互建模的比较研究

George Daoud, Mohamed El-Darieby

机构 * Ontario Tech University(安大略理工大学) Assiut University(艾斯尤特大学)

专题命中 动作表示与策略 :action model(title);分类 cs.LG

AI总结 本文比较了19种图神经网络层在轨迹预测中的空间和时间处理能力,发现ARMA、Chebyshev和拓扑感知层表现最佳,并总结了基于和聚合、多头注意力和不同跳距权重等设计原则。

Comments 6 pages, 1 figure

Journal ref The IEEE Intelligent Vehicles Symposium (IEEE IV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03809 2024-05-08 cs.AI 74%

SocialFormer: Social Interaction Modeling with Edge-enhanced Heterogeneous Graph Transformers for Trajectory Prediction

Zixu Wang, Zhigang Sun, Juergen Luettin, Lavdim Halilaj

专题命中 动作表示与策略 :action model(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.01880 2022-03-04 cs.CV 74%

LatentFormer: Multi-Agent Transformer-Based Interaction Modeling and Trajectory Prediction

Elmira Amirloo, Amir Rasouli, Peter Lakner, Mohsen Rohani, Jun Luo

专题命中 动作表示与策略 :action model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.07167 2021-03-11 cs.CV 74%

GraphTCN: Spatio-Temporal Interaction Modeling for Human Trajectory Prediction

Chengxin Wang, Shaofeng Cai, Gary Tan

专题命中 动作表示与策略 :action model(title);分类 cs.CV

Comments 10 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03181 2026-08-14 cs.RO cs.CV 版本更新 73%

SpatialVAM:Spatial-Aware Multi-View Video Diffusion as a Data-Efficient Robot Policy

多视角视频扩散策略:一种3D空间-时间感知的视频动作模型

Peiyan Li, Yixiang Chen, Yuan Xu, Jiabing Yang, Xiangnan Wu, Jun Guo, Nan Sun, Long Qian, Xinghang Li, Xin Xiao, Jing Liu, Nianfeng Liu, Tao Kong, Yan Huang, Liang Wang, Tieniu Tan

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges(五时代) Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学) Wuhan University(武汉大学) Nanjing University(南京大学)

专题命中 动作表示与策略 :vision language action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 本文提出MV-VDP,通过联合建模环境的3D空间-时间状态,解决机器人操控中对3D空间结构和时间演变理解不足的问题,实现高效、鲁棒且可解释的动作执行。

Comments Updated Version; Project Website: https://spatialvam.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29201 2026-06-30 cs.RO cs.AI 73%

Behavior Uncloning: Distilling Mode Redirection into Policy Weights without Inference-Time Steering

行为去克隆:将模式重定向蒸馏到策略权重中,无需推理时引导

Hao Wang, Jiuzhou Lei, Dayou Li, Bangya Liu, Minghui Zheng, Manling Li, Ruohan Zhang, Zhiwen Fan

专题命中 动作表示与策略 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 提出MoRE方法,通过短时“去克隆”步骤将模式分类器的重定向信号蒸馏到策略权重中,抑制不安全行为模式,零推理开销提升部署成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17077 2026-05-19 cs.RO cs.AI 73%

How to Instruct Your Robot: Dense Language Annotations Power Robot Policy Learning

如何指导你的机器人:密集语言标注助力机器人策略学习

Bosung Kim, Ruiyi Wang, David Acuna, Jaehun Jung, Alexander Trevithick, Brandon Cui, Yejin Choi, Prithviraj Ammanabrolu

机构 * University of California, San Diego(加州大学圣地亚哥分校) NVIDIA

专题命中 动作表示与策略 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 本研究通过密集语言标注提升机器人策略学习效率,提出DeMiAn方法,利用视觉语言模型生成多方面标注,提升策略和世界模型性能,无需新增演示数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13456 2026-05-14 cs.AI cs.RO 73%

Block-wise Adaptive Caching for Accelerating Diffusion Policy

块级自适应缓存用于加速扩散策略

Kangye Ji, Yuan Meng, Hanyun Cui, Ye Li, Jianbo Zhou, Shengjia Hua, Lei Chen, Zhi Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 动作表示与策略 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 本文提出BAC方法,通过块级自适应缓存加速扩散策略,利用特征相似性非均匀时间动态特性,减少计算开销,实现无损动作生成加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11479 2026-05-13 cs.RO cs.AI 73%

Offline Policy Evaluation for Manipulation Policies via Discounted Liveness Formulation

通过折扣存活公式评估操纵策略的离线策略评估

Hao Wang, Joshua Bowden, Colton Crosby, Somil Bansal

机构 * University of Southern California(南加州大学) Stanford University(斯坦福大学)

专题命中 动作表示与策略 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 本文提出基于存活Bellman算子的离线策略评估框架,解决稀疏奖励下任务完成问题,通过保守固定点值函数降低截断偏差,实验证明在折叠任务中优于传统基线方法。

Comments Published at RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09330 2026-04-13 cs.RO cs.CV 73%

VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis

VAG:用于具身数据合成的双流视频-动作生成

Xiaolei Lang, Yang Wang, Yukun Zhou, Chaojun Ni, Kerui Li, Jiagang Zhu, Tianze Liu, Jiajun Lv, Xingxing Zuo, Yun Ye, Guan Huang, Xiaofeng Wang, Zheng Zhu

机构 * GigaAI Zhejiang University(浙江大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 动作表示与策略 :robot foundation model(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 本文提出VAG模型,通过双流框架联合生成视频和动作,提升跨模态一致性,实现高效且准确的视频-动作配对生成,支持轨迹回放并提升下游策略泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27670 2026-03-31 cs.RO cs.AI 73%

ProgressVLA: Progress-Guided Diffusion Policy for Vision-Language Robotic Manipulation

ProgressVLA: 用于视觉-语言机器人操控的进展引导扩散策略

Hongyu Yan, Qiwei Li, Jiaolong Yang, Yadong Mu

机构 * Peking University(北京大学) Microsoft Research Asia (MSRA)(微软亚洲研究院)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 本文提出ProgressVLA模型,通过鲁棒的进展估计和可微进展引导方法提升机器人操控任务的成功率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18933 2026-03-25 cs.CV cs.RO 73%

Point What You Mean: Visually Grounded Instruction Policy

指出你的意图:基于视觉的指令策略

Hang Yu, Juntu Zhao, Yufeng Liu, Kaiyu Li, Cheng Ma, Di Zhang, Yingdong Hu, Guang Chen, Junyuan Xie, Junliang Guo, Junqiao Zhao, Yang Gao

机构 * Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) Spirit AI Tsinghua University(清华大学)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Point-VLA,通过结合视觉提示提升物体指称能力,在复杂场景中实现更精准的视觉 grounding。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00021 2026-03-24 cs.RO cs.CV 73%

Foundation Models for Trajectory Planning in Autonomous Driving: A Review of Progress and Open Challenges

自动驾驶轨迹规划中的基础模型:进展与开放挑战综述

Kemal Oksuz, Alexandru Buburuzan, Anthony Knittel, Yuhan Yao, Puneet K. Dokania

机构 * Five AI Ltd.(Five AI有限公司) Robert Bosch GmbH(罗伯特·博世有限公司) United Kingdom(英国)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文综述了自动驾驶中基于基础模型的轨迹规划方法,分析了其架构设计、方法优势及局限性,并评估了37种最新方法的代码和数据集开放性。

Comments Accepted to TMLR (Survey Certification)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03768 2026-03-05 cs.RO cs.AI 73%

Cognition to Control - Multi-Agent Learning for Human-Humanoid Collaborative Transport

认知到控制 - 多智能体学习用于人-仿人协作运输

Hao Zhang, Ding Zhao, H. Eric Tseng

机构 * Department of Electrical Engineering, the University of Texas at Arlington(电气工程系,德克萨斯大学阿灵顿分校) Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 本研究提出认知到控制框架,通过多智能体强化学习实现人-仿人协作运输中的持续推理与稳定控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03380 2026-03-05 cs.RO cs.AI 73%

LiteVLA-Edge: Quantized On-Device Multimodal Control for Embedded Robotics

LiteVLA-Edge: 量化在设备上多模态控制用于嵌入式机器人

Justin Williams, Kishor Datta Gupta, Roy George, Mrinmoy Sarkar

机构 * Clark Atlanta University(克拉克阿特兰大学) Siemens Corporation(西门子公司)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 LiteVLA-Edge通过量化和GPU加速,在嵌入式机器人中实现低延迟的多模态控制,提供模块化本地执行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15397 2026-02-18 cs.RO cs.AI 73%

ActionCodec: What Makes for Good Action Tokenizers

ActionCodec:什么使好的动作分词器成为可能

Zibin Dong, Yicheng Liu, Shiduo Zhang, Baijun Ye, Yifu Yuan, Fei Ni, Jingjing Gong, Xipeng Qiu, Hang Zhao, Yinchuan Li, Jianye Hao

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) Tianjin University(天津大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 本文提出ActionCodec,通过信息论原则提升动作分词性能,实现无需机器人预训练的VLA模型新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22467 2026-02-02 cs.RO cs.CV 73%

CARE: Multi-Task Pretraining for Latent Continuous Action Representation in Robot Control

CARE:用于机器人控制的潜在连续动作表示的多任务预训练

Jiaqi Shi, Xulong Zhang, Xiaoyang Qu, Jianzong Wang

机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司) University of Science and Technology of China(中国科学技术大学)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 CARE通过多任务预训练学习连续动作表示,提升机器人控制的可扩展性和可解释性。

Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16163 2026-01-23 cs.AI cs.RO 73%

Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning

Cosmos Policy: 为视觉运动控制和规划微调视频模型

Moo Jin Kim, Yihuai Gao, Tsung-Yi Lin, Yen-Chen Lin, Yunhao Ge, Grace Lam, Percy Liang, Shuran Song, Ming-Yu Liu, Chelsea Finn, Jinwei Gu

机构 * NVIDIA Stanford University(斯坦福大学)

专题命中 动作表示与策略 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 Cosmos Policy通过单阶段后训练将预训练视频模型转化为高效机器人策略,实现视觉运动控制与规划的先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14628 2026-01-22 cs.RO cs.AI 73%

A Brain-inspired Embodied Intelligence for Fluid and Fast Reflexive Robotics Control

一种类脑的具身智能用于流体和快速反射式机器人控制

Weiyu Guo, He Zhang, Pengteng Li, Tiefu Cai, Ziyang Chen, Yandong Guo, Xiao He, Yongkui Yang, Ying Sun, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) AI 2 Robotics(AI 2机器人) Shenzhen, China(深圳中国)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 NeuroVLA是一种类脑具身智能框架,通过生物启发设计实现机器人快速反射和动态稳定性控制,首次在物理机器人上实现先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08580 2025-12-11 cs.RO cs.AI 73%

Mind to Hand: Purposeful Robotic Control via Embodied Reasoning

Mind to Hand: 通过具身推理实现目的性机器人控制

Peijun Tang, Shangjin Xie, Binyan Sun, Baifu Huang, Kuncheng Luo, Haotian Yang, Weiqi Jin, Jianan Wang

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 Lumo-1通过具身推理实现目的性机器人控制,结合视觉语言动作模型提升机器人推理与动作协调能力。

Comments 49 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27545 2025-11-03 cs.RO cs.AI 73%

EBT-Policy: Energy Unlocks Emergent Physical Reasoning Capabilities

Travis Davies, Yiqi Huang, Alexi Gladstone, Yunxin Liu, Xiang Chen, Heng Ji, Huxian Liu, Luhui Hu

机构 * ZhiCheng AI(智成AI) UIUC(伊利诺伊大学香槟分校) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

Comments 9 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09667 2025-10-14 cs.CV cs.RO 73%

OmniSAT: Compact Action Token, Faster Auto Regression

Huaihai Lyu, Chaofan Chen, Senwei Xie, Pengwei Wang, Xiansheng Chen, Shanghang Zhang, Changsheng Xu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Institute of Computation, Chinese Academy of Sciences(中国科学院计算研究所) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Peking University(北京大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏