arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 238 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 动作表示与策略 238 篇

2608.05970 2026-08-07 cs.RO cs.AI 新提交 87%

SkillMemo: Expert-guided Skill Memory Framework for Compositional Embodied Manipulation

SkillMemo:用于组合式具身操纵的专家引导技能记忆框架

Changyuan Wang, Chubin Zhang, Zhenyu Wu, Runhao Li, Angyuan Ma, Ke Chao, Yinan Liang, Xiuwei Xu, Ziwei Wang, Yansong Tang, Jiwen Lu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Automation, Tsinghua University(清华大学自动化系) Nanyang Technological University(南洋理工大学) Beijing Normal University(北京师范大学)

专题命中 动作表示与策略 :VLA(summary_cn,abstract);vision-language-action(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 SkillMemo是一种专家引导的技能记忆框架,通过分解轨迹为技能基元并结合动态记忆库,提升了DP和VLA模型的组合泛化能力,在基准测试中达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08440 2025-09-30 cs.RO cs.AI 87%

TGRPO :Fine-tuning Vision-Language-Action Model via Trajectory-wise Group Relative Policy Optimization

Zengjue Chen, Runliang Niu, He Kong, Qi Wang, Qianli Xing, Zipei Fan

机构 * School of Artificial Intelligence, Jilin University(人工智能学院,吉林大学)

专题命中 动作表示与策略 :vision-language-action(title);action model(title);VLA(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13017 2026-07-15 cs.RO cs.CV 新提交 86%

FlowWAM: Optical Flow as a Unified Action Representation for World Action Models

FlowWAM:光流作为世界动作模型的统一动作表示

Yixiang Chen, Peiyan Li, Yuan Xu, Qisen Ma, Jiabing Yang, Kai Wang, Jianhua Yang, Dong An, He Guan, Gaoteng Liu, Jianlou Si, Jun Huang, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges(无) MBZUAI(无) Alibaba Group(阿里巴巴集团)

专题命中 动作表示与策略 :action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 研究针对世界动作模型控制中动作表示难题,提出FlowWAM双流扩散框架,以光流为统一动作表示。该框架可实现WAMs两种模式,能利用无动作标签视频预训练,实验表明在操纵和世界建模任务中表现优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21112 2026-02-26 cs.RO cs.AI 86%

EO-1: An Open Unified Embodied Foundation Model for General Robot Control

EO-1:一个通用机器人控制的开放统一具身基础模型

Delin Qu, Haoming Song, Qizhi Chen, Zhaoqing Chen, Xianqiang Gao, Dong Wang, Xinyi Ye, Qi Lv, Modi Shi, Guanghui Ren, Cheng Ruan, Maoqing Yao, Haoran Yang, Jiacheng Bao, Bin Zhao, Xuelong Li

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) AgiBot Northwestern Polytechnical University(西北工业大学)

专题命中 动作表示与策略 :embodied foundation model(title,abstract);vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 EO-1是一个统一的具身基础模型,通过交错视觉-文本-动作预训练实现了在多模态推理和机器人控制中的卓越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15446 2026-02-11 cs.RO 85%

VDRive: Leveraging Reinforced VLA and Diffusion Policy for End-to-end Autonomous Driving

VDRive:利用强化VLA和扩散策略实现端到端自动驾驶

Ziang Guo, Zufeng Zhang

机构 * Suzhou Automotive Research Institute of Tsinghua University(清华大学苏州汽车研究院)

专题命中 动作表示与策略 :VLA(title,abstract);vision language action(abstract);action model(abstract);分类 cs.RO

AI总结 VDRive通过结合强化VLA和扩散策略,实现端到端自动驾驶,提升决策的可解释性和鲁棒性。

Comments WIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14943 2026-07-17 cs.RO cs.AI cs.LG cs.SY eess.SY math.OC 新提交 82%

Steering Robustness into World Action Models via Mechanistic Interpretability and Optimal Control

通过机制可解释性和最优控制将鲁棒性引入世界行动模型

Jihoon Hong, Julian Skifstad, Qiyue Dai, Alice Chan, Glen Chou

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 动作表示与策略 :action model(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究世界行动模型在分布转移下的脆弱性,利用机制可解释性通过对比激活方向和基于模型的最优控制实现WAM转向,产生WA-LQR,预测不同模型转向能力,在部分模型上提高了对多种扰动的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06049 2026-03-09 cs.CV cs.RO 81%

Devil is in Narrow Policy: Unleashing Exploration in Driving VLA Models

魔鬼在窄政策中:解锁驾驶VLA模型的探索

Canyu Chen, Yuguang Yang, Zhewen Tan, Yizhi Wang, Ruiyi Zhan, Haiyan Liu, Xuanyao Mao, Jason Bao, Xinyue Tang, Linlin Yang, Bingchuan Sun, Yan Wang, Baochang Zhang

机构 * National Superior College for Engineers, Beihang University(北京航空航天大学工程师学院) School of Electronic Information Engineering, Beihang University(北京航空航天大学电子信息工程学院) Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) Lenovo Group Limited(联想集团有限公司) State Key Laboratory of Media Convergence and Communication, Communication University of China(中国传媒大学媒体融合与传播国家重点实验室)

专题命中 动作表示与策略 :VLA(title,abstract);分类 cs.RO、cs.CV

AI总结 Curious-VLA通过双阶段设计缓解探索-利用困境,提升驾驶VLA模型的探索潜力,实现Navsim基准的最优性能。

Comments Accepted by CVPR2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.24164 2026-01-09 cs.LG cs.RO 81%

$π_0$: A Vision-Language-Action Flow Model for General Robot Control

π₀:一种面向通用机器人控制的视觉-语言-动作流模型

Kevin Black, Noah Brown, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn, Niccolo Fusai, Lachy Groom, Karol Hausman, Brian Ichter, Szymon Jakubczak, Tim Jones, Liyiming Ke, Sergey Levine, Adrian Li-Bell, Mohith Mothukuri, Suraj Nair, Karl Pertsch, Lucy Xiaoyang Shi, James Tanner, Quan Vuong, Anna Walling, Haohuan Wang, Ury Zhilinsky

机构 * Physical Intelligence

专题命中 动作表示与策略 :vision-language-action(title);robot foundation model(abstract);分类 cs.RO、cs.LG

AI总结 本文提出了一种基于预训练视觉-语言模型的流匹配架构,用于通用机器人控制,通过零样本学习和微调实现多样任务的执行。

Comments See project website for videos: https://physicalintelligence.company/blog/pi0 Published in RSS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08548 2025-03-12 cs.RO cs.CV 81%

TLA: Tactile-Language-Action Model for Contact-Rich Manipulation

Peng Hao, Chaofan Zhang, Dingzhe Li, Xiaoge Cao, Xiaoshuai Hao, Shaowei Cui, Shuo Wang

专题命中 动作表示与策略 :action model(title);language-conditioned robot(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07820 2026-08-14 cs.RO cs.AI cs.CV cs.GR cs.SY eess.SY 版本更新 80%

SONIC: Supersizing Motion Tracking for Natural Humanoid Whole-Body Control

SONIC:为自然人形全身体控进行超大规模运动追踪

Zhengyi Luo, Ye Yuan, Tingwu Wang, Chenran Li, Fernando Castañeda, Sirui Chen, Zi-Ang Cao, Jiefeng Li, David Minor, Qingwei Ben, Jinhyung Park, David Sami, Zi Wang, Xingye Da, Runyu Ding, Cyrus Hogg, Lina Song, Edy Lim, Eugene Jeong, Tairan He, Haoru Xue, Wenli Xiao, Simon Yuen, Jan Kautz, Yan Chang, Umar Iqbal, Linxi "Jim" Fan, Yuke Zhu

机构 * NVIDIA

专题命中 动作表示与策略 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出了一种超大规模运动追踪方法,通过扩大模型容量、数据和计算资源,实现了一种能够产生自然且稳健全身体态的通用人形控制器,并展示了其在运动追踪任务中的可扩展性及在下游任务中的应用价值。

Comments Project page: https://nvlabs.github.io/SONIC/

Journal ref Science Robotics 11 (117), eaed4592 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04910 2026-07-24 cs.RO cs.AI cs.LG 版本更新 80%

VPWEM: Non-Markovian Visuomotor Policy with Working and Episodic Memory

VPWEM:非马尔可夫视觉-运动策略与工作记忆与事件记忆

Yuheng Lei, Zhixuan Liang, Hongyuan Zhang, Ping Luo

机构 * School of Computing and Data Science, University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 动作表示与策略 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 VPWEM通过引入工作记忆和事件记忆,提升机器人在非马尔可夫任务中的动作生成性能。

Comments Accepted to IEEE Robotics and Automation Letters (RA-L). \textcopyright 2026 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08830 2026-05-20 cs.CV cs.AI cs.RO 80%

VECTOR-Drive: Tightly Coupled Vision-Language and Trajectory Expert Routing for End-to-End Autonomous Driving

VECTOR-Drive: 紧密耦合的视觉-语言与轨迹专家路由用于端到端自动驾驶

Rui Zhao, Jianlin Yu, Zhenhai Gao, Jiaqiao Liu, Fei Gao

机构 * College of Automotive Engineering, Jilin University(吉林大学汽车工程学院) The National Key Laboratory of Automotive Chassis Integration and Bionics, Jilin University(吉林大学汽车底盘集成与生物力学国家级重点实验室) ReeFocus AI Technology(ReeFocus人工智能技术)

专题命中 动作表示与策略 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出VECTOR-DRIVE框架,通过紧密耦合的视觉-语言与轨迹专家路由,解决端到端自动驾驶中视觉语言理解和轨迹预测之间的耦合问题,实现更高的任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18840 2026-07-22 cs.RO 新提交 79%

WorldScape Policy 2.0: Empowering Steerable World Action Modeling with Reasoning-Augmented Memory

WorldScape Policy 2.0:通过推理增强记忆实现可控的世界行动建模

Haisheng Su, Zongdai Liu, Xin Jin, Haoxuan Dou, Chengming Hu, Baorun Li, Zhanwang Liu, Ruiyan Xu, Jianjie Fang, Xin Zhang, Zhenjie Yang, Xue Yang, Chen Gao, Junchi Yan, Yong Li, Wei Wu

专题命中 动作表示与策略 :action model(title,abstract);分类 cs.RO

AI总结 研究针对现有世界行动模型的局限,提出WorldScape Policy 2.0,用推理增强记忆,构建相关数据集,实现从高级指令自主规划及基于细粒度文本等的可控执行,在模拟和现实平台实验中展现出在多方面的卓越能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13674 2026-06-16 cs.CV 新提交 79%

RepWAM: World Action Modeling with Representation Visual-Action Tokenizers

RepWAM:基于表示视觉-动作分词器的世界动作建模

Junke Wang, Qihang Zhang, Shuai Yang, Yiming Luo, Yujun Shen, Zuxuan Wu, Yu-Gang Jiang, Yinghao Xu

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Robbyant, Ant Group(蚂蚁集团 Robbyant) Hongkong University of Science and Technology(香港科技大学)

专题命中 动作表示与策略 :action model(title,abstract);分类 cs.CV

AI总结 提出RepWAM,一种基于表示视觉-动作分词器的世界动作模型,通过联合建模未来视觉状态和潜在动作,在真实和仿真机器人操作任务中取得优异性能。

Comments Project page: https://wdrink.github.io/RepWAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07794 2026-05-11 cs.RO 79%

NoiseGate: Learning Per-Latent Timestep Schedules as Information Gating in World Action Models

NoiseGate: 在世界动作模型中学习每潜在时间步的调度作为信息门控

Wen Huang, Haoran Sun, Yongjian Guo, Yunxuan Ma, Haoran Li, Jing Long, Zhouying Mo, Zhong Guan, Yucheng Guo, Shuai Di, Junwu Xiong

机构 * Tsinghua University(清华大学) Peking University(北京大学) JDT AI Infra(JDT AI 基础设施) Tianjin University(天津大学)

专题命中 动作表示与策略 :action model(title,abstract);分类 cs.RO

AI总结 本文提出NoiseGate,通过学习每潜在时间步的调度作为信息门控策略,改进世界动作模型中的动作生成与未来观察建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28955 2026-04-01 cs.AI 79%

Enhancing Policy Learning with World-Action Model

通过世界-动作模型增强策略学习

Yuci Han, Alper Yilmaz

机构 * Photogrammetry and Computer Vision Lab, The Ohio State University(俄亥俄州立大学摄影测量与计算机视觉实验室)

专题命中 动作表示与策略 :action model(title,abstract);分类 cs.AI

AI总结 本文提出World-Action Model,通过联合推理未来视觉观测和驱动状态转移的动作,提升策略学习效果。在CALVIN基准的八项任务中,WAM通过行为克隆和基于模型的PPO优化,显著提高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17240 2026-03-24 cs.CV 79%

GigaWorld-Policy: An Efficient Action-Centered World--Action Model

GigaWorld-Policy: 一种高效的以动作为中心的世界-动作模型

Angen Ye, Boyuan Wang, Chaojun Ni, Guan Huang, Guosheng Zhao, Hao Li, Hengtao Li, Jie Li, Jindi Lv, Jingyu Liu, Min Cao, Peng Li, Qiuping Deng, Wenjun Mei, Xiaofeng Wang, Xinze Chen, Xinyu Zhou, Yang Wang, Yifan Chang, Yifan Li, Yukun Zhou, Yun Ye, Zhichao Liu, Zheng Zhu

机构 * GigaAI Project Page(GigaAI项目页) GigaWorld Team(GigaWorld团队)

专题命中 动作表示与策略 :action model(title,abstract);分类 cs.CV

AI总结 本文提出GigaWorld-Policy,通过高效动作解码和可选视频生成,解决世界-动作模型在机器人策略学习中的性能瓶颈问题,实验显示其在实际机器人平台上的运行速度提升9倍,任务成功率提高7%。

Comments Added references

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19370 2026-03-23 cs.RO 79%

VAMPO: Policy Optimization for Improving Visual Dynamics in Video Action Models

VAMPO:通过改进视频动作模型的视觉动态进行策略优化

Zirui Ge, Pengxiang Ding, Baohua Yin, Qishen Wang, Zhiyong Xie, Yemin Wang, Jinbo Wang, Hengtao Li, Runze Suo, Wenxuan Song, Han Zhao, Shangke Lyu, Zhaoxin Fan, Haoang Li, Ran Cheng, Cheng Chi, Huibin Ge, Yaozhi Luo, Donglin Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Xiamen University(厦门大学) University of Sussex(Sussex大学) Tianjin University(天津大学) Wuhan University(武汉大学) Hebei University of Technology(河北工业大学) Nanjing University(南京大学) Fudan University(复旦大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) South China University of Technology(华南理工大学)

专题命中 动作表示与策略 :action model(title,abstract);分类 cs.RO

AI总结 VAMPO通过策略优化直接提升视频动作模型的视觉动态,结合GRPO和非对抗性奖励,在多种模拟和真实任务中提升任务相关视觉动态,增强下游动作生成和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23784 2026-07-28 cs.RO cs.AI 新提交 79%

A Few Words Go a Long Way: Language Guided Robot Policy Synthesis

寥寥数语,成效显著:语言引导的机器人策略合成

Daphne Chen, Archit Ritesh Jain, Eric Goossen, Emma Romig, Michael Murray, Nick Walker, Maya Cakmak

机构 * University of Washington(华盛顿大学) Microsoft Research(微软研究院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 研究针对视觉-语言-动作模型难以解释等问题,提出ARCHITECT框架,利用大语言模型编码代理合成模块化机器人程序,通过人类自然语言修正引导策略并积累技能库,在机器人基准评估中表现出色,提供了新的机器人学习方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18236 2026-07-21 cs.RO cs.LG 新提交 79%

Patch Policy: Efficient Embodied Control via Dense Visual Representations

补丁策略:通过密集视觉表示实现高效具身控制

Gaoyue Zhou, Zichen Jeff Cui, Ada Langford, Bowen Tan, Yann LeCun, Lerrel Pinto

机构 * Courant Institute, New York University(纽约大学柯朗数学科学研究所) Meta-FAIR(Meta FAIR) AMI Labs(AMI 实验室)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract_cn);action model(abstract);分类 cs.RO、cs.LG

AI总结 研究利用预训练密集视觉特征,提出补丁策略,通过块因果注意力掩码等实现高效具身控制。该策略轻量级、快速且高效,在模拟和真实环境中相比其他策略有显著提升,为机器人社区利用视觉表示学习提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00898 2026-07-20 cs.LG cs.RO 版本更新 79%

Dichotomous Diffusion Policy Optimization

二元扩散策略优化

Ruiming Liang, Yinan Zheng, Kexin Zheng, Tianyi Tan, Jianxiong Li, Liyuan Mao, Zhihao Wang, Guang Chen, Hangjun Ye, Jingjing Liu, Jinqiao Wang, Xianyuan Zhan

机构 * Fundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(基础模型研究中心,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Xiaomi EV(小米电动车)

专题命中 动作表示与策略 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.LG

AI总结 DIPOLE是一种新的RL算法,通过二元策略分解实现稳定可控的扩散策略优化,适用于复杂现实应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11839 2026-03-20 cs.RO cs.CV 79%

TrajBooster: Boosting Humanoid Whole-Body Manipulation via Trajectory-Centric Learning

TrajBooster:通过轨迹中心学习提升双足人形机器人的整体操作

Jiacheng Liu, Pengxiang Ding, Qihang Zhou, Yuxuan Wu, Da Huang, Zimian Peng, Wei Xiao, Weinan Zhang, Lixin Yang, Cewu Lu, Donglin Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 TrajBooster通过利用轮式人形数据提升双足VLA性能,采用末端执行器轨迹作为通用接口,通过仿真重定向和预训练实现高效任务执行,减少对同构数据的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06654 2023-08-15 cs.RO cs.CV cs.HC cs.LG 78%

Polar Collision Grids: Effective Interaction Modelling for Pedestrian Trajectory Prediction in Shared Space Using Collision Checks

Mahsa Golchoubian, Moojan Ghafurian, Kerstin Dautenhahn, Nasser Lashgarian Azad

专题命中 动作表示与策略 :action model(title);分类 cs.RO、cs.CV、cs.LG

Comments Accepted for publication as a conference paper in IEEE Intelligent Transportation Systems Conference (ITSC), 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01381 2026-08-04 cs.RO 新提交 77%

DreamTrajectory: Trajectory-Guided Action Generation with World Model Alignment for Mobile Manipulation

DreamTrajectory:面向移动操作的、结合世界模型对齐的轨迹引导动作生成方法

Zheng Yang, Wenjie Zhang, Xiangyu Chen, Wenxuan Song, Xianpeng Wang, Yihang Kang, Wen Chen, Lujia Wang, Renjing Xu, Xiaowen Chu

专题命中 动作表示与策略 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 DreamTrajectory是面向移动操作的轨迹引导框架,通过联合预测末端执行器轨迹与全身动作块、结合轨迹世界模型的测试时细化,在MS-HAB及真实任务中大幅提升操作成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16504 2026-06-16 cs.RO 新提交 77%

APEX: Adaptive Policy Execution for Precise Manipulation

APEX: 用于精确操作的适应性策略执行

Mengfei Zhao, Chenxi Jiang, Tuo An, Jindou Jia, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室)

专题命中 动作表示与策略 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 针对策略与控制器间的执行差距,提出即插即用的APEX框架,通过动态可行参考重建和测试时自适应,减少跟踪误差并提升操作成功率。

Comments 20 pages, 9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10040 2026-02-24 cs.RO 77%

Diffusion Trajectory-guided Policy for Long-horizon Robot Manipulation

用于长时程机器人操作的扩散轨迹引导策略

Shichao Fan, Quantao Yang, Yajie Liu, Kun Wu, Zhengping Che, Qingjie Liu, Min Wan

机构 * School of Mechanical Engineering and Automation, BeiHang University(机械工程与自动化学院,北航) School of Computer Science and Engineering, BeiHang University(计算机科学与工程学院,北航) Beijing Innovation Center of Humanoid Robotics(人形机器人创新中心) Division of Robotics, Perception and Learning (RPL), KTH Royal Institute of Technology(机器人、感知与学习 division,皇家理工学院)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);action model(abstract);分类 cs.RO

AI总结 本文提出DTP框架,通过生成轨迹减少模仿学习中的误差累积,提升长时程机器人任务的性能。

Comments 8 pages, 5 figures, accepted to IEEE Robotics and Automation Letters (RAL)

Journal ref IEEE Robotics and Automation Letters (Volume: 10, Issue: 12, December 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.20095 2025-01-31 cs.RO cs.AI cs.CL cs.CV cs.LG 77%

LLaRA: Supercharging Robot Learning Data for Vision-Language Policy

Xiang Li, Cristina Mata, Jongwoo Park, Kumara Kahatapitiya, Yoo Sung Jang, Jinghuan Shang, Kanchana Ranasinghe, Ryan Burgert, Mu Cai, Yong Jae Lee, Michael S. Ryoo

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19309 2025-02-05 cs.RO cs.CV cs.LG 76%

GRAPE: Generalizing Robot Policy via Preference Alignment

Zijian Zhang, Kaiyuan Zheng, Zhaorun Chen, Joel Jang, Yi Li, Siwei Han, Chaoqi Wang, Mingyu Ding, Dieter Fox, Huaxiu Yao

专题命中 动作表示与策略 :VLA(abstract,comments);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.LG

Comments Website: https://grape-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03320 2025-03-11 q-bio.BM cs.AI cs.LG 76%

log-RRIM: Yield Prediction via Local-to-global Reaction Representation Learning and Interaction Modeling

Xiao Hu, Ziqi Chen, Bo Peng, Daniel Adu-Ampratwum, Xia Ning

专题命中 动作表示与策略 :action model(title);分类 cs.AI、cs.LG

Comments 45 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12236 2026-08-13 cs.RO cs.AI cs.LG 版本更新 75%

TMRL: Diffusion Timestep-Modulated Pretraining Enables Exploration for Efficient Policy Finetuning

TMRL: 差分时间步调节预训练实现高效策略微调的探索

Matthew M. Hong, Jesse Zhang, Anusha Nagabandi, Abhishek Gupta

机构 * University of Washington(华盛顿大学) Amazon FAR(亚马逊FAR)

专题命中 动作表示与策略 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出TMRL框架,通过结合行为克隆预训练与强化学习微调,解决预训练中动作分布狭窄的问题,提升机器人策略微调的样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏