arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4116 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4116 篇

2508.09797 2026-01-30 cs.RO 57%

FLARE: Agile Flights for Quadrotor Cable-Suspended Payload System via Reinforcement Learning

FLARE:通过强化学习实现四旋翼缆悬载具系统的敏捷飞行

Dongcheng Cao, Jin Zhou, Xian Wang, Shuo Li

机构 * College of Control Science and Engineering, Zhejiang University(控制科学与工程学院,浙江大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 FLARE通过强化学习实现四旋翼缆悬载具系统的敏捷飞行,相比传统方法提升了3倍的执行速度,并实现了高效的仿真到现实转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.06284 2026-01-30 cs.AI 57%

CURIOUS: Intrinsically Motivated Modular Multi-Goal Reinforcement Learning

CURIOUS:内在动机的模块化多目标强化学习

Cédric Colas, Pierre Fournier, Olivier Sigaud, Mohamed Chetouani, Pierre-Yves Oudeyer

机构 * Flowers Team, Inria and Ensta ParisTech(Inria和Ensta巴黎科技大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI

AI总结 CURIOUS通过内在动机探索和自动课程学习机制,实现模块化多目标强化学习的自组织发展。

Comments Accepted at ICML 2019 https://github.com/flowersteam/curious

Journal ref Proceedings of the 36th International Conference on Machine Learning 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24330 2026-01-27 cs.CV 57%

SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning

SenseNova-MARS: 通过强化学习赋能多模态代理推理与搜索

Yong Xien Chng, Tao Hu, Wenwen Tong, Xueheng Li, Jiandong Chen, Haojia Yu, Jiefan Lu, Hewei Guo, Hanming Deng, Chengjun Xie, Gao Huang, Dahua Lin, Lewei Lu

机构 * SenseTime Research(商汤科技研究院) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV

AI总结 SenseNova-MARS通过强化学习赋能多模态代理推理与搜索,提升视觉-语言模型在复杂视觉任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23077 2026-01-27 cs.RO 57%

Embodied Learning of Reward for Musculoskeletal Control with Vision Language Models

具身学习奖励以实现肌肉骨骼控制与视觉语言模型

Saraswati Soedarmadji, Yunyue Wei, Chen Zhang, Yisong Yue, Yanan Sui

机构 * Tsinghua University(清华大学) California Institute of Technology(加州理工学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出MoVLR框架,利用视觉语言模型实现高维肌肉骨骼系统的具身学习,通过迭代交互发现和改进奖励函数。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.05092 2026-01-26 cs.LG 57%

Task Aware Dreamer for Task Generalization in Reinforcement Learning

面向任务泛化的任务感知梦者

Chengyang Ying, Xinning Zhou, Zhongkai Hao, Hang Su, Songming Liu, Dong Yan, Jun Zhu

机构 * Department of Computer Science and Technology(计算机科学与技术系) Beijing National Research Center for Information Science and Technology(北京信息科学国家研究中心) Tsinghua-Bosch Joint Center for Machine Learning, Institute for Artificial Intelligence(清华大学-博世联合机器学习中心,人工智能研究院) Tsinghua University(清华大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 本文提出任务感知梦者(TAD)方法,通过整合奖励引导的特征提升强化学习中任务泛化能力,尤其在高任务分布相关性任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12091 2026-01-22 cs.LG 57%

GraphPerf-RT: A Graph-Driven Performance Model for Hardware-Aware Scheduling of OpenMP Codes

GraphPerf-RT: 一种基于图的性能模型用于OpenMP代码的硬件感知调度

Mohammad Pivezhandi, Mahdi Banisharif, Saeed Bakhshan, Abusayeed Saifullah, Ali Jannesari

机构 * Wayne State University(韦恩州立大学) Iowa State University(爱荷华州立大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 GraphPerf-RT通过结合任务拓扑、代码语义和运行时上下文,实现高效硬件感知调度,提升性能与能效。

Comments 49 pages, 4 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01147 2026-01-21 cs.RO 57%

Astra: Efficient Transformer Architecture and Contrastive Dynamics Learning for Embodied Instruction Following

Astra:面向具身指令跟随的高效Transformer架构与对比动态学习

Yueen Ma, Dafeng Chi, Shiguang Wu, Yuecheng Liu, Yuzheng Zhuang, Irwin King

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 Astra通过引入轨迹注意力和对比动态学习目标,提升了具身指令跟随任务中多模态序列处理的效率与准确性。

Comments Accepted to EMNLP 2025 (main). Published version: https://aclanthology.org/2025.emnlp-main.688/ Code available at: https://github.com/yueen-ma/Astra

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19789 2026-01-15 cs.LG 57%

What Can RL Bring to VLA Generalization? An Empirical Study

RL能为VLA泛化带来什么?一项实证研究

Jijia Liu, Feng Gao, Bingwen Wei, Xinlei Chen, Qingmin Liao, Yi Wu, Chao Yu, Yu Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 模仿学习与强化学习 :embodied AI(abstract);分类 cs.LG

AI总结 本研究通过实证分析发现,PPO在提升VLA的语义理解和执行鲁棒性方面优于SFT,同时保持视觉鲁棒性,为VLA泛化提供了有效的方法。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08210 2026-01-14 cs.LG 57%

Scalable Multiagent Reinforcement Learning with Collective Influence Estimation

可扩展的多智能体强化学习与集体影响估计

Zhenglong Luo, Zhiyong Chen, Aoxiang Liu, Ke Pan

机构 * School of Engineering, The University of Newcastle(工程学院) School of Automation, Central South University(自动化学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 本文提出了一种可扩展的多智能体强化学习框架,通过集体影响估计网络实现高效协作,避免网络扩展并提升鲁棒性和部署可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20876 2026-01-13 cs.RO 57%

Proprioception Enhances Vision Language Model in Generating Captions and Subtask Segmentations for Robot Task

本体感知增强视觉语言模型在为机器人任务生成描述和子任务分割中的应用

Kanata Suzuki, Shota Shimizu, Tetsuya Ogata

机构 * Faculty of Science and Engineering, Waseda University(工学部,早稻田大学) Artificial Intelligence Laboratory, Fujitsu Limited(Fujitsu 人工智能实验室) National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 本研究通过引入本体感知数据,提升视觉语言模型在机器人任务描述和子任务分割中的性能,以增强机器人模仿学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14178 2026-01-13 cs.LG 57%

FlowRL: Flow-Augmented Few-Shot Reinforcement Learning for Semi-Structured Sensor Data

FlowRL: 用于半结构化传感器数据的流增强少样本强化学习

Mohammad Pivezhandi, Abusayeed Saifullah

机构 * Wayne State University(韦恩州立大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 FlowRL 通过生成高质量合成数据提升少样本强化学习的样本效率和策略鲁棒性,有效应用于半结构化传感器数据场景。

Comments 13 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02356 2026-01-09 cs.CV 57%

Talk2Move: Reinforcement Learning for Text-Instructed Object-Level Geometric Transformation in Scenes

Talk2Move: 基于强化学习的文本指令下场景中物体级几何变换

Jing Tan, Zhaoyang Zhang, Yantao Shen, Jiarui Cai, Shuo Yang, Jiajun Wu, Wei Xia, Zhuowen Tu, Stefano Soatto

机构 * AWS Agentic AI(AWS智能AI) Amazon Web Services(亚马逊网络服务) Amazon Robotics(亚马逊机器人技术) CUHK(香港中文大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV

AI总结 Talk2Move通过强化学习实现文本指令下的场景中物体级几何变换,利用组相对策略优化和空间奖励引导模型,提升学习效率并实现精确且一致的物体变换。

Comments Project page: https://sparkstj.github.io/talk2move

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01206 2026-01-08 cs.RO 57%

Action Tokenizer Matters in In-Context Imitation Learning

动作分词器在上下文模仿学习中的重要性

An Dinh Vuong, Minh Nhat Vu, Dong An, Ian Reid

机构 * Department of Computer Vision, Mohammed bin Zayed University of Artificial Intelligence(计算机视觉系,穆罕默德·本·扎耶德人工智能大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出LipVQ-VAE,通过强制潜在动作空间的Lipschitz条件,提升上下文模仿学习中动作的稳定性和平滑性。

Comments IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00309 2026-01-05 cs.LG cs.SY eess.SY 57%

Can Optimal Transport Improve Federated Inverse Reinforcement Learning?

最优传输能否改进联邦逆强化学习?

David Millard, Ali Baheri

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文提出基于最优传输的联邦逆强化学习方法,通过Wasserstein均值融合提升跨异构环境的奖励估计一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24532 2026-01-01 cs.AI cs.CL 57%

From Building Blocks to Planning: Multi-Step Spatial Reasoning in LLMs with Reinforcement Learning

从积木到规划:通过强化学习在LLMs中实现多步骤空间推理

Amir Tahmasbi, Sadegh Majidi, Kazem Taram, Aniket Bera

机构 * Department of Computer Science(计算机科学系)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 本文提出了一种两阶段方法,通过强化学习在LLMs中实现多步骤空间推理,通过微调和LoRA适配器提升模型在结构环境中的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22860 2025-12-30 cs.CR cs.LG cs.MA 57%

Adaptive Trust Consensus for Blockchain IoT: Comparing RL, DRL, and MARL Against Naive, Collusive, Adaptive, Byzantine, and Sleeper Attacks

区块链物联网中的自适应信任共识:比较强化学习、深度强化学习和多智能体强化学习与 naive、collusive、adaptive、Byzantine 和 sleeper 攻击

Soham Padia, Dhananjay Vaidya, Ramchandra Mangrulkar

机构 * Artificial Intelligence Northeastern University(人工智能东北大学) Information Technology Dwarkadas J. Sanghvi College of Engineering(信息技术达沃拉吉·桑格维工程学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 本文通过比较RL、DRL和MARL在区块链物联网中对抗不同攻击的效果,发现MARL在对抗攻击中表现最佳,而所有智能体均能抵御Byzantine攻击,但时间延迟污染攻击对所有智能体均造成严重威胁。

Comments 34 pages, 19 figures, 10 tables. Code available at https://github.com/soham-padia/blockchain-iot-trust

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14925 2025-12-30 cs.LG 57%

A Survey of Reinforcement Learning from Human Feedback

从人类反馈强化学习的综述

Timo Kaufmann, Paul Weng, Viktor Bengs, Eyke Hüllermeier

机构 * LMU Munich(慕尼黑大学) MCML Munich(慕尼黑马克斯·普朗克研究所) DFKI(德国人工智能研究中心)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文综述了从人类反馈强化学习的基本原理、核心方法及在多个领域中的应用与贡献。

Comments Published version (TMLR): https://openreview.net/pdf?id=f7OkIurx4b

Journal ref Transactions on Machine Learning Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18850 2025-12-30 cs.RO 57%

InDRiVE: Reward-Free World-Model Pretraining for Autonomous Driving via Latent Disagreement

InDRiVE: 通过潜在分歧进行无奖励世界模型预训练以实现自动驾驶

Feeza Khan Khanzada, Jaerock Kwon

机构 * Department of Electrical and Computer Engineering, University of Michigan-Dearborn(电气与计算机工程系,密歇根大学-迪尔伯恩分校)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO

AI总结 InDRiVE通过潜在分歧进行无奖励世界模型预训练,提升了自动驾驶在零样本迁移和少量样本适应中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04279 2025-12-30 cs.RO 57%

Driving Beyond Privilege: Distilling Dense-Reward Knowledge into Sparse-Reward Policies

超越特权:将密集奖励知识蒸馏到稀疏奖励策略中

Feeza Khan Khanzada, Jaerock Kwon

机构 * Department of Electrical and Computer Engineering, University of Michigan-Dearborn(电气与计算机工程系,密歇根大学迪尔伯恩分校)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO

AI总结 本文提出通过密集奖励蒸馏学习稀疏奖励策略,提升自动驾驶在稀疏目标上的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18670 2025-12-23 cs.LG 57%

Demonstration-Guided Continual Reinforcement Learning in Dynamic Environments

动态环境中的演示引导持续强化学习

Xue Yang, Michael Schukat, Junlin Lu, Patrick Mannion, Karl Mason, Enda Howley

机构 * School of Computer Science, University of Galway(Galway大学计算机科学学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本研究提出演示引导持续强化学习(DGCRL),通过外部演示库指导智能体探索与适应,提升动态环境中的学习效率和知识迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15705 2025-12-19 cs.CV 57%

GeoVista: Web-Augmented Agentic Visual Reasoning for Geolocalization

GeoVista: 基于网络增强的代理视觉推理用于地理定位

Yikun Wang, Zuyan Liu, Ziyi Wang, Han Hu, Pengfei Liu, Yongming Rao

机构 * Fudan University(复旦大学) Tencent Hunyuan(腾讯文元) Tsinghua University(清华大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV

AI总结 GeoVista通过整合图像缩放和网络搜索工具,提升地理定位任务的代理模型性能,实现优于开源模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16787 2025-12-19 cs.AI 57%

Enter the Void - Planning to Seek Entropy When Reward is Scarce

进入虚无 - 在奖励稀缺时规划以寻求熵

Ashish Sundar, Chunbo Luo, Xiaoyang Wang

机构 * Department of Computer Science University of Exeter(计算机科学系埃克塞特大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI

AI总结 本文提出了一种基于世界模型的分层规划方法,在奖励稀缺时主动寻找信息丰富的状态,提升样本效率,应用于Dreamer时在迷宫任务中效率提升50%。

Comments 10 pages without appendix, 15 Figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07342 2025-12-17 cs.CR cs.LG 57%

PrivORL: Differentially Private Synthetic Dataset for Offline Reinforcement Learning

PrivORL: 用于离线强化学习的差分隐私合成数据集

Chen Gong, Zheng Liu, Kecen Li, Tianhao Wang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 PrivORL通过差分隐私技术合成离线强化学习数据集,利用扩散模型和好奇心驱动预训练提升合成数据的多样性和保真度。

Comments Accepted at NDSS 2026; code available at https://github.com/2019ChenGong/PrivORL

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13250 2025-12-16 cs.CV 57%

Toward Ambulatory Vision: Learning Visually-Grounded Active View Selection

迈向便携视觉:基于视觉的主动视角选择

Juil Koo, Daehyeon Choi, Sangwoo Youn, Phillip Y. Lee, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.CV

AI总结 本文提出基于视觉的主动视角选择方法,通过仅利用当前图像中的视觉信息来选择最有信息量的视角,从而提升视觉问答的性能和泛化能力。

Comments Project page: https://active-view-selection.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12855 2025-12-16 cs.RO cs.SY eess.SY 57%

MPC-Guided Safe Reinforcement Learning and Lipschitz-Based Filtering for Structured Nonlinear Systems

MPC引导的安全强化学习与基于Lipschitz的过滤用于结构非线性系统

Patrick Kostelac, Xuerui Wang, Anahita Jamshidnejad

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 本文提出结合MPC与RL的框架,通过安全控制边界和Lipschitz过滤器实现结构非线性系统的安全可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00811 2025-12-15 cs.LG 57%

Equilibrium Policy Generalization: A Reinforcement Learning Framework for Cross-Graph Zero-Shot Generalization in Pursuit-Evasion Games

均衡策略泛化:一种用于追捕-躲避游戏跨图零样本泛化的强化学习框架

Runyu Lu, Peng Zhang, Ruochuan Shi, Yuanheng Zhu, Dongbin Zhao, Yang Liu, Dong Wang, Cesare Alippi

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Dalian University of Technology(大连理工大学) Università della Svizzera italiana(瑞士意大利大学) Politecnico di Milano(米兰理工学院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文提出EPG框架,通过均衡策略训练实现追捕-躲避游戏中跨图零样本泛化的高效解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10284 2025-12-15 cs.RO cs.HC 57%

From "Thumbs Up" to "10 out of 10": Reconsidering Scalar Feedback in Interactive Reinforcement Learning

从' thumbs up '到' 10 分之 10 ':重新考虑交互强化学习中的标量反馈

Hang Yu, Reuben M. Aronson, Katherine H. Allen, Elaine Schaertl Short

机构 * Tufts University School of Engineering, Computer Science(塔夫茨大学工程学院计算机科学系) Tufts University School of Engineering, Mechanical Engineering(塔夫茨大学工程学院机械工程系)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出STEADY方法,通过处理标量反馈提升机器人抓取任务中的学习效果,证明标量反馈在适当处理下对强化学习有益。

Journal ref IROS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06250 2025-12-09 cs.LG 57%

Learning When to Switch: Adaptive Policy Selection via Reinforcement Learning

学习何时切换:通过强化学习实现自适应策略选择

Chris Tava

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 该研究通过强化学习实现自主代理在不同导航策略间的自适应切换,提升复杂任务性能。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05953 2025-12-08 cs.RO 57%

Correspondence-Oriented Imitation Learning: Flexible Visuomotor Control with 3D Conditioning

基于对应关系的模仿学习:具有3D条件的灵活视觉-运动控制

Yunhao Cao, Zubin Bhaumik, Jessie Jia, Xingyi He, Kuan Fang

机构 * Cornell University(康奈尔大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 COIL是一种基于对应关系的模仿学习框架,通过灵活的3D条件策略实现视觉-运动控制,能够适应不同任务需求并优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03707 2025-12-04 cs.RO 57%

ContactRL: Safe Reinforcement Learning based Motion Planning for Contact based Human Robot Collaboration

ContactRL: 基于接触的人机协作中的安全强化学习运动规划

Sundas Rafat Mulkana, Ronyu Yu, Tanaya Guha, Emma Li

机构 * School of Computing Science, University of Glasgow(计算科学学院,格拉斯哥大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 ContactRL通过力反馈强化学习实现安全高效的物理协作,提升人机协作任务的安全性和效率。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏