arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4116 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4116 篇

2509.15607 2025-12-02 cs.RO 57%

PRIMT: Preference-based Reinforcement Learning with Multimodal Feedback and Trajectory Synthesis from Foundation Models

基于偏好强化学习的多模态反馈与轨迹合成:从基础模型出发

Ruiqi Wang, Dezhong Zhao, Ziqin Yuan, Tianyu Shao, Guohua Chen, Dominic Kao, Sungeun Hong, Byung-Cheol Min

机构 * Purdue University(普渡大学) Beijing University of Chemical Technology(北京化工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Sungkyunkwan University(成均馆大学) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 PRIMT通过多模态反馈和轨迹合成,利用基础模型解决偏好强化学习中的查询模糊性和信用分配问题,提升机器人复杂行为的学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01228 2025-12-02 cs.LG 57%

On the Tension Between Optimality and Adversarial Robustness in Policy Optimization

在策略优化中最优性与对抗鲁棒性之间的张力

Haoran Li, Jiayu Lv, Congying Han, Zicheng Zhang, Anqi Li, Yan Liu, Tiande Guo, Nan Jiang

机构 * School of Mathematical Sciences University of Chinese Academy of Sciences(中国科学院大学数学科学学院) School of Mathematical Sciences Nankai University(南开大学数学科学学院) School of Statistics and Data Science Nankai University(南开大学统计与数据科学学院) Siebel School of Computing and Data Science University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校Siebel计算与数据科学学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文提出 BARPO 框架,通过调节对手强度统一 SPO 和 ARPO,解决策略优化中最优性与对抗鲁棒性之间的张力问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01066 2025-12-02 cs.RO cs.SY eess.SY 57%

Reinforcement Learning for Gliding Projectile Guidance and Control

基于强化学习的滑翔弹体引导与控制

Joel Cahn, Antonin Thomas, Philippe Pastor

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 本文提出利用强化学习提升滑翔弹体在动态环境中的自主导航与高精度目标跟踪能力。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22969 2025-12-02 cs.AI cs.MA 57%

Multi-Agent Conditional Diffusion Model with Mean Field Communication as Wireless Resource Allocation Planner

多智能体条件扩散模型与均场通信作为无线资源分配规划器

Kechen Meng, Sinuo Zhang, Rongpeng Li, Xiangming Meng, Yansha Deng, Chan Wang, Ming Lei, Zhifeng Zhao

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Zhejiang University-University of Illinois Urbana-Champaign (ZJU-UIUC) Institute, Zhejiang University(浙江大学-伊利诺伊大学厄巴纳-香槟分校联合研究所) Department of Engineering, King’s College London(伦敦国王学院工程系)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI

AI总结 多智能体条件扩散模型与均场通信用于无线资源分配规划,通过扩散模型和逆动态模型提升样本效率与策略可扩展性,理论保证收敛稳定性,实验显示在无线网络优化中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04340 2025-12-01 cs.LG cs.HC 57%

Interactive Groupwise Comparison for Reinforcement Learning from Human Feedback

基于交互式组间比较的强化学习从人类反馈中学习

Jan Kompatscher, Danqing Shi, Giovanna Varni, Tino Weinkauf, Antti Oulasvirta

机构 * Aalto University(阿尔托大学) University of Cambridge(剑桥大学) University of Trento(特伦特大学) KTH Royal Institute of Technology(皇家理工学院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文提出交互式组间比较方法,通过可视化和主动学习提升强化学习从人类反馈中学习的奖励和策略效果。

Comments 10 pages, 8 figures in proceedings of Computer Graphics Forum

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21011 2025-11-27 cs.LG 57%

Staggered Environment Resets Improve Massively Parallel On-Policy Reinforcement Learning

staggered 环境重置提升大规模并行 on-policy 强化学习

Sid Bharthulwar, Stone Tao, Hao Su

机构 * Harvard University(哈佛大学) UC San Diego(圣迭戈大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 staggered 环境重置通过增加时间多样性减少非平稳性,提升大规模并行 on-policy 强化学习的样本效率和收敛速度

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20018 2025-11-26 cs.NE cs.AI 57%

Energy Costs and Neural Complexity Evolution in Changing Environments

能量成本与神经复杂性在变化环境中的演变

Sian Heesom-Green, Jonathan Shock, Geoff Nitschke

机构 * University of Cape Town(开普敦大学) INRS Montreal(蒙特利尔INRS) NiTheCS

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI

AI总结 本研究通过演进人工神经网络探讨环境变化和能量成本如何影响神经复杂性进化,发现高季节性环境限制大脑大小,支持昂贵大脑假说。

Comments Presented at ALIFE 2025, proceedings forthcoming (MIT Press)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19217 2025-11-25 cs.CV 57%

ReAlign: Text-to-Motion Generation via Step-Aware Reward-Guided Alignment

ReAlign:通过步感知奖励引导对齐实现文本到动作生成

Wanjiang Weng, Xiaofeng Tan, Junbo Wang, Guo-Sen Xie, Pan Zhou, Hongsong Wang

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.CV

AI总结 ReAlign通过步感知奖励模型和引导策略提升文本到动作生成的对齐和质量。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18243 2025-11-25 cs.RO 57%

Dreaming Falcon: Physics-Informed Model-Based Reinforcement Learning for Quadcopters

梦之鹰:用于四旋翼的物理引导模型基强化学习

Eashan Vytla, Bhavanishankar Kalavakolanu, Andrew Perrault, Matthew McCrink

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO

AI总结 本文提出一种基于物理引导的世界模型方法,用于改进四旋翼的强化学习性能,通过物理模型预测力矩和状态展开,提升动态环境下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15046 2025-11-25 cs.AI 57%

Text-to-Decision Agent: Offline Meta-Reinforcement Learning from Natural Language Supervision

基于文本的决策代理:从自然语言监督中进行离线元强化学习

Shilin Zhang, Zican Hu, Wenhao Wu, Xinyi Xie, Jianxiang Tang, Chunlin Chen, Daoyi Dong, Yu Cheng, Zhenhong Sun, Zhi Wang

机构 * Nanjing University(南京大学) University of Technology Sydney(悉尼大学) The Chinese University of Hong Kong(香港中文大学) Australian National University(澳大利亚国立大学) University of New South Wales(新南威尔士大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI

AI总结 本文提出T2DA,通过自然语言监督实现离线元强化学习,利用文本-决策预训练提升零样本泛化能力。

Comments 32 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16602 2025-11-21 cs.AI 57%

Bridging VLMs and Embodied Intelligence with Deliberate Practice Policy Optimization

通过刻意练习策略优化弥合视觉语言模型与具身智能之间的鸿沟

Yi Zhang, Che Liu, Xiancong Ren, Hanchu Ni, Yingji Zhang, Shuai Zhang, Zeyuan Ding, Jiayu Hu, Haozhe Shan, Junbo Qi, Yan Bai, Dengjie Li, Jiachen Luo, Yidong Wang, Yong Dai, Zenglin Xu, Bin Shen, Qifan Wang, Jian Tang, Xiaozhu Ju

机构 * X-Humanoid Imperial College London(帝国理工学院) Peking University(北京大学) University of Manchester(曼彻斯特大学) Westlake University(西湖大学) Fudan University(复旦大学) Waseda University(早稻田大学) Nvidia Queen Mary University of London(伦敦大学玛丽女王学院) Celonis AI Meta AI

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.AI

AI总结 本文提出DPPO框架,通过监督微调与强化学习交替训练,提升具身智能系统在稀疏数据下的学习效率,并在性能和参数规模上取得显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16108 2025-11-21 cs.AI 57%

SkyRL-Agent: Efficient RL Training for Multi-turn LLM Agent

SkyRL-Agent: 多轮长周期LLM代理高效强化学习训练

Shiyi Cao, Dacheng Li, Fangzhou Zhao, Shuo Yuan, Sumanth R. Hegde, Connor Chen, Charlie Ruan, Tyler Griggs, Shu Liu, Eric Tang, Richard Liaw, Philipp Moritz, Matei Zaharia, Joseph E. Gonzalez, Ion Stoica

机构 * NovaSky AI UC Berkeley(加州大学伯克利分校) Anyscale

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 SkyRL-Agent通过高效异步调度和工具增强训练配方,实现多轮长周期LLM代理的高效强化学习训练,使SA-SWE-32B在SWE-Bench上达到39.4% Pass@1,成本降低超2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14330 2025-11-19 cs.RO 57%

MA-SLAM: Active SLAM in Large-Scale Unknown Environment using Map Aware Deep Reinforcement Learning

Yizhen Yin, Yuhua Qi, Dapeng Feng, Hongbo Chen, Hongjun Ma, Jin Wu, Yi Jiang

机构 * Sun Yat-sen University(中山大学) South China University of Technology(华南理工大学) Hong Kong University of Science and Technology(香港科学与技术大学) City University of Hong Kong(香港城市大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12650 2025-11-18 cs.RO cs.SY eess.SY 57%

Task-Aware Morphology Optimization of Planar Manipulators via Reinforcement Learning

Arvind Kumar Mishra, Sohom Chakrabarty

机构 * Department of Electrical Engineering, Indian Institute of Technology Roorkee, Roorkee 247667,India(印度理工学院罗奥尔基分校电子工程系)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

Comments 10 pages, 11 figures, It is submitted as a journal option paper associated with the IFAC World Congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11402 2025-11-17 cs.LG 57%

Multi-Phase Spacecraft Trajectory Optimization via Transformer-Based Reinforcement Learning

Amit Jain, Victor Rodriguez-Fernandez, Richard Linares

机构 * Aeronautics & Astronautics, Massachusetts Institute of Technology(航空与宇航科学系,麻省理工学院) Department of Computer Systems Engineering, Universidad Politécnica de Madrid(计算机系统工程系,马德里理工大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10383 2025-11-14 stat.ML cs.LG cs.SY eess.SY math.OC 57%

Operator Models for Continuous-Time Offline Reinforcement Learning

Nicolas Hoischen, Petar Bevanda, Max Beier, Stefan Sosnowski, Boris Houska, Sandra Hirche

机构 * TU Munich(慕尼黑工业大学) ShanghaiTech University(上海交通大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01720 2025-11-14 cs.LG 57%

Succeed or Learn Slowly: Sample Efficient Off-Policy Reinforcement Learning for Mobile App Control

Georgios Papoudakis, Thomas Coste, Jianye Hao, Jun Wang, Kun Shao

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) University College London(伦敦大学学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08926 2025-11-13 cs.MA cs.AI 57%

Achieving Equilibrium under Utility Heterogeneity: An Agent-Attention Framework for Multi-Agent Multi-Objective Reinforcement Learning

Zhuhui Li, Chunbo Luo, Liming Huang, Luyu Qi, Geyong Min

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08325 2025-11-12 cs.CL cs.IR cs.LG 57%

AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress

Zhiheng Xi, Chenyang Liao, Guanyu Li, Yajie Yang, Wenxiang Chen, Zhihao Zhang, Binghai Wang, Senjie Jin, Yuhao Zhou, Jian Guan, Wei Wu, Tao Ji, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Ant Group(蚂蚁集团)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07051 2025-11-11 cs.CV cs.CR 57%

Improving Deepfake Detection with Reinforcement Learning-Based Adaptive Data Augmentation

Yuxuan Zhou, Tao Yu, Wen Huang, Yuheng Zhang, Tao Dai, Shu-Tao Xia

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02507 2025-11-06 cs.RO 57%

AURA: Autonomous Upskilling with Retrieval-Augmented Agents

Alvin Zhu, Yusuke Tanaka, Andrew Goldberg, Dennis Hong

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02690 2025-11-05 cs.LG 57%

Curriculum Design for Trajectory-Constrained Agent: Compressing Chain-of-Thought Tokens in LLMs

Georgios Tzannetos, Parameswaran Kamalaruban, Adish Singla

机构 * MPI-SWS(马克斯·普朗克所际研究所)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

Comments NeurIPS'25 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08655 2025-11-05 cs.RO 57%

FRASA: An End-to-End Reinforcement Learning Agent for Fall Recovery and Stand Up of Humanoid Robots

Clément Gaspard, Marc Duclusaud, Grégoire Passault, Mélodie Daniel, Olivier Ly

机构 * Univ. Bordeaux, CNRS, LaBRI, UMR 5800(波尔多大学、国家科学研究中心、LaBRI、UMR 5800)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22940 2025-11-05 cs.LG 57%

Generating Auxiliary Tasks with Reinforcement Learning

Judah Goldfeder, Matthew So, Hod Lipson

机构 * Department of Computer Science(计算机科学系) Columbia University(哥伦比亚大学) Department of Mechanical Engineering(机械工程系)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00034 2025-11-04 cs.MA cs.LG 57%

On the Fundamental Limitations of Decentralized Learnable Reward Shaping in Cooperative Multi-Agent Reinforcement Learning

Aditya Akella

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

Comments 8 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22575 2025-11-03 cs.SE cs.AI 57%

On the Mistaken Assumption of Interchangeable Deep Reinforcement Learning Implementations

Rajdeep Singh Hundal, Yan Xiao, Xiaochun Cao, Jin Song Dong, Manuel Rigger

机构 * National University of Singapore(新加坡国立大学) Sun Yat-sen University(中山大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI

Comments Added the ACM Functional v1.1 badge, the full publication citation, and a link to the publication on IEEE Xplore

Journal ref IEEE/ACM 47th International Conference on Software Engineering (ICSE), Ottawa, ON, Canada, 2025, pp. 2225-2237

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03394 2025-11-03 cs.RO 57%

Faster Model Predictive Control via Self-Supervised Initialization Learning

Zhaoxin Li, Xiaoke Wang, Letian Chen, Rohan Paleja, Subramanya Nageshrao, Matthew Gombolay

机构 * Georgia Institute of Technology(佐治亚理工学院) MIT Lincoln Laboratory(麻省理工学院林肯实验室) Ford Motor Company(福特汽车公司)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25529 2025-10-30 cs.AI 57%

Off-policy Reinforcement Learning with Model-based Exploration Augmentation

Likun Wang, Xiangteng Zhang, Yinuo Wang, Guojian Zhan, Wenxuan Wang, Haoyu Gao, Jingliang Duan, Shengbo Eben Li

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25320 2025-10-30 cs.AI cs.CL 57%

GAP: Graph-Based Agent Planning with Parallel Tool Use and Reinforcement Learning

Jiaqi Wu, Qinlao Zhao, Zefeng Chen, Kai Qin, Yifei Zhao, Xueqian Wang, Yuhang Yao

机构 * Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) National University of Singapore(新加坡国立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14819 2025-10-30 cs.LG 57%

Learning from Reward-Free Offline Data: A Case for Planning with Latent Dynamics Models

Vlad Sobal, Wancong Zhang, Kyunghyun Cho, Randall Balestriero, Tim G. J. Rudner, Yann LeCun

机构 * New York University(纽约大学) Genentech(基因泰克) Brown University(布朗大学) University of Toronto(多伦多大学) Meta – FAIR

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

Comments Project web page: https://latent-planning.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏