arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4116 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4116 篇

2601.20071 2026-03-04 cs.LG 57%

Distributional value gradients for stochastic environments

分布价值梯度用于随机环境

Baptiste Debes, Tinne Tuytelaars

机构 * PSI KU Leuven(KU莱顿心理学研究所)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 本文提出分布式Sobolev训练方法,通过建模价值函数及其梯度的分布,提升在随机环境中的样本效率和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00798 2026-03-04 cs.LG stat.ML 57%

Combinatorial Rising Bandits

组合上升老虎机

Seockbean Song, Youngsik Yoon, Siwei Wang, Wei Chen, Jungseul Ok

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文提出组合上升老虎机框架和CRUCB算法,解决组合老虎机中因基础臂增强传播导致的依赖问题,通过理论分析和实验验证其高效性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03032 2026-03-03 cs.LG 57%

Leveraging Discrete Function Decomposability for Scientific Design

利用离散函数分解进行科学设计

James C. Bowden, Sergey Levine, Jennifer Listgarten

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文提出DADO算法,通过利用设计变量的分解结构,提升离散空间优化效率,用于科学设计问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24182 2026-03-02 cs.LG 57%

Multi-Objective Reinforcement Learning for Large-Scale Tote Allocation in Human-Robot Collaborative Fulfillment Centers

大规模人机协作分拣中心中的多目标强化学习用于托盘分配

Sikata Sengupta, Guangyi Liu, Omer Gottesman, Joseph W Durham, Michael Kearns, Aaron Roth, Michael Caldara

机构 * Department of Computer and Information Science, University of Pennsylvania, Philadelphia, PA, USA(计算机与信息科学系,宾夕法尼亚大学,费城,PA,USA) Amazon(亚马逊)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 本文提出了一种多目标强化学习方法,用于解决大规模人机协作分拣中心中的托盘分配问题,通过权衡处理速度、资源使用和空间利用等目标,实现了高效且满足约束的策略学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05362 2026-03-02 cs.CV 57%

Imagine a City: CityGenAgent for Procedural 3D City Generation

想象一座城市:CityGenAgent用于程序化3D城市生成

Zishan Liu, Zecong Tang, RuoCheng Wu, Xinzhe Zheng, Jingyu Hu, Ka-Hei Hui, Haoran Xie, Bo Dai, Zhengzhe Liu

机构 * Lingnan University, Hong Kong SAR, China(岭南大学) Zhejiang University, Hangzhou, China(浙江大学) The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学) Autodesk AI Lab, Canada(Autodesk AI实验室) The University of Hong Kong, Hong Kong SAR, China(香港大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV

AI总结 CityGenAgent通过自然语言驱动的分层程序化生成方法,实现了高质量3D城市生成,提升了语义对齐、视觉质量和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21992 2026-02-26 cs.CV 57%

PanoEnv: Exploring 3D Spatial Intelligence in Panoramic Environments with Reinforcement Learning

PanoEnv:探索基于强化学习的全景环境中3D空间智能

Zekai Lin, Xu Zheng

机构 * University of Glasgow(格拉斯哥大学) HKUST(GZ)(香港科技大学(广州))

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.CV

AI总结 PanoEnv通过强化学习框架提升VLMs在全景环境中3D空间推理能力,实现更高准确率和语义评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04579 2026-02-26 eess.SY cs.RO cs.SY 57%

Gauss-Newton accelerated MPPI Control

Gauss-Newton加速的MPPI控制

Hannes Homburger, Katrin Baumgärtner, Moritz Diehl, Johannes Reuter

机构 * Institute of System Dynamics, HTWG Konstanz - University of Applied Sciences(系统动力学研究所,霍特廷根应用科学大学) Department of Microsystems Engineering (IMTEK), University of Freiburg(微系统工程系(IMTEK),弗赖堡大学) Department of Microsystems Engineering (IMTEK)(微系统工程系(IMTEK)) Department of Mathematics, University of Freiburg(数学系,弗赖堡大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 本文提出Gauss-Newton加速的MPPI方法,通过结合雅可比重构和二次广义高斯-牛顿方法,提升MPPI在高维问题中的可扩展性和计算效率。

Comments 6 pages, 3 figures, submitted to the IFAC World Congress 2026, parts of this preprint are directly taken from Chapter 3 of the main author's PhD thesis with title "Optimal Control for Efficient Vessel Operation: From Theory to Real-World Applications"

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03356 2026-02-25 cs.RO 57%

Effective Reinforcement Learning Control using Conservative Soft Actor-Critic

通过保守的软演员-评论家实现有效的强化学习控制

Zhiwei Shang, Xinyi Yuan, Wenjun Huang, Yunduan Cui, Di Chen, Meixin Zhu

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)数据科学学院) Graduate School of Engineering Science, Osaka University, Japan(大阪大学工学研究科) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences, China(中国科学院深圳先进技术研究院) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学电子与电气工程系) School of Transportation, Southeast University, China(东南大学交通运输学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出保守的软演员-评论家算法,通过熵和相对熵正则化提升强化学习控制的稳定性与效率。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21363 2026-02-24 cs.RO 57%

Towards Bridging the Gap between Large-Scale Pretraining and Efficient Finetuning for Humanoid Control

迈向大规模预训练与高效微调之间的人形机器人控制的桥梁

Weidong Huang, Zhehan Li, Hangxin Liu, Biao Hou, Yao Su, Jingwen Zhang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) School of Artificial Intelligence, Xidian University(人工智能学院,西安电子科技大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO

AI总结 本文提出了一种结合大规模预训练与高效微调的方法,利用SAC实现人形机器人零样本部署,并通过基于模型的方法提升适应效率。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15076 2026-02-18 cs.LG stat.ML 57%

Near-Optimal Sample Complexity for Online Constrained MDPs

在线约束马尔可夫决策过程的近最优样本复杂度

Chang Liu, Yunfan Li, Lin F. Yang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文提出了一种基于模型的对偶算法,解决了在线约束马尔可夫决策过程的安全性问题,证明了在允许小规模违规的情况下,算法能以近最优样本复杂度生成安全策略。

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14534 2026-02-17 cs.CV 57%

MoRL: Reinforced Reasoning for Unified Motion Understanding and Generation

MoRL: 用于统一运动理解与生成的强化推理

Hongpeng Wang, Zeyu Zhang, Wenhao Li, Hao Tang

机构 * The University of Sydney(悉尼大学) Peking University(北京大学) Nanyang Technological University(南洋理工大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.CV

AI总结 MoRL通过结合监督微调和强化学习,提升运动理解与生成的推理能力和现实感,并引入链式运动方法和大规模CoT数据集以增强推理效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13016 2026-02-16 cs.RO 57%

How Swarms Differ: Challenges in Collective Behaviour Comparison

群集行为的差异:集体行为比较中的挑战

André Fialho Jesus, Jonas Kuckling

机构 * Department of Computer and Information Science(计算机与信息科学系) Centre for the Advanced Study of Collective Behaviour(集体行为高级研究中心) Zukunftskolleg(未来学院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 本文研究了群集行为比较中的挑战,提出了一种基于自组织映射的方法来识别特征空间中难以区分行为的区域。

Comments Accepted for publication in the proceeding of ANTS 2026 - 15th International Conference on Swarm Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12734 2026-02-16 cs.RO 57%

Scaling Single Human Demonstrations for Imitation Learning using Generative Foundational Models

通过生成基础模型扩展单人示范用于模仿学习

Nick Heppert, Minh Quang Nguyen, Abhinav Valada

机构 * Computer Science, University of Freiburg(弗赖堡大学计算机科学系) Zuse School ELIZA(泽乌斯学校ELIZA)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 通过生成基础模型扩展单人示范用于模仿学习,实现从单人示范到机器人任务的高效训练与泛化

Comments ICRA 2026, 8 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12520 2026-02-16 cs.LG cs.MA 57%

Multi-Agent Model-Based Reinforcement Learning with Joint State-Action Learned Embeddings

基于联合状态-动作学习嵌入的多智能体模型驱动强化学习

Zhizun Wang, David Meger

机构 * McGill University(麦吉尔大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 本文提出了一种基于联合状态-动作学习嵌入的多智能体模型驱动强化学习框架,通过统一表示学习与想象式回放,提升智能体在动态环境中协调能力与长期规划效率。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11464 2026-02-13 cs.RO 57%

EasyMimic: A Low-Cost Framework for Robot Imitation Learning from Human Videos

EasyMimic: 一种低成本的机器人模仿学习框架

Tao Zhang, Song Xia, Ye Wang, Qin Jin

机构 * AIM3 Lab, Renmin University of China(中国人民大学人工智能实验室)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 EasyMimic通过低成本框架实现机器人从人类视频快速学习操控策略,减少对昂贵数据的依赖,推动家庭机器人发展。

Comments icra 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10455 2026-02-13 cs.RO cs.SY eess.SY 57%

Towards Dynamic Quadrupedal Gaits: A Symmetry-Guided RL Hierarchy Enables Free Gait Transitions at Varying Speeds

迈向动态四足步态:基于对称性的强化学习层级实现自由步态转换以适应不同速度

Jiayu Ding, Xulin Chen, Garrett E. Katz, Zhenyu Gan

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出基于对称性的强化学习方法,实现四足机器人在不同速度下的自由步态转换,提升运动适应性。

Comments This work is build on reusing the main novel concept from arXiv:2403.10723. Based on the reviews we accept while submitting this work, we decided to resubmit this work as a replacement of the linked work

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02087 2026-02-13 cs.LG stat.ML 57%

Beyond CVaR: Leveraging Static Spectral Risk Measures for Enhanced Decision-Making in Distributional Reinforcement Learning

超越CVaR:利用静态谱风险度量提升分布式强化学习中的决策质量

Mehrdad Moghimi, Hyejin Ku

机构 * Department of Mathematics and Statistics, York University, Toronto, Canada(数学与统计学系,约克大学,多伦多,加拿大)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文提出了一种具有收敛保证的DRL算法,优化更广泛的静态谱风险度量,提升决策质量并优于现有方法。

Comments Accepted at ICML 2025

Journal ref Proceedings of the 42nd International Conference on Machine Learning, PMLR 267:44571-44593, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10547 2026-02-12 cs.RO 57%

ReSPEC: A Framework for Online Multispectral Sensor Reconfiguration in Dynamic Environments

ReSPEC:动态环境中在线多光谱传感器重新配置框架

Yanchen Liu, Yuang Fan, Minghui Zhao, Xiaofan Jiang

机构 * Department of Electrical Engineering, Columbia University(电气工程系,哥伦比亚大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 ReSPEC框架通过强化学习实现动态多光谱传感器重新配置,提升机器人在复杂环境下的感知效率与资源利用率。

Comments 8 pages, 4 figures. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04538 2026-02-12 cs.LG 57%

HypeRL: Hypernetwork-Based Reinforcement Learning for Control of Parametrized Dynamical Systems

HypeRL: 基于超网络的强化学习用于参数化动力系统控制

Nicolò Botteghi, Stefania Fresca, Mengwu Guo, Andrea Manzoni

机构 * MOX - Department of Mathematics Politecnico di Milano(米兰理工数学系MOX部门) Department of Mechanical Engineering University of Washington(华盛顿大学机械工程系) Centre for Mathematical Sciences Lund University(卢德大学数学科学中心)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 HypeRL通过超网络强化学习方法,解决参数化动力系统控制问题,实现高效泛化和优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13761 2026-02-11 cs.AI cs.CL 57%

THOR: Tool-Integrated Hierarchical Optimization via RL for Mathematical Reasoning

THOR:通过强化学习进行工具集成的分层优化以实现数学推理

Qikai Chang, Zhenrong Zhang, Pengfei Hu, Jun Du, Jiefeng Ma, Yicheng Pan, Jianshu Zhang, Quan Liu, Jianqing Gao

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(iFLYTEK研究院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI

AI总结 THOR通过强化学习实现工具集成的分层优化,提升数学推理和代码生成能力。

Comments 22 pages, 13 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10357 2026-02-11 cs.AI 57%

Optimus-3: Dual-Router Aligned Mixture-of-Experts Agent with Dual-Granularity Reasoning-Aware Policy Optimization

Optimus-3: 具有双粒度推理感知策略优化的双路由对齐专家混合代理

Zaijing Li, Yuquan Xie, Rui Shao, Gongwei Chen, Weili Guan, Dongmei Jiang, Yaowei Wang, Liqiang Nie

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen Campus)(计算机科学与技术学院,哈尔滨工业大学(深圳校区)) Pengcheng Laboratory(鹏城实验室) School of Information Science and Technology, Harbin Institute of Technology (Shenzhen Campus)(信息科学与技术学院,哈尔滨工业大学(深圳校区)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 模仿学习与强化学习 :embodied AI(abstract);分类 cs.AI

AI总结 Optimus-3通过双路由对齐专家混合架构和双粒度推理感知策略优化,实现了系统1与系统2的协同,提升了开放性任务的解决能力。

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06326 2026-02-09 cs.LG 57%

Online Adaptive Reinforcement Learning with Echo State Networks for Non-Stationary Dynamics

在线自适应强化学习与回声状态网络用于非平稳动态

Aoi Yoshimura, Gouhei Tanaka

机构 * Department of Computer Science, Nagoya Institute of Technology(名古屋技术大学计算机科学系) Nagoya Institute of Technology(名古屋技术大学) International Research Center for Neurointelligence, The University of Tokyo(神经智能国际研究中心,东京大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 本文提出基于回声状态网络的在线自适应强化学习框架,通过共振计算实现快速适应,适用于非平稳动态环境中的实时机器人控制。

Comments Submitted to IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03171 2026-02-04 cs.LG 57%

StepScorer: Accelerating Reinforcement Learning with Step-wise Scoring and Psychological Regret Modeling

StepScorer: 通过分步评分与心理遗憾建模加速强化学习

Zhe Xu

机构 * INDEPENDENT RESEARCHER(独立研究者)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 StepScorer通过分步评分与心理遗憾建模,加速强化学习收敛,适用于连续控制任务和延迟反馈环境。

Comments 10 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02831 2026-02-04 cs.RO 57%

Adaptive Linear Path Model-Based Diffusion

基于自适应线性路径模型的扩散

Yutaka Shimizu, Masayoshi Tomizuka

机构 * Department of Mechanical Engineering, University of California, Berkeley(加州大学伯克利分校机械工程系)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出LP-MBD和ALP-MBD,通过线性概率路径和强化学习提升扩散模型在机器人控制中的适应性和鲁棒性。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02283 2026-02-03 cs.LG stat.ML 57%

Choice-Model-Assisted Q-learning for Delayed-Feedback Revenue Management

基于选择模型的Q学习用于延迟反馈收益管理

Owen Shen, Patrick Jaillet

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 本文提出基于选择模型的Q学习方法,用于解决延迟反馈下的收益管理问题,通过部分世界模型提升决策鲁棒性并减少偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01040 2026-02-03 cs.RO 57%

Learning Adaptive Cross-Embodiment Visuomotor Policy with Contrastive Prompt Orchestration

学习适应性跨主体视觉运动策略与对比提示协调

Yuhang Zhang, Chao Yan, Jiaxi Yu, Jiaping Xiao, Mir Feroskhan

机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院) College of Automation Engineering, Nanjing University of Aeronautics and Astronautics(南京航空航天大学自动化工程学院)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.RO

AI总结 CAPO通过对比提示学习和自适应提示协调,提升跨主体视觉运动策略的适应性和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00452 2026-02-03 cs.LG 57%

Imitation from Observations with Trajectory-Level Generative Embeddings

通过轨迹级生成嵌入进行观察模仿学习

Yongtao Qu, Shangzhe Li, Weitong Zhang

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 TGE通过轨迹级生成嵌入解决离线模仿学习中专家数据稀缺的问题,利用时序扩散模型构建平滑奖励,提升离线数据与专家行为间的学习信号。

Comments 25 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10007 2026-02-03 cs.LG math.OC stat.ML 57%

Sample Complexity of Distributionally Robust Average-Reward Reinforcement Learning

分布鲁棒平均奖励强化学习的样本复杂度

Zijun Chen, Shengbo Wang, Nian Si

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文提出两种算法,实现了分布鲁棒平均奖励强化学习的近最优样本复杂度,通过锚定状态稳定转移核并保证收敛性。

Comments Accepted at NeurIPS 2025. Updated with minor corrections and additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18847 2026-02-02 cs.LG 57%

Offline Goal-Conditioned Reinforcement Learning with Projective Quasimetric Planning

离线目标条件强化学习与投影拟度规划

Anthony Kobanda, Waris Radji, Mathieu Petitbois, Odalric-Ambrym Maillard, Rémy Portelas

机构 * Ubisoft la Forge University of Angers(昂热大学) Inria(法国国家科学研究中心)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文提出ProQ框架,通过学习非对称距离和结合拉格朗日检测器,实现目标条件强化学习中子目标生成与长期目标达成的稳健控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.02662 2026-02-02 cs.LG 57%

Grounding Large Language Models in Interactive Environments with Online Reinforcement Learning

通过在线强化学习将大语言模型接地于交互环境

Thomas Carta, Clément Romac, Thomas Wolf, Sylvain Lamprier, Olivier Sigaud, Pierre-Yves Oudeyer

机构 * Inria (Flowers)(Inria(Flowers)) University of Bordeaux(波尔多大学) Hugging Face Univ Angers, LERIA, SFR MATHSTIC(昂热大学,LERIA,SFR MATHSTIC) Sorbonne Université(索邦大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文提出GLAM方法,通过在线强化学习将大语言模型接地于交互环境,以提升样本效率和泛化能力,并探讨在线学习的影响。

Comments The associated code can be found at https://github.com/flowersteam/Grounding_LLMs_with_online_RL. This is an extended version of the paper published at ICML 2023: https://proceedings.mlr.press/v202/carta23a

Journal ref PMLR 202 (2023):3676-3713

详情

展开后加载摘要…

URL PDF HTML 收藏