arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4106 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4106 篇

2605.19924 2026-05-20 cs.RO 79%

RoHIL: Robust Human-in-the-Loop Robotic Reinforcement Learning Against Illumination Variations

RoHIL: 面对光照变化的鲁棒人机协同机器人强化学习

Shuoqin Zhang, Yixin Xiong, Xiru Gao, Kai Liu, Ke Wang, Xichuan Zhou, Zhe Hu

机构 * Chongqing University(重庆大学) Chengdu Anu Intelligence(成都安努智能)

专题命中 模仿学习与强化学习 :robotic(title);manipulation(abstract);分类 cs.RO

AI总结 本文提出RoHIL框架,通过离线微调方法解决机器人在不同工作间因光照变化导致的性能下降问题,保留原始工作间性能并避免重新收集数据和训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19919 2026-05-20 cs.RO 79%

Beyond Action Residuals: Real-World Robot Policy Steering via Bottleneck Latent Reinforcement Learning

超越动作残差:通过瓶颈潜在强化学习实现现实世界机器人策略引导

Dongjie Yu, Kun Lei, Zhennan Jiang, Jia Pan, Huazhe Xu

机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Shanghai Qizhi Institute(上海启智研究院) Shanghai Jiao Tong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)

专题命中 模仿学习与强化学习 :robot policy(title);manipulation(abstract);分类 cs.RO

AI总结 本文提出了一种名为Z-Perturbation Reinforcement Learning(ZPRL)的方法,通过紧凑的瓶颈潜在空间来引导预训练策略,从而提高样本效率和最终性能,同时在现实世界任务中显著提升了成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18881 2026-05-20 cs.LG physics.flu-dyn 79%

Emergence of a Flow-Assisted Casting Strategy for Olfactory Navigation via Memory-Augmented Reinforcement Learning

气味导航中通过记忆增强强化学习的流辅助铸造策略的出现

Changxu Zhao, Dongxiao Zhao, Xin Bian, Gaojin Li

机构 * State Key Laboratory of Ocean Engineering, School of Ocean and Civil Engineering, Shanghai Jiao Tong University, Shanghai 200240, People’s Republic of China(海洋工程国家重点实验室,海洋与土木工程学院,上海交通大学,上海200240,中华人民共和国) State Key Laboratory of Fluid Power and Mechatronic Systems, Department of Engineering Mechanics, Zhejiang University, Hangzhou 310027, People’s Republic of China(流体动力与机械系统国家重点实验室,工程力学系,浙江大学,杭州310027,中华人民共和国)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.LG

AI总结 研究通过记忆增强强化学习探讨了在动态流场中动物如何利用记忆长度和流条件优化气味搜索效率,发现智能体通过自适应调整搜索轨迹几何形状和启动铸造的浓度阈值来最大化成功概率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14174 2026-05-15 cs.RO 79%

Safety-Constrained Reinforcement Learning with Post-Training Reachability Verification for Robot Navigation

具有事后训练可达性验证的安全强化学习用于机器人导航

Qisong He, Xinmiao Huang, Jinwei Hu, Zhuoyun Li, Yi Dong, Changshun Wu, Xiaowei Huang

机构 * University of Liverpool(利物浦大学) Université Grenoble Alpes(格勒诺布尔阿尔卑斯大学)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出一种基于条件价值风险约束的强化学习框架,通过训练对高成本尾部结果敏感的策略,并在训练后利用神经网络可达性验证评估其安全边际,实验表明该方法在导航任务中实现了更高的安全验证率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19980 2026-04-23 cs.RO cs.SY eess.SY 79%

Efficient Reinforcement Learning using Linear Koopman Dynamics for Nonlinear Robotic Systems

利用线性Koopman动力学实现非线性机器人系统的高效强化学习

Wenjian Hao, Yuxuan Fang, Zehui Lu, Shaoshuai Mou

机构 * School of Aeronautics and Astronautics, Purdue University(航空航天学院,普渡大学)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出基于模型的强化学习框架,通过Koopman算子理论学习非线性机器人系统的线性提升动力学,并将其整合到actor-critic架构中以优化策略,实验显示在模拟和现实平台中样本效率和控制性能均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27317 2026-04-02 cs.RO 79%

Where-to-Learn: Analytical Policy Gradient Directed Exploration for On-Policy Robotic Reinforcement Learning

Where-to-Learn: 分析性策略梯度引导的在线机器人强化学习探索

Leixin Chang, Xinchen Yao, Ben Liu, Liangjing Yang, Hua Chen

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出利用可微动力学模型的分析性策略梯度,引导机器人强化学习探索更优轨迹,提升策略学习效率和质量。

Comments 8 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22859 2026-03-31 cs.RO 79%

DecompGrind: A Decomposition Framework for Robotic Grinding via Cutting-Surface Planning and Contact-Force Adaptation

DecompGrind:一种通过切削面规划和接触力适应的机器人磨削分解框架

Shunsuke Araki, Takumi Hachimine, Yuki Saito, Kouhei Ohnishi, Jun Morimoto, Takamitsu Matsubara

机构 * Nara Institute of Science and Technology (NAIST)(奈良先端科学技术大学院大学) Keio University(庆应义塾大学) Kyoto University(京都大学) Advanced Telecommunications Research Institute International (ATR)(国际电气通信基础技术研究所)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出DecompGrind框架,通过分解磨削过程为去除形状规划和接触力适应,解决不同形状和材料硬度工件的高效磨削问题,实现安全接触力控制。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17301 2026-03-19 cs.LG 79%

WINFlowNets: Warm-up Integrated Networks Training of Generative Flow Networks for Robotics and Machine Fault Adaptation

WINFlowNets: 生成流网络在机器人和机器故障适应中的温升训练

Zahin Sufiyan, Shadan Golestan, Yoshihiro Mitsuka, Shotaro Miwa, Osmar Zaiane

机构 * University of Alberta(阿尔伯塔大学) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔人工智能研究所) Mitsubishi Electric Corporation(三菱电机公司)

专题命中 模仿学习与强化学习 :robotics(title);robotic(abstract);分类 cs.LG

AI总结 WINFlowNets通过温升阶段训练生成流网络与检索网络,提升机器人控制任务的稳定性和适应性,适用于动态环境和故障场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15370 2026-03-17 cs.CV 79%

Trajectory-Diversity-Driven Robust Vision-and-Language Navigation

轨迹多样性驱动的鲁棒视觉-语言导航

Jiangyang Li, Cong Wan, SongLin Dong, Chenhao Ding, Qiang Wang, Zhiheng Ma, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学) Faculty of Computility Microelectronics, Shenzhen University of Advanced Technology(深圳先进技术大学微电子学院)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.CV

AI总结 本文提出NavGRPO框架,通过群体相对策略优化实现目标导向的导航策略学习,在未见环境中提升鲁棒性,实验显示在R2R和REVERIE基准上SPL提升达3.0%和1.71%。

Comments 17pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12868 2026-03-16 cs.RO 79%

Beyond Imitation: Reinforcement Learning Fine-Tuning for Adaptive Diffusion Navigation Policies

超越模仿:用于自适应扩散导航策略的强化学习微调

Junhe Sheng, Ruofei Bai, Kuan Xu, Ruimeng Liu, Jie Chen, Shenghai Yuan, Wei-Yun Yau, Lihua Xie

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) A*STAR, Singapore(A*STAR,新加坡) National University of Singapore, Singapore(新加坡国立大学)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出一种针对扩散导航的强化学习微调框架,通过Group Relative Policy Optimization提升策略适应性,在Isaac Sim中提升成功率和SPL,减少碰撞,展示出更强的零样本迁移能力和安全泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11470 2026-03-13 cs.RO 79%

NFPO: Stabilized Policy Optimization of Normalizing Flow for Robotic Policy Learning

NFPO:归一化流在机器人策略学习中的稳定策略优化

Diyuan Shi, Yiqi Tang, Zifeng Zhuang, Donglin Wang

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出NFPO方法,利用归一化流作为策略参数化,解决在线强化学习中训练不稳定问题,通过实验展示其在机器人学习任务中的稳健性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20325 2026-03-12 cs.CV 79%

AD-R1: Closed-Loop Reinforcement Learning for End-to-End Autonomous Driving with Impartial World Models

AD-R1: 闭环强化学习用于端到端自动驾驶的中立世界模型

Tianyi Yan, Tao Tang, Xingtai Gui, Yongkang Li, Jiasen Zhesng, Weiyao Huang, Lingdong Kong, Wencheng Han, Xia Zhou, Xueyang Zhang, Yifei Zhan, Kun Zhan, Cheng-zhong Xu, Jianbing Shen

机构 * SKL-IOTSC, University of Macau(SKL-IOTSC,澳门大学) Li Auto Inc. Sun Yat-sen University(中山大学) Huazhong University of Science and Technology(华中科技大学) Northwestern University(西北大学) National University of Singapore(新加坡国立大学)

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.CV

AI总结 AD-R1通过引入中立世界模型和反事实合成技术,提升自动驾驶系统在危险预测和安全控制方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09237 2026-03-11 cs.RO 79%

MO-Playground: Massively Parallelized Multi-Objective Reinforcement Learning for Robotics

MO-Playground: 多目标强化学习的大规模并行化方法用于机器人学

Neil Janwani, Ellen Novoseller, Vernon J. Lawhern, Maegan Tucker

专题命中 模仿学习与强化学习 :robotics(title,abstract);分类 cs.RO

AI总结 MO-Playground通过GPU加速的多目标环境和MORLAX算法,实现大规模并行化多目标强化学习,显著提升复杂机器人任务中的帕累托最优策略学习效率。

Comments 8 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12296 2026-03-11 cs.RO 79%

A robust and compliant robotic assembly control strategy for batch precision assembly task with uncertain fit types and fit amounts

一种鲁棒且顺应性的机器人批量精密装配控制策略用于具有不确定配合类型和配合量的精密装配任务

Bin Wang, Jiwen Zhang, Song Wang, Dan Wu

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出了一种基于FVFC-MTRL框架的鲁棒且顺应性机器人装配控制策略,通过多任务强化学习和策略蒸馏方法提升精密装配任务的鲁棒性和成功率。

Journal ref IEEE Transactions on Automation Science and Engineering, vol. 23, pp. 5502-5515, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08476 2026-03-10 cs.RO 79%

LAR-MoE: Latent-Aligned Routing for Mixture of Experts in Robotic Imitation Learning

LAR-MoE:用于机器人模仿学习中专家混合的潜在对齐路由

Ariel Rodriguez, Chenpan Li, Lorenzo Mazza, Rayan Younis, Ortrun Hellig, Sebastian Bodenstedt, Martin Wagner, Stefanie Speidel

机构 * Department of Translational Surgical Oncology, NCT/UCC Dresden(转化外科肿瘤学系) Cluster of Excellence-CeTI, TUD, Germany(卓越中心-CeTI) Department of Visceral, Thoracic and Vascular Surgery, Faculty of Medicine and University Hospital Carl Gustav Carus, TUD, Germany(visceral、胸腔和血管外科系)

专题命中 模仿学习与强化学习 :robotic(title);manipulation(abstract);分类 cs.RO

AI总结 LAR-MoE通过潜在对齐路由在机器人模仿学习中实现无监督的专家混合,提升任务适应性和效率。

Comments Submitted to iROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04579 2026-03-06 cs.RO 79%

Risk-Aware Reinforcement Learning for Mobile Manipulation

面向移动操作的风险感知强化学习

Michael Groom, James Wilson, Nick Hawes, Lars Kunze

机构 * Oxford Robotics Institute, Department of Engineering Science, University of Oxford(牛津大学机器人研究所、工程科学系、牛津大学) Dyson Institute of Engineering & Technology(戴森工程与技术研究所) Bristol Robotics Laboratory, School of Engineering, University of West England(布里斯托尔机器人实验室、工程学院、西英格兰大学)

专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO

AI总结 本文提出了一种基于风险感知的强化学习方法,通过分布强化学习和模仿学习,实现移动操作中的风险敏感决策与策略蒸馏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02192 2026-03-03 cs.RO 79%

A Quantitative Comparison of Centralised and Distributed Reinforcement Learning-Based Control for Soft Robotic Arms

一种集中式与分布式强化学习控制在软机器人手臂中的定量比较

Linxin Hou, Qirui Wu, Zhihang Qin, Neil Banerjee, Yongxin Guo, Cecilia Laschi

机构 * Department of Electrical and Computer Engineering, National University of Singapore(电子与计算机工程系,新加坡国立大学) Department of Computer Science, National University of Singapore(计算机科学系,新加坡国立大学) Department of Mechanical Engineering, National University of Singapore(机械工程系,新加坡国立大学)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 本文比较了集中式与分布式强化学习在软机器人手臂控制中的性能,发现分布式策略在样本效率和鲁棒性上更优,但集中式策略在训练时间上更高效。

Comments 7 pages, 4 figures, 2 tables, accepted by RoboSoft 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23055 2026-02-25 cs.AI 79%

MindPower: Enabling Theory-of-Mind Reasoning in VLM-based Embodied Agents

MindPower: 使基于视觉语言的具身智能体具备心智理论推理能力

Ruoxuan Zhang, Qiyun Zheng, Zhiyu Zhou, Ziqi Liao, Siyu Wu, Jian-Yu Jiang-Lin, Bin Wen, Hongxia Xie, Jianlong Fu, Wen-Huang Cheng

机构 * Jilin University(吉林大学) National Taiwan University(台湾大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 模仿学习与强化学习 :embodied agent(title,abstract);分类 cs.AI

AI总结 MindPower通过整合感知、心理推理、决策和行动,使基于视觉语言的具身智能体具备心智理论推理能力,并在决策和行动生成上超越GPT-4o。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15189 2026-02-13 cs.RO 79%

RM-RL: Role-Model Reinforcement Learning for Precise Robot Manipulation

RM-RL:基于角色模型的强化学习用于精确机器人操控

Xiangyu Chen, Chuhao Zhou, Yuxi Liu, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(马斯实验室,南洋理工大学)

专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO

AI总结 RM-RL通过角色模型策略实现精确机器人操控,无需人类示范,提升在线和离线训练效率,实验显示在现实任务中精度显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09022 2026-02-10 cs.CV 79%

WorldCompass: Reinforcement Learning for Long-Horizon World Models

WorldCompass:用于长周期世界模型的强化学习

Zehan Wang, Tengfei Wang, Haiyu Zhang, Xuhui Zuo, Junta Wu, Haoyuan Wang, Wenqiang Sun, Zhenwei Wang, Chenjie Cao, Hengshuang Zhao, Chunchao Guo, Zhou Zhao

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯混元) The University of Hong Kong(香港大学)

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.CV

AI总结 WorldCompass通过三种创新提升长周期世界模型的交互准确性和视觉保真度。

Comments Project page: \url{https://3d-models.hunyuan.tencent.com/world/}

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10911 2026-01-19 cs.LG 79%

Realistic Curriculum Reinforcement Learning for Autonomous and Sustainable Marine Vessel Navigation

现实课程强化学习用于自主可持续海洋船舶导航

Zhang Xiaocai, Xiao Zhe, Liang Maohan, Liu Tao, Li Haijiang, Zhang Wenbin

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.LG

AI总结 本文提出基于现实课程强化学习的框架,结合数据驱动的海洋模拟和机器学习预测模块,以实现自主且可持续的船舶导航。

Comments Present in The 40th Annual AAAI Conference on Artificial Intelligence (AAAI-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20902 2025-12-25 cs.NI cs.AI 79%

Embodied AI-Enhanced IoMT Edge Computing: UAV Trajectory Optimization and Task Offloading with Mobility Prediction

具身AI增强的IoMT边缘计算:基于移动预测的无人机轨迹优化与任务卸载

Siqi Mu, Shuo Wen, Yang Lu, Ruihong Jiang, Bo Ai

机构 * School of Sports Engineering, Beijing Sport University(体育工程学院,北京体育大学) School of Computer and Information Technology, Beijing Jiaotong University(计算机与信息学院,北京交通大学) State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学) School of Electronics and Information Engineering, Beijing Jiaotong University(电子与信息工程学院,北京交通大学)

专题命中 模仿学习与强化学习 :embodied AI(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于移动预测的无人机轨迹优化与任务卸载方法,利用具身AI增强的IoMT边缘计算框架,通过分层多尺度Transformer模型和预测增强型DRL算法,实现对WBAN用户任务的关键性优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22685 2025-12-22 cs.RO 79%

Deadlock-Free Hybrid RL-MAPF Framework for Zero-Shot Multi-Robot Navigation

无死锁的混合式RL-MAPF框架用于零样本多机器人导航

Haoyi Wang, Licheng Luo, Yiannis Kantaros, Bruno Sinopoli, Mingyu Cai

机构 * Department of Mechanical Engineering University of California Riverside CA USA(加州大学河滨分校机械工程系) Department of Electrical and Systems Engineering Washington University in St. Louis MO USA(华盛顿大学圣路易斯分校电气与系统工程系)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出一种无死锁的混合RL-MAPF框架,通过整合反应性RL导航与按需MAPF干预,实现零样本多机器人导航的鲁棒性能。

Comments 18 pages (including appendix), 3 figures. Project page (videos, animations, additional resources): https://wanghaoyi518.github.io/rl-mapf-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02631 2025-12-03 cs.LG 79%

SeeNav-Agent: Enhancing Vision-Language Navigation with Visual Prompt and Step-Level Policy Optimization

SeeNav-Agent: 通过视觉提示和分步策略优化增强视觉语言导航

Zhengcheng Wang, Zichuan Lin, Yijun Yang, Haobo Fu, Deheng Ye

机构 * Tencent AI Lab(腾讯AI实验室)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.LG

AI总结 SeeNav-Agent通过视觉提示和分步策略优化提升视觉语言导航性能,实验显示其在导航成功率上优于现有模型。

Comments 12 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01383 2025-12-02 cs.CV 79%

PointNet4D: A Lightweight 4D Point Cloud Video Backbone for Online and Offline Perception in Robotic Applications

PointNet4D: 一种轻量级的4D点云视频主干网络,用于机器人应用中的在线和离线感知

Yunze Liu, Zifan Wang, Peiran Wu, Jiayang Ao

机构 * Tsinghua University(清华大学) University of Bristol(布里斯托大学) The University of Melbourne(墨尔本大学)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.CV

AI总结 PointNet4D是一种轻量级4D点云视频主干网络,通过混合Mamba-Transformer时间融合模块和4DMAP预训练策略,提升机器人应用中的在线和离线感知性能。

Comments Accepted by WACV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00427 2025-12-02 cs.RO physics.optics 79%

Hardware-Software Collaborative Computing of Photonic Spiking Reinforcement Learning for Robotic Continuous Control

光子脉冲强化学习的软硬件协同计算用于机器人连续控制

Mengting Yu, Shuiying Xiang, Changjian Xie, Yonghang Chen, Haowen Zhao, Xingxing Guo, Yahui Zhang, Yanan Han, Yue Hao

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出基于光子脉冲RL的软硬件协同计算架构,通过硅光子芯片与电子域结合,实现机器人连续控制的高效能效和低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25679 2025-10-30 cs.AI physics.flu-dyn 79%

Navigation in a Three-Dimensional Urban Flow using Deep Reinforcement Learning

Federica Tonti, Ricardo Vinuesa

机构 * Department of Aerospace Engineering, University of Michigan(航空航天工程系,密歇根大学) FLOW, Engineering Mechanics, KTH Royal Institute of Technology(FLOW,工程力学,皇家理工学院)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25668 2025-10-30 cs.AI cs.MM 79%

ALDEN: Reinforcement Learning for Active Navigation and Evidence Gathering in Long Documents

Tianyu Yang, Terry Ruas, Yijun Tian, Jan Philip Wahle, Daniel Kurzawe, Bela Gipp

机构 * University of Göttingen(戈丁根大学) University of Notre Dame(诺特大学) State and University Library of Göttingen(戈丁根州立大学图书馆)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05525 2025-10-28 cs.LG physics.flu-dyn 79%

A critical assessment of reinforcement learning methods for microswimmer navigation in complex flows

Selim Mecanna, Aurore Loisy, Christophe Eloy

机构 * Aix Marseille Univ, CNRS, Centrale Med, IRPHE(艾克斯-马赛大学、国家科学研究中心、中央医学学院、IRPHE)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.LG

Journal ref Eur. Phys. J. E 48, 58 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15047 2025-10-20 cs.LG cs.CL 79%

Internalizing World Models via Self-Play Finetuning for Agentic RL

Shiqi Chen, Tongyao Zhu, Zian Wang, Jinghan Zhang, Kangrui Wang, Siyang Gao, Teng Xiao, Yee Whye Teh, Junxian He, Manling Li

机构 * City University of Hong Kong(香港城市大学) Northwestern University(西北大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Oxford University(牛津大学) Allen Institute for AI (AI2)(人工智能研究所) University of Washington(华盛顿大学) National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏