arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-25 至 2026-06-25 共收录 14 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 14 篇

2606.22027 2026-06-25 cs.RO cs.AI 新提交 81%

RARM: Confidence-Gated Progress Reward Modeling for RL in Manipulation

RARM:基于置信度门控的进展奖励建模用于操作中的强化学习

Pengzhi Yang, Xinyu Wang, Pengyu Jing, Kehan Wen, Yiduo Qu, Zhenhao Huang, Minghao Fu, Xin Liu, Yaheng Shen, Fan Shi

机构 * NUS Human-Centered Robotic Lab(新加坡国立大学人机共融机器人实验室) University of Cambridge(剑桥大学) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 提出参考锚定奖励模型(RARM),通过对比时间目标从通用视频中学习,将单个成功演示转化为密集进展奖励,并在部署时通过置信度门控抑制虚假正奖励,在长时域操作任务中显著提升强化学习成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07945 2026-06-25 cs.RO cs.AI 版本更新 81%

Incremental Residual Reinforcement Learning Toward Real-World Learning for Social Navigation

面向社交导航的真实世界学习的增量残差强化学习

Haruto Nagahisa, Kohei Matsumoto, Yuki Tomita, Yuki Hyodo, Ryo Kurazume

机构 * School of Engineering, Kyushu University(九州大学工学系) Faculty of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电子工学系) School of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电子工学系)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 提出增量残差强化学习(IRRL),结合增量学习与残差强化学习,在无回放缓冲区的情况下实现与基于回放缓冲区方法相当的性能,并通过真实世界实验验证机器人适应新环境的能力。

Comments RO-MAN 2026, video https://youtu.be/NJOhv56CrPM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25754 2026-06-25 cs.RO 新提交 79%

Stage-Aware and Roughness-Constrained Diffusion Policy for Multi-Stage Robotic Polishing

阶段感知与粗糙度约束的扩散策略用于多阶段机器人抛光

Shuai Ke, Jiexin Zhang, Huan Zhao, Zhiao Wei, Yikun Guo, Tiange Wu, Guoqiang Guo, Haoyuan Zhou, Jie Pan, Han Ding

机构 * State Key Laboratory of Intelligent Manufacturing Equipment and Technology, Huazhong University of Science and Technology(华中科技大学智能制造装备与技术国家重点实验室) Shanghai Spaceflight Precision Machinery Institute(上海航天精密机械研究所)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 提出阶段感知与粗糙度约束扩散策略(SRDP),通过多模态观测推断阶段后验并约束去噪过程,实现无外部标签的阶段一致动作生成,提升多阶段抛光质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25360 2026-06-25 cs.RO 新提交 70%

Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning

解耦语义与几何基础:面向语言条件模仿学习的空间视觉提示

Yanzhe Tang, Xinyu Shao, Yuxuan Hu, Siyu Chen, Bowen Yang, Yajun Gao, Tongtong Cao, Xiu Li, Long Zeng

机构 * Tsinghua University(清华大学) Huawei Technologies Co., Ltd.(华为技术有限公司) National University of Singapore(新加坡国立大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出SVP-IL解耦架构,通过视觉语言基础模型将指令解析为零样本几何掩码,生成空间视觉提示并注入连续动作生成器,在低数据条件下显著提升语言条件模仿学习的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25978 2026-06-25 cs.MA cs.AI cs.LG 新提交 62%

Multi-Agent Goal Recognition with Team- and Goal-Conditioned Reinforcement Learning and Factorized Branch-and-Bound

基于团队与目标条件强化学习和因子化分支定界的多智能体目标识别

Thiago Thomas, Gabriel de Oliveira Ramos, Felipe Meneguzzi

机构 * Pontifícia Universidade Católica do Rio Grande do Sul (PUCRS)(里约格兰德杜斯阿伦斯天主教大学) Universidade do Vale do Rio dos Sinos (Unisinos)(里约斯inos大学) University of Aberdeen(阿伯丁大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 提出MAGR-BB方法,利用共享的团队与目标条件策略作为评分模型,结合因子化分支定界搜索,从轨迹中联合推断智能体分组及团队目标,在基准测试中大幅降低假设空间并缩短识别时间。

Comments 12 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25700 2026-06-25 cs.LG cs.RO 新提交 62%

Memory-Efficient Policy Libraries with Low-Rank Adaptation in Reinforcement Learning

基于低秩适配的强化学习内存高效策略库

Samuel Valland Lyngset, Tor Viljen Raanaas, Gard Sveipe, Eirik Møller Nilsen, Jim Torresen, Kai Olav Ellefsen, Tobias Lømo

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 研究将参数高效微调方法(如LoRA)迁移至机器人强化学习,通过PPO算法微调基线模型构建多任务策略库,实现内存占用降低20-160倍,存储节省90-95%,且成功率无显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25337 2026-06-25 cs.RO cs.AI cs.HC 新提交 62%

AI Coaching for Accelerating Human Skill Development with Reinforcement Learning

AI教练:利用强化学习加速人类技能发展

Wei Wang, Enlin Gu, Antonio Loquercio, Haimin Hu, Rahul Mangharam

机构 * University of Pennsylvania(宾夕法尼亚大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 模仿学习与强化学习 :embodied AI(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种基于非合作动态博弈和强化学习的AI教练框架,通过自适应共享控制和因果影响模型加速人类运动技能发展,在无人机竞速用户研究中显著提升学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25127 2026-06-25 cs.LG cs.AI math.OC 新提交 62%

Reward-Conditioned Attention: How Reward Design Shapes What Autonomous Driving Agents See

奖励条件注意力:奖励设计如何塑造自动驾驶代理的感知

Mohamed Benabdelouahad, Ahmed Djalal Hacini, Nadir Farhi, Aissa Boulmerka

机构 * National School of Artificial Intelligence (ENSIA)(国家人工智能学院) Cosys-Grettia, Univ Gustave Eiffel(古斯塔夫·埃菲尔大学Cosys-Grettia实验室)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 研究奖励设计如何影响自动驾驶强化学习代理的内部注意力模式,发现奖励内容直接决定编码器优先关注的场景元素,且连续碰撞时间惩罚会形成学习性警觉先验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24039 2026-06-25 cs.RO cs.LG cs.SY eess.SY math.OC 新提交 62%

TurboMPC: Fast, Scalable, and Differentiable Model Predictive Control on the GPU

TurboMPC:GPU上快速、可扩展且可微分的模型预测控制

Gabriel Bravo-Palacios, Jianghan Zhang, Zachary Pestrikov, Brian Plancher, Thomas Lew

机构 * Dartmouth College(达特茅斯学院) Toyota Research Institute(丰田研究所)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 提出TurboMPC,一种完全运行在GPU上的可微分MPC求解器,通过SQP、ADMM内求解器、隐式微分和JAX-CUDA协同设计,在约束规划、人形模仿学习和强化学习中实现高达15倍和58倍的加速,并在实车最小时间竞赛中通过贝叶斯优化调参显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15373 2026-06-25 eess.SY cs.AI cs.LG cs.SY math.OC nlin.AO 版本更新 62%

Safe Learning Control with Optimality and Stability Guarantees

具有最优性和稳定性保证的安全学习控制

Xinyang Wang, Hongwei Zhang, Shimin Wang, Wei Xiao, Martin Guay

机构 * Shenzhen Key Lab for Advanced Motion Control and Modern Automation Equipments, School of Intelligence Science and Engineering, Harbin Institute of Technology, Shenzhen, Guangdong 518055, China(深圳先进 motion 控制与现代自动化装备重点实验室,智能科学与工程学院,哈尔滨工业大学,深圳,广东 518055,中国) School of Data Science, Lingnan University, Hong Kong(数据科学学院,岭南大学,香港) School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(电气与电子工程学院,南洋理工大学,新加坡) MIT CSAIL

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 针对非线性系统在高相对度状态约束和未知扰动下的强化学习控制,提出高阶倒数型控制障碍函数处理约束,并通过梯度相似性概念和自适应机制在保证安全的同时提升性能。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25527 2026-06-25 cs.LG 新提交 57%

Beyond One-Size-Fits-All: Diagnosis-Driven Online Reinforcement Learning with Offline Priors

超越一刀切:基于诊断的在线强化学习与离线先验知识

Guozheng Ma, Lu Li, Zilin Wang, Pierre-Luc Bacon, Dacheng Tao

机构 * Nanyang Technical University(南洋理工大学) University of Oxford(牛津大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 本文提出诊断驱动的张力管理框架,通过三种功能角色表征离线先验知识如何重塑在线优化,并展示跨领域证据,解决先验知识有效性随部署变化的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24962 2026-06-25 cs.LG 新提交 57%

Towards Scalable Multi-Task Reinforcement Learning with Large Decision Models

迈向可扩展的多任务强化学习与大决策模型

Thibaut Kulak

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 提出LDM-v0,一个在大规模异构强化学习环境上离线预训练的Transformer策略,通过监督下一动作预测实现多任务学习,在约1000个环境中达到与独立训练策略相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24991 2026-06-25 eess.SY cs.LG cs.SY math.OC 新提交 57%

Solving Markov Decision Processes with Future Information via MPC

通过MPC求解具有未来信息的马尔可夫决策过程

Shambhuraj Sawant, Akhil S Anand, Dirk Reinhardt, Sebastien Gros

机构 * Norwegian University of Science and Technology(挪威科学技术大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 本文提出一种参数化模型预测控制(MPC)方法,可精确表示具有未来信息的MDP的最优价值函数和策略,并通过强化学习学习参数,在点质量赛车任务中验证有效性。

Comments 6 pages, accepted to IFAC World Congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05933 2026-06-25 cs.CL cs.AI 版本更新 57%

Reinforcement Learning Improves Traversal of Parametric Knowledge in LLMs

强化学习改善LLM中参数化知识的遍历

Renfei Zhang, Manasa Kaniselvan, Rylan Schaeffer abd Niloofar Mireshghallah

机构 * Carnegie Mellon University(卡内基梅隆大学) MIT(麻省理工学院) Stanford University(斯坦福大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 本文发现强化学习提升LLM知识回忆能力,原因在于改进了模型对参数化知识层次结构的遍历技能,而非获取新知识。

Comments `

详情

展开后加载摘要…

URL PDF HTML 收藏