arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-07 至 2026-07-07 共收录 10 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 10 篇

2607.04265 2026-07-07 cs.RO cs.AI 新提交 73%

HALO-WA: Hybrid-Attention Latent-Guided Online Reinforcement Learning for World-Action Models

HALO-WA:用于世界-动作模型的混合注意力潜在引导在线强化学习

Angen Ye, Weijie Ke, Xiaofeng Wang, Xinze Chen, Chaojun Ni, Guosheng Zhao, Boyuan Wang, Zheng Zhu, Junjie Xie, Dapeng Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) GigaAI(字节跳动公司(推测,根据常见语境)) Tsinghua University(清华大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对世界-动作模型在现实精度任务中易受多种误差影响的问题,提出HALO-WA框架,利用潜在特征和动作先验,通过混合注意力结构实现快速在线适应,提升动作块精度,实验验证效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03723 2026-07-07 cs.RO cs.AI 新提交 62%

OmniTacTune: Policy-Agnostic Real-World RL for Tactile Residual Adaptation of Visual Policies

OmniTacTune:用于视觉策略触觉残余适应的与策略无关的真实世界强化学习

Kelin Yu, Haode Zhang, Harish Ravichandar, Yunhai Han, Ruohan Gao

机构 * University of Maryland, College Park(马里兰大学帕克分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 研究针对视觉策略在接触丰富操作中不足的问题,提出OmniTacTune管道,通过残余校正让触觉反馈适应预训练视觉策略,经两阶段设计,实验证明其能跨任务等泛化,有效提升策略成功率。

Comments Project page: https://colinyu1.github.io/omnitactune-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03177 2026-07-07 cs.SE cs.AI cs.LG 新提交 62%

CRRL: A Causality-Based Reinforcement Learning Framework for Autonomous System Recovery

CRRL:一种用于自主系统恢复的基于因果关系的强化学习框架

Safia Fatima, Kai Olav Ellefsen, Leon Moonen

机构 * Simula Research Laboratory(Simula研究实验室) University of Oslo(奥斯陆大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 研究自主系统恢复中传统强化学习问题,引入基于因果关系的CRRL框架,利用驾驶日志因果关系塑造训练信号,使策略与基于规则的恢复有效协作,提升相关指标。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07403 2026-07-07 cs.CV cs.AI cs.CL cs.LG 版本更新 60%

SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards

空间思考者:通过密集奖励强化场景图基础的空间推理

Hunar Batra, Haoqin Tu, Hardy Chen, Yuanze Lin, Cihang Xie, Ronald Clark

机构 * University of Oxford(牛津大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 模仿学习与强化学习 :分类 cs.AI、cs.CV、cs.LG;embodied AI(comments);world model(comments)

AI总结 研究针对多模态大语言模型空间推理难题,提出SpatialThinker,通过在线强化学习统一场景图生成与视觉推理,构建心理场景图并借助密集奖励推理,贡献包括基于SGG推理、高质量训练数据集及密集奖励设计。

Comments Preprint. Accepted at NeurIPS 2025 Workshops on SPACE in Vision, Language, and Embodied AI (SpaVLE) as Oral, Embodied World Models for Decision Making (EWM), Aligning Reinforcement Learning Experimentalists and Theorists (ARLET), and Scaling Environments for Agents (SEA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05064 2026-07-07 cs.AI 新提交 57%

Diffusion-Guided Uncertainty-Aware Delayed Policy Optimization

扩散引导的不确定性感知延迟策略优化

Junqi Tu, Zejiao Liu, Fangfei Li, Yang Tang

机构 * The Key Laboratory of Smart Manufacturing in Energy Chemical Process, Ministry of Education, East China University of Science and Technology, Shanghai, China(能源化工过程智能制造重点实验室,教育部,东华大学,上海,中国) The School of Mathematics, East China University of Science and Technology, Shanghai, China(东华大学数学学院,上海,中国)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI

AI总结 针对现实环境强化学习因延迟反馈性能严重下降问题,提出DUPO方法。用扩散模型明确延迟状态与当前状态关系,利用差异估计加权延迟策略,实验表明该方法优于现有方法。

Comments Preprint; appendices included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03512 2026-07-07 cs.RO 新提交 57%

High-Precision Formation Control for Heterogeneous Multi-Robot Systems via Hierarchical Hybrid Physics-Informed Deep Reinforcement Learning

基于分层混合物理信息深度强化学习的异构多机器人系统高精度编队控制

Yanzhou Li, Guangli Chen, Xiao-Meng Li, Wenjian Zhong, Yongkang Lu, Shenghuang He

机构 * Dongguan Key Laboratory of Intelligent Equipment and Smart Industry, School of Advanced Engineering, Great Bay University(东莞智能装备与智能产业重点实验室,大湾区大学先进工程学院) Technische Universität Dresden(德累斯顿工业大学) School of Mechanical and Electrical Engineering, Guangzhou University(广州大学机电工程学院) University of Science and Technology of China(中国科学技术大学) College of Computer Science, Dongguan University of Technology(东莞理工学院计算机科学与技术学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 针对异构多机器人系统编队控制问题,提出分层混合物理信息深度强化学习框架。上层用深度强化学习设计领导者导航策略网络,下层整合多种控制器构建编队控制策略网络,设计分层奖励函数训练跟随者,实验验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24633 2026-07-07 cs.RO 新提交 57%

Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation

超越单调进展:面向机器人模仿的重试监督值学习

Xinyao Qin, Junjie Lu, Kaixin Wang, Chuheng Zhang, Sinjae Kang, Kimin Lee, Min Xu, Bin Liang, Jun Yang, Li Zhao

机构 * Tsinghua University(清华大学) University of Technology Sydney(技术科技大学) Microsoft Research Asia(微软亚洲研究院) KAIST(韩国科学技术院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 针对机器人模仿学习中演示数据包含错误与修正行为的问题,提出ReTVL框架,利用重试事件作为稀疏监督学习对错误敏感的值函数,通过全局进度校准与局部偏好学习捕捉错误-恢复结构,优化下游行为克隆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12569 2026-07-07 eess.SP cs.AI 版本更新 57%

Active Sensing with Meta-Reinforcement Learning for Emitter Localization from RF Observations

基于元强化学习的主动感知用于从射频观测定位发射源

M. Shamail J. Khan, Nisha L. Raichur, Lucas Heublein, Christian Wielenberg, Alexander Mattick, Tobias Feigl, Christopher Mutschler, Felix Ott

机构 * Fraunhofer Institute for Integrated Circuits IIS(弗劳恩霍夫集成电路研究所) Positioning Systems Lab, University of Technology Nürnberg (UTN)(定位系统实验室,图恩大学) Center for Artificial Intelligence, Technical University of Applied Sciences Würzburg-Schweinfurt(人工智能中心,应用技术大学魏玛-施魏尔堡)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 本文提出利用元强化学习框架,通过序列探索环境,从射频观测中定位发射源,解决GNSS干扰下的定位问题,实验显示80.1%的成功率。

Comments 6 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11907 2026-07-07 cs.RO 版本更新 57%

A Graph-Based Reinforcement Learning Approach with Frontier Potential Based Reward for Safe Cluttered Environment Exploration

一种基于前沿势奖励的基于图的强化学习方法用于安全杂乱环境探索

Gabriele Calzolari, Vidya Sumathy, Christoforos Kanellakis, George Nikolakopoulos

机构 * Department of Computer Science, Electrical and Space Engineering, Luleå University of Technology(计算机科学、电气与航天工程系,吕勒奥技术大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 提出结合图神经网络探索贪心策略与安全护盾的方法,用近端策略优化算法训练网络,最大化探索效率并减少护盾干预,还提出奖励函数,能在杂乱环境高效安全探索。

Comments 6 pages, 4 figures, accepted at the 24th European Control Conference (ECC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02533 2026-07-07 eess.SP cs.SY eess.SY 新提交 50%

Centralized PPO-Based DRL for Multi-UAV-BS Positioning and Trajectory Optimization in Disaster Response Networks

基于集中式近端策略优化的深度强化学习用于灾害响应网络中的多无人机基站定位与轨迹优化

Azim Akhtarshenas, Mario Rico Ibanez, Matteo Bernabe, David Lopez-Perez, Merouane Debbah

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 针对灾害场景中多无人机基站定位与轨迹优化问题,扩展集中学习框架,将其建模为马尔可夫决策过程,用近端策略优化的深度强化学习求解,能协调多无人机基站并适应异构用户移动模式。

Comments Submitted to IEEE Transactions on Machine Learning in Communications and Networking (TMLCN). Dataset available at https://doi.org/10.5281/zenodo.20720697 and code available at https://github.com/aakhtarshenas/centralized-ppo-multi-uav-bs

详情

展开后加载摘要…

URL PDF HTML 收藏