arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-14 至 2026-07-14 共收录 8 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 8 篇

2607.10991 2026-07-14 cs.RO cs.AI cs.CV 新提交 82%

Think When It Matters: Conditional VLM Reasoning for Social Navigation with RL Policies

在重要时刻思考:用于社交导航的基于RL策略的条件VLM推理

Ali Ahmadi, Hamed Rahimi, Adrien Jacquet Cretides, Marie Samson, Mahdi Khoramshahi, Mohamed Chetouani

机构 * Institut des Systèmes Intelligents et de Robotique (ISIR)(智能系统与机器人研究所)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 研究社交机器人导航中强化学习策略缺乏语义推理能力的问题,提出HUMA混合架构,动态平衡RL策略与VLM的优势。在基准测试中任务成功率提高,减少碰撞,消融研究验证组件,实际部署证明方法可行。

Comments CoRL 2026 submission. 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10369 2026-07-14 cs.RO cs.AI 新提交 79%

VINE: Taming Generative Control Policies for Reinforcement Learning

VINE:驯服强化学习中的生成控制策略

Rushuai Yang, Zhuo Han, Houlin Li, Hecheng Wang, Zhichao Wu, Rui Zhang, Zhaowei Zhang, Zihong Chen, Xiaohan Yan, Chiming Liu, Yi Chen, Wei Shan, Maoqing Yao

机构 * AgiBot(未知机构) The Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学)

专题命中 模仿学习与强化学习 :robot learning(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 研究针对流匹配策略在值梯度强化学习中训练不稳定的问题,提出VINE方法。该方法通过在去噪步骤重建插值状态,创建稳定可微路径,实现稳定的端到端值梯度优化,在相关基准和任务中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09866 2026-07-14 cs.RO cs.AI 新提交 73%

Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning

Robo-ValueRL:离线到在线强化学习的可靠价值估计

Wenke Xia, Pei Ren, Wenbo Yu, Yizhuo Zhang, Jifan Li, Yixue Zhang, Yinuo Zhao, Qingyang Gao, Jianlong Fu, Jian Tang, Ji-Rong Wen, Zhengping Che, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) Beijing Forestry University(北京林业大学) Peking University(北京大学) Microsoft Research(微软研究院)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 研究离线到在线强化学习中价值函数可靠性对策略优化的影响,提出Robo-ValueRL框架,通过特定指标评估价值估计可靠性并用于策略预训练和在线改进,实验显示其能有效提升下游策略性能,突出价值引导数据利用对策略改进的重要性。

Comments Please refer to our website: https://gewu-lab.github.io/Robo-ValueRL/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11653 2026-07-14 cs.LG cs.RO 版本更新 62%

Simple Recipe Works: Vision-Language-Action Models are Natural Continual Learners with Reinforcement Learning

简单配方有效:视觉-语言-动作模型通过强化学习成为自然持续学习者

Jiaheng Hu, Jay Shim, Chen Tang, Yoonchang Sung, Bo Liu, Peter Stone, Roberto Martin-Martin

机构 * University of Southern California(南加州大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.RO、cs.LG

AI总结 本文通过系统研究发现,对于大型预训练视觉-语言-动作模型,简单的顺序微调结合低秩适配在持续强化学习中表现出高可塑性、几乎无遗忘和强零样本泛化,优于复杂方法。

Comments Accepted at RLC 2026; Best paper award at ICRA26 RL4IL Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05559 2026-07-14 cs.LG cs.ET math.PR physics.optics 版本更新 57%

Autocorrelation effects in a stochastic-process model for solving two-armed bandit problems

在基于时间序列的决策模型中自相关效应的影响

Tomoki Yamagami, Mikio Hasegawa, Takatomo Mihana, Ryoichi Horisaki, Atsushi Uchida

机构 * Department of Information and Computer Sciences, Saitama University(Saitama大学信息与计算机科学系) Department of Electrical Engineering, Tokyo University of Science(东京科学大学电气工程系) Department of Information Physics and Computing, The University of Tokyo(东京大学信息物理与计算系)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本研究通过分析基于时间序列的决策模型,揭示了自相关性质在多臂老虎机问题中的影响,发现环境依赖性及自相关对决策性能的关键作用。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09331 2026-07-14 cs.RO cs.MA 版本更新 57%

CoRL-MPPI: Enhancing MPPI With Learnable Behaviours For Efficient And Provably-Safe Multi-Robot Collision Avoidance

CoRL-MPPI: 通过可学习行为增强MPPI以实现高效且可证明安全的多机器人避障

Stepan Dergachev, Artem Pshenitsyn, Aleksandr Panov, Alexey Skrynnik, Konstantin Yakovlev

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 CoRL-MPPI通过结合协同强化学习与MPPI,提升多机器人避障的效率与安全性。

Comments Comments: 8 pages, 6 figures. Substantially revised version. The manuscript, algorithm description, and figures have been extensively updated. The experimental evaluation has been redesigned with new scenarios, ablation study and an additional car-like motion model

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15353 2026-07-14 stat.AP cs.LG stat.ML 版本更新 57%

Reinforcement Learning in the Real World: A Survey of Statistical Challenges and Future Directions

现实世界中的强化学习:统计挑战与未来方向综述

Asim H. Gazi, Yongyi Guo, Daiqi Gao, Ziping Xu, Kelly W. Zhang, Susan A. Murphy

机构 * Department of Computer Science, Harvard University(哈佛大学计算机科学系) Department of Statistics, University of Wisconsin–Madison(威斯康星大学麦迪逊分校统计学系) Department of Statistics, Harvard University(哈佛大学统计学系) School of Data Science and Society, University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校数据科学与社会学院) Department of Mathematics, Imperial College London(伦敦帝国理工学院数学系)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文综述现实世界强化学习应用,指出其研究与部署存在差距及两大挑战。将应用框架化为三部分过程,回顾应对统计挑战的进展,涵盖在线、离线方法及持续改进设计,还概述受应用启发的未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10830 2026-07-14 cs.CR 新提交 50%

Automated Stealthy Wear-Out Attack on Digital Twins With Deep Reinforcement Learning

基于深度强化学习的数字孪生自动隐身磨损攻击

Joshua Haworth, Aryan Pasikhani, George Pavlides, Prosanta Gope, John Clark

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 研究利用深度强化学习对数字孪生进行隐身磨损攻击,通过操纵控制信号加速特定关节磨损并躲避检测。测试多种算法发现SAC性能最佳,在工业环境中用UR10e机器人手臂评估,证明攻击有效,强调了该攻击对数字孪生环境的风险及防御需求。

详情

展开后加载摘要…

URL PDF HTML 收藏