arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-03 至 2026-07-03 共收录 10 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 10 篇

2607.02431 2026-07-03 cs.RO cs.AI 新提交 84%

WorldSample: Closed-loop Real-robot RL with World Modelling

WorldSample:基于世界建模的闭环真实机器人强化学习

Yuquan Xue, Le Xu, Zeyi Liu, Zhenyu Wu, Zhengyi Gu, Xinyang Song, Bofang Jia, Ziwei Wang

机构 * PINE Lab, School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电气与电子工程学院PINE实验室) Department of Electronic Engineering, Tsinghua University, Beijing, China(清华大学电子工程系) School of Automation, Central South University, Changsha, China(中南大学自动化学院) School of Automation, Beijing University of Posts and Telecommunications, Beijing, China(北京邮电大学自动化学院)

专题命中 模仿学习与强化学习 :world model(title,abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出WorldSample框架,通过物理 rollout、世界模型生成与策略改进的闭环,结合策略节奏学习(PPL)调节训练,在接触性精密操作任务中成功率提升28%,训练步数减少59%。

Comments 16 pages, 9 figures, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01925 2026-07-03 cs.RO 新提交 79%

SPLC: Social Preference Learning for Crowd Robot Navigation

SPLC:面向人群机器人导航的社会偏好学习

Zixuan Chen, Hao Fu, Haiwen Hu, Shiquan Zheng

机构 * Wuhan University of Science and Technology(武汉科技大学) Hubei Province Key Laboratory of Intelligent Information Processing and Real-time Industrial System(湖北省智能信息处理与实时工业系统重点实验室)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO

AI总结 提出SPLC算法,通过社会偏好反馈机制自动生成偏好数据,消除详细奖励设计需求,提升离线强化学习在人群导航中的社会合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01651 2026-07-03 cs.RO 新提交 79%

One Demonstration Is Enough for Real-World Robotic Reinforcement Learning

一个演示足以实现真实世界机器人强化学习

Yuwan Liu, Hongze Yu, Song Liu, Yuhan Wang, Junge Zhang, Yaodong Yang, Yuanpei Chen, Ceyao Zhang

机构 * National Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institution of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能国家重点实验室) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) PKU-PsiBot Joint Lab(北大-鹏城实验室联合实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 模仿学习与强化学习 :robotic(title);manipulation(abstract);分类 cs.RO

AI总结 提出AutoSERL框架,仅需一个演示即可自动化真实世界机器人强化学习,通过滑动窗口干预、安全恢复和自动终止机制,在六个接触密集型任务上超越基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02390 2026-07-03 cs.LG 新提交 70%

DecompRL: Solving Harder Problems by Learning Modular Code Generation

DecompRL: 通过学习模块化代码生成解决更难的问题

Juliette Decugis, Fabian Gloeckle, Francis Bach, Taco Cohen, Gabriel Synnaeve

机构 * FAIR at Meta Inria, \'Ecole Normale Sup\'erieure

专题命中 模仿学习与强化学习 :world model(abstract,abstract_cn);分类 cs.LG

AI总结 提出DecompRL算法,通过强化学习将问题分解为可复用的子函数,重组模块生成候选解,将GPU瓶颈转移至CPU评估,在LiveCodeBench和CodeContests上超越标准RL基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01721 2026-07-03 cs.RO 新提交 70%

CoRe: Combined Rewards with Vision-Language Model Feedback for Preference-Aligned Reinforcement Learning

CoRe: 结合视觉语言模型反馈的复合奖励用于偏好对齐强化学习

Hexian Ni, Tao Lu, Yinghao Cai

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出CoRe框架,将奖励分解为基于任务知识的正式奖励和从观察中学习的残差奖励,利用视觉语言模型迭代优化奖励,实现无需人工的偏好对齐,在机器人操作任务中优于现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02073 2026-07-03 cs.AI cs.LG 新提交 62%

Evidence-State Rewards for Long-Context Reasoning

证据状态奖励用于长上下文推理

Ya Gao, Pekka Marttinen

机构 * Aalto University(阿alto大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 提出Maven框架,通过可编辑证据记忆和动作级状态转移奖励,优化长上下文推理中的证据导航,优于仅结果强化学习和证据识别基线。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21718 2026-07-03 cs.LG cs.AI 版本更新 62%

When Does Predictive Inverse Dynamics Outperform Behavior Cloning?

何时预测性逆动力学优于行为克隆?

Lukas Schäfer, Pallavi Choudhury, Abdelhak Lemkhenter, Chris Lovett, Somjit Nath, Luis França, Matheus Ribeiro Furtado de Mendonça, Alex Lamb, Riashat Islam, Siddhartha Sen, John Langford, Katja Hofmann, Sergio Valcarcel Macua

机构 * University of Cambridge(剑桥大学) Universitygrow

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文通过理论分析解释了预测性逆动力学模型(PIDM)为何在行为克隆(BC)失败时表现更优,归因于偏差-方差权衡,并实验验证了PIDM在样本效率上的显著优势。

Comments To be published in proceedings of the International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02490 2026-07-03 cs.CL cs.CV 新提交 57%

Visually Grounded Self-Reflection for Vision-Language Models via Reinforcement Learning

基于强化学习的视觉语言模型视觉接地自反思

Liyan Tang, Fangcong Yin, Greg Durrett

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) New York University(纽约大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.CV

AI总结 提出VRRL框架,通过随机掩码轨迹前缀和缓冲回滚机制,增强视觉语言模型在分布外场景下的视觉接地自反思能力,显著提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00483 2026-07-03 cs.RO 新提交 57%

VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning

VLM-AR3L:用于强化学习中绝对和相对奖励的视觉-语言模型

Kuan-Chen Chen, Winston Chen, Wei-Fang Sun, Min-Chun Hu

机构 * National Tsing Hua University(国立清华大学) NVIDIA AI Technology Center (NVAITC)(英伟达AI技术中心)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 提出VLM-AR3L框架,利用视觉-语言模型从偏好标签中学习绝对和相对奖励,结合状态评估与比较监督,在多种基准任务中优于先前方法。

Comments Accepted at IJCAI 2026. Project website: https://vlm-ar3l.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02171 2026-07-03 cond-mat.stat-mech cond-mat.soft 新提交 50%

Theory of collective learning in populations of adaptive agents

自适应智能体群体中的集体学习理论

Gerhard Jung, Johann Asnacios, Misaki Ozawa, Olivier Dauchot, Eric Bertin

专题命中 模仿学习与强化学习 :robotics(abstract)

AI总结 通过扩展动力学理论,研究同质活性智能体群体通过交换策略和记忆进行分散式学习以实现宏观目标的过程,推导出策略分布的演化方程,并揭示有效奖励函数的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏