arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 197 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 197 篇

2606.13679 2026-06-15 cs.CV 新提交 57%

InterleaveThinker: Reinforcing Agentic Interleaved Generation

InterleaveThinker: 强化智能体交错生成

Dian Zheng, Harry Lee, Manyuan Zhang, Kaituo Feng, Zoey Guo, Ray Zhang, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) Meituan(美团) CUHK IMIXR(香港中文大学IMIXR实验室)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV

AI总结 提出首个多智能体管线InterleaveThinker,通过规划器和评论家智能体使现有图像生成器具备交错生成能力,并利用GRPO强化单步指令修正,显著提升生成性能。

Comments Project Page: https://zhengdian1.github.io/InterleaveThinker-proj/ Code: https://github.com/zhengdian1/InterleaveThinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09009 2026-06-09 cs.CV 新提交 57%

Scaling by Diversified Experience for Vision-Language-Action Models

通过多样化经验扩展视觉-语言-动作模型

Leiyu Wang, Zhaofengnian Wang, Xueqi Li, Luoyi Fan, Cewu Lu, Nanyang Ye

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.CV

AI总结 提出SyVLA模型,通过意图解耦算法和相似样本引导的强化学习管道,解决视觉-语言-动作模型在推理与控制耦合及策略优化不稳定问题,在真实机器人任务中取得更高成功率和泛化能力。

Comments ICML 2026, SyVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08312 2026-06-09 cs.AI cs.FL 新提交 57%

Neuro-Symbolic Injection of LTLf Constraints in Autoregressive Reinforcement Learning Policies

自回归强化学习策略中LTLf约束的神经符号注入

Ashkan Ansarifard, Matteo Mancanelli, Elena Umili, Fabio Patrizi

机构 * Sapienza University of Rome(罗马大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 提出神经符号框架,将LTLf约束编译为DFA并通过可微损失注入Transformer策略,在导航任务中提升约束满足且保持回报竞争力。

Comments Accepted at the Joint Workshop on Statistics and Knowledge Integration for Logic, Learning, Ethical Decisions, and LLMs (SKILLED-LLMs 2026), co-located with KR 2026 and FLoC 2026, Lisbon, Portugal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08154 2026-06-09 cs.RO 新提交 57%

SynthICL: Scalable In-context Imitation Learning with Synthetic Data

SynthICL: 基于合成数据的可扩展上下文模仿学习

Cheng Qian, Ruomeng Fan, Yifei Ren, Yilong Wang, Edward Johns

机构 * The Robot Learning Lab(机器人学习实验室) Imperial College London(伦敦帝国理工学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 提出SynthICL框架,利用纯RGB合成数据训练上下文模仿学习策略,避免深度传感和真实数据,通过子目标预测提升控制精度,在16个真实操作任务中平均成功率79%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08104 2026-06-09 cs.RO 新提交 57%

Reinforcement learning in linear embedding space unlocks generalizable control across soft robot configurations

线性嵌入空间中的强化学习解锁软体机器人配置的通用控制

Xinglong Zhang, Cong Li, Hangjie Mo, Yue Jiang, Xin Xu, Wei Jiang, Zhenshan Bing, Yihe Yang, Xiaojian Li, Yueneng Yang, Huimin Lu, Ling-li Zeng, Alois Knoll, Dewen Hu, Li Wen, Wei Pan

机构 * National University of Defense Technology(国防科技大学) Hefei University of Technology(合肥工业大学) Nanjing University (Suzhou Campus)(南京大学(苏州校区)) Technical University of Munich(慕尼黑工业大学) Beihang University(北京航空航天大学) Newcastle University(纽卡斯尔大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 提出基于共享线性Koopman嵌入空间的强化学习框架,将控制策略与机器人形态解耦,实现跨33种软体机器人配置的快速迁移,样本量减少75倍,并支持高速运动、重载和多执行器故障下的鲁棒控制。

Comments An updated version of this paper has been accepted by Nature Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08064 2026-06-09 cs.RO 新提交 57%

Cooperative Long Rope Skipping via Multi-Agent Reinforcement Learning

基于多智能体强化学习的协作长绳跳绳

Zihao Wang, Shijie Peng, Kerui Wu, Yu Huang, Ruiqi Xue, Dong Liu, Tian Xu, Lei Yuan, Yang Yu

机构 * National Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Beijing Academy of Artificial Intelligence, BAAI(北京智源人工智能研究院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 提出Marope框架,采用分层强化学习实现多个人形机器人的协作长绳跳绳,通过多智能体强化学习训练分散的摇绳策略,上层调度策略协调执行,并融入多样跳跃策略提升泛化能力,在仿真和真实实验中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13579 2026-07-16 cs.RO cs.AI cs.LG 新提交 56%

Agile perceptive multi-skill locomotion for quadrupedal robots in the wild

野外四足机器人的敏捷感知多技能运动

Jun-Gill Kang, Jaehyun Park, Tae-Gyu Song, Joon-Ha Kim, Seungwoo Hong, Hae-Won Park

机构 * Agency for Defense Development(国防发展局) Korea Advanced Institute of Science and Technology(韩国科学技术院) DIDEN Robotics(迪登机器人公司) Korea University(韩国大学)

专题命中 模仿学习与强化学习 :分类 cs.RO、cs.AI、cs.LG;robotics(comments)

AI总结 研究使四足机器人在复杂地形实现多技能运动的问题,提出 APT-RL 框架,利用机载感知和计算自主转换技能,通过轨迹优化生成数据集训练技能,经实验验证该框架能让机器人在复杂环境敏捷机动,稳健穿越多样障碍物。

Comments Project page: https://skillquadsr.github.io/ ,This is the author's version of the work. It is posted here by permission of the AAAS for personal use, not for redistribution. The definitive version was published in Science Robotics on 7.15.2026; doi: 10.1126/scirobotics.adz7397. Jun-Gill Kang and Jaehyun Park are co-first authors. Seungwoo Hong and Hae-Won Park are co-corresponding authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26697 2026-07-30 physics.acc-ph 新提交 50%

Reinforcement Learning applied to Optimization of LHC beams in the CERN Proton Synchrotron

强化学习在欧洲核子中心质子同步加速器(CERN PS)LHC束流优化中的应用

Joel Axel Wulff, Alexandre Lasheen

专题命中 模仿学习与强化学习 :manipulation(abstract)

AI总结 本研究将卷积神经网络与Soft-Actor-Critic强化学习智能体结合,实现CERN PS纵向三重分裂的自动化优化,其2025年部署的自主控制器为CERN注入器复合体首批强化学习束流质量优化系统之一。

Comments 15 pages, 14 figures, pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22541 2026-07-28 math.OC cs.NA math.NA math.PR 新提交 50%

SDE Guided Monte Carlo Reinforcement Learning: A Stochastic Maximum Principle Approach for Robust Decision Making in Noisy Environments

随机微分方程引导的蒙特卡罗强化学习:一种用于噪声环境中稳健决策的随机最大值原理方法

Juncai Wang

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 研究探讨SMP定性最优条件能否指导稳健表格型强化学习算法,提出SDE-MC-AC框架,通过建立对应关系及自适应温度调度整合多种方法,经实验验证了相关假设,揭示导航模式,为随机最优控制与强化学习搭建桥梁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18481 2026-07-22 cs.CL cs.IR 新提交 50%

Search-on-Graph-R1: Training Large Language Models to Search Knowledge Graphs with Reinforcement Learning

搜索图-R1:使用强化学习训练大型语言模型以搜索知识图谱

Jia Ao Sun, Hao Yu, Fengran Mo, Zhan Su, Yuchen Hui, Bang Liu, Jian-Yun Nie

机构 * Université de Montréal(蒙特利尔大学) Mila – Québec AI Institute(米拉-魁北克人工智能研究所) McGill University(麦吉尔大学) Halmstad University College(哈尔姆斯塔德大学学院)

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 研究针对知识图谱问答部署成本高的问题,提出搜索图-R1,通过监督微调与强化学习,将导航内化到8B模型。核心是用黄金SPARQL查询搭建教师遍历答案路径。该模型在多个数据集上超越前沿语言模型,推理无需辅助模块,训练无需语言模型评判,且训练阶段互补,可跨模型家族迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17635 2026-07-21 eess.SY cs.SY 新提交 50%

On Optimal Event-Triggered Distributed Control for Stochastic Multi-Agent Systems via Reinforcement Learning

基于强化学习的随机多智能体系统最优事件触发分布式控制

Ziming Wang, Bingbing Li, Karl H. Johansson, Apostolos I. Rikos

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 针对含随机不确定性的多智能体系统,提出基于强化学习的最优分布式控制算法,采用 actor-critic-identifier 结构,用低通滤波器和混合事件触发控制策略,经稳定性证明,在仿真中验证正确性并与非最优算法比较突出优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10830 2026-07-14 cs.CR 新提交 50%

Automated Stealthy Wear-Out Attack on Digital Twins With Deep Reinforcement Learning

基于深度强化学习的数字孪生自动隐身磨损攻击

Joshua Haworth, Aryan Pasikhani, George Pavlides, Prosanta Gope, John Clark

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 研究利用深度强化学习对数字孪生进行隐身磨损攻击,通过操纵控制信号加速特定关节磨损并躲避检测。测试多种算法发现SAC性能最佳,在工业环境中用UR10e机器人手臂评估,证明攻击有效,强调了该攻击对数字孪生环境的风险及防御需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02533 2026-07-07 eess.SP cs.SY eess.SY 新提交 50%

Centralized PPO-Based DRL for Multi-UAV-BS Positioning and Trajectory Optimization in Disaster Response Networks

基于集中式近端策略优化的深度强化学习用于灾害响应网络中的多无人机基站定位与轨迹优化

Azim Akhtarshenas, Mario Rico Ibanez, Matteo Bernabe, David Lopez-Perez, Merouane Debbah

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 针对灾害场景中多无人机基站定位与轨迹优化问题,扩展集中学习框架,将其建模为马尔可夫决策过程,用近端策略优化的深度强化学习求解,能协调多无人机基站并适应异构用户移动模式。

Comments Submitted to IEEE Transactions on Machine Learning in Communications and Networking (TMLCN). Dataset available at https://doi.org/10.5281/zenodo.20720697 and code available at https://github.com/aakhtarshenas/centralized-ppo-multi-uav-bs

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02171 2026-07-03 cond-mat.stat-mech cond-mat.soft 新提交 50%

Theory of collective learning in populations of adaptive agents

自适应智能体群体中的集体学习理论

Gerhard Jung, Johann Asnacios, Misaki Ozawa, Olivier Dauchot, Eric Bertin

专题命中 模仿学习与强化学习 :robotics(abstract)

AI总结 通过扩展动力学理论,研究同质活性智能体群体通过交换策略和记忆进行分散式学习以实现宏观目标的过程,推导出策略分布的演化方程,并揭示有效奖励函数的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31372 2026-07-01 cs.SE 新提交 50%

Failure-Based Testing for Deep Reinforcement Learning Agents

基于失败的深度强化学习智能体测试方法

Weibin Lin, Jiangtao Meng, Zheng Zheng

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 针对深度强化学习智能体测试中奖励信号失效的问题,提出一种基于任务失败洞察的黑盒测试方法PRT,通过优先测试高难度任务来提升故障检测效率,在四个基准上测试成本降低超50%。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13891 2026-06-15 eess.SY cs.SY 新提交 50%

TetraRL: A Self-Adaptive Runtime for On-Device Deep Reinforcement Learning Systems

TetraRL:面向设备上深度强化学习系统的自适应运行时

Zexin Li, Soheil Shirvani, Cong Liu

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 提出TetraRL框架,通过偏好条件强化学习控制器动态平衡实时性、任务奖励、内存和能耗四个目标,实现资源受限设备上DRL的自适应优化。

Comments Extension version of RTSS'23 and RTSS'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13834 2026-06-15 cs.PF cs.DC cs.SY eess.SY 新提交 50%

Solving Subgraph Extraction Problems Using $Δ$Search

使用$\Delta$Search解决子图提取问题

Rebin Silva Valan Arasu, Rajiv Gupta

专题命中 模仿学习与强化学习 :robotics(abstract)

AI总结 提出通用启发式框架$\Delta$Search,基于奖励-惩罚优化解决一类子图提取问题,仅需用户提供可行性约束和最优性标准,可加速精确方法,在多个图问题上匹配或超越现有启发式算法。

Comments 23 pages, 13 figures, 10 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏