arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-26 至 2026-05-26 共收录 9 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 9 篇

2605.15971 2026-05-26 cs.RO 79%

OHP-RL: Online Human Preference as Guidance in Reinforcement Learning for Robot Manipulation

OHP-RL:在线人类偏好作为机器人操作强化学习中的指导

Yunyang Mo, Jian Li, Qiwei Wu, Yihang Kang, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO

AI总结 提出OHP-RL框架,利用人类干预作为偏好信息,通过状态依赖偏好门自适应调节策略学习,在Franka机器人接触丰富的操作任务中实现高成功率、快速收敛和低人类干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09179 2026-05-26 cs.AI 79%

Hide-and-Shill: A Reinforcement Learning Framework for Market Manipulation Detection in Symphony-a Decentralized Multi-Agent System

Hide-and-Shill:面向交响乐系统中市场操纵检测的强化学习框架——一个去中心化多智能体系统

Ronghua Shi, Yiou Liu, Yuchun Feng, Lynn Ai, Bill Shi, Zhuang Liu

机构 * Department of Information Systems, City University of Hong Kong(香港城市大学信息系统系) Business School, University of New South Wales(新南威尔士大学商学院) Division of Engineering Science, University of Toronto(多伦多大学工程科学系) ProphetAI Data Technology Co., Ltd.(ProphetAI数据技术有限公司) Gradient, 3 FRASER STREET DUO TOWER, SINGAPORE(Gradient新加坡办公室)

专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.AI

AI总结 提出一个多智能体强化学习框架,通过动态对抗博弈建模操纵者与检测者的交互,利用延迟代币价格反应识别可疑模式,并集成GRPO、理论奖励函数和多模态智能体管道,在去中心化交响乐系统中实现无需中心化预言机的鲁棒操纵检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25414 2026-05-26 cs.RO 74%

How to Mitigate the Distribution Shift Problem in Robotics Control: A Robust and Adaptive Approach Based on Offline to Online Imitation Learning

如何缓解机器人控制中的分布偏移问题:一种基于离线到在线模仿学习的鲁棒自适应方法

Hyung-Suk Yoon, Seung-Woo Seo

机构 * Department of Electronic and Computer Engineering, Seoul National University, Seoul, South Korea(电子与计算机工程系,首尔国立大学,首尔,韩国)

专题命中 模仿学习与强化学习 :robotics(title);分类 cs.RO

AI总结 提出一种鲁棒离线到自适应在线模仿学习框架,通过离线阶段利用判别器扩展状态-动作覆盖和在线阶段自监督模仿学习,缓解分布偏移问题。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04054 2026-05-26 eess.SY cs.SY 71%

Necessary and Sufficient Conditions for the Optimization-Based Concurrent Execution of Learned Robotic Tasks

基于优化的学习型机器人任务并发执行的充分必要条件

Sheikh A. Tahmid, Gennaro Notomista

专题命中 模仿学习与强化学习 :robotic(title)

AI总结 本文提出定理,给出在状态空间子集内使用最小范数控制器并发执行一组学习任务(通过强化学习学习的值函数编码)的充分必要条件,并扩展框架以处理折扣因子训练的值函数。

Comments To be presented at ACC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25584 2026-05-26 cs.RO cs.AI 62%

Acting on the Unseen: Communication-Free Collaborative Filtering for Decentralized Multi-Robot Task Allocation

作用于未知:面向分散式多机器人任务分配的无通信协同过滤

Alexander Apartsin, Yigal Meshulam, Yehudit Aperstein

机构 * Holon Institute of Technology(霍洛技术学院) Afeka Tel Aviv Academic College of Engineering(阿法卡特拉维夫工程学院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 针对零知识多机器人任务分配问题,提出基于在线低秩协同过滤的SwarmCF方法,无需通信、先验知识或协调者,实现每个机器人在未见任务上的有效行动,并证明其样本复杂度优势。

Comments 27 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25424 2026-05-26 cs.LG cs.AI 62%

SeqRoute: Global Budget-Aware Sequential LLM Routing via Offline Reinforcement Learning

SeqRoute: 通过离线强化学习实现全局预算感知的顺序LLM路由

Zhongling Xu, Shunan Zheng, Wei Wang

机构 * Department of Operations Research and Industrial Engineering(运筹学与工业工程系)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 提出SeqRoute框架,将多轮LLM路由建模为有限时域马尔可夫决策过程,通过离线强化学习(CQL)和事后预算重标记(HBR)学习延迟满足,在全局预算约束下优化成本与质量,降低破产率至1%以下。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22894 2026-05-26 cs.GR cs.LG cs.RO 62%

SCRIPT: Scalable Diffusion Policy with Multi-stage Training for Language-driven Physics-based Humanoid Control

SCRIPT: 面向语言驱动的物理仿真人体控制的可扩展扩散策略与多阶段训练

Jingyan Zhang, Han Liang, Ruichi Zhang, Bin Li, Juze Zhang, Xin Chen, Jingya Wang, Lan Xu, Jingyi Yu

机构 * ShanghaiTech University(上海科技大学) University of Pennsylvania(宾夕法尼亚大学) Stanford University(斯坦福大学)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.RO、cs.LG

AI总结 提出SCRIPT框架,通过联合动作-状态-文本扩散Transformer和多阶段训练(监督模仿预训练+混合奖励强化学习后训练),实现语言指令驱动的物理仿真人体控制,在文本对齐、运动质量和物理真实性上超越现有方法。

Comments Project page: https://zhanglele12138.github.io/SCRIPT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08558 2026-05-26 cs.AI cs.CL cs.IR cs.LG 62%

Agent Learning via Early Experience

通过早期经验进行智能体学习

Kai Zhang, Xiangchao Chen, Bo Liu, Tianci Xue, Zeyi Liao, Zhihan Liu, Xiyao Wang, Yuting Ning, Zhaorun Chen, Xiaohan Fu, Jian Xie, Yuxuan Sun, Boyu Gou, Qi Qi, Zihang Meng, Jianwei Yang, Ning Zhang, Xian Li, Ashish Shah, Dat Huynh, Hengduo Li, Zi Yang, Sara Cao, Lawrence Jang, Shuyan Zhou, Jiacheng Zhu, Huan Sun, Jason Weston, Yu Su, Yifan Wu

机构 * Meta Superintelligence Labs(Meta超智能实验室) FAIR at Meta(Meta的FAIR部门) The Ohio State University(俄亥俄州立大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI、cs.LG

AI总结 提出早期经验范式,利用智能体自身动作生成的交互数据(无需奖励信号)通过隐式世界建模和自我反思两种策略提升智能体在多样化环境中的效果和跨域泛化能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24436 2026-05-26 cs.MA cs.LG cs.RO 62%

A Reinforcement Learning Inspired Latent Yield Based Adaptive Algorithm Switching Mechanism

一种受强化学习启发的基于潜在收益的自适应算法切换机制

Jayprakash S. Nair, Jimson Mathew, Shivashankar B. Nair

机构 * Indian Institute of Technology Patna(印度理工学院帕纳布分校) Indian Institute of Technology Guwahati(印度理工学院古瓦哈提分校)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 针对在线或动态环境中算法选择困难的问题,提出一种受强化学习启发的潜在收益方法,通过封装奖励和惩罚触发探索与利用,实现自适应算法切换,并在排序算法和机器人避障任务中验证了有效性。

Comments Accepted and published in the Proceedings of the 29th European Conference on Applications of Evolutionary Computation (EvoApplications 2026), held as part of EvoStar 2026, Toulouse, France, April 8 to 10, 2026. Lecture Notes in Computer Science (LNCS), Springer Nature Switzerland

Journal ref Applications of Evolutionary Computation, EvoApplications 2026, LNCS, Springer Nature Switzerland, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏