arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-29 至 2026-04-29 共收录 5 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 5 篇

2207.09845 2026-04-29 cs.RO cs.AI cs.HC cs.LG 82%

Quantifying the Effect of Feedback Frequency in Interactive Reinforcement Learning for Robotic Tasks

量化交互强化学习在机器人任务中的反馈频率效应

Daniel Harnack, Julie Pivin-Bachler, Nicolás Navarro-Guerrero

机构 * Robotics and Interactive Systems – UPSSITECH, University Paul Sabatier(机器人与交互系统——UPSSITECH,保罗·萨巴蒂埃大学)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究探讨了反馈频率对机器人任务中交互强化学习效率的影响,通过不同复杂度的机械臂逆运动学学习实验,发现反馈频率需随任务熟练度动态调整,无单一最优频率。

Comments Neural Computing and Applications (2022). Special Issue on Human-aligned Reinforcement Learning for Autonomous Agents and Robots

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25898 2026-04-29 cs.LG cs.AI 73%

TSN-Affinity: Similarity-Driven Parameter Reuse for Continual Offline Reinforcement Learning

TSN-Affinity:基于相似性的参数复用用于连续离线强化学习

Dominik Żurek, Kamil Faber, Marcin Pietron, Paweł Gajewski, Roberto Corizzo

机构 * AGH University of Krakow(克拉科夫AGH大学) American University(美国美国大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TSN-Affinity方法,通过基于TinySubNetworks和Decision Transformer的策略,实现任务特定参数化和受控知识共享,提升连续离线强化学习中的多任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12193 2026-04-29 cs.RO 70%

Continual Domain Randomization

持续领域随机化

Josip Josifovski, Sayantan Auddy, Mohammadhossein Malmir, Justus Piater, Alois Knoll, Nicolás Navarro-Guerrero

机构 * School of Computation Information and Technology, Technical University of Munich(技术大学慕尼黑计算信息与技术学院) Department of Computer Science, University of Innsbruck(因斯布鲁克大学计算机科学系) L3S Research Center, Leibniz Universität Hannover(汉诺威莱布尼茨大学L3S研究中心) Digital Science Center (DiSC), University of Innsbruck(因斯布鲁克大学数字科学中心)

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出持续领域随机化方法,结合领域随机化与持续学习,通过逐步随机化参数提升机器人抓取任务的仿真训练效果和现实性能。

Comments Accepted at IROS 2024. Equal contribution from first two authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20211 2026-04-29 cs.CV cs.AI 62%

OmniAlpha: Aligning Transparency-Aware Generation via Multi-Task Unified Reinforcement Learning

OmniAlpha:通过多任务统一强化学习对透明度感知生成进行对齐

Hao Yu, Jinglin Wang, Jiabo Zhan, Rui Chen, Zile Wang, Huaisong Zhang, Hongyu Li, Xinrui Chen, Yongxian Wei, Chun Yuan

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北航)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 OmniAlpha通过多任务统一强化学习框架,解决透明度感知生成中RGB外观、alpha透明度和跨层合成的建模问题,提升RGBA生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16518 2026-04-29 cs.RO cs.CL cs.CV 62%

MiMo-Embodied: X-Embodied Foundation Model Technical Report

MiMo-Embodied:X-Embodied基础模型技术报告

Xiaoshuai Hao, Lei Zhou, Zhijian Huang, Zhiwen Hou, Yingbo Tang, Lingfeng Zhang, Guang Li, Zheng Lu, Shuhuai Ren, Xianhui Meng, Yuchen Zhang, Jing Wu, Jinghui Lu, Chenxu Dang, Jiayi Guan, Jianhua Wu, Zhiyi Hou, Hanbing Li, Shumeng Xia, Mingliang Zhou, Yinan Zheng, Zihao Yue, Shuhao Gu, Hao Tian, Yuannan Shen, Jianwei Cui, Wen Zhang, Shaoqing Xu, Bing Wang, Haiyang Sun, Zeyu Zhu, Yuncheng Jiang, Zibin Guo, Chuhong Gong, Chaofan Zhang, Wenbo Ding, Kun Ma, Guang Chen, Rui Cai, Diyun Xiang, Heng Qu, Fuli Luo, Hangjun Ye, Long Chen

机构 * Xiaomi Embodied Intelligence Team(小米具身智能团队)

专题命中 模仿学习与强化学习 :embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 MiMo-Embodied是首个跨具身基础模型,成功整合并实现自动驾驶和具身AI领域的最先进性能,在17个具身AI基准和12个自动驾驶基准中均取得新纪录,通过多阶段学习、数据构建和CoT/RL微调实现领域间的强正迁移。

Comments Code: https://github.com/XiaomiMiMo/MiMo-Embodied | Model: https://huggingface.co/XiaomiMiMo/MiMo-Embodied-7B

详情

展开后加载摘要…

URL PDF HTML 收藏