arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-01 至 2026-06-01 共收录 8 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 8 篇

2604.17551 2026-06-01 cs.LG cs.AI 73%

SVL: Goal-Conditioned Reinforcement Learning as Survival Learning

SVL:目标条件强化学习作为生存学习

Franki Nguimatsia Tiofack, Fabian Schramm, Théotime Le Hellard, Justin Carpentier

机构 * Inria(法国国家信息与自动化研究所) École Normale Supérieure, PSL Research University, Paris, France(巴黎高等师范学院,PSL研究大学)

专题命中 模仿学习与强化学习 :robotics(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出生存价值学习(SVL),通过将时间到目标建模为概率分布,将目标条件强化学习重构为生存学习问题,并利用危险模型进行最大似然估计,在离线基准上匹配或超越强基线方法。

Comments Accepted to the 43rd International Conference on Machine Learning, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31273 2026-06-01 cs.LG 70%

Survival Reinforcement Learning: Toward Scalable Self-Supervised RL

生存强化学习:迈向可扩展的自监督强化学习

Franki Nguimatsia-Tiofack, Fabian Schramm, Théotime Le Hellard, Justin Carpentier

机构 * Inria and École Normale Supérieure PSL Research University(Inria 和 法国国家科学研究中心巴黎大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.LG

AI总结 提出生存强化学习(SRL),一种基于在线分类的方法,通过最大化智能体在目标状态停留时间来解决对比强化学习中的均匀性-容忍性困境,在长时程运动任务上性能提升2至8倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30795 2026-06-01 cs.RO 70%

Feat2Go: Visual Feature-Grounded Value Estimation for Embodied Reinforcement Learning

Feat2Go: 面向具身强化学习的视觉特征基础价值估计

Junyang Shu, Zhiwei Lin, Bingqing Wei, Yongtao Wang

机构 * Wangxuan Institute of Computer Technology, Peking University, China(北京大学计算机科学技术研究院)

专题命中 模仿学习与强化学习 :manipulation(abstract);world model(abstract);分类 cs.RO

AI总结 提出Feat2Go框架,通过预训练视觉世界模型提取补丁级子目标相似度并聚类语义阶段,训练具身价值模型预测结构进度以重塑终端奖励,显著提升VLA模型在单臂和双臂操作任务中的强化学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30503 2026-06-01 cs.RO cs.SY eess.SY stat.ML 70%

Physics-informed Goal-Conditioned Reinforcement Learning under Hybrid Contact Dynamics

混合接触动力学下的物理信息目标条件强化学习

Vittorio Giammarino, Anastasios Manganaris, Ahmed H. Qureshi

机构 * Department of Computer Science(计算机科学系)

专题命中 模仿学习与强化学习 :manipulation(abstract);navigation(abstract);分类 cs.RO

AI总结 针对接触丰富任务中混合动力学导致现有物理信息目标条件强化学习方法性能下降的问题,提出接触感知和分层公式,选择性应用物理信息归纳偏置,向接触丰富操作扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31256 2026-06-01 cs.RO 57%

Before Parc Fermé: RL-Time Pruning for Efficient Embodied LLMs in Autonomous Driving

在封闭停车场之前:面向自动驾驶高效具身大语言模型的强化学习时间剪枝

Luca Benfenati, Ali Azimi, Matteo Risso, Fabio Carapellese, Daniele Jahier Pagliari, Alessio Burrello

机构 * Department of Control and Computer Engineering(控制与计算机工程系) Department of Mechanical and Aerospace Engineering(机械与航空航天工程系)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 提出一种在强化学习过程中进行剪枝的策略BPF,通过任务特定监督和闭环反馈压缩具身大语言模型控制器,在自动驾驶控制管道中实现了更好的性能-内存-吞吐量权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30576 2026-06-01 cs.AI 57%

Uncertainty-Aware and Temporally Regulated Expert Advice in Reinforcement Learning for Autonomous Driving

自动驾驶强化学习中不确定性感知与时间调控的专家建议

Ahmed Abouelazm, Felix Klingebiel, Philip Schörner, J. Marius Zöllner

机构 * FZI Research Center for Information Technology(弗劳恩霍夫信息技术研究所) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 提出一种不确定性感知框架,通过自适应阈值触发专家建议并采用承诺-冷却策略调控指导时长,结合离线策略隐式分位数网络实现安全高效的探索,在CARLA中成功率提升5-7%。

Comments Accepted in The IEEE International Conference on Intelligent Transportation Systems (ITSC) September 15-18, 2026 -- Naples, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02217 2026-06-01 cs.LG 57%

Population-Free Pareto Tracking for Sample-Efficient Multi-Policy MORL

无种群的帕累托跟踪:面向样本高效的多策略多目标强化学习

Zeyu Zhao, Yueling Che, Kaichen Liu, Jian Li, Junmei Yao

机构 * College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 提出MPFT框架,通过无自进化种群的帕累托跟踪机制,结合单目标极端策略初始化,高效逼近完整帕累托前沿,显著提升样本效率并减少智能体-环境交互。

Comments 37 pages, 10 figures, ICML26 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30690 2026-06-01 cs.CL 50%

ElasticMem: Latent Memory as a Learnable Resource for LLM Agents

ElasticMem: 将潜在记忆作为LLM智能体的可学习资源

Tao Feng, Chongrui Ye, Tianyang Luo, Jingjun Xu, Xueqiang Xu, Haozhen Zhang, Ge Liu, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nanyang Technological University(南洋理工大学)

专题命中 模仿学习与强化学习 :embodied agent(abstract)

AI总结 提出ElasticMem框架,通过可学习的弹性潜在记忆分配策略,在记忆密集型问答和具身智能体控制任务中显著提升准确率并降低token开销。

详情

展开后加载摘要…

URL PDF HTML 收藏