arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-11 至 2026-05-11 共收录 6 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 6 篇

2605.06761 2026-05-11 cs.AI cs.CV cs.LG 67%

Weblica: Scalable and Reproducible Training Environments for Visual Web Agents

Weblica: 可扩展且可重复的视觉网络代理训练环境

Oğuzhan Fatih Kar, Roman Bachmann, Yuanzheng Gong, Anders Boesen Lindbo Larsen, Afshin Dehghan

机构 * Apple(苹果公司)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 Weblica提出一种可扩展且可重复的视觉网络代理训练框架,通过HTTP级缓存和LLM环境合成技术,实现大规模多样化的网络环境训练,其最佳模型在多个网络导航基准中表现优异。

Comments 28 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05110 2026-05-11 cs.RO cs.AI 66%

LineRides: Line-Guided Reinforcement Learning for Bicycle Robot Stunts

LineRides: 基于线引导的强化学习用于自行车机器人特技

Seungeun Rho, Shamel Fahmi, Jeonghwan Kim, Arianna Ilvonen, Sehoon Ha, Gabriel Nelson

机构 * RAI Institute(RAI研究院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI;robotics(comments)

AI总结 本文提出LineRides框架,通过空间引导线和稀疏关键姿态实现自行车机器人自主学习多样特技行为,无需示范或显式时间信息。

Comments Published in IEEE Robotics and Automation Letters (RA-L), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08007 2026-05-11 cs.LG 57%

Interpreting Reinforcement Learning Agents with Susceptibilities

用脆弱性解释强化学习智能体

Chris Elliott, Einar Urdshals, David Quarel, Daniel Murfet

机构 * Timaeus

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 本文将神经网络可解释性技术扩展到深度强化学习的后悔设定,探讨脆弱性在简单网格世界模型中的应用,揭示模型在参数空间中的内部发展特征。

Comments 55 pages, comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23251 2026-05-11 cs.CV 57%

Structure Over Scale: Learning Visual Reasoning from Pedagogical Video

结构优先于规模:从教育视频中学习视觉推理

Bishoy Galoaa, Xiangyu Bai, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.CV

AI总结 本文提出SoSVQA基准,利用教育视频中的结构化推理轨迹提升视觉语言模型的推理能力,通过GRPO优化在少量数据下实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01195 2026-05-11 cs.RO 57%

TAIL-Safe: Task-Agnostic Safety Monitoring for Imitation Learning Policies

TAIL-Safe: 无任务依赖的安全监控用于模仿学习策略

Riad Ahmed, Momotaz Begum

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出TAIL-Safe,通过构建Lipschitz连续的Q值函数,基于可见性、可识别性和可抓取性等短期任务无关标准,确定模仿学习策略的安全集,利用Nagumo定理启发的恢复机制提升策略安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03201 2026-05-11 cs.LG 57%

SLOPE: Optimistic Potential Landscape Shaping for Model-based Reinforcement Learning

SLOPE:基于模型的强化学习中的乐观势能塑造

Yao-Hui Li, Zeyu Wang, Xin Li, Wei Pang, Yingfang Yuan, Zhengkun Chen, Boya Zhang, Riashat Islam, Alex Lamb, Yonggang Zhang

机构 * Beijing Institute of Technology(北京理工大学) Heriot-Watt University(赫瑞-沃森大学) Shenzhen Institutes of Advanced Technology, CAS(深圳先进技术研究院) Microsoft Research NY(微软研究院纽约分部) Tsinghua University(清华大学) Jilin University(吉林大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 SLOPE通过乐观势能估计构建信息丰富的势能景观,解决稀疏奖励环境下梯度信息不足的问题,提升模型在稀疏、半稀疏和密集奖励任务中的性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏