arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-31 至 2026-03-31 共收录 7 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 7 篇

2511.14262 2026-03-31 cs.LG cs.AI 81%

Object-Centric World Models for Causality-Aware Reinforcement Learning

基于因果意识的强化学习对象中心世界模型

Yosuke Nishimoto, Takashi Matsubara

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出STICA框架,通过对象中心Transformer构建世界模型,并结合因果意识策略和价值网络,提升样本效率和最终性能。

Comments Accepted by AAAI-26. Codes are available at https://github.com/nishimoto0430/STICA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22859 2026-03-31 cs.RO 79%

DecompGrind: A Decomposition Framework for Robotic Grinding via Cutting-Surface Planning and Contact-Force Adaptation

DecompGrind:一种通过切削面规划和接触力适应的机器人磨削分解框架

Shunsuke Araki, Takumi Hachimine, Yuki Saito, Kouhei Ohnishi, Jun Morimoto, Takamitsu Matsubara

机构 * Nara Institute of Science and Technology (NAIST)(奈良先端科学技术大学院大学) Keio University(庆应义塾大学) Kyoto University(京都大学) Advanced Telecommunications Research Institute International (ATR)(国际电气通信基础技术研究所)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出DecompGrind框架,通过分解磨削过程为去除形状规划和接触力适应,解决不同形状和材料硬度工件的高效磨削问题,实现安全接触力控制。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28053 2026-03-31 cs.LG 70%

Reducing Oracle Feedback with Vision-Language Embeddings for Preference-Based RL

通过视觉语言嵌入减少Oracle反馈用于基于偏好的强化学习

Udita Ghosh, Dripta S. Raychaudhuri, Jiachen Li, Konstantinos Karydis, Amit Roy-Chowdhury

机构 * AWS AI Labs(AWS AI实验室)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.LG

AI总结 本文提出ROVED框架,结合视觉语言嵌入与针对性Oracle反馈,通过过滤机制减少不确定性样本的Oracle查询,提升鲁棒性与效率,实验证明在机器人任务中显著降低Oracle调用次数。

Comments Accepted at ICRA 2026. Project page:https://roved-icra-2026.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27866 2026-03-31 cs.CV 70%

Wan-R1: Verifiable-Reinforcement Learning for Video Reasoning

Wan-R1: 可验证强化学习用于视频推理

Ming Liu, Yunbei Zhang, Shilong Liu, Liwen Wang, Wensheng Zhang

机构 * Iowa State University(爱荷华州立大学) Tulane University(杜兰大学) Princeton University(普林斯顿大学)

专题命中 模仿学习与强化学习 :navigation(abstract);robotic(abstract);分类 cs.CV

AI总结 本文提出可验证奖励设计以提升视频推理的泛化能力,通过改进GRPO算法在流基视频模型中训练,验证奖励在复杂迷宫和机器人导航任务中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27416 2026-03-31 cs.RO cs.AI 62%

Agent-Driven Autonomous Reinforcement Learning Research: Iterative Policy Improvement for Quadruped Locomotion

由代理驱动的自主强化学习研究:四足运动的迭代策略改进

Nimesh Khandelwal, Shakti S. Gupta

机构 * Indian Institute of Technology Kanpur(印度理工学院坎普尔分校)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文研究了四足运动中由代理驱动的自主强化学习,通过70次实验展示了代理在低人类干预下完成迭代策略改进的能力,同时记录了多个自主研究决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27751 2026-03-31 cs.AI 57%

SkyNet: Belief-Aware Planning for Partially-Observable Stochastic Games

SkyNet:基于信念的规划用于部分可观测随机博弈

Adam Haile

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI

AI总结 SkyNet通过引入自我条件辅助头,改进了MuZero在部分可观测随机博弈中的规划能力,其在Skyjo游戏中实现了显著的胜率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27364 2026-03-31 cs.NI 50%

DRASTIC: A Dynamic Resource Allocation Framework over 6G Network Slicing in Task-aware Closed-Loop Tactile Internet Applications

DRASTIC:一种面向6G网络切片的动态资源分配框架,用于任务感知闭环触觉互联网应用

Narges Golmohammadi, Madan Mohan Rayguru, Sabur Baidya

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 本文提出DRASTIC框架,通过强化学习动态分配资源,满足延迟要求并提高吞吐量,适用于eMBB和HRLLC用户。

详情

展开后加载摘要…

URL PDF HTML 收藏