arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4115 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4115 篇

2605.22874 2026-05-25 cs.AI cs.LO 57%

NeuroNL2LTL: A Neurosymbolic Framework for Natural Language Translation of Linear Temporal Logic

NeuroNL2LTL:用于线性时序逻辑自然语言翻译的神经符号框架

Paapa Kwesi Quansah, Ernest Bonnah

机构 * Baylor University(贝勒大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI

AI总结 提出NeuroNL2LTL神经符号框架,通过验证器在环训练和最小编辑修复机制,实现自然语言到线性时序逻辑的高可靠性翻译,在20万+需求上达到86%的可满足性输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21688 2026-05-22 cs.RO cs.SY eess.SY 57%

Closed-Loop Sim-to-Real Reinforcement Learning for Deformable Microfiber Shape Control

闭环仿真到现实强化学习用于可变形微纤维形状控制

Alessandro Amici, Houari Bettahar, Veeti Jaakkola, Quan Zhou

机构 * Department of Electrical Engineering and Automation, Aalto University(艾尔沃大学电气工程与自动化系)

专题命中 模仿学习与强化学习 :manipulation(abstract_cn);分类 cs.RO

AI总结 本文提出了一种闭环仿真到现实强化学习方法,用于在表面控制可变形微纤维形状,通过在简化摩擦模拟器中训练几何形状调节,并利用实时视觉反馈在部署过程中迭代修正未建模的表面相互作用效果。

Comments 7 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21463 2026-05-21 cs.CL cs.AI 57%

Mem-$π$: Adaptive Memory through Learning When and What to Generate

Mem-$π$: 通过学习何时以及生成什么来实现自适应记忆

Xiaoqiang Wang, Chao Wang, Hadi Nekoei, Christopher Pal, Alexandre Lacoste, Spandana Gella, Bang Liu, Perouz Taslakian

机构 * ServiceNow AI Research(ServiceNow AI研究院) Mila -- Quebec AI Institute(魁北克AI研究所) McGill University(麦吉尔大学) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 Mem-$π$ 通过学习在何时以及生成什么来实现自适应记忆,利用专门的语言或视觉-语言模型生成上下文特定的指导,从而在多种代理任务中优于基于检索和先前RL优化的记忆基线。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07560 2026-05-21 cs.RO 57%

How to Utilize Failure Demo Data?: Effective Data Selection for Imitation Learning Using Distribution Differences in Attention Mechanism

如何利用失败演示数据?:利用注意力机制中的分布差异进行有效的模仿学习数据选择

Kana Miyamoto, Kanata Suzuki, Tetsuya Ogata

机构 * Faculty of Science and Engineering, Waseda University, Tokyo, Japan(科学与工程学部,早稻田大学,东京,日本) Physical AI Laboratory, Fujitsu Limited, Kanagawa, Japan(物理人工智能实验室, Fujitsu 有限,神奈川,日本)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出了一种利用注意力机制中的分布差异来有效选择模仿学习数据的方法,通过学习成功-失败差异的潜在表示,提高行动稳定性,并引入一个后训练度量来选择有益于学习的失败样本。

Comments 15 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21257 2026-05-21 cs.RO 57%

Reinforcement Learning for Risk Adaptation via Differentiable CVaR Barrier Functions

通过可微分CVaR障碍函数实现风险适应的强化学习

Xinyi Wang, Taekyung Kim, Bardh Hoxha, Georgios Fainekos, Dimitra Panagou

机构 * Department of Robotics(机器人学系) Department of Aerospace Engineering(航空航天工程系) University of Michigan(密歇根大学) Toyota Motor North America, Research & Development(丰田美国北美洲研发)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 本文提出了一种端到端的风险适应框架,用于在障碍物运动不确定性的环境下进行人群导航,结合强化学习与基于条件价值-at-风险(CVaR)障碍函数的可微分二次规划安全层,共同学习名义控制输入、风险水平和安全边际,并强制执行显式的概率安全约束。

Comments Project page: https://anonymousrobotics9666.github.io/rlcvarbf/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20609 2026-05-21 cs.LG 57%

Compositional Transduction with Latent Analogies for Offline Goal-Conditioned Reinforcement Learning

基于潜在类比的组合转导用于离线目标条件强化学习

Junseok Kim, Dohyeong Kim, Mineui Hong, Songhwai Oh

机构 * Department of Electrical and Computer Engineering and ASRI, Seoul National University(电气与计算机工程系和首尔国立大学ASRI) Independent researcher(独立研究者) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 本文提出了一种基于潜在类比的组合转导方法,用于解决离线目标条件强化学习中面对新情境时的目标泛化问题,通过引入新的类比表示方法,提升了在不同情境下的目标达到能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10825 2026-05-19 cs.AI 57%

CheeseBench: Evaluating Large Language Models on Rodent Behavioral Neuroscience Paradigms

CheeseBench:在啮齿类行为神经科学范式上评估大语言模型

Zacharie Bugaud

机构 * Astera Institute(Astera研究院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 CheeseBench通过九种经典行为神经科学范式评估大语言模型,发现模型规模、上下文历史、提示方式和架构对性能有显著影响,且当前模型在空间导航等任务上仍低于啮齿类动物基准。

Comments 8 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14350 2026-05-15 cs.LG 57%

Distributionally Robust Multi-Task Reinforcement Learning via Adaptive Task Sampling

通过自适应任务采样实现分布鲁棒多任务强化学习

Nicholas E. Corrado, Wenyuan Huang, Josiah P. Hanna

机构 * Computer Sciences Department(计算机科学系) University of Wisconsin – Madison(威斯康星大学麦迪逊分校)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 本文提出DRATS算法,通过自适应优先采样未被解决的任务,提升多任务强化学习的数据效率和最差任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14274 2026-05-15 cs.CV 57%

CreFlow: Corrective Reflow for Sparse-Reward Embodied Video Diffusion RL

CreFlow:稀疏奖励具身视频扩散强化学习的纠正回流

Zhenyang Ni, Yijiang Li, Ruochen Jiao, Simon Sinong Zhan, Sipeng Chen, Zhenfei Yin, Minshuo Chen, Philip Torr, Zhaoran Wang, Qi Zhu

机构 * Northwestern University(西北大学) University of California, San Diego(加州大学圣地亚哥分校) University of Oxford(牛津大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV

AI总结 本文提出CreFlow框架,通过信用感知NFT损失和纠正回流损失提升高维视频生成性能,有效解决稀疏奖励下的具身任务执行问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14235 2026-05-15 cs.LG cs.MA quant-ph 57%

Quantum Advantage in Multi Agent Reinforcement Learning

量子多智能体强化学习中的量子优势

Simranjeet Singh Dahia, Claudia Szabo

机构 * Adelaide University(阿德莱德大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文通过实验验证量子纠缠在多智能体强化学习中的协调作用,展示了量子智能体在CHSH游戏中超越经典性能的量子优势,并探讨了不同纠缠结构对性能的影响。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22273 2026-05-14 cs.LG 57%

Decoupling Exploration and Policy Optimization: Uncertainty Guided Tree Search for Hard Exploration

解耦探索与策略优化:基于不确定性引导的树搜索用于困难探索

Zakaria Mhammedi, James Cohan

机构 * Google Research, NYC(谷歌研究,纽约市)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 本文提出一种解耦探索与策略优化的方法,通过树搜索策略和不确定性测量提升探索效率,在困难探索任务中取得显著成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12831 2026-05-14 cs.LG 57%

Quantifying Potential Observation Missingness in Inverse Reinforcement Learning

量化逆强化学习中的潜在观察缺失程度

Leo Benac, Abhishek Sharma, Alihan Huyuk, Finale Doshi-Velez

机构 * School of Engineering and Applied Sciences(工程与应用科学学院) Harvard University(哈佛大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文研究逆强化学习中因观察缺失导致的决策偏差问题,提出算法量化行为数据中可能的观察缺失范围,通过合成导航任务、癌症治疗模拟和ICU治疗数据实验验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12746 2026-05-14 cs.CR cs.AI 57%

CoT-Guard: Small Models for Strong Monitoring

CoT-Guard:用于强监控的小型模型

Nirav Diwan, Han Wang, Berkcan Kapusuzoglu, Ramin Moradi, Supriyo Chakraborty, Giri Iyengar, Sambit Sahu, Huan Zhang, Gang Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Capital One

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI

AI总结 本文提出CoT-Guard,通过结合监督微调和强化学习,提升小型模型在代码生成任务中检测隐藏目标的能力,其在提示和代码攻击下的表现优于现有大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13399 2026-05-14 cs.AI cs.CL 57%

Differentiable Evolutionary Reinforcement Learning

可微分进化强化学习

Sitao Cheng, Tianle Li, Xuhan Huang, Xunjian Yin, Difan Zou

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.AI

AI总结 本文提出DERL,通过可微分的元优化器自动发现最优奖励结构,实现复杂任务中的高效强化学习,优于传统非可微方法。

Comments Work in Progress. We release our code and model at https://github.com/sitaocheng/DERL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11697 2026-05-13 cs.RO 57%

Rainbow Deep Q-Learning with Kinematics-Aware Design for Cooperative Delta and 3-RRS Parallel Robot Insertion

彩虹深度Q学习与运动学感知设计用于协作Delta和3-RRS平行机器人插入

Hassen Nigatu, Gaokun Shi, Jituo Li, Wang Jin, Lu Guodong

机构 * Robotics Research Center of Yuyao(余姚机器人研究中心) Robotics Institute of Zhejiang University(浙江大学机器人院) Yuyao Technology Innovation Center(余姚技术创新中心) Department of Electrical and Computer Engineering, University of New Brunswick(新 Brunswick大学电气与计算机工程系)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出基于Rainbow深度Q网络的运动学感知深度强化学习框架,用于Delta并联机器人与3-RRS并联机械臂的协作插孔任务。通过几何设计优化阶段提升运动学性能,实现六自由度可控子空间,并结合形状奖励机制和两阶段课程训练,提高插孔任务的稳定性和可靠性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11534 2026-05-13 cs.RO 57%

PRISM: : Planning and Reasoning with Intent in Simulated Embodied Environments

PRISM:在模拟的具身环境中进行规划与意图推理

Yunn Kang Lim, Pengzhan Sun, Ziyi Bai, Xun Xu, Angela Yao, Xulei Yang, Shijie Li

机构 * A*STAR National University of Singapore(国立新加坡大学) BAAI(北京人工智能研究院)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.RO

AI总结 PRISM通过诊断性基准测试识别具身代理失败的根源,通过三个能力层级评估基本能力、推理能力和长周期能力,揭示不同模型在空间定位、意图解析和长周期协调上的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00623 2026-05-12 cs.RO 57%

Recovering Hidden Reward in Diffusion-Based Policies

从扩散策略中恢复隐藏奖励

Yanbiao Ji, Qiuchang Li, Yuting Hu, Shaokai Wu, Wenyuan Xie, Guodong Zhang, Qicheng He, Deyi Ji, Yue Ding, Hongtao Lu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出EnergyFlow框架,通过参数化标量能量函数的梯度作为去噪场,统一生成动作建模与逆强化学习,证明在最大熵最优性下,去噪分数匹配学习的分数函数能恢复专家的软Q函数梯度,无需对抗训练即可提取奖励。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08104 2026-05-12 cs.LG 57%

Distributional Reinforcement Learning via the Cramér Distance

通过Cramér距离进行分布式强化学习

Vanya Aziz, Ivo Nowak, E. M. T Hendrix

机构 * HAW Hamburg(汉堡应用技术大学) Universidad de Málaga(马拉加大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 本文提出C-DSAC算法,通过最小化Cramér距离改进分布式强化学习,实验表明其在高复杂度环境中优于基线SAC和现有分布式方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08007 2026-05-11 cs.LG 57%

Interpreting Reinforcement Learning Agents with Susceptibilities

用脆弱性解释强化学习智能体

Chris Elliott, Einar Urdshals, David Quarel, Daniel Murfet

机构 * Timaeus

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 本文将神经网络可解释性技术扩展到深度强化学习的后悔设定,探讨脆弱性在简单网格世界模型中的应用,揭示模型在参数空间中的内部发展特征。

Comments 55 pages, comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23251 2026-05-11 cs.CV 57%

Structure Over Scale: Learning Visual Reasoning from Pedagogical Video

结构优先于规模:从教育视频中学习视觉推理

Bishoy Galoaa, Xiangyu Bai, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.CV

AI总结 本文提出SoSVQA基准,利用教育视频中的结构化推理轨迹提升视觉语言模型的推理能力,通过GRPO优化在少量数据下实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01195 2026-05-11 cs.RO 57%

TAIL-Safe: Task-Agnostic Safety Monitoring for Imitation Learning Policies

TAIL-Safe: 无任务依赖的安全监控用于模仿学习策略

Riad Ahmed, Momotaz Begum

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出TAIL-Safe,通过构建Lipschitz连续的Q值函数,基于可见性、可识别性和可抓取性等短期任务无关标准,确定模仿学习策略的安全集,利用Nagumo定理启发的恢复机制提升策略安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03201 2026-05-11 cs.LG 57%

SLOPE: Optimistic Potential Landscape Shaping for Model-based Reinforcement Learning

SLOPE:基于模型的强化学习中的乐观势能塑造

Yao-Hui Li, Zeyu Wang, Xin Li, Wei Pang, Yingfang Yuan, Zhengkun Chen, Boya Zhang, Riashat Islam, Alex Lamb, Yonggang Zhang

机构 * Beijing Institute of Technology(北京理工大学) Heriot-Watt University(赫瑞-沃森大学) Shenzhen Institutes of Advanced Technology, CAS(深圳先进技术研究院) Microsoft Research NY(微软研究院纽约分部) Tsinghua University(清华大学) Jilin University(吉林大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 SLOPE通过乐观势能估计构建信息丰富的势能景观,解决稀疏奖励环境下梯度信息不足的问题,提升模型在稀疏、半稀疏和密集奖励任务中的性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05791 2026-05-08 cs.LG 57%

A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration

一种适应数据拟合Q迭代的测度论有限样本理论

Manuel Haussmann, Mustafa Mert Çelikok, Melih Kandemir

机构 * Department of Mathematics and Computer Science(数学与计算机科学系)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 本文提出一种统一的理论框架,用于在一般可测Borel空间上分析拟合Q迭代,通过结合测度论概率与Banach空间中的Bellman算子收缩,提供有限样本适应数据性能界,并首次为连续空间中的FQI提供累积路径在线遗憾保证。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05478 2026-05-08 cs.AI 57%

LANTERN: LLM-Augmented Neurosymbolic Transfer with Experience-Gated Reasoning Networks

LANTERN:基于大语言模型的神经符号迁移与经验门控推理网络

Mahyar Alinejad, Yue Wang, Amrit Singh Bedi, George Atia

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) University of Central Florida(中央佛罗里达大学) Department of Computer Science(计算机科学系)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 LANTERN通过生成自动机、语义聚合和自适应门控方法,实现多源神经符号迁移,提升样本效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19972 2026-05-08 cs.CV 57%

Boosting Reasoning in Large Multimodal Models via Activation Replay

通过激活回放提升大多模态模型的推理能力

Yun Xing, Xiaobin Hu, Qingdong He, Jiangning Zhang, Shuicheng Yan, Shijian Lu, Yu-Gang Jiang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Tencent Youtu Lab(腾讯云图实验室) Zhejiang University(浙江大学) Fudan University(复旦大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV

AI总结 本文通过激活回放方法提升大模型的多模态推理能力,通过操控低熵激活来增强推理性能,验证了该方法在数学、视觉代理和视频推理等场景中的有效性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01352 2026-05-05 cs.OS cs.AI cs.DC 57%

VUDA: Breaking CUDA-Vulkan Isolation for Spatial Sharing of Compute and Graphics on the Same GPU

VUDA: 打破CUDA-Vulkan隔离以实现同一GPU上的计算与图形空间共享

Bin Xu, Pengfei Hu, Wenxin Zheng, Jinyu Gu, Haibo Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 模仿学习与强化学习 :embodied AI(abstract);分类 cs.AI

AI总结 VUDA通过打破CUDA与Vulkan的执行隔离,实现计算与图形任务的空间并行,提升GPU利用率并减少端到端延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01232 2026-05-05 cs.RO 57%

A Principled Approach for Creating High-fidelity Synthetic Demonstrations for Imitation Learning

为模仿学习创建高保真合成演示的原理性方法

Moniruzzaman Akash, Momotaz Begum

机构 * Spot mobile manipulator(Spot移动机械臂)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出基于动态运动基元的框架,通过保留专家轨迹结构生成多样化演示,实现高保真渲染与几何推理的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01201 2026-05-05 cs.RO 57%

To Do or Not to Do: Ensuring the Safety of Visuomotor Policies Learned from Demonstrations

做或不做:确保从示范中学习的视觉-运动策略的安全性

Riad Ahmed, Moniruzzaman Akash, Momotaz Begum

机构 * Department of Computer Science(计算机科学系)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 本文提出了一种政策无关的安全度量,确保视觉-运动策略在状态空间特定区域内的最大任务成功率,通过视图合成和Nagumo子切线条件分析,验证了策略安全性和性能的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00384 2026-05-04 cs.RO 57%

PrefMoE: Robust Preference Modeling with Mixture-of-Experts Reward Learning

PrefMoE:基于专家混合的鲁棒偏好建模

Ziqin Yuan, Ruiqi Wang, Dezhong Zhao, Baijian Yang, Byung-Cheol Min

机构 * Purdue University(普渡大学) Beijing University of Chemical Technology(北京化工大学) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 PrefMoE通过混合专家框架提升偏好建模鲁棒性,采用轨迹级软路由结合多个专用奖励专家,有效处理异质且部分冲突的偏好监督,提升下游策略学习可靠性。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00012 2026-05-04 cs.IR cs.AI cs.CL 57%

Exploring LLM biases to manipulate AI search overview

探索LLM偏见以操控AI搜索概述

Roman Smirnov

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI

AI总结 研究探索LLM偏见在AI搜索概述系统中的影响,通过强化学习优化搜索片段内容以操控结果,并发现偏见驱动相对优势而非绝对优势。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏