arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 115 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 115 篇

2607.07753 2026-07-22 cs.LG cs.AI 版本更新 62%

A Transdiagnostic Space of Disorder Like Phenotypes in Reinforcement Learning Agents

强化学习智能体中类似障碍表型的跨诊断空间

Hari Prasad

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 研究在强化学习智能体中建模心理障碍,将其重新表述为对认知评估信号的剂量可控操纵,通过多个旋钮表示多种障碍,呈现分级剂量反应,还发现障碍自组织成二维空间、旋钮对不同障碍有不同影响及旋钮相互作用可预测共病等,且框架具有通用性。

Comments 15 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32017 2026-07-21 cs.LG cs.AI 版本更新 62%

TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning

TRIAGE:面向智能体强化学习的角色类型化信用分配

Yuanda Xu, Zhengze Zhou, Hejian Sang, Xiaomin Li, Jiaxin Zhang, Xinchen Du, Sen Na, Zhipeng Wang, Alborz Geramifard

机构 * LinkedIn Corporation(领英公司) Harvard University(哈佛大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 提出TRIAGE框架,通过角色类型化信用分配修正GRPO仅依赖结果信用的盲点,在ALFWorld等任务中提升成功率并减少交互步数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07032 2026-07-21 cs.LG cs.AI 版本更新 62%

A Systematic Investigation of RL-Jailbreaking in LLMs

LLMs中RL越狱的系统性研究

Montaser Mohammedalamen, Kevin Roice, Reginald McLean, Alyssa Lefaivre Škopac

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文首次系统分解RL越狱框架,通过分析奖励函数、动作空间、回合长度等环境形式化因素和算法措施,发现密集奖励和延长回合长度是越狱成功的主要驱动因素,并提供了提升RL越狱效率及强化模型防御的工具。

Comments Warning: This paper may contain unfiltered and potentially offensive jailbreaking examples. Accepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11624 2026-07-17 cs.RO cs.LG 版本更新 62%

SKooP: Symmetric Koopman Predictions for Faster and More Generalizable Legged Robot Locomotion with Reinforcement Learning

SKooP:用于强化学习的更快、更通用的有腿机器人运动的对称库普曼预测

Evelyn D'Elia, Weishu Zhan, Giulio Turrisi, Giulio Romualdi, Giuseppe L'Erario, Raffaello Camoriano, Wei Pan, Daniele Pucci

机构 * Italian Institute of Technology (IIT)(意大利理工学院) University of Manchester(曼彻斯特大学) Dynamic Legged Systems Laboratory, IIT(意大利理工学院动态腿式系统实验室) Generative Bionics S.R.L(生成仿生学有限公司) DAUIN, Politecnico di Torino(都灵理工大学DAUIN) Rehab Technologies Lab, IIT(意大利理工学院康复技术实验室) Newcastle University(纽卡斯尔大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 研究针对强化学习样本效率低问题展开,提出SKooP方法,结合形态对称与库普曼模型优势,在学习策略时学习系统动力学模型,将其预测用于评论家,还纳入群对称,验证了该方法能减少收敛时间并增加学习奖励,且策略可转移。

Comments This paper has been accepted for publication at the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Pittsburgh, USA, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11653 2026-07-14 cs.LG cs.RO 版本更新 62%

Simple Recipe Works: Vision-Language-Action Models are Natural Continual Learners with Reinforcement Learning

简单配方有效:视觉-语言-动作模型通过强化学习成为自然持续学习者

Jiaheng Hu, Jay Shim, Chen Tang, Yoonchang Sung, Bo Liu, Peter Stone, Roberto Martin-Martin

机构 * University of Southern California(南加州大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.RO、cs.LG

AI总结 本文通过系统研究发现,对于大型预训练视觉-语言-动作模型,简单的顺序微调结合低秩适配在持续强化学习中表现出高可塑性、几乎无遗忘和强零样本泛化,优于复杂方法。

Comments Accepted at RLC 2026; Best paper award at ICRA26 RL4IL Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15136 2026-07-10 cs.LG cs.AI 版本更新 62%

Safe Flow Q-Learning: Offline Safe Reinforcement Learning with Reachability-Based Flow Policies

安全流Q学习:基于可达性的安全离线强化学习流策略

Mumuksh Tayal, Manan Tayal, Ravi Prakash

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Safe Flow Q-Learning,结合达性启发的安全价值函数和高效的一步流策略,通过自一致性Bellman递归学习安全价值,行为克隆训练流策略并转化为奖励最大化安全动作选择器,减少部署时的拒绝采样,提升实时安全应用性能。

Comments 21 pages, 6 figures, 3 tables; First 2 authors have contributed equally; Paper accepted at Reinforcement Learning Conference (RLC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05296 2026-07-09 cs.RO cs.LG 版本更新 62%

Latent Policy Steering through One-Step Flow Policies

通过一步流策略实现潜在策略引导

Hokyun Im, Andrey Kolobov, Jianlong Fu, Youngwoon Lee

机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学) Microsoft Research(微软研究院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出Latent Policy Steering (LPS),通过一步流策略实现高保真的潜在策略改进,解决了离线强化学习中回报最大化与行为约束之间的权衡问题,实现了无需复杂超参数调整的鲁棒性能。

Comments Accepted to RSS 2026, Project Webpage : https://jellyho.github.io/LPS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21718 2026-07-03 cs.LG cs.AI 版本更新 62%

When Does Predictive Inverse Dynamics Outperform Behavior Cloning?

何时预测性逆动力学优于行为克隆?

Lukas Schäfer, Pallavi Choudhury, Abdelhak Lemkhenter, Chris Lovett, Somjit Nath, Luis França, Matheus Ribeiro Furtado de Mendonça, Alex Lamb, Riashat Islam, Siddhartha Sen, John Langford, Katja Hofmann, Sergio Valcarcel Macua

机构 * University of Cambridge(剑桥大学) Universitygrow

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文通过理论分析解释了预测性逆动力学模型(PIDM)为何在行为克隆(BC)失败时表现更优,归因于偏差-方差权衡,并实验验证了PIDM在样本效率上的显著优势。

Comments To be published in proceedings of the International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10263 2026-07-02 cs.RO cs.LG 版本更新 62%

From Prior to Pro: Efficient Skill Mastery via Distribution Contractive RL Finetuning

从先验到专家:通过分布收缩强化学习微调实现高效技能掌握

Zhanyi Sun, Shuran Song

机构 * Stanford University(斯坦福大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 提出DICE-RL框架,将强化学习作为分布收缩算子,通过在线反馈放大高成功行为,将预训练行为先验微调为高性能专家策略,实现稳定、样本高效的复杂操作技能掌握。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30719 2026-06-29 cs.LG cs.AI 版本更新 62%

When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?

何时LLMs足以作为序列RL任务的策略优化器?

Stephane Hatgis-Kessell, Emma Brunskill

机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 提出PromptPO方法,利用LLM通过Python描述状态空间、动作空间和奖励函数,基于rollout反馈迭代生成和优化可执行策略,在多种环境中匹配或超越标准RL基线,但在细粒度连续控制任务中表现不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15373 2026-06-25 eess.SY cs.AI cs.LG cs.SY math.OC nlin.AO 版本更新 62%

Safe Learning Control with Optimality and Stability Guarantees

具有最优性和稳定性保证的安全学习控制

Xinyang Wang, Hongwei Zhang, Shimin Wang, Wei Xiao, Martin Guay

机构 * Shenzhen Key Lab for Advanced Motion Control and Modern Automation Equipments, School of Intelligence Science and Engineering, Harbin Institute of Technology, Shenzhen, Guangdong 518055, China(深圳先进 motion 控制与现代自动化装备重点实验室,智能科学与工程学院,哈尔滨工业大学,深圳,广东 518055,中国) School of Data Science, Lingnan University, Hong Kong(数据科学学院,岭南大学,香港) School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(电气与电子工程学院,南洋理工大学,新加坡) MIT CSAIL

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 针对非线性系统在高相对度状态约束和未知扰动下的强化学习控制,提出高阶倒数型控制障碍函数处理约束,并通过梯度相似性概念和自适应机制在保证安全的同时提升性能。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17518 2026-06-17 cs.LG cs.AI q-fin.CP stat.ML 版本更新 62%

Ensemble RL through Classifier Models: Enhancing Risk-Return Trade-offs in Trading Strategies

通过分类器模型进行集成强化学习:在交易策略中增强风险回报权衡

Zheli Xiong

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在金融交易策略中使用集成强化学习模型的全面研究,利用分类器模型来提升性能。通过将A2C、PPO和SAC等强化学习算法与传统分类器如支持向量机(SVM)、决策树和逻辑回归相结合,探讨不同分类器组如何整合以改善风险回报权衡。研究评估了各种集成方法的有效性,将其与单个强化学习模型在关键金融指标(包括累计回报率、夏普比率(SR)、卡勒姆比率和最大回撤(MDD))上进行比较。结果表明,集成方法在风险调整后的回报方面始终优于基础模型,提供了更好的回撤管理和整体稳定性。然而,我们发现集成性能对方差阈值τ的选择敏感,强调了动态调整τ以达到最佳性能的重要性。本研究强调了将强化学习与分类器结合在自适应决策中的价值,对金融交易、机器人和其他动态环境具有启示。

Comments 23 pages,10 figures, 9 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26452 2026-06-09 cs.RO cs.LG cs.SY eess.SY 版本更新 62%

Robust Koopman Control Barrier Filters for Safe Actor-Critic Reinforcement Learning

鲁棒Koopman控制屏障滤波器用于安全演员-评论家强化学习

Dhruv S. Kushwaha, Zoleikha A. Biron

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 提出鲁棒Koopman-CBF SAC框架,通过数据驱动学习Koopman预测器、构建提升空间中的仿射CBF约束并利用二次规划安全层实施,同时通过投影残差裕度处理近似误差,实现零约束违反或减少违规。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03382 2026-06-08 cs.LG cs.AI 版本更新 62%

Local Guidance, Global Impact: Gaussian-Reshaped Trust Region Unlocks Behavior Transitions

局部引导,全局影响:高斯重塑信任区域解锁行为转变

Bingxu Liu, Jiashun Liu, Johan Obando-Ceron, Hao Wang, Runze Liu, Pablo Samuel Castro, Aaron Courville, Ling Pan

机构 * Hong Kong University of Science and Technology(香港科技大学) Mila - Québec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学) Fudan University(复旦大学) City University of Hong Kong(香港城市大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 针对PPO在非平稳环境中优化失效的问题,提出高斯信任区域策略优化(GTR),通过高斯核重塑信任区域实现非单调约束,在保持局部稳定性的同时允许必要的大幅策略更新,并在多种任务中取得强性能。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08168 2026-06-08 cs.RO cs.AI 版本更新 62%

ViVa: A Video-Generative Value Model for Robot Reinforcement Learning

ViVa:用于机器人强化学习的视频生成价值模型

Jindi Lv, Hao Li, Jie Li, Fankun Kong, Yang Wang, Pengfei Yi, Yifei Nie, Xiaofeng Wang, Zheng Zhu, Chaojun Ni, Qiuping Deng, Hengtao Li, Jiancheng Lv, Guan Huang

机构 * GigaAI Sichuan University(四川大学) Tsinghua University(清华大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出ViVa,利用预训练视频生成器联合预测未来本体感受和标量价值,通过时空先验实现可靠价值估计,在三个任务中取得最优结果,与RECAP结合平均成功率达80%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07223 2026-08-11 cs.AI 版本更新 61%

Reflex First, Reflect Later: Latency-Aware Embodied LLM Agents for Dynamic Response

先反射,后反思:面向动态响应的延迟感知具身大语言模型智能体

Yangqing Zheng, Shunqi Mao, Dingxin Zhang, Weidong Cai

机构 * School of Computer Science, The University of Sydney(计算机科学学院,悉尼大学)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.AI;embodied AI(comments)

AI总结 该研究针对动态环境中具身LLM智能体的推理延迟问题,提出RRARA智能体及相关评估指标,通过时间转换机制与预规划器实现决策质量与响应能力的平衡。

Comments Accepted by the CVPR 2025 Embodied AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05608 2026-06-16 cs.RO 版本更新 61%

HiCrowd: Hierarchical Crowd Flow Alignment for Dense Human Environments

HiCrowd:密集人群环境中的分层人群流对齐

Yufei Zhu, Shih-Min Yang, Martin Magnusson, Allan Wang

机构 * Robot Navigation and Perception Lab, AASS Research Center, Örebro University, Sweden(奥雷布罗大学机器人导航与感知实验室,AASS研究中心,瑞典) Miraikan – The National Museum of Emerging Science and Innovation, Japan(日本新兴科学与创新国家博物馆——Miraikan)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO;robotics(comments)

AI总结 提出HiCrowd分层框架,结合强化学习与模型预测控制,通过跟随人群流解决机器人冻结问题,在真实和合成数据集上提升导航效率与安全性。

Comments 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16136 2026-06-09 cs.RO 版本更新 61%

Reward Evolution with Graph-of-Thoughts: A Bi-Level Language Model Framework for Reinforcement Learning

基于思维图的奖励进化:一种用于强化学习的双层语言模型框架

Changwei Yao, Xinzi Liu, Chen Li, Marios Savvides

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Tokyo(东京大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO;robotics(journal_ref)

AI总结 本文提出RE-GoT框架,结合LLM与VLM的图思维推理,通过任务分解和视觉反馈迭代优化奖励函数,实验表明在RoboGen和ManiSkill2任务中均优于现有方法。

Journal ref IEEE International Conference on Robotics and Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07403 2026-07-07 cs.CV cs.AI cs.CL cs.LG 版本更新 60%

SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards

空间思考者:通过密集奖励强化场景图基础的空间推理

Hunar Batra, Haoqin Tu, Hardy Chen, Yuanze Lin, Cihang Xie, Ronald Clark

机构 * University of Oxford(牛津大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 模仿学习与强化学习 :分类 cs.AI、cs.CV、cs.LG;embodied AI(comments);world model(comments)

AI总结 研究针对多模态大语言模型空间推理难题,提出SpatialThinker,通过在线强化学习统一场景图生成与视觉推理,构建心理场景图并借助密集奖励推理,贡献包括基于SGG推理、高质量训练数据集及密集奖励设计。

Comments Preprint. Accepted at NeurIPS 2025 Workshops on SPACE in Vision, Language, and Embodied AI (SpaVLE) as Oral, Embodied World Models for Decision Making (EWM), Aligning Reinforcement Learning Experimentalists and Theorists (ARLET), and Scaling Environments for Agents (SEA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06161 2026-08-14 cs.AI 版本更新 57%

iARCS: Iterative Agentic RL for Controllable 3D Scene Generation

iARCS:用于可控3D场景生成的迭代智能体强化学习

Saugat Adhikari, Ashok Prasad Neupane, Pramish Paudel, Ajad Chhatkuli, Danda Pani Paudel

机构 * Tribhuvan University(特里布文大学) Pulchowk Campus, IOE, Tribhuvan University(特里布文大学工程学院普尔乔克校区) NAAMII(尼泊尔先进数学与信息学研究所) INSAIT, Sofia University “St. Kliment Ohridski”(索菲亚大学圣克莱门特奥赫里德斯基分校INSAIT)

专题命中 模仿学习与强化学习 :embodied AI(abstract);分类 cs.AI

AI总结 研究针对现有3D场景生成器无法满足任务约束的问题,提出iARCS迭代智能体强化学习框架,通过两阶段策略优化约束保真度,生成的数据可改进基础生成器,具实用价值。

Comments 15 pages, 9 figures, 4 tables. Includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01891 2026-08-14 cs.LG 版本更新 57%

SEAR: Sample Efficient Action Chunking Reinforcement Learning

SEAR:样本高效的动作分块强化学习

C. F. Maximilian Nagy, Onur Celik, Emiliyan Gospodinov, Florian Seligmann, Weiran Liao, Aryan Kaushik, Gerhard Neumann

机构 * Autonomous Learning Robots, Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院自主学习机器人实验室)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 SEAR 是一种样本高效的在线强化学习算法,通过利用动作分块的时间结构和滚动时间 horizon,有效结合小和大分块大小的优势,在 Metaworld 上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01151 2026-08-11 cs.LG 版本更新 57%

Lagrangian Perturbation Diffusion Steering: Latent Reinforcement Learning for Generative Policies

拉格朗日扰动扩散引导:用于生成策略的潜在强化学习

Hikmet Simsir, Ozgur S. Oguz

机构 * University of Michigan(密歇根大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 提出拉格朗日扰动扩散引导(LP-DS),通过学习紧凑的噪声空间扰动来微调冻结的生成策略,利用拉格朗日信任区域目标优化,在保持潜在先验约束的同时提升下游价值,在多个基准上实现样本效率和回报提升。

Comments Accepted as a regular paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01476 2026-08-11 cs.LG cs.CL 版本更新 57%

From Rebound to Remedy: Understanding and Mitigating Reward Hacking via Representation Engineering

当奖励黑客反弹时:通过表征层面信号理解与缓解它

Rui Wu, Ruixiang Tang

机构 * Rutgers University(罗格斯大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 本文研究了大型语言模型强化学习中奖励黑客现象,通过环境操控设置分析其三阶段反弹模式,并提出基于表征工程的Advantage Modification方法以更有效抑制黑客行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20985 2026-08-06 cs.LG 版本更新 57%

Distributional Active Inference

分布式主动推断

Abdullah Akgül, Gulcin Baykal, Manuel Haußmann, Mustafa Mert Çelikok, Melih Kandemir

机构 * University of Southern Denmark(丹麦南部大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 本文提出了一种将主动推断整合到分布式强化学习框架中的形式抽象,以提升复杂环境机器人系统最优控制的样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27703 2026-08-05 cs.AI 版本更新 57%

SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them

SpatialCLI:先借助空间工具进行推理,再脱离工具进行推理

Yang Zhou, Zixuan Huang, Sunzhu Li, Zhuo Yang, Chen Zhang, Shunian Chen, Caijun Yan, Jianyao Xu, Shunyu Liu, Weijie Fu, Peiliang Li, Xiaozhi Chen, Yuxiang Cai

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.AI

AI总结 本研究提出SpatialCLI框架,通过三个阶段让视觉语言模型先借助专用空间工具推理,再内化感知能力,在MindCube上大幅提升了Qwen3-VL-8B-Instruct的性能,表现优于对比模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20880 2026-08-05 stat.ML cs.LG stat.ME 版本更新 57%

Adversarial observations in probabilistic State-Space Models for robust Reinforcement Learning

概率状态空间模型中的对抗观测用于鲁棒强化学习

M. Santos-Pascual, D. Ríos Insua

机构 * Inst. Math. Sciences, Spanish Nat. Research Council, Madrid, Spain(西班牙国家研究委员会数学科学研究所,马德里)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 分析线性概率状态空间模型中受似然约束的对抗观测对潜在状态和策略决策的影响,为构建鲁棒强化学习系统提供理论基础,适用于机器人等安全关键领域。

Comments 42 pages, 10 figures, PREPRINT ONGOING: Revised version with additional theoretical results and experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00610 2026-08-03 cs.RO 版本更新 57%

Vision-based Goal-Reaching Control for Mobile Robots Using a Hierarchical Learning Framework

基于视觉的目标到达控制的移动机器人Hierarchical Learning框架

Mehdi Heydari Shahna, Pauli Mustalahti, Jouni Mattila

机构 * Faculty of Engineering and Natural Sciences, Tampere University(工程与自然科学学院,塔尔皮莱大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 本文提出一种基于视觉的目标到达控制框架,通过分层学习方法提高移动机器人在复杂地形中的安全性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01110 2026-07-31 cs.RO 版本更新 57%

Compact Task-Aligned Imitation Learning for Laboratory Automation

紧凑的任务对齐模仿学习用于实验室自动化

Kanata Suzuki, Hanon Nakamura, Kana Miyamoto, Tetsuya Ogata

机构 * Spatial Robotics Research Center, Fujitsu Limited.(富士通株式会社空间机器人研究中心) Faculty of Science and Engineering, Waseda University(早稻田大学理工学部) National Institute of Advanced Industrial Science and Technology(国家工业科学与技术研究院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出了一种紧凑的模仿学习框架,通过小基础模型和扩散变换器专家实现高效实验室自动化,实验显示其在三个任务中的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21302 2026-07-28 cs.AI 版本更新 57%

Expert Behavior Prior Reinforcement Learning

专家行为先验强化学习

Gong Gao, Weidong Zhao, Xianhui Liu, Ning Jia

机构 * School of Computer Science, Tongji University(同济大学计算机科学与技术学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI

AI总结 研究针对行为先验强化学习依赖静态离线数据集的问题,提出专家行为先验算法,通过Q引导的条件变分自编码器生成专家策略先验,并结合专家策略引导和策略梯度校正模块,提升样本效率与收敛稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18985 2026-07-28 cs.AI 版本更新 57%

Athena-Brain Technical Report: An Efficient Robot Brain for General Intelligence and Embodied Interaction

雅典娜大脑技术报告:用于通用智能和具身交互的高效机器人大脑

Jialian Li, Junhong Liu, Yuchen Cao, Weiran Guo, Jiaming Song, Xutao Wang, Yi Zhao, Jiangpin Liu, Jie Chen

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.AI

AI总结 研究针对具身智能体对设备端紧凑模型需求,提出雅典娜大脑8B模型,经多阶段训练流程,使其兼具通用与具身交互能力,实验证明该模型在通用和具身评估中有效,能在保持性能同时生成更简洁回复。

详情

展开后加载摘要…

URL PDF HTML 收藏