arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 197 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 197 篇

2606.26955 2026-06-26 cs.RO 新提交 79%

RobOralScan: Learning Active Intraoral Scanning for Robotic Dental Reconstruction

RobOralScan:面向机器人牙科重建的主动口内扫描学习

Jinhyung Lee, Haeun Yun, Siwon Kim, Gihyun Baek, Sungho Moon, Sehyun Hwang, Sunghoon Im

机构 * DGIST(大邱庆北科学技术院)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 提出基于强化学习的机器人自动口内扫描方法RobOralScan,通过几何记忆观测空间和牙齿级覆盖学习,提升全弓扫描的覆盖率和均匀性,实现高精度重建。

Comments 24 pages, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25754 2026-06-25 cs.RO 新提交 79%

Stage-Aware and Roughness-Constrained Diffusion Policy for Multi-Stage Robotic Polishing

阶段感知与粗糙度约束的扩散策略用于多阶段机器人抛光

Shuai Ke, Jiexin Zhang, Huan Zhao, Zhiao Wei, Yikun Guo, Tiange Wu, Guoqiang Guo, Haoyuan Zhou, Jie Pan, Han Ding

机构 * State Key Laboratory of Intelligent Manufacturing Equipment and Technology, Huazhong University of Science and Technology(华中科技大学智能制造装备与技术国家重点实验室) Shanghai Spaceflight Precision Machinery Institute(上海航天精密机械研究所)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 提出阶段感知与粗糙度约束扩散策略(SRDP),通过多模态观测推断阶段后验并约束去噪过程,实现无外部标签的阶段一致动作生成,提升多阶段抛光质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20698 2026-06-23 cs.RO 新提交 79%

SafeDojo: Safe Reinforcement Learning for VLA via Interactive World Model

SafeDojo:基于交互世界模型的安全强化学习用于视觉-语言-动作模型

Kai Tang, Peidong Jia, Zhong Chu, Jixian Wu, Rui Ma, Jiajun Cao, Fangyuan Zhao, Sixiang Chen, Yichen Guo, Xiaowei Chi, Chun-Kai Fan, Kevin Zhang, Jinchang Xu, Fubing Yang, Weishi Mi, Xiaozhu Ju, Jian Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology(香港科技大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.RO

AI总结 提出SafeDojo,首个基于模型的安全强化学习框架,通过交互式视频世界模型进行想象学习安全动作,结合解耦的任务奖励和安全代价信号,在SafeLIBERO和真实机器人上取得最佳安全成功率。

Comments 20 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18625 2026-06-18 cs.RO 新提交 79%

SRL: Combining SLIP Model and Reinforcement Learning for Agile Robotic Jumping

SRL:结合SLIP模型与强化学习实现敏捷机器人跳跃

Xiaowen Hu, Linqi Ye, Yudi Zhu, Chenyue Shao, Rankun Li, Qingdu Li, Yan Peng

机构 * Institute of Artificial Intelligence, Shanghai University(上海大学人工智能研究院) Institute of Machine Intelligence, University of Shanghai for Science and Technology(上海理工大学机器智能研究院)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 提出SRL框架,融合SLIP模型的物理基线与强化学习的自适应能力,通过前馈控制信号与实时反馈优化机器人跳跃,显著减少训练时间并保持高精度跟踪。

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16621 2026-06-16 cs.RO 新提交 79%

Reinforcement Learning with Inner-loop Dynamics Estimator for Aerial Manipulation under Uncertainty

基于内环动力学估计器的强化学习在不确定性下的空中操纵

Shivansh Pratap Singh, Samaksh Ujjwal, Ishita Chaudhary, V R Vasudevan, Rishabh Dev Yadav, Spandan Roy

机构 * International Institute of Information Technology Hyderabad(国际信息技术学院海德拉巴) University of Manchester(曼彻斯特大学)

专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO

AI总结 提出一种分层控制框架,结合强化学习与外环与内环动力学估计器,实现直接任务驱动控制,在硬件实验中降低末端执行器跟踪误差并提高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16572 2026-06-16 cs.RO 新提交 79%

Steering Generative Reinforcement Learning into Stable Robotic Controller

将生成式强化学习引导至稳定机器人控制器

Yixuan Wang, Shutong Ding, Ke Hu, Tianxiang Gui, Jingya Wang, Ye Shi

机构 * ShanghaiTech University(上海科技大学)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 提出SteerGenPO框架,通过潜在空间强化学习将训练好的生成式策略转化为鲁棒的确定性机器人控制器,在Isaac Lab和Unitree G1任务上优于基线方法,实现更稳定的推理行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13675 2026-06-15 cs.RO 新提交 79%

Improving Robotic Generalist Policies via Flow Reversal Steering

通过流反转引导改进机器人通用策略

Andy Tang, William Chen, Andrew Wagenmaker, Chelsea Finn, Sergey Levine

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

专题命中 模仿学习与强化学习 :robotic(title);manipulation(abstract);分类 cs.RO

AI总结 提出流反转引导(FRS)方法,通过逆向流策略找到次优动作的潜在噪声并映射到通用策略的动作模式,提升零样本控制、行为克隆和强化学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11577 2026-06-11 cs.RO 新提交 79%

Distortion-Resilient Robotic Imitation Learning for Autonomous Cable Routing

抗畸变机器人模仿学习用于自主电缆布线

Hao Wang, Fu-Zhao Ou, Shiqi Wang, Zhaolin Wan, Xiaopeng Fan

机构 * School of Artificial Intelligence, Harbin Institute of Technology(哈尔滨工业大学人工智能学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Pengcheng Laboratory(鹏城实验室) Suzhou Research Institute, Harbin Institute of Technology(哈尔滨工业大学苏州研究院)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 提出一种包含图像质量评估、置信度学习和决策模块的机器人模仿学习框架,在图像畸变下仍保持高性能,实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10927 2026-06-10 cs.RO 新提交 79%

AllDayNav: Lifelong Navigation via Real-World Reinforcement Learning

AllDayNav: 通过真实世界强化学习实现终身导航

Hang Yin, Yinan Liang, Jiazhao Zhang, Jiahang Liu, Minghan Li, Zhizheng Zhang, He Wang

机构 * Tsinghua University(清华大学) Galbot Robotics Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO

AI总结 提出AllDayNav框架,利用自进化多模态记忆和强化学习隐式编码场景动态,在跨房间、跨回合和跨任务场景中实现接近100%的成功率,超越基于地图、VLM和RL的基线方法。

Comments Project Page: https://bagh2178.github.io/AllDayNav/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29613 2026-08-03 cs.RO cs.CL cs.CV 新提交 79%

WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning

WCM:用于视觉-语言-动作强化学习的世界评论者模型

Senyu Fei, Xiaopeng Yu, Siyin Wang, Xianzhong Zhao, Jingjing Gong, Xipeng Qiu

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);world model(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 该研究针对视觉-语言-动作强化学习中评论者与机器人部分可观测性不匹配的问题,提出WCM模型,联合预测未来潜态与值估计,在149个仿真任务和7个真实任务上均实现最优性能与泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10369 2026-07-14 cs.RO cs.AI 新提交 79%

VINE: Taming Generative Control Policies for Reinforcement Learning

VINE:驯服强化学习中的生成控制策略

Rushuai Yang, Zhuo Han, Houlin Li, Hecheng Wang, Zhichao Wu, Rui Zhang, Zhaowei Zhang, Zihong Chen, Xiaohan Yan, Chiming Liu, Yi Chen, Wei Shan, Maoqing Yao

机构 * AgiBot(未知机构) The Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学)

专题命中 模仿学习与强化学习 :robot learning(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 研究针对流匹配策略在值梯度强化学习中训练不稳定的问题,提出VINE方法。该方法通过在去噪步骤重建插值状态,创建稳定可微路径,实现稳定的端到端值梯度优化,在相关基准和任务中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27374 2026-06-26 cs.RO cs.CV 新提交 79%

World Action Models Enable Continual Imitation Learning with Recurrent Generative Replays

世界行动模型通过循环生成重放实现持续模仿学习

Manish Kumar Govind, Dominick Reilly, Smit Patel, Hieu Le, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 模仿学习与强化学习 :robot learning(abstract);manipulation(abstract);robot policy(abstract);分类 cs.RO、cs.CV

AI总结 提出循环生成重放(REGEN)框架,利用世界行动模型(WAM)生成伪重放轨迹,使机器人策略在不存储原始演示的情况下复习先前任务,在仿真和真实实验中减少50%灾难性遗忘,接近真实重放性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24597 2026-06-24 cs.CL 新提交 78%

Qwen-AgentWorld: Language World Models for General Agents

Qwen-AgentWorld: 通用智能体的语言世界模型

Yuxin Zuo, Zikai Xiao, Li Sheng, Fei Huang, Jianhong Tu, Yuxuan Liu, Tianyi Tang, Xiaomeng Hu, Yang Su, Qingfeng Lan, Yantao Liu, Qin Zhu, Yinger Zhang, Bowen Yu, Haiquan Zhao, Haiyang Xu, Jianxin Yang, Jiayang Cheng, Junyang Wang, Lianghao Deng, Mingfeng Xue, Tianyi Bai, Yang Fan, Yubo Ma, Yucheng Li, Zeyu Cui, Zhihai Wang, Zhihui Xie, Zhuorui Ye, An Yang, Dayiheng Liu, Jingren Zhou, Ning Ding

机构 * Qwen Team(Qwen团队)

专题命中 模仿学习与强化学习 :world model(title,abstract)

AI总结 提出基于语言模型的世界模型Qwen-AgentWorld,通过三阶段训练(CPT、SFT、RL)模拟7个领域的智能体环境,并构建AgentWorldBench基准,实验表明其显著优于现有模型,且能作为环境模拟器和智能体基础模型提升下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14674 2026-06-15 cs.CL 新提交 78%

AgentSpec: Understanding Embodied Agent Scaffolds Through Controlled Composition

AgentSpec: 通过受控组合理解具身智能体脚手架

Jixuan Chen, Jianzhi Shen, Haoqiang Kang, Zhi Hong, Qingyi Jiang, Soham Bose, Yiming Zhang, Leon Leng, Amit Vyas, Lingjun Mao, Siru Ouyang, Kun Zhou, Lianhui Qin

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校) Johns Hopkins University(约翰霍普金斯大学) University of Washington(华盛顿大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 模仿学习与强化学习 :embodied agent(title,abstract)

AI总结 提出AgentSpec模块化规范框架,将具身智能体表示为可复用策略组件的类型化组合,通过标准化接口实现受控组件替换与重组,揭示脚手架兼容性和交互效应对性能的主导作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08491 2026-08-11 cs.AI 新提交 77%

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models

TrustRoboReward:面向多范式机器人奖励模型的偏好有序保序分数编辑方法

Yidong Wang, Yan Zhan, Ziteng Feng, Zhenyu Cui, Ziyi Zhou, Renzhao Liang, Jiaxuan Zhu, Zilei Yang, Yiran Zhao, Zhongkuan Mao, Bo Jia, Hanchu Ni, Chenggang Xie, Biao Liu, Yi Zhang, Yong Dai, Xiaozhu Ju, Wei Ye, Shikun Zhang

机构 * Peking University(北京大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) University of Science and Technology of China(中国科学技术大学) Southeast University(东南大学) Southern University of Science and Technology(南方科技大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Beijing Language and Culture University(北京语言大学) Sichuan University(四川大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 模仿学习与强化学习 :embodied AI(abstract);manipulation(abstract);robotic(abstract);分类 cs.AI

AI总结 针对现有机器人奖励模型的跨范式偏好与分数不一致问题,本文提出 TrustRoboReward 框架,通过 POISE 方法解决反转冲突,训练的 Qwen3-VL-4B 性能接近 GPT-5-mini,优于 RoboReward 基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23371 2026-06-23 cs.RO 新提交 77%

TSD: A Physics-Inspired Trajectory Saliency Detector for Efficient Imitation Learning

TSD:一种受物理启发的轨迹显著性检测器用于高效模仿学习

Yiming Zhao, Gongrui Ma, Qingkai Li, Mingguo Zhao

机构 * Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 模仿学习与强化学习 :robot learning(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出一种无需训练、即插即用的轨迹显著性检测器TSD,通过空间熵和向心加速度两个物理指标识别关键轨迹,实现数据集压缩和扩展,平均减少25%数据量仍保持或提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22509 2026-06-23 cs.AI 新提交 77%

Imagine to Ensure Safety in Hierarchical Reinforcement Learning

想象以确保分层强化学习的安全性

Gregory Gorbov, Artem Latyshev, Aleksandr I. Panov

机构 * Cognitive AI Systems Lab(认知人工智能系统实验室) Moscow Independent Research Institute of Artificial Intelligence(莫斯科独立人工智能研究所) FRC Computer Science RAS(俄罗斯科学院联邦研究中心计算机科学研究所)

专题命中 模仿学习与强化学习 :manipulation(abstract);navigation(abstract);world model(abstract);分类 cs.AI

AI总结 提出结合可学习世界模型与高低层策略的分层方法,通过高层生成安全子目标、低层利用想象滚动减少不安全行为,在长时域任务中显著优于现有安全强化学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09381 2026-06-09 cs.RO 新提交 77%

ReGIL: Retrieval-Guided Imitation Learning from a Single Demonstration

ReGIL: 基于检索引导的单一示范模仿学习

Yuying Zhang, Francesco Verdoja, Wenyan Yang, Ville Kyrki

机构 * Aalto University(阿尔托大学)

专题命中 模仿学习与强化学习 :robot learning(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出ReGIL框架,将单一示范作为外部记忆,通过检索引导探索、生成正则化缓冲和构建奖励,在LIBERO和Meta-World基准及真实机器人任务中显著提升成功率和训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08039 2026-06-09 cs.RO 新提交 77%

MuJoCo-Drones-Gym: A GPU-Accelerated Multi-Drone Simulator for Control and Reinforcement Learning

MuJoCo-Drones-Gym: 用于控制和强化学习的GPU加速多无人机模拟器

Manan Tayal

机构 * TAU-Intelligence

专题命中 模仿学习与强化学习 :robotics(abstract);navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出基于MuJoCo物理引擎的GPU加速多无人机模拟器MuJoCo-Drones-Gym,支持任意数量Crazyflie 2.x纳米四旋翼,提供模块化物理模型、动作接口和观测空间,集成PettingZoo多智能体强化学习,涵盖悬停、速度跟踪等七种任务环境。

Comments 18 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17760 2026-07-21 cs.LG cs.AI cs.RO 新提交 75%

Generalize and Guide: Decomposing Rewards for Few-Shot Inverse Reinforcement Learning

泛化与引导:用于少样本逆强化学习的奖励分解

Ziyi Liu, Grace Zhang

专题命中 模仿学习与强化学习 :manipulation(abstract);navigation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究少样本逆强化学习(FM - IRL)问题,提出多任务判别器近邻引导的IRL(MPG)方法,通过学习两个互补奖励组件,在多种有显著变化的任务上验证有效性,平均成功率达81.2%,优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09336 2026-07-13 cs.LG cs.AI cs.RO 新提交 75%

Shortcut Trajectory Planning for Efficient Offline Reinforcement Learning

用于高效离线强化学习的捷径轨迹规划

Guanquan Wang, Yoshimasa Tsuruoka

机构 * The University of Tokyo(东京大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);navigation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究针对离线强化学习中轨迹规划器的问题,提出捷径轨迹规划(STP)框架,将捷径模型作为轨迹生成器,单阶段训练条件捷径轨迹模型,支持可调推理,用增强可行性感知校正的评论家选候选计划,在多任务基准测试中性能强且简化训练管道。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23640 2026-06-23 cs.LG cs.AI cs.RO stat.ML 新提交 75%

Learning Process Rewards via Success Visitation Matching for Efficient RL

通过成功访问匹配学习过程奖励以实现高效强化学习

Raymond Tsao, Andrew Wagenmaker, Sergey Levine

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 针对稀疏奖励导致的信用分配难题,提出通过判别器区分成功/失败轨迹,生成密集过程奖励以匹配成功访问分布,在不改变最优策略下加速机器人控制策略微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09758 2026-06-09 cs.RO cs.AI cs.LG 新提交 75%

Difference-Aware Retrieval Policies for Imitation Learning

差异感知的模仿学习检索策略

Quinn Pfeifer, Ethan Pronovost, Paarth Shah, Khimya Khetarpal, Siddhartha Srinivasa, Abhishek Gupta

机构 * Paul G. Allen School of Computer Science & Engineering, University of Washington(华盛顿大学保罗·G·艾伦计算机科学与工程学院) Toyota Research Institute(丰田研究所) Google DeepMind(谷歌DeepMind) Mila

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出DARP,一种半参数检索式模仿学习方法,通过基于k近邻的局部邻域结构重参数化,解决行为克隆的分布外泛化问题,在连续控制和机器人操作任务中性能提升15-46%。

Comments 12 pages, 7 figures, 3 tables. Accepted to ICLR 2026. Code and demos available at https://weirdlabuw.github.io/darp-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12306 2026-08-13 cs.LG cs.AI 新提交 73%

Redistribution-based Cost Inference Improves Sparse Safe Offline RL

基于重分配的代价推断改进稀疏安全离线强化学习

Ebenezer Gelo, Geraud Nangue Tasse, Steven James, Benjamin Rosman

机构 * University of the Witwatersrand(威特沃特斯兰德大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.LG

AI总结 针对安全离线强化学习中稀疏轨迹级停止反馈问题,提出RCI框架转换为密集每步代价,经理论证明转换无损,实验在两类任务上违规率更低且鲁棒性好。

Comments Accepted at the 1st IJCAI Workshop on Safe Physical AI (SPAI 2026), affiliated with IJCAI/ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09866 2026-07-14 cs.RO cs.AI 新提交 73%

Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning

Robo-ValueRL:离线到在线强化学习的可靠价值估计

Wenke Xia, Pei Ren, Wenbo Yu, Yizhuo Zhang, Jifan Li, Yixue Zhang, Yinuo Zhao, Qingyang Gao, Jianlong Fu, Jian Tang, Ji-Rong Wen, Zhengping Che, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) Beijing Forestry University(北京林业大学) Peking University(北京大学) Microsoft Research(微软研究院)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 研究离线到在线强化学习中价值函数可靠性对策略优化的影响,提出Robo-ValueRL框架,通过特定指标评估价值估计可靠性并用于策略预训练和在线改进,实验显示其能有效提升下游策略性能,突出价值引导数据利用对策略改进的重要性。

Comments Please refer to our website: https://gewu-lab.github.io/Robo-ValueRL/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04265 2026-07-07 cs.RO cs.AI 新提交 73%

HALO-WA: Hybrid-Attention Latent-Guided Online Reinforcement Learning for World-Action Models

HALO-WA:用于世界-动作模型的混合注意力潜在引导在线强化学习

Angen Ye, Weijie Ke, Xiaofeng Wang, Xinze Chen, Chaojun Ni, Guosheng Zhao, Boyuan Wang, Zheng Zhu, Junjie Xie, Dapeng Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) GigaAI(字节跳动公司(推测,根据常见语境)) Tsinghua University(清华大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对世界-动作模型在现实精度任务中易受多种误差影响的问题,提出HALO-WA框架,利用潜在特征和动作先验,通过混合注意力结构实现快速在线适应,提升动作块精度,实验验证效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01225 2026-07-02 cs.LG cs.AI 新提交 73%

Language-Critique Imitation Learning from Suboptimal Demonstrations

语言-批评模仿学习从次优演示中

Chih-Han Yang, Dai-Jie Wu, Yun-Ping Huang, Ping-Chun Hsieh, Kenneth Marino, Shao-Hua Sun

机构 * Graduate Institute of Communication Engineering, National Taiwan University (NTU)(国立台湾大学电信工程学研究所) University of Utah(犹他大学) National Yang Ming Chiao Tung University(国立阳明交通大学) NTU Artificial Intelligence Center of Research Excellence(国立台湾大学人工智能卓越研究中心)

专题命中 模仿学习与强化学习 :manipulation(abstract);navigation(abstract);分类 cs.AI、cs.LG

AI总结 提出语言批评框架,用自然语言作为结构化监督信号从次优演示中学习策略,避免压缩为标量,在连续控制任务上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31846 2026-07-01 cs.RO cs.AI 新提交 73%

Z-1: Efficient Reinforcement Learning for Vision-Language-Action Models

Z-1: 面向视觉-语言-动作模型的高效强化学习

Lang Cao, Renhong Chen, Luyi Li, Peng Wang, Mofan Peng, Yitong Li

机构 * Zioneer Robot Team(Zioneer机器人团队)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出Z-1框架,结合共享前缀生成、树状轨迹分支、完成感知奖励校准和选择性联合训练,通过GRPO策略在24个RoboCasa任务上平均成功率80.6%,较SFT提升13.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31377 2026-07-01 cs.RO cs.AI 新提交 73%

Stage-Transition Dense Reward Modeling for Reinforcement Learning

面向强化学习的阶段转换密集奖励建模

Yang Yang, Bingjie Chen, Zihan Wang, Yizhe Li, Guoping Pan, Yi Cheng, Houde Liu

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Zerith Robotics

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出阶段转换密集奖励(STDR)框架,利用专家视频学习任务阶段结构,提供阶段转换和阶段内进展两种密集奖励信号,结合OOD检测和抓取调节模块,提升机器人操作任务的样本效率和成功率。

Comments 8 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28152 2026-06-29 cs.LG cs.RO 新提交 73%

Regularized Reward-Punishment Reinforcement Learning

正则化奖惩强化学习

Jiexin Wang, Eiji Uchibe

机构 * Dept. of Brain Robot Interface, ATR Computational Neuroscience Laboratories(ATR计算神经科学实验室脑机接口系)

专题命中 模仿学习与强化学习 :navigation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 提出KL耦合策略正则化(KCPR)框架,通过策略间动态先验交互实现奖惩强化学习中的策略协调,并衍生出KL耦合软最优性(KCSO)及深度实现klDMP,在网格世界和Gazebo机器人导航任务中提升了安全性和学习稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏