arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4106 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4106 篇

2607.24860 2026-07-29 cs.RO 新提交 79%

Egocentric Station Holding of Robotic Fish in Unknown Turbulent Background Flow

未知湍流背景流中机器鱼的自我中心驻位

Xiaozhu Lin, Xu Huang, Hongru Dai, Xiaopei Liu, Junzhi Yu, Yang Wang

机构 * School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院) State Key Laboratory for Turbulence and Complex Systems, Department of Advanced Manufacturing and Robotics, College of Engineering, Peking University(北京大学工程科学学院先进制造与机器人系湍流与复杂系统国家重点实验室) Laboratory of Cognitive and Decision Intelligence for Complex System, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能实验室)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 研究机器鱼在未知湍流背景流中的自我中心驻位问题,提出SWiFT框架,集成实验装置、CFD模拟器及转移管道,通过强化学习探索驻位策略,相比现有方法有显著改进,验证了仅靠自我中心反馈可驻位,推动机器鱼控制发展。

Comments 20 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21113 2026-07-24 cs.RO 新提交 79%

RL-MACRO: A Cybernetic Closed-Loop Intelligence Framework for Multimodal Adaptive Robotic Craniotomy

RL-MACRO:一种用于多模态自适应机器人开颅手术的控制论闭环智能框架

Xiao Zhang, Jiaxuan Li, Renzhen Le, Di Wu, Chao Sun, Jiachen Zhu, Haoyuan Zhang, Xiang Li, Jian Liu, Zhenzhi Ying, Pengfei Zhang, Liming Shu

机构 * Dalian University of Technology(大连理工大学) Second Hospital of Dalian Medical University(大连医科大学附属第二医院) The University of Tokyo(东京大学)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 研究针对自主机器人开颅手术面临的挑战,提出RL-MACRO框架,通过多模态感知、自适应决策和机器人执行实现闭环控制,利用CNN-LSTM观测器重建温度,经IQL策略和双头执行器优化行为,实验验证了该框架在骨切割方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14643 2026-07-17 cs.RO 新提交 79%

NavCMPO: Critic-Guided MeanFlow Policy Optimization for Adaptive Navigation

NavCMPO:用于自适应导航的评论家引导的平均流策略优化

Junjie An, Yi Wu, Xiao Liu, Yiqun Zhou, Yuechen Wu, Xiaoqing Guan, You Wang, Guang Li

机构 * Zhejiang University(浙江大学) Shandong University(山东大学)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO

AI总结 研究针对无地图视觉导航中策略的问题,提出NavCMPO框架,结合平均流轨迹生成、评论家引导细化和强化学习微调。在InternVLA - N1基准上有高成功率且降低推理延迟,并在Unitree Go2上实现有效模拟到现实的迁移。

Comments Accepted for presentation at IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14488 2026-07-17 cs.RO 新提交 79%

Safe Execution of RL Policies Via Acceleration-Based CBF-QP Constraint Enforcement for Real-World Robotic Deployments

通过基于加速度的CBF-QP约束执行实现强化学习策略在实际机器人部署中的安全执行

Bastien Muraccioli, Alice Cariou, Pierre-Alexandre Leziart, Mathieu Celerier, Arnaud Demont, Gentiane Venture, Mehdi Benallegue

机构 * CNRS–AIST Joint Robotics Laboratory (JRL)(法国国家科学研究中心与日本产业技术综合研究所联合机器人实验室) AIST(日本产业技术综合研究所) The University of Tokyo(东京大学)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 研究针对强化学习缺乏安全保障限制硬件部署的问题,提出基于加速度的CBF-QP安全过滤器Acc-CBF-QP,能在运行时约束策略于安全集,减少约束违反,保留标称任务性能,在机器人实验中效果显著,且流程开源。

Comments 8 pages, 4 figures. Accepted for publication at IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18300 2026-07-17 cs.LG 79%

Deep Reinforcement Learning Based Navigation with Macro Actions and Topological Maps

基于宏观动作和拓扑地图的深度强化学习导航

Simon Hakenes, Tobias Glasmachers

机构 * Institute for Neural Computation, Faculty of Computer Science, Ruhr University Bochum, Germany(神经计算研究所,计算机科学学院,博德姆鲁尔大学)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.LG

AI总结 本文提出了一种基于拓扑地图和宏观动作的深度强化学习导航方法,通过简化问题复杂度实现高效的样本学习。

Comments 14 pages, 6 figures

Journal ref Machine Learning, Optimization, and Data Science. LOD 2025. Lecture Notes in Computer Science, vol 16467

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10930 2026-07-16 cs.RO 版本更新 79%

Where to Touch, How to Contact: A Hierarchical RL-MPC Framework for Geometry-Aware Sim-to-Real Manipulation

何处触碰,如何接触:面向几何感知的长时间灵巧操作的分层RL-MPC框架

Zhixian Xie, Yu Xiang, Michael Posa, Wanxin Jin

机构 * Arizona State University(亚利桑那州立大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Pennsylvania(宾夕法尼亚大学)

专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO

AI总结 提出分层RL-MPC框架,高层RL策略预测接触意图(接触位置和子目标位姿),低层接触隐式MPC优化局部接触模式并实时重规划,实现几何泛化的非抓取操作,数据效率提升10倍且零样本迁移到真实环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09130 2026-07-13 cs.RO 新提交 79%

Vascular Geometry Characterization for AI-Based Endovascular Navigation

基于人工智能的血管内导航的血管几何特征表征

Han-Ru Wu, Harry Robertshaw, Lisa Dwyer-Joyce, Thomas C Booth, Alejandro Granados

机构 * National Taiwan University Hospital(台湾大学附属医院) Chelsea & Westminster Hospital(切尔西和威斯敏斯特医院)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO

AI总结 研究旨在识别与血管内导航难度相关的血管指标并开发自动化流程,通过分割血管树测量指标,用RL算法导航并分析结果,发现血管几何形状影响导航难度,所提流程为相关评估奠定基础。

Comments Int J CARS (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19990 2026-07-08 cs.AI 新提交 79%

Reward as An Agent for Embodied World Models

奖励作为具身世界模型的智能体

Pu Li, Zhigang Lin, Qiang Wu, Yongxuan Lv, Fei Wang, Shan You

机构 * ACE Robotics(ACE机器人)

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI

AI总结 提出奖励智能体框架和动态感知 rollout 多样化方法,通过鲁棒验证支持更广泛探索,缓解奖励黑客问题,提升世界模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01925 2026-07-03 cs.RO 新提交 79%

SPLC: Social Preference Learning for Crowd Robot Navigation

SPLC:面向人群机器人导航的社会偏好学习

Zixuan Chen, Hao Fu, Haiwen Hu, Shiquan Zheng

机构 * Wuhan University of Science and Technology(武汉科技大学) Hubei Province Key Laboratory of Intelligent Information Processing and Real-time Industrial System(湖北省智能信息处理与实时工业系统重点实验室)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO

AI总结 提出SPLC算法,通过社会偏好反馈机制自动生成偏好数据,消除详细奖励设计需求,提升离线强化学习在人群导航中的社会合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01651 2026-07-03 cs.RO 新提交 79%

One Demonstration Is Enough for Real-World Robotic Reinforcement Learning

一个演示足以实现真实世界机器人强化学习

Yuwan Liu, Hongze Yu, Song Liu, Yuhan Wang, Junge Zhang, Yaodong Yang, Yuanpei Chen, Ceyao Zhang

机构 * National Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institution of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能国家重点实验室) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) PKU-PsiBot Joint Lab(北大-鹏城实验室联合实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 模仿学习与强化学习 :robotic(title);manipulation(abstract);分类 cs.RO

AI总结 提出AutoSERL框架,仅需一个演示即可自动化真实世界机器人强化学习,通过滑动窗口干预、安全恢复和自动终止机制,在六个接触密集型任务上超越基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02714 2026-06-30 cs.CV 79%

ExploreVLA: Dense World Modeling and Exploration for End-to-End Autonomous Driving

ExploreVLA: 为端到端自动驾驶的密集世界建模与探索

Zihao Sheng, Xin Ye, Jingru Luo, Sikai Chen, Liu Ren

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.CV

AI总结 本文提出基于世界建模的统一理解与生成框架,通过密集监督和内在奖励提升自动驾驶策略探索能力,在NAVSIM和nuScenes基准上取得优异性能。

Comments Accepted to ECCV 2026. The code is available at https://zihaosheng.github.io/ExploreVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27861 2026-06-29 cs.RO 新提交 79%

PPO-EAL: Exact Augmented Lagrangian Proximal Policy Optimization for Safe Robotic Control

PPO-EAL:用于安全机器人控制的精确增广拉格朗日近端策略优化

Jiatao Ding, Songqun Gao, Andrea Del Prete, Matteo Saveriano

机构 * University of Trento(特伦托大学)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 提出PPO-EAL框架,将精确增广拉格朗日优化与近端策略优化结合,通过裁剪策略更新和精确二次惩罚项实现安全约束,在多种机器人任务中优于现有方法。

Comments 11 pages, 8 figures and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27483 2026-06-29 cs.AI 新提交 79%

Internalizing the Future: A Unified Agentic Training Paradigm for World Model Planning

内化未来:一种统一的世界模型规划智能体训练范式

Xuan Zhang, Zhijian Zhou, Lingfeng Qiao, Yulei Qin, Ke Li, Xing Sun, Xiaoyu Tan, Chao Qu, Yuan Qi

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Tencent Youtu Lab(腾讯优图实验室)

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI

AI总结 提出一种三阶段训练范式(WM-AMT、FE-SFT、FC-RL),使LLM智能体内化世界模型以进行前瞻性规划,在搜索和数学推理任务上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26048 2026-06-29 cs.RO cs.SY eess.SY 新提交 79%

Deep Reinforcement Learning-Enhanced Event-Triggered Data-Driven Predictive Control for a 3D Cable-Driven Soft Robotic Arm

深度强化学习增强的事件触发数据驱动预测控制用于三维缆索驱动软体机械臂

Cheng Ouyang, Moeen Ul Islam, Kaixiang Zhang, Zhaojian Li, Xiaobo Tan, Dong Chen

机构 * Mississippi State University(密西西比州立大学) Michigan State University(密歇根州立大学)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 提出一种强化学习自适应事件触发DeePC框架,通过训练RL策略决定何时调用优化器,在保持跟踪精度的同时减少计算开销,实验显示优化频率降低66%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26955 2026-06-26 cs.RO 新提交 79%

RobOralScan: Learning Active Intraoral Scanning for Robotic Dental Reconstruction

RobOralScan:面向机器人牙科重建的主动口内扫描学习

Jinhyung Lee, Haeun Yun, Siwon Kim, Gihyun Baek, Sungho Moon, Sehyun Hwang, Sunghoon Im

机构 * DGIST(大邱庆北科学技术院)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 提出基于强化学习的机器人自动口内扫描方法RobOralScan,通过几何记忆观测空间和牙齿级覆盖学习,提升全弓扫描的覆盖率和均匀性,实现高精度重建。

Comments 24 pages, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25754 2026-06-25 cs.RO 新提交 79%

Stage-Aware and Roughness-Constrained Diffusion Policy for Multi-Stage Robotic Polishing

阶段感知与粗糙度约束的扩散策略用于多阶段机器人抛光

Shuai Ke, Jiexin Zhang, Huan Zhao, Zhiao Wei, Yikun Guo, Tiange Wu, Guoqiang Guo, Haoyuan Zhou, Jie Pan, Han Ding

机构 * State Key Laboratory of Intelligent Manufacturing Equipment and Technology, Huazhong University of Science and Technology(华中科技大学智能制造装备与技术国家重点实验室) Shanghai Spaceflight Precision Machinery Institute(上海航天精密机械研究所)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 提出阶段感知与粗糙度约束扩散策略(SRDP),通过多模态观测推断阶段后验并约束去噪过程,实现无外部标签的阶段一致动作生成,提升多阶段抛光质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21543 2026-06-24 cs.RO 版本更新 79%

Self-CriTeach: LLM Self-Teaching and Self-Critiquing for Improving Robotic Planning via Automated Domain Generation

Self-CriTeach: LLM 自我教学与自我批评用于通过自动领域生成提升机器人规划

Jinbang Huang, Zhiyuan Li, Yuanzhao Hu, Zhanguang Zhang, Mark Coates, Xingyue Quan, Yingxue Zhang

机构 * Huawei Noah's Ark Lab(华为诺亚实验室) University of Toronto(多伦多大学) University of British Columbia(不列颠哥伦比亚大学) McGill University(麦吉尔大学)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出Self-CriTeach框架,通过LLM自动生成符号规划领域,用于自我教学生成规划问题-计划对及自我批评生成结构化奖励信号,提升机器人规划性能与泛化能力。

Comments International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20698 2026-06-23 cs.RO 新提交 79%

SafeDojo: Safe Reinforcement Learning for VLA via Interactive World Model

SafeDojo:基于交互世界模型的安全强化学习用于视觉-语言-动作模型

Kai Tang, Peidong Jia, Zhong Chu, Jixian Wu, Rui Ma, Jiajun Cao, Fangyuan Zhao, Sixiang Chen, Yichen Guo, Xiaowei Chi, Chun-Kai Fan, Kevin Zhang, Jinchang Xu, Fubing Yang, Weishi Mi, Xiaozhu Ju, Jian Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology(香港科技大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.RO

AI总结 提出SafeDojo,首个基于模型的安全强化学习框架,通过交互式视频世界模型进行想象学习安全动作,结合解耦的任务奖励和安全代价信号,在SafeLIBERO和真实机器人上取得最佳安全成功率。

Comments 20 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18625 2026-06-18 cs.RO 新提交 79%

SRL: Combining SLIP Model and Reinforcement Learning for Agile Robotic Jumping

SRL:结合SLIP模型与强化学习实现敏捷机器人跳跃

Xiaowen Hu, Linqi Ye, Yudi Zhu, Chenyue Shao, Rankun Li, Qingdu Li, Yan Peng

机构 * Institute of Artificial Intelligence, Shanghai University(上海大学人工智能研究院) Institute of Machine Intelligence, University of Shanghai for Science and Technology(上海理工大学机器智能研究院)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 提出SRL框架,融合SLIP模型的物理基线与强化学习的自适应能力,通过前馈控制信号与实时反馈优化机器人跳跃,显著减少训练时间并保持高精度跟踪。

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16621 2026-06-16 cs.RO 新提交 79%

Reinforcement Learning with Inner-loop Dynamics Estimator for Aerial Manipulation under Uncertainty

基于内环动力学估计器的强化学习在不确定性下的空中操纵

Shivansh Pratap Singh, Samaksh Ujjwal, Ishita Chaudhary, V R Vasudevan, Rishabh Dev Yadav, Spandan Roy

机构 * International Institute of Information Technology Hyderabad(国际信息技术学院海德拉巴) University of Manchester(曼彻斯特大学)

专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO

AI总结 提出一种分层控制框架,结合强化学习与外环与内环动力学估计器,实现直接任务驱动控制,在硬件实验中降低末端执行器跟踪误差并提高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16572 2026-06-16 cs.RO 新提交 79%

Steering Generative Reinforcement Learning into Stable Robotic Controller

将生成式强化学习引导至稳定机器人控制器

Yixuan Wang, Shutong Ding, Ke Hu, Tianxiang Gui, Jingya Wang, Ye Shi

机构 * ShanghaiTech University(上海科技大学)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 提出SteerGenPO框架,通过潜在空间强化学习将训练好的生成式策略转化为鲁棒的确定性机器人控制器,在Isaac Lab和Unitree G1任务上优于基线方法,实现更稳定的推理行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13675 2026-06-15 cs.RO 新提交 79%

Improving Robotic Generalist Policies via Flow Reversal Steering

通过流反转引导改进机器人通用策略

Andy Tang, William Chen, Andrew Wagenmaker, Chelsea Finn, Sergey Levine

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

专题命中 模仿学习与强化学习 :robotic(title);manipulation(abstract);分类 cs.RO

AI总结 提出流反转引导(FRS)方法,通过逆向流策略找到次优动作的潜在噪声并映射到通用策略的动作模式,提升零样本控制、行为克隆和强化学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11577 2026-06-11 cs.RO 新提交 79%

Distortion-Resilient Robotic Imitation Learning for Autonomous Cable Routing

抗畸变机器人模仿学习用于自主电缆布线

Hao Wang, Fu-Zhao Ou, Shiqi Wang, Zhaolin Wan, Xiaopeng Fan

机构 * School of Artificial Intelligence, Harbin Institute of Technology(哈尔滨工业大学人工智能学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Pengcheng Laboratory(鹏城实验室) Suzhou Research Institute, Harbin Institute of Technology(哈尔滨工业大学苏州研究院)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 提出一种包含图像质量评估、置信度学习和决策模块的机器人模仿学习框架,在图像畸变下仍保持高性能,实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10927 2026-06-10 cs.RO 新提交 79%

AllDayNav: Lifelong Navigation via Real-World Reinforcement Learning

AllDayNav: 通过真实世界强化学习实现终身导航

Hang Yin, Yinan Liang, Jiazhao Zhang, Jiahang Liu, Minghan Li, Zhizheng Zhang, He Wang

机构 * Tsinghua University(清华大学) Galbot Robotics Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO

AI总结 提出AllDayNav框架,利用自进化多模态记忆和强化学习隐式编码场景动态,在跨房间、跨回合和跨任务场景中实现接近100%的成功率,超越基于地图、VLM和RL的基线方法。

Comments Project Page: https://bagh2178.github.io/AllDayNav/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26974 2026-06-08 cs.RO 版本更新 79%

Trust, Geometry, and Rules: A Credibility-Aware Reinforcement Learning Framework for Safe USV Navigation under Uncertainty

信任、几何与规则:不确定性下安全USV导航的可信感知强化学习框架

Yuhang Zhang, Shuqi Chai, Yukang Zhang, Liusha Yang, Mingchuan Zhang, Wei Wang, Qingjiang Shi, Quanbo Ge

机构 * School of Information Engineering, Henan University of Science and Technology(河南科技大学信息工程学院) Shenzhen Research Institute of Big Data(深圳大数据研究院) School of Logistics Engineering, Shanghai Maritime University(上海 Maritime University物流工程学院) Shenzhen Technology University(深圳科技大学) School of Computer Science, Wuhan University(武汉大学计算机学院) School of Software Engineering, Tongji University(同济大学软件工程学院)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO

AI总结 提出一种集成可信感知学习、几何安全屏蔽和连续规则感知嵌入的强化学习框架,以解决动态海洋环境中USV导航的安全性和COLREGs合规性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05687 2026-06-05 cs.RO cs.SY eess.SY 79%

Accelerating and Scaling MPC-Guided Reinforcement Learning for Humanoid Locomotion and Manipulation

加速与扩展MPC引导的强化学习在类人机器人行走与操作中的应用

Junheng Li, Liang Wu, Sergio A. Esteban, Lizhi Yang, Ján Drgoňa, Aaron D. Ames

机构 * California Institute of Technology(加州理工学院) Johns Hopkins University(约翰霍普金斯大学)

专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO

AI总结 本文提出了一种基于质心动力学MPC奖励的MPC-RL框架,并开发了并行批处理GPU求解器π^nMPC,以高效实现类人机器人的行走与操作技能。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.01292 2026-06-04 cs.RO cs.SY eess.SY 79%

A General Safety Framework for Learning-Based Control in Uncertain Robotic Systems

一种用于不确定机器人系统中基于学习的控制的通用安全框架

Jaime F. Fisac, Anayo K. Akametalu, Melanie N. Zeilinger, Shahab Kaynama, Jeremy Gillula, Claire J. Tomlin

机构 * Department of Mechanical and Process Engineering, ETH Zurich(瑞士苏黎世联邦理工学院机械与过程工程系) Clearpath Robotics(Clearpath机器人公司) Electronic Frontier Foundation(电子前沿基金会)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出一种通用安全框架,结合Hamilton-Jacobi可达性方法和任意学习算法,通过近似系统动力学知识确保约束满足,同时减少对学习过程的干扰,并引入贝叶斯机制提升安全分析。

Comments Accepted for publication in IEEE Transactions on Automatic Control. Video with experiments: https://youtu.be/WAAxyeSk2bw

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15971 2026-05-26 cs.RO 79%

OHP-RL: Online Human Preference as Guidance in Reinforcement Learning for Robot Manipulation

OHP-RL:在线人类偏好作为机器人操作强化学习中的指导

Yunyang Mo, Jian Li, Qiwei Wu, Yihang Kang, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO

AI总结 提出OHP-RL框架,利用人类干预作为偏好信息,通过状态依赖偏好门自适应调节策略学习,在Franka机器人接触丰富的操作任务中实现高成功率、快速收敛和低人类干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09179 2026-05-26 cs.AI 79%

Hide-and-Shill: A Reinforcement Learning Framework for Market Manipulation Detection in Symphony-a Decentralized Multi-Agent System

Hide-and-Shill:面向交响乐系统中市场操纵检测的强化学习框架——一个去中心化多智能体系统

Ronghua Shi, Yiou Liu, Yuchun Feng, Lynn Ai, Bill Shi, Zhuang Liu

机构 * Department of Information Systems, City University of Hong Kong(香港城市大学信息系统系) Business School, University of New South Wales(新南威尔士大学商学院) Division of Engineering Science, University of Toronto(多伦多大学工程科学系) ProphetAI Data Technology Co., Ltd.(ProphetAI数据技术有限公司) Gradient, 3 FRASER STREET DUO TOWER, SINGAPORE(Gradient新加坡办公室)

专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.AI

AI总结 提出一个多智能体强化学习框架,通过动态对抗博弈建模操纵者与检测者的交互,利用延迟代币价格反应识别可疑模式,并集成GRPO、理论奖励函数和多模态智能体管道,在去中心化交响乐系统中实现无需中心化预言机的鲁棒操纵检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23027 2026-05-25 cs.RO 79%

PIMbot: A Self-Adaptive Attack Framework for Adversarial Manipulation of Multi-Robot Reinforcement Learning

PIMbot:一种用于多机器人强化学习对抗性操纵的自适应攻击框架

Zexin Li, Ziliang Zhang, Hyoseung Kim, Cong Liu

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO

AI总结 提出PIMbot框架,通过奖励激励操纵和策略操纵两种互补杠杆,并采用自适应多目标控制器在线平衡,有效操纵多机器人社会困境环境,实验验证了其在仿真和真实嵌入式系统中的有效性。

Comments Extension version of IROS'23

详情

展开后加载摘要…

URL PDF HTML 收藏