arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4113 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4113 篇

2510.09469 2026-02-24 cs.MA cs.AI cs.RO 62%

Towards Information-Optimized Multi-Agent Path Finding: A Hybrid Framework with Reduced Inter-Agent Information Sharing

迈向信息优化的多智能体路径寻找:一种减少智能体间信息共享的混合框架

Bharath Muppasani, Ritirupa Dey, Biplav Srivastava, Vignesh Narayanan

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种减少智能体间信息共享的混合框架IO-MAPF,通过强化学习和轻量级集中协调器实现高效多智能体路径寻找,在信息受限条件下保持高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18694 2026-02-24 cs.LG cs.AI 62%

In-Context Planning with Latent Temporal Abstractions

基于潜在时间抽象的上下文规划

Baiting Luo, Yunuo Zhang, Nathaniel S. Keplinger, Samir Gupta, Abhishek Dubey, Ayan Mukhopadhyay

机构 * Vanderbilt University(范德比大学) William & Mary(威廉与玛丽学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 I-TAP通过学习离散时间抽象空间,实现高效且鲁棒的上下文规划,在部分可观测和随机动态环境中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18097 2026-02-23 cs.RO cs.LG 62%

Interacting safely with cyclists using Hamilton-Jacobi reachability and reinforcement learning

与骑行者安全交互的框架:利用哈密顿-雅可比可达性分析与强化学习

Aarati Andrea Noronha, Jean Oh

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出结合哈密顿-雅可比可达性分析与深度Q学习的框架,用于实现自动驾驶车辆与骑行者的安全高效交互。

Comments 7 pages. This manuscript was completed in 2020 as part of the first author's graduate thesis at Carnegie Mellon University

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18025 2026-02-23 cs.AI cs.RO 62%

Cross-Embodiment Offline Reinforcement Learning for Heterogeneous Robot Datasets

跨体态离线强化学习用于异构机器人数据集

Haruki Abe, Takayuki Osa, Yusuke Mukuta, Tatsuya Harada

机构 * The University of Tokyo(东京大学) RIKEN Center for Advanced Intelligence Project(理化学研究所先进情报项目中心)

专题命中 模仿学习与强化学习 :robot policy(abstract);分类 cs.RO、cs.AI

AI总结 本文提出跨体态离线强化学习方法,通过整合离线强化学习与跨体态学习,提升异构机器人数据集的预训练效果,有效解决次优数据带来的冲突问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17978 2026-02-23 cs.LG cs.AI 62%

Learning Optimal and Sample-Efficient Decision Policies with Guarantees

学习具有保证的最优和样本高效的决策策略

Daqian Shao

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种样本高效且具有保证的学习方法,用于在存在隐藏混杂因素的情况下学习最优决策策略,并通过实验验证了其在现实决策中的有效性。

Comments A thesis submitted for the degree of DPhil in Computer Science at Oxford

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17676 2026-02-23 cs.AI cs.CL cs.LG 62%

Epistemic Traps: Rational Misalignment Driven by Model Misspecification

知识陷阱:由模型规格不准确驱动的理性偏差

Xingcheng Xu, Jingjing Qu, Qiaosheng Zhang, Chaochao Lu, Yanqing Yang, Na Zou, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ShanghaiTech University(上海科技大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出主观模型工程,通过设计代理的内部信念结构来实现稳健对齐,揭示安全由认知先验决定而非奖励大小连续函数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16196 2026-02-19 cs.LG cs.AI cs.MA 62%

Graphon Mean-Field Subsampling for Cooperative Heterogeneous Multi-Agent Reinforcement Learning

图论均值场子采样用于协作异质多智能体强化学习

Emile Anand, Richard Hoffmann, Sarah Liaw, Adam Wierman

机构 * California Institute of Technology(加州理工学院) Harvard University(哈佛大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 GMFS通过子采样异质智能体交互,实现可扩展的协作多智能体强化学习,具有poly(κ)样本复杂度和O(1/√κ)最优性差距。

Comments 43 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15010 2026-02-19 cs.RO cs.LG 62%

BPP: Long-Context Robot Imitation Learning by Focusing on Key History Frames

BPP: 通过聚焦关键历史帧实现长上下文机器人模仿学习

Max Sobol Mark, Jacky Liang, Maria Attarian, Chuyuan Fu, Debidatta Dwibedi, Dhruv Shah, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学) Google DeepMind(谷歌DeepMind)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 BPP通过聚焦关键历史帧,提升机器人模仿学习在长上下文任务中的表现,成功率达70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16641 2026-02-18 quant-ph cs.AI cs.LG 62%

Hybrid Reward-Driven Reinforcement Learning for Efficient Quantum Circuit Synthesis

混合奖励驱动强化学习用于高效量子电路综合

Sara Giordano, Kornikar Sen, Miguel A. Martin-Delgado

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种混合奖励驱动强化学习方法,用于高效合成量子电路,通过结合静态奖励和动态惩罚,优化电路深度和门数,提升量子电路综合效率。

Comments 35 pages, 7 figures, color figures

Journal ref Quantum Mach. Intell. 8, 9 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20326 2026-02-17 cs.RO cs.AI 62%

Deep Reinforcement Learning based Autonomous Decision-Making for Cooperative UAVs: A Search and Rescue Real World Application

基于深度强化学习的自主决策合作无人机:一种搜索与救援现实应用

Thomas Hickling, Maxwell Hogan, Abdulla Tammam, Nabil Aouf

机构 * School of Science(科学学院) Technology City St George's University of London London, United Kingdom(圣乔治伦敦大学技术学院伦敦英国)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出基于深度强化学习的自主决策框架,用于室内搜索与救援任务,通过APF奖励和图注意力网络实现高效任务分配与导航,实现实时厘米级稳定性,取得竞赛第一名。

Comments 22 Pages, 24 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14587 2026-02-17 cs.LG cs.AI math.OC math.ST stat.TH 62%

Decoupled Continuous-Time Reinforcement Learning via Hamiltonian Flow

通过哈密顿流实现解耦的连续时间强化学习

Minh Nguyen

机构 * Google(谷歌) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了解耦的连续时间强化学习算法,通过哈密顿流更新价值函数,并利用扩散生成器学习优势率函数,实现了在连续控制任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12846 2026-02-16 cs.LG cs.AI 62%

Amortized Reasoning Tree Search: Decoupling Proposal and Decision in Large Language Models

渐进推理树搜索:在大语言模型中解耦提案与决策

Zesheng Hong, Jiadong Yu, Hui Pan

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 ARTS通过解耦生成与验证,有效解决大语言模型中推理路径被压制的问题,实现74.6%的性能,优于完全微调策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12636 2026-02-16 cs.LG cs.RO 62%

Dual-Granularity Contrastive Reward via Generated Episodic Guidance for Efficient Embodied RL

双粒度对比奖励 via 生成 episodic 引导 为高效 embodied RL

Xin Liu, Yixuan Li, Yuhui Chen, Yuxing Qin, Haoran Li, Dongbin Zhao

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出DEG方法,通过生成episodic引导实现高效具身RL,无需人工标注,提升样本效率和任务完成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11583 2026-02-13 cs.AI cs.LG 62%

The Five Ws of Multi-Agent Communication: Who Talks to Whom, When, What, and Why -- A Survey from MARL to Emergent Language and LLMs

多智能体通信的五个W:谁与谁沟通,何时沟通,沟通什么,为何沟通——从MARL到涌现语言和LLMs的综述

Jingdi Chen, Hanqing Yang, Zongjun Liu, Carlee Joe-Wong

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了多智能体通信的五个W,探讨了从MARL到涌现语言和LLM的发展,分析了不同范式下的通信设计、权衡与挑战。

Comments Accepted at Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11524 2026-02-13 cs.LG cs.AI cs.CL 62%

Adaptive Milestone Reward for GUI Agents

自适应里程碑奖励用于GUI代理

Congmin Zheng, Xiaoyun Mo, Xinbei Ma, Qiqiang Lin, Yin Zhao, Jiachen Zhu, Xingyu Lou, Jun Wang, Zhaoxiang Wang, Weiwen Liu, Zhuosheng Zhang, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) OPPO Research Institute(OPPO研究院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 ADMIRE通过自适应里程碑奖励机制,解决长周期任务中奖励保真度与密度的矛盾,提升GUI代理的成功率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12314 2026-02-13 cs.LG cs.AI cs.CE cs.CR 62%

Thought Purity: A Defense Framework For Chain-of-Thought Attack

思维纯洁性:针对思维链攻击的防御框架

Zihao Xue, Zhen Bi, Long Ma, Zhenlin Hu, Yan Wang, Xueshu Chen, Zhenfang Liu, Kang Zhao, Jie Xiao, Jungang Lou

机构 * Huzhou University(湖州大学) Zhejiang Key Laboratory of Intelligent Education Technology and Application(浙江智能教育技术与应用重点实验室) University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) Zhejiang University of Technology(浙江工业大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TP框架,通过整合安全数据管道与强化学习,有效防御思维链攻击,同时保持模型在良性任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08244 2026-02-10 cs.LG cs.AI 62%

Learning in Context, Guided by Choice: A Reward-Free Paradigm for Reinforcement Learning with Transformers

在情境中学习,由选择引导:一种无奖励的强化学习与Transformer的范式

Juncheng Dong, Bowen He, Moyang Guo, Ethan X. Fang, Zhuoran Yang, Vahid Tarokh

机构 * Department of Electrical and Computer Engineering, Duke University, Durham, US(电子工程系,杜克大学,达勒姆,美国) Department of Computer Science, Duke University, Durham, US(计算机科学系,杜克大学,达勒姆,美国) Department of Biostatistics and Bioinformatics, Duke University, Durham, US(生物统计学与生物信息学系,杜克大学,达勒姆,美国) Department of Statistics and Data Science, Yale University, New Haven, US(统计学与数据科学系,耶鲁大学,纽 Haven,美国)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ICPRL范式,通过仅使用偏好反馈实现无奖励的强化学习,适用于奖励难以获取的场景,实验显示其在连续控制等任务中性能接近传统ICRL方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07210 2026-02-09 cs.RO cs.AI 62%

HyPlan: Hybrid Learning-Assisted Planning Under Uncertainty for Safe Autonomous Driving

HyPlan:在不确定环境下通过混合学习辅助规划实现安全自动驾驶

Donald Pfaffmann, Matthias Klusch, Marcel Steinmetz

机构 * Saarland University, Computer Science Dept.(萨尔兰大学计算机科学系) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) French National Centre for Scientific Research (CNRS)(法国国家科学研究中心)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 HyPlan通过结合多智能体行为预测、深度强化学习和POMDP规划,实现安全且高效的自动驾驶导航

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01299 2026-02-09 cs.AI cs.LG 62%

Scalable In-Context Q-Learning

可扩展的上下文Q学习

Jinmei Liu, Fuhong Liu, Zhenhong Sun, Jianye Hao, Huaxiong Li, Bo Wang, Daoyi Dong, Chunlin Chen, Zhi Wang

机构 * Nanjing University(南京大学) Australian National University(澳大利亚国立大学) Tianjin University(天津大学) University of Technology Sydney(悉尼大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出S-ICQL框架,通过动态规划和世界建模实现高效的奖励最大化和任务泛化,适用于决策领域。

Comments accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03493 2026-02-06 cs.LG cs.AI 62%

On Entropy Control in LLM-RL Algorithms

在LLM-RL算法中的熵控制

Han Shen

机构 * Ant Group(蚂蚁集团)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AEnt方法,通过改进的熵控制策略提升LLM-RL算法在数学推理任务中的性能。

Comments Updated with ICLR 2026 version

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.02594 2026-02-06 cs.LG cs.AI cs.SE 62%

SMARLA: A Safety Monitoring Approach for Deep Reinforcement Learning Agents

SMARLA:一种用于深度强化学习智能体的安全监控方法

Amirhossein Zolfagharian, Manel Abdellatif, Lionel C. Briand, Ramesh S

机构 * School of Electrical Engineering and Computer Science (EECS), University of Ottawa(电气工程与计算机科学系,渥太华大学) Software and Information Technology Engineering Department, École de Technologie Supérieure(软件与信息技术工程系,高等技术学院) Lero SFI Research Center and University of Limerick(Lero SFI研究中心和利默里克大学) Department of Research and Development, General Motors(研发部,通用汽车)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 SMARLA是一种用于深度强化学习智能体的安全监控方法,通过状态抽象和Q值预测安全违规,实现早期检测与低假阳性率的平衡。

Journal ref in IEEE Transactions on Software Engineering, vol. 51, no. 01, pp. 82-105, Jan. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04851 2026-02-05 cs.RO cs.CV 62%

PDF-HR: Pose Distance Fields for Humanoid Robots

PDF-HR:人形机器人姿态距离场

Yi Gu, Yukang Gao, Yangchen Zhou, Xingyu Chen, Yixiao Feng, Mingle Zhao, Yunyang Mo, Zhaorui Wang, Lixin Xu, Renjing Xu

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 PDF-HR通过构建姿态距离场,为人类机器人提供轻量级先验,提升姿态优化与控制性能。

Comments \href{https://gaoyukang33.github.io/PDF-HR/}{Project page}

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03501 2026-02-04 cs.LG cs.AI 62%

Reparameterization Flow Policy Optimization

重参数化流策略优化

Hai Zhong, Zhuoran Li, Xun Wang, Longbo Huang

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出重参数化流策略优化方法,通过联合反向传播流生成过程和系统动力学,提升模型驱动强化学习的样本效率和探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19411 2026-02-04 cs.RO cs.LG 62%

Task-Centric Policy Optimization from Misaligned Motion Priors

以任务为导向的策略优化从不一致的运动先验

Ziang Zheng, Kai Feng, Yi Nie, Shentao Qin

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出任务导向的运动先验框架,通过将模仿视为条件正则化器,提升任务性能并抑制有害模仿,验证了在嘈杂示范下的鲁棒性。

Comments Work requires further details and not complete yet

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02473 2026-02-03 cs.RO cs.LG 62%

HumanX: Toward Agile and Generalizable Humanoid Interaction Skills from Human Videos

HumanX: 向通过人类视频实现敏捷且可推广的人形交互技能迈进

Yinhuai Wang, Qihan Zhao, Yuen Fui Lau, Runyi Yu, Hok Wai Tsui, Qifeng Chen, Jingbo Wang, Jiangmiao Pang, Ping Tan

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 HumanX通过人类视频实现敏捷且可推广的人形交互技能,无需任务特定奖励,展示出高泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01915 2026-02-03 cs.LG cs.AI 62%

VLM-Guided Experience Replay

基于VLM的经验回放

Elad Sharony, Tom Jurgenson, Orr Krupnik, Dotan Di Castro, Shie Mannor

机构 * Nvidia Research(英伟达研究)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用VLMs指导经验回放,提升强化学习中样本效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02649 2026-02-03 cs.RO cs.AI 62%

Effective Online 3D Bin Packing with Lookahead Parcels Using Monte Carlo Tree Search

有效在线三维装箱使用蒙特卡洛树搜索和前瞻性包裹

Jiangyi Fang, Bowen Zhou, Haotian Wang, Xin Zhu, Leye Wang

机构 * Key Lab of High Confidence Software Technologies (Peking University), Ministry of Education China(高可信软件技术重点实验室(北京大学)) Faculty of Computing, Harbin Institute of Technology, Harbin, China(计算机学院,哈尔滨工业大学,哈尔滨,中国) JD Logistic, Beijing, China(京东物流,北京,中国) School of Computer Science, Peking University, Beijing, China(计算机科学学院,北京大学,北京,中国)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种基于蒙特卡洛树搜索和前瞻性包裹的在线三维装箱方法,通过动态探索先验平衡强化学习策略与稳健随机策略,有效应对物流中的短期分布变化,实现显著的装箱效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14858 2026-02-03 cs.LG cs.AI 62%

1000 Layer Networks for Self-Supervised RL: Scaling Depth Can Enable New Goal-Reaching Capabilities

1000层网络用于自监督强化学习:增加深度可以启用新的目标到达能力

Kevin Wang, Ishaan Javali, Michał Bortkiewicz, Tomasz Trzciński, Benjamin Eysenbach

机构 * Princeton University(普林斯顿大学) Warsaw University of Technology(华沙理工大学) Tooploox IDEAS Research Institute(IDEAS研究所)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过增加网络深度至1024层,显著提升自监督强化学习的目标到达能力,实验显示性能提升达2-50倍。

Comments Link to project website: https://wang-kevin3290.github.io/scaling-crl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00401 2026-02-03 cs.RO cs.AI 62%

ZEST: Zero-shot Embodied Skill Transfer for Athletic Robot Control

ZEST:零样本具身技能迁移用于竞技机器人控制

Jean Pierre Sleiman, He Li, Alphonsus Adu-Bredu, Robin Deits, Arun Kumar, Kevin Bergamin, Mohak Bhardwaj, Scott Biddlestone, Nicola Burger, Matthew A. Estrada, Francesco Iacobelli, Twan Koolen, Alexander Lambert, Erica Lin, M. Eva Mungai, Zach Nobles, Shane Rozen-Levy, Yuyao Shi, Jiashun Wang, Jakob Welner, Fangzhou Yu, Mike Zhang, Alfred Rizzi, Jessica Hodgins, Sylvain Bertrand, Yeuhi Abe, Scott Kuindersma, Farbod Farshidian

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 ZEST通过强化学习从多种数据源训练策略,实现零样本具身技能迁移,使机器人能执行复杂动态行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23266 2026-02-02 cs.RO cs.AI 62%

IRL-DAL: Safe and Adaptive Trajectory Planning for Autonomous Driving via Energy-Guided Diffusion Models

IRL-DAL:通过能量引导扩散模型实现自动驾驶的安全自适应轨迹规划

Seyed Ahmad Hosseini Miangoleh, Amin Jalal Aghdasian, Farzaneh Abdollahi

机构 * Department of Electrical Engineering, Amirkabir University of Technology (Tehran Polytechnic)(电气工程系,阿米尔卡比尔技术大学(德黑兰理工大学))

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出IRL-DAL框架,通过能量引导扩散模型实现自动驾驶的安全自适应轨迹规划,结合模仿学习与强化学习,提升行驶安全性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏