arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-13 至 2026-04-13 共收录 49 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 1 篇

2510.00491 2026-04-13 cs.RO cs.AI 79%

Traj2Action: A Co-Denoising Framework for Trajectory-Guided Human-to-Robot Skill Transfer

Traj2Action: 一种用于轨迹引导的人机技能转移协同去噪框架

Han Zhou, Jinjin Cao, Liyuan Ma, Xueji Fang, Guo-jun Qi

机构 * MAPLE Lab, Westlake University(西湖大学MAPLE实验室) Zhejiang University(浙江大学) Huazhong University of Science and Technology(华中科技大学) Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖大学先进技术研究所)

专题命中 机器人学习 :manipulation(abstract);robot policy(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出Traj2Action框架,通过3D操作端点轨迹作为统一中间表示,解决人机技能转移中的形态差距问题,提升机器人动作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 14 篇

2604.09036 2026-04-13 cs.RO 89%

V-CAGE: Vision-Closed-Loop Agentic Generation Engine for Robotic Manipulation

V-CAGE:用于机器人操作的视觉闭环代理生成引擎

Yaru Liu, Ao-bo Wang, Nanyang Ye

机构 * University of Cambridge(剑桥大学) Wuhan University(武汉大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);embodied agent(abstract);分类 cs.RO

AI总结 V-CAGE通过闭环代理生成框架实现机器人数据合成,结合语义布局规划和视觉自验证,提升环境生成的语义结构和可达性,解决传统方法在场景生成中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19432 2026-04-13 physics.app-ph cond-mat.mes-hall quant-ph 82%

Robotic chip-scale nanofabrication for superior consistency

机器人微米级纳米加工以实现卓越的一致性

Felix M. Mayor, Wenyan Guan, Erik Szakiel, Amir H. Safavi-Naeini, Samuel Gyger

专题命中 机器人操作 :robotic(title,abstract);robotics(abstract)

AI总结 本文提出利用机器人手臂自动化微米级纳米加工,提高复杂器件制造的一致性,通过Josephson结电阻开发验证了机器人在减少人工操作波动方面的有效性。

Comments 5 pages, 3 figures

Journal ref Appl. Phys. Lett. 128, 144101 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09096 2026-04-13 cs.CV cs.MM eess.IV 79%

Off-the-shelf Vision Models Benefit Image Manipulation Localization

现成视觉模型助力图像篡改定位

Zhengxuan Zhang, Keji Song, Junmin Hu, Ao Luo, Yuezun Li

机构 * School of Computer Science and Technology, Ocean University of China(中国海洋大学计算机科学与技术学院) Southwest Jiaotong University(西南交通大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.CV

AI总结 本文提出ReVi适配器,利用现成通用视觉模型提升图像篡改定位性能,通过解耦语义冗余与篡改信息实现高效训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08945 2026-04-13 cs.CV cs.RO 73%

TouchAnything: Diffusion-Guided 3D Reconstruction from Sparse Robot Touches

TouchAnything: 从稀疏机器人触碰引导的3D重建

Langzhe Gu, Hung-Jui Huang, Mohamad Qadri, Michael Kaess, Wenzhen Yuan

机构 * Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出TouchAnything框架,利用预训练的2D视觉扩散模型作为语义和几何先验,从稀疏触觉测量中实现准确的3D重建,优于现有基线方法,支持开放世界中未见过的物体实例重建。

Comments Project Page: https://grange007.github.io/touchanything

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04161 2026-04-13 cs.RO 70%

Adaptive Action Chunking at Inference-time for Vision-Language-Action Models

推理时的自适应动作分块

Yuanchang Liang, Xiaobo Wang, Kai Wang, Shuo Wang, Xiaojiang Peng, Haoyu Chen, David Kim Huat Chua, Prahlad Vadakkepat

机构 * National University of Singapore(新加坡国立大学) Shenzhen University of Advanced Technology(深圳理工大学) Sangfor Technologies Inc.(深信服科技股份有限公司) Mininglamp Technology(明略科技) Shenzhen Technology University(深圳技术大学) City University of Hong Kong(香港城市大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出自适应动作分块策略,通过动作熵动态调整分块大小,提升机器人操作的反应与一致性。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06809 2026-04-13 cs.LG cs.AI cs.CL 62%

Neurons Speak in Ranges: Breaking Free from Discrete Neuronal Attribution

神经元以范围说话:摆脱离散神经元归因

Muhammad Umair Haider, Hammad Rizwan, Hassan Sajjad, Peizhong Ju, A. B. Siddique

机构 * University of Kentucky(肯塔基大学) Dalhousie University(达尔豪斯大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 研究发现大语言模型中神经元具有多义性,提出NeuronLens框架通过范围归因提升模型可解释性和可控性。

Journal ref Transactions on Machine Learning Research, ISSN 2835-8856, 2026. https://openreview.net/forum?id=AukyIhfBuW

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01257 2026-04-13 cs.SI cs.AI cs.CY cs.HC cs.LG 62%

Detection and Characterization of Coordinated Online Behavior: A Survey

协调在线行为的检测与表征:综述

Lorenzo Mannocci, Michele Mazza, Anna Monreale, Maurizio Tesconi, Stefano Cresci

机构 * University of Pisa(比萨大学) Institute for Informatics and Telematics, National Research Council (IIT-CNR)(国家研究委员会信息学与远程信息处理研究所)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了协调在线行为的研究现状,提出综合框架,讨论检测与表征方法,指出研究挑战与方向,为学者和政策制定者提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01383 2026-04-13 cs.RO 57%

CaRLi-V: Camera-RADAR-LiDAR Point-Wise 3D Velocity Estimation

CaRLi-V:摄像头-雷达-激光雷达点云三维速度估计

Landson Guo, Andres M. Diaz Aguilar, William Talbot, Turcan Tuna, Marco Hutter, Cesar Cadena

机构 * ETH Zürich(苏黎世联邦理工学院) Robotic Systems Lab (RSL), ETH Zürich(苏黎世联邦理工学院机器人系统实验室)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 本文提出CaRLi-V方法,结合雷达、激光雷达和摄像头数据,通过雷达速度立方体、光流和激光雷达测距,实现点云三维速度估计,优于现有场景流方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09213 2026-04-13 cs.CV 57%

SHIFT: Steering Hidden Intermediates in Flow Transformers

SHIFT: 在流变换器中操控隐藏中间量

Nina Konovalova, Andrey Kuznetsov, Aibek Alanov

机构 * FusionBrain Lab(FusionBrain实验室) HSE University(高等经济大学) AXXX

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 SHIFT通过在推理时操控中间激活值,实现对DiT扩散模型中概念的去除,同时保持图像质量,支持风格域转换和目标对象的偏移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08787 2026-04-13 cs.RO 57%

One Interface, Many Robots: Unified Real-Time Low-Level Motion Planning for Collaborative Arms

一个接口,多种机器人:面向协作臂的统一实时低级运动规划

Yue Feng, Weicheng Huang, I-Ming Chen

机构 * Robotics Research Center (RRC), Nanyang Technological University(南洋理工大学机器人研究中心) WinGs Robotics LLC(WinGs 机器人有限责任公司)

专题命中 机器人操作 :robotic(abstract);分类 cs.RO

AI总结 本文提出一个统一的实时低级运动规划接口,用于协作机器人臂,旨在提高在异构硬件平台上的应用性和可移植性。通过n次多项式插值与二次规划求解器结合,生成平滑连续可微的轨迹。在三个不同场景中验证了方法的可靠性、通用性和易用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08726 2026-04-13 cs.RO 57%

Task-Aware Bimanual Affordance Prediction via VLM-Guided Semantic-Geometric Reasoning

基于VLM引导的语义-几何推理的任务感知双臂 affordance 预测

Fabian Hahne, Vignesh Prasad, Georgia Chalvatzaki, Jan Peters, Alap Kshirsagar

机构 * Department of Computer Science, Technical University of Darmstadt(达姆施塔特工业大学计算机科学系) German Research Center for AI (DFKI)(德国人工智能研究中心) Centre for Cognitive Science, Technical University of Darmstadt(达姆施塔特工业大学认知科学中心) Hessian Center for Artificial Intelligence (Hessian.AI), Darmstadt(黑森州人工智能中心) Robotics Institute Germany (RIG)(德国机器人研究所)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 本文提出一种任务感知双臂 affordance 预测框架,通过VLM实现跨物体类别和任务描述的泛化,融合多视角RGB-D数据生成全局6自由度抓取候选,结合语义和几何过滤提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16107 2026-04-13 cs.RO 57%

Allocation for Omnidirectional Aerial Robots: Incorporating Power Dynamics

多方向空中机器人分配:考虑功率动态

Eugenio Cuniato, Mike Allenspach, Thomas Stastny, Helen Oleynikova, Roland Siegwart, Michael Pantic

机构 * Autonomous Systems Lab (ASL), ETH Zurich(苏黎世联邦理工学院自主系统实验室)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 本文提出三种新型多方向空中机器人分配方法,通过考虑冗余性和动力学,提升动态 maneuver 的执行效率和轨迹跟踪速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09310 2026-04-13 quant-ph cond-mat.mes-hall 50%

Coherent Control of Nanoscale Nuclear Spin Ensembles in the Spin Noise Regime

在自旋噪声范围内实现纳米尺度核自旋集合的相干控制

Ana Martin, Roberto Rizzato, Carlos Munuera-Javaloy, Dileep Singh, Dominik B. Bucher, Jorge Casanova

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究通过相关光谱技术探讨核自旋控制,揭示初始RF相位和方向对NV读出对比度的影响,为多维自旋共振实验提供新见解。

Comments 5 pages, 2 figures and 3 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09960 2026-04-13 cond-mat.soft 50%

Active nematic pumps

主动取向液体泵

Ignasi Vélez-Ceron, Rodrigo C. V. Coelho, Pau Guillamat, Marc Vergés-Vilarrubia, Margarida Telo da Gama, Francesc Sagués, Jordi Ignés-Mullol

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文通过实验与模拟结合,展示在主动取向凝胶中加入三角形掺杂物可局部打破主动湍流的前后对称性,稳定具有自泵能力的流场,实现无壁自供电微流体系统。

Comments Supplementary figures and videos at DOI 10.17605/OSF.IO/N8G4C

Journal ref PNAS 122 (46) e2427103122 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身导航 5 篇

2604.08883 2026-04-13 cs.RO cs.AI 81%

HTNav: A Hybrid Navigation Framework with Tiered Structure for Urban Aerial Vision-and-Language Navigation

HTNav:一种具有分层结构的混合导航框架用于城市空域视觉-语言导航

Chengjie Fan, Cong Pan, Zijian Liu, Ningzhong Liu, Jie Qin

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Key Laboratory of Brain-Machine Intelligence Technology, Ministry of Education(教育部脑机智能技术重点实验室)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出HTNav框架,结合模仿学习与强化学习,通过分层决策机制提升复杂城市环境中的导航精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02826 2026-04-13 cs.LG cs.AI 81%

From Navigation to Refinement: Revealing the Two-Stage Nature of Flow-based Diffusion Models through Oracle Velocity

从导航到细化:通过Oracle速度揭示基于流的扩散模型的两阶段本质

Haoming Liu, Jinnuo Liu, Yanhao Li, Liuyang Bai, Yunkai Ji, Yuanhe Guo, Shenji Wan, Hongyi Wen

机构 * Center for Data Science, New York University Shanghai(上海纽约大学数据科学中心) New York University(纽约大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过分析基于流的扩散模型的边际速度场,揭示其两阶段训练目标,解释了模型在早期阶段的全局布局生成和后期阶段的细节记忆行为,为模型设计和算法改进提供了指导。

Comments Accepted to CVPR 2026 (Findings track); 16 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09115 2026-04-13 cs.NI cs.RO 57%

"Take Me Home, Wi-Fi Drone": A Drone-based Wireless System for Wilderness Search and Rescue

带我回家,Wi-Fi无人机:一种基于无人机的无线系统用于荒野搜救

Weiying Hou, Luca Jiang-Tao Yu, Chenshu Wu

机构 * The University of Hong Kong(香港大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出Wi2SAR,一种基于无人机的无线系统,用于远距离穿透遮挡的荒野搜救。通过模仿Wi-Fi设备自动重新连接行为,利用无人机Wi-Fi发现并定位受害者,采用三种创新技术提升性能。

Comments 16 pages, 12 figures, 1 table. Project page: https://aiot-lab.github.io/Wi2SAR

Journal ref In The 32nd Annual International Conference on Mobile Computing and Networking (MobiCom '26), October 26-30, 2026, Austin, TX, USA. ACM, New York, NY, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17687 2026-04-13 cs.LG cs.NE 57%

Boosting Brain-inspired Path Integration Efficiency via Learning-based Replication of Continuous Attractor Neurodynamics

通过基于学习的复制连续吸引子神经动力学提升脑启发路径整合效率

Zhangyu Ge, Xu He, Lingfei Mo, Xiaolin Meng, Wenxuan Yin, Youdong Zhang, Lansong Jiang, Fengyuan Liu

专题命中 具身导航 :navigation(abstract);分类 cs.LG

AI总结 本文提出基于表示学习模型复制连续吸引子神经网络动力学模式的方法,提升路径整合效率,实验表明在通用设备和边缘设备上分别提升了17.5%和40-50%的效率,同时定位精度与NeuroSLAM相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12046 2026-04-13 physics.optics physics.app-ph 50%

Terahertz Generation and Detection through Gain-Enhanced Interband Photomixing in Quantum Well Structures

太赫兹波通过量子井结构中的增益增强的能带光混频生成与检测

Yifan Zhao, Shahed-E- Zumrat, Szu-An Tsao, Mona Jarrahi

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出利用量子井PIN光电二极管中的增益增强能带光混频实现可调太赫兹波生成与检测,提升功率效率和灵敏度,为紧凑型太赫兹光电系统奠定基础。

Comments 63 pages, 21 Figures, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 具身推理 5 篇

2604.08719 2026-04-13 cs.CV cs.AI cs.RO 82%

LMGenDrive: Bridging Multimodal Understanding and Generative World Modeling for End-to-End Driving

LMGenDrive: 联合多模态理解与生成世界建模以实现端到端驾驶

Hao Shao, Letian Wang, Yang Zhou, Yuxuan Hu, Zhuofan Zong, Steven L. Waslander, Wei Zhan, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) University of Toronto(多伦多大学) UC Berkeley(加州大学伯克利分校)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出LMGenDrive框架,结合LLM多模态理解与生成世界模型,提升自动驾驶的闭环性能,通过视频预测和控制信号生成,增强时空场景建模和指令遵循能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09059 2026-04-13 cs.CV cs.AI 81%

Learning Vision-Language-Action World Models for Autonomous Driving

学习视觉-语言-动作世界模型以实现自动驾驶

Guoqing Wang, Pin Tang, Xiangxuan Ren, Guodongfang Zhao, Bailan Feng, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部人工智能重点实验室) Central Research Institute, Huawei(华为中央研究院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 本文提出VLA-World模型,通过结合预测想象与反思推理提升自动驾驶的前瞻性。该模型利用生成的轨迹引导图像生成,并通过反思优化轨迹预测,实验表明其在规划和未来场景生成任务中优于现有方法。

Comments Accepted by CVPR2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03353 2026-04-13 cs.MA cs.AI 79%

Decentralized Collective World Model for Emergent Communication and Coordination

去中心化的集体世界模型用于涌现通信与协调

Kentaro Nomura, Tatsuya Aoki, Tadahiro Taniguchi, Takato Horii

机构 * The University of Osaka(大阪大学) Kyoto University(京都大学) Ritsumeikan University(立命馆大学) The University of Tokyo(东京大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本文提出一种去中心化的多智能体世界模型,通过时间扩展的集体预测编码实现通信与协调的同步发展,通过对比学习促进信息对齐,展示了在双智能体轨迹绘制任务中优于非通信模型的协调能力。

Comments Accepted at IEEE ICDL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09338 2026-04-13 cs.AI cs.CL 70%

Mind the Gap Between Spatial Reasoning and Acting! Step-by-Step Evaluation of Agents With Spatial-Gym

注意空间推理与行动之间的差距!通过Spatial-Gym进行分步评估代理

Lars Benedikt Kaesberg, Tianyu Yang, Niklas Bauer, Terry Ruas, Jan Philip Wahle, Bela Gipp

专题命中 具身推理 :robotics(abstract);navigation(abstract);分类 cs.AI

AI总结 本文提出Spatial-Gym环境,通过2D网格谜题的分步决策任务评估模型在空间推理中的能力,发现分步格式对弱模型有益但对强模型有负面影响,且视觉模型在空间环境中的表现较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11340 2026-04-13 cs.CV cs.RO 54%

REACT3D: Recovering Articulations for Interactive Physical 3D Scenes

REACT3D: 交互式物理3D场景中关节的恢复

Zhao Huang, Boyang Sun, Alexandros Delitzas, Jiaqi Chen, Marc Pollefeys

机构 * ETH Zurich(苏黎世联邦理工学院) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) Microsoft Spatial AI Lab(微软空间人工智能实验室)

专题命中 具身推理 :robotics(comments,journal_ref);分类 cs.RO、cs.CV

AI总结 REACT3D通过零样本框架实现静态3D场景到可交互模拟的转换,解决了标注过程繁琐的问题,提升了多任务应用的兼容性与效率。

Comments Accepted at IEEE Robotics and Automation Letters (RA-L)

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 5, pp. 5954-5961, May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人基础模型 1 篇

2510.10181 2026-04-13 cs.RO cs.AI cs.CV 67%

Dejavu: Towards Experience Feedback Learning for Embodied Intelligence

Dejavu:迈向具身智能的经验反馈学习

Shaokai Wu, Yanbiao Ji, Qiuchang Li, Zhiyi Zhang, Qichen He, Wenyuan Xie, Guodong Zhang, Bayram Bayramli, Yue Ding, Hongtao Lu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院)

专题命中 机器人基础模型 :embodied agent(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出Dejavu框架,通过经验反馈网络增强冻结的视觉-语言-动作策略,提升具身智能任务的适应性、鲁棒性和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 模仿学习与强化学习 6 篇

2501.14377 2026-04-13 cs.RO 70%

Dream to Fly: Model-Based Reinforcement Learning for Vision-Based Drone Flight

梦想飞翔:基于模型的强化学习用于基于视觉的无人机飞行

Angel Romero, Ashwin Shenai, Ismail Geles, Elie Aljalbout, Davide Scaramuzza

机构 * Robotics and Perception Group, Department of Informatics, University of Zurich(苏黎世大学信息学系机器人感知组)

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出基于模型的强化学习方法,通过像素观测实现无人机敏捷飞行,展示了在模拟和真实世界中的高效表现,推动了基于像素的自主飞行技术发展。

Comments 8 pages, 6 Figures, accepted to IEEE ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09452 2026-04-13 cs.LG cs.AI 62%

SafeAdapt: Provably Safe Policy Updates in Deep Reinforcement Learning

SafeAdapt: 在深度强化学习中提供安全的策略更新

Maksim Anisimov, Francesco Belardinelli, Matthew Wicker

机构 * Imperial College London(伦敦帝国理工学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SafeAdapt方法,通过引入Rashomon集在连续强化学习中提供安全策略更新的正式保证,确保在下游适应过程中源任务的安全性。

Comments Code available at: https://github.com/maxanisimov/provably-safe-policy-updates

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09035 2026-04-13 cs.AI cs.LG 62%

Advantage-Guided Diffusion for Model-Based Reinforcement Learning

基于优势的扩散模型用于基于模型的强化学习

Daniele Foffano, Arvid Eriksson, David Broman, Karl H. Johansson, Alexandre Proutiere

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) Digital Futures(数字未来)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AGD-MBRL,通过利用智能体的优势估计引导反向扩散过程,提升长周期回报。采用SAG和EAG两种引导方法,改进了短周期视角下的扩散模型MBRL性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04334 2026-04-13 cs.LG cs.AI 62%

Boosted Distributional Reinforcement Learning: Analysis and Healthcare Applications

提升分布强化学习:分析与医疗应用

Zequn Chen, Wesley J. Marrero

机构 * Thayer School of Engineering, Dartmouth College(达特茅斯学院塞耶工程学院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文提出BDRL算法,通过优化个体结果分布并确保相似代理的可比性,提升医疗决策的一致性和效果。

Comments Preprint. 40 pages,11 figures. Supplementary appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏