arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-12 至 2026-05-12 共收录 410 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 143 篇

2605.10754 2026-05-12 cs.AI 79%

The Agent Use of Agent Beings: Agent Cybernetics Is the Missing Science of Foundation Agents

代理行为的代理使用:代理循证学是基础代理的缺失科学

Xinrun Wang, Chang Yang, He Zhao, Zhuoyi Lin, Shuyue Hu

机构 * Singapore Management University(新加坡管理大学) The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学) Institute for Infocomm Research, Agency for Science, Technology and Research (A*STAR)(信息通信研究院,科技研究局(A*STAR)) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 本文提出代理循证学作为基础代理的理论基础,通过将经典循证学定律映射到代理设计原则,提出可靠性、持续运行和自我改进三大工程需求,以指导复杂任务中的代理设计与部署。

Comments Preliminary Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09465 2026-05-12 cs.CV cs.AI 79%

EvoDriveVLA: Evolving Driving VLA Models via Collaborative Perception-Planning Distillation

EvoDriveVLA: 通过协作感知-规划蒸馏进化驾驶VLA模型

Jiajun Cao, Xiaoan Zhang, Xiaobao Wei, Liyuqiu Huang, Zijian Wang, Hanzhen Zhang, Zhengyu Jia, Wei Mao, Hao Wang, Xianming Liu, Shuchang Zhou, Yang Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) XPeng Motors(小鹏汽车)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出EvoDriveVLA框架,结合自我锚定感知约束和未来引导轨迹优化,解决自动驾驶中感知退化和长期规划不稳定问题,实现nuScenes和NAVSIM的SOTA性能。

Comments 19 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08136 2026-05-12 cs.CL 79%

EconWebArena: Benchmarking Autonomous Agents on Economic Tasks in Realistic Web Environments

EconWebArena:在现实网络环境中评估自主代理在经济任务上的基准测试

Zefang Liu, Yinzhu Quan

机构 * Capital One Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划决策 :autonomous agent(title,abstract);分类 cs.CL

AI总结 本文提出EconWebArena基准,通过360个精心挑选的任务测试自主代理在经济任务中的能力,强调权威数据源和基于网络的经济推理,评估多种多模态LLM的表现,揭示性能差距和挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10106 2026-05-12 cs.CV cs.AI 79%

ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models

ViSRA:一种基于视频的空间推理代理用于多模态大语言模型

Tingshu Mou, Jiabo He, Renying Wang, Ce Liu, Hao Yang, Tiehua Zhang, Jingjing Chen, Xingjun Ma

机构 * Fudan University(复旦大学) Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心(BCAI)) Tongji University(同济大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 ViSRA从无训练视角出发,提出一种人类对齐的视频空间推理代理框架,通过显式空间信息探索多模态大语言模型的空间推理机制,实现模块化和可扩展的空间推理,提升3D理解能力并减少训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09638 2026-05-12 cs.LG 79%

Plan2Cleanse: Test-Time Backdoor Defense via Monte-Carlo Planning in Deep Reinforcement Learning

Plan2Cleanse:通过深度强化学习中的蒙特卡洛规划实现测试时后门防御

Sze-Ann Chen, Zhi-Yi Chin, Kui-Yuan Chen, Chi-Yu Li, Ping-Chun Hsieh

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 本文提出Plan2Cleanse框架,利用蒙特卡洛树搜索在无需重新训练的情况下检测和缓解强化学习中的后门攻击,通过在MuJoCo、O-RAN和Atari环境中测试,显著提升了后门检测成功率和对抗性环境中的胜率。

Comments Published in Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09622 2026-05-12 cs.CV cs.AI 79%

Any2Any 3D Diffusion Models with Knowledge Transfer: A Radiotherapy Planning Study

任意到任意的3D扩散模型与知识转移:放射治疗计划研究

Yuhan Wang, Zihan Li, Han Liu, Simon Arberet, Martin Kraus, Yuyin Zhou, Florin-Cristian Ghesu, Dorin Comaniciu, Ali Kamen, Riqiang Gao

机构 * UC Santa Cruz(加州大学圣克ruz分校) Siemens Healthineers(西门子医疗) University of Washington(华盛顿大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出DiffKT3D,一种利用预训练视频扩散模型知识的统一Any2Any 3D扩散框架,通过模态特定嵌入实现多临床模态灵活条件化,结合临床导向的强化学习机制,提升放射治疗计划中的剂量预测精度与图像质量。

Comments Accepted by CVPR 2026 main conference. Compare to CVPR version, minor updates here are included (e.g., combine main text and appendix; clarify the timing scenario in appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09387 2026-05-12 cs.AI cs.RO 79%

NEXUS: Continual Learning of Symbolic Constraints for Safe and Robust Embodied Planning

NEXUS:用于安全和稳健体素规划的符号约束连续学习

Tiehan Cui, Peipei Liu, Yanxu Mao, Congying Liu, Mingzhe Xing, Datao You

机构 * School of Artificial Intelligence and Automation(人工智能与自动化学院) Huazhong University of Science and Technology(华中科技大学) School of Software(软件学院) Henan University(河南大学) Institute of Information Engineering(信息工程研究所) Chinese Academy of Sciences(中国科学院) School of Cyberspace Security(网络空间安全学院) University of the Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 NEXUS通过模块化框架实现体素代理的连续学习,将符号 artifacts 用于符号 grounding 和知识演化,将概率风险评估转化为确定性硬约束,提升任务成功率并抵御对抗攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09269 2026-05-12 cs.CL cs.CV 79%

DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification

DeltaRubric: 通过联合规划和验证实现生成式多模态奖励建模

Rui Liu, Dian Yu, Zhenwen Liang, Yucheng Shi, Tong Zheng, Runpeng Dai, Haitao Mi, Pratap Tokekar, Leoweiliang

机构 * Tencent Hunyuan(腾讯文元) University of Maryland, College Park(马里兰大学 College Park 分校) University of North Carolina, Chapel Hill(北卡罗来纳大学 Chapel Hill 分校)

专题命中 规划决策 :planning(title,abstract);分类 cs.CL

AI总结 DeltaRubric通过联合规划和验证流程,提升多模态奖励建模的可靠性与泛化能力,实验表明其在多模态任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08477 2026-05-12 cs.CL 79%

Do Agents Need to Plan Step-by-Step? Rethinking Planning Horizon in Data-Centric Tool Calling

智能体是否需要分步规划?重新审视数据导向工具调用中的规划范围

Naoki Otani, Nikita Bhutani, Hannah Kim, Dan Zhang, Estevam Hruschka

机构 * Megagon Labs(Megagon实验室)

专题命中 规划决策 :planning(title,abstract);分类 cs.CL

AI总结 本文研究了数据导向任务中规划范围的影响,发现全范围规划结合延迟重规划在准确性和效率上优于单步规划。

Comments CAIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09915 2026-05-12 cs.CL cs.AI cs.CY 79%

Position: Academic Conferences are Potentially Facing Denominator Gaming Caused by Fully Automated Scientific Agents

位置:学术会议可能面临由完全自动化科学代理引发的分母游戏威胁

Rong Shan, Te Gao, Hang Zheng, Yunjia Xi, Jiachen Zhu, Zeyu Zheng, Yong Yu, Weinan Zhang, Jianghao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Central South University(中南大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划决策 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文探讨了由完全自动化科学代理引发的分母游戏威胁,分析了其对学术会议评审系统的影响,并提出系统性政策改革作为缓解措施。

Comments Accepted by ICML'26 Position Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10880 2026-05-12 cs.RO 78%

Safe Aerial 3D Path Planning for Autonomous UAVs using Magnetic Potential Fields

基于磁势场的自主无人机安全三维路径规划

Haechan Mark Bong, Giovanni Beltrame

机构 * Department of Computer Engineering and Software Engineering, Polytechnique Montréal(蒙特利尔理工学院计算机工程与软件工程系) MILA(蒙特利尔人工智能实验室)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出3DMaxConvNet,通过卷积自编码器从LiDAR点云生成障碍物感知的磁势场,实现高效安全的三维路径规划,在不同城市环境中均取得100%成功率,且运行速度显著优于A*和RRT*(3k)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10707 2026-05-12 cs.RO 78%

ObjView-Bench: Rethinking Difficulty and Deployment for Object-Centric View Planning

ObjView-Bench:重新思考面向对象的视图规划中的难度与部署

Sicong Pan, Hao Hu, Xuying Huang, Benno Wingender, Maren Bennewitz

机构 * University of Bonn(波恩大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出ObjView-Bench框架,通过分离视图规划评估中的三个关键因素,改进了面向对象的视图规划评估方法,并展示了部署导向的评估协议对方法性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16593 2026-05-12 cs.RO 78%

Scalable Inspection Planning via Flow-based Mixed Integer Linear Programming

基于流的混合整数线性规划的可扩展检查规划

Adir Morgan, Kiril Solovey, Oren Salzman

机构 * Technion--Israel Institute of Technology, Haifa, Israel(技术离子-以色列理工学院,海法,以色列)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出基于流的混合整数线性规划方法,解决大规模检查规划问题,提升求解效率和解的质量,适用于医疗和基础设施等场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09792 2026-05-12 cs.CR 78%

Operationalizing Cybersecurity Governance for Mitigation Planning with Attack-Path Modeling and Reinforcement Learning

将网络安全治理 operationalize 用于缓解规划:通过攻击路径建模和强化学习

Philip Huff, Dakota Dale, Harshith Guduru, Rohan Singh, Qinghua Li

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出利用攻击路径建模和强化学习,将网络安全治理框架转化为可行的缓解决策,通过映射CSF成熟度评估到MITRE ATT&CK缓解能力,实现组织安全态势与对抗驱动的防御规划整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08536 2026-05-12 eess.SP 78%

Online UAV Trajectory Planning Under QoS Constraints to Mobile Users in Urban Environments

面向城市环境中移动用户的QoS约束下的无人机轨迹规划

Chenrui Qiu, Loizos Kanaris, Yongxu Zhu, Tasos Dagiuklas

专题命中 规划决策 :planning(title,abstract)

AI总结 本文研究了单架无人机在城市环境中为多个移动地面用户实时规划轨迹和无线资源分配,考虑异构用户移动性和QoS约束,采用在线强化学习方法优化轨迹以平衡吞吐量和用户公平性。

Comments Accepted to the IEEE 15th International Symposium on Communication Systems, Networks and Digital Signal Processing (CSNDSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11490 2026-05-12 math.OC 78%

An Efficient Hybrid Heuristic for the Transmission Expansion Planning under Uncertainty

一种在不确定性下的高效混合启发式方法用于传输扩展规划

Yure Rocha, Teobaldo Bulhões, Anand Subramanian, Joaquim Dias Garcia

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出一种结合渐进贴现算法和集成方法的混合启发式策略,用于解决具有不确定性的传输扩展规划问题,通过在大型系统中实现高效求解,平均成本降低5.28%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02340 2026-05-12 eess.SY cs.SY 78%

Risk-Based PV-Rich Distribution System Planning Using Generative AI

基于风险的光伏丰富配电系统规划使用生成式AI

Habtemariam Aberie Kefale, Weijie Xia, Nanda Kishor Panda, Peter P. Palensky, Pedro P. Vergara

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出一种基于风险的光伏容量评估框架,利用生成式AI生成时间相关负载需求场景,以量化电压违规的风险,提升配电系统规划的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21713 2026-05-12 eess.SY cs.SY 78%

Simple Trajectory Smoothing for UAV Reference Path Planning Based on Decoupling, Spatial Modeling and Linear Programming

基于解耦、空间建模和线性规划的UAV参考路径规划轨迹平滑方法

Mogens Plessen

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出了一种基于Dubins飞机动力学的UAV轨迹平滑方法,结合解耦、空间建模和线性规划,通过优化滚角控制实现飞行路径角和速度控制,扩展至特技飞行和三维地形拖车路径规划。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10899 2026-05-12 cs.CL cs.LG 73%

RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards

RubricEM: 通过规则引导的策略分解实现超越可验证奖励的元强化学习

Gaotang Li, Bhavana Dalvi Mishra, Zifeng Wang, Jun Yan, Yanfei Chen, Chun-Liang Li, Long T. Le, Rujun Han, George Lee, Hanghang Tong, Chen-Yu Lee, Tomas Pfister

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google Cloud AI Research(谷歌云人工智能研究)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.CL、cs.LG

AI总结 RubricEM通过规则引导的策略分解和反思元策略进化,解决深度研究代理在不可验证奖励下的训练问题,实现长周期优化和可重用经验积累。

Comments 63 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10820 2026-05-12 cs.AI cs.LG 73%

MaD Physics: Evaluating information seeking under constraints in physical environments

MaD Physics:在物理环境中评估受约束的信息获取

Moksh Jain, Mehdi Bennani, Johannes Bausch, Yuri Chervonyi, Bogdan Georgiev, Simon Osindero, Nenad Tomašev

机构 * Mila – Quebec AI Institute, Université de Montréal(Mila-魁北克人工智能研究所,蒙特利尔大学) Google DeepMind(谷歌DeepMind)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 MaD Physics通过三个基于不同物理定律的环境,评估智能体在资源受限条件下进行测量和推理的能力,揭示了现有模型在科学推理和约束规划方面的不足。

Comments 64 pages, 10 figures. Project page: https://mad-physics.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10816 2026-05-12 cs.LG cs.AI 73%

Policy Gradient Methods for Non-Markovian Reinforcement Learning

非马尔可夫强化学习中的策略梯度方法

Avik Kar, Siddharth Chandak, Rahul Singh, Soumitra Sinhahajari, Eric Moulines, Shalabh Bhatnagar, Nicholas Bambos

机构 * Department of Computer Science and Automation, Indian Institute of Science(印度科学研究院计算机科学与自动化系) Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系) Department of Electrical and Electronics Engineering, Nanyang Technological University(南洋理工大学电气与电子工程系) CMAP, CNRS, École polytechnique, Institut Polytechnique d́e Paris(巴黎理工学院先进材料与工艺中心、国家科学研究中心、巴黎理工学院)

专题命中 规划决策 :agent(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文研究非马尔可夫决策过程中的策略梯度方法,提出基于奖励的策略优化框架,通过递归更新内部状态提升非马尔可夫任务性能。

Comments 39 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09998 2026-05-12 cs.LG cs.AI 73%

Continual Harness: Online Adaptation for Self-Improving Foundation Agents

持续Harness:面向自我改进基础代理的在线适应

Seth Karten, Joel Zhang, Tersoo Upaa, Ruirong Feng, Wenzhe Li, Chengshuai Shi, Chi Jin, Kiran Vodrahalli

机构 * Princeton University(普林斯顿大学) ARISE Foundation(ARISE基金会) Google DeepMind(谷歌DeepMind)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出持续Harness,一种无需人工干预的自我改进机制,通过在线适应提升具身代理在长视界部分可观察决策中的表现,实验证明其在Pokémon游戏中显著降低操作成本并接近专家水平。

Comments 28 pages, 19 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11537 2026-05-12 cs.LG cs.AI 73%

Simulus: Combining Improvements in Sample-Efficient World Model Agents

Simulus:结合高效样本世界模型代理的改进

Lior Cohen, Kaixin Wang, Bingyi Kang, Uri Gadot, Shie Mannor

机构 * Technion(技术ion大学) Microsoft Research(微软研究院) ByteDance Seed(字节跳动种子实验室)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Simulus,一种模块化的基于标记的世界模型代理,通过整合灵活的标记化框架、内在动机、优先世界模型回放和回归-分类方法,提升了样本效率,适用于多个基准测试。

Comments Revised version: updated title, abstract, and framing to better reflect our contributions and situate the work within the literature

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17693 2026-05-12 cs.LG cs.AI cs.MA 73%

COSAC: Counterfactual Credit Assignment in Sequential Cooperative Teams

COSAC:在顺序合作团队中的反事实信用分配

Shripad Deshmukh, Jayakumar Subramanian, Raghavendra Addanki, Nikos Vlassis

机构 * Adobe Research(Adobe研究)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 COSAC提出一种无批评者策略梯度方法,通过单个岭回归分解团队奖励,计算每个代理的反事实优势,实现低方差和可控的信用分配,适用于顺序合作团队。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09514 2026-05-12 cs.CL cs.AI 73%

EcoGym: Evaluating LLMs for Long-Horizon Plan-and-Execute in Interactive Economies

EcoGym:评估基于LLM的长周期计划与执行能力于交互经济中

Xavier Hu, Jinxiang Xia, Shengze Xu, Kangqi Song, Yishuo Yuan, Guibin Zhang, JinCheng Ren, Boyu Feng, Li Lu, Tieyong Zeng, Jiaheng Liu, Minghao Liu, He Zhu, Yuchen Eleanor Jiang, Wei Wang, Wangchunshu Zhou

机构 * OPPO-PersonalAI(OPPO-个人AI)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 EcoGym提出一个通用基准,用于评估LLM在交互经济中的长周期计划与执行能力,通过三个环境展示不同策略和行动的优化挑战。

Comments update

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09537 2026-05-12 cs.RO 71%

Drift is a Sampling Error: SNR-Aware Power Distributions for Long-Horizon Robotic Planning

漂移是一种采样误差:面向长时间 horizon 的机器人规划的 SNR 意识功率分布

Kewei Chen, Yayu Long, Mingsheng Shang

机构 * Chongqing Institute of Green and Intelligent Technology, Chinese Academy of Sciences(中国科学院重庆绿色智能技术研究院) Chongqing School, University of Chinese Academy of Sciences(中国科学院大学重庆学院)

专题命中 规划决策 :planning(title)

AI总结 本文提出 CAPS 框架,通过功率分布增强全局轨迹概率,结合 SNR 机制实现动态切换,提升长horizon 机器人规划的鲁棒性。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10310 2026-05-12 cs.RO cs.SY eess.SY 71%

Safe and Real-Time Consistent Planning for Autonomous Vehicles in Partially Observed Environments via Parallel Consensus Optimization

通过并行一致性优化实现自动驾驶车辆在部分观测环境中的安全与实时一致性规划

Lei Zheng, Rui Yang, Minzhe Zheng, Michael Yu Wang, Jun Ma

机构 * Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)机器人与自主系统方向) School of Engineering, Great Bay University(大湾大学工程学院) Division of Emerging Interdisciplinary Areas, The Hong Kong University of Science and Technology(香港科学与技术大学新兴交叉领域学院)

专题命中 规划决策 :planning(title)

AI总结 本文提出CPTO方法,通过并行优化解决自动驾驶在部分观测环境中安全与一致性规划问题,采用共识安全屏障模块和分解二次规划加速计算,提升安全性和一致性。

Comments 16 pages, 7 figures

Journal ref IEEE Transactions on Intelligent Transportation Systems, vol. 27, no. 5, pp. 5174-5190, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10909 2026-05-12 cs.LG stat.ML 70%

Revisiting Policy Gradients for Restricted Policy Classes: Escaping Myopic Local Optima with $k$-step Policy Gradients

重新审视受限策略类别的策略梯度:通过k步策略梯度逃脱短视局部极值

Alex DeWeese, Guannan Qu

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 本文提出k步策略梯度方法,通过结合k步时间窗口内的随机性,解决受限策略类中因策略梯度短视导致的局部极值问题,并在理论上保证收敛性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10257 2026-05-12 cs.AI 70%

Towards Autonomous Railway Operations: A Semi-Hierarchical Deep Reinforcement Learning Approach to the Vehicle Rescheduling Problem

迈向自主铁路运营:一种半层次深度强化学习方法用于车辆重新调度问题

Alberto Castagna, Stefan Zahlner, Adrian Egli, Christian Eichenberger, Daniel Boos, Manuel Meyer, Anton Fuxjager

机构 * enliteAI SBB CFF FFS Flatland Association

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出一种半层次深度强化学习方法,解决铁路车辆重新调度问题,通过分离调度与路由,提升协调性和鲁棒性,实验显示在不同难度下表现优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21232 2026-05-12 cs.AI 70%

ReCAPA: Hierarchical Predictive Correction to Mitigate Cascading Failures

ReCAPA:分层预测性修正以缓解级联故障

Xiyin Zeng, Yuyu Sun, Haoyang Li, Shouqiang Liu, Hao Wang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) South China Normal University(华南师范大学)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 ReCAPA通过分层预测修正和对齐架构,缓解多模态环境中多步骤任务执行中的级联故障问题,引入新的指标量化误差传播与恢复过程,实验表明其在多个代理基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏