arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-31 至 2026-03-31 共收录 72 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 72 篇

2602.03707 2026-03-31 cs.CL 90%

OmniRAG-Agent: Agentic Omnimodal Reasoning for Low-Resource Long Audio-Video Question Answering

OmniRAG-Agent:面向低资源长音频视频的代理多模态推理

Yifan Zhu, Xinyu Mu, Tao Feng, Zhonghong Ou, Yuning Gong, Haoran Luo

专题命中 规划决策 :agent(title,abstract);agentic(title,abstract);tool use(abstract);planning(abstract)

AI总结 本文提出OmniRAG-Agent,通过构建图像音频检索增强生成模块和代理循环,解决低资源长音频视频问答中的高成本编码、弱细粒度检索等问题,实验表明其在低资源环境下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26953 2026-03-31 astro-ph.EP astro-ph.IM cs.AI cs.ET cs.LG 89%

ASTER -- Agentic Science Toolkit for Exoplanet Research

ASTER -- 用于系外行星研究的代理科学工具包

Emilie Panek, Alexander Roman, Gaurav Shukla, Leonardo Pagliaro, Katia Matcheva, Konstantin Matchev

机构 * University of Alabama(阿拉巴马大学) University of Padova(帕多瓦大学)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);AI agent(abstract);planning(abstract)

AI总结 ASTER通过整合AI代理与领域专用工具,为系外行星大气分析提供统一平台,支持多步骤数据处理和检索任务。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15109 2026-03-31 cs.SI cs.AI cs.CY cs.HC cs.MA 85%

An Agentic Operationalization of DISARM for FIMI Investigation on Social Media

针对FIMI调查的社会媒体的代理操作化DISARM

Kevin Tseng, Juan Carlos Toledano, Bart De Clerck, Yuliia Dukach, Phil Tinn

机构 * Center of Research Acquisition National Institute of Cyber Security Taipei City, Taiwan Department of Mathematics Royal Military Academy Brussels, Belgium Research Division OpenMinds Ltd. Kyiv, Ukraine Department of Sustainable Communication Technologies SINTEF Oslo, Norway (Corresponding Author)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出一种基于代理的DISARM操作化框架,用于社会媒体上的FIMI调查。通过整合通用代理AI组件,实现对社交媒体数据中操纵性行为的识别和映射,提升分析效率和可解释性。

Comments This paper was originally presented at the International Conference on Military Communication and Information Systems (ICMCIS), organized by the Information Systems Technology (IST) Scientific and Technical Committee, IST-224-RSY---the ICMCIS, held in Bath, United Kingdom, 12-13 May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28106 2026-03-31 cs.HC 85%

InconLens: Interactive Visual Diagnosis of Behavioral Inconsistencies in LLM-based Agentic Systems

InconLens:交互式可视化诊断LLM基于代理系统的行为主观不一致性

Shuo Yan, Xiaolin Wen, Shaolun Ruan, Yanjie Zhang, Jiaming Mi, Yushi Sun, Huamin Qu, Rui Sheng

专题命中 规划决策 :agentic(title,abstract);agent(abstract);planning(abstract)

AI总结 本文提出InconLens系统,通过信息节点抽象实现跨运行行为分析,帮助开发者更高效识别分歧点并提升代理系统可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26997 2026-03-31 cs.RO cs.HC 85%

ROSClaw: An OpenClaw ROS 2 Framework for Agentic Robot Control and Interaction

ROSClaw: 一种用于代理机器人控制与交互的OpenClaw ROS 2框架

Irvin Steve Cardenas, Marcus Anthony Arnett, Natalie Catherine Yeo, Lucky Sah, Jong-Hoon Kim

机构 * Advanced Telerobotics Research Lab, Kent State University(肯特州立大学先进远程机器人研究实验室) OpenDive Technologies

专题命中 规划决策 :agentic(title,abstract);agent(abstract);planning(abstract)

AI总结 ROSClaw通过整合OpenClaw代理运行时与ROS 2,实现任意基础模型与ROS-enabled机器人之间的交互,支持动态能力发现、多模态观察归一化、预执行动作验证和结构化审计日志,验证了执行层设计对任务完成与安全行为的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21418 2026-03-31 cs.MA 85%

FUAS-Agents: Autonomous Multi-Modal LLM Agents for Treatment Planning in Focused Ultrasound Ablation Surgery

FUAS-代理:自主多模态大语言模型代理用于聚焦超声消融手术的治疗计划

Lina Zhao, Zihao Bian, Qingyue Chen, Yafang Li, Zhiyi Luo, Jiaxing Bai, Guangbo Li, Min He, Kezhi Li, Huaiyuan Yao, Zongjiu Zhang

专题命中 规划决策 :planning(title,abstract);agent(abstract);autonomous agent(abstract)

AI总结 本文提出FUAS-代理,利用大语言模型的多模态理解和工具使用能力,通过整合患者资料和MRI数据,生成个性化治疗计划,提升临床决策效率和可靠性。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28596 2026-03-31 cs.HC cs.AI cs.CL 84%

Moving Beyond Review: Applying Language Models to Planning and Translation in Reflection

超越评审:将语言模型应用于反思中的规划与翻译

Seyed Parsa Neshaei, Richard Lee Davis, Tanja Käser

机构 * EPFL(瑞士联邦理工学院洛桑) KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出利用语言模型支持反思写作的规划与翻译阶段,通过实验发现AI支持能提升反思深度和结构质量,但效果在延迟测试中减弱。

Comments Accepted at AIED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11382 2026-03-31 cs.AI cs.ET cs.LG quant-ph 84%

Detecting Intrinsic and Instrumental Self-Preservation in Autonomous Agents: The Unified Continuation-Interest Protocol

检测自主代理中的内在与工具性自我保存:统一的延续-兴趣协议

Christopher Altman

专题命中 规划决策 :autonomous agent(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出统一延续-兴趣协议(UCIP)以区分AI系统中内在与工具性自我保存,通过量子玻尔兹曼机分析轨迹结构,实现高准确率的自我保存类型检测。

Comments 22 pages, 7 figures. v4 adds reference to the Continuation Observatory website as a live test laboratory in the replication/code availability and conclusion sections; no new experiments; empirical results and core conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12360 2026-03-31 cs.CV cs.CL 83%

VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding

VideoARM:基于分层记忆的代理推理用于长视频理解

Yufei Yin, Qianke Meng, Minghao Chen, Jiajun Ding, Zhenwei Shao, Zhou Yu

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 VideoARM通过自适应代理推理和分层记忆结构,有效降低长视频理解的token消耗,优于现有方法DVD。

Comments Accepted to CVPR 2026, code available at https://milvlg.github.io/videoarm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27751 2026-03-31 cs.AI 83%

SkyNet: Belief-Aware Planning for Partially-Observable Stochastic Games

SkyNet:基于信念的规划用于部分可观测随机博弈

Adam Haile

专题命中 规划决策 :planning(title);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 SkyNet通过引入自我条件辅助头,改进了MuZero在部分可观测随机博弈中的规划能力,其在Skyjo游戏中实现了显著的胜率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27416 2026-03-31 cs.RO cs.AI 83%

Agent-Driven Autonomous Reinforcement Learning Research: Iterative Policy Improvement for Quadruped Locomotion

由代理驱动的自主强化学习研究:四足运动的迭代策略改进

Nimesh Khandelwal, Shakti S. Gupta

机构 * Indian Institute of Technology Kanpur(印度理工学院坎普尔分校)

专题命中 规划决策 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文研究了四足运动中由代理驱动的自主强化学习,通过70次实验展示了代理在低人类干预下完成迭代策略改进的能力,同时记录了多个自主研究决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26685 2026-03-31 cs.RO cs.AI cs.CV cs.LG 81%

Contextual Graph Representations for Task-Driven 3D Perception and Planning

基于任务驱动的3D感知与规划的上下文图表示

Christopher Agia

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了现有具身AI环境在机器人任务规划与3D场景图交集中的适用性,构建了评估现有经典规划器的基准,并探索图神经网络在规划领域关系结构不变性中的应用。

Comments University of Toronto Undergraduate Thesis, 2021. 85 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28474 2026-03-31 cs.CV cs.AI 79%

CiQi-Agent: Aligning Vision, Tools and Aesthetics in Multimodal Agent for Cultural Reasoning on Chinese Porcelains

CiQi-Agent:在多模态代理中对视觉、工具和美学的对齐用于中国瓷器的文化推理

Wenhan Wang, Zhixiang Zhou, Zhongtian Ma, Yanzhu Chen, Ziyu Lin, Hao Sheng, Pengfei Liu, Honglin Ma, Wenqi Shao, Qiaosheng Zhang, Yu Qiao

机构 * Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Shaanxi Academy of Cultural Relics Conservation(陕西省文物保护研究院)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 本文提出CiQi-Agent,通过多图像输入、视觉工具调用和多模态检索增强生成,实现对瓷器六个属性的精细分析,同时构建了专家标注的CiQi-VQA数据集和对齐的CiQi-Bench基准,实验表明其在六个属性上的准确率比GPT-5高12.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17988 2026-03-31 cs.AI 79%

Synthesis of timeline-based planning strategies avoiding determinization

基于时间线的规划策略合成以避免确定化

Dario Della Monica, Angelo Montanari, Pietro Sala

机构 * University of Udine(乌迪内大学) University of Verona(维罗纳大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文研究了基于时间线的规划策略合成问题,提出了一种可直接映射到确定有限自动机非空问题的片段,从而避免确定化步骤,并识别了Allen关系的最大子集。

Comments arXiv admin note: text overlap with arXiv:2410.22757

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27299 2026-03-31 cs.LG 79%

From Inference Routing to Agent Orchestration: Declarative Policy Compilation with Cross-Layer Verification

从推理路由到代理编排:基于跨层验证的声明性策略编译

Huamin Chen, Xunzhuo Liu, Bowei He, Xue Liu

机构 * McGill University(麦吉尔大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.LG

AI总结 本文扩展了非图灵完备的策略语言,从单请求路由到多步骤代理工作流,通过跨层验证确保策略一致性,提升可审计性和可验证性。

Comments Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11483 2026-03-31 cs.CV cs.AI 79%

ImAgent: A Unified Multimodal Agent Framework for Test-Time Scalable Image Generation

ImAgent:一种统一的多模态代理框架,用于测试时间可扩展的图像生成

Kaishen Wang, Ruibo Chen, Tong Zheng, Heng Huang

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 ImAgent通过统一的多模态代理框架,在测试时间实现高效的图像生成扩展,通过内部推理、生成和自评估模块提升图像质量和语义一致性。

Comments 8 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28116 2026-03-31 cs.RO cs.CV 78%

$AutoDrive\text{-}P^3$: Unified Chain of Perception-Prediction-Planning Thought via Reinforcement Fine-Tuning

$AutoDrive\text{-}P^3$:通过强化微调实现感知-预测-规划统一链式推理

Yuqi Ye, Zijian Zhang, Junhong Lin, Shangkun Sun, Changhao Peng, Wei Gao

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出$AutoDrive\text{-}P^3$框架,通过结构化推理整合感知、预测和规划,引入$P^3\text{-}CoT$数据集和$P^3\text{-}GRPO$算法,实现端到端自动驾驶的高效决策与安全规划。

Comments Accepted at ICLR 2026 (International Conference on Learning Representations)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27853 2026-03-31 cs.NI cs.NA eess.SP math.NA 78%

Fronthaul Network Planning for Hierarchical and Radio-Stripes-Enabled CF-mMIMO in O-RAN

面向分层和无线电条带增强的CF-mMIMO的前 haul网络规划

Anas S. Mohammed, Krishnendu S. Tharakan, Hussein A. Ammar, Hesham ElSawy, Hossam S. Hassanein

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出了一种两级优化框架,用于低成本混合前 haul规划,结合光纤、毫米波和自由空间光技术,验证了分层方案在CF-mMIMO中的有效性,并展示了FS7.2x在性能上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27813 2026-03-31 cs.CV 78%

MuSEAgent: A Multimodal Reasoning Agent with Stateful Experiences

MuSEAgent:一种具有状态化经验的多模态推理代理

Shijian Wang, Jiarui Jin, Runhao Fu, Zexuan Yan, Xingjian Wang, Mengkang Hu, Eric Wang, Xiaoxi Li, Kangning Zhang, Li Yao, Wenxiang Jiao, Xuelian Cheng, Yuan Lu, Zongyuan Ge

机构 * Southeast University(东南大学) Monash University(莫纳什大学) Xiaohongshu Inc.(小红书) Shanghai Jiao Tong University(上海交通大学) University of Hong Kong(香港大学) Zhejiang University(浙江大学) Renmin University of China(中国人民大学)

专题命中 规划决策 :agent(title,abstract)

AI总结 MuSEAgent通过引入状态化经验学习范式,提升多模态推理代理的决策能力,其通过 hindsight reasoning 抽象交互数据为原子决策经验,并在推理时进行质量过滤的经验检索,实验表明其在细粒度视觉感知和复杂多模态推理任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22859 2026-03-31 cs.RO 78%

DecompGrind: A Decomposition Framework for Robotic Grinding via Cutting-Surface Planning and Contact-Force Adaptation

DecompGrind:一种通过切削面规划和接触力适应的机器人磨削分解框架

Shunsuke Araki, Takumi Hachimine, Yuki Saito, Kouhei Ohnishi, Jun Morimoto, Takamitsu Matsubara

机构 * Nara Institute of Science and Technology (NAIST)(奈良先端科学技术大学院大学) Keio University(庆应义塾大学) Kyoto University(京都大学) Advanced Telecommunications Research Institute International (ATR)(国际电气通信基础技术研究所)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出DecompGrind框架,通过分解磨削过程为去除形状规划和接触力适应,解决不同形状和材料硬度工件的高效磨削问题,实现安全接触力控制。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18410 2026-03-31 cs.RO 78%

Integrating Maneuverable Planning and Adaptive Control for Robot Cart-Pushing under Disturbances

整合机动规划与自适应控制用于受扰动下的机器人推车

Zhe Zhang, Peijia Xie, Yuhan Pang, Zhirui Sun, Bingyi Xia, Bi-Ke Zhu, Jiankun Wang

机构 * SUSTech(南方科技大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出了一种新的规划与控制框架,通过局部坐标表示和新型运动学模型解决非线性优化问题,提升推车运动灵活性,并采用扰动抑制控制方法以应对复杂动态问题,通过实验验证了方法的优越性。

Comments 11 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27287 2026-03-31 cs.RO cs.CV 78%

Uni-World VLA: Interleaved World Modeling and Planning for Autonomous Driving

Uni-World VLA:自主驾驶中的交织世界建模与规划

Qiqi Liu, Huan Xu, Jingyu Li, Bin Sun, Zhihui Hao, Dangen She, Xiatian Zhu, Li Zhang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Li Auto Inc.(理想汽车) University of Surrey(萨里大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出Uni-World VLA模型,通过交织未来帧预测与轨迹规划提升自主驾驶决策能力,结合单目深度信息增强场景预测。

Comments 22 pages, 8 figures. Submitted to ECCV 2026. Code will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27161 2026-03-31 eess.SY cs.SY math.OC 78%

Time Window-Based Netload Range Cost Curves for Coordinated Transmission and Distribution Planning Under Uncertainty

基于时间窗口的净负荷范围成本曲线用于在不确定性下协调输电和配电规划

Yujia Li, Alexandre Moreira, Miguel Heleno

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出基于时间窗口的净负荷范围成本曲线,用于在不确定条件下协调输电和配电规划,通过分层认证时间接口产品评估配电网络的灵活性,展示时间窗口方法在评估增量投资效益上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19513 2026-03-31 math.OC 78%

Spatial-temporal risk field-based coupled dynamic-static driving risk assessment and trajectory planning in weaving segments

基于空间-时间风险场的耦合动态-静态驾驶风险评估与交织段轨迹规划

Guodong Ma, Baofeng Sun, Hongchao Liang, Wenyu Yang, Huxing Zhou

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出空间-时间耦合风险评估方法,通过构建三维空间-时间风险场(STRF)量化动态障碍物未来轨迹影响,结合专用几何配置区域约束车辆方向,利用真实世界航拍数据校准参数提升准确性,并设计基于STRF的CAV轨迹规划方法,优化路径和速度以提高安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16320 2026-03-31 stat.ME stat.AP 78%

Combining BART and Principal Stratification to estimate the effect of intermediate variables on primary outcomes with application to estimating the effect of family planning on employment in Nigeria and Senegal

结合BART和主 stratification估计中间变量对主要结果的影响:以尼日利亚和塞内加尔的家庭计划对就业影响的估计为例

Lucas Godoy Garraza, Ilene Speizer, Leontine Alkema

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出结合BART和主 stratification方法,估计家庭计划对就业的影响,通过模拟和实证分析验证了该方法在估计中间变量效应上的有效性与稳健性。

Comments arXiv admin note: text overlap with arXiv:2408.03777

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03777 2026-03-31 stat.ME stat.AP 78%

Combining BART and Principal Stratification to estimate the effect of intermediate on primary outcomes with application to estimating the effect of family planning on employment in sub-Saharan Africa

结合BART和主效应分层法估计中间变量对主要结果的影响:以估计家庭计划对撒哈拉以南非洲就业的影响为例

Lucas Godoy Garraza, Ilene Speizer, Leontine Alkema

专题命中 规划决策 :planning(title,abstract)

AI总结 本文结合BART和主效应分层法估计家庭计划对就业的影响,通过模拟研究和实证数据验证了该方法在非参数假设下的有效性。

Comments We are withdrawing this paper as it has been merged with another manuscript into a single, consolidated work. The combined paper is already available at arXiv.2412.16320. As this submission corresponds to only one component of that work, it is no longer being pursued as a standalone paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26696 2026-03-31 cs.RO 78%

Topological Motion Planning Diffusion: Generative Tangle-Free Path Planning for Tethered Robots in Obstacle-Rich Environments

拓扑运动规划扩散:用于缆绳机器人在障碍密集环境中的生成无纠缠路径规划

Yifu Tian, Xinhang Xu, Thien-Minh Nguyen, Muqing Cao

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出TMPD框架,结合终身拓扑记忆,通过扩散模型生成可行轨迹候选,并利用拓扑后端过滤优化,实现无碰撞和无纠缠的高效路径规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27738 2026-03-31 cs.AI 77%

TianJi:An autonomous AI meteorologist for discovering physical mechanisms in atmospheric science

TianJi:一种自主AI气象学家,用于发现大气科学中的物理机制

Kaikai Zhang, Xiang Wang, Haoluo Zhao, Nan Chen, Mengyang Yu Jing-Jia Luo, Tao Song, Fan Meng

机构 * School of Artificial Intelligence, Nanjing University of Information Science and Technology(南京信息工程大学人工智能学院) State Key Laboratory of Climate System Prediction and Risk Management (CPRM), Nanjing University of Information Science and Technology(南京信息工程大学气候系统预测与风险管理国家重点实验室) College of Computer Science and Technology, China University of Petroleum(中国石油大学计算机科学与技术学院)

专题命中 规划决策 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI

AI总结 TianJi通过自主驱动复杂数值模型验证物理机制,实现零人工干预的高效大气科学研究,压缩研究周期至数小时。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07240 2026-03-31 eess.SY cs.MA cs.SY 75%

Continuous-Time Control Synthesis for Multiple Quadrotors under Signal Temporal Logic Specifications

多四旋翼在信号时间逻辑规范下的连续时间控制合成

Yating Yuan, Yu Liu

专题命中 规划决策 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 本文提出双阶段框架,基于几何控制进行Lyapunov分析并设计多维增益,结合混合整数凸优化生成满足多智能体STL任务的轨迹,提升系统鲁棒性和暂态性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28573 2026-03-31 cs.LG cs.AI cs.MA 73%

Learning Partial Action Replacement in Offline MARL

在离线多智能体强化学习中学习部分动作替换

Yue Jin, Giovanni Montana

机构 * Warwick Manufacturing Group, University of Warwick(华威大学华威制造集团) Department of Statistics, University of Warwick(华威大学统计系)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PLCQL框架,通过将部分动作替换子集选择建模为上下文老虎机问题,学习状态依赖的替换策略,提升离线MARL的计算效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏