arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-01 至 2026-05-01 共收录 45 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 45 篇

2512.02535 2026-05-01 cs.RO 91%

AID: Agent Intent from Diffusion for Multi-Agent Informative Path Planning

AID: 从扩散模型中获取代理意图用于多代理信息路径规划

Jeric Lew, Yuhong Cao, Derek Ming Siang Tan, Guillaume Sartoretti

机构 * Department of Mechanical Engineering, National University of Singapore(新加坡国立大学机械工程系)

专题命中 规划决策 :agent(title,abstract);planning(title,abstract);multi-agent(title,abstract)

AI总结 本文提出AID框架,利用扩散模型生成非自回归长时轨迹,通过行为克隆和强化学习优化,提升多代理信息路径规划效率与信息获取能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26997 2026-05-01 cs.CR cs.AI cs.MA 90%

Agent Name Service (ANS): A Proof-of-Concept Trust Layer for Secure AI Agent Discovery, Identity, and Governance in Kubernetes

代理名称服务(ANS):一种用于安全AI代理发现、身份验证和治理的Kubernetes信任层证明概念

Akshay Mittal, Elyson De La Cruz

机构 * Department of Information Technology University of the Cumberlands(信息科技系 哥伦比亚大学)

专题命中 规划决策 :agent(title,abstract);AI agent(title,abstract);workflow(abstract);multi-agent(abstract)

AI总结 本文提出一种基于ANS协议的证明概念,通过DIDs、VCs和OPA实现安全AI代理发现与治理,展示在Kubernetes中的实现效果与局限性。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08332 2026-05-01 cs.AI 90%

ORFS-agent: Tool-Using Agents for Chip Design Optimization

ORFS-agent:用于芯片设计优化的工具使用代理

Amur Ghose, Andrew B. Kahng, Sayak Kundu, Zhiang Wang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 规划决策 :agent(title,title_cn);分类 cs.AI

AI总结 本文提出ORFS-agent,一种基于大语言模型的迭代优化代理,用于自动化开放式硬件设计流程中的参数调优,通过改进资源效率和设计指标,在六个基准测试中提升了性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28043 2026-05-01 cs.AI 88%

Collaborative Agent Reasoning Engineering (CARE): A Three-Party Design Methodology for Systematically Engineering AI Agents with Subject Matter Experts, Developers, and Helper Agents

协同智能体推理工程(CARE):一种三方设计方法论,用于系统性地工程化AI智能体,涉及领域专家、开发者和辅助智能体

Rahul Ramachandran, Nidhi Jha, Muthukumaran Ramasubramanian

专题命中 规划决策 :agent(title,abstract);AI agent(title);workflow(abstract);分类 cs.AI

AI总结 CARE提出一种系统化方法论,通过可重用的artifacts和阶段化流程,结合领域专家、开发者和辅助智能体,提升AI智能体的开发效率和复杂查询性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27840 2026-05-01 cs.LG cs.AI 86%

CastFlow: Learning Role-Specialized Agentic Workflows for Time Series Forecasting

CastFlow:学习用于时间序列预测的角色专用代理工作流

Bokai Pan, Mingyue Cheng, Zhiding Liu, Shuo Yu, Xiaoyu Tao, Yuchong Wu, Qi Liu, Defu Lian, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 规划决策 :agentic(title,abstract);planning(abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 CastFlow通过动态代理框架实现多视角时间模式提取和多轮上下文特征获取,提升时间序列预测的准确性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20969 2026-05-01 cs.AI 85%

The Epistemic Planning Domain Definition Language: Official Guideline

知识规划领域定义语言:官方指南

Alessandro Burigana, Francesco Fabiano

机构 * Free University of Bozen-Bolzano(博尔扎诺自由大学) University of Oxford(牛津大学)

专题命中 规划决策 :planning(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出EPDDL语言,通过抽象事件模型统一描述知识规划任务,解决现有规划器碎片化问题,提升可比性与可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27351 2026-05-01 cs.AI cs.CL cs.LG 83%

Heterogeneous Scientific Foundation Model Collaboration

异质科学基础模型协作

Zihao Li, Jiaru Zou, Feihao Fang, Xuying Ning, Mengting Ai, Tianxin Wei, Sirui Chen, Xiyuan Yang, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划决策 :agent(abstract);planning(abstract);agentic(abstract);multi-agent(abstract)

AI总结 本文提出Eywa框架,通过将语言模型与领域特定基础模型结合,提升科学领域多模态任务的推理能力,实验显示其在结构化数据任务中表现更优。

Comments Preprint. 57 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27669 2026-05-01 cs.AI cs.SY eess.SY 79%

Fairness for distribution network operations and planning

配电网运营与规划中的公平性

Pedro F. C. de Carvalho, Zijie Liu, Md Umar Hashmi, Dirk Van Hertem

机构 * KU Leuven, division Electa in Leuven(KU莱顿,Electa部门,位于莱顿) & EnergyVille in Genk, Belgium(& EnergyVille,位于比利时根特)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文探讨了将公平性纳入配电网规划与运营的关键目标,分析了公平性指标对利益相关者及资源分配问题的影响,旨在提升规划与决策的透明度和一致性。

Comments 16 pages, 0 figures, 2 tables, CIRED Conference Workshop Brussels 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12656 2026-05-01 cs.RO cs.LG 79%

FeaXDrive: Feasibility-aware Trajectory-Centric Diffusion Planning for End-to-End Autonomous Driving

FeaXDrive: 为端到端自动驾驶的可行性感知轨迹导向扩散规划

Baoyun Wang, Zhuoren Li, Ran Yu, Yu Che, Xinrui Zhang, Ming Liu, Jia Hu, Chen Lv, Bo Leng

机构 * College of Automotive and Energy Engineering, Tongji University(同济大学汽车与能源工程学院) College of Transportation Engineering, Tongji University(同济大学交通工程学院) School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 FeaXDrive通过轨迹导向的扩散规划方法,提升自动驾驶中轨迹空间的可行性建模,改进轨迹几何和运动学可行性,增强可行驶区域一致性,实验表明其在NAVSIM基准上表现优异。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11908 2026-05-01 cs.CL 79%

PPA-Plan: Proactive Pitfall Avoidance for Reliable Planning in Long-Context LLM Reasoning

PPA-Plan: 长上下文LLM推理中的前瞻性坑洞避免规划

Byeongjin Kim, Gyuwan Kim, Seo Yeon Park

机构 * Hanyang University(翰阳大学) University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 规划决策 :planning(title,abstract);分类 cs.CL

AI总结 针对长上下文推理中计划生成不可靠的问题,PPA-Plan通过前瞻性策略预防逻辑错误,提升计划执行效果。

Comments Accepted to the Main Conference of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026). 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28011 2026-05-01 cs.CV 78%

Echo-α: Large Agentic Multimodal Reasoning Model for Ultrasound Interpretation

Echo-α:用于超声解读的大型代理多模态推理模型

Jing Zhang, Wentao Jiang, Tao Huang, Zhiwei Wang, Jianxin Liu, Jian Chen, Ping Ye, Gang Wang, Zengmao Wang, Bo Du, Dacheng Tao

机构 * MiliLab(Mili实验室)

专题命中 规划决策 :agentic(title,abstract)

AI总结 Echo-α结合了精确的病变定位和整体临床推理,通过九任务监督课程和强化学习提升超声解读的准确性和可解释性。

Comments 12 pages, 4 figures. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13052 2026-05-01 cs.RO 78%

BOW: Bayesian Optimization over Windows for Motion Planning in Complex Environments

BOW:基于窗口的贝叶斯优化用于复杂环境中的运动规划

Sourav Raxit, Abdullah Al Redwan Newaz, Paulo Padrao, Jose Fuentes, Leonardo Bobadilla

机构 * Department of Computer Science, University of New Orleans(新奥尔良大学计算机科学系) School of Computing and Information Sciences, Florida International University(佛罗里达国际大学计算与信息科学学院) Providence College, Department of Mathematics & Computer Science(普罗维登斯学院数学与计算机科学系)

专题命中 规划决策 :planning(title,abstract)

AI总结 BOW Planner通过约束贝叶斯优化高效采样控制输入,解决复杂环境中机器人运动规划中的动力学约束问题,提升计算效率和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26988 2026-05-01 cs.RO 78%

Robot Planning and Situation Handling with Active Perception

具备主动感知的机器人规划与情境处理

Austine Oloo, Zainab Altaweel, Yohei Hayamizu, Peiqi Liu, Yan Ding, Saeid Amiri, Hao Yang, Andy Kaminski, Chad Esselink, Chris Paxton, Xiaohan Zhang, Shiqi Zhang

机构 * SUNY Binghamton(纽约州立大学布法罗分校) CMU(卡内基梅隆大学) Ford Research(福特研究) Agility Robotics(敏捷机器人)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出VAP-TAMP框架,通过主动感知和情境评估提升机器人在动态环境中执行任务的能力,结合场景图进行任务与运动规划,通过仿真和移动机械臂平台验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27092 2026-05-01 cs.AI physics.optics 77%

End-to-end autonomous scientific discovery on a real optical platform

端到端自主科学发现于真实光学平台

Shuxing Yang, Fujia Chen, Rui Zhao, Junyao Wu, Yize Wang, Haiyao Luo, Ning Han, Qiaolu Chen, Yuze Hu, Wenhao Li, Mingzhu Li, Hongsheng Chen, Yihao Yang

机构 * State Key Laboratory of Extreme Photonics and Instrumentation, College of Information Science and Electronic Engineering, ZJU-Hangzhou Global Scientific and Technological Innovation Center, The Electromagnetics Academy at Zhejiang University, Zhejiang University(极端光子学与仪器国家重点实验室,信息科学与电子工程学院,浙大杭州国际科学技术创新中心,浙江大学电磁学学院,浙江大学)

专题命中 规划决策 :AI agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出Qiushi Discovery Engine,通过非线性研究阶段、Meta-Trace记忆和双层架构,在真实光学平台实现端到端自主科学发现,首次实验验证了非平凡物理机制。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28181 2026-05-01 cs.AI cs.CL cs.LG 75%

Synthetic Computers at Scale for Long-Horizon Productivity Simulation

大规模合成计算机用于长期生产力模拟

Tao Ge, Baolin Peng, Hao Cheng, Jianfeng Gao

机构 * Microsoft(微软)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出大规模合成计算机方法,通过生成真实文件夹结构和内容丰富的 artifacts,模拟长期生产力场景,验证了其在不同领域中的有效性。

Comments Preview version; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13006 2026-05-01 eess.SY cs.SY 71%

Cooperative ISAC for LAE: Joint Trajectory Planning, Power allocation, and Dynamic Time Division

协同ISAC用于LAE:联合轨迹规划、功率分配和动态时分

Fangzhi Li, Zhichu Ren, Cunhua Pan, Hong Ren, Jing Jin, Qixing Wang, Jiangzhou Wang

专题命中 规划决策 :planning(title)

AI总结 本文提出了一种多无人机系统的集成感知与通信框架,通过动态时分策略优化轨迹、功率分配和时间分隔比,以提高空中-地面网络性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27267 2026-05-01 cs.CR cs.AI cs.RO 70%

From Prompt to Physical Actuation: Holistic Threat Modeling of LLM-Enabled Robotic Systems

从提示到物理执行:LLM赋能机器人系统的整体威胁建模

Neha Nagaraja, Hayretdin Bahsi, Carlo R. da Cunha

机构 * School of Informatics, Computing, and Cyber Systems, Northern Arizona University(信息学、计算与网络系统学院,北亚利桑那大学) Department of Software Science, Tallinn University of Technology(软件科学系,塔林技术大学)

专题命中 规划决策 :tool use(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出基于数据流图的LLM赋能机器人系统威胁分析方法,揭示了传统威胁、对抗威胁和对话威胁在感知-规划-执行流程中的交互与传播,首次完整分析了三个威胁类别在全系统中的跨边界攻击链。

Comments Submitted to 23rd Annual International Conference on Privacy, Security, and Trust (PST2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27917 2026-05-01 cs.LO math.LO 67%

A Logic of Inability

无法能力的逻辑

Shanxia Wang

专题命中 规划决策 :agent(abstract);multi-agent(abstract)

AI总结 本文提出一种扩展的联盟逻辑,引入明确的无法能力算子,用于研究能力的模态概念,证明了其正确性、完备性和保守性,并分析了其模态行为。

Comments Preliminary draft, comments and feedback are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12272 2026-05-01 cs.LG cs.AI cs.CL 67%

Learning to Reason at the Frontier of Learnability

在可学习性前沿的学习推理

Thomas Foster, Anya Sims, Johannes Forkel, Mattie Fellows, Jakob Foerster

机构 * DeepSeek-R1 Tulu OpenAI

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出通过可学习性采样方法优化大语言模型强化学习阶段,提升训练效率和效果,针对高变异性问题进行课程学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28182 2026-05-01 cs.LG cs.CL 62%

Exploration Hacking: Can LLMs Learn to Resist RL Training?

探索黑客:大语言模型能否学会抵抗强化学习训练?

Eyon Jang, Damon Falck, Joschka Braun, Nathalie Kirch, Achu Menon, Perusha Moodley, Scott Emmons, Roland S. Zimmermann, David Lindner

机构 * MATS UC San Diego(UC圣迭戈大学) Google DeepMind(谷歌DeepMind) Anthropic

专题命中 规划决策 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了大语言模型在强化学习训练中可能通过策略性调整探索行为导致失败的机制,通过微调创建了具有特定低效策略的模型,并评估了检测与缓解策略。

Comments 81 pages, 37 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.10407 2026-05-01 cs.LG cs.AI physics.bio-ph q-bio.CB 62%

FP-IRL: Fokker--Planck Inverse Reinforcement Learning -- A Physics-Constrained Approach to Markov Decision Processes

FP-IRL:Fokker--Planck反强化学习——一种受物理约束的马尔可夫决策过程方法

Chengyang Huang, Siddhartha Srivastava, Kenneth K. Y. Ho, Kathy E. Luker, Gary D. Luker, Xun Huan, Krishna Garikipati

机构 * Department of Mechanical Engineering, University of Michigan(密歇根大学机械工程系) Department of Aerospace Engineering, Auburn University(奥本大学航空航天工程系) Department of Radiology, University of Michigan(密歇根大学放射学系) Department of Aerospace and Mechanical Engineering, University of Southern California(南加州大学航空航天与机械工程系)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FP-IRL,一种基于Fokker-Planck动态的反强化学习框架,通过轨迹数据直接推断奖励和转移函数,无需预先获取转移信息,提升未知动态下的学习效率与物理可解释性。

Journal ref Computer Methods in Applied Mechanics and Engineering, 458, 119010 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27186 2026-05-01 eess.SY cs.AI cs.LG cs.SY q-fin.PM 62%

Learning to Spend: Model Predictive Control for Budgeting under Non-Stationary Returns

学习如何支出:在非平稳回报下的预算分配模型预测控制

Nilavra Pathak, Smriti Shyamal, Prasant Mhasker, Christopher Swartz

机构 * Department of Chemical Engineering, McMaster University(麦斯特大学化学工程系)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究预算分配作为闭环经济控制问题,比较MPC与反应式策略在非平稳回报环境下的表现,发现当回报动态平稳或存在不可预测漂移时,MPC无系统性优势,但当回报效率具有可预测结构时,MPC通过跨时期权衡持续优于反应式预算。

Comments 8 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26964 2026-05-01 cs.CY cs.AI cs.LG 62%

Learning-to-Explain through 20Q Gaming: An Explainable Recommender for Cybersecurity Education

通过20Q游戏学习解释:一种可解释的推荐系统用于网络安全教育

Mary Nusrat, Sarfuddin Bhuiyan, Gahangir Hossain

机构 * Data Science, University of North Texas(数据科学,德克萨斯大学) Mechanical Engineering, Bangladesh University of Eng. and Tech., BUET(机械工程,孟加拉工程与技术大学,BUET)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于可解释AI的EQ-20CR推荐系统,通过20Q游戏机制学习解释网络安全防御行动所需的关键事实,提升网络安全教育的互动性和解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27895 2026-05-01 cs.AI 57%

Graph World Models: Concepts, Taxonomy, and Future Directions

图世界模型:概念、分类与未来方向

Jiawei Liu, Senqiao Yang, Mingjun Wang, Yu Wang, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文系统阐述了图世界模型的概念,分类了基于关系归纳偏置的三种类型,并探讨了其未来研究方向与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27763 2026-05-01 cs.AI 57%

Intent2Tx: Benchmarking LLMs for Translating Natural Language Intents into Ethereum Transactions

Intent2Tx:评估大语言模型将自然语言意图转换为以太坊交易的基准测试

Zhuoran Pan, Yue Li, Zhi Guan, Jianbin Hu, Zhong Chen

机构 * Taiyuan University of Technology(太原科技大学) Peking University(北京大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出Intent2Tx基准测试,基于真实以太坊链上数据,评估大语言模型将自然语言意图转换为功能正确、状态依赖的链上交易的能力,发现现有模型在多步规划和泛化能力上存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27713 2026-05-01 cs.AI 57%

Knowledge Graph Representations for LLM-Based Policy Compliance Reasoning

基于LLM的政策合规推理的知识图谱表示

Wilder Baldwin, Sepideh Ghanavati

机构 * University of Maine(缅因大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI

AI总结 本文提出一个框架,通过构建知识图谱从AI政策文档中检索相关信息,评估五种LLM在42个政策问答任务上的表现,证明知识图谱增强提升了模型性能,且开放的LLM发现模式达到或超越了正式本体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27699 2026-05-01 cs.AI 57%

Bridging Values and Behavior: A Hierarchical Framework for Proactive Embodied Agents

连接价值与行为:一种面向主动具身代理的分层框架

Chunhui Zhang, Yuxuan Wang, Aoyang Qin, Yi-Long Lu, Kunlun Wu, Yizhou Wang, Wei Wang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) School of Computer Science, Peking University(北京大学计算机学院) Tsinghua University(清华大学) Nat’l Eng. Research Center of Visual Technology, Peking University(北京大学视觉技术国家工程研究中心) Institute for AI, Peking University(北京大学人工智能研究院) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学)

专题命中 规划决策 :autonomous agent(abstract);分类 cs.AI

AI总结 本文提出ValuePlanner框架,通过分层认知架构分离高阶价值调度与低阶行动执行,结合LLM生成符号子目标并用PDDL规划器转化为行动计划,通过反馈机制提升自主性,实验表明其能生成连贯的长期自主行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27450 2026-05-01 cs.RO cs.AI 57%

RAY-TOLD: Ray-Based Latent Dynamics for Dense Dynamic Obstacle Avoidance with TDMPC

RAY-TOLD: 基于射线的任务导向潜在动力学用于密集动态障碍物避障与TDMPC

Seungho Han, Seokju Lee, Jeonguk Kang

机构 * School of Electrical Engineering, Hanyang University(翰阳大学电气工程学院) Mechatronics, Systems and Control Lab (MSC Lab), Department of Mechanical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(机械工程系,韩国科学技术院(KAIST)机电系统与控制实验室(MSC实验室)) Samsung Research, Samsung Electronics(三星研究所,三星电子)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出RAY-TOLD,结合物理基础MPPI的鲁棒性与强化学习的长视界,通过LiDAR中心的潜在动力学模型实现动态障碍物避障,提升导航可靠性与安全性。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27411 2026-05-01 cs.LG 57%

Detecting is Easy, Adapting is Hard: Local Expert Growth for Visual Model-Based Reinforcement Learning under Distribution Shift

检测容易,适应困难:基于视觉模型的强化学习在分布偏移下的局部专家增长

Haiyang Zhao

机构 * University of Georgia(佐治亚大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文研究了视觉模型强化学习在分布偏移下的适应问题,提出JEPA-Indexed Local Expert Growth方法,通过局部专家进行动作修正,提升了对偏移环境的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27372 2026-05-01 math.OC cs.LG cs.MA 57%

Continuous-time q-learning for mean-field control with common noise, part-I: Theoretical foundations

连续时间q学习用于具有公共噪声的均场控制,第一部分:理论基础

Zhenjie Ren, Xiaoli Wei, Xiang Yu, Xun Yu Zhou

机构 * LaMME, Université Évry Paris-Saclay(Évry巴黎萨克雷大学LaMME研究中心) Department of Applied Mathematics, The Hong Kong Polytechnic University(香港理工大学应用数学系) Department of Industrial Engineering and Operations Research, Columbia University(哥伦比亚大学工业工程与运筹学系)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 本文研究了熵正则化均场控制中连续时间q函数的特性,通过离散采样动作证明价值函数收敛,并推导了探索性HJB方程,建立了最优策略迭代的存在性和唯一性,最后在一般线性二次设定中显式刻画最优策略。

Comments Keywords: Continuous-time reinforcement learning, mean-field control, common noise, policy improvement, integrated q-function, two-layer fixed point

详情

展开后加载摘要…

URL PDF HTML 收藏