arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-11 至 2026-05-11 共收录 199 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 63 篇

2605.07370 2026-05-11 cs.RO cs.AI cs.MA cs.SY eess.SY 79%

MORPH-U: Multi-Objective Resilient Motion Planning for V2X-Enabled Autonomous Driving in High-Uncertainty Environments via Simulation

MORPH-U:基于仿真实现多目标鲁棒运动规划的V2X赋能自动驾驶高不确定性环境

Shih-Yu Lai

机构 * CARLA-based vehicle-side pipeline(基于CARLA的车辆侧流水线)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出MORPH-U,通过融合V2X与传感器数据构建局部动态地图,采用多目标优化方法在跟踪误差、安全余量、响应性和平滑度之间进行权衡,通过Pareto前沿分析选择操作点,并利用拜占庭启发的接受门防止故障触发下的不安全重规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07103 2026-05-11 cs.AI cs.MA 79%

ARMOR: An Agentic Framework for Reaction Feasibility Prediction via Adaptive Utility-aware Multi-tool Reasoning

ARMOR:一种通过自适应效用感知多工具推理的代理框架用于反应可行性预测

Ye Liu, Botao Yu, Xinyi Ling, Daniel Adu-Ampratwum, Xia Ning

机构 * Department of Biomedical Informatics(生物医学信息学系) Department of Computer Science and Engineering(计算机科学与工程系) Division of Medicinal Chemistry and Pharmacognosy(药物化学与药理学系) Translational Data Analytics Institute(转化数据分析研究所)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 ARMOR通过自适应效用感知多工具推理框架,有效整合多个工具的优势,提升反应可行性预测的准确性,尤其在存在工具预测冲突时表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06957 2026-05-11 cs.AI 79%

Learning and Reusing Policy Decompositions for Hierarchical Generalized Planning with LLM Agents

基于LLM代理的分层通用规划中的策略分解学习与重用

Shirin Sohrabi, Haritha Ananthakrishnan, Harsha Kokel, Kavitha Srinivas, Michael Katz

机构 * IBM

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出一种结合通用规划与分层任务分解的动态策略学习方法,通过自动分解学习可重用的策略组件,提升任务执行效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06924 2026-05-11 cs.CV cs.AI 79%

A$^2$RD: Agentic Autoregressive Diffusion for Long Video Consistency

A$^2$RD:基于代理的自回归扩散用于长视频一致性

Do Xuan Long, Yale Song, Min-Yen Kan, Tomas Pfister, Long T. Le

机构 * Google Cloud AI Research(谷歌云人工智能研究)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 A$^2$RD通过Retrieve-Synthesize-Refine-Update循环实现长视频一致性合成,提升视频生成的连贯性和叙事一致性。

Comments Project page: http://dxlong2000.github.io/AARD

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10512 2026-05-11 cs.LG cs.LO stat.ML 79%

Exponential Sample Complexity Separation between Flat and Hierarchical Agentic Theorem Provers

平坦与分层代理定理证明器的指数样本复杂度分离

Sho Sonoda, Shunta Akiyama, Yuya Uezato

机构 * CyberAgent RIKEN AIP(RIKEN先进研究所)

专题命中 规划决策 :agentic(title,abstract);分类 cs.LG

AI总结 研究通过分析教师证明器生成的数据分布,探讨了分层证明器在重复子证明中通过预测可重用证明图来减少样本需求的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07570 2026-05-11 cs.DS cs.CG 78%

Coordinated Motion Planning is FPT on Discretized Simple Polygons

在离散化简单多边形上的协调运动规划是FPT

Argyrios Deligkas, Eduard Eiben, Robert Ganian, Iyad Kanj

专题命中 规划决策 :planning(title,abstract)

AI总结 本文研究了在离散化简单多边形上协调运动规划问题,提出了一种参数为机器人数量k的固定参数算法,解决了该问题的参数复杂性,推动了对子网格和平面图的协调运动规划研究。

Comments A short version of this manuscript appears in the proceedings of ICALP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07251 2026-05-11 cs.AI 77%

Can Agents Price a Reaction? Evaluating LLMs on Chemical Cost Reasoning

智能体能否定价反应?评估大语言模型在化学成本推理上的能力

Yuyang Wu, Yue Huang, Shuaike Shen, Xujian Wang, Shuhao Zhang, Qiyao Xue, Weichen Liu, Runtian Gao, Jian Ma, Xiangliang Zhang, Olexandr Isayev

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Notre Dame(Notre Dame 大学) University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校) University of Pittsburgh(匹兹堡大学)

专题命中 规划决策 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出ChemCost基准,评估大语言模型在化学成本推理任务中的能力,发现工具访问并非解决问题的充分条件,且在噪声环境下表现下降。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07703 2026-05-11 cs.AI cs.RO 74%

Finite-Time Analysis of MCTS in Continuous POMDP Planning

连续POMDP规划中MCTS的有限时间分析

Da Kong, Vadim Indelman

机构 * Technion Autonomous Systems Program (TASP)(技术离子自主系统计划(TASP)) Technion – Israel Institute of Technology(技术离子–以色列理工学院) Stephen B. Klein Faculty of Aerospace Engineering(史蒂文·B·克莱因航空航天工程学院) Faculty of Data and Decision Sciences(数据与决策科学学院)

专题命中 规划决策 :planning(title);分类 cs.AI

AI总结 本文针对连续POMDP规划中的MCTS,提出有限时间分析,通过扩展多项式探索奖励和引入抽象分区框架,提供理论保证,提出Voro-POMCPOW算法在连续观测空间中实现有效探索。

Comments 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00380 2026-05-11 cs.LG cs.CL 73%

ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning

ResRL: 通过负样本投影残差强化学习提升大语言模型推理能力

Zihan Lin, Xiaohan Wang, Jie Cao, Jiajun Chai, Li Wang, Xiaodong Lu, Wei Lin, Ran He, Guojun Yin

机构 * MAIS\&NLPR, Institute of Automation, Chinese Academy of Sciences, Beijing, China(MAIS与NLPR,自动化研究所,中国科学院,北京,中国) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing, China(先进交叉学科学院,中国科学院大学,北京,中国)

专题命中 规划决策 :agent(abstract);function calling(abstract);分类 cs.CL、cs.LG

AI总结 本文提出ResRL,通过解耦正负响应的语义分布,提升LLM推理能力同时保持生成多样性,在十二个基准测试中超越强基线,尤其在数学推理上表现更优。

Comments Accepted to ICML 2026. Preprint version. https://github.com/1229095296/ResRL.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06859 2026-05-11 cs.LG cs.AI 73%

Exact Is Easier: Credit Assignment for Cooperative LLM Agents

精确更简单:合作大语言模型代理的信用分配

Yanjun Chen, Yirong Sun, Hanlin Wang, Jinghan Wang, Xinming Zhang, Xiaoyu Shen, Wenjie Li, Wei Zhang

机构 * Eastern Institute of Technology(东部技术研究所) The Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出C3方法,通过精确历史恢复实现合作大语言模型代理的信用分配,证明精确方法在效果、成本和效率上均优于近似方法,并引入三种可审计指标用于信用评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07110 2026-05-11 cs.CL cs.SE 73%

Securing Computer-Use Agents: A Unified Architecture-Lifecycle Framework for Deployment-Grounded Reliability

保障计算机使用代理:一种面向部署的架构-生命周期框架用于可靠性

Zejian Chen, Zhanyuan Liu, Chaozhuo Li, Mengxiang Han, Songyang Liu, Litian Zhang, Feng Gao, Yiming Hei, Xi Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) China Academy of Information and Communications Technology, Artificial Intelligence Institute(信息与通信技术研究院,人工智能研究所)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.CL、cs.SE

AI总结 本文提出一种面向部署的架构-生命周期框架,用于提升计算机使用代理的可靠性,通过分析感知、决策和执行层,以及创建、部署、操作和维护阶段,解决能力形成、授权暴露、故障表现和控制放置之间的联系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19788 2026-05-11 cs.AI cs.LG 73%

Benchmarking World-Model Learning with Environment-Level Queries

用环境级查询评估世界模型学习

Archana Warrier, Dat Nguyen, Michelangelo Naim, Moksh Jain, Yichao Liang, Karen Schroeder, Cambridge Yang, Joshua B. Tenenbaum, Sebastian Vollmer, Kevin Ellis, Zenna Tavares

机构 * Basis Research Institute DFKI GmbH Harvard University Universit\'e de Montr\'eal \& Mila - Quebec AI Institute University of Cambridge Massachusetts Institute of Technology Cornell University

专题命中 规划决策 :AI agent(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出WorldTest协议,通过环境级查询评估智能体是否学习到支持多种环境属性的模型,通过AutumnBench验证人类在网格世界环境中的表现优于前沿模型。

Comments 34 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08019 2026-05-11 cs.AI q-bio.NC 70%

Reason to Play: Behavioral and Brain Alignment Between Frontier LRMs and Human Game Learners

玩乐的动机:前沿LRMs与人类游戏学习者的行为与大脑对齐

Botos Csaba, Sreejan Kumar, Austin Tudor David Andrews, Laurence Hunt, Chris Summerfield, Joshua B. Tenenbaum, Rui Ponte Costa, Marcelo G. Mattar, Momchil Tomov

机构 * University of Oxford(牛津大学) Columbia University(哥伦比亚大学) New York University(纽约大学) Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文研究了前沿LRMs在游戏学习中的行为与大脑活动对齐情况,发现其在游戏发现阶段更接近人类行为,并能更准确预测大脑活动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07937 2026-05-11 cs.CL 70%

Ask Early, Ask Late, Ask Right: When Does Clarification Timing Matter for Long-Horizon Agents?

尽早、晚些时候、正确时机:澄清时机对长周期智能体有何影响?

Anmol Gulati, Hariom Gupta, Elias Lumer, Sahil Sen, Vamse Kumar Subbiah

机构 * PricewaterhouseCoopers U.S(普华永道美国公司)

专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.CL

AI总结 研究探讨了澄清时机对长周期智能体性能的影响,发现澄清价值依赖于缺失信息类型,且过晚澄清会降低性能。通过实验验证了任务内在的时机特性,为设计时间感知的澄清策略提供了依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07537 2026-05-11 cs.AI 70%

Multi-Environment POMDPs with Finite-Horizon Objectives

多环境POMDPs与有限时间目标

Léonard Brice, Filip Cano, Krishnendu Chatterjee, Thomas A. Henzinger, Stefanie Muroya

机构 * Institute of Science and Technology Austria(奥地利科学与技术研究所)

专题命中 规划决策 :agent(abstract,abstract_cn);分类 cs.AI

AI总结 本文研究多环境POMDPs在有限时间目标下的最优值与策略计算,证明该问题在POMDPs中为PSPACE完全问题,并提出有效算法在经典基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05558 2026-05-11 cs.AI cs.CY 70%

Who Prices Cognitive Labor in the Age of Agents? Compute-Anchored Wages

在代理时代谁定价认知劳动?基于计算的工资

Siqi Zhu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出计算锚定工资理论,指出代理并非劳动力而是将计算资本转化为认知劳动的有效单位,从而改变劳动力市场的工资定价机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17942 2026-05-11 cs.AI cs.DB 70%

LLM-Based SQL Generation: Prompting, Self-Refinement, and Adaptive Weighted Majority Voting

基于大型语言模型的SQL生成:提示、自我完善与自适应加权多数投票

Yu-Jie Yang, Hung-Fu Chang, Po-An Chen

机构 * Institute of Information Management(信息管理研究所) National Yang Ming Chiao Tung University(阳明交通大学) R. B. Annis School of Engineering(R. B. Annis工程学院) University of Indianapolis(印第安纳大学)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出SSEV管道,通过自我完善与加权多数投票提升SQL生成准确性,在多个基准测试中取得良好成绩,并进一步提出ReCAPAgent-SQL框架以应对企业数据库复杂性,提升实际应用效果。

Comments 29 pages, 22 figures

Journal ref 2026 International Conference on Information Management

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03479 2026-05-11 cs.CV 67%

ProcObject-10K: Benchmarking Object-Centric Procedural Understanding in Instructional Videos

ProcObject-10K:面向教学视频中以对象为中心的程序理解的基准测试

Wenliang Guo, Yu Kong

机构 * Michigan State University(密歇根州立大学)

专题命中 规划决策 :planning(abstract,abstract_cn)

AI总结 本文提出ProcObject-10K,首个评估教学视频中以对象为中心推理和时间证据定位的基准,涵盖137个任务和五种推理类型,揭示模型在对象动态理解上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19759 2026-05-11 cs.CC 67%

Pushing Blocks without Fixed Walls via Checkable Gizmos: Push-1 is PSPACE-Complete

通过可检查的工具推动方块而不依赖固定墙壁:Push-1 是 PSPACE 完全的

MIT Hardness Group, Josh Brunner, Lily Chung, Erik D. Demaine, Jenny Diomidova, Della Hendrickson, Jayson Lynch

专题命中 规划决策 :agent(abstract);planning(abstract)

AI总结 本文证明了Push-1问题PSPACE完全性,移除了固定墙壁的需要,展示了新的可检查工具框架,并连接了运动规划通过工具框架与图定向重配置问题。

Comments 34 pages, 20 figures. Improved writing and added intuition

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07195 2026-05-11 cs.CV 67%

See Tomorrow, Act Today: Foresight-Driven Autonomous Driving

预见未来,立即行动:基于预见的自动驾驶

Bozhou Zhang, Nan Song, Yuang Wang, Jiankang Deng, Xiatian Zhu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) Imperial College London(伦敦帝国理工学院) University of Surrey(萨里大学)

专题命中 规划决策 :autonomous agent(abstract);planning(abstract)

AI总结 本文提出ForeSight框架,通过生成未来场景并据此规划动作,实现前瞻性决策,实验表明其在动态场景中优于现有方法。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06690 2026-05-11 cs.AI cs.CL cs.LG 67%

State Representation and Termination for Recursive Reasoning Systems

递归推理系统的状态表示与终止

Debashis Guha, Amritendu Mukherjee, Sanjay Kukreja, Tarun Kumar

机构 * S P Jain School of Global Management(S P Jain 全球管理学院) Indian Statistical Institute(印度统计研究所) eClerx Services Ltd.(eClerx 服务有限公司)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出了一种递归推理系统的状态表示方法及终止条件,通过epistemic状态图编码提取的主张、证据关系、开放问题和置信度权重,并定义了顺序间隙以判断迭代的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07841 2026-05-11 cs.LG cs.AI cs.DC 62%

\mathsf{VISTA}: Decentralized Machine Learning in Adversary Dominated Environments

VISTA:在敌手主导环境中去中心化机器学习

Hanzaleh Akbari Nodehi, Parsa Moradi, Soheil Mohajer, Mohammad Ali Maddah-Ali

机构 * University of Minnesota(明尼苏达大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VISTA算法,通过动态调整接受阈值,在敌手主导的去中心化学习中实现渐近收敛,无需诚实多数假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07817 2026-05-11 cs.CV cs.AI cs.CL 62%

GazeVLM: Active Vision via Internal Attention Control for Multimodal Reasoning

GazeVLM:通过内部注意力控制实现多模态推理的主动视觉

Brown Ebouky, Gabriele Carrino, Niccolo Avogaro, Christoph Studer, Andrea Bartezzaghi, Mattia Rigotti

机构 * IBM Research(IBM研究院) ETH Zurich(苏黎世联邦理工学院) TU Wien(维也纳技术大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 GazeVLM通过内部注意力控制实现主动视觉,使模型在多模态推理中实现从全局空间感知到局部聚焦推理的无缝切换,无需外部工具或增加视觉token。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07677 2026-05-11 cs.IR cs.AI cs.CL 62%

TRACE: Tourism Recommendation with Accountable Citation Evidence

TRACE:基于可问责引用证据的旅游推荐

Zixu Zhao, Sijin Wang, Yu Hou, Yuanyuan Xu, Yufan Sheng, Xike Xie, Wenjie Zhang, Won-Yong Shin, Xin Cao

机构 * UNSW Sydney(新南威尔士大学悉尼分校) University of Adelaide(阿德莱德大学) Yonsei University(延世大学) USTC(中国科学技术大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 TRACE通过多轮对话结合评论引用和显式拒绝机制,解决旅游推荐中信任、可验证性和适应性问题,提出三项能力差距并验证评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07335 2026-05-11 cs.LG cs.SE 62%

CellScientist: Dual-Space Hierarchical Orchestration for Closed-Loop Refinement of Virtual Cell Models

细胞科学家:双空间分层协调用于虚拟细胞模型的闭环细化

Mengran Li, Bo Li, Jiaying Wang, Wenbin Xing, Yixuan Dong, Chengyang Zhang, Hongliang Zhang, Yuzhong Peng, Jinlin Wu, Bob Zhang, Bingo Wing-Kuen Ling, Fuji Yang, Zhen Lei, Jiebo Luo, Zelin Zang

机构 * Center for Artificial Intelligence and Robotics(人工智能与机器人中心) Hong Kong Institute of Science and Innovation(香港科学与创新研究院)

专题命中 规划决策 :workflow(abstract);分类 cs.LG、cs.SE

AI总结 本文提出CellScientist框架,通过双空间分层协调实现虚拟细胞模型的闭环细化,解决模型预测误差的反馈路由问题,提升模型修订效率和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07278 2026-05-11 cs.LG cs.AI cs.CV 62%

Predictive but Not Plannable: RC-aux for Latent World Models

可预测但不可计划:RC-aux用于潜在世界模型

Wenyuan Li, Guang Li, Keisuke Maeda, Takahiro Ogawa, Miki Haseyama

机构 * Hokkaido University(北海道大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RC-aux,通过改进潜在世界模型的时空匹配,提升规划能力,实验表明其在目标导向任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07129 2026-05-11 cs.IR cs.AI cs.LG 62%

RRCM: Ranking-Driven Retrieval over Collaborative and Meta Memories for LLM Recommendation

RRCM:基于协作和元记忆的排序驱动检索用于LLM推荐

Shijun Li, Wooseong Yang, Yu Wang, Tianxin Wei, Joydeep Ghosh

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Illinois at Chicago(伊利诺伊大学香槟分校) Capital One AI Foundations(Capital One AI基金会) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 RRCM通过排序驱动的检索与推理框架,解决LLM推荐中构建相关上下文的挑战,利用自然语言表示的协作和元记忆,实现灵活的证据获取,提升推荐质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01569 2026-05-11 cs.AI cs.CL 62%

InvThink: Premortem Reasoning for Safer Language Models

InvThink:用于更安全语言模型的预mortem推理

Yubin Kim, Taehan Kim, Eugene Park, Chunjong Park, Cynthia Breazeal, Daniel McDuff, Hae Won Park

机构 * MIT(麻省理工学院) Google Research(谷歌研究院) Google DeepMind(谷歌DeepMind) Samsung Research(三星研究)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 InvThink通过预mortem推理框架提升语言模型安全性,通过枚举、分析和约束潜在故障来生成响应,相比现有方法在安全性和减少有害行为方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07737 2026-05-11 cs.SE 57%

Securing the Dark Matter: A Semantic-Enhanced Neuro-Symbolic Framework for Supply Chain Analysis of Opaque Industrial Software

守护暗物质:一种语义增强的神经符号框架用于opaque工业软件的供应链分析

Bowei Ning, Xuejun Zong, Lian Lian, Kan He, Yifei Sun, Yuxiang Lei, Plamen Vasilev

专题命中 规划决策 :agent(abstract);分类 cs.SE

AI总结 本文提出一种语义增强的神经符号框架,通过直接从opaque二进制中重建行为语义,实现可扩展的全局风险推理,提升供应链分析的准确性和语义映射精度。

Comments 33 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07520 2026-05-11 cs.AI 57%

Model-Driven Policy Optimization in Differentiable Simulators via Stochastic Exploration

基于可微模拟器的模型驱动策略优化:通过随机探索

Yuval Aroosh, Ayal Taitler

机构 * Department of Industrial Engineering and Management(工业工程与管理系)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出MDPO框架,通过在优化过程中注入噪声提升可微规划的探索能力,有效解决非线性和混合连续-离散域中的优化问题,实验表明其优于确定性方法和模型无关基线。

详情

展开后加载摘要…

URL PDF HTML 收藏