arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-03 至 2026-03-03 共收录 299 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 103 篇

2603.00469 2026-03-03 cs.AI math.OC 74%

Why Not? Solver-Grounded Certificates for Explainable Mission Planning

为何不?基于求解器的可解释任务规划证书

Najeeb Khan

机构 * Serana AI Inc.(Serana AI公司)

专题命中 规划决策 :planning(title);分类 cs.AI

AI总结 本文提出基于求解器的可解释任务规划证书方法,通过优化模型本身生成解释,实现正确性、反事实有效性及稳定性,提升调度决策的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03253 2026-03-03 cs.LG cs.AI 73%

Solving the Granularity Mismatch: Hierarchical Preference Learning for Long-Horizon LLM Agents

解决粒度不匹配问题:用于长周期LLM代理的层次化偏好学习

Heyang Gao, Zexu Sun, Erxue Min, Hengyi Cai, Shuaiqiang Wang, Dawei Yin, Xu Chen

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(人工智能与数字经济广东实验室) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Baidu Inc.(百度公司)

专题命中 规划决策 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出层次化偏好学习方法,通过双层课程引导解决LLM代理长周期任务中的粒度不匹配问题,提升多粒度偏好优化能力。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00977 2026-03-03 cs.AI cs.LG 73%

HiMAC: Hierarchical Macro-Micro Learning for Long-Horizon LLM Agents

HiMAC:用于长视界LLM代理的分层宏微学习

Hongbo Jin, Rongpeng Zhu, Jiayu Ding, Wenhao Zhang, Ge Li

机构 * School of Electronic and Computer Engineering(电子与计算机工程学院) Peking University(北京大学)

专题命中 规划决策 :planning(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 HiMAC通过分层宏微学习框架,提升LLM代理在长视界任务中的规划与执行能力,实现更高效的强化学习训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01969 2026-03-03 physics.med-ph 71%

Assessing Hemodynamic Impact of Tissue-Engineered Vascular Graft Displacement: Combining Postoperative in vivo Results and Computational Modeling to Improve Surgical Planning

评估组织工程血管移植物位移的血流动力学影响:结合术后体内结果和计算建模以改进手术规划

Seda Aslan, Enze Chen, Miya Mese-Jones, Jacqueline Contento, Hidenori Hayashi, Keigo Kawaji, Joey Huddle, Jed Johnson, Yue-Hin Loke, Mark Fuge, Laura Olivieri, Thao D Nguyen, Narutoshi Hibino, Axel Krieger

专题命中 规划决策 :planning(title)

AI总结 本研究通过结合体内结果和计算建模,评估TEVG位移和大小对血流动力学的影响,以改进手术规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00835 2026-03-03 cs.RO cs.LG 70%

CAIMAN: Causal Action Influence Detection for Sample-efficient Loco-manipulation

CAIMAN:用于样本高效移动-操作的因果动作影响检测

Yuanchen Yuan, Jin Cheng, Núria Armengol Urpí, Stelian Coros

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.LG

AI总结 CAIMAN通过因果动作影响作为内在动机目标,提升腿部机器人在稀疏奖励下的样本效率和移动-操作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01104 2026-03-03 cs.HC cs.AI cs.CV cs.CY 70%

Egocentric Co-Pilot: Web-Native Smart-Glasses Agents for Assistive Egocentric AI

第一人称共驾:面向辅助第一人称AI的网页原生智能眼镜代理

Sicheng Yang, Yukai Huang, Weitong Cai, Shitong Sun, Fengyi Fang, You He, Yiqiao Xie, Jiankang Deng, Hang Zhang, Jifei Song, Zhensong Zhang

机构 * Shenzhen International Graduate School Tsinghua University Shenzhen China(深圳国际研究生院清华大学深圳中国) Independent Researcher London United Kingdom(独立研究者伦敦英国) Queen Mary University of London London United Kingdom(女王玛丽大学伦敦英国) Imperial College London London United Kingdom(帝国理工学院伦敦英国) University Of Surrey Guildford United Kingdom(Surrey大学Guildford英国)

专题命中 规划决策 :AI agent(abstract);tool use(abstract);分类 cs.AI

AI总结 Egocentric Co-Pilot通过网页原生智能眼镜代理实现第一人称AI的持续辅助,结合神经符号框架和多模态意图层,展示了在日常生活中提升可及性和情境感知的实用路径。

Comments 14 pages, 6 figures, WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00612 2026-03-03 cs.CL 70%

From Literature to Hypotheses: An AI Co-Scientist System for Biomarker-Guided Drug Combination Hypothesis Generation

从文献到假设:一种用于生物标志物引导的药物组合假设生成的AI合作者系统

Raneen Younis, Suvinava Basak, Lukas Chavez, Zahra Ahmadi

机构 * Peter L. Reichertz Institute for Medical Informatics (PLRI), Hannover Medical School(汉诺威医学院彼得·L·里赫茨医学信息学研究所) Lower Saxony Center for Artificial Intelligence and Causal Methods in Medicine (CAIMed)(下萨克森医学人工智能与因果方法中心) Sanford Burnham Prebys (SBP) Medical Discovery Institute, San Diego(圣地亚哥桑福尔德·伯恩斯医学发现研究所)

专题命中 规划决策 :agent(abstract);workflow(abstract);分类 cs.CL

AI总结 本文提出 AI 合作者系统 CoDHy,通过整合生物医学知识图谱和文献证据,实现基于生物标志物的药物组合假设生成与验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08166 2026-03-03 cs.AI 70%

ZeroDVFS: Zero-Shot LLM-Guided Core and Frequency Allocation for Embedded Platforms

ZeroDVFS: 面向嵌入式平台的零样本LLM引导的核心与频率分配

Mohammad Pivezhandi, Mahdi Banisharif, Abusayeed Saifullah, Ali Jannesari

机构 * Wayne State University(韦恩州立大学) Iowa State University(爱荷华州立大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 ZeroDVFS通过基于模型的强化学习和LLM引导的语义特征提取,实现嵌入式平台的零样本核心与频率分配,显著提升能效和任务完成效率。

Comments 56 pages, 14 figures, 18 tables (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01637 2026-03-03 cs.CV 67%

DriveCombo: Benchmarking Compositional Traffic Rule Reasoning in Autonomous Driving

DriveCombo:自主驾驶中组合交通规则推理的基准测试

Enhui Ma, Jiahuan Zhang, Guantian Zheng, Tao Tang, Shengbo Eben Li, Yuhang Lu, Xia Zhou, Xueyang Zhang, Yifei Zhan, Kun Zhan, Zhihui Hao, Xianpeng Lang, Kaicheng Yu

机构 * Autolab, Westlake University(西lake大学自动化实验室) Li Auto Inc(Li Auto公司) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 规划决策 :agent(abstract);planning(abstract)

AI总结 DriveCombo提出了一种基于文本和视觉的基准,用于评估自动驾驶中复杂交通规则的推理能力,通过五级认知阶梯和Rule2Scene代理提升模型在多规则冲突场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01414 2026-03-03 cs.RO 67%

Jailbreaking Embodied LLMs via Action-level Manipulation

通过动作层面操控实现体感大语言模型的突破

Xinyu Huang, Qiang Yang, Leming Shen, Zijing Ma, Yuanqing Zheng

机构 * The Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学) University of Cambridge, Cambridge, United Kingdom(剑桥大学)

专题命中 规划决策 :AI agent(abstract);planning(abstract)

AI总结 Blindfold通过动作层面操控实现对体感大语言模型的突破,其攻击成功率显著高于现有基线,凸显了对后果感知防御机制的迫切需求。

Comments This paper has been officially accepted for ACM SenSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01041 2026-03-03 cs.RO 67%

Coordinated Control of Multiple Construction Machines Using LLM-Generated Behavior Trees with Flag-Based Synchronization

利用LLM生成的行为树实现多台施工机械的协调控制

Akinosuke Tsutsumi, Tomoya Itsuka, Yuichiro Kasahara, Tomoya Kouno, Kota Akinari, Genki Yamauchi, Daisuke Endo, Taro Abe, Takeshi Hashimoto, Keiji Nagatani, Ryo Kurazume

机构 * Graduate School of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电气工程研究生院) Public Works Research Institute(公共工程研究所) Institute of Systems and Information Engineering, University of Tsukuba(筑波大学系统与信息工程研究所) Faculty of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电气工程学部)

专题命中 规划决策 :planning(abstract);workflow(abstract)

AI总结 本文提出利用LLM生成行为树实现施工机械协调控制,通过同步标志提升多机协作效率,实验验证其在土方自动化中的可行性。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13474 2026-03-03 cs.CL cs.AI cs.LG 67%

Language Agents for Hypothesis-driven Clinical Decision Making with Reinforcement Learning

用于强化学习的假设驱动临床决策制定语言代理

David Bani-Harouni, Chantal Pellegrini, Ege Özsoy, Nassir Navab, Matthias Keicher

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出了一种基于强化学习的假设驱动语言代理LA-CDM,用于提升临床诊断的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01966 2026-03-03 cs.CL cs.AI 62%

AMemGym: Interactive Memory Benchmarking for Assistants in Long-Horizon Conversations

AMemGym:用于长时对话中助手的交互式记忆基准测试

Cheng Jiayang, Dongyu Ru, Lin Qiu, Yiyang Li, Xuezhi Cao, Yangqiu Song, Xunliang Cai

机构 * The Hong Kong University of Science and Technology(香港科技大学) Meituan(美团)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 AMemGym通过交互式环境实现长时对话中助手的内存管理优化,揭示现有内存系统性能差距并推动策略自我进化。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01907 2026-03-03 cs.LG cs.CL 62%

Efficient RLVR Training via Weighted Mutual Information Data Selection

通过加权互信息数据选择实现高效的RLVR训练

Xinyu Zhou, Boyu Zhu, Haotian Zhang, Huiming Wang, Zhijiang Guo

专题命中 规划决策 :planning(abstract);分类 cs.CL、cs.LG

AI总结 InSight通过加权互信息数据选择方法提升RLVR训练效率,实现性能和加速的显著提升。

Comments 15 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17616 2026-03-03 cs.LG cs.AI 62%

Stable Asynchrony: Variance-Controlled Off-Policy RL for LLMs

稳定异步性:用于大语言模型的方差控制的非策略强化学习

Luke J. Huang, Zhuoyang Zhang, Qinghao Hu, Shang Yang, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达)

专题命中 规划决策 :tool-use(abstract);分类 cs.AI、cs.LG

AI总结 VCPO通过动态调整学习率和最小方差基线,提升大语言模型异步训练的稳定性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18453 2026-03-03 cs.AI cs.CL 62%

Reason Like a Radiologist: Chain-of-Thought and Reinforcement Learning for Verifiable Report Generation

像放射科医生一样推理:用于可验证报告生成的推理链和强化学习

Peiyuan Jing, Kinhei Lee, Zhenxuan Zhang, Huichi Zhou, Zhengqing Yuan, Zhifan Gao, Lei Zhu, Giorgos Papanastasiou, Yingying Fang, Guang Yang

专题命中 规划决策 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 BoxMed-RL通过推理链和强化学习生成可验证的放射科报告,提升报告的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01748 2026-03-03 cs.LG cs.AI 62%

Discrete World Models via Regularization

通过正则化构建离散世界模型

Davide Bizzaro, Luciano Serafini

机构 * University of Padua(帕多瓦大学) Fonadazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 DWMR通过正则化方法实现无监督布尔世界模型学习,提高表示准确性和转换性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01694 2026-03-03 cs.CV cs.AI cs.LG 62%

MVR: Multi-view Video Reward Shaping for Reinforcement Learning

MVR:多视图视频奖励塑造用于强化学习

Lirui Luo, Guoxi Zhang, Hongming Xu, Yaodong Yang, Cong Fang, Qing Li

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 MVR通过多视角视频和视觉语言模型提升强化学习中的奖励塑造,有效解决复杂动态任务中的状态相关性和视角偏见问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01657 2026-03-03 cs.LG cs.AI 62%

FreeGNN: Continual Source-Free Graph Neural Network Adaptation for Renewable Energy Forecasting

FreeGNN: 为可再生能源预测的连续无源图神经网络适应

Abderaouf Bahi, Amel Ourici, Ibtissem Gasmi, Aida Derrablia, Warda Deghmane, Mohamed Amine Ferrag

机构 * Computer Science and Applied Mathematics Laboratory (LIMA), Faculty of Science and Technology, Chadli Bendjedid University(计算机科学与应用数学实验室(LIMA),科学与技术学院,查德利·本杰迪德大学) Mathematical Modeling and Numerical Simulation Laboratory (LAM2SIN), Faculty of Technology, Badji Mokhtar University(数学建模与数值模拟实验室(LAM2SIN),技术学院,巴杰·莫克塔尔大学) College of Information Technology, United Arab Emirates University(信息科技学院,阿拉伯联合酋长国大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 FreeGNN通过连续无源图神经网络适应技术,实现对可再生能源预测的准确鲁棒性,适用于多站点、多时间分辨率的实时环境适应。

Comments 16 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01335 2026-03-03 cs.LG cs.AI 62%

Provable and Practical In-Context Policy Optimization for Self-Improvement

可证明且实用的上下文内策略优化用于自我改进

Tianrun Yu, Yuxiao Yang, Zhaoyang Wang, Kaixiang Zhao, Porter Jenkins, Xuchao Zhang, Chetan Bansal, Huaxiu Yao, Weitong Zhang

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ICPO方法,通过上下文内自我反思和最小熵优化,在保持低推理成本的同时实现数学推理任务的高性能

Comments 34 pages, 8 tables, 4 figures, Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19113 2026-03-03 cs.LG cs.AI stat.ML 62%

Learning from Complexity: Exploring Dynamic Sample Pruning of Spatio-Temporal Training

从复杂性学习:探索时空训练的动态样本修剪

Wei Chen, Junle Chen, Yuqian Wu, Yuxuan Liang, Xiaofang Zhou

机构 * HKUST(GZ)(香港科技大学(广州))

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ST-Prune方法,通过动态样本修剪提升时空预测任务的训练效率和模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21500 2026-03-03 cs.LG cs.AI 62%

Chasing the Tail: Effective Rubric-based Reward Modeling for Large Language Model Post-Training

追逐尾部:基于评分标准的奖励建模以实现大语言模型的后训练效果

Junkai Zhang, Zihao Wang, Lin Gui, Swarnashree Mysore Sathyendra, Jaehwan Jeong, Victor Veitch, Wei Wang, Yunzhong He, Bing Liu, Lifeng Jin

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Scale AI, Inc.(Scale AI 公司) University of Chicago(芝加哥大学)

专题命中 规划决策 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于评分标准的奖励建模方法,通过关注高奖励区域以缓解大语言模型强化微调中的奖励过度优化问题,并实现有效的后训练改进。

Comments In ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00530 2026-03-03 cs.AI cs.CL 62%

CityLens: Evaluating Large Vision-Language Models for Urban Socioeconomic Sensing

CityLens:评估大型视觉-语言模型用于城市社会经济感知

Tianhui Liu, Hetian Pang, Xin Zhang, Tianjian Ouyang, Zhiyuan Zhang, Jie Feng, Yong Li, Pan Hui

机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系) School of Electronic and Information Engineering, Beijing Jiaotong University(北京交通大学电子与信息工程学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 CityLens通过评估大型视觉-语言模型在城市社会经济指标预测中的表现,揭示了其在可持续城市发展中的潜力与局限性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00602 2026-03-03 cs.LG cs.AI 62%

Learning to Explore: Policy-Guided Outlier Synthesis for Graph Out-of-Distribution Detection

学习探索:基于策略的异常合成用于图分布外检测

Li Sun, Lanxu Yang, Jiayu Tian, Bowen Fang, Xiaoyan Yu, Junda Ye, Peng Tang, Hao Peng, Philip S. Yu

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 PGOS通过强化学习策略生成高质量伪OOD图,提升图分布外检测的鲁棒性与性能

Comments Accepted by AAAI'26, 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00396 2026-03-03 cs.LG cs.AI cs.SY eess.SY math.OC 62%

Hereditary Geometric Meta-RL: Nonlocal Generalization via Task Symmetries

继承性几何元强化学习:通过任务对称性实现非局部泛化

Paul Nitschke, Shahriar Talebi

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出继承性几何元强化学习方法,通过任务对称性实现非局部泛化,提升任务空间泛化能力。

Comments Accepted to 2026 American Control Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02208 2026-03-03 cs.CL 57%

Reasoning Core: A Scalable Procedural Data Generation Suite for Symbolic Pre-training and Post-Training

Reasoning Core:一个可扩展的程序化数据生成套件,用于符号预训练和后训练

Valentin Lacombe, Valentin Quesnel, Damien Sileo

机构 * Univ. Lille, Inria, CNRS, Centrale Lille, UMR 9189 - CRIStAL(里尔大学、法国国家信息与自动化研究所、法国国家科学研究中心、中央理工大学、UMR 9189 - CRIStAL)

专题命中 规划决策 :planning(abstract);分类 cs.CL

AI总结 Reasoning Core 提出了一种可扩展的程序化数据生成套件,用于符号预训练和后训练,通过生成多样化的符号推理数据提升语言模型的推理能力。

Comments Keywords: LLMs, NLP, Dataset, Corpus, Procedural Pre-training, Reasoning, Logic, Formal Semantics https://github.com/sileod/reasoning_core

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01460 2026-03-03 cs.SE 57%

Production-Grade AI Coding System for Client-Side Development

面向客户端开发的生产级AI编码系统

Ruihan Wang, Chencheng Guo, Guangjing Wang

专题命中 规划决策 :planning(abstract);分类 cs.SE

AI总结 本文提出了一种面向客户端开发的生产级AI编码系统,通过结构化多阶段流程整合Figma设计、PRD和领域知识,提升代码生成与产品需求的对齐性。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01286 2026-03-03 cs.AI cs.RO 57%

Information-Theoretic Framework for Self-Adapting Model Predictive Controllers

信息论框架用于自适应模型预测控制器

Wael Hafez, Amir Nazeri

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出基于信息论的纠缠学习框架,通过信息数字双胞胎提升MPC的自适应能力,实现对动态环境的实时响应与优化。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01241 2026-03-03 cs.IR cs.AI 57%

TARSE: Test-Time Adaptation via Retrieval of Skills and Experience for Reasoning Agents

TARSE: 通过检索技能和经验进行测试时适应以实现推理代理

Junda Wang, Zonghai Tao, Hansi Zeng, Zhichao Yang, Hamed Zamani, Hong Yu

机构 * University of Massachusetts Amherst, MA, USA(马萨诸塞大学阿姆赫斯特分校) University of Massachusetts Lowell, MA, USA(马萨诸塞大学洛厄尔分校)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 TARSE通过检索技能和经验实现测试时适应,提升医疗推理代理的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01047 2026-03-03 cs.LG stat.ML 57%

Evaluating GFlowNet from partial episodes for stable and flexible policy-based training

从部分片段评估GFlowNet以实现稳定且灵活的基于策略的训练

Puhua Niu, Shili Wu, Xiaoning Qian

机构 * Texas A&M University(德克萨斯大学) Brookhaven National Laboratory(布鲁克海文国家实验室)

专题命中 规划决策 :workflow(abstract);分类 cs.LG

AI总结 本文提出了一种基于流平衡的评估方法,用于提升基于策略的训练的稳定性和灵活性,通过在部分片段上学习评估器来减少策略分歧。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏