arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-23 至 2026-03-23 共收录 104 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 4 篇

2603.14332 2026-03-23 cs.CR 91%

Governing Dynamic Capabilities: Cryptographic Binding and Reproducibility Verification for AI Agent Tool Use

动态能力治理:用于AI代理工具使用的加密绑定与可重复性验证

Ziling Zhou

专题命中 工具调用 :agent(title,abstract);AI agent(title,abstract);tool use(title);multi-agent(abstract)

AI总结 本文提出三种代理治理要求,通过加密绑定和可重复性验证解决AI代理动态能力验证问题,证明两个结构定理并验证两种加密方案,展示低开销和高安全性。

Comments 23 pages, 5 figures, 18 tables. Includes 11 experiments, 9 formal security properties, and appendix with proofs

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12180 2026-03-23 cs.CL cs.AI 73%

Strategic Navigation or Stochastic Search? How Agents and Humans Reason Over Document Collections

策略导航还是随机搜索?智能体和人类如何在文档集合上进行推理

Łukasz Borchmann, Jordy Van Landeghem, Michał Turski, Shreyansh Padarha, Ryan Othniel Kearns, Adam Mahdi, Niels Rogge, Clémentine Fourrier, Siwei Han, Huaxiu Yao, Artemis Llabrés, Yiming Xu, Dimosthenis Karatzas, Hao Zhang, Anupam Datta

机构 * Snowflake\,AI\,Research University\,of\,Oxford Computer\,Vision\,Center

专题命中 工具调用 :planning(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文通过MADQA基准测试,探讨智能体与人类在文档检索中的策略性推理与随机搜索差异,揭示最佳智能体在准确性上接近人类,但依赖暴力搜索而非有效策略规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19952 2026-03-23 eess.SY cs.SY 67%

On the Capacity of Future Lane-Free Urban Infrastructure

未来无车道城市基础设施的容量

Patrick Malcolm, Klaus Bogenberger

专题命中 工具调用 :agent(abstract);multi-agent(abstract)

AI总结 本文通过分析与仿真方法探讨了未来无车道城市交通的潜在容量和空间效率,提出OptWULF方法实现了无车道交叉口的高效管理,验证了容量与街道宽度的连续关系及对称需求模式的适应性。

Comments 9 pages, 8 figures, submitted to IEEE Transactions on Intelligent Transportation Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19241 2026-03-23 cs.CE cs.SC physics.app-ph physics.comp-ph 50%

Engineering-Oriented Symbolic Regression: LLMs as Physics Agents for Discovery of Simulation-Ready Constitutive Laws

面向工程的符号回归:LLMs作为物理代理用于发现可模拟的本构定律

Yue Wu, Tianhao Su, Mingchuan Zhao, Shunbo Hu, Deng Pan

专题命中 工具调用 :agent(abstract)

AI总结 本文提出一种面向工程的符号回归框架,利用LLMs作为物理代理,解决传统工程拟合和数据驱动方法之间的矛盾,通过自动合成物理约束发现稳定的本构定律。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 58 篇

2603.19838 2026-03-23 cs.RO 91%

Multi-Agent Motion Planning on Industrial Magnetic Levitation Platforms: A Hybrid ADMM-HOCBF approach

多智能体在工业磁悬浮平台上的运动规划:一种混合ADMM-HOCBF方法

Bavo Tistaert, Stan Servaes, Alejandro Gonzalez-Garcia, Ibrahim Ibrahim, Louis Callens, Jan Swevers, Wilm Decré

机构 * MECO Research Team, Dept. of Mechanical Engineering, KU Leuven and Flanders Make(MECO研究团队,机械工程系,KU莱顿和弗拉芒制造)

专题命中 规划决策 :agent(title,abstract);planning(title,abstract);multi-agent(title,abstract)

AI总结 本文提出了一种新颖的混合运动规划方法,用于具有holonomic特性的多智能体系统。通过结合去中心化的交替方向乘子法(ADMM)与集中式的高阶控制屏障函数(HOCBF)架构,解决了传统集中式MPC在智能体数量增加时的可计算性问题,并提供安全性保障。

Comments 8 pages, 4 figures, accepted to the European Control Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19858 2026-03-23 cs.RO cs.MA 89%

Beyond detection: cooperative multi-agent reasoning for rapid onboard EO crisis response

超越检测:用于快速在轨遥感危机响应的协作多智能体推理

Alejandro D. Mousist, Pedro Delgado de Robles Martín, Raquel Lladró Climent, Julian Cobos Aparicio

专题命中 规划决策 :agent(title,abstract);multi-agent(title,abstract);AI agent(abstract)

AI总结 本文提出了一种分层多智能体架构,用于在轨遥感处理,在资源和带宽受限条件下,通过协调专用AI智能体实现互补多模态观测的利用,减少计算开销并保持决策一致性。

Comments Accepted for presentation at the ESA's 4S Symposium 2026 Conference (see https://atpi.eventsair.com/4s-symposium-2026/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07451 2026-03-23 cs.CL 89%

DLLM Agent: See Farther, Run Faster

DLLM Agent: 看得更远,跑得更快

Huiling Zhen, Weizhe Lin, Renxi Liu, Kai Han, Yiming Li, Yuchuan Tian, Hanting Chen, Xiaoguang Li, Xiaosong Li, Chen Chen, Xianzhi Yu, Mingxuan Yuan, Youliang Yan, Peifeng Qin, Jun Wang, Yu Wang, Dacheng Tao, Yunhe Wang

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) UCL(伦敦大学学院) Tsinghua University(清华大学) NTU(国立新加坡大学) Peking University(北京大学)

专题命中 规划决策 :agent(title,abstract);tool-use(abstract);planning(abstract);workflow(abstract)

AI总结 本文研究了扩散大语言模型(DLLM)在代理多步决策中的表现,发现其在准确率相当的情况下,整体效率比自回归模型(AR)高30%以上,并提出部署扩散骨架的两个实用考虑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20132 2026-03-23 cs.LG 85%

Revisiting Gene Ontology Knowledge Discovery with Hierarchical Feature Selection and Virtual Study Group of AI Agents

重新审视基因本体知识发现:基于层次特征选择和人工智能代理虚拟学习小组

Cen Wan, Alex A. Freitas

专题命中 规划决策 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.LG

AI总结 本文提出基于人工智能代理的虚拟学习小组,通过层次特征选择提取与衰老相关的生物知识,验证了其在不同模式生物中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00171 2026-03-23 cs.CV 85%

CompAgent: An Agentic Framework for Visual Compliance Verification

CompAgent:一种用于视觉合规验证的代理框架

Rahul Ghosh, Baishali Chaudhury, Hari Prasanna Das, Meghana Ashok, Ryan Razkenari, Long Chen, Sungmin Hong, Chun-Hao Liu

机构 * Generative AI Innovation Center(生成式人工智能创新中心) Amazon Web Services(亚马逊网络服务)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);planning(abstract)

AI总结 本文提出CompAgent,一种基于代理的视觉合规验证框架,通过集成视觉工具和规划代理,提升多模态推理能力,在公开基准测试中取得76%的F1分数,优于现有方法。

Comments Accepted to IEEE CVPR 2026 GRAIL-V Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20185 2026-03-23 cs.CV cs.AI cs.CL 84%

VideoSeek: Long-Horizon Video Agent with Tool-Guided Seeking

VideoSeek: 长时程视频代理与工具引导的搜索

Jingyang Lin, Jialian Wu, Jiang Liu, Ximeng Sun, Ze Wang, Xiaodong Yu, Jiebo Luo, Zicheng Liu, Emad Barsoum

机构 * AMD(AMD公司) University of Rochester(罗切斯特大学)

专题命中 规划决策 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 VideoSeek通过视频逻辑流程主动寻找关键证据,减少帧数使用,提升视频理解能力,实验显示其在视频理解和推理任务中表现优异。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19639 2026-03-23 cs.AI 83%

HyEvo: Self-Evolving Hybrid Agentic Workflows for Efficient Reasoning

HyEvo:自演化混合代理工作流用于高效推理

Beibei Xu, Yutong Ye, Chuyun Shen, Yingbo Zhou, Cheng Chen, Mingsong Chen

机构 * East China Normal University(华东师范大学) Beihang University(北京航空航天大学) Shanghai University of International Business and Economics(上海对外经贸大学) Fudan University(复旦大学)

专题命中 规划决策 :agentic(title,abstract);workflow(abstract);分类 cs.AI

AI总结 HyEvo通过混合原子合成方法,结合概率LLM节点和确定性代码节点,提升推理效率,减少计算成本和延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18377 2026-03-23 cs.CR cs.AI cs.ET 83%

PlanTwin: Privacy-Preserving Planning Abstractions for Cloud-Assisted LLM Agents

PlanTwin: 云辅助规划中的隐私保护规划抽象

Guangsheng Yu, Qin Wang, Rui Lang, Shuai Su, Xu Wang

机构 * University of Technology Sydney(悉尼技术大学) CSIRO Data61(CSIRO数据61)

专题命中 规划决策 :planning(title,abstract);agentic(abstract);分类 cs.AI

AI总结 PlanTwin通过构建规划导向的数字孪生,实现云辅助规划中本地环境信息的隐私保护,同时保持规划质量接近全上下文系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17021 2026-03-23 cs.AI 83%

Generative AI-assisted Participatory Modeling in Socio-Environmental Planning under Deep Uncertainty

生成AI辅助的参与建模在深不确定性下的社会环境规划

Zhihao Pei, Nir Lipovetzky, Angela M. Rojas-Arevalo, Fjalar J. de Haan, Enayat A. Moallemi

机构 * School of Computing(计算学院) Information Systems, Faculty of Engineering(信息学院,工程学院) Information Technology, The University of Melbourne, Parkville VIC 3010, Australia(信息科技,墨尔本大学,帕克维尔 VIC 3010, 澳大利亚) Industrial Research Organization (CSIRO), Research Way, Clayton VIC 3168, Australia(工业研究组织(CSIRO),Research Way,克莱顿 VIC 3168, 澳大利亚) Department of Psychiatry, The University of Melbourne, Parkville VIC 3010, Australia(精神病学系,墨尔本大学,帕克维尔 VIC 3010, 澳大利亚)

专题命中 规划决策 :planning(title,abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型简化社会环境规划中深不确定性下的问题概念化过程,通过模板化工作流实现参与建模,提升建模效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19248 2026-03-23 cs.CL cs.AI 82%

DuCCAE: A Hybrid Engine for Immersive Conversation via Collaboration, Augmentation, and Evolution

DuCCAE:通过协作、增强和进化实现沉浸式对话的混合引擎

Xin Shen, Zhishu Jiang, Jiaye Yang, Haibo Liu, Yichen Wan, Jiarui Zhang, Tingzhi Dai, Luodong Xu, Shuchen Wu, Guanqiang QI, Chenxi Miao, Jiahui Liang, Yang Li, Weikang Li, Deguo Xia, Jizhou Huang

机构 * Baidu Inc(百度公司)

专题命中 规划决策 :agent(abstract);planning(abstract);agentic(abstract);multi-agent(abstract)

AI总结 DuCCAE通过解耦实时响应与异步代理执行,提升沉浸式对话的响应速度与任务能力,减少延迟并增强用户留存与复杂任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13876 2026-03-23 cs.AI cs.CL 81%

Improved Generalized Planning with LLMs through Strategy Refinement and Reflection

通过策略细化与反思改进基于LLM的通用规划

Katharina Stein, Nils Hodel, Daniel Fišer, Jörg Hoffmann, Michael Katz, Alexander Koller

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出通过生成伪代码并自动调试,结合反思步骤提升LLM生成的通用规划质量,实验显示改进后配置在17个基准领域达到82%的平均覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19931 2026-03-23 cs.CL 79%

SAGE: Sustainable Agent-Guided Expert-tuning for Culturally Attuned Translation in Low-Resource Southeast Asia

SAGE:面向文化适应翻译的可持续代理引导专家调优

Zhixiang Lu, Chong Zhang, Yulong Li, Angelos Stefanidis, Anh Nguyen, Imran Razzak, Jionglong Su, Zhengyong Jiang

机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) University of Liverpool(利物浦大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.CL

AI总结 SAGE通过能量感知方法优化低资源东南亚地区翻译任务,利用强化学习代理筛选高质量数据,显著降低能耗和数据使用量,提升模型性能与环保性。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19782 2026-03-23 cs.AI 79%

Embodied Science: Closing the Discovery Loop with Agentic Embodied AI

具身科学:通过代理具身AI闭合发现循环

Xiang Zhuang, Chenyi Zhou, Kehua Feng, Zhihui Zhu, Yunfan Gao, Yijie Zhong, Yichi Zhang, Junjie Huang, Keyan Ding, Lei Bai, Haofen Wang, Qiang Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tongji University(同济大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出具身科学框架,将科学发现视为闭环过程,结合代理推理与物理执行,通过感知-语言-行动-发现框架实现自主发现系统。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19649 2026-03-23 cs.SI cs.AI 79%

PolicySim: An LLM-Based Agent Social Simulation Sandbox for Proactive Policy Optimization

PolicySim:一种基于LLM的代理社会模拟沙盒,用于主动政策优化

Renhong Huang, Ning Tang, Jiarong Xu, Yuxuan Cao, Qingqian Tu, Sheng Guo, Bo Zheng, Huiyuan Liu, Yang Yang

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) University of Nottingham(诺丁汉大学) PowerChina Huadong Engineering Corporation Limited(国家电网华东工程公司)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 本文提出PolicySim,通过用户代理模块和自适应干预模块,模拟用户行为与平台干预的双向动态,实现对干预政策的主动评估与优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21375 2026-03-23 cs.RO cs.AI cs.SY eess.SY 79%

Safe Path Planning and Observation Quality Enhancement Strategy for Unmanned Aerial Vehicles in Water Quality Monitoring Tasks

无人机在水质监测任务中的安全路径规划与观测质量提升策略

Yuanshuang Fu, Qianyao Wang, Qihao Wang, Bonan Zhang, Jiaxin Zhao, Yiming Cao, Zhijun Li

机构 * University of Electronic Science and Technology of China(电子科技大学) North China University of Technology(华北理工大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出一种动态光照阴影干扰避障路径规划方法,通过动态预测模型和改进的IFDS算法,结合MPC框架和DFAA机制,提升无人机在复杂光照环境下的观测质量和飞行安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16931 2026-03-23 cs.AI cs.RO 79%

Multimodal Fused Learning for Solving the Generalized Traveling Salesman Problem in Robotic Task Planning

多模态融合学习用于解决机器人任务规划中的广义旅行商问题

Jiaqi Cheng, Mingfeng Fan, Xuefeng Zhang, Jingsong Liang, Yuhong Cao, Guohua Wu, Guillaume Adrien Sartoretti

机构 * Central South University(中南大学) National University of Singapore(新加坡国立大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出多模态融合学习框架,通过图和图像表示捕捉问题互补方面,生成高质量实时任务规划方案,实验表明其在各类GTSP实例中性能优于现有方法。

Comments 14 pages, 6 figures, Proceedings of the Conference on Robot Learning (CoRL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19515 2026-03-23 cs.AI 79%

ItinBench: Benchmarking Planning Across Multiple Cognitive Dimensions with Large Language Models

ItinBench:利用大语言模型在多个认知维度上进行规划的基准测试

Tianlong Wang, Pinqiao Wang, Weili Shi, Sheng li

机构 * University of Virginia(弗吉尼亚大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出ItinBench,通过整合空间推理和传统语言推理任务,评估大语言模型在多认知维度上的规划能力,发现模型在同时处理多个维度时性能不稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19429 2026-03-23 cs.AI cs.LO cs.SC 79%

When both Grounding and not Grounding are Bad -- A Partially Grounded Encoding of Planning into SAT (Extended Version)

当同时 grounding 和不 grounding 都不好 -- 一种部分 grounding 的规划到 SAT 编码(扩展版)

João Filipe, Gregor Behnke

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出一种部分 grounding 的 SAT 编码,在保持动作 lifted 的同时部分 grounding 预言,实现线性规模的规划效率,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19257 2026-03-23 cs.CL 79%

Constraint-aware Path Planning from Natural Language Instructions Using Large Language Models

基于自然语言指令的约束感知路径规划:利用大语言模型

Dylan Shim, Minghan Wei

专题命中 规划决策 :planning(title,abstract);分类 cs.CL

AI总结 本文提出利用大语言模型解决带约束的路径规划问题,通过自然语言输入进行问题匹配和自推断,实现灵活且可扩展的解决方案。

Comments Accepted by 2026 SPIE Security + Defense Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19306 2026-03-23 cs.IR cs.AI cs.LG 79%

VERDICT: Verifiable Evolving Reasoning with Directive-Informed Collegial Teams for Legal Judgment Prediction

VERDICT: 可验证的演进推理与指令驱动的协作团队用于法律判断预测

Hui Liao, Chuan Qin, Yongwen Ren, Hao Li, Zhenya Huang, Yanyong Zhang, Chao Wang

机构 * University of Science and Technology of China(中国科学技术大学) Chinese Academy of Sciences(中国科学院) iFLYTEK AI Research(iFLYTEK人工智能研究院)

专题命中 规划决策 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 VERDICT通过模拟虚拟合议庭,提出自反思协作多智能体框架,结合混合法理记忆实现法律推理的可验证性和适应性,提升法律预测的准确性和解释性。

Comments 15 pages,3 figures,4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19881 2026-03-23 q-bio.NC 78%

Problem difficulty and waiting time shape the level of detail and temporal organization of visual strategies in human planning

问题难度和等待时间影响人类规划中视觉策略的细节和时间组织水平

Mattia Eluchans, Giovanni Pezzulo

专题命中 规划决策 :planning(title,abstract)

AI总结 研究探讨了问题难度和等待时间如何影响人类规划中视觉策略的细节和时间组织,发现难度增加视觉覆盖,时间影响执行中的重计划程度和目光路径一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19602 2026-03-23 cs.RO 78%

CeRLP: A Cross-embodiment Robot Local Planning Framework for Visual Navigation

CeRLP:一种面向视觉导航的跨体素机器人局部规划框架

Haoyu Xi, Mingao Tan, Xinming Zhang, Siwei Cheng, Shanze Wang, Yin Gu, Xiaoyu Shen, Wei Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University, Shanghai, P. R. China(上海交通大学计算机科学学院,上海,中华人民共和国) College of Information Science and Technology, Eastern Institute of Technology, Ningbo, P. R. China(信息科学与技术学院,东部技术研究所,宁波,中华人民共和国)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出CeRLP框架,通过统一几何表征和异构机器人适应,解决跨体素机器人视觉导航中的尺度模糊和异构问题,实验证明其在障碍物避障和导航任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19556 2026-03-23 cs.MA 78%

Planning Autonomous Vehicle Maneuvering in Work Zones Through Game-Theoretic Trajectory Generation

通过博弈论轨迹生成实现自动驾驶车辆在作业区的 maneuvering 规划

Mayar Nour, Atrisha Sarkar, Mohamed H. Zaki

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出博弈论框架用于生成自动驾驶车辆在作业区的轨迹,通过建模变道为车辆间的非合作博弈,平衡安全、进度和交通稳定性,减少冲突频率35%。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19502 2026-03-23 cs.CG cs.RO 78%

Unlabeled Multi-Robot Motion Planning with Improved Separation Trade-offs

未标记多机器人运动规划中的改进分离折中

Tsuri Farhana, Omrit Filtser, Shalev Goldshtein

机构 * Department of Computer Science, Ben Gurion University(本· Gurion大学计算机科学系) Department of Mathematics and Computer Science, The Open University of Israel(以色列开放大学数学与计算机科学系)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出了一种改进的多机器人运动规划算法,通过调整机器人与障碍物的分离距离,实现了更高效的路径规划,解决了密集环境下的分离折中问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10525 2026-03-23 cs.CL cs.AI cs.LG 75%

LHAW: Controllable Underspecification for Long-Horizon Tasks

LHAW:长周期任务的可控性不足

George Pu, Michael S. Lee, Udari Madhushani Sehwag, David J. Lee, Bryan Zhu, Yash Maurya, Mohit Raghavendra, Yuan Xue, Samuel Marc Denton

专题命中 规划决策 :agent(abstract);workflow(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出LHAW框架,通过系统性地移除目标、约束、输入和上下文信息,生成可控的不明确任务变体,用于评估自主系统在长周期任务中的澄清行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19685 2026-03-23 cs.AI cs.LG cs.MA 73%

A Subgoal-driven Framework for Improving Long-Horizon LLM Agents

一种用于提升长周期LLM代理的子目标驱动框架

Taiyi Wang, Sian Gooding, Florian Hartmann, Oriana Riva, Edward Grefenstette

机构 * Google DeepMind(谷歌DeepMind)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出子目标分解规划框架和MiRA强化学习框架,通过实时规划和密集奖励信号提升LLM在长周期任务中的表现,成功率达到43.0%。

Comments 50 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏