arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 5014 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5014 篇

2604.03675 2026-05-26 cs.AI cs.CL cs.IR 81%

OASES: Outcome-Aligned Search-Evaluation Co-Training for Agentic Search

OASES:面向智能搜索的结果对齐搜索-评估协同训练

Erhan Zhang, Yiqun Chen, Zechun Niu, Wei Yang, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Jiaxin Mao

机构 * Renmin University of China(中国人民大学) Xiaohongshu Inc.(小红书公司) University of Southern California(南加州大学)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 提出OASES框架,通过结果对齐的过程奖励和搜索-评估协同训练,解决智能搜索中奖励稀疏和过程监督不可靠的问题,在多跳问答基准上优于强强化学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14345 2026-05-12 cs.LG cs.AI stat.ML 81%

PAC-MCTS: Bias-Aware Pruning for Robust LLM-Guided Search and Planning

PAC-MCTS:具有偏见意识的剪枝用于稳健的LLM引导搜索与规划

Tianhao Qian

机构 * School of Mathematics, Southeast University(东南大学数学学院)

专题命中 工具调用 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出PAC-MCTS框架,通过动态调整置信区间来应对LLM引导下的偏见问题,实验表明其在Blocksworld和ALFWorld任务中显著提升了鲁棒性和搜索效率。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06721 2026-05-08 cs.AI cs.CL cs.HC 81%

ProAgent: Harnessing On-Demand Sensory Contexts for Proactive LLM Agent Systems in the Wild

ProAgent:利用按需感官上下文实现野外的前瞻性LLM代理系统

Bufang Yang, Lilin Xu, Liekang Zeng, Yunqi Guo, Siyang Jiang, Wenrui Lu, Kaiwei Liu, Yixuan Li, Xiaofan Jiang, Guoliang Xing, Zhenyu Yan

机构 * The Chinese University of Hong Kong(香港中文大学) Columbia University(哥伦比亚大学)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 ProAgent通过整合低成本上下文线索与按需丰富感知,实现连续感知用户环境,利用上下文感知的前瞻性推理器推断用户需求,提升预测准确性与降低误检率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16323 2026-05-05 cs.SE cs.AI 81%

Beyond the 'Diff': Addressing Agentic Entropy in Agentic Software Development

超越'差异':应对代理软件开发中的代理熵

Matteo Casserini, Alessandro Facchini, Andrea Ferrario

机构 * Dipartimento Tecnologie Innovative, SUPSI(技术创新部,SUPSI) Dalle Molle Institute for Artificial Intelligence (IDSIA), SUPSI(达勒莫利人工智能研究所(IDSIA),SUPSI) Management in Networked and Digital Societies (MINDS) Department, Kozminski University(网络化与数字化社会管理(MINDS)系,科津斯基大学) Institute of Biomedical Ethics and History of Medicine, University of Zurich(生物医学伦理与医学史研究所,苏黎世大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出一种过程导向的可解释框架,通过时间、工具调用和架构边界揭示代理决策过程,解决代理行为与架构意图的偏离问题,为代理监控提供意图层面的 telemetry。

Comments Camera-ready version of the position paper accepted to the Human-Centered Explainable AI (HCXAI) Workshop at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24026 2026-05-01 cs.CL cs.AI 81%

From Skill Text to Skill Structure: The Scheduling-Structural-Logical Representation for Agent Skills

从技能文本到技能结构:面向智能体技能的调度-结构-逻辑表示

Qiliang Liang, Hansi Wang, Zhong Liang, Yang Liu

机构 * Key Laboratory of Computational Linguistics, Ministry of Education, Peking University(计算语言学重点实验室,教育部,北京大学) School of Computer Science, Peking University(北京大学计算机学院) Department of Chinese Language and Literature, Peking University(北京大学中文语言文学系)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出调度-结构-逻辑(SSL)表示法,通过解耦技能调度信号、执行结构和逻辑证据,提升智能体技能的可搜索性和可审查性,实验表明其在技能发现和风险评估任务中优于纯文本基线。

Comments 21 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21236 2026-04-27 cs.CR cs.AI cs.SE 81%

AgentBound: Securing Execution Boundaries of AI Agents

AgentBound: 保障AI代理的执行边界安全

Christoph Bühler, Matteo Biagiola, Luca Di Grazia, Guido Salvaneschi

机构 * University of St. Gallen(圣加尔大学) Università della Svizzera italiana(瑞士联邦理工学院)

专题命中 工具调用 :AI agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出AgentBound,首个MCP服务器访问控制框架,通过声明性策略机制和执行引擎自动从源代码生成访问控制策略,有效阻止安全威胁且无显著开销。

Journal ref Proceedings of the 34th ACM Joint European Software Engineering Conference and Symposium on the Foundations of Software Engineering (FSE). 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15625 2026-04-21 cs.LG cs.AI 81%

Robust Tool Use via Fission-GRPO: Learning to Recover from Execution Errors

通过Fission-GRPO实现鲁棒的工具使用:学习从执行错误中恢复

Zhiwei Zhang, Fei Zhao, Rui Wang, Zezhong Wang, Bin Liang, Jiakang Wang, Yao Hu, Shaosheng Cao, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) Xiaohongshu Inc.(小红书公司) MoE Key Laboratory of High Confidence Software Technologies(可信软件技术国家重点实验室)

专题命中 工具调用 :tool use(title);tool-use(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Fission-GRPO框架,通过将执行错误转化为在线纠正监督,提升模型在多轮执行中的错误恢复能力,实验显示其在BFCL v4 Multi-Turn上提升了Qwen3-8B的错误恢复率和整体准确率。

Comments 9 pages, 4 figures, 4 tables. Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00739 2026-04-20 cs.AI cs.LG cs.MA 81%

Towards Understanding, Analyzing, and Optimizing Agentic AI Execution: A CPU-Centric Perspective

向理解、分析和优化代理AI执行:一种以CPU为中心的视角

Ritik Raj, Souvik Kundu, Ishita Vohra, Hong Wang, Tushar Krishna

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 本文从CPU角度分析代理AI工作负载的瓶颈,提出两种优化方法,降低CPU-GPU资源分配偏差,提升执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26435 2026-04-13 cs.CL cs.AI 81%

Adaptive Planning for Multi-Attribute Controllable Summarization with Monte Carlo Tree Search

多属性可控摘要的自适应规划

Sangwon Ryu, Heejin Do, Yunsu Kim, Gary Geunbae Lee, Jungseul Ok

机构 * GSAI, POSTECH(浦项科技大学人工智能研究院) CSE, POSTECH(浦项科技大学计算机科学与工程学院) ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心) LILT(LILT公司)

专题命中 工具调用 :planning(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出PACO框架,通过定制化的MCTS实现多属性可控摘要的自适应规划,有效满足相关约束,实验表明其在不同领域和模型上表现优异,甚至超越大模型基线。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16383 2026-04-07 cs.AI cs.SE 81%

An Agent-Based Framework for the Automatic Validation of Mathematical Optimization Models

一个基于代理的数学优化模型自动验证框架

Alexander Zadorojniy, Segev Wasserkrug, Eitan Farchi

机构 * IBM Research(IBM研究院)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出基于代理的自动验证方法,通过生成测试API、测试用例和突变体,提升优化模型的验证质量,尤其在突变覆盖方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02050 2026-03-25 cs.AI cs.SE 81%

Rethinking the Role of Entropy in Optimizing Tool-Use Behaviors for Large Language Model Agents

重新思考熵在优化大语言模型代理工具使用行为中的作用

Zeping Li, Hongru Wang, Yiwen Zhao, Guanhua Chen, Yixia Li, Keyang Chen, Yixin Cao, Guangnan Ye, Hongfeng Chai, Zhenfei Yin

机构 * Fudan University(复旦大学) University of Edinburgh(爱丁堡大学) Southern University of Science and Technology(南方科技大学) Oxford University(牛津大学) Haven

专题命中 工具调用 :tool-use(title,abstract);分类 cs.AI、cs.SE

AI总结 本文通过熵基实验发现熵减与高质量工具调用正相关,提出两种奖励策略优化工具使用行为,实验表明熵减可提升代理适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18010 2026-03-20 cs.CL cs.AI cs.CY 81%

Agentic Framework for Political Biography Extraction

政治传记提取的代理框架

Yifei Zhu, Songpo Yang, Jiangnan Zhu, Junyan Jiang

机构 * Department of Politics and Public Administration, The University of Hong Kong(政治与公共行政系,香港大学) School of International Studies, Peking University(国际关系学院,北京大学) Department of Political Science, Columbia University(政治学系,哥伦比亚大学)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出一种两阶段的合成-编码框架,利用大语言模型自动化提取多维精英传记,提升政治科学研究的效率和准确性。

Comments 70 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11327 2026-03-19 cs.LG cs.CL 81%

Meta-Reinforcement Learning with Self-Reflection for Agentic Search

具有自我反思的元强化学习用于代理搜索

Teng Xiao, Yige Yuan, Hamish Ivison, Huaisheng Zhu, Faeze Brahman, Nathan Lambert, Pradeep Dasigi, Noah A. Smith, Hannaneh Hajishirzi

机构 * Allen Institute for AI(Allen人工智能研究所) University of Washington(华盛顿大学) Independent(独立)

专题命中 工具调用 :agentic(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出MR-Search,一种基于上下文的元强化学习框架,通过自我反思优化搜索策略,提升测试时探索效率,实验显示其在多个基准上表现优异。

Comments 23 pages, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15021 2026-03-17 cs.SE cs.AI 81%

Describing Agentic AI Systems with C4: Lessons from Industry Projects

用C4描述代理AI系统:来自行业项目的启示

Andreas Rausch, Stefan Wittek

机构 * Institute for Software and Systems Engineering(软件与系统工程研究所) Clausthal University of Technology(克莱斯特哈大学)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.SE

AI总结 本文基于行业项目经验,提出针对代理AI系统风格的文档系统,通过风格导向的建模词汇和分层描述技术,实现透明且可持续的架构文档。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10069 2026-03-12 cs.LG cs.CL 81%

Improving Search Agent with One Line of Code

通过一行代码改进搜索代理

Jian Li, Dongsheng Chen, Zhenhua Xu, Yizhang Jin, Jiafu Wu, Chengjie Wang, Xiaotong Yuan, Yabiao Wang

机构 * Nanjing University(南京大学) Tencent YoutuLab(腾讯优图实验室)

专题命中 工具调用 :agent(title);agentic(abstract);分类 cs.CL、cs.LG

AI总结 通过一行代码改进搜索代理,提出SAPO算法以稳定训练并提升性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08933 2026-03-11 cs.AI cs.IR cs.LG 81%

Interpretable Markov-Based Spatiotemporal Risk Surfaces for Missing-Child Search Planning with Reinforcement Learning and LLM-Based Quality Assurance

可解释的基于马尔可夫的时空风险表面用于缺失儿童搜索规划的强化学习与基于LLM的质量保证

Joshua Castillo, Ravi Mukkamala

机构 * Old Dominion University(老奥尔巴尼大学)

专题命中 工具调用 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 Guardian系统利用马尔可夫链、强化学习和LLM进行可解释的时空风险建模,以提升失踪儿童搜索规划的效率和准确性。

Comments 14 pages, 7 figures. Accepted at ICEIS 2026 (International Conference on Enterprise Information Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19255 2026-03-06 cs.LG cs.AI 81%

VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use

VTool-R1: 通过在多模态工具使用上的强化学习使VLMs学会通过图像思考

Mingyuan Wu, Jingcheng Yang, Jize Jiang, Meitang Li, Kaizhuo Yan, Hanchao Yu, Minjia Zhang, Chengxiang Zhai, Klara Nahrstedt

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan Ann Arbor(密歇根大学安娜堡分校) Independent Researcher(独立研究者)

专题命中 工具调用 :tool use(title,abstract);分类 cs.AI、cs.LG

AI总结 VTool-R1通过强化学习训练视觉语言模型生成多模态思考链,提升其通过图像进行推理的能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01464 2026-03-03 cs.AI cs.CL 81%

ProtRLSearch: A Multi-Round Multimodal Protein Search Agent with Large Language Models Trained via Reinforcement Learning

ProtRLSearch: 一种基于大语言模型的多轮多模态蛋白质搜索代理,通过强化学习进行训练

Congying Liu, Taihao Li, Ming Huang, Xingyuan Wei, Peipei Liu, Yiqing Shen, Yanxu Mao, Tiehan Cui

机构 * University of Chinese Academy of Sciences(中国科学院大学) Hangzhou Institute for Advanced Study(杭州高等研究院) Shenzhen Institutes of Advanced Technology(深圳先进技术研究所) Institute of Information Engineering(信息工程研究所) Johns Hopkins University(约翰霍普金斯大学) Henan University(河南大学)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 ProtRLSearch通过强化学习训练,利用多模态输入提升蛋白质搜索的准确性和效率,解决传统方法在多模态整合和搜索过程约束上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22576 2026-02-27 cs.CL cs.IR cs.LG 81%

Search-P1: Path-Centric Reward Shaping for Stable and Efficient Agentic RAG Training

Search-P1: 基于路径的奖励塑造用于稳定且高效的代理RAG训练

Tianle Xia, Ming Xu, Lingxiang Hu, Yiding Sun, Wenwei Li, Linfang Shang, Liqun Liu, Peng Shu, Huan Yu, Jie Jiang

机构 * Tencent(腾讯)

专题命中 工具调用 :agentic(title,abstract);分类 cs.CL、cs.LG

AI总结 Search-P1通过路径中心奖励塑造提升代理RAG训练的稳定性和效率,实现7.7个百分点的准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24694 2026-02-25 cs.CL cs.AI 81%

Repurposing Synthetic Data for Fine-grained Search Agent Supervision

将合成数据重新利用于细粒度搜索代理的监督

Yida Zhao, Kuan Li, Xixi Wu, Liwen Zhang, Dingchu Zhang, Baixuan Li, Maojia Song, Zhuo Chen, Chenxi Wang, Xinyu Wang, Kewei Tu, Pengjun Xie, Jingren Zhou, Yong Jiang

机构 * School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院) Shanghai Engineering Research Center of Intelligent Vision and Imaging(智能视觉与成像上海工程研究中心) Tongyi Lab, Alibaba Group(阿里集团通义实验室)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出E-GRPO框架,通过利用训练中被丢弃的实体信息,提升搜索代理的细粒度学习和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14295 2026-02-17 cs.LG cs.AI 81%

Machine Learning as a Tool (MLAT): A Framework for Integrating Statistical ML Models as Callable Tools within LLM Agent Workflows

机器学习作为工具(MLAT):一种将统计机器学习模型作为可调用工具集成到LLM代理工作流中的框架

Edwin Chen, Zulekha Bibi

机构 * Legacy AI LLC

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 MLAT框架通过将统计机器学习模型作为可调用工具集成到LLM代理工作流中,实现快速生成专业提案的自动化流程。

Comments Submitted to the Google Gemini 3 Hackathon

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07983 2026-02-10 cs.AI cs.CL 81%

Accelerating Social Science Research via Agentic Hypothesization and Experimentation

通过代理假设和实验加速社会科学研究

Jishu Sen Gupta, Harini SI, Somesh Kumar Singh, Syed Mohamad Tawseeq, Yaman Kumar Singla, David Doermann, Rajiv Ratn Shah, Balaji Krishnamurthy

机构 * Adobe Media and Data Science Research (MDSR)(Adobe媒体与数据科学研究所)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 EXPERIGEN通过代理框架实现端到端的科学发现,发现更多显著且预测性强的假设,并通过A/B测试验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04248 2026-02-05 cs.AI cs.CL 81%

Empirical-MCTS: Continuous Agent Evolution via Dual-Experience Monte Carlo Tree Search

经验-MCTS:通过双经验蒙特卡洛树搜索实现连续智能体进化

Hao Lu, Haoyuan Huang, Yulin Zhou, Chen Li, Ningxin Zhu

机构 * JianChengXingYun Technology Co., Ltd.(健成星云科技有限公司)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 经验-MCTS通过双环框架实现连续智能体进化,结合局部探索与全局记忆优化,提升复杂推理任务性能。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20412 2026-01-29 cs.CL cs.SE 81%

Beyond Accuracy: A Cognitive Load Framework for Mapping the Capability Boundaries of Tool-use Agents

超越准确率:一种认知负荷框架用于映射工具使用代理的能力边界

Qihao Wang, Yue Hu, Mingzhe Lu, Jiayue Wu, Yanbing Liu, Yuanmin Tang

专题命中 工具调用 :tool-use(title);agent(abstract);分类 cs.CL、cs.SE

AI总结 本文提出一种认知负荷框架,用于评估工具使用代理的能力边界,通过分解任务复杂性为内在负荷和额外负荷,揭示模型的真实能力限制。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01576 2026-01-21 cs.IR cs.AI cs.CL 81%

OpenNovelty: An LLM-powered Agentic System for Verifiable Scholarly Novelty Assessment

OpenNovelty: 一种基于大语言模型的代理系统,用于可验证的学术新颖性评估

Ming Zhang, Kexin Tan, Yueyuan Huang, Yujiong Shen, Chunchun Ma, Li Ju, Xinran Zhang, Yuhui Wang, Wenqing Jing, Jingyi Deng, Huayu Sha, Binze Hu, Jingqi Tong, Changhao Jiang, Yage Geng, Yuankai Ying, Yue Zhang, Zhangyue Yin, Zhiheng Xi, Shihan Dou, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Claremont McKenna College(克莱蒙特麦肯纳学院)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 OpenNovelty通过基于大语言模型的代理系统,提供可验证的学术新颖性评估,提升同行评审的公平性和证据支持性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06534 2026-01-19 cs.AI cs.LG 81%

Beneficial Reasoning Behaviors in Agentic Search and Effective Post-training to Obtain Them

代理搜索中的有益推理行为及有效训练以获得这些行为

Jiahe Jin, Abhijay Paladugu, Chenyan Xiong

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出行为引导方法,通过预训练使代理搜索模型具备信息验证、权威评估等有益推理行为,从而在强化学习前提升任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07296 2026-01-13 cs.AI cs.CL 81%

LRAS: Advanced Legal Reasoning with Agentic Search

LRAS: 基于代理搜索的先进法律推理

Yujin Zhou, Chuxue Cao, Jinluan Yang, Lijun Wu, Conghui He, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 LRAS通过整合反思模仿学习和难度感知强化学习,使大推理模型能够识别知识边界并处理法律推理的复杂性,从而在法律领域取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06937 2026-01-13 cs.AI cs.LG 81%

mind_call: A Dataset for Mental Health Function Calling with Large Language Models

mind_call: 一个用于大语言模型心理健康新功能调用的数据集

Fozle Rabbi Shafi, M. Anwar Hossain, Salimur Choudhury

机构 * School of Computing, Queen’s University Kingston(计算学院,女王大学金斯顿)

专题命中 工具调用 :function calling(title,abstract);分类 cs.AI、cs.LG

AI总结 mind_call数据集通过合成功能调用任务,为大语言模型在心理健康领域的应用提供支持,涵盖多种自然语言查询与标准化API调用的映射,促进意图识别和可靠功能调用的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05256 2026-01-12 cs.AI cs.CL cs.CV cs.IR 81%

Naiad: Novel Agentic Intelligent Autonomous System for Inland Water Monitoring

Naiad:一种新型智能自主系统用于内陆水体监测

Eirini Baltzi, Tilemachos Moumouris, Athena Psalta, Vasileios Tsironis, Konstantinos Karantzalos

机构 * National Technical University of Athens(希腊国家技术大学)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 Naiad是一种基于大语言模型和外部工具的智能系统,用于通过地球观测数据实现内陆水体的全面监测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04767 2026-01-09 cs.AI cs.CL 81%

AT$^2$PO: Agentic Turn-based Policy Optimization via Tree Search

AT$^2$PO: 通过树搜索实现基于回合的代理策略优化

Zefang Zong, Dingwei Chen, Yang Li, Qi Yi, Bo Zhou, Chengming Li, Bo Qian, Peng Chen, Jie Jiang

机构 * Tencent Inc(腾讯公司) Sun Yat-Sen University(中山大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 AT$^2$PO 通过树搜索实现多轮代理强化学习,解决探索多样性、奖励分配和策略优化不一致问题,提升性能达1.84个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏