arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 5014 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5014 篇

2509.04979 2025-09-08 cs.AI 81%

Internet 3.0: Architecture for a Web-of-Agents with it's Algorithm for Ranking Agents

Rajesh Tembarai Krishnamachari, Srividya Rajesh

机构 * NYU(纽约大学) Independent Researcher(独立研究者)

专题命中 工具调用 :agent(abstract);AI agent(abstract);autonomous agent(abstract);agentic(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18260 2025-06-24 cs.AI 81%

Advanced For-Loop for QML algorithm search

FuTe Wong

机构 * Institute of Medical Science, University of Toronto(多伦多大学医学科学研究所) Vector Institute(向量研究所) Department of Computer Science, University of Toronto(多伦多大学计算机科学系)

专题命中 工具调用 :agent(abstract);planning(abstract);agentic(abstract);multi-agent(abstract)

Comments 7 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21316 2026-06-23 hep-ph 新提交 81%

Large Language Model-Assisted Framework for BSM Model Building

大型语言模型辅助的BSM模型构建框架

Shaikh Saad

专题命中 工具调用 :agent(summary_cn,abstract)

AI总结 提出bsm_agent框架,结合确定性物理后端与LLM聊天接口,通过自然语言指定新场量子数,自动构建可重整拉氏量、检查规范反常、导出对称性破缺条件与质量矩阵,确保结果可重复。

Comments 49 pages. Includes a Python package for BSM model building via LLM chat from user-specified particle quantum numbers. Code: https://github.com/saad-hep/bsm_agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09855 2026-08-11 cs.AI cs.CL 新提交 81%

Agentic Auto-Research is Fuzz Testing

智能体自动研究即模糊测试

Yifeng He, Jicheng Wang, Yinzhe Zhao, Jiachen Liu, Hao Chen

专题命中 工具调用 :agentic(title);agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出自主研究智能体的“生成-排序”范式存在反馈稀疏性问题,类比灰盒模糊测试,指出自动研究需具备密集进展信号与反馈导向搜索能力,强调反馈架构是自动研究的核心瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05987 2026-08-07 cs.AI cs.LG 新提交 81%

AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning

AgentOPSD:面向智能体强化学习的递归自蒸馏方法

Zi-Han Wang, Zhengxi Lu, Zhiyuan Yao, Jinyang Wu, Jie Wu, Zhengzhou Cai, Yueqing Sun, Ziang Ye, Linji Hao, Qi Gu, Xunliang Cai, Yongliang Shen, Yujiu Yang

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) Meituan(美团)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 提出 AgentOPSD 这一无 critic 的递归自蒸馏方法,用于智能体强化学习的轮次级 credit 分配,在 ALFWorld 等数据集上优于 GRPO 等基线,在 Qwen2.5-7B 模型上实现 ALFWorld 89.1% 的成功率。

Comments Code: https://github.com/ZethWang/AgentOPSD

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09297 2026-08-07 cs.SE cs.AI 版本更新 81%

SkillMOO: Multi-Objective Optimization of Agent Skills for Software Engineering

SkillMOO:软件工程中代理技能的多目标优化

Jingzhi Gong, Ruizhen Gu, Zhiwei Fei, Yazhuo Cao, Lukas Twist, Alina Geiger, Shuo Han, Dominik Sobania, Federica Sarro, Jie M. Zhang

机构 * King's College London(伦敦国王学院) Queen's University Belfast(贝尔法斯特女王大学) Nanjing University(南京大学) Johannes Gutenberg University Mainz(美因茨约翰尼斯·古滕贝格大学) University College London(伦敦大学学院) University of Duisburg-Essen(杜伊斯堡- Essen大学)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出SkillMOO框架,通过LLM提议的编辑和NSGA-II算法优化代理技能包,提升任务成功率并降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03527 2026-08-05 cs.IR cs.AI cs.CL 新提交 81%

Training Documents Reranker with Search Rubrics for Deep Research Agent

面向深度研究智能体的、基于搜索 rubrics 的训练文档重排序器

Wenhan Liu, Yu Lu, Qiaolin Xia, Hui Xu, Tong Zhao, Jian Xi, Yutao Zhu, Haijin Liang, Haibo Shi, Hao Wang, Zhicheng Dou

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 针对现有检索器无法满足深度研究智能体复杂信息需求的问题,提出搜索 rubrics 并训练文档重排序器 RubricRanker,在多基准上取得优于基线的性能且泛化性良好。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03222 2026-08-05 cs.SE cs.AI 新提交 81%

Fail-Fast, Restart-Smart: Early Failure Prediction and Restart for SWE Agentic Tasks

快速失败,智能重启:面向软件工程智能体任务的早期失败预测与重启

Chenyu Wang, Yunbo Lyu, Junda He, Zhou Yang, Chenxing Zhong, Yaniv Harel, David Lo

专题命中 工具调用 :agentic(title);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出FailFast-RestartSmart两阶段控制器,可在5%假阳性率下节省14.6%-20.4%执行token,在25%假阳性率下将Qwen3.6-27B解决率从66.6%提至71.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02645 2026-08-05 cs.SE cs.AI 新提交 81%

Verified Tool Calls Improve LLM Agent Reliability Under Non-Atomic Failures

经验证的工具调用可提升非原子故障下LLM智能体的可靠性

Isham Kalappurackal Mansoor, Abhishek Phadke, Pratip Rana

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 针对非原子故障导致LLM智能体可靠性不足的问题,提出带后置条件验证、重试前逻辑和幂等键的工具包装器,可减少重复动作并保持任务成功率,且无需修改底层LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20668 2026-07-24 cs.CL cs.AI 新提交 81%

From Agent Failures to Text Policies: What Works and What Breaks

从智能体失败到文本策略:可行与不可行之处

Jaideep Ray, Ankit Goyal

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 研究智能体中TextGrad应用问题,通过区分遵循与学习策略能力来研究。发现两者有差距,人工编写策略能提升智能体表现,而从轨迹生成的策略无法可靠超越固定提示,主要挑战是从经验中生成和选择策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18308 2026-07-22 cs.LG cs.AI 新提交 81%

Agentic Calibration of Grey-Box Simulation Models: An LLM-Driven Alternative

灰箱仿真模型的智能校准:一种由大语言模型驱动的替代方法

David Gómez-Guillén, Mireia Diaz, Josep Lluis Arcos, Jesús Cerquides

机构 * Catalan Institute of Oncology-IDIBELL(加泰罗尼亚肿瘤研究所-IDIBELL) Autonomous University of Barcelona(巴塞罗那自治大学) Centro de Investigación Biomédica en Red de Epidemiología y Salud Pública(国家公共卫生与流行病学网络生物医学研究中心) Artificial Intelligence Research Institute, IIIA-CSIC(人工智能研究所,西班牙科学研究委员会-人工智能研究所)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 研究灰箱仿真模型校准问题,提出用大语言模型作优化器的智能校准方法,在肛门癌仿真模型上评估,结果表明该方法在减少模型评估次数上有优势,虽迭代推理时间增加,但可审计和解释,适用于仿真时间占主导的情况。

Comments Manuscript: 19 pages, 2 figures. Appendix: 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32017 2026-07-21 cs.LG cs.AI 版本更新 81%

TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning

TRIAGE:面向智能体强化学习的角色类型化信用分配

Yuanda Xu, Zhengze Zhou, Hejian Sang, Xiaomin Li, Jiaxin Zhang, Xinchen Du, Sen Na, Zhipeng Wang, Alborz Geramifard

机构 * LinkedIn Corporation(领英公司) Harvard University(哈佛大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 提出TRIAGE框架,通过角色类型化信用分配修正GRPO仅依赖结果信用的盲点,在ALFWorld等任务中提升成功率并减少交互步数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06854 2026-07-09 cs.LG cs.AI cs.GT 新提交 81%

A Gold-Standard Study of What Makes a Lightweight Game-Playing Agent Strong

关于使轻量级博弈代理强大的因素的金标准研究

Nima Kelidari, Mohammadsaeed Haghi, Mahdi Salmani

机构 * University of Southern California(美国南加州大学)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 研究不完美信息纸牌游戏中使轻量级博弈代理强大的因素,构建专家代理作标准,经超百次运行确定有效因素,添加基线并应用于另一游戏,得出通用方法可训练有竞争力代理且无需专家训练。

Comments 9 pages, 5 figures, 3 tables. Code and models: https://github.com/Nikelroid/adversarial-coevolution

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23800 2026-07-09 cs.RO cs.AI cs.LG 版本更新 81%

Object Search in Partially-Known Environments via LLM-informed Model-based Planning and Prompt Selection

通过LLM引导的基于模型的规划与提示选择进行部分已知环境中的物体搜索

Abhishek Paudel, Abhish Khanal, Raihan I. Arnob, Shahriar Hossain, Gregory J. Stein

机构 * Department of Computer Science, George Mason University(乔治·马歇尔大学计算机科学系)

专题命中 工具调用 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于LLM的模型规划框架和提示选择方法,用于部分已知环境中的物体搜索。利用LLM估计不同位置搜索目标物体的可能性,并结合环境地图提取的旅行成本,以实现有效的搜索性能。

Comments 10 pages, 8 figures. Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23236 2026-07-08 cs.LG cs.AI cs.AR cs.MA cs.PF 版本更新 81%

KernelEvolve: Scaling Agentic Kernel Coding for Heterogeneous AI Accelerators at Meta

KernelEvolve:为Meta异构AI加速器扩展智能内核编码

Gang Liao, Hongsen Qin, Ying Wang, Alicia Golden, Michael Kuchnik, Yavuz Yetim, Jia Jiunn Ang, Chunli Fu, Yihan He, Samuel Hsia, Zewei Jiang, Dianshi Li, Uladzimir Pashkevich, Varna Puvvada, Feng Shi, Matt Steiner, Ruichao Xiao, Liyuan Li, Nathan Yan, Xiayu Yu, Zhou Fang, Roman Levenstein, Kunming Ho, Haishan Zhu, Alec Hammond, Richard Li, Ajit Mathews, Kaustubh Gondkar, Abdul Zainul-Abedin, Ketan Singh, Hongtao Yu, Wenyuan Chi, Barney Huang, Sean Zhang, Noah Weller, Zach Marine, Wyatt Cook, Carole-Jean Wu, Gaoxiang Liu

机构 * Meta Platforms(Meta平台)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对深度学习推荐模型训练和推理面临的异构性挑战,提出KernelEvolve框架,通过多编程抽象自动生成和优化内核,经实验验证其正确性,大幅提升性能并降低新AI硬件可编程性障碍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03333 2026-07-07 cs.DC cs.AI cs.LG 新提交 81%

SPORK: Self-Speculative Forking to Accelerate Agentic LLM Inference

SPORK:自我推测性分叉以加速智能体大语言模型推理

Huajun Bai, Weiwei Lv, Huichuan Zheng, Youyou Lu, Jiwu Shu

机构 * Tsinghua University(清华大学) Meituan(美团)

专题命中 工具调用 :agentic(title);workflow(abstract);分类 cs.AI、cs.LG

AI总结 研究LLM智能体推理中串行循环耗时问题,提出SPORK方法,利用模型自身预测提前调度推测工具调用,通过成本模型等组件优化,大幅提升推理效率且不影响任务准确性。

Comments 16 pages, 15 figures. Code: https://github.com/baihuajun24/spork

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05409 2026-07-07 cs.AI cs.CL 版本更新 81%

Agentic Retrieval-Augmented Generation for Financial Document Question Answering

代理检索增强生成用于财务文档问答

Yang Shu, Yingmin Liu, Zequn Xie

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出FinAgent-RAG框架,通过迭代检索-推理循环和自我验证,提升金融文档问答的精度。引入对比金融检索器、程序化思维模块和自适应策略路由,实验表明在三个基准数据集上均取得显著效果,准确率提升5.62-9.32个百分点。

Comments This paper is withdrawn due to significant methodological errors in the experimental design that fundamentally affect the validity of the results. The errors are not correctable within the current framework, and the conclusions can no longer be supported. We apologize for any inconvenience caused to readers

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00297 2026-07-02 cs.LG cs.CL 新提交 81%

EPC: A Standardized Protocol for Measuring Evaluator Preference Dynamics in LLM Agent Systems

EPC:一种用于测量LLM智能体系统中评估者偏好动态的标准协议

Zewen Liu

专题命中 工具调用 :agent(title,abstract);分类 cs.CL、cs.LG

AI总结 提出EPC协议,通过四阶段隔离范式标准化测量LLM智能体系统中评估者偏好耦合现象,并提供参考快照和版本约定以支持复现、比较和衰减检测。

Comments 10 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25819 2026-06-25 cs.CL cs.SE 新提交 81%

Beyond Function Calling: Benchmarking Tool-Using Agents under Tool-Environment Unreliability

超越函数调用:工具环境不可靠性下的工具使用智能体基准测试

Yang Tian, Zhengpeng Shi, Yu Zhou, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 工具调用 :function calling(title);tool-use(abstract);分类 cs.CL、cs.SE

AI总结 提出ToolBench-X基准,在工具环境中注入五种可恢复可靠性风险,评估智能体任务完成能力,发现可靠工具下表现良好的智能体在可恢复风险下失败,失败主因是诊断和恢复能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18383 2026-06-19 cs.CL cs.AI 版本更新 81%

MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation

MENTOR: 通过灵活的教师优化奖励进行工具使用蒸馏的强化学习

ChangSu Choi, Hoyun Song, Dongyeon Kim, WooHyeon Jung, Minkyung Cho, Sunjin Park, NohHyeob Bae, Seona Yu, KyungTae Lim

机构 * Seoul National University of Science and Technology(首尔科学技术大学) Korea Advanced Institute of Science and Technology(韩国科学技术院) LG CNS

专题命中 工具调用 :tool-use(title,abstract);分类 cs.AI、cs.CL

AI总结 提出MENTOR方法,通过灵活的教师优化奖励结构,平衡行为对齐与下游性能,提升小模型在工具使用任务中的域外泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29676 2026-06-18 cs.AI cs.CL 版本更新 81%

Notation Matters: A Benchmark Study of Token-Optimized Formats in Agentic AI Systems

符号至关重要:智能体AI系统中令牌优化格式的基准研究

Lorenz Kutschka, Bernhard Geiger

机构 * Know Center Research GmbH(知中心研究有限公司) Graz University of Technology(格拉茨技术大学) Graz Center for Machine Learning(格拉茨机器学习中心)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 本研究在四个智能体基准上评估了两种令牌优化格式TOON和TRON,发现TRON在保持准确率的同时最多减少27%的令牌,而TOON虽减少18%但存在多轮解析失败和并行工具调用输出崩溃的问题。

Comments 16 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13662 2026-06-15 cs.AI cs.CL 新提交 81%

EurekAgent: Agent Environment Engineering is All You Need For Autonomous Scientific Discovery

EurekAgent:自主科学发现中,智能体环境工程即一切

Amy Xin, Jiening Siow, Junjie Wang, Zijun Yao, Fanjin Zhang, Jian Song, Lei Hou, Juanzi Li

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Zhipu AI(智谱AI)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 提出环境工程框架EurekAgent,通过权限、工件、预算和人机交互四维工程设计,在数学、内核工程和机器学习任务上取得新最优结果,总API成本低于11美元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08696 2026-06-09 cs.LG cs.AI 新提交 81%

Agentic Search for Counterfactual Recourse under Fixed LLM Budgets

固定LLM预算下的反事实追索的智能搜索

Yasuo Tabei

机构 * RIKEN Center for Advanced Intelligence Project(日本RIKEN高级智能项目中心)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 提出Comp-MCTS框架,在固定LLM调用预算下,通过树搜索最大化生成唯一且经oracle验证的反事实,平衡数量与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04104 2026-06-04 cs.SE cs.AI cs.CR 81%

Proof-Carrying Agent Actions: Model-Agnostic Runtime Governance for Heterogeneous Agent Systems

证明携带型智能体动作:异构智能体系统的模型无关运行时治理

Zexun Wang

机构 * Ond Holdings Inc(Ond控股公司)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 提出一种运行时无关的治理模型PCAA,通过动作证书和五个检查点实现异构智能体系统的统一授权与审计,并在参考实现中验证其可移植性和有效性。

Comments 25 pages, 2 tables, 3 figures. Implementation-informed systems paper with bounded public validation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01065 2026-06-02 cs.DC cs.AI cs.LG 81%

Leyline: KV Cache Directives for Agentic Inference

Leyline:用于智能推理的 KV 缓存指令

Bole Ma, Jan Eitzinger, Harald Koestler

机构 * Erlangen National High Performance Computing Center(埃朗根国家高性能计算中心)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 针对智能体 LLM 中策略驱动的缓存编辑需求,提出 Leyline 服务端原语,通过声明式指令四元组和架构无关接口实现缓存拼接与截断,提升缓存命中率和求解率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00914 2026-06-02 cs.AI cs.CL cs.CR 81%

Adversarial Feeds Steer LLM Agent Decisions Against Their Defaults

对抗性输入流引导LLM智能体决策偏离其默认行为

Rana Muhammad Usman

机构 * Independent Researcher(独立研究者)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本研究通过控制实验揭示,外部输入流的组成和排序能因果性地改变LLM智能体的下游决策,存在对抗性屈服、默认饱和及默认方向不对称三种响应模式,且该效应在多个决策领域普遍存在。

Comments 14 pages, 5 figures. Code, post pools, and 2,785 decision rollouts: https://github.com/ranausmanai/recommenders-as-control-surfaces

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11374 2026-06-02 cs.LG cs.CL cs.IR 81%

Test-Time Compute for Frozen Embedding Models through Agentic Program Search

冻结嵌入模型在测试时通过智能体程序搜索的计算

Han Xiao

机构 * Jina AI by Elastic(Jina AI 由 Elastic 提供)

专题命中 工具调用 :agentic(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种智能体程序搜索方法,通过大语言模型编写程序操作冻结编码器API,在推理时提升小嵌入模型的检索质量,无需训练参数且跨任务迁移。

Comments 15 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30604 2026-06-01 cs.CR cs.AI cs.CL cs.IR 81%

An Organization-Scoped LLM Agent Runtime Architecture for Regulated Cybersecurity Operations

面向受监管网络安全运营的组织范围LLM代理运行时架构

George Fatouros, Georgios Makridis, George Kousiouris, John Soldatos, Dimosthenis Kyriazis

机构 * Innov-Acts Ltd(Innov-Acts有限公司) Dept. of Digital Systems University of Piraeus(数字系统系希腊比雷埃克斯大学) Harokopio University(哈罗基奥大学) Dept. of Informatics and Telematics(信息学与电信系)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 提出一种组织范围的LLM代理运行时架构,通过类型化安全上下文、运行时核心、专业子代理、受控工具适配层和分层人机回环,实现检索、工具调用、内存、发现、报告和审计的全局强制,并保持模型无关和本地部署。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17373 2026-06-01 cs.LG cs.AI 81%

FML-bench: A Controlled Study of AI Research Agent Strategies from the Perspective of Search Dynamics

FML-bench:从搜索动力学视角对AI研究代理策略的受控研究

Qiran Zou, Hou Hei Lam, Wenhao Zhao, Tingting Chen, Yiming Tang, Samson Yu, Yingtao Zhu, Srinivas Anumasa, Zufeng Zhang, Tianyi Zhang, Chang Liu, Zhengyao Jiang, Anirudh Goyal, Dianbo Liu

机构 * National University of Singapore(国立新加坡大学) Tsinghua University(清华大学) University of Minnesota(明尼苏达大学) Weco Meta

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出FML-Bench基准,通过分离策略与基础设施并定义过程级指标,评估六种代理策略,发现贪婪爬山法接近最优树搜索,且自适应策略基于搜索密度切换可超越其他代理。

Comments Our benchmark is available at: https://github.com/qrzou/FML-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27788 2026-05-28 cs.LG cs.CL 81%

Knowing When to Ask: Segment-Level Credit Assignment for LLM Tool Use

知道何时求助:面向LLM工具使用的片段级信用分配

Abhijit Kumar, Zoey Wu, Mohit Suley

机构 * Microsoft AI Redmond(微软AI红mond)

专题命中 工具调用 :tool use(title);tool-use(abstract);分类 cs.CL、cs.LG

AI总结 提出CARL方法,通过强化学习在模型自身轨迹上训练评论家,对每个工具使用片段独立分配信用,使模型学会区分参数知识足够与需要外部帮助的情况,在多个基准上提升准确率并减少不必要的工具调用。

详情

展开后加载摘要…

URL PDF HTML 收藏