arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 92539 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5014 篇

2605.27995 2026-05-29 cs.AI 85%

AsyncTool: Evaluating the Asynchronous Function Calling Capability under Multi-Task Scenarios

AsyncTool: 多任务场景下异步函数调用能力的评估

Kou Shi, Ziao Zhang, Shiting Huang, Avery Nie, Zhen Fang, Qiuchen Wang, Lin Chen, Huaian Chen, Zehui Chen, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) University of Toronto(多伦多大学)

专题命中 工具调用 :function calling(title);agent(abstract);tool use(abstract);tool-use(abstract)

AI总结 提出AsyncTool基准,通过模拟工具响应延迟的多任务环境,评估基于大语言模型的智能体在异步工具调用中的任务协调与效率。

Comments https://github.com/StoKou/repo-asynctool

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21434 2026-05-21 cs.SE 85%

Agentic Model Checking

代理模型检查

Youcheng Sun, Jiawen Liu, Daniel Kroening, Jason Xue

专题命中 工具调用 :agentic(title,abstract);agent(abstract,abstract_cn);分类 cs.SE

AI总结 本文提出了一种代理模型检查方法,结合LLM代理与受限模型检查后端,通过代理提出任务并由求解器验证,以解决LLM生成系统代码的验证难题,包括规范缺失和安全合同隐式编码的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20315 2026-05-21 cs.CL 85%

Mix-Quant: Quantized Prefilling, Precise Decoding for Agentic LLMs

Mix-Quant: 量化预填,精准解码用于代理大语言模型

Haiquan Lu, Zigeng Chen, Gongfan Fang, Xinyin Ma, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 工具调用 :agentic(title,abstract);tool use(abstract);planning(abstract);分类 cs.CL

AI总结 本文提出Mix-Quant,一种简单有效的阶段感知量化框架,用于加速代理大语言模型的推理。通过在预填阶段应用高吞吐量NVFP4量化,同时保留BF16精度用于解码,从而在保持任务性能的同时显著提高效率,实现预填阶段高达3倍的速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14038 2026-05-19 cs.AI 85%

Model-Adaptive Tool Necessity Reveals the Knowing-Doing Gap in LLM Tool Use

模型适应性工具必要性揭示了大语言模型工具使用中的知行差距

Yize Cheng, Chenrui Fan, Mahdi JafariRaviz, Keivan Rezaei, Soheil Feizi

机构 * University of Maryland, College Park(马里兰大学College Park分校)

专题命中 工具调用 :tool use(title,abstract);autonomous agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 本文研究了大语言模型在使用外部工具时的必要性问题,提出了一种基于模型自身性能的适应性工具必要性定义,并通过四个模型在算术和事实性问答数据集上的比较,发现工具必要性与实际调用行为之间存在显著的不匹配,揭示了LLM工具使用中的知行差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14671 2026-05-15 cond-mat.mtrl-sci cs.AI 85%

Agentic Design of Compositional Descriptors via Autoresearch for Materials Science Applications

通过Autoresearch进行组合描述符的代理设计用于材料科学应用

Matteo Cobelli, Stefano Sanvito

机构 * School of Physics(物理系) CRANN Institute, Trinity College, Dublin 2, Dublin, Ireland(CRANN研究所,三一学院,都柏林2号,都柏林,爱尔兰)

专题命中 工具调用 :agentic(title);agent(abstract);AI agent(abstract);workflow(abstract)

AI总结 本文通过Autoresearch框架设计输入描述符,利用大语言模型生成化学化合物的组合描述符,并通过随机森林工作流评估,提升了材料性质预测的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15019 2026-05-15 cs.AI cs.IR 85%

Hunt Globally: Wide Search AI Agents for Drug Asset Scouting in Investing, Business Development, and Competitive Intelligence

全球搜索:面向药物资产勘探的宽搜索AI代理,用于投资、业务开发和竞争情报

Vlad Vinogradov, Alisa Vinogradova, Luba Greenwood, Ilya Yasny, Dmitry Kobyzev, Shoman Kasbekar, Kong Nguyen, Dmitrii Radkevich, Roman Doronin, Andrey Doronichev

机构 * Bioptic

专题命中 工具调用 :AI agent(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出一种基于树结构的自学习Bioptic代理,用于在多语言、异构数据源中实现高召回率的药物资产勘探,通过构建多代理流水线和基准测试,验证了其在非美国中心雷达数据中的完整性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06607 2026-05-14 physics.flu-dyn cs.AI 85%

AI CFD Scientist: Toward Open-Ended Computational Fluid Dynamics Discovery with Physics-Aware AI Agents

AI CFD科学家:借助物理感知AI代理实现开放式计算流体力学发现

Nithin Somasekharan, Rabi Pathak, Manushri Dhanakoti, Tingwen Zhang, Ling Yue, Andy Zhu, Shaowu Pan

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院)

专题命中 工具调用 :AI agent(title);agent(abstract,abstract_cn);workflow(abstract);分类 cs.AI

AI总结 本文提出AI CFD科学家,通过结合文献引导的构思、验证执行、基于视觉的物理验证、源代码修改和图基写作,实现计算流体力学的开放式发现。

Comments 9 main pages and rest in appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08828 2026-05-13 cs.AI 85%

When Agents Overtrust Environmental Evidence: An Extensible Agentic Framework for Benchmarking Evidence-Grounding Defects in LLM Agents

当智能体过度信任环境证据:一个可扩展的智能体框架,用于基准测试LLM智能体中的证据 grounding 缺陷

Strick Sheng, Ziyue Wang, Liyi Zhou

机构 * The University of Sydney(悉尼大学) Nanjing University(南京大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI

AI总结 本文提出EnvTrustBench框架,用于评估智能体在环境证据过时、错误或恶意时的可靠性问题,通过生成多个任务场景并验证结果,揭示证据 grounding 是智能体可靠性的重要挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07863 2026-05-11 cs.LG 85%

ADKO: Agentic Decentralized Knowledge Optimization

ADKO:群体性去中心化知识优化

Lucas Nerone Rillo, Zhanhong Jiang, Nastaran Saadati, Aditya Balu, Baskar Ganapathysubramanian, Chinmay Hegde, Soumik Sarkar

机构 * Iowa State University(爱荷华州立大学) New York University(纽约大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.LG

AI总结 ADKO框架通过去中心化方法实现高效黑盒优化,结合高斯过程、语言模型和压缩技术,在隐私保护和异质目标处理方面取得突破。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07112 2026-05-11 cs.AI cs.MA 85%

Switchcraft: AI Model Router for Agentic Tool Calling

Switchcraft:面向代理工具调用的AI模型路由

Sharad Agarwal, Pooria Namyar, Alec Wolman, Rahul Ambavat, Ankur Gupta, Qizheng Zhang

机构 * Microsoft Research(微软研究院) Stanford(斯坦福大学)

专题命中 工具调用 :agentic(title,abstract);tool use(abstract);tool-use(abstract);分类 cs.AI

AI总结 Switchcraft是首个面向代理工具调用优化的模型路由系统,通过选择成本最低且正确的模型,降低推理成本达84%,同时保持准确率与最佳单个模型相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06847 2026-05-08 cs.SE 85%

Characterizing Faults in Agentic AI: A Taxonomy of Types, Symptoms, and Root Causes

代理AI中的故障特征化:故障类型、症状和根本原因的分类

Mehil B Shah, Mohammad Mehdi Morovati, Mohammad Masudur Rahman, Foutse Khomh

专题命中 工具调用 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 本文通过实证研究,提出代理AI系统故障的分类体系,涵盖34种故障类型,揭示其在结构化输出解释、工具调用、运行时执行和异常处理中的表现,以及数据模式不匹配、依赖漂移等根本原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00060 2026-05-04 cs.AI cs.SY eess.SY 85%

TADI: Tool-Augmented Drilling Intelligence via Agentic LLM Orchestration over Heterogeneous Wellsite Data

TADI:通过异构钻井现场数据的代理LLM编排实现工具增强的钻井智能

Rong Lu

专题命中 工具调用 :agentic(title,abstract);agent(abstract);function calling(abstract);分类 cs.AI

AI总结 TADI通过代理LLM编排整合钻井数据,实现证据驱动的分析智能,展示了领域专用工具设计对分析质量的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25555 2026-04-29 cs.CR cs.AI 85%

From CRUD to Autonomous Agents: Formal Validation and Zero-Trust Security for Semantic Gateways in AI-Native Enterprise Systems

从CRUD到自主代理:面向AI原生企业系统的语义网关的正式验证与零信任安全

Ignacio Peyrano

机构 * Universidad Austral(乌尔苏拉大学)

专题命中 工具调用 :autonomous agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出了一种基于模型上下文协议的语义网关,通过正式验证和实证评估,解决了AI原生系统中自主代理的安全验证问题,采用零信任安全模型和语义模糊化技术,实现了对动态状态转换系统的安全审计。

Comments 25 pages, 4 figures, 4 tables. Open-source proof-of-concept (47 automated tests, deterministic semantic fuzzer) available at https://github.com/PeyranoDev/semantic-gateway-poc

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16394 2026-04-21 cs.IR cs.AI 85%

A Reference Architecture for Agentic Hybrid Retrieval in Dataset Search

面向数据集搜索的代理混合检索参考架构

Riccardo Terrenzi, Phongsakon Mark Konrad, Tim Lukas Adam, Serkan Ayvaz

机构 * Centre for Industrial Software University of Southern Denmark(工业软件中心 欧洲南部大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出一种结合BM25和嵌入检索的代理混合检索架构,通过LLM代理规划查询并融合RRF算法,引入元数据增强减少语义偏差,分析单代理与多代理架构的权衡。

Comments 7 pages, 3 figures, accepted at SAML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12482 2026-04-20 cs.AI 85%

Agentic AI Optimisation (AAIO): what it is, how it works, why it matters, and how to deal with it

代理AI优化(AAIO):它是什么,如何运作,为什么重要,以及如何应对它

Luciano Floridi, Carlotta Buttaboni, Nicolas Gertler, Emmie Hine, Jessica Morley, Claudio Novelli, Tyler Schroder

机构 * Digital Ethics Center, Yale University(耶鲁大学数字伦理中心) Department of Legal Studies, University of Bologna(博洛尼亚大学法律研究系) Department of Computer Science(计算机科学系)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文探讨了代理AI优化(AAIO)作为确保网站与代理AI系统无缝交互的关键方法,分析了其在数字基础设施中的重要性及治理挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05846 2026-04-08 cs.CL 85%

AgentGL: Towards Agentic Graph Learning with LLMs via Reinforcement Learning

AgentGL: 通过强化学习实现基于LLM的代理图学习

Yuanfu Sun, Kang Li, Dongzhe Fan, Jiajin Liu, Qiaoyu Tan

机构 * New York University Shanghai(上海纽约大学) New York University(纽约大学) Tsinghua University(清华大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.CL

AI总结 AgentGL通过强化学习框架实现图学习,结合图导航与LLM推理,提升复杂关系环境下的自主导航与推理能力,优于现有基线方法。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04604 2026-04-07 cs.CY cs.AI cs.CR cs.MA 85%

AI Agents Under EU Law

欧盟法律下的AI代理

Luca Nannini, Adam Leon Smith, Michele Joshua Maggini, Enrico Panai, Sandra Feliciano, Aleksandr Tiulkanov, Elena Maran, James Gealy, Piercosma Bisconti

机构 * Piccadilly Labs(皮卡迪利实验室) Association of AI Ethicists(人工智能伦理学家协会) Centro Singular de Investigación en Tecnoloxías Intelixentes da USC(圣地亚哥德孔波斯特拉大学智能技术卓越研究中心) AIQI Consortium(AIQI联盟) BeEthical INSIGHT – Piaget Research Center for Ecological Human Development(INSIGHT – 皮亚杰生态人类发展研究中心) Responsible Innovations(负责任创新) ForHumanity Europe(ForHumanity欧洲) Alethesis AI SaferAI DEXAI Icaro Lab(伊卡洛斯实验室)

专题命中 工具调用 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文探讨欧盟法律下AI代理的监管挑战,提出合规架构和分类体系,分析多党行动链透明度和安全问题。

Comments Working Paper - April 2026, subject to updates (EC M/613, M/606, Digital Omnibus proposals)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16839 2026-03-18 cs.AI 85%

Learning to Present: Inverse Specification Rewards for Agentic Slide Generation

学习呈现:用于代理幻灯片生成的逆规范奖励

Karthik Ragunath Ananda Kumar, Subrahmanyam Arunachalam

机构 * Tavus Inc.(Tavus公司) University of Texas at Dallas(德克萨斯大学达拉斯分校) Texas A&M University(德克萨斯农工大学)

专题命中 工具调用 :agentic(title,abstract);tool use(abstract);tool-use(abstract);分类 cs.AI

AI总结 本文提出一个兼容OpenEnv的强化学习环境,通过工具使用训练LLM代理生成专业HTML幻灯片,引入多组件奖励系统,包括结构验证、渲染质量评估、LLM审美评分、内容质量指标和逆规范奖励,实验显示细调模型在质量与工具使用合规性上表现优异。

Comments 12 pages, 11 figures, 13 tables, 26 references. Code: https://github.com/pushing-the-frontier/slide-forge-llm Dataset: https://huggingface.co/datasets/KarthikRagunathAnandaKumar/sliderl-multi-turn-rollouts

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01050 2026-03-03 cs.CV cs.AI 85%

MM-DeepResearch: A Simple and Effective Multimodal Agentic Search Baseline

MM-DeepResearch: 一种简单而有效的多模态代理搜索基线

Huanjin Yao, Qixiang Yin, Min Yang, Ziwang Zhao, Yibo Wang, Haotian Luo, Jingyi Zhang, Jiaxing Huang

专题命中 工具调用 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.AI

AI总结 MM-DeepResearch通过Hyper-Search和DR-TTS方法,构建了多模态代理搜索基线,实现了高效多模态研究任务的处理。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08401 2026-02-10 cs.AI cs.CR 85%

On Protecting Agentic Systems' Intellectual Property via Watermarking

通过水印技术保护代理系统知识产权

Liwen Wang, Zongjie Li, Yuchong Xie, Shuai Wang, Dongdong She, Wei Wang, Juergen Rahmel

机构 * The Hong Kong University of Science(香港科学与技术大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI

AI总结 本文提出AGENTWM框架,通过水印技术保护代理系统知识产权,有效抵御适应性对手的攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07652 2026-02-10 cs.CR cs.AI 85%

Agent-Fence: Mapping Security Vulnerabilities Across Deep Research Agents

Agent-Fence: 在深度研究代理中映射安全漏洞

Sai Puppala, Ismail Hossain, Md Jahangir Alam, Yoonpyo Lee, Jay Yoo, Tanzim Ahad, Syed Bahauddin Alam, Sajedul Talukder

机构 * Computer Science Department, Southern Illinois University(索尔坦大学计算机科学系) Computer Science Department, University of Texas(德克萨斯大学计算机科学系) Hanyang University(翰阳大学) The Grainger College of Engineering, Nuclear, Plasma & Radiological Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校格雷格尔工程学院)

专题命中 工具调用 :agent(title,abstract);tool use(abstract);planning(abstract);分类 cs.AI

AI总结 Agent-Fence通过定义14种信任边界攻击类别,评估深度代理的安全性,发现高风险类别如Denial-of-Wallet和Authorization Confusion,揭示代理在持久交互中的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26553 2026-02-10 cs.CL cs.PL 85%

Towards Reliable Benchmarking: A Contamination Free, Controllable Evaluation Framework for Multi-step LLM Function Calling

迈向可靠的基准测试:一种无污染、可控的多步骤LLM功能调用评估框架

Seiji Maekawa, Jackson Hassell, Pouya Pezeshkpour, Tom Mitchell, Estevam Hruschka

机构 * Megagon Labs(Megagon实验室)

专题命中 工具调用 :function calling(title);agent(abstract);tool use(abstract);tool-use(abstract)

AI总结 本文提出FuncBenchGen框架,通过生成多步骤工具使用任务评估LLM功能调用能力,发现依赖深度增加导致性能下降,引入重申变量值策略提升模型表现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01331 2026-02-03 cs.MA cs.CL 85%

A-MapReduce: Executing Wide Search via Agentic MapReduce

A-MapReduce:通过代理MapReduce执行广泛搜索

Mingju Chen, Guibin Zhang, Heng Chang, Yuchen Guo, Shiji Zhou

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算创新中心,人工智能学院,北京航空航天大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) BNRist, Tsinghua University(BNRist,清华大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 A-MapReduce通过引入MapReduce范式,提出一种多代理框架,将广泛搜索转化为水平结构的检索问题,实现高效且低成本的广泛搜索执行。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20439 2026-01-29 cs.CL 85%

PEARL: Plan Exploration and Adaptive Reinforcement Learning for Multihop Tool Use

PEARL:多跳工具使用中的计划探索与自适应强化学习

Qihao Wang, Mingzhe Lu, Jiayue Wu, Yue Hu, Yanbing Liu

机构 * Institute of Information Engineering, China(信息工程研究所,中国) School of Cyber Security, University of Chinese Academy of Sciences, China(中国科学院大学网络安全学院,中国)

专题命中 工具调用 :tool use(title,abstract);agent(abstract);planning(abstract);分类 cs.CL

AI总结 PEARL通过两阶段方法提升LLM在多跳工具使用中的规划与执行能力,实现ToolHop 56.5%的成功率。

Comments Accepted to PRICAI25

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23880 2026-01-29 cs.AI cond-mat.mtrl-sci 85%

CASCADE: Cumulative Agentic Skill Creation through Autonomous Development and Evolution

CASCADE:通过自主开发与进化实现累积性代理技能创造

Xu Huang, Junwu Chen, Yuxing Fei, Zhuohan Li, Philippe Schwaller, Gerbrand Ceder

机构 * Department of Materials Science and Engineering, University of California, Berkeley, California, United States(加州大学伯克利分校材料科学与工程系) Materials Sciences Division, Lawrence Berkeley National Laboratory, California, United States(劳伦斯伯克利国家实验室材料科学部) Laboratory of Artificial Chemical Intelligence (LIAC), Institute of Chemical Sciences and Engineering, École Polytechnique Fédérale de Lausanne (EPFL), Lausanne, Switzerland(日内瓦联邦理工学院化学科学与工程研究所人工化学智能实验室) National Centre of Competence in Research (NCCR) Catalysis, École Polytechnique Fédérale de Lausanne (EPFL), Lausanne, Switzerland(日内瓦联邦理工学院催化研究国家中心)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI

AI总结 CASCADE通过自主开发与进化实现代理技能的累积,提升复杂科学任务的适应性和扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12449 2026-01-21 cs.CR cs.AI 85%

AgenTRIM: Tool Risk Mitigation for Agentic AI

AgenTRIM:代理AI的工具风险缓解

Roy Betser, Shamik Bose, Amit Giloni, Chiara Picardi, Sindhu Padakandla, Roman Vainshtein

机构 * Fujitsu Research of Europe (FRE)(富士通欧洲研究(FRE)) Fujitsu Research of India Pvt. Ltd. (FRIPL)(富士通印度私人有限公司(FRIPL))

专题命中 工具调用 :agentic(title);agent(abstract);AI agent(abstract);tool use(abstract)

AI总结 AgenTRIM通过离线和在线阶段检测并缓解代理AI中工具驱动的风险,减少攻击成功率同时保持任务性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10355 2026-01-16 cs.CL 85%

Unlocking Implicit Experience: Synthesizing Tool-Use Trajectories from Text

解锁隐含经验:从文本合成工具使用轨迹

Zhihao Xu, Rumei Li, Jiahuan Li, Rongxiang Weng, Jingang Wang, Xunliang Cai, Xiting Wang

机构 * Renmin University of China(中国人民大学) Meituan(美团)

专题命中 工具调用 :tool-use(title,abstract);autonomous agent(abstract);workflow(abstract);分类 cs.CL

AI总结 本研究提出GEM方法,通过文本数据生成多轮工具使用轨迹,提升LLM在多轮交互中的工具使用能力,实验显示其在基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08225 2026-01-14 cs.CL 85%

User-Oriented Multi-Turn Dialogue Generation with Tool Use at scale

面向用户的多轮对话生成与工具使用规模化

Jungho Cho, Minbyul Jeong, Sungrae Park

机构 * Upstage AI

专题命中 工具调用 :tool use(title);agent(abstract);autonomous agent(abstract);tool-use(abstract)

AI总结 本文提出面向用户的多轮对话生成方法,通过动态生成领域特定工具解决任务,提升大规模多轮对话生成的可扩展性和真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21578 2026-01-08 cs.AI 85%

NEMO-4-PAYPAL: Leveraging NVIDIA's Nemo Framework for empowering PayPal's Commerce Agent

NEMO-4-PAYPAL:利用NVIDIA的Nemo框架赋能PayPal的商业代理

Sudhanshu Garg, Andrew Wang, Chaitanya Kulkarni, Ali Sahami, Farhad Farahani, Sean Yun-Shiuan Chuang, Jian Wan, Srinivasan Manoharan, Uma Kona, Nitin Sharma, Linsey Pang, Prakhar Mehrotra, Jessica Clark, Mark Moyou

机构 * PayPal AI NVIDIA

专题命中 工具调用 :agent(title,abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI

AI总结 NEMO-4-PAYPAL利用NVIDIA Nemo框架优化PayPal商业代理,通过微调Nemotron模型提升检索性能并降低延迟与成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01498 2026-01-06 cs.CL 85%

From Failure to Mastery: Generating Hard Samples for Tool-use Agents

从失败到精通:为工具使用代理生成困难样本

Bingguang Hao, Zengzhuang Xu, Yuntao Wen, Xinyi Xu, Yang Liu, Tong Zhao, Maolin Wang, Long Chen, Dong Wang, Yicheng Chen, Cunyin Peng, Xiangyu Zhao, Chenyi Zhuang, Ji Zhang

专题命中 工具调用 :tool-use(title,abstract);agent(abstract);agentic(abstract);分类 cs.CL

AI总结 本文提出HardGen方法,通过生成具有可验证推理的困难样本,提升工具使用代理的训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏