arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-21 至 2026-04-21 共收录 22 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 22 篇

2604.16394 2026-04-21 cs.IR cs.AI 85%

A Reference Architecture for Agentic Hybrid Retrieval in Dataset Search

面向数据集搜索的代理混合检索参考架构

Riccardo Terrenzi, Phongsakon Mark Konrad, Tim Lukas Adam, Serkan Ayvaz

机构 * Centre for Industrial Software University of Southern Denmark(工业软件中心 欧洲南部大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出一种结合BM25和嵌入检索的代理混合检索架构,通过LLM代理规划查询并融合RRF算法,引入元数据增强减少语义偏差,分析单代理与多代理架构的权衡。

Comments 7 pages, 3 figures, accepted at SAML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16555 2026-04-21 cs.LG cs.AI cs.CV 84%

LLM as a Tool, Not an Agent: Code-Mined Tree Transformations for Neural Architecture Search

将LLM作为工具而非代理:基于代码挖掘的树变换用于神经架构搜索

Masakazu Yoshimura, Zitang Sun, Yuiko Sakuma, Junji Otsuka, Atsushi Irie, Takeshi Ohashi

机构 * Sony Group Corporation(索尼集团公司)

专题命中 工具调用 :agent(title);planning(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLMasTool框架,通过树变换实现稳定且开放的模型进化,避免LLM的固有偏差,提升NAS在CIFAR-10、CIFAR-100和ImageNet16-120上的性能。

Comments 72 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18356 2026-04-21 cs.CL 83%

ComPASS: Towards Personalized Agentic Social Support via Tool-Augmented Companionship

ComPASS:通过工具增强的陪伴实现个性化代理社交支持

Zhaopei Huang, Yanfeng Jia, Jiayi Zhao, Xinjie Zhang, Wenxuan Wang, Qin Jin

机构 * Renmin University of China(中国人民大学) Beihang University(北京航空航天大学)

专题命中 工具调用 :agentic(title);agent(abstract);tool use(abstract);分类 cs.CL

AI总结 本文提出ComPASS框架,通过外部工具增强代理能力,构建首个个性化社交支持基准,训练出ComPASS-Qwen模型,提升响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17337 2026-04-21 cs.AI 83%

AutoSearch: Adaptive Search Depth for Efficient Agentic RAG via Reinforcement Learning

AutoSearch: 通过强化学习实现高效的代理RAG自适应搜索深度

Jingbo Sun, Wenyue Chong, Songjun Tu, Qichao Zhang, Yaocheng Zhang, Jiajun Chai, Xiaohan Wang, Wei Lin, Guojun Yin, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所SKL-MAIS实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学交叉学科学院) Meituan(美团)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出AutoSearch框架,通过强化学习动态调整搜索深度,在保证搜索质量的同时提升效率,实现在复杂问题上的准确率与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06328 2026-04-21 cs.AI 83%

C-World: A Computer Use Agent Environment Creator

C-World:一个计算机使用代理环境创建者

Ziqiao Xi, Shuang Liang, Qi Liu, Jiaqing Zhang, Letian Peng, Fang Nan, Meshal Nayim, Tianhui Zhang, Rishika Mundada, Lianhui Qin, Biwei Huang, Kun Zhou

机构 * UC San Diego(UC圣迭戈大学)

专题命中 工具调用 :agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 C-World通过四个组件构建代理环境,解决LLM代理在规划和推理中与人类的差距问题,展示其作为评估环境和数据引擎的双重价值。

Comments Submitted to ACL 2026 12 pages, 4 figures Ziqiao Xi and Shuang Liang contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18334 2026-04-21 cs.SE 81%

Reliability of AI Bots Footprints in GitHub Actions CI/CD Workflows

GitHub Actions CI/CD 工作流中 AI 机器人足迹的可靠性

Syed Muhammad Ashhar Shah, Sehrish Habib, Muizz Hussain, Maryam Abdul Ghafoor, Abdul Ali Bangash

专题命中 工具调用 :agent(abstract);AI agent(abstract);workflow(abstract);agentic(abstract)

AI总结 研究分析了AI机器人在GitHub Actions CI/CD工作流中的可靠性,发现不同AI机器人成功率差异显著,且高频的AI PR可能影响工作流可靠性。

Comments 5 pages, 3 figures. Submitted to the 23rd International Conference on Mining Software Repositories (MSR 2026) Mining Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15625 2026-04-21 cs.LG cs.AI 81%

Robust Tool Use via Fission-GRPO: Learning to Recover from Execution Errors

通过Fission-GRPO实现鲁棒的工具使用:学习从执行错误中恢复

Zhiwei Zhang, Fei Zhao, Rui Wang, Zezhong Wang, Bin Liang, Jiakang Wang, Yao Hu, Shaosheng Cao, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) Xiaohongshu Inc.(小红书公司) MoE Key Laboratory of High Confidence Software Technologies(可信软件技术国家重点实验室)

专题命中 工具调用 :tool use(title);tool-use(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Fission-GRPO框架,通过将执行错误转化为在线纠正监督,提升模型在多轮执行中的错误恢复能力,实验显示其在BFCL v4 Multi-Turn上提升了Qwen3-8B的错误恢复率和整体准确率。

Comments 9 pages, 4 figures, 4 tables. Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18364 2026-04-21 cs.AI cs.GR cs.MA 79%

Training and Agentic Inference Strategies for LLM-based Manim Animation Generation

基于LLM的Manim动画生成的训练与代理推理策略

Ravidu Suien Rammuni Silva, Ahmad Lotfi, Isibor Kennedy Ihianle, Golnaz Shahtahmassebi, Jordan J. Bird

机构 * Department of Computer Science, Nottingham Trent University, Nottingham, United Kingdom(计算机科学系,诺丁汉特伦特大学,诺丁汉,英国)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出ManimTrainer和ManimAgent,结合监督微调与强化学习,提升文本到代码到视频的转换性能,通过ManimBench评估17种模型,结果显示GRPO和RITL-DOC策略显著提升动画生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17111 2026-04-21 cs.DC cs.AI 79%

HiveMind: OS-Inspired Scheduling for Concurrent LLM Agent Workloads

HiveMind: 为并发LLM代理工作负载提供操作系统启发的调度

Justice Owusu Agyemang, Jerry John Kponyo, Obed Kwasi Somuah, Elliot Amponsah, Godfred Manu Addo Boakye, Kwame Opuni-Boachie Obour Agyekum

机构 * Sperix Labs(Sperix实验室) VIA Cybersecurity Lab(VIA网络安全实验室) KNUST(科罗纳大学) Quantum and Assistive Technologies Lab(量子与辅助技术实验室)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 HiveMind通过引入五个操作系统启发的调度原语,解决并发LLM代理在共享API端点时的资源竞争问题,显著降低失败率并减少浪费计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17886 2026-04-21 cs.CL cs.AI 73%

Latent Preference Modeling for Cross-Session Personalized Tool Calling

潜在偏好建模用于跨会话个性化工具调用

Yejin Yoon, Minseo Kim, Taeuk Kim

机构 * Hanyang University(翰阳大学)

专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出MPT基准和PRefine方法,通过生成-验证-细化循环提升工具调用准确性,仅用1.24%的token实现稳健的个性化。

Comments Under review. 25 pages, 10 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10741 2026-04-21 cs.CL cs.AI cs.IR 73%

Deep-Reporter: Deep Research for Grounded Multimodal Long-Form Generation

Deep-Reporter:基于多模态长形式生成的深度研究

Fangda Ye, Zhifei Xie, Yuxin Hu, Yihang Yin, Shurui Huang, Shikai Dong, Jianzhu Bao, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) University of Edinburgh(爱丁堡大学) Beijing Institute of Technology(北京理工大学)

专题命中 工具调用 :planning(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Deep-Reporter框架,通过多模态搜索、检查清单引导合成和上下文管理,解决多模态长形式生成中的整合与选择难题,通过8K高质量数据集和M2LongBench测试集验证其有效性。

Comments 41 pages, 6 figures, 8 tables. Code available at https://github.com/fangda-ye/Deep-Report. v2: corrected typos and updated experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15690 2026-04-21 cs.AI stat.AP 70%

From Passive Metric to Active Signal: The Evolving Role of Uncertainty Quantification in Large Language Models

从被动度量到主动信号:不确定性量化在大语言模型中的演变角色

Jiaxin Zhang, Wendi Cui, Zhuohang Li, Lifu Huang, Bradley Malin, Caiming Xiong, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce AI研究院) Intuit(Intuit公司) Vanderbilt University(范德比大学) University of California, Davis(加州大学戴维斯分校) Vanderbilt University Medical Center(范德比大学医学中心)

专题命中 工具调用 :autonomous agent(abstract);tool use(abstract);分类 cs.AI

AI总结 本文探讨大语言模型中不确定性量化从被动诊断指标到主动控制信号的演变,分析其在高级推理、自主代理和强化学习中的应用及贡献。

Comments This paper has been accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16625 2026-04-21 cs.CL cs.AI cs.LG 67%

AdaExplore: Failure-Driven Adaptation and Diversity-Preserving Search for Efficient Kernel Generation

AdaExplore: 基于失败的适应与多样性保持搜索用于高效内核生成

Weihua Du, Jingming Zhuo, Yixin Dong, Andre Wang He, Weiwei Sun, Zeyu Zheng, Manupa Karunaratne, Ivan Fox, Tim Dettmers, Tianqi Chen, Yiming Yang, Sean Welleck

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学) Arm Ltd(Arm有限公司)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 AdaExplore通过积累执行反馈实现自我改进,通过失败驱动适应和多样性保持搜索提升内核生成的正确性和优化性能,无需额外微调或外部知识。

Comments Preliminary work. The implementation is available at https://github.com/StigLidu/AdaExplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16918 2026-04-21 cs.CL cs.LG 62%

Freshness-Aware Prioritized Experience Replay for LLM/VLM Reinforcement Learning

具有新鲜度意识的优先经验回放用于LLM/VLM强化学习

Weiyu Ma, Yongcheng Zeng, Yan Song, Xinyu Cui, Jian Zhao, Xuhui Liu, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology(卡布尔大学科学与技术大学) Chinese Academy of Sciences, Institute of Automation(中国科学院自动化研究所) AI Centre, Department of Computer Science, University College London(伦敦大学学院人工智能中心) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究所)

专题命中 工具调用 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Freshness-Aware PER,通过引入指数衰减机制解决LLM/VLM强化学习中优先级过时问题,显著提升样本效率,在多个任务中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18473 2026-04-21 cs.LG 57%

Train Separately, Merge Together: Modular Post-Training with Mixture-of-Experts

分开训练,合并一起:模块化后训练与专家混合

Jacob Morrison, Sanjay Adhikesaven, Akshita Bhagia, Matei Zaharia, Noah A. Smith, Sewon Min

机构 * University of Washington(华盛顿大学) University of California, Berkeley(加州大学伯克利分校) Allen Institute for AI(人工智能研究院)

专题命中 工具调用 :tool use(abstract);分类 cs.LG

AI总结 本文提出BAR方法,通过独立训练领域专家并采用专家混合架构实现高效更新,避免了传统重训练的高成本和性能下降问题,实验显示其在多个领域任务中表现优异。

Comments 9 content pages, 23 pages overall, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07934 2026-04-21 cs.DL cs.SE 57%

Lishu: A Real-Source Research Workbench for Elite Business Journal Search, Analysis, and Writing Support

Lishu:精英商业期刊搜索、分析与写作支持的实源研究工作台

Chuang Zhao, Hongke Zhao, Yichen Li, Xiaoquan Zhi, Songyue Guo

专题命中 工具调用 :workflow(abstract);分类 cs.SE

AI总结 本文介绍Lishu,一个用于搜索、监控和解读精英商业与管理期刊文献的可部署网页工具,整合UTD-24和FT50期刊池,支持更广泛的研究流程,包括文献检索、主题分析和写作支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17234 2026-04-21 cs.SE 57%

From Language to Action: Enhancing LLM Task Efficiency with Task-Aware MCP Server Recommendation

从语言到行动:通过任务感知的MCP服务器推荐提升LLM任务效率

Shiyu He, Zhiman Chen, Yuqi Zhao, Neng Zhang, Ran Mo, Yutao Ma

专题命中 工具调用 :agent(abstract);分类 cs.SE

AI总结 本文提出任务感知的MCP服务器推荐框架,通过构建任务-工具关联数据集和改进的推荐模型,提升LLM在实际开发任务中的效率和准确性。

Comments 44 pages, 12 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04997 2026-04-21 physics.comp-ph 50%

LEDDS: Portable LBM-DEM simulations on GPUs

LEDDS: 在GPU上进行便携式LBM-DEM模拟

Raphael Maggio-Aprile, Maxime Rambosson, Christophe Coreixas, Jonas Latt

专题命中 工具调用 :workflow(abstract)

AI总结 本文提出LEDDS框架,通过算法原语实现LBM-DEM模拟,展现高抽象层次下的高性能与可移植性,验证了其在颗粒流和流-粒子相互作用中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17679 2026-04-21 cs.RO 50%

A Hamilton-Jacobi Reachability-Guided Search Framework for Efficient and Safe Indoor Planar Robot Navigation

一种基于哈密顿-雅可比可达性的搜索框架用于高效安全的室内平面机器人导航

Hanyang Hu, Cameron Siu, Mo Chen

机构 * Simon Fraser University(西蒙弗雷泽大学)

专题命中 工具调用 :planning(abstract)

AI总结 本文提出结合离线哈密顿-雅可比可达性与在线图搜索的方法,提升室内机器人导航的效率和安全性,通过预计算的HJ值函数作为启发式和安全约束,减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17431 2026-04-21 cs.CY 50%

The Inference Bottleneck: A Formal Model of Vertical Foreclosure in AI Markets

推理瓶颈:人工智能市场中垂直垄断的正式模型

Gaston Besanson

专题命中 工具调用 :agent(abstract)

AI总结 本文提出一个正式博弈论模型,分析人工智能市场中的垂直垄断问题,探讨服务质量歧视和路由偏见等机制,并提出中性推理政策框架以减少垄断风险。

Comments Working Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01645 2026-04-21 cs.CR 50%

Contextualizing Sink Knowledge for Java Vulnerability Discovery

在Java漏洞发现中 contextualizing sink knowledge

Fabian Fleischer, Cen Zhang, Joonun Jang, Jeongin Cho, Meng Xu, Taesoo Kim

专题命中 工具调用 :agent(abstract)

AI总结 GONDAR框架通过利用sink API语义进行针对性漏洞发现,通过CWE扫描和LLM静态过滤识别可利用的sink调用点,并通过探索和利用代理协作发现更多漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16316 2026-04-21 cs.CY cs.IR 50%

CrossTraffic: An Open-Source Framework for Reproducible and Executable Transportation Analysis and Knowledge Management

CrossTraffic: 一个用于可重复和可执行交通分析与知识管理的开源框架

Rei Tamaru, Bin Ran

专题命中 工具调用 :planning(abstract)

AI总结 本文提出CrossTraffic开源框架,通过标准化接口实现交通方法的可部署和可验证软件基础设施,结合知识图谱和对话接口提升分析精度与协作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏