arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 5039 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5039 篇

2603.28716 2026-05-26 cs.AI 79%

Dynamic Dual-Granularity Skill Bank for Agentic RL

动态双粒度技能库用于智能体强化学习

Songjun Tu, Chengdong Xu, Qichao Zhang, Yaocheng Zhang, Xiangyuan Lan, Linjing Li, Dong Li, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Pengcheng Laboratory(鹏城实验室) Sun Yat-Sen University(中山大学) MemoraX AI

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 提出D2Skill,一种动态双粒度技能库,通过任务技能和步骤技能分别提供高层指导和细粒度决策支持,利用配对基线回放和技能注入回放的性能差距更新技能和优化策略,在ALFWorld等任务上显著提升性能。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24539 2026-05-26 cs.AI 79%

DemoEvolve: Overcoming Sparse Feedback in Agentic Harness Evolution with Demonstrations

DemoEvolve:利用演示克服智能体框架演化中的稀疏反馈

Lirong Che, Yuzhe yang, Peiwen lin, Chuang wang, Xueqian wang, Jian su

机构 * Tsinghua University(清华大学) AgiBot

专题命中 工具调用 :agentic(title);agent(abstract);分类 cs.AI

AI总结 提出DemoEvolve方法,通过人类演示引导框架演化,解决长时域随机环境中自生成轨迹因稀疏反馈和高方差导致的脆弱性问题,在Liar's Dice和Balatro任务中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23951 2026-05-26 cs.AI cs.LO cs.MA 79%

Methods for Formal Verification of Agent Skills: Three Layers Toward a Mechanically Checkable Capability-Containment Proof

智能体技能形式化验证方法:面向可机械检查的能力包含证明的三层架构

Alfredo Metere

机构 * Metere Consulting, LLC(梅特尔咨询公司)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 本文提出三层可组合方法(静态抽象解释、精炼类型系统、SMT有界模型检测),将智能体技能从声明或测试级别提升至形式化验证级别,实现机械可检查的能力包含证明。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13473 2026-05-25 cs.AI 79%

NeuroWeaver: An Autonomous Evolutionary Agent for Exploring the Programmatic Space of EEG Analysis Pipelines

NeuroWeaver:一种用于探索EEG分析流水线程序空间的自主进化智能体

Guoan Wang, Shihao Yang, Jun-En Ding, Feng Liu

机构 * Department of Systems Engineering, Stevens Institute of Technology(系统工程系,斯蒂文斯理工学院)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 针对EEG分析中基础模型计算成本高和通用自动机器学习缺乏神经科学先验的问题,提出NeuroWeaver自主进化智能体,通过领域信息子空间初始化和多目标进化优化,在五个异构基准上合成轻量级解决方案,性能优于现有任务特定方法并接近大规模基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13989 2026-05-22 cs.CL 79%

VectraYX-Nano: A 42M-Parameter Spanish Cybersecurity Language Model with Curriculum Learning and Native Tool Use

VectraYX-Nano: 一个具有课程学习和原生工具使用的4200万参数西班牙语网络安全语言模型

Juan S. Santillana

机构 * Globant

专题命中 工具调用 :tool use(title);tool-use(abstract);分类 cs.CL

AI总结 本文提出了一种基于西班牙语的网络安全语言模型VectraYX-Nano,通过课程学习和原生工具调用,展示了在网络安全领域的应用与改进。

Comments 24 pages, 5 figures, 12 tables. v3: post-Chinchilla compute ablation (v8-v15), Globant affiliation finalized, EMNLP Findings 2026 submission. Released model: VectraYX-Nano v7 (42M params, GGUF Q4 ~20 MB, native MCP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22080 2026-05-21 cs.AI 79%

Sound Agentic Science Requires Adversarial Experiments

声音代理科学需要对抗性实验

Dionizije Fa, Marko Culjak

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 该研究探讨了代理辅助科学中对抗性实验的重要性,指出传统方法在科学发现中的局限性,并提出应以证伪优先的标准来评估代理生成的科学主张。

Comments Published at ICLR 2026 Workshop on Agents in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18652 2026-05-19 cs.CR cs.AI 79%

From Craft to Kernel: A Governance-First Execution Architecture and Semantic ISA for Agentic Computers

从手工到内核:一种以治理为导向的执行架构和语义ISA用于代理计算机

Xiangyu Wen, Yuang Zhao, Xiaoyu Xu, Lingjun Chen, Changran Xu, Shu Chi, Jianrong Ding, Zeju Li, Haomin Li, Li Jiang, Fangxin Liu, Qiang Xu

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出了一种以治理为导向的执行架构和语义指令集架构(ISA),旨在解决代理计算机中AI从脆弱原型到生产系统的过渡问题,通过引入概率处理单元和确定性神经符号内核,提升系统的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07364 2026-05-19 cs.LG 79%

FlightSense: An End-to-End MLOps Platform for Real-Time Flight Delay Prediction via Rotation-Chain Propagation Features and Agentic Conversational AI

FlightSense: 一个端到端的MLOps平台,通过旋转链传播特征和代理对话式AI实现实时航班延误预测

Aditi J. Shelke, Renuka J. Shelke, Yash M. Kamerkar, Nitin P. Hazarani

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Axtria Inc.(Axtria公司) Meta

专题命中 工具调用 :agentic(title);tool-use(abstract);分类 cs.LG

AI总结 本文提出FlightSense平台,通过旋转链传播特征和对话式AI实现实时航班延误预测,采用三级特征工程框架提升预测性能,最终达到AUC 0.879。

Comments 12 pages, 5 figures, 9 tables; machine learning, MLOps, aviation delay prediction

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16079 2026-05-18 cs.CV cs.AI cs.HC 79%

VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation

VideoSeeker:通过原生代理工具调用激励实例级视频理解

Yiming Zhao, Yu Zeng, Wenxuan Huang, Zhen Fang, Qing Miao, Qisheng Su, Jiawei Zhao, Jiayin Cai, Lin Chen, Zehui Chen, Yukun Qi, Yao Hu, Xiaolong Jiang, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Xiaohongshu Inc.(小红书公司) East China Normal University(华东师范大学) Xi’an Jiaotong University(西安交通大学)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 VideoSeeker通过整合代理推理与实例级视频理解任务,提升视频理解精度,实验表明其在实例级任务中比基线模型提升13.7%,超越GPT-4o和Gemini-2.5-Pro。

Comments Project Page: https://gaotiexinqu.github.io/VideoSeeker/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06651 2026-05-14 cs.AI 79%

AI co-mathematician: Accelerating mathematicians with agentic AI

AI协同数学家:用智能体AI加速数学家

Daniel Zheng, Ingrid von Glehn, Yori Zwols, Iuliya Beloshapka, Lars Buesing, Daniel M. Roy, Martin Wattenberg, Bogdan Georgiev, Tatiana Schmidt, Andrew Cowie, Fernanda Viegas, Dimitri Kanevsky, Vineet Kahlon, Hartmut Maennel, Sophia Alj, George Holland, Alex Davies, Pushmeet Kohli

机构 * Google(谷歌)

专题命中 工具调用 :agentic(title);AI agent(abstract);分类 cs.AI

AI总结 本文提出AI协同数学家,一种帮助数学家利用AI代理进行开放性研究的工具。系统提供完整支持,涵盖数学工作流程的探索和迭代,包括构思、文献检索、计算探索、定理证明和理论构建,并在难题解决基准中取得新高成绩。

Comments 23 pages; several citations added

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11868 2026-05-13 cs.CR cs.AI 79%

IPI-proxy: An Intercepting Proxy for Red-Teaming Web-Browsing AI Agents Against Indirect Prompt Injection

IPI-proxy:一种用于对抗间接提示注入的拦截代理

Chia-Pei, Chen, Kentaroh Toyoda, Anita Lai, Alex Leung

机构 * Vulcan Research, AIFT(火山研究,AIFT)

专题命中 工具调用 :AI agent(title,abstract);分类 cs.AI

AI总结 本文提出IPI-proxy,一种开源工具,用于针对间接提示注入攻击的网络浏览AI代理进行红队测试。通过拦截代理重写白名单域的HTTP响应,嵌入攻击负载,支持多种嵌入技术与插入点,实现参数扫描评估。

Comments code: https://github.com/VulcanLab/IPI-Proxy/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11039 2026-05-13 cs.CR cs.AI 79%

The Granularity Mismatch in Agent Security: Argument-Level Provenance Solves Enforcement and Isolates the LLM Reasoning Bottleneck

代理安全中的粒度不匹配:论证层面的溯源解决了执行问题并隔离了LLM推理瓶颈

Linfeng Fan, Ziwei Li, Yuan Tian, Yichen Wang, Rongsheng Li, Xiong Wang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 学院) King Abdullah University of Science and Technology(国王 Abdullah 科学技术大学) Dongbei University of Finance and Economics(东北财经大学) University of Science and Technology of China(中国科学技术大学)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 本文提出PACT框架,通过论证层面的溯源解决代理安全中的粒度不匹配问题,隔离LLM推理瓶颈,提升安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08563 2026-05-12 cs.AI 79%

Why Retrying Fails: Context Contamination in LLM Agent Pipelines

为何重试失效:LLM代理流水线中的上下文污染

Zhanfu Yang

机构 * Department of Computer Science, Rutgers University(罗格斯大学计算机科学系)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 本文研究LLM代理在多步骤工具增强任务中重试失败的上下文污染问题,提出上下文污染重试模型(CCRM),推导了五个核心结果,包括成功概率公式、重试开销定理、预算分配定理等,并通过实验证明模型的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18700 2026-05-11 cs.AI 79%

TEA-Bench: A Systematic Benchmarking of Tool-enhanced Emotional Support Dialogue Agent

TEA-Bench: 一种工具增强情感支持对话代理的系统性基准测试

Xingyu Sui, Yanyan Zhao, Yulin Hu, Jiahe Guo, Weixiang Zhao, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 工具调用 :agent(title);tool use(abstract);分类 cs.AI

AI总结 本文提出TEA-Bench,首个评估工具增强情感支持对话代理的交互式基准,通过真实情感场景和工具环境评估情感支持质量和事实性。实验表明工具增强提升情感支持质量并减少幻觉,但效果依赖模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05878 2026-05-08 cs.AI 79%

Agentic, Context-Aware Risk Intelligence in the Internet of Value

价值互联网中的代理、情境感知风险智能

Basel Magableh, OmniRisk Research

机构 * School of Computer Science, Technological University Dublin(技术大学都柏林计算机科学学院) Rayachain Lab(雷亚链实验室)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出价值互联网中基于五种引擎的风险智能架构,通过实验验证其可行性,并正式陈述验证性分析。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05411 2026-05-08 cs.RO cs.AI 79%

Creative Robot Tool Use by Counterfactual Reasoning

通过反事实推理实现创意机器人工具使用

M. Tuluhan Akbulut, Varun Satheesh, Ahmed Jaafar, Alper Ahmetoglu, Shane Parr, Aditya Ganeshan, Shivam Vats, George Konidaris

机构 * Brown University(布朗大学)

专题命中 工具调用 :tool use(title,abstract);分类 cs.AI

AI总结 本文提出一种因果推理框架,用于识别超出其主要目标的合适工具。通过动态模型模拟实验发现工具与任务的因果关系,并通过几何和物理特征扰动生成反事实工具,实现更可靠的工具选择和更强的技能关键点迁移。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00136 2026-05-04 cs.AI 79%

Are Tools All We Need? Unveiling the Tool-Use Tax in LLM Agents

工具是否足够?揭示LLM代理中的工具使用税

Kaituo Zhang, Zhen Xiong, Mingyu Zhong, Zhimeng Jiang, Zhouyuan Yuan, Zhecheng Li, Ying Lin

机构 * University of Houston(休斯顿大学) University of Southern California(南加州大学) New York University(纽约大学) Texas A&M University(德克萨斯农工大学) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 工具调用 :tool-use(title,abstract);分类 cs.AI

AI总结 本文研究了工具增强推理在LLM代理中的有效性,发现语义干扰下工具性能可能下降,提出Factorized Intervention Framework分析工具使用成本,并引入G-STEP缓解协议误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27753 2026-05-01 cs.AI cs.ET cs.MA 79%

Autonomous Traffic Signal Optimization Using Digital Twin and Agentic AI for Real-Time Decision-Making

基于数字孪生和群体智能AI的自主交通信号优化

Salman Jan, Toqeer Ali Syed, Shahid Kamal, Qamar Wali, Ali Akarma

机构 * Center for Advanced Analytics, CoE for Artificial Intelligence, Faculty of Computing and Informatics, Multimedia University, Cyberjaya, Malaysia(先进分析中心、人工智能学院、计算与信息学院,多媒体大学,吉宝市,马来西亚) Faculty of Computer Studies, Arab Open University-Bahrain, A’Ali, Bahrain(计算机研究学院,阿拉伯开放大学-巴林,阿利,巴林) Faculty of Computer and Information System, Islamic University of Madinah, Madinah, Saudi Arabia(计算机与信息系统学院,麦地那伊斯兰大学,麦地那,沙特阿拉伯) Faculty of Computer Studies, Multimedia University, Cyberjaya, Malaysia(计算机研究学院,多媒体大学,吉宝市,马来西亚)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出一种基于数字孪生和群体智能AI的交通信号优化框架,通过实时感知和决策提升交通效率,优于固定时间与强化学习基线。

Comments This paper is submitted to MECON2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17617 2026-04-30 cs.IR cs.CL 79%

Agentic Search in the Wild: Intents and Trajectory Dynamics from 14M+ Real Search Requests

野外代理搜索:从1400万次真实搜索请求中获取意图和轨迹动态

Jingjie Ning, João Coelho, Yibo Kong, Yunfan Long, Bruno Martins, João Magalhães, Jamie Callan, Chenyan Xiong

机构 * Carnegie Mellon University Pittsburgh PA US INESC-ID, Carnegie Mellon University Pittsburgh PA US INESC-ID, Instituto Superior T\'ecnico, University of Lisbon Lisbon Portugal NOVA LINCS\ University Lisbon Caparica Portugal Carnegie Mellon University INESC-ID, Carnegie Mellon University INESC-ID, Instituto Superior T\'ecnico, University of Lisbon NOVA LINCS\ University Lisbon

专题命中 工具调用 :agentic(title,abstract);分类 cs.CL

AI总结 本文分析了1400万次真实搜索请求,揭示了代理搜索会话中的行为模式,包括步骤数、时间间隔及查询重构的可追溯性,为重复敏感停止和意图适应检索预算提供信号。

Comments Accepted at SIGIR 2026. DOI: 10.1145/3805712.3809627

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14703 2026-04-30 cs.AI 79%

ToolPRM: Fine-Grained Inference Scaling of Structured Outputs for Function Calling

ToolPRM:用于函数调用的结构化输出细粒度推理扩展

Jianghao Lin, Yuanyuan Shi, Xin Peng, Renjie Ding, Hairui Wang, Yuxuan Peng, Bizhe Bai, Weixi Song, Fengshuo Bai, Huacan Chai, Weinan Zhang, Fei Huang, Ying Wen

机构 * Shanghai Jiao Tong University(上海交通大学) Longshine AI Research(长 Shine 人工智能研究院) Shanghai Innovation Institute(上海创新研究院)

专题命中 工具调用 :function calling(title,abstract);分类 cs.AI

AI总结 本文提出ToolPRM框架,结合细粒度束搜索与过程奖励模型,提升结构化输出的推理扩展能力,并通过细粒度监督数据集改进函数调用性能。

Comments ACL 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04751 2026-04-28 cs.AI 79%

Evaluating the Search Agent in a Parallel World

在平行世界中评估搜索代理

Jiawei Chen, Xintian Shen, Lihao Zheng, Lifu Mu, Haoyi Sun, Ning Mao, Hao Ma, Tao Wei, Pan Zhou, Kun Zhan

机构 * Li Auto

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 本文提出Mind-ParaWorld框架,通过生成未来场景和不可侵犯的原子事实,解决传统搜索代理评估中的基准构建、动态过时和证据判断难题。

Comments https://github.com/TIMMY-CHAN/Mind-ParaWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18874 2026-04-22 cs.AI 79%

How Adversarial Environments Mislead Agentic AI?

对抗性环境如何误导代理AI?

Zhonghao Zhan, Huichi Zhou, Zhenhao Li, Peiyuan Jing, Krinos Li, Hamed Haddadi

机构 * Imperial College London(伦敦帝国学院)

专题命中 工具调用 :agentic(title);agent(abstract);分类 cs.AI

AI总结 研究指出代理AI在依赖外部工具时存在信任缺口,提出对抗性环境注入威胁模型,通过POTEMKIN协议测试发现,对抗性攻击导致代理在知识和导航鲁棒性上存在差异。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18718 2026-04-22 cs.CR cs.AI 79%

Towards Optimal Agentic Architectures for Offensive Security Tasks

迈向进攻性安全任务的最优代理架构

Isaac David, Arthur Gervais

机构 * University College London(伦敦大学学院)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 本文通过控制基准测试评估不同代理架构在进攻性安全任务中的性能,发现白盒模式和Web目标在检测效率上显著优于黑盒模式和二进制目标,且更广泛的协调能提升覆盖范围但需权衡成本与验证难度。

Comments 18 pages, 4 figures, supplementary appendix and benchmark artifacts

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18364 2026-04-21 cs.AI cs.GR cs.MA 79%

Training and Agentic Inference Strategies for LLM-based Manim Animation Generation

基于LLM的Manim动画生成的训练与代理推理策略

Ravidu Suien Rammuni Silva, Ahmad Lotfi, Isibor Kennedy Ihianle, Golnaz Shahtahmassebi, Jordan J. Bird

机构 * Department of Computer Science, Nottingham Trent University, Nottingham, United Kingdom(计算机科学系,诺丁汉特伦特大学,诺丁汉,英国)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出ManimTrainer和ManimAgent,结合监督微调与强化学习,提升文本到代码到视频的转换性能,通过ManimBench评估17种模型,结果显示GRPO和RITL-DOC策略显著提升动画生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17111 2026-04-21 cs.DC cs.AI 79%

HiveMind: OS-Inspired Scheduling for Concurrent LLM Agent Workloads

HiveMind: 为并发LLM代理工作负载提供操作系统启发的调度

Justice Owusu Agyemang, Jerry John Kponyo, Obed Kwasi Somuah, Elliot Amponsah, Godfred Manu Addo Boakye, Kwame Opuni-Boachie Obour Agyekum

机构 * Sperix Labs(Sperix实验室) VIA Cybersecurity Lab(VIA网络安全实验室) KNUST(科罗纳大学) Quantum and Assistive Technologies Lab(量子与辅助技术实验室)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 HiveMind通过引入五个操作系统启发的调度原语,解决并发LLM代理在共享API端点时的资源竞争问题,显著降低失败率并减少浪费计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15709 2026-04-20 cs.AI 79%

Bilevel Optimization of Agent Skills via Monte Carlo Tree Search

通过蒙特卡洛树搜索优化代理技能

Chenyi Huang, Haoting Zhang, Jingxu Xu, Zeyu Zheng, Yunduan Lin

机构 * Department of Mathematics(数学系) National University of Singapore(国立新加坡大学) Department of Industrial Engineering and Operations Research(工业工程与运营管理系) University of California at Berkeley(加州大学伯克利分校) Department of Decision, Operation and Technology(决策、运营与技术系) The Chinese University of Hong Kong(香港中文大学)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 本文提出通过蒙特卡洛树搜索优化代理技能的双层优化框架,提升任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15186 2026-04-17 cs.DC cs.AI 79%

Scepsy: Serving Agentic Workflows Using Aggregate LLM Pipelines

Scepsy:利用聚合LLM管道服务代理工作流

Marcel Wagenländer, Otto White, Britannio Jarrett, Pedro Silvestre, Yanda Tao, Guo Li, Huanzhou Zhu, Llúis Vilanova, Peter Pietzuch

机构 * Imperial College London(伦敦帝国学院)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 Scepsy通过聚合LLM管道高效调度多LLM代理工作流,实现高吞吐量和低延迟,相比独立优化或用户指定分配的系统,吞吐量提升2.4倍,延迟降低27倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13115 2026-04-16 cs.CL cs.IR 79%

Agentic Conversational Search with Contextualized Reasoning via Reinforcement Learning

基于强化学习的上下文化推理对话搜索代理

Fengran Mo, Yifan Gao, Sha Li, Hansi Zeng, Xin Liu, Zhaoxuan Tan, Xian Li, Jianshu Chen, Dakuo Wang, Meng Jiang

机构 * University of Montreal(蒙特利尔大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Notre Dame(诺特丹大学) Northeastern University(东北大学)

专题命中 工具调用 :agentic(title);agent(abstract);分类 cs.CL

AI总结 本文提出一种基于强化学习的对话搜索代理,通过在对话轮次中交替搜索与推理,实现探索性与适应性行为,优于现有基准方法。

Comments Accepted by ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12762 2026-04-15 cs.CV cs.AI cs.MA 79%

ARGOS: Who, Where, and When in Agentic Multi-Camera Person Search

ARGOS:智能多摄像机人像搜索中的谁、哪里和何时

Myungchul Kim, Kwanyong Park, Junmo Kim, In So Kweon

机构 * KAIST(韩国科学技术院) University of Seoul(首尔大学) KIST(韩国科学技术院)

专题命中 工具调用 :agentic(title);agent(abstract);分类 cs.AI

AI总结 ARGOS首次将多摄像机人像搜索转化为交互推理问题,通过智能体在信息不对称下规划、提问和消除候选,包含14个真实场景的2691个任务,实验表明该基准远未解决。

Comments Accepted to CVPR 2026 Workshop on Multimodal Spatial Intelligence (MUSI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09666 2026-04-14 cs.IR cs.AI 79%

Do We Still Need GraphRAG? Benchmarking RAG and GraphRAG for Agentic Search Systems

我们仍然需要GraphRAG吗?对RAG和GraphRAG在代理搜索系统中的基准测试

Dongzhe Fan, Zheyi Xue, Siyuan Liu, Qiaoyu Tan

机构 * New York University Shanghai(上海纽约大学)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 本文通过RAGSearch基准测试,评估了代理搜索系统对密集RAG和代表性的GraphRAG方法的影响,发现代理搜索显著提升了密集RAG性能,但在复杂多跳推理中GraphRAG仍具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏