arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-30 至 2026-06-30 共收录 19 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 19 篇

2606.30464 2026-06-30 cond-mat.str-el cond-mat.dis-nn physics.comp-ph 92%

NQS-Agent: Health-Aware Agentic Hyperparameter Optimization for Neural-Network Quantum States

NQS-Agent: 面向神经网络量子态的健康感知智能超参数优化

Jia-Qi Wang, Xiao-Qi Han, Ze-Feng Gao, Rong-Qiang He, Zhong-Yi Lu

专题命中 工具调用 :agent(title,title_cn);agentic(title);workflow(abstract)

AI总结 提出NQS-Agent框架,通过监测能量轨迹、检测破坏性事件、调整学习率并恢复优化,实现健康感知超参数优化,在J1-J2模型上提升精度并发现新架构。

Comments 11 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28733 2026-06-30 cs.AI 91%

Agentic Abstention: Do Agents Know When to Stop Instead of Act?

Agentic Abstention: 智能体知道何时停止而非行动吗?

Han Luo, Bingbing Wen, Lucy Lu Wang

机构 * University of Leeds(利兹大学) Southwest Jiaotong University(西南交通大学) University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院)

专题命中 工具调用 :agentic(title,title_cn);agent(abstract);分类 cs.AI

AI总结 研究LLM智能体在不确定环境下何时应停止行动的问题,提出Agentic Abstention概念,通过实验分析不同模型和框架的弃权行为,并引入CONVOLVE方法提升及时弃权率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00835 2026-06-30 cs.CL 90%

Agentic Tool Use in Large Language Models

大语言模型中的代理工具使用

Jinchao Hu, Meizhi Zhong, Kehai Chen, Xuefeng Bai, Min Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院)

专题命中 工具调用 :tool use(title,abstract);agentic(title,abstract);autonomous agent(abstract);tool-use(abstract)

AI总结 本文系统梳理了大语言模型中代理工具使用的三种范式,分析了其方法、优缺点及评估现状,旨在解决现有研究碎片化问题,提供更系统的进化视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28679 2026-06-30 cs.CR cs.AI 87%

Capability Gates Are Not Authorization: Confused-Deputy Failures in LLM Agent Frameworks

能力门控并非授权:LLM 代理框架中的混淆代理失败

David Mellafe Zuvic

机构 * Independent Security Research(独立安全研究)

专题命中 工具调用 :agent(title,summary_cn);分类 cs.AI

AI总结 本文审计了 LangChain、LlamaIndex 和 Stripe Agent Toolkit 等框架,发现它们默认仅提供能力门控而非每次调用的值授权,导致混淆代理漏洞。作者提出 ScopeGate,一个五阶段授权框架,实验证明其能有效阻止未经授权的操作。

Comments 7 pages, 3 figures, 3 tables. Artifact: https://github.com/raceksd-source/scopegate-runtime (run_proof.sh)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30251 2026-06-30 cs.MA 86%

TACO: Tool-Augmented Credit Optimization for Agentic Tool Use

TACO:面向智能体工具使用的工具增强信用优化

Mingkuan Feng, Jinyang Wu, Hao Gu, Fangrui Lv, Ruihan Jin, Chuyuan Zhang, Zhengqi Wen, Jianhua Tao

专题命中 工具调用 :agentic(title,abstract);tool use(title)

AI总结 提出TACO方法,通过差分答案探针奖励和结果门控优势路由,为代码工具智能体提供无监督工具贡献信用分配,提升多模态问答准确性并减少冗余工具调用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29746 2026-06-30 cs.AI cs.HC 85%

DEEPMED Search: An Open-Source Agentic Platform for Medical Deep Research with Introspective Verification

DEEPMED Search: 一个具有内省验证功能的开源医学深度研究智能体平台

Maolin Liu, Fanyu Xu, Ruoqing Xu, Jiahang Zhang, Hao Wang, Rui Wang

机构 * School of Computer Science and Software Engineering, Shanghai University(上海大学计算机科学与软件工程学院) Department of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出一个开源智能体平台DEEPMED Search,通过源自适应路由和内省验证模块,自动分解复杂医学查询并生成结构化报告,解决异构医疗数据检索中的推理漂移问题。

Comments 5 pages, 2 figures, 2 tables. Accepted to IJCAI-ECAI 2026 Demo Track. Project website: https://www.deepmedsearch.cloud. Demo video: https://youtu.be/4U4aok8yLpk

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27996 2026-06-30 cs.AI cs.GR cs.HC 83%

Exploring LLM Agent Designs and Interaction Modalities for Scientific Visualization

探索LLM代理在科学可视化中的交互范式

Jackson Vonderhorst, Kuangshi Ai, Haichao Miao, Shusen Liu, Chaoli Wang

机构 * Univ. Notre Dame(诺特难大学) LLNL(劳伦斯利弗莫尔国家实验室)

专题命中 工具调用 :agent(title,abstract);tool use(abstract);分类 cs.AI

AI总结 本文研究不同类型的LLM代理在科学可视化任务中的表现,通过评估八种代表性代理在15个基准任务中的可视化质量、效率、鲁棒性和计算成本,发现通用编程代理任务成功率最高但计算成本高,领域专用代理更高效稳定但灵活性差,计算机使用代理在单步任务表现良好但多步流程受限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28566 2026-06-30 cs.IR 82%

R$^2$-Searcher: Calibrating Retrieval and Reasoning Boundaries for Agentic Search

R$^2$-Searcher:校准智能搜索中的检索与推理边界

Sheng Zhang, Junyi Li, Wenlin Zhang, Xiaowei Qian, Yichao Wang, Yingyi Zhang, Maolin Wang, Yong Liu, Xiangyu Zhao

专题命中 工具调用 :agentic(title,abstract);agent(abstract)

AI总结 提出R$^2$-Searcher框架,通过细粒度查询令牌引导的证据建模和检索后反思,校准检索与推理边界,在多跳问答基准上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30632 2026-06-30 cs.RO cs.AI cs.CV 79%

GROW$^2$: Grounding Which and Where for Robot Tool Use

GROW$^2$:为机器人工具使用确定哪个物体和哪个部位

Yuhong Deng, Yuyao Liu, David Hsu

机构 * National University of Singapore(新加坡国立大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 工具调用 :tool use(title,abstract);分类 cs.AI

AI总结 提出GROW$^2$方法,通过分层语义和几何接地实现开放世界工具选择与部位定位,在零样本泛化中优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29863 2026-06-30 cs.CL 79%

KbSD: Knowledge Boundary aware Self-Distillation for Behavioral Calibration in Agentic Search

KbSD: 面向智能体搜索中行为校准的知识边界感知自蒸馏

Tao Feng, Xinke Jiang, Chao Wu

机构 * Zhejiang University(浙江大学) Peking University(北京大学)

专题命中 工具调用 :agentic(title,abstract);分类 cs.CL

AI总结 针对智能体搜索中知识边界校准的奖励稀疏问题,提出KbSD框架,通过密集令牌级监督、稀疏结果奖励和象限自适应优化,利用提示增强教师模型生成校准推理演示,显著提升任务准确率并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16733 2026-06-30 cs.AI 79%

Monte Carlo Query Search: Active Capability Assessment of AI Agents

蒙特卡罗查询搜索:人工智能代理的主动能力评估

Daniel Bramblett, Rushang Karia, Adrian Ciotinga, Pulkit Verma, YooJung Choi, Siddharth Srivastava

机构 * Arizona State University(亚利桑那州立大学) Indian Institute of Technology Madras(印度理工学院马德拉斯分校)

专题命中 工具调用 :AI agent(title);agent(abstract);分类 cs.AI

AI总结 本文提出蒙特卡罗查询合成方法,用于学习黑盒AI系统的符号随机能力模型,通过主动学习策略加速能力评估,实验表明该方法在多个系统中更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30531 2026-06-30 cs.AI 77%

Entity Binding Failures in Tool-Augmented Agents

工具增强型代理中的实体绑定失败

Rahul Suresh Babu, Shashank Indukuri

专题命中 工具调用 :agent(abstract);tool use(abstract);tool-use(abstract);分类 cs.AI

AI总结 研究工具增强型语言模型代理中实体绑定失败问题,提出实体感知执行机制,实验表明该方法可消除错误实体操作但可能降低任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29823 2026-06-30 cs.DB cs.AI cs.MA 70%

Experience Graphs: The Data Foundation for Self-Improving Agents

经验图:自我改进智能体的数据基础

Gang Liao, Yujia He, Abdullah Ozturk, Zhouyang Li, Ying Wang, Zhitong Guo, Hongsen Qin, Yaobin Qin, Tao Yang, Zewei Jiang, Dianshi Li, Jort Gemmeke, Jiangyuan Li, Liyuan Li, Nathan Yan, Masha Basmanova, Uladzimir Pashkevich, Matt Steiner, Pedro Pedreira, Rob Fergus, Anirudh Goyal, Carole-Jean Wu, Gaoxiang Liu, Andrew Witten, Daniel J. Abadi

机构 * Meta Platforms(Meta平台) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出Trellis系统,将智能体探索过程产生的经验图作为一等数据库状态,通过查询、重用和物化视图支持跨会话复用和训练数据提取,在Meta的KernelEvolve中实现10倍加速和52%更低token成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29459 2026-06-30 cs.LG cond-mat.mtrl-sci cs.AI cs.CL 67%

Interpretable Inverse Design of Metal-Organic Frameworks with Large Language Model Agents

可解释的金属有机框架逆向设计:基于大语言模型智能体

Kyungmin Nam, Seunghee Han, Jihan Kim

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出LLM4MOF框架,利用大语言模型智能体通过化学推理、候选MOF构建和模拟测试的闭环迭代,实现可解释的逆向设计,在六项任务中高效搜索高性能结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00994 2026-06-30 cs.CL cs.AI 62%

Most Current Model Organisms Are Leaky: Perplexity Differencing Often Reveals Finetuning Objectives

模型生物体是泄漏的:困惑度差分经常揭示微调目标

Mohammed Abu Baker, Luca Baroni, Dan Wilhelm

机构 * Meridian Visiting Researcher Programme(Meridian 访问研究员计划)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出通过困惑度差分方法揭示模型生物体的微调目标,无需模型内部信息或先验假设,适用于多种微调模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26815 2026-06-30 cs.CL cs.AI cs.IR 62%

Sustainable Hybrid Document-Routed Retrieval for Financial RAG: Resolving the Robustness-Precision Trade-off

通过混合文档路由检索解决金融RAG中的鲁棒性与精度权衡

Zhiyuan Cheng, Longying Lai, Yue Liu

机构 * organization= School of Engineering, Stanford University , city= Stanford , state= CA , country= USA organization= Simon Business School, University of Rochester , city= Rochester , state= NY , country= USA organization= Accounting \& Information Systems, Rutgers University , city= Newark , state= NJ , country= USA

专题命中 工具调用 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出混合文档路由检索方法,通过结合语义文件路由与分块检索,解决金融文档问答中鲁棒性与精度的权衡问题,提升检索性能。

Comments 26 pages, 4 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29544 2026-06-30 cs.SD cs.AI 57%

Proteus: Automated Adversarial Robustness Testing for Audio Deepfake Detectors

Proteus: 音频深度伪造检测器的自动化对抗鲁棒性测试

Nicolas M. Müller, Aditya Tirumala Bukkapatnam, Zohaib Ahmed

机构 * Resemble AI

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出Proteus框架,通过搜索日常音频变换组合(如编解码、噪声等)自动发现欺骗深度伪造检测器的对抗样本,并利用BFS和Q-learning两种策略优化攻击链,以提升检测器鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09038 2026-06-30 cs.AI 57%

SearchSkill: Teaching LLMs to Use Search Tools with Evolving Skill Banks

SearchSkill: 教授大语言模型使用搜索工具与演进技能库

Jinchao Hu, Meizhi Zhong, Kehai Chen, Min Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区计算机科学与技术学院) TikTok Inc, Beijing(字节跳动北京公司)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 SearchSkill通过可重用的搜索技能显式规划查询,提升开放域问答中的检索效率和推理质量,改进了知识密集型问答基准的精确匹配表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29875 2026-06-30 cs.RO 50%

AUSLUN: A Fixed-Hover UAV--USV System for GNSS-Denied Maritime Search and Navigation

AUSLUN: 一种用于GNSS拒止环境下海上搜索与导航的固定悬停无人机-无人艇系统

Siyuan Yang, Zikai Jia, Hailiang Kuang, Xiaoyu He, Qizhi Guo, Yihao Dong, Shaoming He

机构 * School of Aerospace Engineering, Beijing Institute of Technology(北京理工大学航空航天工程学院) Khalifa University Center for Autonomous Robotic Systems (KUCARS), Khalifa University(哈利法大学自主机器人系统中心(KUCARS))

专题命中 工具调用 :planning(abstract)

AI总结 提出AUSLUN系统,利用固定悬停无人机通过视觉惯性里程计和变焦吊舱扫描,结合门控递归估计器实现非合作目标定位与无人艇导航,在GNSS拒止环境下验证了搜索-导航完整流程。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏