arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-11 至 2026-06-11 共收录 14 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 14 篇

2606.11869 2026-06-11 cs.SE cs.AI 新提交 88%

Agents All the Way Down; A Methodology for Building Custom AI Agents from Substrate to Production

层层代理:从底层到生产构建自定义AI代理的方法论

Marc Alier Forment, Juanan Pereira, Francisco José García-Peñalvo, María José Casañ Guerrero

机构 * Universitat Politècnica de Catalunya (UPC)(西班牙巴塞罗那理工大学) Universidad del País Vasco / Euskal Herriko Unibertsitatea (UPV/EHU)(西班牙巴斯克大学)

专题命中 工具调用 :AI agent(title,abstract);agent(abstract);function calling(abstract);multi-agent(abstract)

AI总结 提出一种无框架的方法论,通过两个前提条件(将LLM作为软件组件和构建块)和三个实践(原型设计、打包为CLI、代理测试代理)来构建自定义AI代理,实现端到端开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11543 2026-06-11 cs.AI cs.SE 新提交 84%

SkillJuror: Measuring How Agent Skill Organization Changes Runtime Behavior

SkillJuror:衡量智能体技能组织如何改变运行时行为

Zhiyu Chen, Zihan Guo, Bo Huang, Bingwei Lu, Jianghao Lin, Yuanjian Zhou, Weinan Zhang

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 提出SkillJuror框架,通过渐进式披露与扁平基线对比,发现技能组织方式改变智能体搜索和应用程序知识的行为,并在82个任务中提升4.1%的验证通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11652 2026-06-11 cs.LG 新提交 83%

IAPO: Input Attribution-Aware Policy Optimization for Tool Use in Small Multimodal Agents

IAPO:面向小型多模态代理工具使用的输入归因感知策略优化

Yifan Yang, Zhen Zhang, Jiayi Tian, Liyan Tan, Zheng Zhang

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 工具调用 :tool use(title,abstract);agentic(abstract);分类 cs.LG

AI总结 提出输入归因感知策略优化(IAPO),通过强化学习对齐模型与教师模型的输入归因,提升多模态小语言模型的工具调用能力,在六个测试集上平均准确率提升3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22638 2026-06-11 cs.AI 版本更新 83%

MobilityBench: A Benchmark for Evaluating Route-Planning Agents in Real-World Mobility Scenarios

MobilityBench:用于评估真实世界移动场景中路径规划智能体的基准

Zhiheng Song, Jingshuai Zhang, Chuan Qin, Chao Wang, Chao Chen, Longfei Xu, Kaikui Liu, Xiangxiang Chu, Hengshu Zhu

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) AMAP, Alibaba Group(阿里集团AMAP) Alibaba Group(阿里集团)

专题命中 工具调用 :planning(title,abstract);tool use(abstract);分类 cs.AI

AI总结 提出MobilityBench基准,通过确定性API重放沙箱和多维评估协议,系统评估基于LLM的路径规划智能体,发现现有模型在偏好约束路径规划上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11350 2026-06-11 cs.CL cs.IR 新提交 70%

When More Documents Hurt RAG: Mitigating Vector Search Dilution with Domain-Scoped, Model-Agnostic Retrieval

当更多文档损害RAG:利用领域限定、模型无关的检索缓解向量搜索稀释

Nabaraj Subedi, Ahmed Abdelaty, Shivanand Venkanna Sheshappanavar

机构 * Dept. of Electrical Engineering & Computer Science, University of Wyoming(怀俄明大学电气工程与计算机科学系) Dept. of Civil, Architectural Engineering & Construction Management, University of Wyoming(怀俄明大学土木、建筑工程与施工管理系)

专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 针对检索增强生成在异构文档集合中因向量搜索稀释导致性能下降的问题,提出基于组织元数据的领域限定方法MASDR-RAG,显著提升P@10至0.86,并揭示多智能体编排的精度-忠实度悖论。

Comments 24 pages, 8 figures, 30 tables. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11854 2026-06-11 cs.LG cs.AI cs.CL 新提交 67%

Fine-tuning Multi-modal LLMs with ART: Art-based Reinforcement Training

使用ART微调多模态大语言模型:基于艺术的强化训练

Michal Chudoba, Sergey Alyaev, Petra Galuscakova, Tomasz Wiktorski

机构 * University of Stavanger(斯塔万格大学) NORCE Research(NORCE研究机构)

专题命中 工具调用 :tool-use(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出ART方法,通过优化原始视觉输入将信息注入冻结的多模态大语言模型,实现软提示微调,无需修改计算图,在数学和工具使用基准上达到与LoRA相当的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11522 2026-06-11 cs.AI cs.LG 新提交 62%

Search Discipline for Long-Horizon Research Agents

长周期研究智能体的搜索纪律

Adithya Srinivasan, Devesh Paragiri

机构 * North Carolina State University(北卡罗来纳州立大学) University of Maryland(马里兰大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对研究智能体使用聚合指标评估候选方案导致科学有效性反转的问题,提出一种外部审计协议,基于分解行为而非单一分数进行决策。

Comments 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11806 2026-06-11 cs.CL 新提交 57%

External Experience Serving in Production LLM Systems: A Deployment-Oriented Study of Quality-Cost Trade-offs

生产级LLM系统中的外部经验服务:面向部署的质量-成本权衡研究

Lin Sun, Heming Zhang, Xiangzheng Zhang

机构 * Qiyuan Tech(奇元科技)

专题命中 工具调用 :tool-use(abstract);分类 cs.CL

AI总结 研究生产级LLM系统中注入外部经验的质量-成本权衡,发现选择性检索优于全局注入,且检索质量比增加Top-K更重要,成本效益因任务输出长度而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11662 2026-06-11 cs.AI 新提交 57%

TreeSeeker: Tree-Structured Trial, Error, and Return in Deep Search

TreeSeeker:深度搜索中的树结构试错与回溯

Zhuofan Shi, Mingzhe Ma, Lu Wang, Fangkai Yang, Pu Zhao, Yiming Guan, Youling Huang, Wei Zhang, Qingwei Lin, Dongmei Zhang, Saravan Rajmohan

机构 * Microsoft(微软公司) East China Normal University(东华大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出TreeSeeker框架,通过树结构分支-回溯搜索和UCB信号选择,在深度搜索中实现受控试错,显著提升复杂问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07362 2026-06-11 cs.LG 版本更新 57%

Breaking the Ice: Analyzing Cold Start Latency in vLLM

打破冰层:分析 vLLM 中的冷启动延迟

Huzaifa Shaaban Kabakibo, Animesh Trivedi, Lin Wang

机构 * Anonymous Institution, Anonymous City, Anonymous Region, Anonymous Country(匿名机构,匿名城市,匿名地区,匿名国家)

专题命中 工具调用 :planning(abstract);分类 cs.LG

AI总结 本文首次系统分析 vLLM 推理引擎的冷启动延迟,将其分解为六个基础步骤,发现主要受 CPU 限制,并建立轻量级分析模型预测延迟,为大规模推理环境资源规划提供指导。

Journal ref Proceedings of the 9th MLSys Conference, Bellevue, WA, USA, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21639 2026-06-11 cs.CY cs.LG 版本更新 57%

A Multi-Modal Sensor Fusion Instrument for Measuring Regional Human Mobility: The Distributed Human Data Engine (DHDE)

多模态传感器融合仪器用于测量区域人类流动性:分布式人类数据引擎(DHDE)

Amil Khanzada, Takuji Takemoto

机构 * Headquarters for Regional Revitalization, University of Fukui, Japan(复兴地区总部,福井大学,日本)

专题命中 工具调用 :planning(abstract);分类 cs.LG

AI总结 提出分布式人类数据引擎(DHDE),通过融合边缘AI相机、数字意图信号、行为记录和气象数据,解决外围区域人类流动性测量中传感器稀疏和行为异质性问题,验证了稀疏传感器补偿方法,并发现“低活力悖论”。

Comments 32 pages, 4 figures, 3 tables. Pre-print of a manuscript submitted for peer review (v2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11216 2026-06-11 cs.CY cs.SI 新提交 50%

Great Disappearance Acts Generative Search and Shadow Banning

消失的行为:生成式搜索与影子封禁

Danny Friedmann

专题命中 工具调用 :agentic(abstract)

AI总结 本文研究生成式搜索和影子封禁对互联网开放生态的破坏,分析其法律与监管问题,并提出增强透明度与公平性的解决方案。

Journal ref 27 German Law Journal 1211 - 1234 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10150 2026-06-11 quant-ph hep-ex physics.comp-ph 版本更新 50%

Towards the implementation of a quantum classifier

迈向量子分类器的实现

Lorenzo Confalonieri

专题命中 工具调用 :tool use(abstract)

AI总结 研究量子电路作为二元分类模型,使用Qibo框架设计分类器,在MNIST和高能碰撞数据集上测试,与经典CNN比较性能。

Comments Bachelor's Thesis in Physics, Lorenzo Confalonieri, supervised by Adrián Pérez-Salinas and Stefano Carrazza, Università degli Studi di Milano (July 2021). 55 pages, 28 figures. Code implementations utilize the Qibo framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10749 2026-06-11 cs.CR 版本更新 50%

AttriGuard: Defeating Indirect Prompt Injection in LLM Agents via Causal Attribution of Tool Invocations

AttriGuard: 通过工具调用的因果归因击败LLM代理中的间接提示注入

Yu He, Haozhe Zhu, Yiming Li, Shuo Shao, Hongwei Yao, Zhihao Liu, Zhan Qin

专题命中 工具调用 :agent(abstract)

AI总结 针对LLM代理易受间接提示注入攻击的问题,提出基于并行反事实测试的运行时防御AttriGuard,通过因果归因区分用户意图驱动与不可信观察驱动的工具调用,在多个基准上实现0%攻击成功率。

Comments Accepted by USENIX Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏