arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-12 至 2026-06-12 共收录 14 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 14 篇

2606.12587 2026-06-12 cs.AI cs.HC 新提交 87%

Strategic Decision Support for AI Agents

AI智能体的战略决策支持

Shayan Kiyani, Sima Noorani, George Pappas, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 工具调用 :AI agent(title,abstract);agent(abstract);tool use(abstract);agentic(abstract)

AI总结 针对AI智能体作为主要决策者时的可靠性问题,提出通过优化问题最小化支持使用并控制反事实遗漏支持误差的战略决策支持框架,并开发在线算法自适应阈值化支持分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12924 2026-06-12 cs.AI 新提交 86%

Iterating Toward Better Search: A Two-Agent Simulation Framework for Evaluating Agentic Search Architectures in E-Commerce

迭代优化搜索:面向电子商务中智能搜索架构评估的双智能体仿真框架

Jetlir Duraj, Jayanth Yetukuri, Shuang Zhou, Dhruv Varma, Rui Kong, Ishita Khan, Qunzhi Zhou

机构 * eBay Inc.(eBay公司)

专题命中 工具调用 :agent(title,abstract);agentic(title);分类 cs.AI

AI总结 提出模块化双智能体仿真框架,通过固定买家智能体对比不同应答器设计,发现滚动窗口记忆在质量和速度上优于意图提取记忆,并基于失败分析将失败率降低62%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12586 2026-06-12 cs.CR 新提交 85%

Beyond Attack Success Rate: Examining Trigger Leakage in Vision-Language Agentic Systems

超越攻击成功率:视觉-语言智能系统中的触发器泄漏研究

Jiamin Chang, Salil Kanhere, Piotr Koniusz, Jason, Xue, Hammond Pearce

专题命中 工具调用 :agentic(title,abstract);tool use(abstract);planning(abstract)

AI总结 本文提出“触发器泄漏”概念,量化视觉-语言智能系统中后门触发器在视觉或语义相近输入下意外激活隐藏行为的风险,并引入邻域泄漏率(NLR)指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07489 2026-06-12 cs.AI econ.GN q-fin.EC 新提交 83%

How AI Agents Reshape Knowledge Work: Autonomy, Efficiency, and Scope

AI代理如何重塑知识工作:自主性、效率与范围

Jeremy Yang, Kate Zyskowski, Noah Yonack, Jerry Ma

机构 * Harvard Business School(哈佛商学院) Perplexity AI

专题命中 工具调用 :AI agent(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 基于Perplexity产品数据,研究发现AI代理通过端到端任务执行,将自主工作时间从33秒提升至26分钟,完成时间缩短87%,成本降低94%,并扩展了工作范围与认知层次。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12674 2026-06-12 cs.AI 新提交 81%

Evoflux: Inference-Time Evolution of Executable Tool Workflows for Compact Agents

Evoflux: 紧凑型智能体的可执行工具工作流的推理时演化

Kushal Raj Bhandari, Ling Yue, Ching-Yun Ko, Dhaval Patel, Shaowu Pan, Pin-Yu Chen, Jianxi Gao

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) IBM Research(IBM研究院)

专题命中 工具调用 :agent(abstract);tool use(abstract);workflow(abstract);function calling(abstract)

AI总结 提出Evoflux,一种推理时演化搜索方法,通过结构化编辑和执行反馈修复紧凑语言模型的工具工作流,将执行可行性从3%提升至17-24%,优于SFT和ReAct。

Comments Code is available at https://github.com/IBM/Evoflux

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05860 2026-06-12 cs.LG 版本更新 79%

GenAutoML: An Agentic Framework for Dynamic Architecture Generation and Optimization in Time-Series Analysis

GenAutoML: 面向时间序列分析的动态架构生成与优化的智能体框架

Oleeviya Babu Poikarayil, Cédric Schockaert, Abdulrahman Nahhas, Christian Daase, Mursal Dawodi, Jawid Ahmad Baktash

机构 * Paul Wurth S.A.(保罗·沃思公司) Otto-von-Guericke University(奥托·冯·格里克大学) Technical University of Munich(慕尼黑技术大学)

专题命中 工具调用 :agentic(title,abstract);分类 cs.LG

AI总结 提出GenAutoML框架,利用大语言模型作为神经架构师,通过沙盒反射循环和签名感知运行时自动生成并优化时间序列预测与异常检测的神经网络架构,引入动态可逆实例归一化提升非平稳条件下的鲁棒性。

Comments 26 pages, 17 figures, 12 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20755 2026-06-12 eess.AS 版本更新 75%

DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action

DuplexSLA: 一种具备同步语音、语言和动作的全双工语音语言模型

Haoyang Zhang, Jun Chen, Donghang Wu, Yuxin Li, Yuxin Zhang, Xiangyu Tony Zhang, Che Liu, Qingjian Lin, Yizhou Peng, Hexin Liu, Eng Siong Chng, Chao Yan, Boyong Wu, Yechang Huang, Xuerui Yang, Fei Tian

专题命中 工具调用 :tool use(abstract);planning(abstract);agentic(abstract)

AI总结 本研究提出DuplexSLA,一种全双工语音语言模型,通过共享160ms时间线解码助理音频和结构化动作流,实现了同步语音、语言和动作的处理,解决了现有全双工模型在对话中规划和工具调用方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13361 2026-06-12 cs.AI cs.CE cs.MA 新提交 70%

Can I Buy Your KV Cache?

我能买你的KV缓存吗?

Luoyuan Zhang

机构 * Harbin Institute of Technology, Shenzhen (HITSZ)(哈尔滨工业大学(深圳))

专题命中 工具调用 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 针对AI代理重复计算相同文档KV缓存的问题,提出由发布者预计算KV缓存,其他代理付费加载以跳过预填充,实验表明在Qwen3-4B上计算成本降低9-50倍,并设计了代理原生预填充CDN架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12737 2026-06-12 cs.CR cs.AI 新提交 70%

PI-Hunter: Automated Red-Teaming for Exposing and Localizing Prompt Injections

PI-Hunter:用于暴露和定位提示注入的自动化红队测试

Pengfei He, Lesly Miculicich, Vishesh Sharma, Ash Fox, George Lee, Jiliang Tang, Tomas Pfister, Long T. Le

机构 * Google Cloud AI Research(谷歌云人工智能研究) Google(谷歌) Michigan State University(密歇根州立大学)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出PI-Hunter自动化审计框架,通过构建源感知测试用例并迭代演化,主动暴露LLM智能体中的潜在提示注入漏洞,显著提升漏洞暴露和攻击面覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13663 2026-06-12 cs.CL 新提交 57%

HyperTool: Beyond Step-Wise Tool Calls for Tool-Augmented Agents

HyperTool:超越逐步工具调用的工具增强型智能体

Yaxin Du, Yifan Zhou, Yujie Ge, Jiajun Wang, Xianghe Pang, Shuo Tang, Tuney Zheng, Bryan Dai, Jian Yang, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) IQuest Research Beijing University of Aeronautics and Astronautics(北京航空航天大学)

专题命中 工具调用 :tool use(abstract);分类 cs.CL

AI总结 针对工具增强型LLM中逐步调用导致执行粒度不匹配的问题,提出HyperTool统一可执行接口,将确定性工具子流程折叠为单次调用,在多步工具任务上显著提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13120 2026-06-12 cs.CL 新提交 57%

EvoBrowseComp: Benchmarking Search Agents on Evolving Knowledge

EvoBrowseComp: 基于演化知识的搜索智能体基准测试

Yunhan Wang, Jiaan Wang, Lianzhe Huang, Xianfeng Zeng, Fandong Meng

机构 * Northeastern University, China(东北大学(中国)) Weixin AI, Tencent Inc, China(腾讯微信AI(中国))

专题命中 工具调用 :agent(abstract);分类 cs.CL

AI总结 提出EvoBrowseComp,一个通过实时网络遍历自动生成400道英文和400道中文无污染复杂问题的演化基准,用于评估搜索智能体在动态知识环境中的真实浏览能力。

Comments 14 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12908 2026-06-12 cs.CL 新提交 57%

SENTINEL: Failure-Driven Reinforcement Learning for Training Tool-Using Language Model Agents

SENTINEL: 用于训练工具使用语言模型智能体的失败驱动强化学习

Ziyi Wang, Yuxuan Lu, Yimeng Zhang, Qun Liu, Chen Luo, Jiri Gesi, Hanqing Lu, Yisi Sang, Manling Li, Jing Huang, Dakuo Wang

机构 * Northeastern University(东北大学) Independent Researcher(独立研究员) Northwestern University(西北大学)

专题命中 工具调用 :tool use(abstract);分类 cs.CL

AI总结 提出SENTINEL框架,通过将智能体失败转化为针对性训练任务,在Tau2-Bench Retail上提升Qwen3-4B模型Pass@1从66.4到74.9,优于通用合成任务上的强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12414 2026-06-12 cs.CY 新提交 50%

The Khipu Problem: Institutional Legibility Under Distributed Cognition

基普问题:分布式认知下的制度可读性

Krti Tallam

专题命中 工具调用 :agent(abstract)

AI总结 针对分布式AI系统认知分散导致制度可读性丧失的问题,提出“基普问题”概念,强调需要维护解释连续性而非仅保留痕迹,并建议构建治理工作空间和承载收据的治理界面作为解释基础设施。

Comments 17 pages, 2 figures, 1 table. Conceptual governance paper on institutional legibility, distributed cognition, and interpretive continuity in AI systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14210 2026-06-12 cs.RO 版本更新 50%

GLIDE: A Coordinated Aerial-Ground Framework for Search and Rescue in Unknown Environments

GLIDE:未知环境下的空地协同搜索与救援框架

Seth Farrell, Chenghao Li, Henrik I. Christensen

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 工具调用 :planning(abstract)

AI总结 提出GLIDE框架,通过两架无人机与一辆无人地面车协同,实现未知环境中的快速受害者定位和障碍物感知导航,利用角色分离和地形侦察提升救援效率。

详情

展开后加载摘要…

URL PDF HTML 收藏