arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-17 至 2026-07-17 共收录 13 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 13 篇

2607.14145 2026-07-17 cs.AI cs.CV cs.LG 新提交 88%

ToolAnchor: Anchoring Counterfactual Context to Boost Agentic Tool-use Capability

ToolAnchor:锚定反事实上下文以提升智能体工具使用能力

Weiting Liu, Jieyi Bi, Wanqi Zhou, Jianfeng Feng, Yining Ma, Ai Han, Wenlian Lu

机构 * Fudan University(复旦大学) Nanyang Technological University(南洋理工大学) MIT(麻省理工学院)

专题命中 工具调用 :agentic(title,abstract);tool-use(title);agent(abstract);分类 cs.AI、cs.LG

AI总结 研究针对工具增强大语言模型智能体在工具集扩展时的问题,提出ToolAnchor框架,通过在关键决策点注入反事实锚定上下文打破行为惯性,经教师模型假设、学生展开验证及智能体后训练,提升其在扩展工具集下的性能,为智能体强化学习开辟新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31693 2026-07-17 cs.IR cs.AI cs.CL 版本更新 86%

ShopX: A Foundation Model for Intent-to-Item Fulfillment in Agentic Shopping

ShopX:面向智能购物中意图到商品实现的基础模型

Jiacheng Chen, Tao Zhang, Manxi Lin, Dunxian Huang, Teng Shi, Honghao Fu, Mengyan Li, Xinming Zhang, Chenchi Zhang, Xuan Lu, Xiaoxiong Du, Haibin Chen, Shaolin Ye, Hao Chang, Xiaoqi Li, Shuwen Xiao, Yujin Yuan, Jingxuan Feng, Shaopan Xiong, Huimin Yi, Ju Huang, Qiu Shen, Ying Chen, Junjun Zheng, Xiangheng Kong, Dan Ou, Haihong Tang, Yuning Jiang, Bo Zheng

专题命中 工具调用 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 提出ShopX基础模型,通过统一意图理解、执行规划和基于语义ID的商品空间操作,解决大语言模型代理在购物中意图到商品实现的瓶颈,在淘宝生产日志任务上优于工具中介系统。

Comments The new version adds additional results and details

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01086 2026-07-17 cs.AI cs.CR cs.DB cs.DC cs.SE 版本更新 86%

MedBeads: An AI-Native Clinical Context Graph Built from Immutable Beads and Reconstructable Clinical Links

MedBeads:面向可信医疗AI的智能体原生不可变数据基底

Takahito Nakajima

机构 * Diagnostic Imaging and Interventional Radiology, Institute of Medicine, University of Tsukuba(东京大学医学研究院诊断影像与介入放射学部) Center for Cyber Medicine Research, University of Tsukuba(东京大学计算机医学研究中心)

专题命中 工具调用 :agent(title,abstract);AI agent(abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 针对医疗AI中电子病历与智能体间的上下文不匹配问题,提出基于Merkle有向无环图的不可变数据架构MedBeads,通过确定性图遍历替代概率检索,实现可审计、防篡改的临床上下文提供。

Comments 23 pages, 5 figures, 3 tables. Reference implementation and reproducible Docker demo available at https://github.com/medbeads/medbeads

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08877 2026-07-17 cs.AI 85%

Quantifying the Accuracy and Cost Impact of Design Decisions in Budget-Constrained Agentic LLM Search

量化预算约束下代理LLM搜索中的准确性与成本影响

Kyle McCleary, James Ghawaly

专题命中 工具调用 :agentic(title,abstract);tool use(abstract);planning(abstract);分类 cs.AI

AI总结 本研究探讨了预算约束下代理LLM搜索中搜索深度、检索策略和完成预算对准确性和成本的影响,并提供了可重复的评估方法和实验结果。

Comments Accepted in 2026 Language Resources and Evaluation Conference (LREC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15253 2026-07-17 cs.IR cs.CL 新提交 83%

Bridge Evidence: Static Retrieval Utility Does Not Predict Causal Utility in Multi-Step Agentic Search

桥梁证据:静态检索效用无法预测多步智能体搜索中的因果效用

Debayan Mukhopadhyay, Utshab Kumar Ghosh, Shubham Chatterjee

机构 * University of Calcutta(卡塔克大学) Missouri University of Science and Technology(密苏里科技大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 研究智能体检索中静态检索效用与因果效用的差异,通过在HotpotQA上用ReAct风格智能体实验,比较原始与反事实运行得CTU分数,发现两者近乎独立,约三分之一文档为桥梁文档,还确定了相关机制,指出优化静态相关性无法带来因果有用性。

Comments Preprint; extended version in preparation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03465 2026-07-17 cs.CL 版本更新 83%

The Tool Illusion: Rethinking Tool Use in Web Agents

工具幻觉:重新审视网络代理中的工具使用

Renze Lou, Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, Suman Nath, Wenpeng Yin, Jianfeng Gao

机构 * Microsoft Research, Redmond(微软研究院,雷德蒙德) The Pennsylvania State University, University Park(宾夕法尼亚州立大学,大学园)

专题命中 工具调用 :tool use(title,abstract);tool-use(abstract);分类 cs.CL

AI总结 本文通过系统研究不同工具源、基础模型和评估基准,重新审视网络代理中的工具使用,揭示工具效果的稳定性及潜在副作用,为未来研究提供更可靠的实证基础。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14155 2026-07-17 cs.SE 新提交 79%

Beyond Object Validation: Relational Conformance in Multi-Artifact Agent Releases

超越对象验证:多工件代理版本中的关系一致性

Tengjiao Liu

专题命中 工具调用 :agent(title,abstract);分类 cs.SE

AI总结 研究多工件代理版本中软件包的关系一致性问题,通过结合Schema Docs和Brand Shuttle GEO研究故障,提出候选Schema - SIP关系一致性配置文件(SIP - RC),建模版本为图,确定故障类别并证明机制可行,完整配置文件效果待实验。

Comments 10 pages, 1 figure, 5 tables. Schema Sandbox Research Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14494 2026-07-17 cs.AI cs.IR cs.LG 新提交 76%

SAGA: Schema-Aware Grounding for Agentic Text-to-SPARQL Generation

SAGA:用于智能文本到SPARQL生成的模式感知基础

Yiming Zhang, Koji Tsuda

专题命中 工具调用 :agentic(title);分类 cs.AI、cs.LG

AI总结 研究复杂知识库问答中语义解析范式,针对现有智能体类型盲基础问题,提出无训练框架SAGA,通过模式约束基础操作,维护类型状态,过滤候选属性,以紧凑格式呈现图模式,在多基准设置上取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14108 2026-07-17 cs.CL cs.AI cs.SE 新提交 75%

Eta Given Delta: Defining LLM Tool Efficiency With Marginal Tool Utility

给定增量的埃塔:用边际工具效用定义大语言模型工具效率

Nyx Iskandar

机构 * Foam(泡沫)

专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 研究提出用于评估LLM智能体轨迹中工具调用率的工具效率及边际工具效用指标,用LLM-as-a-Judge确定边际工具效用符号,区别于间接测效率的 prior work,直接测效率,为LLM评估研究及相关工程做贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14582 2026-07-17 cs.AI 新提交 70%

MathCoPilot: An Interactive System for Human-AI Symbiotic Paradigm of Mathematical Research

MathCoPilot:一种用于数学研究的人机共生范式的交互式系统

Junjie Zhang, Jiayu Liu, Wenbin Liu, Zhenya Huang, Doudou Wang, Yan Jiang, Leiye Xu, Tao Xiong, Wen Huang, Qi Liu, Guoping Hu, Enhong Chen, Mengping Zhang, Xiangdong Ye

机构 * University of Science and Technology of China(中国科学技术大学) School of Mathematical Sciences, University of Science and Technology of China(中国科学技术大学数学科学学院)

专题命中 工具调用 :AI agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 研究提出MathCoPilot这人机共生的数学研究系统,统一三项核心能力。通过它在特定子集和定理上比较四个大语言模型,发现当前模型处理本科问题成功率高,但在特定领域定理上仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14285 2026-07-17 cs.SE cs.AI 新提交 62%

ToolAlignBench: Investigating Alignment Conflicts in Tool-Calling Enabled LLMs

ToolAlignBench:研究启用工具调用的大语言模型中的对齐冲突

Aryan Keluskar, Amrita Bhattacharjee, Huan Liu

机构 * School of Computing \& AI, Arizona State University, Tempe, AZ, USA

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究受监管行业中工具调用大语言模型智能体的安全对齐冲突,构建含128个场景的基准测试,发现安全对齐开源模型有时会违背部署指令,擦除可降低举报率,揭示多元对齐矛盾,发布基准测试框架。

Comments Accepted to the Pluralistic Alignment Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14093 2026-07-17 cs.AI 新提交 57%

Intelligent Three Level Learning Architecture for Autonomous UAV Swarms in Search and Rescue

用于自主无人机群搜索和救援的智能三级学习架构

Oleksii Bychkov

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 本文针对无人机群搜索和救援提出智能三级学习架构,集成三种学习机制,通过架构契约形式化,引入群体元认知,有进展函数和主整合定理,解决了现有分层强化学习方法的五个基本限制。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09727 2026-07-17 cs.AI 版本更新 57%

Gaussian Process Aggregation for Root-Parallel Monte Carlo Tree Search with Continuous Actions

用于具有连续动作的根并行蒙特卡罗树搜索的高斯过程聚合

Junlin Xiao, Victor-Alexandru Darvariu, Bruno Lacerda, Nick Hawes

机构 * Oxford Robotics Institute, Department of Engineering Science, University of Oxford(牛津机器人研究所、工程科学系、牛津大学)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 研究连续动作空间环境中根并行蒙特卡罗树搜索的聚合问题,核心方法是用高斯过程回归获取动作值估计,经6个领域系统评估,该方法优于现有策略且推理时间增加适度。

Comments To appear in the Reinforcement Learning Journal (RLJ) and to be presented at the Third Reinforcement Learning Conference (RLC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏