arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-24 至 2026-07-24 共收录 10 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 10 篇

2607.20536 2026-07-24 cs.AI cs.CL cs.LG cs.MA 新提交 89%

AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use

AppWorld-UL:用于工具使用的多样化智能体-用户交互基准测试

Junzhi Chen, Harsh Trivedi, Jane Pan, Michael JQ Zhang, Tejas Srinivasan, Niranjan Balasubramanian, Ashish Sabharwal

专题命中 工具调用 :agent(title,abstract);tool-use(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究针对当前智能体-用户交互基准测试不足,引入 AppWorld-UL 基准测试,基于 AppWorld 框架及模拟应用构建多样任务,用大型语言模型模拟用户行为,评估显示其难度大,能推动回路中工具使用智能体研究。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14257 2026-07-24 cs.CL cs.AI 版本更新 84%

Student-Centered Distillation Narrows the Agentic Gap Between Small and Large LLMs

以学生为中心的蒸馏缩小了小型和大型语言模型之间的智能差距

Yuanjie Lyu, Chengyu Wang, Jun Huang, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 工具调用 :agentic(title,abstract);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 研究旨在缩小大小语言模型智能差距,提出SCoRe框架,让学生生成训练轨迹,教师纠正最早错误,经微调与短视距强化学习,提升学生解决问题能力,在12个基准测试中,70亿参数学生模型缩小了与720亿参数教师模型的性能差距

Comments Accepted to ICML 2026. The title has been changed from "From Correction to Mastery: Reinforced Distillation of Large Language Model Agents" to "Student-Centered Distillation Narrows the Agentic Gap Between Small and Large LLMs"; the camera-ready version has been uploaded

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20668 2026-07-24 cs.CL cs.AI 新提交 81%

From Agent Failures to Text Policies: What Works and What Breaks

从智能体失败到文本策略:可行与不可行之处

Jaideep Ray, Ankit Goyal

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 研究智能体中TextGrad应用问题,通过区分遵循与学习策略能力来研究。发现两者有差距,人工编写策略能提升智能体表现,而从轨迹生成的策略无法可靠超越固定提示,主要挑战是从经验中生成和选择策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10230 2026-07-24 cs.LG cs.SD eess.AS 版本更新 79%

Encode Once, Decode Never: Reusing Audio LM Internals for Efficient Temporal Localization

帧级内部工具使用用于音频语言模型中的时序定位

Joseph An, Phillip Keung, Jiaqi Wang, Orevaoghene Ahia, Noah A. Smith

专题命中 工具调用 :tool use(title,abstract);分类 cs.LG

AI总结 本文提出帧级内部工具使用方法,通过二元分类器和IHP损失提升音频语言模型的时序定位能力,实现50倍加速和鲁棒长度泛化。

Comments To appear in COLM 2026. Refer to https://github.com/inkitori/taudio/ for the codebase

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21361 2026-07-24 cs.MA 新提交 75%

FedAgentKE: Federated Semantic Knowledge Evolution for Heterogeneous Agents

FedAgentKE:异构智能体的联邦语义知识演化

Weihao Li, Jun Bai, Ziyang Song

专题命中 工具调用 :agent(abstract);tool use(abstract);workflow(abstract)

AI总结 研究异构智能体孤立运行问题,提出 FedAgentKE 框架,通过语义知识蒸馏、聚合和Adapt实现联邦语义知识演化,实验验证其在跨框架和跨任务设置下能改进智能体协作,为未来协作智能体生态系统发展提供潜力。

Comments 9 pages (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13026 2026-07-24 cs.LG cs.CR 版本更新 70%

PISmith: Reinforcement Learning-based Red Teaming for Prompt Injection Defenses

PISmith: 基于强化学习的提示注入防御红队测试

Chenlong Yin, Runpeng Geng, Yanting Wang, Jinyuan Jia

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 工具调用 :autonomous agent(abstract);agentic(abstract);分类 cs.LG

AI总结 本文提出PISmith框架,通过强化学习评估现有提示注入防御的鲁棒性,发现标准GRPO在攻击强防御时表现不佳,引入自适应熵正则化和动态优势加权以提升探索能力,实验表明最新防御仍易受适应性攻击影响。

Comments To appear in COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21459 2026-07-24 econ.GN q-fin.EC 新提交 67%

The Evolution of Digital Search: From Blue Links to Delegated Decision-Making

数字搜索的演变:从蓝色链接到委托决策

David M. Rothschild, Nicole Immorlica, Brendan Lucier, Markus Mobius, Aleksandrs Slivkins

专题命中 工具调用 :agent(abstract);agentic(abstract)

AI总结 研究数字搜索从传统模式到人工智能原生模式的转变,指出小设计选择影响重大,未来搜索发展不由算法和界面改进决定,而是取决于开放透明有竞争力的代理系统设计,揭示多领域交叉的重大挑战。

Comments 4 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19321 2026-07-24 cs.NE 版本更新 67%

Learning to Sample in Variable Neighborhood Search Algorithm for Urban Cable Routing Optimization

城市电缆路由优化的可变邻域搜索算法中的采样学习

Wei Liu, Rui Wang, Chenhui Lin, Kaiwen Li, Wenhua Li, Tao Zhang

专题命中 工具调用 :agent(abstract);multi-agent(abstract)

AI总结 针对城市电缆路由优化这一大规模双层组合优化问题,提出学习辅助可变邻域搜索(L-VNS)算法,该算法集成四个关键组件,经实验验证其相比其他方法有优越性,能有效降低建设成本,且具有有效性和鲁棒性。

Comments Accepted by Swarm and Evolutionary Computation

Journal ref Swarm and Evolutionary Computation; Volume 106, June 2026, 102432

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20430 2026-07-24 cs.CL cs.AI 新提交 62%

LLM-INSTRUCT at UZH Shared Task 2026: Constraint-Aware Retrieval and Selective Debate for Paragraph-Level Argument Mining

LLM-INSTRUCT在UZH 2026共享任务中的应用:用于段落级论证挖掘的约束感知检索和选择性辩论

Phuong Huu Vu Tran, Long Minh Vo, Son Nguyen Minh Le, Hoang Van

机构 * Vietnamese-German University(越南-德国大学) RMIT University Vietnam(皇家墨尔本理工大学越南分校) VANGIA INNOVATIONS(VANGIA创新公司)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文介绍了在UZH 2026共享任务中用于段落级论证挖掘的获胜系统LLM-INSTRUCT,通过元数据感知检索、约束解码等方法缩小决策空间,提高了准确性和提交稳健性,在官方排行榜上取得优异成绩。

Comments Accepted to the 13th Workshop on Argument Mining (ArgMining 2026) at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16059 2026-07-24 astro-ph.IM astro-ph.CO 版本更新 50%

OpenCosmo: Community Portal and Analysis Framework for Flagship Cosmological Simulations

OpenCosmo:旗舰级宇宙学模拟的社区门户与分析框架

Patrick R. Wells, Michael Buelhmann, Patricia Larsen, William M. Hicks, Manpreet Dhillon, Idunnuoluwa A. Adeniji, Katrin Heitmann, Salman Habib, Benoit Côté, Thomas Uram, Gideon McFarland, Andrew Hearin, Ezar Shinabro, Michael E. Papka

专题命中 工具调用 :agent(abstract)

AI总结 OpenCosmo项目旨在为大型宇宙学模拟数据集提供灵活访问和分析模式,通过网络数据门户和分析库,结合现有设施支持多层次交互,基于Globus Compute的架构可扩展,助力宇宙学数据共享与计算结合。

Comments 18 pages, 6 figures. To be submitted

详情

展开后加载摘要…

URL PDF HTML 收藏