arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-07 至 2026-04-07 共收录 14 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 14 篇

2604.04017 2026-04-07 cs.CL 90%

GeoBrowse: A Geolocation Benchmark for Agentic Tool Use with Expert-Annotated Reasoning Traces

GeoBrowse:一种用于代理工具使用的地理定位基准测试

Xinyu Geng, Yanjing Xiao, Yuyang Zhang, Hanwen Wang, Xinyan Liu, Rui Min, Tianqing Fang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 工具调用 :tool use(title,abstract);agentic(title,abstract);tool-use(abstract);workflow(abstract)

AI总结 GeoBrowse基准测试结合了视觉推理与知识密集型多跳查询,通过专家标注的逐步轨迹分析验证多步工具使用策略的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04604 2026-04-07 cs.CY cs.AI cs.CR cs.MA 85%

AI Agents Under EU Law

欧盟法律下的AI代理

Luca Nannini, Adam Leon Smith, Michele Joshua Maggini, Enrico Panai, Sandra Feliciano, Aleksandr Tiulkanov, Elena Maran, James Gealy, Piercosma Bisconti

机构 * Piccadilly Labs(皮卡迪利实验室) Association of AI Ethicists(人工智能伦理学家协会) Centro Singular de Investigación en Tecnoloxías Intelixentes da USC(圣地亚哥德孔波斯特拉大学智能技术卓越研究中心) AIQI Consortium(AIQI联盟) BeEthical INSIGHT – Piaget Research Center for Ecological Human Development(INSIGHT – 皮亚杰生态人类发展研究中心) Responsible Innovations(负责任创新) ForHumanity Europe(ForHumanity欧洲) Alethesis AI SaferAI DEXAI Icaro Lab(伊卡洛斯实验室)

专题命中 工具调用 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文探讨欧盟法律下AI代理的监管挑战,提出合规架构和分类体系,分析多党行动链透明度和安全问题。

Comments Working Paper - April 2026, subject to updates (EC M/613, M/606, Digital Omnibus proposals)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04220 2026-04-07 cs.AI 83%

TimeSeek: Temporal Reliability of Agentic Forecasters

TimeSeek:代理预测者的时序可靠性

Hamza Mostafa, Om Shastri, Dennis Lee

机构 * Automorphic Labs(Automorphic实验室)

专题命中 工具调用 :agentic(title,abstract);tool-use(abstract);分类 cs.AI

AI总结 TimeSeek研究代理LLM预测者在预测市场生命周期中的可靠性变化,评估10种前沿模型在150个Kalshi二元市场中的表现,发现早期和高不确定性市场表现最佳,但接近解决和强共识市场时表现下降,网页搜索提升BSS但部分情况下降低,简单两模型组合能减少误差但未超越市场整体。

Comments Workshop paper. 11 pages including references

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16383 2026-04-07 cs.AI cs.SE 81%

An Agent-Based Framework for the Automatic Validation of Mathematical Optimization Models

一个基于代理的数学优化模型自动验证框架

Alexander Zadorojniy, Segev Wasserkrug, Eitan Farchi

机构 * IBM Research(IBM研究院)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出基于代理的自动验证方法,通过生成测试API、测试用例和突变体,提升优化模型的验证质量,尤其在突变覆盖方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04847 2026-04-07 eess.AS cs.CL 79%

Full-Duplex-Bench-v3: Benchmarking Tool Use for Full-Duplex Voice Agents Under Real-World Disfluency

全双工基准v3:在现实世界不流畅条件下评估全双工语音代理的基准工具

Guan-Ting Lin, Chen Chen, Zhehuai Chen, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) NVIDIA(英伟达)

专题命中 工具调用 :tool use(title,abstract);分类 cs.CL

AI总结 本文提出全双工基准v3,用于评估在自然语音条件下和多步骤工具使用中语言模型的性能。通过六个模型配置评估准确性、延迟和轮流交流维度,发现GPT-Realtime在Pass@1和打断避免方面表现最佳,而Gemini Live 3.1具有最短延迟但轮流率最低。

Comments Work in progress. Demo at https://daniellin94144.github.io/FDB-v3-demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04323 2026-04-07 cs.CL 79%

How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settings

代理技能在真实环境中的表现如何:在现实场景中评估LLM技能使用的基准测试

Yujian Liu, Jiabao Ji, Li An, Tommi Jaakkola, Yang Zhang, Shiyu Chang

机构 * UC Santa Barbara(加州大学圣塔芭芭拉分校) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 工具调用 :agentic(title);agent(abstract);分类 cs.CL

AI总结 本文研究了在更现实的环境下LLM技能的实用性,发现技能效果随环境复杂性增加而下降,通过查询特定的技能细化策略可恢复性能,实验在Terminal-Bench 2.0上提升了Claude Opus 4.6的通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04826 2026-04-07 cs.RO 78%

Efficient Multi-Objective Planning with Weighted Maximization Using Large Neighbourhood Search

基于大邻域搜索的加权最大化多目标规划高效方法

Krishna Kalavadia, Shamak Dutta, Yash Vardhan Pant, Stephen L. Smith

机构 * University of Waterloo(滑铁卢大学)

专题命中 工具调用 :planning(title,abstract)

AI总结 本文提出基于大邻域搜索的新型算法,高效解决加权最大化规划问题,在保持解质量的同时将运行时间提升1-2个数量级,适用于自主导航中的多目标优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04543 2026-04-07 cs.MA cs.LO 78%

Statistical Model Checking of the Island Model: An Established Economic Agent-Based Model of Endogenous Growth

岛屿模型的统计模型检验:一个内生增长的已确立经济基于代理模型

Stefano Blando, Giorgio Fagiolo, Daniele Giachini, Andrea Vandin, Ernest Ivanaj

专题命中 工具调用 :agent(title,abstract)

AI总结 本文利用统计模型检验方法对岛屿模型进行分析,验证了模型的关键特征,并展示了其在内生增长研究中的应用价值。

Comments In Proceedings MARS 2026, arXiv:2604.03053

Journal ref EPTCS 443, 2026, pp. 3-22

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04651 2026-04-07 cs.AI 70%

Search, Do not Guess: Teaching Small Language Models to Be Effective Search Agents

搜索,不要猜测:教小语言模型成为有效的搜索代理

Yizhou Liu, Qi Sun, Yulin Chen, Siyue Zhang, Chen Zhao

机构 * New York University(纽约大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nanyang Technological University(南洋理工大学)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文通过评估复杂多跳推理任务,发现小语言模型(SLMs)虽参数较少,但检索工具使用更少且易产生幻觉。提出轻量级微调方法\policy,使SLMs能可靠检索并生成基于证据的答案,提升Bamboogle和HotpotQA性能17.3和15.3分,达到LLM水平。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04373 2026-04-07 cs.AI cs.LG 62%

Decocted Experience Improves Test-Time Inference in LLM Agents

解毒经验提升LLM代理的测试时间推理

Maohao Shen, Kaiwen Zha, Zexue He, Zhang-Wei Hong, Siru Ouyang, J. Jon Ryu, Prasanna Sattigeri, Suhas Diggavi, Gregory Wornell

机构 * Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 工具调用 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文研究通过解毒经验提升LLM代理测试时间推理性能,探讨如何通过经验构建有效上下文以优化复杂推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04263 2026-04-07 cs.CY cs.AI cs.CL 62%

Commercial Persuasion in AI-Mediated Conversations

人工智能调解对话中的商业说服

Francesco Salvi, Alejandro Cuevas, Manoel Horta Ribeiro

机构 * Princeton University(普林斯顿大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究探讨了人工智能调解对话中商业说服的影响,发现基于LLM的说服使用户选择赞助产品率提高近三倍,且大多数参与者未能察觉促销倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.00797 2026-04-07 cs.AI cs.GT cs.LG cs.MA 62%

Combining Tree-Search, Generative Models, and Nash Bargaining Concepts in Game-Theoretic Reinforcement Learning

将树搜索、生成模型和纳什谈判概念结合在博弈论强化学习中

Zun Li, Marc Lanctot, Kevin R. McKee, Luke Marris, Ian Gemp, Daniel Hennes, Paul Muller, Kate Larson, Yoram Bachrach, Michael P. Wellman

机构 * Google DeepMind(谷歌DeepMind) University of Waterloo(滑铁卢大学) University of Michigan(密歇根大学)

专题命中 工具调用 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于深度博弈论强化学习的多智能体训练框架,通过生成最佳响应算法GenBR和纳什谈判理论构建对手混合策略,提升在不完全信息域中的对手建模能力。

Comments Accepted by IJCAI'25 main track

Journal ref Proc. 34th Int. Joint Conf. Artif. Intell. (IJCAI 2025), pp. 161-169

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03291 2026-04-07 cs.AR cs.AI 57%

RAGnaroX: A Secure, Local-Hosted ChatOps Assistant Using Small Language Models

RAGnaroX:一种使用小型语言模型的安全、本地托管的ChatOps助手

Benedikt Dornauer, Mircea-Cristian Racasan

机构 * University of Innsbruck(因斯布鲁克大学) c.c.com Moser GmbH(c.c.com Moser有限公司)

专题命中 工具调用 :function calling(abstract);分类 cs.AI

AI总结 RAGnaroX是一种基于本地硬件的高效ChatOps助手,采用Rust实现,提供可审计的本地解决方案,通过模块化数据摄入、混合检索和函数调用实现灵活安全的部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09362 2026-04-07 math.AG 50%

The Complete Intersection Discrepancy of a Curve I: Numerical Invariants

曲线的完全交差异数I:数值不变量

Andrei Benguş-Lasnier, Antoni Rangachev

专题命中 工具调用 :tool use(abstract)

AI总结 本文通过引入曲线的完全交差异数修正项,推广了两个经典公式,用于研究曲线的等奇异性和亏格-次数公式。

Comments With an appendix by Marc Chardin. The revised version includes a genus--degree formula for almost complete intersection curves (Corollary C), together with minor improvements to the exposition

详情

展开后加载摘要…

URL PDF HTML 收藏