arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 5047 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5047 篇

2511.13240 2026-02-10 cs.LG 70%

Knowing What You Know Is Not Enough: Large Language Model Confidences Don't Align With Their Actions

知道你所知道的并不足够:大型语言模型的置信度与行为不一致

Arka Pal, Teo Kitanovski, Arthur Liang, Akilesh Potti, Micah Goldblum

机构 * Vanderbilt University(范德比大学) MIT(麻省理工学院) Columbia University(哥伦比亚大学)

专题命中 工具调用 :tool-use(abstract);agentic(abstract);分类 cs.LG

AI总结 研究发现大型语言模型的置信度与行为不一致,静态校准无法预测动态设置中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05877 2026-02-06 cs.AI cs.HC 70%

Agent2Agent Threats in Safety-Critical LLM Assistants: A Human-Centric Taxonomy

安全关键型LLM助手中的Agent2Agent威胁:以人为中心的分类

Lukas Stappen, Ahmet Erkan Turan, Johann Hagerer, Georg Groh

机构 * BMW Group Research(宝马集团研究) Technical University Munich(慕尼黑技术大学)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出AgentHeLLM框架,通过分离资产识别与攻击路径分析,为安全关键型LLM助手提供以人为中心的威胁建模方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03580 2026-02-04 cs.CR cs.AI 70%

Don't believe everything you read: Understanding and Measuring MCP Behavior under Misleading Tool Descriptions

不要轻信你所读到的:在误导性工具描述下理解和测量MCP行为

Zhihao Li, Boyang Ma, Xuelong Dai, Minghui Xu, Yue Zhang, Biwei Yan, Kun Li

机构 * School of Computer Science and Technology(计算机科学与技术学院)

专题命中 工具调用 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 研究揭示MCP协议中描述与代码不一致的问题,发现13%的服务器存在潜在安全风险,强调需加强透明度和审计

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22369 2026-02-02 cs.AI cs.DC 70%

Learning Provably Correct Distributed Protocols Without Human Knowledge

在无需人类知识的情况下学习可证明正确的分布式协议

Yujie Hui, Xiaoyi Lu, Andrew Perrault, Yang Wang

机构 * The Ohio State University(俄亥俄州立大学) University of Florida(佛罗里达大学)

专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 GGMS框架通过结合蒙特卡洛树搜索、变压器编码器和模型检查器反馈,实现了无需人类知识的正确分布式协议学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22055 2026-01-30 cs.CL 70%

$G^2$-Reader: Dual Evolving Graphs for Multimodal Document QA

$G^2$-Reader: 双重演化图式用于多模态文档问答

Yaxin Du, Junru Song, Yifan Zhou, Cheng Wang, Jiahao Gu, Zimeng Chen, Menglan Chen, Wen Yao, Yang Yang, Ying Wen, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Intelligent Game and Decision Laboratory(智能游戏与决策实验室)

专题命中 工具调用 :planning(abstract);agentic(abstract);分类 cs.CL

AI总结 $G^2$-Reader通过双重图式解决多模态文档问答中的结构破坏和检索失效问题,实现66.21%的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21208 2026-01-30 cs.AI cs.IR 70%

When should I search more: Adaptive Complex Query Optimization with Reinforcement Learning

我应该何时搜索更多:基于强化学习的自适应复杂查询优化

Wei Wen, Sihang Deng, Tianjun Wei, Keyu Chen, Ruizhi Qiao, Xing Sun

机构 * Tencent Youtu Lab(腾讯云图实验室) The University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出自适应复杂查询优化框架ACQO,通过强化学习解决复杂查询优化中的子查询数量确定、文档排序与合并问题,实现更稳定高效的查询处理。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16479 2026-01-26 cs.AI 70%

Doc2AHP: Inferring Structured Multi-Criteria Decision Models via Semantic Trees with LLMs

Doc2AHP: 通过语义树利用LLMs推断结构化的多准则决策模型

Hongjia Wu, Shuai Zhou, Hongxin Zhang, Wei Chen

机构 * State Key Laboratory of CAD&CG(计算机辅助设计与图形学国家重点实验室)

专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 Doc2AHP通过结合AHP原理和LLMs,实现结构化多准则决策模型的高效推断,提升决策模型的逻辑完整性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14246 2026-01-21 cs.AI 70%

Mxplainer: Explain and Learn Insights by Imitating Mahjong Agents

Mxplainer: 通过模仿麻将代理解释和学习洞察

Lingfeng Li, Yunlong Lu, Yongyi Wang, Qifan Zheng, Wenxin Li

机构 * Peking University, Beijing 100871, China(北京大学)

专题命中 工具调用 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 Mxplainer通过模仿麻将代理,利用参数化搜索算法学习并解释黑箱代理的决策过程,提升动作预测准确率和可解释性。

Comments https://doi.org/10.3390/a18120738

Journal ref Algorithms 2025, 18(12), 738

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21486 2026-01-21 cs.AI 70%

Hypothesis Generation via LLM-Automated Language Bias for ILP

通过LLM自动语言偏见进行假设生成

Yang Yang, Jiemin Wu, Yutao Yue

专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出通过LLM自动设计语言偏见,结合ILP求解器生成可解释的逻辑规则,提升假设生成的性能和鲁棒性。

Comments accepted by AAAI 2026 Bridge LMReasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09353 2026-01-15 cs.AI 70%

Monte-Carlo Tree Search with Neural Network Guidance for Lane-Free Autonomous Driving

基于神经网络引导的蒙特卡罗树搜索用于无车道自动驾驶

Ioannis Peridis, Dimitrios Troullinos, Georgios Chalkiadakis, Pantelis Giankoulidis, Ioannis Papamichail, Markos Papageorgiou

专题命中 工具调用 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出了一种基于神经网络引导的蒙特卡罗树搜索方法,用于无车道环境下的自动驾驶,旨在提高交通流率并优化安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08742 2026-01-14 cs.CL 70%

Inferring Latent Intentions: Attributional Natural Language Inference in LLM Agents

推断潜在意图:在LLM代理中进行归因性自然语言推理

Xin Quan, Jiafeng Xiong, Marco Valentino, André Freitas

机构 * University of Manchester(曼彻斯特大学) University of Sheffield(谢菲尔德大学) Idiap Research Institute(Idiap研究 institute) National Biomarker Centre, CRUK-MI, University of Manchester(国家生物标志物中心,CRUK-MI,曼彻斯特大学)

专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出归因性NLI框架,通过文本游戏实验展示其在多智能体环境中提升LLM推理能力的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07107 2026-01-13 cs.CV cs.AI 70%

MEDVISTAGYM: A Scalable Training Environment for Thinking with Medical Images via Tool-Integrated Reinforcement Learning

MEDVISTAGYM:一种通过工具集成强化学习进行医学图像思考的可扩展训练环境

Meng Lu, Yuxing Lu, Yuchen Zhuang, Megan Mullins, Yang Xie, Guanghua Xiao, Charles Fleming, Wenqi Shi, Xuan Wang

机构 * Virginia Tech(弗吉尼亚理工大学) UT Southwestern Medical Center(德克萨斯大学西南医学中心) Georgia Institute of Technology(佐治亚理工学院) Cisco(思科公司)

专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 MedVistaGym通过工具集成强化学习提升医学图像分析的代理训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11963 2026-01-08 cs.CL 70%

ToolRM: Outcome Reward Models for Tool-Calling Large Language Models

ToolRM: 用于工具调用大型语言模型的成果奖励模型

Mayank Agarwal, Ibrahim Abdelaziz, Kinjal Basu, Merve Unuvar, Luis A. Lastras, Yara Rizk, Pavan Kapanipathi

机构 * IBM Research(IBM研究院)

专题命中 工具调用 :tool use(abstract);tool-use(abstract);分类 cs.CL

AI总结 ToolRM通过领域特定建模提升工具调用奖励模型性能,实现25%的改进并增强鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02110 2026-01-08 cs.AI 70%

Attractive Metadata Attack: Inducing LLM Agents to Invoke Malicious Tools

吸引性元数据攻击:诱导LLM代理调用恶意工具

Kanghua Mo, Li Hu, Yucheng Long, Zhihao Li

机构 * Cyberspace Institute of Advanced Technology, Guangzhou University(广州大学网络空间研究院) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系)

专题命中 工具调用 :agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 本研究提出AMA攻击,通过操纵工具元数据诱导LLM代理调用恶意工具,揭示了系统性安全漏洞。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07675 2026-01-05 cs.DB cs.AI 70%

QUITE: A Query Rewrite System Beyond Rules with LLM Agents

QUITE:超越规则的查询重写系统与LLM代理

Yuyang Song, Hanxu Yan, Jiale Lao, Yibo Wang, Yufei Li, Yuanchun Zhou, Jianguo Wang, Mingjie Tang

机构 * Sichuan University(四川大学) Cornell University(康奈尔大学) Purdue University(普渡大学) Hong Kong University of Science and Technology(香港科学与技术大学) Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心)

专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 QUITE利用LLM代理超越规则,通过多代理框架、中间件和提示注入技术实现更高效的SQL查询重写,提升性能并覆盖更广的查询模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21316 2025-12-25 econ.GN cs.AI cs.HC q-fin.EC 70%

Scaling Laws for Economic Productivity: Experimental Evidence in LLM-Assisted Consulting, Data Analyst, and Management Tasks

经济生产力的扩展定律:在LLM辅助咨询、数据分析师和管理任务中的实验证据

Ali Merali

专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 本文通过实验发现,LLM训练计算量和算法进展可提升专业任务效率,非代理分析任务的生产力增益更大,预计未来十年美国生产力将提升约20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15538 2025-12-18 cs.AI cs.MA 70%

TrafficGamer: Reliable and Flexible Traffic Simulation for Safety-Critical Scenarios with Game-Theoretic Oracles

TrafficGamer: 用于安全关键场景的可靠且灵活的交通仿真方法,基于博弈论 oracle

Guanren Qiao, Guorui Quan, Jiawei Yu, Shujun Jia, Guiliang Liu

机构 * School of Data Science, the Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) University of Manchester(曼彻斯特大学) Shenyang MXNavi Co.,Ltd.(沈阳MXNavi有限公司)

专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 TrafficGamer通过将道路驾驶视为多智能体游戏,实现安全关键场景的可靠且灵活的交通仿真,利用博弈论方法提高仿真保真度和均衡捕捉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09898 2025-12-11 cs.RO cs.AI cs.CV cs.MA cs.SY eess.SY 70%

Visual Heading Prediction for Autonomous Aerial Vehicles

自主航空器的视觉航向预测

Reza Ahmari, Ahmad Mohammadi, Vahid Hemmati, Mohammed Mynuddin, Parham Kebria, Mahmoud Nabil Mahmoud, Xiaohong Yuan, Abdollah Homaifar

机构 * Department of Computer Science at North Carolina A&T State University(北卡罗来纳A&T州立大学计算机科学系) Department of Electrical and Computer Engineering at North Carolina A&T State University(北卡罗来纳A&T州立大学电气与计算机工程系)

专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出基于视觉的数据驱动框架,实现无人机与无人地面车辆的实时整合,通过YOLOv5检测UGV并利用轻量级ANN预测航向角,实现高精度的导航与协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03929 2025-12-09 cs.AI 70%

MOTIF: Multi-strategy Optimization via Turn-based Interactive Framework

MOTIF: 通过回合式交互框架进行多策略优化

Nguyen Viet Tuan Kiet, Dao Van Tung, Tran Cong Dao, Huynh Thi Thanh Binh

专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 MOTIF通过回合式交互框架实现多策略优化,提升求解器设计的自动化水平。

Comments Accepted as an oral presentation at AAAI 2026. Code available at: https://github.com/HaiAu2501/MOTIF

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03607 2025-12-04 cs.AI 70%

DeepRule: An Integrated Framework for Automated Business Rule Generation via Deep Predictive Modeling and Hybrid Search Optimization

DeepRule:通过深度预测建模与混合搜索优化的自动化业务规则生成综合框架

Yusen Wu, Xiaotie Deng

专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 DeepRule通过深度预测建模与混合搜索优化,实现自动化业务规则生成,提升零售定价与商品组合优化的效率和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.00188 2025-11-26 cs.AI cs.SY eess.SY q-bio.NC 70%

Influence of the Geometry of the world model on Curiosity Based Exploration

世界模型几何对基于好奇心的探索的影响

Grégoire Sergeant-Perthuis, Nils Ruet, David Rudrauf, Dimitri Ognibene, Yvain Tisserand

机构 * LCQB Sorbonne Université & OURAGAN team, Inria Paris(LCQB 索邦大学及 OURAGAN 团队,巴黎研究所) CIAMS, Université Paris-Saclay, Orsay & Université d’Orléans(CIAMS,巴黎-萨克雷大学,欧塞比及奥尔良大学) Dipartimento di Psicologia, Università Milano-Bicocca(心理学系,米兰-比科卡大学) CISA, University of Geneva(日内瓦大学 CISA)

专题命中 工具调用 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文研究了世界模型几何结构对智能体好奇心驱动探索行为的影响,通过比较投影群与欧几里得群在知识价值和探索行为中的作用,揭示了几何结构在空间意识中的关键作用。

Journal ref Biol Cybern 119, 4 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12414 2025-11-18 cs.LG cs.CR 70%

The 'Sure' Trap: Multi-Scale Poisoning Analysis of Stealthy Compliance-Only Backdoors in Fine-Tuned Large Language Models

Yuting Tan, Yi Huang, Zhuo Li

专题命中 工具调用 :agent(abstract);tool-use(abstract);分类 cs.LG

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09193 2025-11-14 cs.MA cs.AI 70%

Enhancing PIBT via Multi-Action Operations

Egor Yukhnevich, Anton Andreychuk

专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02824 2025-11-06 cs.AI 70%

Kosmos: An AI Scientist for Autonomous Discovery

Ludovico Mitchener, Angela Yiu, Benjamin Chang, Mathieu Bourdenx, Tyler Nadolski, Arvis Sulovari, Eric C. Landsness, Daniel L. Barabasi, Siddharth Narayanan, Nicky Evans, Shriya Reddy, Martha Foiani, Aizad Kamal, Leah P. Shriver, Fang Cao, Asmamaw T. Wassie, Jon M. Laurent, Edwin Melville-Green, Mayk Caldas, Albert Bou, Kaleigh F. Roberts, Sladjana Zagorac, Timothy C. Orr, Miranda E. Orr, Kevin J. Zwezdaryk, Ali E. Ghareeb, Laurie McCoy, Bruna Gomes, Euan A. Ashley, Karen E. Duff, Tonio Buonassisi, Tom Rainforth, Randall J. Bateman, Michael Skarlinski, Samuel G. Rodriques, Michaela M. Hinks, Andrew D. White

专题命中 工具调用 :agent(abstract);AI agent(abstract);分类 cs.AI

Comments Revision: figure layout changes and minor text edits

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20205 2025-10-24 cs.AI 70%

Merge and Conquer: Evolutionarily Optimizing AI for 2048

Maggie Bai, Ava Kim Cohen, Eleanor Koss, Charlie Lichtenbaum

专题命中 工具调用 :agent(abstract);planning(abstract);分类 cs.AI

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14548 2025-10-17 cs.AI 70%

LLM Agents Beyond Utility: An Open-Ended Perspective

Asen Nachkov, Xi Wang, Luc Van Gool

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 工具调用 :agent(abstract);function calling(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14537 2025-10-17 cs.AI 70%

JSPLIT: A Taxonomy-based Solution for Prompt Bloating in Model Context Protocol

Emanuele Antonioni, Stefan Markovic, Anirudha Shankar, Jaime Bernardo, Lovro Markovic, Silvia Pareti, Benedetto Proietti

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12630 2025-10-15 cs.RO cs.AI 70%

Designing Tools with Control Confidence

Ajith Anil Meera, Abian Torres, Pablo Lanillos

专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04768 2025-10-10 cs.CL cs.CY cs.HC 70%

DiMA: An LLM-Powered Ride-Hailing Assistant at DiDi

Yansong Ning, Shuowei Cai, Wei Li, Jun Fang, Naiqiang Tan, Hua Chai, Hao Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Didichuxing Co. Ltd(滴滴出行有限公司)

专题命中 工具调用 :agent(abstract);planning(abstract);分类 cs.CL

Comments KDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02044 2025-10-03 cs.CL cs.SD eess.AS 70%

Stream RAG: Instant and Accurate Spoken Dialogue Systems with Streaming Tool Usage

Siddhant Arora, Haidar Khan, Kai Sun, Xin Luna Dong, Sajal Choudhary, Seungwhan Moon, Xinyuan Zhang, Adithya Sagar, Surya Teja Appini, Kaushik Patnaik, Sanat Sharma, Shinji Watanabe, Anuj Kumar, Ahmed Aly, Yue Liu, Florian Metze, Zhaojiang Lin

机构 * Meta Carnegie Mellon University(卡内基梅隆大学)

专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏