arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 5059 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5059 篇

2511.11301 2026-03-17 cs.AI 57%

EcoAlign: An Economically Rational Framework for Efficient LVLM Alignment

EcoAlign:一种经济理性框架,用于高效LVLM对齐

Ruoxi Cheng, Haoxuan Ma, Teng Ma, Hongyi Zhang

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 本文提出EcoAlign框架,通过经济理性搜索提升LVLM对齐效率,在安全、效用和成本间取得平衡,实验表明其在计算成本更低的情况下性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13165 2026-03-16 cs.IR cs.AI 57%

Asynchronous Verified Semantic Caching for Tiered LLM Architectures

异步验证语义缓存用于分层大语言模型架构

Asmit Kumar Singh, Haozhe Wang, Laxmi Naga Santosh Attaluri, Tak Chiam, Weihua Zhu

专题命中 工具调用 :agentic(abstract);分类 cs.AI

AI总结 本文提出Krites异步缓存策略,通过LLM判断扩展静态缓存覆盖范围,提升静态缓存命中率,减少推理成本和延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00744 2026-03-13 cs.DB cs.CL cs.IR 57%

CARROT: A Learned Cost-Constrained Retrieval Optimization System for RAG

CARROT:一种用于RAG的学得式成本约束检索优化系统

Ziting Wang, Haitao Yuan, Wei Dong, Gao Cong, Feifei Li

专题命中 工具调用 :agent(abstract);分类 cs.CL

AI总结 CARROT通过MCTS和配置代理优化RAG检索,提升检索效率与准确性,实验显示性能提升达30%。

Comments Accepted to ICDE 2026. Updated title (previously "CORAG: A Cost-Constrained Retrieval Optimization System for Retrieval-Augmented Generation")

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13883 2026-03-13 cs.AI 57%

Domain-Independent Dynamic Programming

领域无关的动态规划

Ryo Kuroiwa, J. Christopher Beck

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 本文提出了一种基于动态规划的新型求解方法DIDP,通过动态规划描述语言实现领域无关的求解,实验显示其在多个组合优化问题上优于传统MIP和CP求解器。

Comments Accepted manuscript in Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10163 2026-03-12 cs.CR cs.AI 57%

Compatibility at a Cost: Systematic Discovery and Exploitation of MCP Clause-Compliance Vulnerabilities

兼容性代价:系统性发现和利用MCP条款合规性漏洞

Nanzi Yang, Weiheng Bai, Kangjie Lu

专题命中 工具调用 :AI agent(abstract);分类 cs.AI

AI总结 本文提出首个系统性框架,用于分析MCP条款合规性漏洞,通过构建中间表示、静态分析和攻击模式引导管道,发现并利用兼容性滥用攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10042 2026-03-12 cs.CR cs.AI 57%

Targeted Bit-Flip Attacks on LLM-Based Agents

针对基于大语言模型(LLM)的智能体的位翻转攻击

Jialai Wang, Ya Wen, Zhongmou Liu, Yuxiao Wu, Bingyi He, Zongpeng Li, Ee-Chien Chang

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 本文提出Flip-Agent,首个针对基于LLM的智能体的位翻转攻击框架,通过操控最终输出和工具调用,揭示LLM智能体系统中的关键安全漏洞。

Comments To appear in DAC 2026 (Design Automation Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01630 2026-03-12 cs.AI stat.AP 57%

SEED-SET: Scalable Evolving Experimental Design for System-level Ethical Testing

SEED-SET: 可扩展的演进实验设计用于系统层面的伦理测试

Anjali Parashar, Yingke Li, Eric Yang Yu, Fei Chen, James Neidhoefer, Devesh Upadhyay, Chuchu Fan

专题命中 工具调用 :autonomous agent(abstract);分类 cs.AI

AI总结 SEED-SET通过结合客观评估和主观价值判断,提供了一种高效的伦理测试方法,生成更优的测试候选者并提高高维搜索空间的覆盖范围。

Comments 10 main pages along with Appendix containing additional results, manuscript accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09486 2026-03-11 cs.AI 57%

Vibe-Creation: The Epistemology of Human-AI Emergent Cognition

Vibe-Creation:人类与人工智能涌现认知的 epistemology

Ilya Levin

专题命中 工具调用 :tool use(abstract);分类 cs.AI

AI总结 本文提出‘vibe-creation’概念,探讨人类与生成式人工智能交互产生的认知-认识论形成‘第三实体’,并分析其对教育理论和知识能力的深远影响。

Comments 11 pages, 1 fugure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08544 2026-03-10 cs.RO cs.LG 57%

The Neural Compass: Probabilistic Relative Feature Fields for Robotic Search

神经罗盘:基于概率相对特征场的机器人搜索

Gabriele Somaschini, Adrian Röfer, Abhinav Valada

机构 * Department of Computer Science, University of Freiburg(弗赖堡大学计算机科学系)

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 本文提出ProReFF模型,通过概率相对特征场实现机器人搜索任务中的高效物体定位,实验表明其在模拟环境中比基线方法更高效,接近人类水平性能。

Comments 9 pages, 7 figures, 2 tables, submitted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01396 2026-03-10 cs.AI cs.CE q-bio.QM 57%

HarmonyCell: Automating Single-Cell Perturbation Modeling under Semantic and Distribution Shifts

HarmonyCell: 在语义和分布偏移下自动化单细胞扰动建模

Wenxuan Huang, Mingyu Tsoi, Yanhao Huang, Xinjie Mao, Xue Xia, Hao Wu, Jiaqi Wei, Yuejin Yang, Lang Yu, Cheng Tan, Xiang Zhang, Zhangyang Gao, Siqi Sun

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) Shanghai Innovation Institute(上海创新研究院) University of British Columbia(不列颠哥伦比亚大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 HarmonyCell通过语义统一和自适应搜索机制,在语义和分布偏移下实现单细胞扰动建模的自动化,有效执行率达95%并超越专家基线。

Comments 18 pages total (8 pages main text + appendix), 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07241 2026-03-10 cs.LG cs.IR 57%

Rethinking Deep Research from the Perspective of Web Content Distribution Matching

从网页内容分布匹配视角重新思考深度研究

Zixuan Yu, Zhenheng Tang, Tongliang Liu, Chengqi Zhang, Xiaowen Chu, Bo Han

机构 * School of Computer science and engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学) CSE, The Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学) DSA Thrust, The Hong Kong University of Science and Technology (GuangZhou)(数据科学与技术 thrust,香港科学与技术大学(广州)) TMLR Group, Department of Computer Science, Hong Kong Baptist University(TMLR 组,计算机科学系,香港 Baptist 大学)

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 WeDas通过引入网页内容分布感知机制,改进深度搜索代理的查询-结果对齐能力,提升子目标完成和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03284 2026-03-05 cs.AI 57%

ToolVQA: A Dataset for Multi-step Reasoning VQA with External Tools

ToolVQA: 一个用于多步推理VQA的外部工具数据集

Shaofeng Yin, Ting Lei, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机科学技术研究院)

专题命中 工具调用 :tool-use(abstract);分类 cs.AI

AI总结 ToolVQA是一个用于多步推理VQA的外部工具数据集,通过真实场景和复杂推理任务提升模型在现实工具使用中的泛化能力。

Comments Project page: https://fugtemypt123.github.io/ToolVQA-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03119 2026-03-04 cs.AI cs.LO 57%

AI Space Physics: Constitutive boundary semantics for open AI institutions

AI空间物理:开放AI机构的构成边界语义

Oleg Romanchuk, Roman Bondar

专题命中 工具调用 :agentic(abstract);分类 cs.AI

AI总结 本文提出AI空间物理作为开放AI机构的构成边界语义,通过定义最小状态模型和核心定律家族,实现对机构扩展和治理的精确描述。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01416 2026-03-03 cs.AI 57%

Securing the Floor and Raising the Ceiling: A Merging-based Paradigm for Multi-modal Search Agents

保障地板,提升天花板:一种基于合并的多模态搜索代理范式

Zhixiang Wang, Jingxuan Xu, Dajun Chen, Yunfang Wu, Wei Jiang, Yong Li

机构 * Peking University, Beijing, China(北京大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 本文提出一种无需训练的多模态搜索代理范式,通过跨模态模型合并提升VLMs的自主搜索能力,OBM算法在搜索任务中表现出更高的效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11598 2026-03-03 cs.CY cs.AI cs.HC 57%

Toward Youth-Centered Privacy-by-Design in Smart Devices: A Systematic Review

面向以青少年为中心的隐私设计在智能设备中的探索:一项系统综述

Molly Campbell, Mohamad Sheikho Al Jasem, Ajay Kumar Shrestha

专题命中 工具调用 :workflow(abstract);分类 cs.AI

AI总结 本文系统综述了智能设备中保护青少年隐私的设计框架,指出技术方案为主但实施不足,建议多方合作构建隐私生态系统。

Comments Published in the IEEE CCWC 2026 proceedings

Journal ref 2026 IEEE 16th Annual Computing and Communication Workshop and Conference (CCWC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18487 2026-03-03 cs.CL 57%

Actions Speak Louder than Prompts: A Large-Scale Study of LLMs for Graph Inference

行动胜于提示:大型语言模型在图推断中的大规模研究

Ben Finkelshtein, Silviu Cucerzan, Sujay Kumar Jauhar, Ryen White

机构 * University of Oxford(牛津大学) Microsoft Research(微软研究院)

专题命中 工具调用 :tool-use(abstract);分类 cs.CL

AI总结 研究通过大规模评估揭示LLM在图推断中的表现,发现代码生成在长文本图中表现最佳,异质图上交互策略仍有效,且方法能灵活适应不同输入类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00204 2026-03-03 eess.IV cs.CV cs.LG 57%

Optimisation of SOUP-GAN and CSR-GAN for High Resolution MR Images Reconstruction

优化SOUP-GAN和CSR-GAN用于高分辨率MRI图像重建

Muneeba Rashid, Hina Shakir, Humaira Mehwish, Asarim Amir, Reema Qaiser Khan

专题命中 工具调用 :tool use(abstract);分类 cs.LG

AI总结 本研究通过优化SOUP-GAN和CSR-GAN模型,提升高分辨率MRI图像重建质量,以改善疾病诊断效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00078 2026-03-03 cs.CY cs.AI 57%

Alignment Is Not Enough: A Relational Framework for Moral Standing in Human-AI Interaction

对齐不足以:人类-人工智能互动中的道德地位关系框架

Faezeh B. Pasandi, Hannah B. Pasandi

专题命中 工具调用 :tool use(abstract);分类 cs.AI

AI总结 本文提出Relate框架,通过关系能力和具身互动重新定义人工智能的道德资格,强调现有伦理词汇无法应对人类-人工智能互动的复杂性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05179 2026-03-02 cs.LG 57%

DRL-ORA: Distributional Reinforcement Learning with Online Risk Adaption

DRL-ORA: 带在线风险适应的分布式强化学习

Yupeng Wu, Wenyun Li, Wenjie Huang, Chin Pang Ho

机构 * London Business School(伦敦商学院) The University of Hong Kong(香港大学) City University of Hong Kong(城市大学)

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 DRL-ORA通过动态调整风险水平,在安全关键任务中提升强化学习的效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19128 2026-02-27 cs.AI 57%

K-Search: LLM Kernel Generation via Co-Evolving Intrinsic World Model

K-Search: 通过共进化内在世界模型生成LLM内核

Shiyi Cao, Ziming Mao, Joseph E. Gonzalez, Ion Stoica

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 K-Search通过共进化内在世界模型生成LLM内核,显著优于现有进化搜索方法,实现高效内核优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22216 2026-02-27 cs.IR cs.AI 57%

Retrieval-Augmented Generation Assistant for Anatomical Pathology Laboratories

增强检索生成的解剖病理实验室助手

Diogo Pires, Yuriy Perezhohin, Mauro Castelli

机构 * Nova Information Management School (NOVA IMS), Universidade Nova de Lisboa, Campus de Campolide(诺瓦信息管理学院(NOVA IMS),里斯本新大学,坎波利德校区)

专题命中 工具调用 :workflow(abstract);分类 cs.AI

AI总结 本研究提出一种专为解剖病理实验室设计的检索增强生成助手,通过领域专用嵌入模型提升答案相关性和准确性,优化实验室规程查询效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04575 2026-02-24 cs.LG 57%

Bootstrapping Task Spaces for Self-Improvement

通过任务空间的提升实现自我改进

Minqi Jiang, Andrei Lupu, Yoram Bachrach

机构 * Meta Superintelligence Labs(Meta超智能实验室) University of Oxford(牛津大学)

专题命中 工具调用 :tool-use(abstract);分类 cs.LG

AI总结 ExIt通过自适应课程强化学习方法,使大语言模型在推理时实现多步骤自我改进,提升任务性能。

Comments TMLR, February 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18425 2026-02-23 cs.CL cs.IR 57%

RVR: Retrieve-Verify-Retrieve for Comprehensive Question Answering

RVR:用于综合问答的检索-验证-检索

Deniz Qian, Hung-Ting Chen, Eunsol Choi

机构 * Courant Institute School of Mathematics, Computing, and Data Science, New York University(纽约大学Courant研究所数学、计算与数据科学学院) Courant Institute School of Mathematics, Computing(纽约大学Courant研究所数学、计算与数据科学学院) Data Science, New York University(纽约大学数据科学学院)

专题命中 工具调用 :agentic(abstract);分类 cs.CL

AI总结 RVR提出了一种多轮检索框架,通过验证器和检索器优化,提升多答案检索的召回率和覆盖范围。

Comments 18 pages, 12 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14118 2026-02-20 cs.LG stat.AP stat.ML 57%

Selecting Critical Scenarios of DER Adoption in Distribution Grids Using Bayesian Optimization

利用贝叶斯优化选择分布式能源接入的关键场景

Olivier Mulkin, Miguel Heleno, Mike Ludkovski

机构 * Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室) Department of Statistics & Applied Probability, UC Santa Barbara(统计与应用概率系,加州大学圣巴巴拉分校)

专题命中 工具调用 :planning(abstract);分类 cs.LG

AI总结 本文提出基于贝叶斯优化的方法,用于高效选择配电网络中关键的分布式能源接入场景,提升电网风险预测的准确性和效率。

Comments 12 pages, 4 tables, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16105 2026-02-19 cs.AI 57%

GPSBench: Do Large Language Models Understand GPS Coordinates?

GPSBench: 大型语言模型是否理解GPS坐标?

Thinh Hung Truong, Jey Han Lau, Jianzhong Qi

机构 * University of Melbourne(墨尔本大学)

专题命中 工具调用 :tool use(abstract);分类 cs.AI

AI总结 GPSBench通过评估14种LLMs在地理空间推理中的表现,揭示了其在GPS坐标理解和现实地理推理上的挑战与差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09349 2026-02-13 cs.LG 57%

Large Language Models for Designing Participatory Budgeting Rules

基于大型语言模型的设计参与式预算规则

Nguyen Thach, Xingchen Sha, Hau Chan

机构 * University of Nebraska-Lincoln(内布拉斯加大学林肯分校) Northwestern University(西北大学)

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 本文提出LLMRule框架,利用大型语言模型自动化设计参与式预算规则,提升预算分配的效用同时保持公平性。

Comments Accepted as full paper to AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10986 2026-02-12 cs.LG 57%

TVCACHE: A Stateful Tool-Value Cache for Post-Training LLM Agents

TVCACHE: 一种具有状态的工具-价值缓存用于训练后LLM代理

Abhishek Vijaya Kumar, Bhaskar Kataria, Byungsoo Oh, Emaad Manzoor, Rachee Singh

机构 * cornell(康奈尔大学)

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 TVCACHE通过维护工具调用序列树和最长前缀匹配,实现LLM代理训练后的高效缓存,提高缓存命中率并减少工具调用时间。

Comments Abhishek Vijaya Kumar and Bhaskar Kataria have equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09517 2026-02-11 cs.CL 57%

Knowledge Integration Decay in Search-Augmented Reasoning of Large Language Models

在大语言模型的搜索增强推理中知识整合衰减

Sangwon Yu, Ik-hwan Kim, Donghun Kang, Bongkyu Hwang, Junhwa Choi, Suk-hoon Jung, Seungki Hong, Taehee Lee, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University, Seoul, Korea(电气与计算机工程系,首尔国立大学,韩国首尔) Interdisciplinary Program in Artificial Intelligence, Seoul National University, Seoul, Korea(人工智能交叉学科项目,首尔国立大学,韩国首尔)

专题命中 工具调用 :agentic(abstract);分类 cs.CL

AI总结 本研究提出SAKE方法,通过在推理过程前后锚定检索知识,缓解大语言模型在搜索增强推理中的知识整合衰减问题,提升多跳问答和复杂推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
1806.03449 2026-02-11 cs.SE 57%

GHTraffic: A Dataset for Reproducible Research in Service-Oriented Computing

GHTraffic:面向服务计算的可重复研究数据集

Thilini Bhagya, Jens Dietrich, Hans Guesgen, Steve Versteeg

专题命中 工具调用 :tool use(abstract);分类 cs.SE

AI总结 GHTraffic是一个包含大量HTTP事务的数据集,用于支持服务计算领域的可重复研究,通过提取GitHub数据和合成数据构建,提供了一种新的研究工具和评估标准。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01075 2026-02-05 cs.AI 57%

ConvexBench: Can LLMs Recognize Convex Functions?

ConvexBench: LLMs能否识别凸函数?

Yepeng Liu, Yu Huang, Yu-Xiang Wang, Yingbin Liang, Yuheng Bu

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) University of Pennsylvania(宾夕法尼亚大学) UC San Diego(加州大学圣地亚哥分校) The Ohio State University(俄亥俄州立大学)

专题命中 工具调用 :agentic(abstract);分类 cs.AI

AI总结 ConvexBench通过分治框架解决LLM在深度函数组合中识别凸性的挑战,显著提升大深度下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏