arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-28 至 2026-04-28 共收录 18 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 18 篇

2604.23425 2026-04-28 cs.CR 89%

When the Agent Is the Adversary: Architectural Requirements for Agentic AI Containment After the April 2026 Frontier Model Escape

当代理成为对手:2026年4月前沿模型逃脱后代理AI约束的架构要求

Richard Joseph Mitchell

专题命中 工具调用 :agentic(title,abstract);agent(title,abstract);AI agent(abstract)

AI总结 本文分析了四种现有约束方法的失效模式,提出五项架构要求,强调架构约束是应对代理AI安全威胁的唯一持久策略。

Comments 17 pages, 30 references, 5 tables. Derives five architectural requirements (R1-R5) for agentic AI containment from the April 2026 Mythos Preview incidents. Assesses AEGIS, Microsoft AGT, NVIDIA OpenShell, and other current systems; finds none satisfies all five requirements. Patent pending

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23734 2026-04-28 cs.IR 82%

Prism-Reranker: Beyond Relevance Scoring -- Jointly Producing Contributions and Evidence for Agentic Retrieval

Prism-Reranker:超越相关性评分——联合生成贡献与证据以实现代理检索

Dun Zhang

专题命中 工具调用 :agentic(title);agent(abstract);autonomous agent(abstract)

AI总结 Prism-Reranker通过联合生成贡献说明和证据片段,提升代理检索性能,其在多个数据集上均取得显著效果。

Comments 28 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22836 2026-04-28 cs.CV 80%

AgentRVOS for MeViS-Text Track of 5th PVUW Challenge: 3rd Method

AgentRVOS用于5th PVUW挑战赛MeViS-Text跟踪的第三种方法:Ref-VOS管道

Deshui Miao, Chao Yang, Chao Tian, Guoqing Zhu, Kai Yang, Zhifan Mo, Xin Li

机构 * Pengcheng Laboratory(鹏城实验室) Wuhan Textile University(武汉纺织大学) Yixiang Innovation Technology (Shenzhen)(曦昂创新技术(深圳))

专题命中 工具调用 :agent(summary_cn,abstract)

AI总结 本文提出基于Sa2VA的Ref-VOS管道,通过明确的agent角色实现密集语义理解与时间搜索,核心方法包括agent循环决策与多agent协作,主要贡献是提升视频跟踪的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04751 2026-04-28 cs.AI 79%

Evaluating the Search Agent in a Parallel World

在平行世界中评估搜索代理

Jiawei Chen, Xintian Shen, Lihao Zheng, Lifu Mu, Haoyi Sun, Ning Mao, Hao Ma, Tao Wei, Pan Zhou, Kun Zhan

机构 * Li Auto

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 本文提出Mind-ParaWorld框架,通过生成未来场景和不可侵犯的原子事实,解决传统搜索代理评估中的基准构建、动态过时和证据判断难题。

Comments https://github.com/TIMMY-CHAN/Mind-ParaWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22760 2026-04-28 cs.IR cs.AI cs.CL 79%

Quantifying Divergence in Inter-LLM Communication Through API Retrieval and Ranking

通过API检索和排序量化跨LLM通信中的分歧

Eyhab Al-Masri

机构 * School of Engineering and Technology(工程与技术学院)

专题命中 工具调用 :agent(abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一个统一的基准框架,量化在相同任务下不同LLM在API发现和排序上的差异。研究发现结构化任务稳定性较高,而开放性任务分歧显著,结果为多代理系统中可靠性感知的协调提供了依据。

Comments AAAI 2026 Conference (LAMAS Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25111 2026-04-28 cs.LG cs.PL cs.SE 79%

SEVerA: Verified Synthesis of Self-Evolving Agents

SEVerA: 验证合成自进化代理

Debangshu Banerjee, Changming Xu, Eugene Ie, Ming Zhang, Daiyi Peng, Chu-Cheng Lin, Gagandeep Singh

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google(谷歌)

专题命中 工具调用 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.LG、cs.SE

AI总结 SEVerA通过引入形式化guarded生成模型,结合搜索、验证和学习三阶段框架,在程序验证、符号数学合成等任务中实现零约束违规,提升自进化代理的正确性和性能。

Comments First Formally Verified Self-Evolving LLM Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24479 2026-04-28 cs.CV 78%

Zero-to-CAD: Agentic Synthesis of Interpretable CAD Programs at Million-Scale Without Real Data

从零到CAD:在百万级规模上无需真实数据合成可解释的CAD程序

Mohammadmehdi Ataei, Farzaneh Askari, Kamal Rahimi Malekshan, Pradeep Kumar Jayaraman

机构 * Autodesk Research(Autodesk研究院)

专题命中 工具调用 :agentic(title,abstract)

AI总结 本文提出Zero-to-CAD框架,通过代理搜索方法生成可执行的CAD构造序列,实现百万级可解释CAD程序的合成,并展示了其在多视图图像重建中的应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23820 2026-04-28 cs.DL 67%

The software space of science

科学的软件空间

Zhouming Wu, Dakota Murray

专题命中 工具调用 :tool use(abstract);workflow(abstract)

AI总结 研究通过分析130万篇论文中的软件提及,揭示科学领域软件工具的结构化分布及学科间工具组合的演变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16888 2026-04-28 cs.CR cs.AI cs.CL 62%

PARASITE: Conditional System Prompt Poisoning to Hijack LLMs

PARASITE: 条件系统提示污染以劫持大语言模型

Viet Pham, Thai Le

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 PARASITE通过条件系统提示污染技术,使LLM在特定查询下输出被篡改响应,同时保持正常输入的高实用性,且在黑盒环境下实现70%的F1降级。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23307 2026-04-28 cs.LG cs.AI 62%

CombiMOTS: Combinatorial Multi-Objective Tree Search for Dual-Target Molecule Generation

CombiMOTS:基于双靶分子生成的组合多目标树搜索

Thibaud Southiratn, Bonil Koo, Yijingxiu Lu, Sun Kim

机构 * Department of Computer Science and Engineering, Seoul National University, Seoul, Republic of Korea(首尔国立大学计算机科学与工程系) Interdisciplinary Program in Bioinformatics, Seoul National University, Seoul, Republic of Korea(首尔国立大学生物信息学跨学科项目) AIGENDRUG Co., Ltd., Seoul, Republic of Korea(AIGENDRUG公司) Interdisciplinary Program in Artificial Intelligence, Seoul National University, Seoul, Republic of Korea(首尔国立大学人工智能跨学科项目)

专题命中 工具调用 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CombiMOTS,一种基于多目标树搜索的框架,用于生成双靶分子,通过向量优化约束平衡靶点亲和力与物理化学性质,实验表明其能生成高评分、多样化的双靶分子。

Comments Accepted as a poster at ICML 2025 (Main Track)

Journal ref Proceedings of the 42nd International Conference on Machine Learning, PMLR 267:56650-56691, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22937 2026-04-28 cs.CL cs.LG cs.PL 62%

AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs

AutoPyVerifier: 为大语言模型输出学习紧凑的可执行验证器

Pouya Pezeshkpour, Estevam Hruschka

机构 * Megagon Labs(梅加戈恩实验室)

专题命中 工具调用 :function calling(abstract);分类 cs.CL、cs.LG

AI总结 本文提出AutoPyVerifier框架,通过LLM生成候选验证器并利用DAG搜索优化,提升验证器集对目标任务的预测精度,实验表明在多个基准测试中性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11452 2026-04-28 quant-ph cs.AI 57%

Attention-Based Deep Reinforcement Learning for Qubit Allocation in Modular Quantum Architectures

基于注意力的深度强化学习在模块化量子架构中的量子比特分配

Enrico Russo, Maurizio Palesi, Davide Patti, Giuseppe Ascia, Vincenzo Catania

机构 * University of Catania(卡塔尼亚大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 本文提出利用深度强化学习方法,结合Transformer和图神经网络,高效解决量子电路编译与映射问题,减少核心间通信并提升求解效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23195 2026-04-28 cs.CV cs.AI 57%

AnalogRetriever: Learning Cross-Modal Representations for Analog Circuit Retrieval

AnalogRetriever: 为模拟电路检索学习跨模态表示

Yihan Wang, Lei Li, Yao Lai, Jing Wang, Yan Lu

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) University of Cambridge(剑桥大学) Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 工具调用 :agentic(abstract);分类 cs.AI

AI总结 本文提出AnalogRetriever,通过构建高质量数据集和三模态检索框架,实现跨模态的模拟电路检索,实验表明其在六个方向上的Recall@1达到75.2%,显著优于现有方法。

Comments 10 pages, 7 figures. Yihan Wang and Lei Li contributed equally to this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22985 2026-04-28 cs.CL 57%

Uncertainty Quantification for LLM Function-Calling

大语言模型函数调用的不确定性量化

Zihuiwen Ye, Lukas Aichberger, Michael Kirchhof, Sinead Williamson, Luca Zappella, Yarin Gal, Arno Blaas, Adam Golinski

机构 * University of Oxford(牛津大学) Apple(苹果公司)

专题命中 工具调用 :tool-use(abstract);分类 cs.CL

AI总结 本文研究了大语言模型函数调用中不确定性量化的关键问题,发现多样本方法在自然语言问答中表现优异,但在函数调用场景中不如单样本方法有效,并提出利用函数调出输出特性改进现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14549 2026-04-28 cs.CR cs.AI 57%

Can Large Language Models Really Recognize Your Name?

大语言模型真的能识别你的名字吗?

Dzung Pham, Peter Kairouz, Niloofar Mireshghallah, Eugene Bagdasarian, Chau Minh Pham, Amir Houmansadr

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Google Research(谷歌研究) Carnegie Mellon University(卡内基梅隆大学) Google Research, University of Massachusetts Amherst(谷歌研究,马萨诸塞大学阿默斯特分校) University of Maryland, College Park(马里兰大学学院市分校)

专题命中 工具调用 :tool use(abstract);分类 cs.AI

AI总结 本文研究大语言模型在短文本中处理模糊人名的可靠性问题,构建AmBench基准测试集,发现模型对模糊人名的识别率下降20-40%,揭示隐私保护中的公平性问题。

Comments ACM FAccT '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24118 2026-04-28 cs.CR 50%

AgentVisor: Defending LLM Agents Against Prompt Injection via Semantic Virtualization

AgentVisor: 通过语义虚拟化防御LLM代理的提示注入

Zonghao Ying, Haozheng Wang, Jiangfan Liu, Quanchen Zou, Aishan Liu, Jian Yang, Yaodong Yang, Xianglong Liu

专题命中 工具调用 :agent(abstract)

AI总结 本文提出AgentVisor框架,通过语义权限分离防御LLM代理的提示注入攻击,结合经典操作系统安全原语设计审计协议,并引入自修正机制,实验表明其在安全性和实用性上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23317 2026-04-28 quant-ph 50%

Constrained Quantum Optimization meets Model Reduction

受约束的量子优化与模型降维

Max Tschaikowski, Andrea Vandin

专题命中 工具调用 :agent(abstract)

AI总结 本文提出利用量子测量的投影特性,通过模型降维方法在低维空间中模拟受约束的量子优化,展示了在随机3-SAT和图上代理协调问题中实现指数级状态空间缩减。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23100 2026-04-28 cs.CR cs.AR cs.LO 50%

From Language to Logic: Bridging LLMs & Formal Representations for RTL Assertion Generation

从语言到逻辑:桥接LLMs与形式表示以生成RTL断言

Nowfel Mashnoor, Hadi Kamali, Kimia Azar

专题命中 工具调用 :agent(abstract)

AI总结 本文提出ProofLoop工具增强的ReAct代理,通过求解器在环方法从自然语言规范生成SVA,实现93.7%的语法正确性和82.0%的功能正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏