arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-01 至 2026-06-01 共收录 16 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 16 篇

2605.31584 2026-06-01 cs.CL cs.AI cs.LG 82%

LongTraceRL: Learning Long-Context Reasoning from Search Agent Trajectories with Rubric Rewards

LongTraceRL: 基于评分奖励从搜索智能体轨迹中学习长上下文推理

Nianyi Lin, Jiajie Zhang, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出LongTraceRL框架,通过知识图谱随机游走生成多跳问题并利用搜索智能体轨迹构建分层干扰物,结合基于实体链的评分奖励进行过程监督,提升大语言模型在长上下文推理中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30604 2026-06-01 cs.CR cs.AI cs.CL cs.IR 81%

An Organization-Scoped LLM Agent Runtime Architecture for Regulated Cybersecurity Operations

面向受监管网络安全运营的组织范围LLM代理运行时架构

George Fatouros, Georgios Makridis, George Kousiouris, John Soldatos, Dimosthenis Kyriazis

机构 * Innov-Acts Ltd(Innov-Acts有限公司) Dept. of Digital Systems University of Piraeus(数字系统系希腊比雷埃克斯大学) Harokopio University(哈罗基奥大学) Dept. of Informatics and Telematics(信息学与电信系)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 提出一种组织范围的LLM代理运行时架构,通过类型化安全上下文、运行时核心、专业子代理、受控工具适配层和分层人机回环,实现检索、工具调用、内存、发现、报告和审计的全局强制,并保持模型无关和本地部署。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17373 2026-06-01 cs.LG cs.AI 81%

FML-bench: A Controlled Study of AI Research Agent Strategies from the Perspective of Search Dynamics

FML-bench:从搜索动力学视角对AI研究代理策略的受控研究

Qiran Zou, Hou Hei Lam, Wenhao Zhao, Tingting Chen, Yiming Tang, Samson Yu, Yingtao Zhu, Srinivas Anumasa, Zufeng Zhang, Tianyi Zhang, Chang Liu, Zhengyao Jiang, Anirudh Goyal, Dianbo Liu

机构 * National University of Singapore(国立新加坡大学) Tsinghua University(清华大学) University of Minnesota(明尼苏达大学) Weco Meta

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出FML-Bench基准,通过分离策略与基础设施并定义过程级指标,评估六种代理策略,发现贪婪爬山法接近最优树搜索,且自适应策略基于搜索密度切换可超越其他代理。

Comments Our benchmark is available at: https://github.com/qrzou/FML-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30862 2026-06-01 cs.DB cs.AI 79%

Sophrosyne: Agentic Exploration of Relational Data Systems Needs Moderation

Sophrosyne: 关系数据系统的智能体探索需要适度

Madhav Jivrajani, Ramnatthan Alagappan, Aishwarya Ganesan

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 工具调用 :agentic(title);agent(abstract);分类 cs.AI

AI总结 针对LLM驱动的Text2SQL智能体在探索数据系统时过度探索的问题,提出Sophrosyne环境,通过增强API响应中的指令来引导探索,减少过度探索并提升SQL生成准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30738 2026-06-01 cs.AI 79%

MAVEN: Improving Generalization in Agentic Tool Calling

MAVEN:提升智能体工具调用的泛化能力

Omkar Ghugarkar, Vishvesh Bhat, Muhammad Ahmed Mohsin, Asad Aali

机构 * CoreThink AI, USA(CoreThink AI, 美国) Stanford University, Stanford, CA, USA(斯坦福大学, 加州斯坦福, 美国)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 提出MAVEN框架,通过轻量级符号推理脚手架实现结构化分解、自适应工具编排和中间验证,在多个基准测试中显著提升模型性能,且成本仅为前沿专有模型的约1/10。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31268 2026-06-01 cs.CL 77%

Mellum2 Technical Report

Mellum2 技术报告

Marko Kojic, Ivan Bondyrev, Aral de Moor, Joseph Shtok, Petr Borovlev, Kseniia Lysaniuk, Madeeswaran Kannan, Ivan Dolgov, Nikita Pavlichenko

机构 * JetBrains Constructor University(Constructor大学)

专题命中 工具调用 :tool use(abstract);function calling(abstract);agentic(abstract);分类 cs.CL

AI总结 本文介绍 Mellum 2,一个12B参数(每token激活2.5B)的混合专家语言模型,专攻软件工程,通过架构创新和训练优化在代码生成、数学推理等基准上达到4B-14B开源模型的竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30838 2026-06-01 cs.AI 77%

COMPASS: Cognitive MCTS-Guided Process Alignment for Safe Search Agents

COMPASS: 认知MCTS引导的过程对齐用于安全搜索代理

Wenkai Shen, Pengyang Zhou, Jiahe Xu, Jiaming Qian, Haozhe He, Zhihao Huang, Chaochao Chen, Xiaolin Zheng

机构 * Zhejiang University(浙江大学)

专题命中 工具调用 :agent(abstract);tool use(abstract);workflow(abstract);分类 cs.AI

AI总结 提出COMPASS框架,通过认知树探索和自省步骤对齐,在保持通用效用的同时实现搜索代理工作流中的鲁棒安全对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26612 2026-06-01 cs.RO 71%

Meta-Adaptive Beam Search Planning for Transformer-Based Reinforcement Learning Control of UAVs with Overhead Manipulators under Flight Disturbances

基于Transformer强化学习的无人机搭载顶置机械臂在飞行扰动下的元自适应波束搜索规划

Hazim Alzorgan, Sayed Pedram Haeri Boroujeni, Abolfazl Razi

专题命中 工具调用 :planning(title)

AI总结 针对无人机与顶置机械臂耦合导致的末端执行器跟踪误差问题,提出基于Transformer双深度Q网络(DDQN)的强化学习框架,通过自适应波束搜索规划器利用学习到的评论家进行前向估计,实现软件在环的短视域波束搜索,显著降低跟踪误差并提升奖励。

Comments The paper will be reworked significantly

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30914 2026-06-01 cs.LG cs.SE 62%

Automating Formal Verification with Reinforcement Learning and Recursive Inference

用强化学习和递归推理自动化形式验证

Max Tan

机构 * Department of Electrical Engineering and Computer Science(电气工程与计算机科学系) Massachusetts Institute of Technology(麻省理工学院)

专题命中 工具调用 :tool-use(abstract);分类 cs.LG、cs.SE

AI总结 研究通过可验证奖励的强化学习和验证器引导的推理搜索,提升大语言模型生成验证程序和证明的能力,在Dafny和Lean上取得显著进展。

Comments Master's thesis, 140 pages, 16 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30686 2026-06-01 cs.CR cs.AI cs.LG 62%

Depth-Dependent Indirect Prompt Injection in Tool-Calling ReAct Agents: Injection Depth, Payload Framing, and Turn-Budget Sensitivity

工具调用ReAct代理中深度相关的间接提示注入:注入深度、载荷框架和轮次预算敏感性

Mohammadreza Rashidi

机构 * Department of Computer Science(计算机科学系) AI and Media Analysis Lab(人工智能与媒体分析实验室) Berlin, Germany(柏林,德国)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 通过四个对照实验(共460次试验),研究在工具调用ReAct代理中,注入深度、载荷框架和轮次预算对间接提示注入攻击成功率的影响,发现注入深度是主导变量,且仅清理第一个工具观察可捕获67%的注入成功。

Comments 17 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26711 2026-06-01 cs.CL cs.LG 62%

The Need for an External Observer Formalizing the Sufficiency Gap: A Mathematical Extension of Mixture Identifiability and Contextual Grounding in Sequence Models

外部观察者的必要性:充分性差距的形式化——序列模型中混合可识别性与上下文基础化的数学扩展

Francesco Corielli

专题命中 工具调用 :tool use(abstract);分类 cs.CL、cs.LG

AI总结 本文通过构建二元混合过程,形式化了由未观测隐状态导致的充分性差距,并引入辅助信号建立上下文主导阈值,证明温度缩放无法弥补缺失上下文,而外部观察者或验证器在高风险领域是必要的。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30961 2026-06-01 cs.CL 57%

EvoGens: A Population-Based Heuristic Search Framework for Scientific Idea Generation

EvoGens:一种基于种群的启发式搜索框架用于科学思想生成

Xu Li, Hanzhe Tu, Xinyi Li, Kuncheng Zhao, Xun Han, Zhonghui Liu

机构 * Southwest Petroleum University(西南石油大学) Sichuan Police College(四川警察学院)

专题命中 工具调用 :planning(abstract);分类 cs.CL

AI总结 针对现有LLM方法生成科学思想时语义趋同、多样性和新颖性不足的问题,提出EvoGens框架,通过进化搜索(变异、交叉、选择)增强思想探索,显著提升新颖性和多样性。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30563 2026-06-01 cs.AI 57%

Transforming and Encoding FTS for SAT Solving: What Helps, What Hurts (Extended Version)

转换与编码FTS以用于SAT求解:什么有帮助,什么有损害(扩展版)

João Filipe, Álvaro Torralba, Gregor Behnke

机构 * University of Amsterdam, Institute for Logic Language and Computation(阿姆斯特丹大学,逻辑语言与计算研究所) Aalborg University(奥尔堡大学)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 研究如何将因子化任务编码为SAT问题,提出多种编码策略,并分析并行性和任务转换对SAT规划器性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27881 2026-06-01 cs.CL 57%

Retrieval, Reward, and Training Protocols: What Matters in Training Search Agents?

检索、奖励与训练协议:训练搜索代理的关键因素是什么?

Yibo Zhao, Zichen Ding, Jiayi Wu, Zun Wang, Xiang Li

机构 * School of Data Science and Engineering, East China Normal University(东华大学数据科学与工程学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 工具调用 :agent(abstract);分类 cs.CL

AI总结 本文通过控制实验,系统研究了检索语料库、奖励设计和训练协议三个维度对搜索代理训练的影响,发现纠正语料覆盖问题比算法差异更有效,简单的基于结果的奖励方法在多数设置下表现优异,并提出了实用训练指南。

Comments 18pages, 4 figures, and 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23278 2026-06-01 cs.CL stat.ML 57%

When Is Next-Token Prediction Useful? Marginalization, Ergodicity, Mixture Identifiability, Local Sufficiency, RAG, Tools, and Programming

下一个词预测何时有用?边缘化、遍历性、混合可识别性、局部充分性、RAG、工具与编程

Francesco Corielli

专题命中 工具调用 :tool use(abstract);分类 cs.CL

AI总结 本文通过区分完整条件语言过程、边缘文本过程和模型诱导分布,论证了下一个词预测的有效性依赖于强假设(平稳性、代表性、遍历性)以及观察前缀对潜在上下文的充分性,并解释了RAG和工具使用作为条件充分性机制的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30647 2026-06-01 cs.RO 50%

Bidirectional Incremental Generalized Hybrid A*

双向增量广义混合A*

Sidharth Talia, Oren Salzman, Siddhartha Srinivasa

专题命中 工具调用 :planning(abstract)

AI总结 针对复杂动力学系统在非结构化环境中的高效任意时刻运动规划问题,提出双向增量广义混合A*算法,通过双向搜索缓解冻结顶点隐藏解的问题,保证单调成本改进和终止,显著减少扩展次数。

详情

展开后加载摘要…

URL PDF HTML 收藏