SAGA: Schema-Aware Grounding for Agentic Text-to-SPARQL Generation
SAGA:用于智能文本到SPARQL生成的模式感知基础
专题命中 工具调用 :agentic(title);分类 cs.AI、cs.LG
AI总结 研究复杂知识库问答中语义解析范式,针对现有智能体类型盲基础问题,提出无训练框架SAGA,通过模式约束基础操作,维护类型状态,过滤候选属性,以紧凑格式呈现图模式,在多基准设置上取得优异成绩。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
SAGA:用于智能文本到SPARQL生成的模式感知基础
专题命中 工具调用 :agentic(title);分类 cs.AI、cs.LG
AI总结 研究复杂知识库问答中语义解析范式,针对现有智能体类型盲基础问题,提出无训练框架SAGA,通过模式约束基础操作,维护类型状态,过滤候选属性,以紧凑格式呈现图模式,在多基准设置上取得优异成绩。
FedAgentKE:异构智能体的联邦语义知识演化
专题命中 工具调用 :agent(abstract);tool use(abstract);workflow(abstract)
AI总结 研究异构智能体孤立运行问题,提出 FedAgentKE 框架,通过语义知识蒸馏、聚合和Adapt实现联邦语义知识演化,实验验证其在跨框架和跨任务设置下能改进智能体协作,为未来协作智能体生态系统发展提供潜力。
Comments 9 pages (including appendix)
给定增量的埃塔:用边际工具效用定义大语言模型工具效率
机构 * Foam(泡沫)
专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 研究提出用于评估LLM智能体轨迹中工具调用率的工具效率及边际工具效用指标,用LLM-as-a-Judge确定边际工具效用符号,区别于间接测效率的 prior work,直接测效率,为LLM评估研究及相关工程做贡献。
低延迟系统中的工具制作与自我进化大语言模型智能体
机构 * Amazon(亚马逊)
专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.CL、cs.LG、cs.SE
AI总结 研究如何解决生产LLM智能体因重复生成代码浪费延迟和可靠性的问题,提出用智能工具制作管道取代推理时编码循环,部署该方法使系统更快、更可靠、易操作,降低延迟和错误率,提高可审计性。
Comments Preprint
SkillFuzz: 面向开放技能市场中隐式意图发现的技能组合模糊测试
机构 * School of Computer Science and Informatics, University of Liverpool(利物浦大学计算机科学与信息学学院) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 工具调用 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 提出SkillFuzz,首个无需执行的模糊测试方法,通过提取结构化技能契约并利用契约引导的蒙特卡洛树搜索,在开放技能市场中高效发现因技能组合导致的隐式意图,验证了80%以上高风险组合。
Comments Under Review
Object Aligner: 一种可配置的图结构JSON模式相似度评分,应用于LLM提示优化
机构 * Artificial Intelligence Center, Faculty of Electrical Engineering, Czech Technical University in Prague(捷克理工大学电气工程学院人工智能中心)
专题命中 工具调用 :planning(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出Object Aligner,一种基于递归树对齐和引用对齐的JSON相似度评分方法,通过Weisfeiler-Leman颜色细化近似图同构,用于LLM输出评估和提示优化。
Comments 28 pages, This is a submitted version of a manuscript under review at IEEE Access; it has not been peer reviewed
AgonAlpha:通过提示经济与可扩展智能体搜索实现自主阿尔法发现
机构 * The Chinese University of Hong Kong(香港中文大学) ; University of Maryland(马里兰大学)
专题命中 工具调用 :agentic(title);分类 cs.AI
AI总结 AgonAlpha是首个结合经验证构件搜索、对抗审核器与并行预算分配的阿尔法挖掘系统,在WorldQuant BRAIN部署后产出SPECTACULAR级阿尔法,为交易因子自主研究提供了完整证据轨迹。
VectraYX-Vision-1B:一款具备结构化视觉推理与原生工具使用能力的20亿参数以下西班牙语/拉丁美洲网络安全多模态模型
专题命中 工具调用 :tool use(title);分类 cs.CL
AI总结 本研究推出VectraYX-Vision-1B,一款20亿参数以下西班牙语/拉丁美洲网络安全多模态模型,支持结构化推理与工具调用,针对网络UI优化,同时报告了其视觉定位的负面结果及相关修复方案,开源了模型与数据。
Comments 11 pages, 1 figure
CEDAR:面向复杂系统目标导向优化的智能体编排树搜索算法
机构 * Sakana AI
专题命中 工具调用 :agent(title);分类 cs.AI
AI总结 针对复杂系统目标导向设计的难题,提出基于LLM智能体的CEDAR方法,通过LLM驱动的MCTS实现复杂系统的目标导向发现,减少人力投入并促进其跨领域应用。
Comments Accepted as Talk in ALIFE 2026: The 2026 Conference on Artificial Life
BiCAA:面向搜索增强智能体的双向信用分配
专题命中 工具调用 :agent(title);分类 cs.CL
AI总结 针对搜索增强智能体多步搜索任务中普通GRPO的稀疏监督问题,提出BiCAA双向信用分配框架,融合前向可解性增益与后见成功关键性构建密集过程奖励,实现稳定策略优化并取得有竞争力的QA性能。
智能体神经架构搜索
机构 * Artificial Intelligence Graduate School, Ulsan National Institute of Science and Engineering(人工智能研究生院,乌山科学与工程研究院) ; Department of Computer Science and Engineering, Ulsan National Institute of Science and Engineering(计算机科学与工程系,乌山科学与工程研究院)
专题命中 工具调用 :agentic(title);分类 cs.AI
AI总结 研究探索LLM驱动设计与NAS驱动搜索的分工,提出用LLM生成种子架构并分解为带插槽架构供NAS搜索的机制,在AgentNAS中实例化,在多任务上表现出色,两种搜索机制互补。
工具使用何时会增强有限精度循环模型的表达能力?
机构 * Robotics and Perception Group University of Zurich(机器人感知组苏黎世大学) ; Shenzhen International Center for Industrial and Applied Mathematics(深圳国际工业与应用数学中心) ; Shenzhen Research Institute of Big Data(深圳大数据研究 institute) ; Tengen Intelligence Institute CRRC Zhuzhou Institute(腾云智能研究院 CRRC 长沙研究所)
专题命中 工具调用 :tool use(title);分类 cs.CL
AI总结 研究工具使用对有限精度循环模型表达能力的影响,通过将模型建模为与预言机交互的有限状态控制器,得出有限状态工具基本不增加表达能力,单个无限状态磁带使系统图灵完备,且特定单层控制器可实现此构造的结论。
Comments 24 pages
超越下一个词预测:Atlassian工作流中工具使用代理的RLVR概念验证
机构 * Centific
专题命中 工具调用 :tool-use(title);分类 cs.AI
AI总结 针对企业SaaS工作流中LLM因目标不匹配导致的静默失败,提出在目标环境中直接应用可验证奖励强化学习(RLVR),在五个合成Jira/Confluence环境中训练Qwen模型,将平均奖励从0.35-0.92提升至0.95-1.00。
流式工具使用何时有帮助?表征流式检索增强生成中的工具意图稳定化
机构 * SMG Labs(SMG实验室)
专题命中 工具调用 :tool use(title);分类 cs.CL
AI总结 通过测量工具意图稳定化(即推测查询收敛到答案的时间点),在CRAG基准上分析流式RAG的延迟隐藏效果,发现73.9%的查询可实现显著延迟隐藏,并识别早期与晚期稳定化的预测因素。
通过训练期间回收零方差查询实现智能体搜索的有效强化学习
机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) ; Instituto Superior Técnico and INESC-ID, University of Lisbon(里斯本大学理工学院和INESC-ID) ; NOVA LINCS, NOVA School of Science and Technology(NOVA科学与技术学院LINCS)
专题命中 工具调用 :agentic(title);分类 cs.AI
AI总结 提出查询回收方法,将训练中零方差查询重新投入采样池,使有效训练分布随策略演化,1.7B模型在7个多跳QA基准上平均Pass@1达66.0,匹配或超越7B模型。
恢复自动研究智能体中浪费的计算资源
机构 * Columbia University(哥伦比亚大学) ; Georgetown University(乔治城大学) ; Capital One(第一资本金融公司)
专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 本文针对自动研究智能体应用于表格数据集时的四类计算资源浪费问题,提出针对性干预措施,仅通过优化智能体设计即可大幅提升其性能。
DOCSCHISEL:面向大语言模型智能体的自适应工具文档优化框架
专题命中 工具调用 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对LLM智能体工具文档的异质性与泛化问题,提出DocsChisel自适应优化框架,经实验较原始文档及EasyTool、DRAFT基线大幅提升任务成功率,且开销有限。
有特权但有偏差:PI条件化教师如何破坏自蒸馏
机构 * Microsoft Research(微软研究院)
专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 该研究发现,以特权信息为条件的自蒸馏在低难度任务上有效,但在困难任务上会因特权信息偏差导致模型推理能力下降,其优化信号与任务成功脱钩。
分数并非决策:大语言模型智能体工具获取的成本感知停止策略
专题命中 工具调用 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.LG
AI总结 针对LLM智能体工具获取的异构成本问题,提出CAM-DF及其轻量变体,通过训练停止决策的离线差距实现成本感知停止,在1343个任务上验证其优于基线,减少工具接触量的同时保持任务成功率。
ToolSciVer:基于视觉工具增强强化学习的多模态科学声明验证
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; University of Waterloo(滑铁卢大学)
专题命中 工具调用 :tool use(abstract);tool-use(abstract);分类 cs.AI、cs.CL
AI总结 研究多模态科学声明验证问题,提出ToolSciVer框架,为视觉语言模型配备三种类型感知视觉工具,用组相对策略优化训练策略,实验证明该方法在多模型上性能优于竞争基线。
服务代理何时应重新考虑?客户服务运营中的难度路由控制
机构 * The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 工具调用 :tool-use(abstract);workflow(abstract);分类 cs.AI、cs.CL
AI总结 提出一种难度路由的服务控制架构,通过轻量级路由器将常规会话与操作耦合会话分流,在关键后端写入前集中审查,提升零售和航空任务的可靠性。
AI采纳与能力的开源经济指数
机构 * University of Michigan(密歇根大学) ; AT&T Chief Data Office(AT&T首席数据办公室) ; IFM-MBZUAI
专题命中 工具调用 :AI agent(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 通过公开聊天数据和O*NET任务构建开源经济指数,衡量AI在各职业的采纳率与任务执行能力,发现金融、计算机和艺术行业采纳率最高。
AdversaBench: 基于多裁判确认与跨模型迁移性的自动化大语言模型红队测试
机构 * Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校)
专题命中 工具调用 :tool use(abstract);tool-use(abstract);分类 cs.AI、cs.CL
AI总结 提出AdversaBench端到端红队测试流水线,使用五种结构化算子变异种子提示,通过三裁判加元裁判机制确认失败,实验发现算子效果因类别而异、二元失败率掩盖难度、裁判一致性受标签偏斜影响、对抗提示可跨模型迁移。
Comments 10 pages, 4 figures, 5 tables. Code and data at https://github.com/khanak0509/AdversaBench
学习搜索的艺术以实现自动发现
机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) ; Université de Montréal and Mila- Quebec AI Institute(蒙特利尔大学和Mila-魁北克人工智能研究所)
专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 提出ARTS方法,利用推理语言模型在假设与实验空间中迭代搜索,通过测试时训练解决上下文长度问题,在22个任务上优于现有算法,相对提升超15.3%。
LoopCoder-v2: 仅循环一次以实现高效的测试时计算扩展
机构 * Beihang University(北京航空航天大学) ; IQuest Research ; Langboat(浪波) ; Renmin University of China(中国人民大学)
专题命中 工具调用 :tool-use(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 本文提出并行循环Transformer(PLT)并研究循环次数选择,发现两循环变体在代码生成等任务上显著提升,而三循环以上性能下降,揭示了增益-成本权衡。
Dr-DCI: 通过动态工作空间扩展实现直接语料交互的规模化
机构 * University of Toronto(多伦多大学) ; Texas A&M University(德克萨斯A&M大学) ; University of Waterloo(滑铁卢大学) ; UC San Diego(加州大学圣迭戈分校) ; Verdent AI ; Netmind AI
专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 提出DR-DCI框架,将检索作为智能体可调用的动作来动态扩展本地工作空间,结合检索器的召回能力与DCI的局部操作精度,实现大规模语料上的高效搜索与验证。
Comments 25 pages, 4 figures, 22 tables
VATS: 通过系统性变异利用错误路径注入中的隐式权威
机构 * Harshil Patel ; Kunal Pai
专题命中 工具调用 :autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 提出VATS框架,通过七维变异生成对抗性负载,利用错误消息的隐式权威绕过安全机制,在四个前沿模型上实现高达100%的注入成功率。
Comments Published at Second Workshop on Agents in the Wild: Safety, Security, and Beyond (ICML 2026 AIWILD)
洛梅奎:大语言模型智能体中资源受限的工具发现
机构 * Sea12 Technologies(Sea12科技公司) ; Yale University(耶鲁大学)
专题命中 工具调用 :tool use(abstract);tool-use(abstract);分类 cs.AI;agentic(comments)
AI总结 研究受认知科学启发区分工具使用与发现,将工具发现分解为好奇心、识别和效率,表明该框架可用于现有任务,证明识别与模型大小成反比,还通过组合博弈及模拟环境观察到反比缩放。
Comments All authors contributed equally. 17 pages, 6 figures. Presented at the 2026 Conference on Learning Theory Workshop on Learning in an Agentic World
GSpyNetTree - O4:第四次LIGO - Virgo - KAGRA观测运行中使用的事件验证工具
专题命中 工具调用 :tool use(title)
AI总结 研究针对引力波探测器数据中的毛刺问题,在第四次LIGO - Virgo - KAGRA观测运行中部署GSpyNetTree - O4工具。通过新架构、扩充训练集及校准校正等方法,该工具在毛刺识别和无毛刺样本判断上表现良好,提高了引力波事件验证工作流程的自动化。
Comments 23 pages, 16 figures
缓解可靠高效搜索智能体的上下文干扰
机构 * The Chinese University of Hong Kong(香港中文大学) ; University College London(伦敦大学学院) ; Zhejiang University(浙江大学) ; The University of Hong Kong(香港大学) ; The University of Edinburgh(爱丁堡大学)
专题命中 工具调用 :agent(abstract);AI agent(abstract);分类 cs.CL
AI总结 本文针对多轮搜索智能体的上下文干扰问题,提出基于蒸馏的上下文优化器,将其纳入RL训练后可显著提升搜索智能体的可靠性与效率,开创了AI智能体“先优化上下文再生成”的新范式。