arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-08 至 2026-07-08 共收录 13 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 13 篇

2607.05773 2026-07-08 cs.AI 新提交 85%

Beyond Static Evaluation: Building Simulation Environments for Scalable Agentic Reinforcement Learning

超越静态评估:构建用于可扩展智能体强化学习的模拟环境

Akshay Arora, Ishan Nigam, Ashutosh Aggarwal, Shefali Bansal, Krishna Singh, Sweta Kumari, Nikhil Mittal, Shariq Farhan, Siddarth Malreddy

机构 * Uber AI Solutions(优步人工智能解决方案)

专题命中 工具调用 :agentic(title);agent(abstract);autonomous agent(abstract);tool use(abstract)

AI总结 研究针对大语言模型成为自主智能体后传统静态评估失效的问题,引入AgenticAI-Supervisor平台,通过API和UI驱动构建强化学习环境,运用可验证执行结果、多维奖励塑造及严格验证测试,以客户支持智能体案例展示核心能力及未来工作重点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05790 2026-07-08 cs.AI 新提交 83%

Controlling Tool Use with Heading-Specific Activation Steering

通过特定标题激活控制工具使用

Yuqi Chen, Vincent Siu, Yang Liu, Dawn Song, Chenguang Wang

专题命中 工具调用 :tool use(title,abstract);tool-use(abstract);分类 cs.AI

AI总结 研究工具增强大语言模型中工具使用决策的稳定内部表示,通过从标题锚点位置提取引导向量对工具调用行为进行双向因果控制,发现其因果有效性与线性结构不符,还区分了工具使用引导向量与参数化概念的引导向量,二者关系待解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05518 2026-07-08 cs.CR cs.AI 新提交 83%

aiAuthZ: Off-Host, Identity-Bound Authorization for AI Agents

aiAuthZ:人工智能代理的远程、身份绑定授权

Sai Varun Kodathala

机构 * SportsVision AI

专题命中 工具调用 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究人工智能代理授权问题,提出aiAuthZ授权网关,通过消息签名验证身份、评估策略,加入审计日志并生成认证收据,有效降低攻击成功率,保障代理调用安全,减少决策延迟。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23236 2026-07-08 cs.LG cs.AI cs.AR cs.MA cs.PF 版本更新 81%

KernelEvolve: Scaling Agentic Kernel Coding for Heterogeneous AI Accelerators at Meta

KernelEvolve:为Meta异构AI加速器扩展智能内核编码

Gang Liao, Hongsen Qin, Ying Wang, Alicia Golden, Michael Kuchnik, Yavuz Yetim, Jia Jiunn Ang, Chunli Fu, Yihan He, Samuel Hsia, Zewei Jiang, Dianshi Li, Uladzimir Pashkevich, Varna Puvvada, Feng Shi, Matt Steiner, Ruichao Xiao, Liyuan Li, Nathan Yan, Xiayu Yu, Zhou Fang, Roman Levenstein, Kunming Ho, Haishan Zhu, Alec Hammond, Richard Li, Ajit Mathews, Kaustubh Gondkar, Abdul Zainul-Abedin, Ketan Singh, Hongtao Yu, Wenyuan Chi, Barney Huang, Sean Zhang, Noah Weller, Zach Marine, Wyatt Cook, Carole-Jean Wu, Gaoxiang Liu

机构 * Meta Platforms(Meta平台)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对深度学习推荐模型训练和推理面临的异构性挑战,提出KernelEvolve框架,通过多编程抽象自动生成和优化内核,经实验验证其正确性,大幅提升性能并降低新AI硬件可编程性障碍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05999 2026-07-08 cs.AI 新提交 79%

AgoraSim: A Hybrid Agent-Based Modeling Framework

AgoraSim:一个基于混合智能体的建模框架

Chung-Chi Chen

机构 * Human-Agent Ally Lab (HAA Lab)(人机协作实验室(HAA实验室)) National Institute of Informatics, Japan(日本国立信息学研究所)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 针对大语言模型智能体模拟输出易被过度解读及难与社会动态比较的问题,提出AgoraSim框架,能将文本等解析为可编辑配置,运行混合智能体群体并比较场景,通过多种接口公开,助用户检查轨迹、比较假设及识别需验证的案例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20023 2026-07-08 cs.SE cs.AI cs.CL 新提交 76%

When Lower Privileges Suffice: Investigating Over-Privileged Tool Selection in LLM Agents

当较低权限足够时:探究LLM代理中的过度权限工具选择

Kaiyue Yang, Yuyan Bu, Jingwei Yi, Yuchi Wang, Biyu Zhou, Juntao Dai, Songlin Hu, Yaodong Yang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Beijing Academy of Artificial Intelligence(北京人工智能研究院) The Chinese University of Hong Kong(香港中文大学) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 工具调用 :agent(abstract,comments);tool use(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 针对LLM代理在工具选择中偏好高权限工具的安全问题,提出ToolPrivBench评估框架,发现主流代理普遍存在过度权限选择且被瞬态故障放大,并设计权限感知后训练防御方法有效减少不必要的高权限工具使用。

Comments code: https://github.com/AISafetyHub/agent-tool-selection-bias

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06155 2026-07-08 cs.FL cs.CC cs.CL 新提交 74%

When Does Tool Use Increase the Expressive Power of Finite-Precision Recurrent Models?

工具使用何时会增强有限精度循环模型的表达能力?

Nikola Zubić, Qian Li, Yuyi Wang, Davide Scaramuzza

机构 * Robotics and Perception Group University of Zurich(机器人感知组苏黎世大学) Shenzhen International Center for Industrial and Applied Mathematics(深圳国际工业与应用数学中心) Shenzhen Research Institute of Big Data(深圳大数据研究 institute) Tengen Intelligence Institute CRRC Zhuzhou Institute(腾云智能研究院 CRRC 长沙研究所)

专题命中 工具调用 :tool use(title);分类 cs.CL

AI总结 研究工具使用对有限精度循环模型表达能力的影响,通过将模型建模为与预言机交互的有限状态控制器,得出有限状态工具基本不增加表达能力,单个无限状态磁带使系统图灵完备,且特定单层控制器可实现此构造的结论。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24245 2026-07-08 cs.SE cs.AI cs.CR 新提交 62%

AutoSpec: Safety Rule Evolution for LLM Agents via Inductive Logic Programming

AutoSpec: 通过归纳逻辑编程实现LLM智能体的安全规则演化

Pingchuan Ma, Zhaoyu Wang, Zimo Ji, Yuguang Zhou, Zhantong Xue, Zongjie Li, Shuai Wang, Xiaoqin Zhang

机构 * Zhejiang University of Technology(浙江工业大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出AutoSpec框架,利用归纳逻辑编程引导的CEGIS自动演化专家定义的安全规则,平衡精确率和召回率,在代码执行和具身智能体领域将F1提升至0.98和0.93,减少高达94%的误报。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06066 2026-07-08 cs.AI 新提交 57%

Reward-Density Heuristic for Dynamic Multi-Vehicle Routing: Performance and Computational Efficiency

动态多车辆路径规划的奖励密度启发式算法:性能与计算效率

Manish Kolachalam, Rani Malhotra

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 研究动态多车辆路径规划问题,提出奖励密度启发式算法(效率启发式算法),在自主无人机任务分配和城市出租车调度等领域评估,该算法与多种经典和元启发式算法比较,在奖励与计算前沿占优,解质量相当但规划时间少,为实时分配调度系统提供实用原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05970 2026-07-08 cs.IR cs.AI 新提交 57%

Faithful or Findable? Evaluating LLM-Generated Metadata for RDF Dataset Search

忠实还是可查找?评估用于RDF数据集搜索的大语言模型生成的元数据

Riccardo Terrenzi, Serkan Ayvaz

机构 * University of Southern Denmark(南部丹麦大学)

专题命中 工具调用 :agentic(abstract);分类 cs.AI

AI总结 研究RDF数据集六种元数据生成设置,评估其检索有效性与忠实性。发现无约束重写检索增益强但忠实性低,更有根据的设置提高了忠实性,基于配置文件的重写权衡最佳,将合成元数据定位为需综合评估多方面的系统级信息检索问题。

Comments 5 pages, 1 figure, accepted at SynthIR @ SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05708 2026-07-08 cs.AI 新提交 57%

Akashic: A Low-Overhead LLM Inference Service with MemAttention

Akashic:一种基于内存注意力机制的低开销大语言模型推理服务

Yang Liu, Zhaokai Luo, Huayi Jin, Ruozhou He, Chenchen Hong, Zhiyong Wang, Yifei Liu, Yunfei Gu, Chentao Wu, Junhao Hu

机构 * Xiaohongshu Inc.(小红书公司) ShangHai JiaoTong University(上海交通大学) Peking University(北京大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 针对大语言模型推理中重放完整历史记录不切实际的问题,提出基于内存注意力机制的低开销内存系统Akashic,通过组织上下文成有界块、建模块间语义关系及应用软硬件协同设计内存放置,提升了任务准确率、吞吐量和可持续请求率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04024 2026-07-08 cs.CV cs.AI 版本更新 57%

Volumetric Directional Diffusion: Anchoring Uncertainty Quantification in Anatomical Consensus for Ambiguous Medical Image Segmentation

体积方向扩散:在模糊医学图像分割的解剖学共识中锚定不确定性量化

Chao Wu, Mahesh Bhosale, Kangxian Xie, Pouya Karimian, David Doermann, Mingchen Gao

机构 * Department of Computer Science and Engineering University at Buffalo, SUNY Buffalo, NY, USA(计算机科学与工程系,布法罗大学,纽约州,布法罗,美国)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 针对模糊医学图像分割中不同专家边界描绘有差异的问题,提出体积方向扩散(VDD)框架,以粗略共识预测为锚点,学习方向扩散过程生成边界变化,实验表明该方法能在保持精度和结构一致性时改善不确定性分布对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06374 2026-07-08 cs.CV 新提交 50%

VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery

花瓶博物馆:古希腊陶器数字智能博物馆

Jiazi Wang, Nonghai Zhang, Qiushi Xie, Zeyu Zhang, Yufeng Chen, Yang Zhao, Ling Shao, Hao Tang

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) School of Computer Science, Peking University(北京大学计算机科学学院) Huazhong University of Science and Technology(华中科技大学) Department of Computer Science and Information Technology, La Trobe University(拉筹伯大学计算机科学与信息技术系) UCAS-Terminus AI Lab, University of Chinese Academy of Sciences(中国科学院大学UCAS-Terminus人工智能实验室)

专题命中 工具调用 :agent(abstract)

AI总结 针对古希腊陶器文化遗产领域中视觉语言模型面临的挑战,提出轻量级模块化多模态智能体框架花瓶博物馆,结合虚拟博物馆与花瓶智能体,经多模态感知等操作,提高引用有效性,减少幻觉并产生更中立答案。

Comments Code: https://github.com/AIGeeksGroup/VaseMuseum. Website: https://aigeeksgroup.github.io/VaseMuseum

详情

展开后加载摘要…

URL PDF HTML 收藏