arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-21 至 2026-07-21 共收录 23 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 23 篇

2607.17948 2026-07-21 cs.AI cs.MA 新提交 88%

Towards Agentic Agent-based Models: Feasibility, Performance, and Statistical Model Checking

迈向基于智能体的智能体模型:可行性、性能和统计模型检查

Stefano Blando, Emanuele Guerrazzi, Riccardo Porcedda, Giuseppe Squillace, Max Tschaikowski, Andrea Vandin

机构 * Sant’Anna School of Advanced Studies Pisa(比萨圣安娜高等研究学校) Sapienza University of Rome(罗马第一大学) DTU Technical University of Denmark(丹麦技术大学) University of Pisa(比萨大学)

专题命中 工具调用 :agent(title,abstract);agentic(title,abstract);分类 cs.AI

AI总结 研究引入大语言模型驱动决策对基于智能体模型模拟的影响,以Mesa ABM模型为对象,扩展谢林隔离模型,通过统计模型检查进行分析,实验表明较小本地服务LLM有问题,较大模型通过初步检查,还探讨了统计模型检查的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16200 2026-07-21 cs.AI 新提交 88%

Deterministic Replay for AI Agent Systems

人工智能代理系统的确定性重放

Rasheed Mudasiru

专题命中 工具调用 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI

AI总结 研究人工智能代理系统不确定性问题,提出agrepl框架,通过MITM代理拦截外部交互并序列化,在隔离环境重放,形式化执行模型,经实验验证重放保真度高且延迟大幅降低,以Go实现并开源。

Comments 9 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01744 2026-07-21 cs.CL 85%

Octopus v2: On-device language model for super agent

章鱼v2:用于超级代理的设备端语言模型

Wei Chen, Zhiyuan Li

机构 * Stanford University(斯坦福大学)

专题命中 工具调用 :agent(title);AI agent(abstract);workflow(abstract);function calling(abstract)

AI总结 章鱼v2通过设备端20亿参数模型,在准确性和延迟上超越GPT-4,同时将上下文长度减少95%,提升边缘设备应用性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19021 2026-07-21 cs.CR 版本更新 85%

Trustworthy AI LLM Scalability Risk Index (LSRI): A Cybersecurity Framework Assessing Agentic-AI Security & Software Model Supply Chain Safety Boosting AI-Generated Malware Defense & Explainability Mitigating Emerging Risks of Generative AI

大语言模型在代理AI中的可扩展性风险与模型供应链安全

Kiarash Ahi, Vaibhav Agrawal, Saeed Valizadeh

专题命中 工具调用 :agentic(title,abstract);agent(abstract);multi-agent(abstract)

AI总结 本文研究了大语言模型在代理AI中的可扩展性风险及模型供应链安全问题,提出LSRI指数和模型供应链框架,以提升安全关键环境下的LLM部署安全性。

Comments Accepted for publication in Journal of Computer Information Systems (2026). DOI: 10.1080/08874417.2026.2624670

Journal ref Journal of Computer Information Systems (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25624 2026-07-21 cs.CR cs.AI cs.CL cs.LG 版本更新 83%

STAC: When Innocent Tools Form Dangerous Chains for LLM Agents

STAC:当无害工具形成危险链以劫持LLM代理

Jing-Jing Li, Jianfeng He, Chao Shang, Devang Kulshreshtha, Xun Xian, Yi Zhang, Hang Su, Sandesh Swamy, Yanjun Qi

机构 * AWS AI Labs(AWS人工智能实验室) UC Berkeley(伯克利大学)

专题命中 工具调用 :agent(abstract);autonomous agent(abstract);tool use(abstract);tool-use(abstract)

AI总结 STAC通过多轮工具链攻击揭示LLM代理的安全漏洞,提出基于推理的防御策略,显著降低攻击成功率。

Comments Long version with 15 pages in main draft and a total of 39 pages including references and appendix. Data and code \url{https://github.com/amazon-science/MultiTurnAgentAttack}

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16355 2026-07-21 cs.CV cs.AI 新提交 83%

PhysAgent: Reflective Agentic Physics Control for Physically Plausible Video Generation

PhysAgent:用于物理上合理的视频生成的反射式智能体物理控制

Qirui Li, Jinkun Hao, Yibo Li, Ran Yi, Paul L. Rosin, Yu-Kun Lai

机构 * Shanghai Jiao Tong University(上海交通大学) Cardiff University(卡迪夫大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究物理上合理的视频生成问题,提出PhysAgent反射式智能体框架,通过闭环设计及物理控制API,改善参数控制,实现复杂轨迹等,实验证明其能生成更合理视频,有更好提示对齐及泛化效果。

Comments For project page, see https://iapple233.github.io/PhysAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16372 2026-07-21 cs.SE cs.AI cs.LG cs.PL 新提交 82%

AoA: Theorem Proving Agent over Abstract Syntax Tree of Redesigned Language

AoA:基于重新设计语言抽象语法树的定理证明智能体

Qiyuan Xu, Joshua Ong Jun Leang, Renxi Wang, Wenda Li, Haonan Li, Luke Ong, Conrad Watt

机构 * Nanyang Technological University Singapore(南洋理工大学新加坡分校) Imperial College London London, UK(伦敦帝国理工学院伦敦分校) University of Edinburgh Edinburgh, UK(爱丁堡大学爱丁堡分校)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 研究针对交互式定理证明中人工操作限制可扩展性及基于LLM的证明智能体成本高的问题,提出将智能体从源文本提升到抽象语法树的方法,实现了AoA,在多个方面有显著提升且解决更多难题。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32017 2026-07-21 cs.LG cs.AI 版本更新 81%

TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning

TRIAGE:面向智能体强化学习的角色类型化信用分配

Yuanda Xu, Zhengze Zhou, Hejian Sang, Xiaomin Li, Jiaxin Zhang, Xinchen Du, Sen Na, Zhipeng Wang, Alborz Geramifard

机构 * LinkedIn Corporation(领英公司) Harvard University(哈佛大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 提出TRIAGE框架,通过角色类型化信用分配修正GRPO仅依赖结果信用的盲点,在ALFWorld等任务中提升成功率并减少交互步数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18147 2026-07-21 eess.SY cs.AI cs.SY 新提交 79%

LLMs and Agentic AI Systems for Smart Grids: A Tutorial on Architectures and Applications

用于智能电网的大语言模型和智能AI系统:架构与应用教程

Daniela Rojas, Abdulwahab Albassam, Aidan G. Leung, Jett Ngo, Ryan Luo, Peter R. Quawas, Junpyung Kim, Kangkai Liang, Mansi Nanavati, Jonathan Mai, Meng-Chi Tsai, Yun-Tong Tsai, Yize Chen, Yuanyuan Shi

机构 * Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣迭戈分校电气与计算机工程系) Department of Electrical and Computer Engineering, University of Alberta(阿尔伯塔大学电气与计算机工程系)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 研究智能电网中LLMs和智能AI系统,提出基于求解器的设计原则,通过提示策略等构建模块及四个案例研究实例化该原则,比较不同方案,还提出四组评估框架,明确了各部分分工。

Comments 28 pages, 11 figures, 6 tables; plus supplementary material. Review/tutorial article

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17147 2026-07-21 cs.CR cs.CL 新提交 79%

SlotGuard: Stop Oversharing Private Local Context in LLM Agent Transcri

SlotGuard:阻止大语言模型代理转录中过度共享私有本地上下文

Haocheng Xia, Yongjoo Park

机构 * Siebel School of Computing(计算机科学系) Data Science, University of Illinois Urbana-Champaign(数据科学,伊利诺伊大学厄巴纳-香槟分校)

专题命中 工具调用 :agent(title,abstract);分类 cs.CL

AI总结 研究大语言模型代理转录本隐私泄露问题,提出SlotGuard方法,通过重写结构绑定、替换机密值、链接跨轮引用等操作隐藏敏感数据,在保持代理性能的同时大幅降低凭证泄漏率。

Comments ICML 2026 AIWILD

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01549 2026-07-21 cs.CL cs.SE 版本更新 76%

Octopus: On-device language model for function calling of software APIs

章鱼:用于软件API函数调用的设备端语言模型

Wei Chen, Zhiyuan Li, Mingyuan Ma

机构 * Stanford University(斯坦福大学) Harvard University(哈佛大学)

专题命中 工具调用 :function calling(title);分类 cs.CL、cs.SE

AI总结 研究利用设备端大语言模型调用软件API,通过编译数据集微调不同参数模型,提升其API交互能力,提出条件掩码技术和新基准,经微调的Octopus模型在API调用上性能超GPT-4,推动自动化软件开发和API集成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16961 2026-07-21 cs.AI 新提交 72%

Lomekwi: Resource-Bounded Tool Discovery in LLM Agents

洛梅奎:大语言模型智能体中资源受限的工具发现

Roshan Klein-Seetharaman, Daniel Wang, Andrew Xu

机构 * Sea12 Technologies(Sea12科技公司) Yale University(耶鲁大学)

专题命中 工具调用 :tool use(abstract);tool-use(abstract);分类 cs.AI;agentic(comments)

AI总结 研究受认知科学启发区分工具使用与发现,将工具发现分解为好奇心、识别和效率,表明该框架可用于现有任务,证明识别与模型大小成反比,还通过组合博弈及模拟环境观察到反比缩放。

Comments All authors contributed equally. 17 pages, 6 figures. Presented at the 2026 Conference on Learning Theory Workshop on Learning in an Agentic World

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17641 2026-07-21 cs.AI cs.SE 新提交 62%

Verify, Repair, Repeat, or Stop? Robust Stopping for Noisy Verify-Repair Loops in LLM Agents

验证、修复、重复还是停止?大语言模型代理中用于有噪声验证-修复循环的稳健停止方法

Yitao Wu, Si Shen, Rui Yang, Hong Peng, Bin Hu

专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.SE

AI总结 研究大语言模型代理中验证-修复循环有噪声时缺乏停止原则的问题,提出VRR-Stop框架,通过四参数噪声模型和信念过滤估计有效性,依真实边际增益符号决策,配对VRR-Guard,提升了停止可靠性与真实有效性。

Comments 18 pages, 10 figures, 10 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18045 2026-07-21 cs.AI cs.GT cs.MA 新提交 57%

The Shared Discovery Paradox: How a One-Answer Rule Turns Better Information into Worse Search

共享发现悖论:单答案规则如何将更好的信息转化为更差的搜索

Yohei Nakajima

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 研究共享信息时单答案规则导致的发现悖论,通过可精确求解的十六盒模型对比不同情况,指出这是协议失败。还探讨了自利搜索者博弈及共同线索模型,贡献是分离信息等因素为精确可复用量的紧凑基准。

Comments 29 pages, 4 figures. Code, data, and an interactive guide: https://github.com/yoheinakajima/shared-discovery-paradox

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17558 2026-07-21 cs.AI 新提交 57%

Why Does Feedback-Augmented Self-Distillation Fail to Improve Retrieval-Interleaved Search Agents?

为什么反馈增强的自蒸馏不能改进检索交织搜索智能体?

Fan Yang, Rui Meng, Yuxin Wen

机构 * Chapman University(查普曼大学) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)

专题命中 工具调用 :agentic(abstract);分类 cs.AI

AI总结 研究反馈增强的自蒸馏在智能体搜索中失效的原因,发现模型存在解码崩溃现象,因监督信号不一致致学习不稳定,将其分解为模型和提示不一致,引入EMA教师减轻不一致,最终提高模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16851 2026-07-21 cs.AI 新提交 57%

AgentBrew: Lifelong Knowledge Brewing from Strong Teachers to Weak LLM Agents

AgentBrew:从强大教师到弱小语言模型智能体的终身知识酿造

Yangqin Jiang, Chao Huang

机构 * The University of Hong Kong(香港大学)

专题命中 工具调用 :tool-use(abstract);分类 cs.AI

AI总结 研究语言模型智能体知识酿造问题,提出AgentBrew方法,含失败触发教师和学生感知合成两个组件,无需训练,能将教师交互经验提炼到学生外部记忆,经实验验证可产生强大且可部署的智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02528 2026-07-21 q-fin.GN cs.CY cs.LG 版本更新 57%

Auditing Asset-Specific Preferences in Financial Large Language Models: Evidence from Bitcoin Representations and Portfolio Allocation

审计金融大语言模型中的资产特定偏好:来自比特币表征与投资组合配置的证据

Wenbin Wu

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 本研究通过三级审计协议,发现大型语言模型对比特币存在框架依赖的偏好,并识别出模型内部一个可因果干预的比特币选择性特征,该特征能显著影响下游投资组合配置。

Comments 31 pages, 6 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30664 2026-07-21 cs.AI 版本更新 57%

Structure-Induced Information for Rerooting Levin Tree Search

结构信息用于重定根莱文树搜索

Jake Tuero, Michael Buro, Laurent Orseau, Levi H. S. Lelis

机构 * Department of Computing Science, University of Alberta, Edmonton, Canada. Alberta Machine Intelligence Institute (Amii), Edmonton, Canada. Google DeepMind, London, United Kingdom.

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出三种重定根器设计,利用结构信息隐式分解子目标,提升策略树搜索的可扩展性和效率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16842 2026-07-21 cs.LG cond-mat.dis-nn cond-mat.stat-mech cs.SY eess.SY physics.bio-ph 版本更新 57%

Stochastic Resetting Accelerates Reinforcement Learning Beyond Random Search

随机重置加速强化学习中的策略收敛

Jello Zhou, David J. Schwab, Vudtiwat Ngampruetikorn

机构 * Biophysics Program, Stanford University(斯坦福大学生物物理项目) School of Physics, University of Sydney(悉尼大学物理学院) National Institute for Theory and Mathematics in Biology, Northwestern University(生物理论与数学国家研究所,西北大学) The University of Chicago(芝加哥大学) Princeton-CUNY Center for the Physics of Biological Function, The Graduate Center, CUNY(普林斯顿-纽约大学生物物理功能中心,纽约大学研究生中心)

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 研究探讨随机重置与强化学习的交互,发现其能加速策略收敛,通过截断长轨迹提升价值传播,为强化学习提供新的优化机制。

Comments 10 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18089 2026-07-21 eess.SY cs.SY 新提交 50%

Real-Time Flight Test Maneuver Selection with Monte Carlo Tree Search

基于蒙特卡洛树搜索的实时飞行测试机动选择

Nicholas E. Bostock, Helen Pruitt-Kennett, Marc R. Schlichting, Mykel J. Kochenderfer

专题命中 工具调用 :planning(abstract)

AI总结 研究如何在资源限制下安排飞行架次机动动作以降不确定性,提出结合高斯过程与蒙特卡洛树搜索的实时规划框架,用加权综合方差减少评分,经模拟评估,该方法在降不确定性上优于基线,是提高飞行测试效率的有前途方法。

Comments N. E. Bostock and H. Pruitt-Kennett contributed equally. 9 pages, 4 figures. Accepted to the 45th AIAA/IEEE Digital Avionics Systems Conference (DASC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17541 2026-07-21 cs.RO 新提交 50%

Predicting Grasping Compliance in Robotic Hands through Analytical-Model-Informed Neural Networks

通过分析模型驱动的神经网络预测机器人手的抓握顺应性

Qianwen Zhao, Long Wang

机构 * Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 工具调用 :tool use(abstract)

AI总结 研究旨在开发强力交互时抓握工具行为的预测模型,引入分析模型驱动神经网络(AMINN),结合分析力学层与数据驱动学习,在三指欠驱动机器人手上评估,有强预测能力且实现更好物理一致性,推动了物理可解释学习。

Comments Preprint. 9 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17162 2026-07-21 cond-mat.mtrl-sci 新提交 50%

XMatcher: An Open-Source Framework for X-Ray Diffraction Phase Identification

XMatcher:用于X射线衍射相识别的开源框架

Bin Cao

专题命中 工具调用 :workflow(abstract)

AI总结 介绍开源框架XMatcher,用于X射线衍射相识别。它集成多种功能于便携工作流程,能生成理论库、检索候选相、校正匹配并报告指标证据,其AutoMix模块可处理多相模式,通过图形界面提供可解释且可重现的相识别平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14447 2026-07-21 cs.CY 版本更新 50%

Do Generative AI Assistants Respect robots.txt? Tracing Web Access Beyond Visible Answers

生成式人工智能助手是否遵守robots.txt?追踪可见答案之外的网络访问

Gabriel Lopez-Fonseca, David Rodriguez, Stefan Bechtold, Jose M. Del Alamo

专题命中 工具调用 :agent(abstract)

AI总结 研究探讨生成式AI助手是否遵守robots.txt,对十个有网络搜索功能的AI助手进行实证研究,通过特定配置和条件评估其对http URL规则的遵守情况,发现不同助手差异大,结果引发相关法律治理问题及对更新标准的需求。

详情

展开后加载摘要…

URL PDF HTML 收藏