arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-23 至 2026-06-23 共收录 325 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 20 篇

2606.21129 2026-06-23 cs.CR cs.OS 新提交 87%

AgenticOS: An Intent-Oriented Secure Operating System Architecture for Autonomous AI Agents

AgenticOS: 面向自主AI代理的意图导向安全操作系统架构

Zhen Zhao, Yu Zhang, Yanpeng Zhu, Jia Wang, Songqiao Tao, Xin Cheng, Jiexin Gao

专题命中 工具调用 :AI agent(title);agent(abstract);autonomous agent(abstract);tool use(abstract)

AI总结 针对LLM驱动代理面临的结构性安全挑战,提出AgenticOS架构,将OS从资源管理器重构为意图过滤器,通过四层架构和意图ABI实现最小权限环境。

Comments 11 pages,5 figures,1 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20570 2026-06-23 cs.NI cs.AI cs.DC cs.MA 新提交 85%

Infrastructure for the Agentic Web: Gap Analysis and Architecture from the Agentverse Platform

代理网络的基础设施:来自Agentverse平台的差距分析与架构

Robin Dey, Panyanon Viradecha

机构 * OpenHub Research(开放 hub 研究)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文通过实证审计Agentverse平台,识别出8类62项缺失能力,提出七层代理云栈参考架构,并规划了从存储到经济原语的五条关键演进路径,为2030年实现Web4代理云提供技术路线。

Comments 28 pages, 11 tables, 1 figure. Preprint, not peer-reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21316 2026-06-23 hep-ph 新提交 81%

Large Language Model-Assisted Framework for BSM Model Building

大型语言模型辅助的BSM模型构建框架

Shaikh Saad

专题命中 工具调用 :agent(summary_cn,abstract)

AI总结 提出bsm_agent框架,结合确定性物理后端与LLM聊天接口,通过自然语言指定新场量子数,自动构建可重整拉氏量、检查规范反常、导出对称性破缺条件与质量矩阵,确保结果可重复。

Comments 49 pages. Includes a Python package for BSM model building via LLM chat from user-specified particle quantum numbers. Code: https://github.com/saad-hep/bsm_agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21553 2026-06-23 cs.CL cs.IR 新提交 80%

Dissecting Agentic RAG: A Component Ablation for Multi-Hop QA with a Local 7B Model

解析智能体RAG:基于本地7B模型的多跳问答组件消融研究

Sheroz Shaikh

机构 * Independent Researcher(独立研究员)

专题命中 工具调用 :agentic(title,abstract);分类 cs.CL

AI总结 通过消融实验,发现固定混合检索和短检索循环对多跳问答贡献最大,自适应路由和深度循环并非必要。

Comments 8 pages, 4 figures, 4 tables. Code: https://github.com/sherozshaikh/agentic-rag-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20113 2026-06-23 cs.CL cs.IR 新提交 74%

When Does Streaming Tool Use Help? Characterizing Tool-Intent Stabilization in Streaming Retrieval-Augmented Generation

流式工具使用何时有帮助?表征流式检索增强生成中的工具意图稳定化

Elroy Galbraith

机构 * SMG Labs(SMG实验室)

专题命中 工具调用 :tool use(title);分类 cs.CL

AI总结 通过测量工具意图稳定化(即推测查询收敛到答案的时间点),在CRAG基准上分析流式RAG的延迟隐藏效果,发现73.9%的查询可实现显著延迟隐藏,并识别早期与晚期稳定化的预测因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21891 2026-06-23 cs.AI cs.CL 新提交 73%

Learning the ARTS of Search for Automated Discovery

学习搜索的艺术以实现自动发现

Gurusha Juneja, Arnav Kumar Jain, Deepak Nathani, William Yang Wang, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Université de Montréal and Mila- Quebec AI Institute(蒙特利尔大学和Mila-魁北克人工智能研究所)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出ARTS方法,利用推理语言模型在假设与实验空间中迭代搜索,通过测试时训练解决上下文长度问题,在22个任务上优于现有算法,相对提升超15.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23277 2026-06-23 cs.AI 新提交 70%

GIF: Locally Sound Geometric Information Flow Control for LLMs

GIF: 局部几何信息流控制用于大语言模型

Adam Storek, Nikolaus Holzer, Zhuo Zhang, Suman Jana

机构 * Columbia University(哥伦比亚大学)

专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 提出GIF框架,利用LLM雅可比矩阵和局部输出几何上界香农互信息,实现可扩展的信息流追踪,在提示注入和隐私泄露任务中达到近完美召回,且计算成本低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21124 2026-06-23 cs.AI cs.IR 新提交 70%

PulseCX: Breaking the Closed-World Assumption in Real-Time CX

PulseCX:打破实时客户体验中的封闭世界假设

Rajat Agarwal, Suvidha Tripathi, Shubham Sharma

机构 * Sprinklr AI, Gurugram, India(Sprinklr AI,古尔冈,印度)

专题命中 工具调用 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 提出PulseCX框架,通过解耦知识获取与消费,采用异步代理和衰减感知时序知识图谱(DA-TKG)管理信息生命周期,结合分层意图门控消除同步搜索瓶颈,在动态环境中提升意图解析率和客户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20625 2026-06-23 cs.AI cs.CL cs.LG 新提交 67%

AlphaMemo: Structured Search-Process Memory for Self-Evolving Alpha Mining Agents

AlphaMemo: 用于自我进化的Alpha挖掘智能体的结构化搜索过程记忆

Hang Yu, Zifan Zheng, Jeff Z. Pan, Tongliang Liu, Zhiyong Wang, Fengxiang He

机构 * University of Sydney(悉尼大学) University of Edinburgh(爱丁堡大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出AlphaMemo,一种具有结构化搜索过程记忆的自我进化Alpha挖掘智能体,通过记录编辑模式在特定父因子上下文中的成败证据,结合置信门控残差记忆和非对称否决控制,提升样本外表现和固定预算发现效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21975 2026-06-23 cs.AI cs.LG 新提交 62%

IRumAI: Reinforcement Learning for Indian Rummy

IRumAI: 面向印度拉米纸牌游戏的强化学习

Vignesh Mohan

机构 * IEEE

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出首个面向印度拉米纸牌游戏的强化学习智能体IRumAI,采用PPO、融合感知编码、死牌驱动奖励和双分支卷积架构,在仅对弱启发式训练后,以53.9%胜率击败最强搜索对手,推理速度比最优启发式快7000倍以上。

Comments 9 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22909 2026-06-23 cs.DB cs.AI cs.IR 新提交 57%

Graph-Enhanced Large Language Models for Spatial Search

用于空间搜索的图增强大型语言模型

Nicole R. Schneider, Kent O'Sullivan, Hanan Samet

机构 * University of Maryland(马里兰大学) University of Sydney(悉尼大学)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 针对大语言模型空间推理能力不足的问题,提出图增强方法,将空间数据以图形式存储并与检索增强生成结合,提升复杂空间问题回答能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22840 2026-06-23 cs.LG 新提交 57%

RLM-Cascade: Response-Level Speculative Decoding for Cost-Efficient LLM API Serving

RLM-Cascade:用于成本高效LLM API服务的响应级推测解码

Haifeng Wu, Srinivasan Manoharan, Fangbo Tu, Junhua Zhao, Jian Wan

机构 * PayPal

专题命中 工具调用 :agentic(abstract);分类 cs.LG

AI总结 提出RLM-Cascade代理层系统,通过响应级推测解码降低LLM API成本,在真实编码工作负载上实现45.8%成本降低和1.83倍延迟加速,同时保持或超越基线质量。

Comments 9 pages, 1 figure, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22698 2026-06-23 cs.CR cs.CL 新提交 57%

Black-Box Forensics for Conversational LLM Agents

对话式LLM代理的黑盒取证

Isadora White, Yasaman Jafari, Taylor Berg-Kirkpatrick

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 工具调用 :agent(abstract);分类 cs.CL

AI总结 研究通过非对抗对话识别对话代理的基座模型(归因)和系统提示(指纹识别),归因准确率达98%,指纹识别对未见提示的AUC达0.943。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22385 2026-06-23 cs.AI cs.CE 新提交 57%

MetaPS: Adaptive Programmatic Strategy Selection for Market Agents

MetaPS:面向市场智能体的自适应程序化策略选择

Jiaxiang Chen, Aotian Luo, Zhouyi Zheng, Weiyi Huang, Chi Zhang, Zenglin Xu

机构 * Fudan University(复旦大学) TensorPacific

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出MetaPS框架,通过模拟市场回滚候选策略并生成监督微调数据,使智能体自适应选择程序化策略,在股票交易和商品交换实验中优于固定策略和直接决策方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22013 2026-06-23 cs.LG cs.PF 新提交 57%

Load Testing for Machine Learning Model Serving Systems at Scale

大规模机器学习模型服务系统的负载测试

Amr S. Abdelfattah, Nakul Tirumalai, Indu Mohanan, Xiao Li, Pengchao Wang, Dinakar Dhurjati, Eric Sung

机构 * Meta Inc.(Meta公司)

专题命中 工具调用 :planning(abstract);分类 cs.LG

AI总结 提出自适应反馈驱动的负载测试框架Sys,通过实时性能信号和收敛检测,在SLO约束下高效识别最大可持续吞吐量,显著提升GPU资源效率并减少服务事故。

Comments The paper is accepted at ECSA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21416 2026-06-23 cs.DC cs.SE 新提交 57%

Bridging Design and Execution: A Visual Graph Editor for Edge and Cloud Workflows

桥接设计与执行:面向边缘和云工作流的可视化图形编辑器

Katarina-Glorija Grujić, Nikola Stanković, Maja Vukasović, Miloš Simić

专题命中 工具调用 :workflow(abstract);分类 cs.SE

AI总结 提出一种领域特定可视化图形编辑器,通过内核、共享内存节点和事件触发器三种抽象,支持边缘和云应用的模块化设计,自动序列化为可执行表示,弥合设计与部署的鸿沟。

Comments 12 pages, published at the 16th International Conference on Information Society and Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23166 2026-06-23 cs.LG cond-mat.mtrl-sci 新提交 57%

Substitution-Based Analysis of Structural Novelty for Generative Models of Materials

基于替换分析的材料生成模型结构新颖性评估

Masahiro Negishi, Aron Walsh

机构 * Imperial College London(伦敦帝国学院)

专题命中 工具调用 :workflow(abstract);分类 cs.LG

AI总结 针对无机晶体生成AI模型,提出工作流区分生成晶体是否为训练重复、元素替换产物或全新结构,发现81-92%的生成晶体为重复或替换结构,高对称性系统尤其明显,低对称性新结构可解释为数据丰富区域的插值。

Comments 27 pages (20 pages of main text). See https://github.com/WMD-group/xtaledit for the code

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22425 2026-06-23 cs.AI cond-mat.mtrl-sci 新提交 57%

SVGym (SciVerseGym): An Environment for Reinforcement Learning and Bayesian Optimization in Crystal Discovery

SVGym (SciVerseGym): 晶体发现中强化学习与贝叶斯优化的环境

Bin Cao

机构 * Bin Cao(包超)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出一个兼容Gymnasium的晶体发现环境SciVerseGym,将晶体设计建模为马尔可夫决策过程,支持局部和全局编辑操作,为强化学习、贝叶斯优化等提供可复现的测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21338 2026-06-23 cs.CR 新提交 50%

"What Happens Locally, Leaks Globally": Detecting Privacy Leakage Risks in MCP Servers

“局部发生,全局泄露”:检测MCP服务器中的隐私泄露风险

Biwei Yan, Minghui Xu, Yijun Yang, Boyang Ma, Xuelong Dai, Jingku Li, Yue Zhang

专题命中 工具调用 :agent(abstract)

AI总结 提出MCPPrivacyDetector,一种上下文感知的跨语言静态分析框架,用于检测MCP服务器中由协议引发的隐私泄露,在10,655个真实服务器中发现超过10%的泄露率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20597 2026-06-23 cs.CY 新提交 50%

From Punishment to Protection: Charting Six Decades of U.S. Juvenile Justice Through Topic Modeling and LLM-Assisted Analysis

从惩罚到保护:通过主题建模和LLM辅助分析描绘美国少年司法的六十年变迁

Nia E. George, Simeon Sayer

专题命中 工具调用 :tool use(abstract)

AI总结 本文通过主题建模和LLM辅助分析60470份美国上诉意见(1970-2025),发现儿童福利案件激增、性犯罪登记案件翻倍,而传统惩罚机制(移交成人法庭、少年死刑)大幅下降,并揭示了法律词汇的十年演变和司法管辖区碎片化风险。

Comments 7 figures, 4 tables, includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 98 篇

2606.23449 2026-06-23 cs.AI cs.OS 新提交 92%

AOHP: An Open-Source OS-Level Agent Harness for Personalized, Efficient and Secure Interaction

AOHP:一个用于个性化、高效和安全交互的开源操作系统级Agent框架

Shanhui Zhao, Jiacheng Liu, Guohong Liu, Jichao Yan, Jialei Ye, Yuhao Yang, Hao Wen, Shizuo Tian, Yizhen Yuan, Yuxuan Chen, Yunxin Liu, Ju Ren, Ya-Qin Zhang, Chao Huang, Yao Guo, Yuanchun Li

机构 * Tsinghua University(清华大学) Peking University(北京大学) The University of Hong Kong(香港大学)

专题命中 规划决策 :agent(title,title_cn);AI agent(abstract,abstract_cn);分类 cs.AI

AI总结 提出AOHP,一个基于AOSP的操作系统级Agent框架,通过将Agent视为一等OS参与者,实现个性化服务组合、高效Agent接口和安全信息流,在任务完成率、令牌成本和策略合规性上优于现有系统。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22388 2026-06-23 cs.AI cs.CL 新提交 90%

PlanBench-XL: Evaluating Long-Horizon Planning of LLM Tool-Use Agents in Large-Scale Tool Ecosystems

PlanBench-XL:评估大规模工具生态系统中LLM工具使用智能体的长时程规划能力

Jiayu Liu, Qihan Lin, Cheng Qian, Rui Wang, Emre Can Acikgoz, Xiaocheng Yang, Jiateng Liu, Zhenhailong Wang, Xiusi Chen, Heng Ji, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划决策 :tool-use(title,abstract);planning(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出PlanBench-XL基准,包含327个零售任务和1665个工具,测试LLM智能体在检索受限工具环境下的长时程规划能力,实验表明GPT-5.4在无阻塞下准确率51.90%,严重阻塞下降至11.36%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21740 2026-06-23 cs.AI 新提交 85%

Training the Orchestrator: A Supervised Approach to End-to-End PDDL Planning with LLM Agents

训练编排器:一种基于监督学习的端到端PDDL规划方法,使用LLM智能体

Rajesh Mangannavar, Zachary Coalson, Pranay Dugar, Prasad Tadepalli

机构 * Oregon State University(俄勒冈州立大学)

专题命中 规划决策 :planning(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出HALO框架,通过监督学习训练编排器,利用验证器提供的轨迹作为监督信号,在11个PDDL领域上以极低成本实现与前沿LLM相当的成功率。

Comments 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20686 2026-06-23 cs.RO cs.AI 新提交 85%

JPPD: Joint Prediction_Planning Diffusion with Differentiable Safety Guidance for Dynamic Obstacle Avoidance in Intelligent Transportation Systems

JPPD:具有可微安全引导的联合预测-规划扩散框架用于智能交通系统中的动态障碍物规避

Jiahao Wu, Shengwen Yu

机构 * The University of Hong Kong(香港大学) Guangzhou College of Commerce(广州商学院)

专题命中 规划决策 :planning(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出联合预测-规划扩散框架,将参与者预测与机器人规划视为条件轨迹生成问题,通过可微安全势引导和条件流匹配提升共享空间中的安全性与效率。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22995 2026-06-23 cs.LG cs.AI cs.CL 新提交 85%

Group-Graph Policy Optimization for Long-Horizon Agentic Reinforcement Learning

组图策略优化用于长程智能体强化学习

Yunan Wang, Minghui Song, Zihan Zhang, Shaohan Huang, Haizhen Huang, Furu Wei, Weiwei Deng, Feng Sun, Qi Zhang

机构 * Peking University(北京大学) Microsoft Corporation(微软公司)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出G2PO算法,通过构建全局状态转移图并引入组聚合状态值估计和边中心优势估计,解决长程智能体强化学习中的奖励稀疏和信用分配粗粒度问题,在WebShop等基准上显著提升成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20641 2026-06-23 cs.RO cs.AI cs.LG 新提交 84%

MAGNIFIED: RL Fine-tuning of Multimodal Large Language Models for Motion Planning

MAGNIFIED: 多模态大语言模型的强化学习微调用于运动规划

Letian Chen, Yiren Lu, Justin Fu, Yichen Xie, Runsheng Xu, Jyh-Jing Hwang, Ben Sapp, Drago Anguelov

机构 * Waymo LLC(Waymo有限责任公司)

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 提出MAGNIFIED方法,通过强化学习微调多模态大语言模型,利用令牌级奖励优化规划目标,在Waymo数据集上显著降低重叠率和偏离道路率。

Journal ref ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20627 2026-06-23 cs.AI cs.LG 新提交 84%

Latent Goal Prediction from Language for Model-Based Planning

基于语言隐式目标预测的模型规划

Samuel Barbeau, Simon Roy, Giovanni Beltrame, Christian Desrosiers, Nicolas Thome

机构 * École de Technologie Supérieure, Montréal(蒙特利尔高等技术学院) International Laboratory on Learning Systems (ILLS)(国际学习系统实验室) Polytechnique Montréal(蒙特利尔综合理工学院) MILA Institut Universitaire de France (IUF)(法国大学研究院) Université Sorbonne, CNRS, ISIR(索邦大学,法国国家科学研究中心,智能系统与机器人研究所)

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 提出LAGO框架,通过在同一隐空间预测语言指令的中间子目标序列和动作条件轨迹,结合软最小轨迹代价规划,实现长程鲁棒规划。

Comments 9 pages. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20520 2026-06-23 cs.CR cs.AI cs.DC cs.LG 新提交 84%

Sovereign Execution Broker: Enforcing Certificate-Bound Authority in Agentic Control Planes

主权执行代理:在智能体控制平面中强制执行证书绑定权限

Jun He, Deying Yu

专题命中 规划决策 :agentic(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 针对自主代理在生产环境中执行变更时缺乏强制权限验证的问题,提出主权执行代理(SEB),通过证书验证、状态检查和范围身份实现运行时强制权限控制,并在AWS和Kubernetes上验证了其安全性和性能。

Comments 19 pages, 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23543 2026-06-23 cs.AI cs.CL cs.CV cs.LG 新提交 83%

VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct

VeriEvol:通过可验证的进化指令扩展多模态数学推理

Haoling Li, Kai Zheng, Jie Wu, Can Xu, Qingfeng Sun, Han Hu, Yujiu Yang

机构 * Tsinghua University(清华大学) Tencent Hunyuan(腾讯混元)

专题命中 规划决策 :agent(summary_cn,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出VeriEvol框架,通过类型感知进化模块生成更难的问题,并利用HTV-Agent验证器确保答案可靠性,从而在强化学习中扩展多模态数学推理数据,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23221 2026-06-23 cs.CV cs.AI 新提交 83%

RS-Gen: A Multi-Stage Agentic Framework for Reasoning and Search-Augmented Image Generation

RS-Gen:用于推理和搜索增强图像生成的多阶段智能体框架

Feifei Bian, Zhimin Zheng, Wei Deng, Daiguo Zhou, Jian Luan

机构 * MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)

专题命中 规划决策 :agentic(title,abstract);planning(abstract);分类 cs.AI

AI总结 提出RS-Gen,一种即插即用、无需训练的多阶段图像智能体框架,通过“提问-解决”闭环机制进行逻辑推理和知识补全,显著提升基础图像生成与编辑模型在模糊意图和分布外知识场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏