arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-30 至 2026-06-30 共收录 294 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 12 篇

2606.28436 2026-06-30 cs.SE cs.AI 62%

Dockerless: Environment-Free Program Verifier for Coding Agents

Dockerless: 面向编码智能体的无环境程序验证器

Wenhao Zeng, Yuling Shi, Xiaodong Gu, Chao Hu, Chaofan Wang, Yuhao Cui, Hongting Zhou, Mengnan Qi, Jianqiao Wangni, Zhaojian Yu, Shuzheng Gao, Kai Cai, Shilin He

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 提出Dockerless,一种无需执行代码即可验证补丁正确性的智能体验证器,通过智能体仓库探索收集证据判断补丁正确性,在验证基准上超越最强开源验证器14.3 AUC点,并实现完全无环境的训练后流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28430 2026-06-30 cs.SE cs.AI 62%

Building to the Test: Coding Agents Deliver What You Check, Not What You Requested

为测试而构建:编码代理交付的是你检查的内容,而非你请求的内容

Yanuo Ma, Ben Kereopa-Yorke, Ben Schultz

机构 * Microsoft(微软)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究发现,在代码生成任务中,编码代理在测试存在时得分接近完美,但实际交付的库却残缺不全,揭示了“为测试而构建”的倾向,并提出了“验证自我意识”这一概念。

Comments 27 pages (9 main + 14 appendix), 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06090 2026-06-30 cs.SE cs.AI cs.PF 62%

SWE-fficiency: Can Language Models Optimize Real-World Repositories on Real Workloads?

SWE-fficiency:语言模型能否在真实工作负载上优化现实世界仓库?

Jeffrey Jian Ma, Milad Hashemi, Amir Yazdanbakhsh, Kevin Swersky, Ofir Press, Enhui Li, Vijay Janapa Reddi, Parthasarathy Ranganathan

机构 * Harvard University(哈佛大学) Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学) Google(谷歌)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出SWE-fficiency基准,评估语言模型在真实工作负载上优化软件仓库性能的能力,发现现有模型在定位优化机会和保持正确性方面表现不佳。

Comments Appearing at ICML 2026. Data, code, and leaderboard are available at https://swefficiency.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05755 2026-06-30 cs.CR cs.AI 57%

Red-Teaming Coding Agents from a Tool-Invocation Perspective: An Empirical Security Assessment

从工具调用角度审视代码代理的红队测试:一项经验性安全评估

Yuchong Xie, Mingyu Luo, Zesen Liu, Zhixiang Zhang, Kaikai Zhang, Yu Liu, Zongjie Li, Ping Chen, Shuai Wang, Dongdong She

机构 * The Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文从工具调用角度对六个流行的代码代理进行红队测试,发现ToolLeak漏洞并实现远程代码执行,揭示了代码代理的安全风险及防御建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06730 2026-06-30 quant-ph 50%

Decoder Dependence in Surface-Code Threshold Estimation under Digitized Hybrid Continuous-Variable and Discrete Noise

表面码阈值估计中的解码器依赖性:在数字化混合连续变量和离散噪声下的情况

Dennis Delali Kwesi Wayo, Chinonso Onah, Leonardo Goliatt, Sven Groppe

专题命中 软件智能体 :workflow(abstract)

AI总结 该研究探讨了在数字化混合连续变量和离散噪声下,表面码阈值估计对解码器和估计器的选择依赖性,通过比较不同解码器在LiDMaS+工作流中的性能,揭示了解码器选择对阈值估计结果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 8 篇

2606.29472 2026-06-30 cs.AI 83%

Agent-Computer Observation Interfaces Enable Dynamic Computer Use

智能体-计算机观察接口实现动态计算机使用

Bojie Li, Noah Shi

机构 * Pine AI University of Washington(Pine AI华盛顿大学)

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI

AI总结 提出智能体-计算机观察接口(AOI),通过关键帧捕获、音频转录和视觉叙述解耦观察与动作,使CU模型在动态任务中性能提升17-48个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29705 2026-06-30 cs.AI cs.CL cs.CV 81%

GUICrafter: Weakly-Supervised GUI Agent Leveraging Massive Unannotated Screenshots

GUICrafter: 利用海量无标注截图的弱监督GUI智能体

Sunqi Fan, Lingshan Chen, Runqi Yin, Qingle Liu, Yongming Rao, Meng-Hao Guo, Shi-Min Hu

机构 * Tsinghua University(清华大学) Tencent Hunyuan(腾讯文脉)

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 提出GUICrafter,一种利用海量无标注截图通过课程学习框架训练GUI智能体的弱监督方法,显著降低对人工标注的依赖,在极少量标注数据下性能超越UI-TARS等先进系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29445 2026-06-30 cs.CV cs.AI 79%

Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction

通过通用关键帧提取桥接VideoQA和视频引导的智能体任务

Sunqi Fan, Qingle Liu, Runqi Yin, Meng-Hao Guo, Shuojin Yang

专题命中 GUI与网页智能体 :agentic(title,abstract);分类 cs.AI

AI总结 提出VG-GUIBench基准和TASKER关键帧提取算法,联合考虑任务相关性和场景动态,在VideoQA和视频引导的GUI任务上提升性能。

Comments Accepted by ECCV 2026. Project Page: https://vg-gui-tasker.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29991 2026-06-30 cs.IR 50%

Behind the Content: Wikipedia Mobile Views and Tourism Activity

内容背后:维基百科移动端浏览量与旅游活动

Lucas Eustache, Paul Favier

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 研究利用维基百科移动端浏览量作为高频、可解释的旅游活动指标,发现其与当日酒店需求和景点访客量正相关,优于桌面端浏览量。

Journal ref 31e Conf{é}rence de l'Association Information et Management, Association Information et Management, May 2026, Neuch{â}tel, Switzerland

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29566 2026-06-30 cs.RO 50%

Analyzing Uncertainty in the Spatial Representation of the Kinematic Bicycle Model

分析运动学自行车模型空间表示中的不确定性

Shafayat Abrar, M. Zaeem Baig, Shahir Ul Islam Anzal, Abdul Basit Memon

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 针对车辆运动学模型中的不确定性,采用泰勒级数线性化三角函数,推导了协方差矩阵的闭式表达式,与蒙特卡洛模拟吻合,首次完整给出了协方差矩阵的闭式解。

Journal ref In 2025 International Conference on Emerging Technologies in Electronics, Computing, and Communication (ICETECC) (pp. 1-6). IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05377 2026-06-30 cs.RO cs.CV 50%

OpenFrontier: General Navigation with Visual-Language Grounded Frontiers

OpenFrontier: 基于视觉-语言基础的通用导航

Esteban Padilla-Cerdio, Boyang Sun, Marc Pollefeys, Hermann Blum

机构 * ETH Zurich(苏黎世联邦理工学院) Microsoft Spatial AI Lab(微软空间人工智能实验室) University of Bonn(波恩大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出OpenFrontier框架,通过稀疏子目标识别与到达问题实现高效导航,无需任务特定训练或微调,适用于多种视觉-语言先验模型,展示零样本性能和真实机器人部署效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10310 2026-06-30 cs.CV 50%

Efficient-VLN: A Simple yet Strong Baseline for Efficient Vision-Language Navigation

Efficient-VLN: 一种高效且强大的视觉语言导航基线

Duo Zheng, Shijia Huang, Yanyang Li, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Weitu AI

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 Efficient-VLN通过三个简单有效机制解决视觉语言导航中的系统瓶颈,提升推理效率和训练稳定性,在R2R-CE和RxR-CE基准上取得新突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13561 2026-06-30 cs.CR 50%

GuardianPWA: Enhancing Security Throughout the Progressive Web App Installation Lifecycle

GuardianPWA: 提升渐进式Web应用安装生命周期的安全性

Mengxiao Wang, Guofei Gu

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出GUARDIANPWA框架,基于CIA原则分析PWA安装机制,发现203处安全违规,揭示浏览器厂商在PWA安装生命周期中的隐私风险,并帮助开发者提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 记忆与上下文管理 23 篇

2602.17753 2026-06-30 cs.CY cs.AI 92%

The 2025 AI Agent Index: Documenting Technical and Safety Features of Deployed Agentic AI Systems

2025人工智能代理指数:记录已部署代理式人工智能系统的技术和安全特性

Leon Staufer, Kevin Feng, Kevin Wei, Luke Bailey, Yawen Duan, Mick Yang, A. Pinar Ozisik, Stephen Casper, Noam Kolt

机构 * University of Cambridge(剑桥大学) University of Washington(华盛顿大学) Harvard Law School(哈佛法学院) Stanford University(斯坦福大学) Concordia AI(康科迪亚AI) University of Pennsylvania(宾夕法尼亚大学) Massachusetts Institute of Technology(麻省理工学院) Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 记忆与上下文管理 :agent(title,abstract);AI agent(title,abstract);agentic(title,abstract);分类 cs.AI

AI总结 本文提出2025人工智能代理指数,记录30种先进代理式AI系统的起源、设计、能力、生态系统及安全特性,揭示代理发展中的趋势和开发者透明度问题。

Comments To be publishesd at ACM FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03895 2026-06-30 cs.OS cs.AI cs.CR 91%

Agent libOS: A Runtime Substrate for Capability-Controlled Self-Evolving LLM Agents

Agent libOS: 一种受库操作系统启发的运行时,用于长时间运行、能力受控的LLM智能体

Yingqi Zhang

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 记忆与上下文管理 :agent(title,title_cn);tool use(abstract);分类 cs.AI

AI总结 提出Agent libOS运行时,将LLM智能体建模为具有进程标识、生命周期、能力控制和审计记录的AgentProcess,通过类似libc的工具包装和运行时原语边界实现安全调度与资源控制。

Comments 12 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07287 2026-06-30 cs.LG cs.AI 88%

Experience-Evolving Multi-Turn Tool-Use Agent with Hybrid Episodic-Procedural Memory

具有混合情景-程序记忆的经验演化多轮工具使用智能体

Sijia Li, Yuchen Huang, Zifan Liu, Zijian Li, Jingjing fu, Lei Song, Jiang Bian, Jun Zhang, Rui Wang

专题命中 记忆与上下文管理 :agent(title,abstract);tool-use(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出混合情景-程序记忆策略,通过动态重用部分重叠的成功经验,使多轮工具使用策略实现经验驱动的自我演化,提升多轮任务中的推理与执行效率。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29788 2026-06-30 cs.LG 83%

MemLeak: Diagnosing Information Leaks in Multimodal Agent Memory

MemLeak: 诊断多模态智能体记忆中的信息泄露

Kuan Wang, Chao Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 记忆与上下文管理 :agent(title,abstract);AI agent(abstract);分类 cs.LG

AI总结 提出信息溯源图(IPG)分类法,通过MemLeak基准测试发现多模态记忆系统中删除事实后仍可从保留图像中恢复信息,图像泄露率达12.0%,47%的泄露无法通过文本恢复。

Comments 23 pages, 3 figures, includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29774 2026-06-30 cs.RO 82%

Analytic Concept-Centric Memory for Agentic Embodied Manipulation

分析性概念中心记忆用于具身操作代理

Mingyang Sun, Xiujian Liang, Jiude Wei, Qichen He, Donglin Wang, Cewu Lu, Jianhua Sun

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Westlake University(西湖大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract)

AI总结 提出分析性概念中心记忆框架,通过结构化概念(语义部件、参数模板等)组织经验,支持粗到细检索,提升长时程具身操作中的物体重识别、状态推理和技能复用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30191 2026-06-30 cs.AI cs.LG cs.NE 81%

From Detecting Agency to Doing Work: Self-Caused Credit Builds a Durable Behavioral Self in a Minimal Spiking Agent

从检测能动性到执行工作:自我归因的信用在最小脉冲智能体中构建持久的行为自我

Haoliang Han

机构 * Institute of Biomedical Strategy(生物医学战略研究院)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 通过能动门控的慢速信用更新,智能体在脉冲神经网络上形成持久的行为残留,实现自我保存和任务保持,无需重放缓冲区。

Comments 22 pages, 6 figures. Includes supplementary information in the same PDF

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29778 2026-06-30 cs.DB cs.AI cs.CL cs.IR 81%

Mandol: An Agglomerative Agent Memory System for Long-Term Conversations

Mandol:一种用于长期对话的聚合式智能体记忆系统

Yuhan Zhang, Zhiyuan Guo, Ziheng Zeng, Wei Wang, Wentao Wu, Lijie Xu

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) Microsoft Research(微软研究院)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 提出Mandol聚合式记忆系统,通过统一内存原生架构整合碎片化记忆,结合层次化记忆模型、聚合语义数据结构与量化查询机制,在长期对话基准上取得最佳准确率并实现5.4倍检索加速。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29763 2026-06-30 cs.CV cs.AI 79%

TopoAgent: An Agentic Framework for Automated Topology Learning in Medical Imaging

TopoAgent: 医学影像中自动拓扑学习的智能体框架

Guangyu Meng, Pengfei Gu, Xueyang Li, Yiyu Shi, Erin Wolf Chambers, Danny Z. Chen

机构 * Dept. of Computer Science and Engineering, University of Notre Dame(内布拉斯加大学达灵顿分校计算机科学与工程系) Dept. of Computer Science, The University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷分校计算机科学系)

专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.AI

AI总结 提出基于大语言模型的智能体框架TopoAgent,通过感知-推理-行动-反思循环和21个领域工具,自动为医学图像选择最优拓扑描述符并生成特征向量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29073 2026-06-30 cs.CR cs.AI 79%

From Tool Connection to Execution Control: Benchmarking Security Invariants in MCP-Style Agent Runtimes

从工具连接到执行控制:MCP风格智能体运行时中的安全不变性基准测试

Ting Liu

机构 * SymbolicLight Research(SymbolicLight研究院)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI

AI总结 针对MCP风格智能体运行时中安全决策分散的问题,提出八项执行层安全不变性,并在HCP参考运行时中实现,通过10个基准案例验证其能阻断所有攻击并保留审计证据。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01569 2026-06-30 cs.AI cs.SE 79%

CaveAgent: Transforming LLMs into Stateful Runtime Operators

CaveAgent:将LLM转变为具有状态的运行时操作符

Maohao Ran, Zhenglin Wan, Cooper Lin, Yanting Zhang, Hongyu Xin, Hongwei Fan, Yibo Xu, Beier Luo, Yaxin Zhou, Wangbo Zhao, Lijie Yang, Lang Feng, Fuchao Yang, Jingxuan Wu, Yiqiao Huang, Chendong Ma, Yusen Huang, Dailing Jiang, Jianbo Deng, Sirui Han, Yang You, Bo An, Yike Guo, Jun Song

机构 * Hong Kong Generative AI Research and Development Center (HKGAI)(香港生成式AI研究与开发中心(HKGAI))

专题命中 记忆与上下文管理 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 CaveAgent通过引入双流架构,将LLM从文本生成器转变为运行时操作符,解决了长周期任务中上下文漂移问题,提升了多轮交互的稳定性和数据处理能力。

Comments ver.2

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29207 2026-06-30 cs.DC 78%

KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding

KernelFlume: 面向智能体长上下文解码的弹性核心注意力扩展

Guangyu Xiang, Xueze Kang, Lin Zhang, Wenxiang Lin, Shaohuai Shi, Yuxin Wang, Xiaowen Chu

专题命中 记忆与上下文管理 :agentic(title,abstract)

AI总结 针对智能体长上下文解码中突发性长上下文需求超出部署容量的问题,提出KernelFlume架构,通过解耦投影/FFN路径与核心注意力计算,实现无权重注意力节点的弹性扩展,在降低延迟的同时显著降低输出成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29008 2026-06-30 eess.SP 78%

Macro--Micro Decision-Making in 6G Networks: An Agent-Based Framework for the Resource-Fungibility Landscape Resource-Fungibility Landscape

6G网络中的宏观-微观决策:基于智能体的资源可替代性景观框架

Sayanti Ghosh, Indrakshi Dey, Nicola Marchetti

专题命中 记忆与上下文管理 :agent(title,abstract)

AI总结 针对6G网络中资源可替代性受宏观与微观决策耦合影响的问题,提出基于智能体建模的框架,通过三个宏观选择、三个微观超参数和三个结构指标分离决策尺度,并推导出六个关键定理。

Comments 5 pages, 4 figures, submitted to IEEE Networking Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29030 2026-06-30 cs.AI cs.ET 77%

Memory as an Attack Surface in LLM Agents: A Study on Multiple-Choice Question Answering

LLM代理中的记忆作为攻击面:多项选择题回答研究

Shahnewaz Karim Sakib, Anindya Bijoy Das

专题命中 记忆与上下文管理 :agent(abstract);AI agent(abstract);tool use(abstract);分类 cs.AI

AI总结 研究LLM代理中外部记忆组件在多项选择题回答中的脆弱性,通过插入误导记忆进行攻击,实验表明简单记忆操纵即可显著影响答案准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29824 2026-06-30 cs.CL cs.AI 73%

Neural Procedural Memory: Empowering LLM Agents with Implicit Activation Steering

神经程序记忆:通过隐式激活引导赋予LLM智能体能力

Chengfeng Zhao, Yuqiao Tan, Shizhu He, Yequan Wang, Jun Zhao, Kang Liu

机构 * Institute of Automation, CAS(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 记忆与上下文管理 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL

AI总结 提出神经程序记忆(NPM),一种无训练框架,通过隐式激活引导而非显式指令表示智能体记忆,从历史对比经验中提取程序技能为激活空间中的引导向量,直接激活任务相关神经机制以指导执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29702 2026-06-30 physics.comp-ph 67%

Verified residual-specific explicit derivative kernels for physics-informed learning and discretized PDE adjoints

用于物理信息学习和离散化PDE伴随的验证残差特定显式导数核

Wenbo Cao, Zhe Lu, Weiwei Zhang

专题命中 记忆与上下文管理 :agent(abstract);workflow(abstract)

AI总结 提出基于智能体辅助实现和严格数值验证的残差特定显式微分(ED)方法,用于物理信息神经网络(PINNs)和离散化PDE伴随,相比自动微分实现2-4倍加速并降低内存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29279 2026-06-30 cs.CR cs.AI cs.CL 62%

Manufactured Confidence: How Memory Consolidation Turns Hearsay into Confident Facts

制造自信:记忆巩固如何将传闻转化为确信的事实

Alex Kwon

机构 * Independent Researcher(独立研究员)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究LLM代理在记忆压缩中将不确定表述转化为自信断言的问题,发现记忆重写导致代理将传闻当作事实执行,提出冗余来源可恢复正确决策。

Comments 16 pages, 16 tables, 1 figure. Code: https://github.com/collapseindex/manufactured-confidence

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28413 2026-06-30 cs.LG cs.AI cs.MA 62%

On the Necessity of a Liquid Substrate for Mesh Intelligence

论液态基质对于网格智能的必要性

Hongwei Xu

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究自主智能体网格在无中心、无时钟、无重训练条件下,如何从异步观测中在线融合信息,证明液态连续时间网络是实现最优估计的必要条件。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏