arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-15 至 2026-05-15 共收录 194 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 18 篇

2605.14771 2026-05-15 cs.AI 83%

MediaClaw: Multimodal Intelligent-Agent Platform Technical Report

MediaClaw:多模态智能体平台技术报告

Shaoan Zhao, Huanlin Gao, Qiang Hui, Ting Lu, Xueqiang Guo, Yantao Li, Xinpei Su, Fuyuan Shi, Chao Tan, Fang Zhao, Kai Wang, Shiguo Lian

机构 * China Unicom AI (Yuanjing) Team(中国unicom AI (元京)团队)

专题命中 工作流自动化 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 MediaClaw基于OpenClaw生态系统构建多模态智能体平台,通过统一抽象、插件扩展和工作流编排三层架构解决AIGC应用中的碎片化能力、异构接口、生产流程断层和高质量流程复用不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14089 2026-05-15 cs.AI 83%

SkillFlow: Flow-Driven Recursive Skill Evolution for Agentic Orchestration

SkillFlow: 以流程驱动的递归技能进化用于代理编排

Mingda Zhang, Tiesunlong Shen, Haoran Luo, Wenjin Liu, Zikai Xiao, Erik Cambria, Xiaoying Tang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

专题命中 工作流自动化 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 SkillFlow通过流程驱动的递归技能进化解决代理编排中的策略崩溃、梯度方差高和无指导技能进化问题,实现高效任务编排。

Comments 49 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11844 2026-05-15 cs.SE 79%

The Death Spiral of Open Source Projects: A Post-Mortem Analysis of Pull Request Workflow Dynamics

开源项目的死亡螺旋:对拉取请求工作流动态的回顾分析

Mohit Kaushik, Kuljit Kaur Chahal

专题命中 工作流自动化 :workflow(title,abstract);分类 cs.SE

AI总结 本文通过分析1736个非活跃GitHub仓库和130万个人驱动的拉取请求,揭示了拉取请求工作流中摩擦、审查周期延长和负面惩罚等微观动态对开源项目生存的影响,发现项目寿命由内在价值和生态系统动态决定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14700 2026-05-15 cs.RO 78%

SR-Platform: An Agentic Pipeline for Natural Language-Driven Robot Simulation Environment Synthesis

SR-Platform:一种基于自然语言的机器人仿真环境合成代理管道

Ben Wei Lim, Minh Duc Le, Thang Truong, Thanh Nguyen Canh

机构 * Strike Robotics

专题命中 工作流自动化 :agentic(title,abstract)

AI总结 SR-Platform通过代理系统将自然语言描述转化为可执行的MuJoCo仿真环境,显著降低手动创建多样机器人训练环境的工作量,实现从普通英文提示在一分钟内生成可执行场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24316 2026-05-15 cs.GR 78%

Large-Scale Photogrammetric Documentation of St. John's Co-Cathedral: A Workflow for Cultural Heritage Preservation

大规模摄影测量记录圣约翰共祭坛:文化保护的流程

Matthew Kenely, Mark Bugeja, Andre Grima, Peter Pullicino, Matthew Pullicino, Dylan Seychell

专题命中 工作流自动化 :workflow(title,abstract)

AI总结 本文介绍了一种用于大规模摄影测量记录马耳他瓦莱塔圣约翰共祭坛的完整流程,该建筑为世界遗产,具有复杂的巴洛克建筑和卡拉瓦乔作品。通过七晚的夜间拍摄,采集了99,000张照片,利用DSLR相机、无人机和激光雷达扫描,生成包含25-30十亿三角形的高精度3D重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13928 2026-05-15 stat.CO 78%

CudaMon: An R Package to Monitor NVIDIA GPUs, Showcased by Monitoring a GPU-accelerated Single-cell Analysis Workflow in R

CudaMon:一个用于监控NVIDIA GPU的R包,通过监控一个基于GPU的单细胞分析工作流进行展示

Mohammad Amin Zadenoori, Riccardo Ceccaroni, Gabriele Sales, Davide Risso

专题命中 工作流自动化 :workflow(title,abstract)

AI总结 CudaMon是一个R包,用于实时监控NVIDIA GPU的使用情况、内存、温度和功耗,通过NVML提供数据导出和可视化工具,展示了GPU加速的单细胞RNA测序工作流中的计算瓶颈和资源优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14844 2026-05-15 cs.LG cs.AI 62%

XFP: Quality-Targeted Adaptive Codebook Quantization with Sparse Outlier Separation for LLM Inference

XFP:面向LLM推理的质量导向自适应码本量化与稀疏异常分离

Thomas Witt

机构 * Gemini Stiftung(吉姆米基金会)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 XFP通过自适应码本量化和稀疏异常分离技术,实现高质量LLM推理,无需Hessian或校准数据,支持动态调整码本大小和异常预算,提升推理速度和精度。

Comments 17 pages, 3 figures, 17 tables, 1 algorithm. Code: https://github.com/flash7777/vllm/tree/multiquant

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14037 2026-05-15 cs.LG cs.CL 62%

Self-Pruned Key-Value Attention: Learning When to Write by Predicting Future Utility

自修剪键值注意机制:通过预测未来效用学习何时写作

Gergely Szilvasy, Manuel Faysse, Maria Lomeli, Matthijs Douze, Pierre-Emmanuel Mazaré, Loïc Cabannes, Wen-tau Yih, Hervé Jégou

机构 * Meta FAIR

专题命中 工作流自动化 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 本文提出自修剪键值注意机制,通过预测未来效用减少长序列的KV缓存大小,提升内存使用和解码速度,同时保持验证损失和下游任务性能。

Comments 28 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14188 2026-05-15 quant-ph cs.CL cs.DL physics.atom-ph 57%

QOuLiPo: What a quantum computer sees when it reads a book

QOuLiPo:量子计算机阅读书籍时的视觉呈现

Christophe Jurczak

机构 * Quantonation

专题命中 工作流自动化 :agentic(abstract);分类 cs.CL

AI总结 本文通过量子处理器处理文艺复兴时期经典作品,提出rigidity指标,构建QOuLiPo文本集,为中性原子硬件提供基准测试,并展示工程化文本的高近似比结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15142 2026-05-15 stat.ME 50%

Creating treatment and component hierarchies in component network meta-analysis

在组件网络meta分析中创建治疗和组件层次结构

Augustine Wigle, Audrey Béliveau, Adriani Nikolakopoulou, Lifeng Lin

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出在频繁ist和贝叶斯CNMA中回答治疗层次问题的步骤流程,明确识别可唯一估计的相对效应,通过两个不同网络示例展示方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15064 2026-05-15 cs.HC 50%

After the Interface: Relocating Human Agency in the Age of Conversational AI

接口之后:在对话式AI时代重新定位人类代理

Mengke Wu, Mike Yao

专题命中 工作流自动化 :agentic(abstract)

AI总结 本文探讨人类代理在对话式AI时代从界面转向交互本身的变化,通过重新定义控制机制揭示代理的再分布,呼吁重新思考代理的意义与责任归属。

Comments 7 pages, 1 figure

Journal ref ACM Conversational User Interfaces 2026 (CUI '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14944 2026-05-15 cs.RO cs.SY eess.SY 50%

Behavioral Data-Driven Optimal Trajectory Generation for Rotary Cranes

基于行为数据的旋转起重机最优轨迹生成

Iskandar Khemakhem, Manuel Zobel, Johannes Schüle, Oliver Sawodny, Naoki Uchiyama, Abdallah Farrage

机构 * Institute for Adaptive Mechanical Systems, University of Stuttgart(适应性机械系统研究所,斯图加特大学) Institute for System Dynamics, University of Stuttgart(系统动力学研究所,斯图加特大学) Department of Mechanical Engineering, Toyohashi University of Technology(机械工程系,toyohashi大学) Department of Mechatronics Engineering, Faculty of Engineering, Assiut University(机电工程系,工程学院,阿西尤特大学)

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出基于行为数据的旋转起重机轨迹生成方法,通过非参数表示和凸优化减少负载摆动、跟踪误差和运行时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06759 2026-05-15 cs.CR cs.HC 50%

"Tab, Tab, Bug": Security Pitfalls of Next Edit Suggestions in AI-Integrated IDEs

Tab,Tab,Bug:AI集成IDE中Next Edit Suggestions的安全隐患

Yunlong Lyu, Yixuan Tang, Peng Chen, Tian Dong, Xinyu Wang, Zhiqiang Dong, Hao Chen

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文研究了AI集成IDE中的Next Edit Suggestions安全问题,揭示了其复杂的上下文检索机制和潜在攻击向量,通过实验室测试和在线调查发现NES易受上下文污染和交易性编辑影响,需加强安全教育和防护措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04764 2026-05-15 econ.TH 50%

Data-Driven Monitoring and Deterrence in a Changing Environment

在变化环境中数据驱动的监控与威慑

Yeon-Koo Che, Jinwoo Kim, Konrad Mierendorff

专题命中 工作流自动化 :agent(abstract)

AI总结 本文研究了一个动态模型,其中主导者基于历史违规数据监控代理人,数据决定了监控的时间和强度。通过马尔可夫过程建模环境变化,发现短视策略使历史数据无价值,但内在探索动机成为内生承诺机制,降低违规率并恢复威慑力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 8 篇

2605.13918 2026-05-15 cs.SE cs.LG 84%

CA2: Code-Aware Agent for Automated Game Testing

CA2: 一种基于代码的自动化游戏测试代理

Valliappan Chidambaram Adaikkappan, Vincent Martineau, Joshua Romoff, David Meger

专题命中 软件智能体 :agent(title,abstract);分类 cs.LG、cs.SE

AI总结 CA2通过利用调用栈信息提升游戏测试效率,相比传统方法更有效定位目标函数,实现更精准的测试策略学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12808 2026-05-15 cs.LG 79%

Neurodata Without Boredom: Benchmarking Agentic AI for Data Reuse

神经数据无厌倦:评估代理AI的数据重用基准测试

Ling-Qi Zhang, Kristin Branson

机构 * HHMI Janelia Research Campus(HHMI贾能利亚研究中心)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.LG

AI总结 本文探讨了代理AI在神经数据重用中的应用,通过八篇研究论文评估了通用编码代理在处理多模态数据和任务解码中的表现,发现其在子任务中表现良好,但难以实现端到端无错误解决方案,提出了数据共享的最佳实践。

Comments v2: Added forgotten acknowledgments section

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15187 2026-05-15 cs.CV cs.GR cs.RO 78%

Articraft: An Agentic System for Scalable Articulated 3D Asset Generation

Articraft: 一种可扩展的拟人化3D资产生成代理系统

Matt Zhou, Ruining Li, Xiaoyang Lyu, Zhaomou Song, Zhening Huang, Chuanxia Zheng, Christian Rupprecht, Andrea Vedaldi, Shangzhe Wu

机构 * University of Cambridge(剑桥大学) University of Oxford(牛津大学) Nanyang Technological University(南洋理工大学)

专题命中 软件智能体 :agentic(title,abstract)

AI总结 本文提出Articraft代理系统,利用大语言模型生成大规模拟人化3D资产,构建了包含10000+资产的Articraft-10K数据集,应用于机器人仿真和虚拟现实等下游任务。

Comments Project page: https://articraft3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13874 2026-05-15 cs.NE cs.AI 74%

GEAR: Genetic AutoResearch for Agentic Code Evolution

GEAR:基于遗传算法的自主研究代理

Ahmadreza Jeddi, Minh Ngoc Le, Hakki C. Karaimer, Konstantinos G. Derpanis, Babak Taati

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) AI Center-Toronto, Samsung Electronics(多伦多AI中心,三星电子) York University(约克大学)

专题命中 软件智能体 :agentic(title);分类 cs.AI

AI总结 GEAR通过多路径搜索提升自主研究代理效果,采用群体搜索策略保持多个 promising 方向,通过突变和交叉探索新想法,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14415 2026-05-15 cs.SE cs.AI cs.CL 67%

SWE-Chain: Benchmarking Coding Agents on Chained Release-Level Package Upgrades

SWE-Chain:基于链式发布级包升级的编码代理基准测试

Man Ho Lam, Chaozheng Wang, Hange Liu, Jingyu Xiao, Haau-sing Li, Jen-tse Huang, Terry Yue Zhuo, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Independent(独立) ELLIS Technical University of Darmstadt(达姆施塔特技术大学) Johns Hopkins University(约翰霍普金斯大学) Monash University(墨尔本大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 SWE-Chain通过链式发布级包升级评估编码代理,包含12个升级链和155个版本过渡,揭示当前代理在连续维护中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04601 2026-05-15 cs.SE cs.AI cs.CL 67%

Vibe Code Bench: Evaluating AI Models on End-to-End Web Application Development

Vibe Code Bench:评估AI模型在端到端Web应用开发中的表现

Hung Tran, Langston Nashold, Rayan Krishnan, Antoine Bigeard, Alex Gu

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 本文提出Vibe Code Bench,通过100个Web应用规格和964个浏览器工作流评估AI模型在端到端应用开发中的性能,揭示了可靠开发仍为前沿挑战,并提出评估协议和人类对齐研究。

Comments 23 pages, 8 figures. Accepted to ACM CAIS 2026. Live leaderboard: https://www.vals.ai/benchmarks/vibe-code. Benchmark first released Nov 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21104 2026-05-15 cs.LG cs.PL 57%

BRIDGE: Building Representations In Domain Guided Program Synthesis

BRIDGE: 在领域引导的程序合成中构建表示

Robert Joseph George, Carson Eisenach, Udaya Ghai, Dominique Perrault-Joncas, Anima Anandkumar, Dean Foster

机构 * California Institute of Technology(加州理工学院) Amazon(亚马逊)

专题命中 软件智能体 :workflow(abstract);分类 cs.LG

AI总结 BRIDGE通过多艺术ifacts程序合成框架提升Lean验证正确性,结合代码、规范和定理证明领域,提高生成效率和正确率。

Comments 41 pages, 10 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11186 2026-05-15 cs.MA cs.AI math.OC 57%

Sequential Resource Trading Using Comparison-Based Gradient Estimation

基于比较的梯度估计的顺序资源交易

Surya Murthy, Mustafa O. Karabag, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文研究了两个贪心理性代理在有限资源类别中进行顺序多议题交易的问题,提出基于比较的算法通过接受/拒绝反馈估计对方梯度,确保交易互惠并最终收敛到帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与网页智能体 6 篇

2605.14747 2026-05-15 cs.CL cs.AI cs.CV cs.LG 82%

Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining

Video2GUI:合成大规模交互轨迹用于通用GUI代理预训练

Weimin Xiong, Shuhao Gu, Bowen Ye, Zihao Yue, Lei Li, Feifan Song, Sujian Li, Hao Tian

机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机科学学院,北京大学) The University of Hong Kong(香港大学) Renmin University of China(中国人民大学)

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出Video2GUI框架,通过自动提取互联网视频中的GUI交互轨迹,生成大规模数据集WildGUI,提升了GUI代理的泛化能力。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14290 2026-05-15 cs.CR cs.AI cs.CL cs.SE 75%

Web Agents Should Adopt the Plan-Then-Execute Paradigm

网络代理应采用计划-然后执行范式

Julien Piet, Annabella Chow, Yiwei Hou, Muxi Lyu, Sylvie Venuto, Jinhao Zhu, Raluca Ada Popa, David Wagner

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 本文提出网络代理应默认采用计划-然后执行范式,而非ReAct架构。该范式通过预先制定任务特定程序,避免运行时网页内容的干扰,提升安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14786 2026-05-15 cs.CR cs.AI cs.HC cs.LG 62%

Known By Their Actions: Fingerprinting LLM Browser Agents via UI Traces

以行为识别LLM浏览器代理:通过UI轨迹指纹化

William Lugoloobi, Samuelle Marro, Jabez Magomere, Joss Wright, Chris Russell

机构 * Oxford Internet Institute, University of Oxford(牛津互联网研究所,牛津大学) Department of Engineering Science, University of Oxford(工程科学系,牛津大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究通过被动JavaScript跟踪器分析LLM代理的行为和交互时间,发现可识别底层模型,F1达96%,并展示分类器在不同模型上的泛化能力及早期身份推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15030 2026-05-15 cs.CR cs.AI 57%

WARD: Adversarially Robust Defense of Web Agents Against Prompt Injections

WARD: 用于对抗Web代理对抗提示注入的鲁棒防御

Tri Cao, Yulin Chen, Hieu Cao, Yibo Li, Khoi Le, Thong Nguyen, Yuexin Li, Yufei He, Yue Liu, Shuicheng Yan, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) University of Science(科学大学) Vietnam National University, Ho Chi Minh City(越南国家大学,胡志明市)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 WARD通过WARD-Base和WARD-PIG数据集及A3T框架,实现高效鲁棒的Web代理防御,有效应对提示注入攻击,保持低误报率和高效运行。

Comments Code and models: https://github.com/caothientri2001vn/WARD-WebAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14911 2026-05-15 cs.RO 50%

Chrono-Gymnasium: An Open-Source, Gymnasium-Compatible Distributed Simulation Framework

Chrono-Gymnasium:一个开源、兼容Gymnasium的分布式模拟框架

Bocheng Zou, Harry Zhang, Khailanii Slaton, Jingquan Wang, Derrick Ruan, Huzaifa Mustafa Unjhawala, Radu Serban, Dan Negrut

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 Chrono-Gymnasium通过分布式计算框架提升高保真多体动力学模拟的效率,支持机器人导航和行星着陆器优化,减少计算时间而不牺牲物理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15384 2026-05-15 cs.GT 50%

Co-Investment in Mobile Edge Computing with Infrastructure Update and Dynamic Participation

移动边缘计算中的协同投资与基础设施更新及动态参与

Amal Sakr, Andrea Araldo, Tijani Chahed, Daniel Kofman

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出一种协同投资方案,通过运营商和多个服务提供商共同部署和共享移动边缘计算基础设施,解决资源规划、分配及成本收益分配问题,并通过动态参与机制提升整体收益。

Comments Accepted at IFIP Networking, May 24-27, 2026, Lugano, Switzerland

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 记忆与上下文管理 9 篇

2605.13880 2026-05-15 cs.AI cs.CL 81%

PREPING: Building Agent Memory without Tasks

PREPING:在没有任务的情况下构建代理记忆

Yumin Choi, Sangwoo Park, Minki Kang, Jinheon Baek, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文研究在无任务经验下通过自动生成合成实践构建代理记忆的方法,提出Preping框架,通过Proposer生成任务、Solver执行和Validator验证,提升性能并降低部署成本。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15128 2026-05-15 cs.CV cs.CL cs.IR 79%

MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory

MemEye:一种以视觉为中心的多模态代理记忆评估框架

Minghao Guo, Qingyue Jiao, Zeru Shi, Yihao Quan, Boxuan Zhang, Danrui Li, Liwei Che, Wujiang Xu, Shilong Liu, Zirui Liu, Mubbasir Kapadia, Vladimir Pavlovic, Jiang Liu, Mengdi Wang, Yiyu Shi, Dimitris N. Metaxas, Ruixiang Tang

机构 * Rutgers(罗格斯大学) Notre Dame(圣母大学) Princeton(普林斯顿大学) UMN(明尼苏达大学)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.CL

AI总结 MemEye框架从视觉证据的粒度和证据使用的复杂性两个维度评估多模态代理记忆,通过8个生活场景任务构建新基准,验证记忆方法在细粒度视觉细节保留和时间状态推理上的不足。

Comments 46 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏