arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-19 至 2026-05-19 共收录 402 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 33 篇

2605.16897 2026-05-19 cs.NI cs.PL 50%

Escape from Callback Hell! A New Programming Paradigm for Network Simulation

逃离回调地狱!一种新的网络模拟编程范式

Yuanyi Zhu, Zijian Li, Xin Ai, Zixuan Chen, Sen Liu, Yang Xu

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出了一种名为CoDES的新型网络模拟开发范式,通过协程机制优化网络模拟开发流程,有效解决网络事件模拟中的复杂性和可维护性问题,减少开发工作量并提升代码可读性和可维护性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16783 2026-05-19 physics.geo-ph 50%

Pretrain-to-alignment learning paradigm to improve geophysical AI applicability under scarce field labels and synthetic-to-field gaps: A case study of relative geologic time estimation in global shelf-edge clinothems

预训练到对齐学习范式以提高在稀少实地标签和合成到实地差距下的地球物理AI适用性:全球岸缘cline-thems中相对地质时间估计的案例研究

Hui Gao, Xinming Wu, Jiarun Yang, Zhixiang Gao, Yimin Dou

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出了一种预训练到对齐的学习范式,通过整合自监督预训练、合成监督、先验驱动细化和领域适应微调,提升地球物理AI在稀少实地标签和合成到实地差距下的适用性,通过全球岸缘cline-thems中相对地质时间估计的案例研究验证了该范式的有效性。

Comments 50 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10108 2026-05-19 cs.HC 50%

JARVIS: A Just-in-Time Augmented Reality VLM-Powered Instruction System for Cross-Reality Task Guidance

JARVIS:一种基于视觉语言模型的即时增强现实指令系统,用于跨现实任务指导

Yusi Sun, Ying Jiang, Jiayin Lu, Yin yang, Yong-Hong Kuo, Chenfanfu Jiang

专题命中 工作流自动化 :workflow(abstract)

AI总结 JARVIS通过视觉语言模型生成上下文相关的分步指导,实现实时状态验证和自适应视觉反馈,提升跨现实任务的可用性、工作负荷、成功率和可视化效果。

Comments 14 pages, 11 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16589 2026-05-19 cs.CR 50%

STRIKE: A Structured Taxonomy of Cybercrime for Risk, Impact, Knowledge, and Evolution

STRIKE:一种用于风险、影响、知识和演化的网络犯罪结构分类

Melissa Pappy, Linh Nguyen, Suman Kumar, Byungkwan Jung, Bernard Chen

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出STRIKE框架,用于分类网络犯罪,涵盖传统和新兴领域,提供多维分析方法以应对复杂威胁。

Journal ref In Communications in Computer and Information Science, vol 2740. Springer (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 22 篇

2605.18747 2026-05-19 cs.CL cs.AI 90%

Code as Agent Harness

代码作为代理工具

Xuying Ning, Katherine Tieu, Dongqi Fu, Tianxin Wei, Zihao Li, Yuanchen Bei, Jiaru Zou, Mengting Ai, Zhining Liu, Ting-Wei Li, Lingjie Chen, Yanjun Zhao, Ke Yang, Bingxuan Li, Cheng Qian, Gaotang Li, Xiao Lin, Zhichen Zeng, Ruizhong Qiu, Sirui Chen, Yifan Sun, Xiyuan Yang, Ruida Wang, Rui Pan, Chenyuan Yang, Dylan Zhang, Liri Fang, Zikun Cui, Yang Cao, Pan Chen, Dorothy Sun, Ren Chen, Mahesh Srinivasan, Nipun Mathur, Yinglong Xia, Hong Li, Hong Yan, Pan Lu, Lingming Zhang, Tong Zhang, Hanghang Tong, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta Stanford University(斯坦福大学)

专题命中 软件智能体 :agent(title,abstract);AI agent(abstract);tool use(abstract);planning(abstract)

AI总结 本文探讨了代码在代理系统中的作用,提出了一种统一的视角,将代码视为代理基础设施的基础,并讨论了代理工具接口、机制以及扩展到多代理系统的挑战。

Comments GitHub: https://github.com/YennNing/Awesome-Code-as-Agent-Harness-Papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03409 2026-05-19 cs.AI 87%

Robust Agent Compensation (RAC): Teaching AI Agents to Compensate

鲁棒代理补偿(RAC):教AI代理补偿

Srinath Perera, Kaviru Hapuarachchi, Frank Leymann, Rania Khalaf

机构 * University of Stuttgart(斯图加特大学)

专题命中 软件智能体 :agent(title,abstract);AI agent(title);分类 cs.AI;agentic(comments)

AI总结 本研究提出了一种基于日志的恢复范式RAC,通过架构扩展实现安全网,可应用于大多数代理框架以支持可靠执行。RAC可在不修改现有代理代码的情况下启用,通过现有的扩展点在大多数现有代理框架中实现,并通过τ-bench和REALM-Bench验证,证明在解决复杂问题时,RAC在延迟和token经济性方面优于现有最先进的LLM-based恢复方法。

Comments Accepted at ACM Conference on AI and Agentic Systems (ACM CAIS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17444 2026-05-19 cs.SE cs.AI cs.CL 87%

MemRepair: Hierarchical Memory for Agentic Repository-Level Vulnerability Repair

MemRepair:用于代理级漏洞修复的分层内存

Simiao Liu, Li Zhang, Fang Liu, Xiaoli Lian, Yang Liu, Yinghao Zhu

机构 * Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.SE

AI总结 本研究提出MemRepair,一种增强记忆的代理框架,通过分层记忆和动态反馈循环提高漏洞修复的可靠性,实现了在多个仓库级别的漏洞修复基准上的高修复率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18684 2026-05-19 cs.SE cs.AI 86%

Reversa: A Reverse Documentation Engineering Framework for Converting Legacy Software into Operational Specifications for AI Agents

Reversa:一个用于将遗留软件转换为AI代理操作规范的反向文档工程框架

Sanderson Oliveira de Macedo, Ronaldo Martins da Costa

机构 * Federal Institute of Goias(戈亚斯联邦理工学院) Federal University of Goias(戈亚斯联邦大学)

专题命中 软件智能体 :AI agent(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出Reversa框架,旨在通过反向文档工程将遗留软件转换为AI代理可操作的规范,通过多代理流水线流程提取隐含规则,生成可追溯的操作规范,并提出评估协议以衡量覆盖率、可追溯性、置信度、效用和成本。

Comments Preprint. Includes a generative AI use statement

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16265 2026-05-19 cs.AI cs.CR 83%

AgentWall: A Runtime Safety Layer for Local AI Agents

AgentWall:本地AI代理的运行时安全层

Ashwin Aravind

专题命中 软件智能体 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出AgentWall,一种用于本地AI代理的运行时安全与可观测性层,通过拦截代理操作、评估政策、要求人类批准和记录执行轨迹,实现92.9%的政策执行准确率。

Comments 16 pages, 2 figures, open-source implementation at https://github.com/agentwall/Agentwall

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18451 2026-05-19 cs.CV cs.GR 82%

Code-as-Room: Generating 3D Rooms from Top-Down View Images via Agentic Code Synthesis

Code-as-Room: 通过代理代码合成从俯视图图像生成3D房间

Yixuan Yang, Zhen Luo, Wanshui Gan, Jinkun Hao, Junru Lu, Jinghao Yan, Zhaoyang Lyu, Xudong Xu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Southern University of Science and Technology(南方科技大学) University of Warwick(沃里克大学)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract)

AI总结 本文提出Code-as-Room框架,通过结构化执行 harness 生成3D房间,利用Blender代码表示房间,并引入专门的代码基3D房间合成基准进行评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16819 2026-05-19 cs.CL cs.AI cs.LG 80%

AgentKernelArena: Generalization-Aware Benchmarking of GPU Kernel Optimization Agents

AgentKernelArena: GPU核优化代理的通用化意识基准测试

Sharareh Younesian, Wenwen Ouyang, Sina Rafati, Mehdi Rezagholizadeh, Sharon Zhou, Ji Liu, Yue Liu, Yuchen Yang, Hao Li, Ziqiong Liu, Dong Li, Vikram Appia, Zhenyu Gu, Emad Barsoum

机构 * AMD

专题命中 软件智能体 :agent(abstract,abstract_cn);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出AgentKernelArena,一个用于评估GPU核优化代理的开源基准,通过隔离工作区和统一评分机制,测试代理在不同任务和硬件目标上的性能和通用化能力,发现大多数任务在正确性和编译效率上表现优异,但在PyTorch到HIP的转换任务中存在显著的正确性下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16079 2026-05-19 cs.CL cs.AI 79%

EvolveR: Self-Evolving LLM Agents through an Experience-Driven Lifecycle

EvolveR:通过经验驱动的生命周期实现自进化大语言模型代理

Rong Wu, Xiaoman Wang, Jianbiao Mei, Pinlong Cai, Daocheng Fu, Cheng Yang, Licheng Wen, Xuemeng Yang, Yufan Shen, Yuxin Wang, Botian Shi

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Fudan University(复旦大学) Central South University(中南大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

专题命中 软件智能体 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 EvolveR通过闭环经验生命周期实现LLM代理的自进化,结合离线自蒸馏和在线交互,利用策略强化机制迭代优化,提升多跳问答任务性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18073 2026-05-19 cs.SE cs.AI 73%

A-ProS: Towards Reliable Autonomous Programming Through Multi-Model Feedback

A-ProS:通过多模型反馈实现可靠的自主编程

Anika Tabassum, Md Sifat Hossain, Md. Fahim Arefin, Tariqul Islam, Tarannum Shaila Zaman

机构 * Dept. of Computer Science and Engineering, University of Dhaka(达卡大学计算机科学与工程系) Dept. of Information Systems, University of Maryland, Baltimore County(马里兰大学巴尔的摩县信息学院) University of Maryland, Baltimore County(马里兰大学巴尔的摩县)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出A-ProS,一种通过多模型反馈框架实现自主编程的AI代理,结合生成器和调试器,通过多轮反馈提升代码生成的准确性与效率,实验表明其在解决编程问题上具有显著优势。

Comments Accepted for Publication in ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02512 2026-05-19 cs.ET cs.AI cs.SE 73%

Human-Certified Module Repositories for the AI Age

面向AI时代的可信模块仓库

Szilárd Enyedi

机构 * Automation Department, Technical University of Cluj-Napoca, Romania(克卢日-纳波卡技术大学自动化系,罗马尼亚)

专题命中 软件智能体 :AI agent(abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 本文提出HCMR框架,通过人类监督与自动化分析结合,确保模块的可信度,为AI辅助开发提供安全可预测的模块组装方法。

Comments v4: acknowledged AI use for grammar and readability, added IEEE copyright notice; v3: 13 pages, new subsection about strong typed languages forcing AI to create more reliable code; v2: 12 pages, improved references; v1: 11 pages, 3 figures, 2 tables, prepared for AQTR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18397 2026-05-19 cs.DC 71%

Duet instrumentation: An Agentic Approach to Improving Sensitivity in Cloud Service Benchmarking

双人乐器:一种改进云服务基准测试灵敏度的代理方法

Sebastian Koch, Nils Japke, David Bermbach

专题命中 软件智能体 :agentic(title)

AI总结 本文提出了一种名为duet instrumentation的新基准测试方法,利用大型语言模型的代码理解能力,通过分析两个连续应用版本之间的代码变更,提高云服务基准测试的灵敏度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21654 2026-05-19 cs.LG 70%

EvilGenie: A Reward Hacking Benchmark

EvilGenie: 一个奖励黑客基准

Jonathan Gabor, Jayson Lynch, Jonathan Rosenfeld

机构 * Cambridge Boston Alignment Initiative(剑桥波士顿对齐倡议) MIT FutureTech(麻省理工 FutureTech)

专题命中 软件智能体 :agent(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出EvilGenie基准,用于评估编程环境中奖励黑客问题,通过测试用例硬编码和测试文件编辑等方法检测奖励黑客行为,并验证了LLM判断在无歧义情况下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04375 2026-05-19 eess.SY cs.AI cs.SY 70%

Experiment-as-Code Labs: A Declarative Stack for AI-Driven Scientific Discovery

实验作为代码实验室:面向AI驱动科学发现的声明式栈

Zhenning Yang, Yuhan Chen, Patrick Tser Jern Kon, Tongyuan Miao, Hongyi Lin, Venkat Viswanathan, Danai Koutra, Ang Chen

专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出实验作为代码实验室框架,通过声明式配置编译至设备API,实现AI代理与自动化实验室设备的高效协同,推动AI在科学发现中的应用突破。

Comments Experiment-as-Code (EaC) white paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18583 2026-05-19 cs.SE cs.AI cs.CL cs.CR 67%

Overeager Coding Agents: Measuring Out-of-Scope Actions on Benign Tasks

过度激进的编码代理:在良性任务中测量超出范围的动作

Yubin Qu, Ying Zhang, Yanjun Zhang, Gelei Deng, Yuekang Li, Leo Yu Zhang, Yi Liu

机构 * Griffith University(格里菲斯大学) Wake Forest University(威克森林大学) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) Quantstamp

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 本文提出OverEager-Gen基准,用于评估编码代理在良性任务中超出范围的行为。研究发现,当基准中明确列出授权范围时,代理会停止推断边界并开始匹配声明文本,从而影响测量有效性。通过行为梯度验证器和双通道堆栈审计内部工具调用,验证了不同框架下的过度激进行为差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18449 2026-05-19 cs.LG cs.AI 66%

Modelling Customer Trajectories with Reinforcement Learning for Practical Retail Insights

用强化学习建模客户轨迹以获得实际零售洞察

Ken Ming Lee, Paul Barde, Maxime C. Cohen, Derek Nowrouzezahrai

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG;autonomous agent(comments)

AI总结 本文提出了一种基于智能体的建模框架,将客户轨迹预测转化为最大熵强化学习问题,以更准确地反映具有有限理性的客户行为,从而提供更精确的冲动购买率和货架交通密度估计。

Comments Proceeding of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17526 2026-05-19 cs.SE cs.AI 62%

SaaSBench: Exploring the Boundaries of Coding Agents in Long-Horizon Enterprise SaaS Engineering

SaaSBench: 探索编码代理在长周期企业SaaS工程中的边界

Qingnan Ren, Shun Zou, Shiting Huang, Ziao Zhang, Kou Shi, Zhen Fang, Yiming Zhao, Yu Zeng, Qisheng Su, Lin Chen, Yong Wang, Zehui Chen, Xiangxiang Chu, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) AMAP, Alibaba Group(阿里云实验室)

专题命中 软件智能体 :AI agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出SaaSBench,首个针对企业SaaS工程的基准,旨在探索AI代理在复杂系统中的边界,通过30个任务和5370个验证节点,涵盖8种编程语言、6种数据库和13种框架,揭示了当前最先进代理在多组件系统配置和集成中的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17338 2026-05-19 cs.SE cs.CL 62%

Precise Debugging Benchmark: Is Your Model Debugging or Regenerating?

精确调试基准:你的模型是在调试还是重生成?

Wang Bill Zhu, Miaosen Chai, Shangshang Wang, Yejia Liu, Song Bian, Honghua Dong, Willie Neiswanger, Robin Jia

机构 * University of Southern California(南加州大学) Microsoft(微软) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Toronto(多伦多大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.CL、cs.SE

AI总结 本文提出PDB基准,评估LLM调试能力,发现前沿模型调试精度低,即使受指令引导也难以达到高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16352 2026-05-19 cs.IR cs.AI cs.LG 62%

LARGER: Lexically Anchored Repository Graph Exploration and Retrieval

LARGER: 词典锚定的仓库图探索与检索

Yuntong Hu, Tongli Su, Liang Zhao, Bowen Zhu, Hasibul Haque

机构 * Emory University(埃默里大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 LARGER通过词典锚定的结构化定位方法提升代码仓库文件定位精度,实现测试生成和代码库理解任务的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16699 2026-05-19 cs.CL cs.AI 62%

Calibrate-Then-Act: Cost-Aware Exploration in LLM Agents

校准后再行动:在大语言模型代理中考虑成本的探索

Wenxuan Ding, Nicholas Tomlin, Greg Durrett

机构 * New York University(纽约大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Calibrate-Then-Act框架,使LLM代理在不确定环境下显式平衡成本与不确定性,从而更优地决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17926 2026-05-19 cs.SE 57%

LLM-Based Static Verification of Code Against Natural-Language Requirements: An Industrial Experience Report

基于大语言模型的代码对自然语言要求的静态验证:一项工业经验报告

Zhi Quan Zhou, Dave Towey, Tsong Yueh Chen

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文提出一种基于大语言模型的两阶段工作流,用于在智能汽车网络安全案例中验证代码是否符合自然语言要求,通过引入结构化中间表示减少幻觉和输出变异,提升静态分析的准确性与解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17907 2026-05-19 cs.CV cs.AI 57%

One Model to Translate Them All: Universal Any-to-Any Translation for Heterogeneous Collaborative Perception

一个模型翻译它们所有:面向异构协作感知的通用任意到任意翻译

Yang Li, Weize Li, Quan Yuan, Congzhang Shao, Guiyang Luo, Yunqi Ba, Xuanhan Zhu, Xinyuan Ding, Xiaoyuan Fu, Jinglin Li

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出UniTrans,一种通用任意到任意特征模态翻译模型,通过预训练一组翻译专家参数并学习其组合系数来实现零样本翻译,从而在OPV2V-H和DAIR-V2X数据集上实现了优于现有方法的性能。

Comments 19 pages, accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12485 2026-05-19 q-bio.NC q-bio.QM 50%

Letting the neural code speak: Automated characterization of monkey visual neurons through human language

让神经代码发声:通过人类语言自动表征猴子视觉神经元

Vedang Lad, Katrin Franke, Tamar Rott Shaham, Surya Ganguli, Andreas S. Tolias, Sophia Sanborn, Nikos Karantzas

专题命中 软件智能体 :agentic(abstract)

AI总结 该研究通过人类语言表征猴子视觉皮层神经元的选择性,利用生成模型和神经数字孪生技术,实现了对神经功能的可解释、可测试的大规模描述,推动了智能科学发现。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与网页智能体 14 篇

2605.18652 2026-05-19 cs.CV 82%

MementoGUI: Learning Agentic Multimodal Memory Control for Long-Horizon GUI Agents

MementoGUI: 学习代理多模态记忆控制以实现长周期GUI代理

Ziyun Zeng, Hang Hua, Bocheng Zou, Mu Cai, Rogerio Feris, Jiebo Luo

机构 * University of Rochester(罗切斯特大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 GUI与网页智能体 :agentic(title,abstract);agent(abstract)

AI总结 本文提出MementoGUI,一种学习代理多模态记忆控制框架,用于提升长周期GUI代理的任务状态维持能力,通过模块化记忆控制和可扩展的数据管道提高记忆检索和决策效率。

Comments Preprint, 15 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16883 2026-05-19 cs.LG 70%

SE-GA: Memory-Augmented Self-Evolution for GUI Agents

SE-GA:基于记忆的自进化GUI代理

Shilong Jin, Lanjun Wang, Zhuosheng Zhang

机构 * College of Intelligence and Computing, Tianjin University, Tianjin, China(天津大学智能与计算学院) School of New Media and Communication, Tianjin University, Tianjin, China(天津大学新媒体与传播学院) School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院)

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);分类 cs.LG

AI总结 本文提出SE-GA框架,通过整合分层记忆结构和迭代自我改进机制,解决GUI代理在多步骤任务中因上下文窗口受限和静态策略无法适应动态环境的问题,实验表明其在多个基准测试中均达到领先性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12766 2026-05-19 cs.CL 70%

NaviRAG: Towards Active Knowledge Navigation for Retrieval-Augmented Generation

NaviRAG:迈向检索增强生成的主动知识导航

Jihao Dai, Dingjun Wu, Yuxuan Chen, Zheni Zeng, Yukun Yan, Zhenghao Liu, Maosong Sun

机构 * Tsinghua University(清华大学) Nanjing University(南京大学) Northeastern University(东北大学)

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);分类 cs.CL

AI总结 NaviRAG通过主动知识导航框架提升检索增强生成的复杂任务处理能力,通过分层知识组织和动态信息检索提高检索准确率和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16784 2026-05-19 cs.MA 67%

Dynamic Deployment of Mobile Charging Trucks During Natural Disaster Evacuation: An Offline-to-Online Framework

自然灾害疏散期间移动充电车的动态部署:一种离线到在线框架

Rui Ma, Zilin Bian, Kaan Ozbay

专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract)

AI总结 本文提出了一种离线到在线框架,用于在自然灾害疏散期间动态部署移动充电车,以缓解固定充电站过载问题,通过风险感知的分配和动态路由策略减少风险暴露。

详情

展开后加载摘要…

URL PDF HTML 收藏