arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-31 至 2026-07-31 共收录 199 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 15 篇

2607.22917 2026-07-31 cs.AI cs.LG cs.MA 版本更新 84%

Agent Team Work Zone: An Automated, Persistent Workspace for Long-Lived Claude Code Agent Teams

智能体团队工作区:面向长期存在的编码智能体团队的自动化持久工作区

Shouren Wang

专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 研究针对Claude Code等大语言模型智能体在长期工作流程中存在的问题,提出ATWZ,通过围绕其原生智能体团队构建基于文件系统的操作层,保存智能体工作状态等,解决相关问题并减少提示编写工作量。

Comments 31 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27309 2026-07-31 cs.SE 新提交 83%

SIGIL: Compiling Agent Skills into Typed Harnesses

SIGIL:将智能体技能编译为类型化工具框架

Jayanaka Dantanarayana, Savini Kashmira, Lingjia Tang, Jason Mars

专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.SE

AI总结 SIGIL通过Skill Compilation将散文式智能体技能编译为类型化工具框架,提升了智能体执行技能要求步骤的比例、完整过程的频率并减少token使用,且效果与模型无关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28591 2026-07-31 cs.SE cs.CL cs.LG 新提交 82%

Change2Task: From Repository Changes to Executable Coding Agent Tasks and Environments

Change2Task:从仓库变更到可执行编码智能体任务与环境

Haomin Qi, Xingliang Wang, Xuanqi Gao, Baihui Sang, Xin Zhang, Minghua Ma, Pengfei Gao, Yu Kang, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang, Qi Zhang

专题命中 软件智能体 :agent(title,abstract);分类 cs.CL、cs.LG、cs.SE

AI总结 Change2Task系统基于仓库历史将已合并拉取请求转为编码智能体任务,在5类任务中实现79.6%验证成功率,比基准多恢复29.2%任务,可减少流程支出10.8%。

Comments 15 pages, 7 figures, and 15 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28271 2026-07-31 cs.SE cs.AI 新提交 81%

Agentic Method for Deterministic Validation of Legacy Code Migration

用于遗留代码迁移确定性验证的智能体方法

Andras Ferenczi, Jordan Docherty, Mariya Bessonov, Matthew Findlay, Krishna Lingamneni

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出名为Locksmith Loop的智能体测试合成方法,通过在三项COBOL-Java案例研究中提升测试覆盖率,实现了遗留代码迁移的确定性验证。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27250 2026-07-31 cs.SE cs.AI 新提交 81%

Do Context Files Help Coding Agents? A Two-Agent Ablation Study on Real Repositories

上下文文件对编码智能体有帮助吗?针对真实仓库的双智能体消融研究

Prakhar Khatri

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本研究通过双智能体(Claude Code、Codex)的受控消融实验,发现上下文文件对编码智能体的正确性无显著提升,其失败源于实现技能而非知识缺失,还解释了过往研究矛盾的原因并公开了相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28027 2026-07-31 cs.MA cs.AI cs.CE 新提交 79%

VISA: A Structured Description Protocol for Agent-Based Simulation Models Towards Machine Reproducibility

VISA:面向智能体可复现性的智能体仿真模型结构化描述协议

Zhou He

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI

AI总结 该研究提出VISA结构化描述协议,通过八个表格及可执行规则、LLM技能提升智能体模型可复现性,在三类平台的ABMs上验证了其有效性,将复现障碍转化为可处理的依赖项。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25560 2026-07-31 cs.AI 版本更新 79%

Agent Skills Matter: Inferring Proprietary Skills from Execution Trajectories

智能体技能很重要:从执行轨迹推断专有技能

Jianing Geng, Ruiqi He, Zekun Fei, Biao Yi, Xuansheng Wu, Ruijie Wang, Zheli Liu, Xia Hu, Qingkai Zeng

机构 * Nankai University(南开大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Alibaba Group(阿里巴巴集团) East China University of Science and Technology(华东理工大学) Beihang University(北京航空航天大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI

AI总结 研究从智能体执行轨迹推断专有技能的问题,提出SigLeak黑盒框架,利用技能特征构建诊断任务,通过对比轨迹迭代优化重构技能,在多场景和框架中表现出色,证明良性轨迹可暴露专有知识。

Comments 18 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21997 2026-07-31 cs.SE 版本更新 79%

"Go Home Copilot, You're Drunk": Understanding Developer Responses to Agent-Generated Code Review Comments

“回家吧,副驾驶,你喝醉了”:理解开发者对智能体生成的代码审查评论的回应

Shamse Tasnim Cynthia, Ratnadira Widyasari, Banani Roy, Ting Zhang, David Lo

专题命中 软件智能体 :agent(title,abstract);分类 cs.SE

AI总结 研究开发者对智能体生成的代码审查评论的回应,分析五个智能体在342个Python仓库生成的54791条评论,探讨解决率、开发者经验及影响评论有用性的特征,发现不同智能体解决率有差异,还确定未解决评论原因及影响因素,为改进相关反馈提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11270 2026-07-31 cs.SE 版本更新 70%

Evaluating LLM Agents on Automated Software Analysis Tasks

评估LLM代理在自动化软件分析任务中的性能

Islem Bouzenia, Cristian Cadar, Michael Pradel

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.SE

AI总结 本文通过AnalysisBench评估四种LLM架构在自动化软件分析任务中的表现,发现AnalysisAgent在手动验证的成功率高达94%,而现有代理存在阶段混用、错误定位差等问题,且整程序分析和符号执行是最具挑战性的任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27409 2026-07-31 cs.SE cs.AI 新提交 62%

SWE-NFI: Studying and Benchmarking Coding Agents for Non-Functional Improvements

SWE-NFI:面向非功能改进的编码智能体研究与基准测试

Pengyu Xue, He Yang Yuan, Xin Wang, Junkai Chen, Haonan Zhang, Boyuan Chen, Zishuo Ding, Zhenhao Li, Weiyi Shang

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出SWE-NFI基准,基于开源Python项目的真实合并拉取请求构建188个任务,评估编码智能体的非功能改进能力,发现智能体在该能力上普遍落后于人类开发者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27228 2026-07-31 cs.CL cs.AI cs.DL 新提交 62%

AI-assisted pre-review of open-source software submissions: an experience report from BOSC 2026

AI辅助的开源软件提交预评审:来自BOSC 2026的经验报告

Tazro Ohta, Nomi L. Harris, Seth Carbon

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本研究针对BOSC 2026投稿激增问题,开发bosc-pre-review与Runabilly辅助评审,调查显示该预评审工具对志愿评审人员有用,需人工复核结论。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28086 2026-07-31 cs.AI 新提交 57%

Distilling Answer Set Programming Theories from Large Language Models

从大型语言模型中提炼答案集编程理论

Nelson Higuera Ruiz, Markus Hofmarcher, Claudiu Leoveanu-Condrei

机构 * ExtensityAI

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 该研究针对从头编写ASP理论困难的问题,采用神经符号方法测试9种模型从LLM提炼ASP理论的能力,在VQA基准上验证了前沿模型的性能,并发布了相关资源。

Comments Accepted at NeSy 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27733 2026-07-31 cs.AI 新提交 57%

VeriSkill: A Self-Evolution Framework for Program Verification Skills

VeriSkill:一种用于程序验证技能的自进化框架

Changguo Jia, Tianqi Zhao, Zhiyou Xiao, Weiming Zhang, Minghui Zhou

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出专为程序验证设计的自进化框架VeriSkill,可将验证失败归因于技能缺陷并迭代优化技能,实验显示其在多种场景下均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15828 2026-07-31 cs.SE 版本更新 57%

Configuration Smells in AGENTS.md Files: Common Mistakes in Configuring Coding Agents

AGENTS.md 文件中的配置异味:配置编码代理的常见错误

Helio Victor F. dos Santos, Vitor Costa, Joao Eduardo Montandon, Luciana Lourdes Silva, Marco Tulio Valente

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文首次系统化编码代理配置文件(AGENTS.md/CLAUDE.md)的异味,通过灰文献综述和仓库挖掘识别出六种异味,并在100个开源仓库中验证其普遍性,其中Lint Leakage最常见(62%)。

Journal ref 26th IEEE International Conference on Source Code Analysis and Manipulation (SCAM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 7 篇

2607.28227 2026-07-31 cs.AI cs.CV 新提交 90%

Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents

Qwen-UI-Agent技术报告:面向下一代以真实世界为中心的基础图形用户界面智能体

Hanzhang Zhou, Panrong Tong, Xu Zhang, Quyu Kong, Chenglin Cai, Tianyu Xia, Gongjie Zhang, Jianan Zhang, Long Li, Long Chen, Lei Wang, Gaole Dai, Pengxiang Li, Liangyu Chen, Yue Wang, Steven Hoi

机构 * Alibaba Group(阿里巴巴集团)

专题命中 GUI与网页智能体 :agent(title,title_cn);分类 cs.AI

AI总结 本研究推出以真实世界为中心的基础GUI智能体Qwen-UI-Agent,结合多环境与数据飞轮等机制,在移动端基准达最优,在多类任务上表现具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28196 2026-07-31 cs.CL 新提交 83%

Fidelity Is Not Safety: Gently-Compressed LLMs Pass Every Data-Free Quality Guard Yet Invent Procedure Steps in Agentic Execution

保真度≠安全性:轻度压缩的大语言模型通过所有无数据质量防护,但在智能体执行中生成指令中不存在的流程步骤

I. Kennedy, T. Kennedy

专题命中 GUI与网页智能体 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 该研究发现轻度压缩LLM虽通过困惑度、MMLU等无数据质量防护,但在智能体执行SOP时会生成指令外流程步骤,提出基于压缩误差双轴统计量的无数据筛查方法以保障智能体安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28573 2026-07-31 cs.AI 新提交 70%

Rethinking Inference-Time Scaling in Local Computer-Use Agents: Failure Modes and Compute Tradeoffs

重新思考本地计算机使用智能体的推理时扩展:失败模式与计算权衡

Woongkyu Lee, Jungwook Choi

机构 * Hanyang University(汉阳大学)

专题命中 GUI与网页智能体 :planning(abstract);agentic(abstract);分类 cs.AI

AI总结 本文针对本地计算机使用智能体的推理时扩展开展系统实证研究,评估多款模型在OSWorld基准上的表现,揭示其边际收益递减、失败模式转变等规律,提出高效本地智能体的设计方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28399 2026-07-31 cs.LG 新提交 57%

Why Are GUI Agents Correct but Late? Decode on the Decision-Time Critical Path, Tested with Pre-Compiled Policy Trees

为什么GUI智能体正确但延迟?基于决策时间关键路径的解码,用预编译策略树测试

Zihan Dong, Rui Qian, Qishi Zhan, Dongshen Peng, Kaixin Li, Yu Li

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.LG

AI总结 针对GUI智能体因决策时间关键路径的自回归解码延迟导致瞬态事件失败的问题,提出AAPT策略树方法,提升了决策窗口内的动作成功率,验证了分支路由为关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26041 2026-07-31 cs.AI cs.CV 版本更新 57%

Desktop-Delta Bench: Do Computer-Use Models Understand Desktop GUI Transitions?

桌面增量基准测试:计算机使用模型是否理解桌面GUI转换?

Abhishek Pillai, Samir Kumar Nayak, Yuan Chen

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 研究计算机使用模型对桌面GUI转换的理解,引入桌面增量基准测试(DDB)及其实例、任务,评估多个模型家族,发现排序不饱和,任务上下文对匹配有影响,单动作推断家族更难,DDB填补诊断层,助力改进桌面CUA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28474 2026-07-31 cs.RO 新提交 50%

TEA-AgriVLN: Traversability Estimation Alarm for Agricultural Vision-and-Language Navigation

TEA-AgriVLN:面向农业视觉语言导航的可通行性估计告警

Xiaobei Zhao, Xingqi Lyu, Xin Chen, Xiang Li

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 针对农业场景可通行性模糊问题,提出TEA模块并集成至AgriVLN构建TEA-AgriVLN,在A2A基准上将SR提至0.54、NE降至2.70米,实现农业VLN-CE领域最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27812 2026-07-31 cs.NI 新提交 50%

Localization and Pursuit of a Mobile Target using Distance-only Measurements

仅利用距离测量的移动目标定位与追踪

Nabarupa Das, Suvadip Batabyal

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出一种无需GPS、角度传感或多锚节点的方法,通过距离测量实现二维平面内移动目标的定位与追踪,最多13步即可完成定位,智能体可从搜索顺利过渡到追踪并保持有界误差。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 记忆与上下文管理 8 篇

2607.27834 2026-07-31 cs.AI cs.CL 新提交 76%

MemTxn: A Transaction Boundary for Source-Supported Updates and Complete-State Recovery in Agent Memory

MemTxn:智能体记忆中源支持更新与完整状态恢复的事务边界

Hanshuai Cui, Zhiqing Tang, Zhi Yao, Fanshuai Meng, Qianli Ma, Weijia Jia

专题命中 记忆与上下文管理 :agent(title);分类 cs.AI、cs.CL

AI总结 针对大语言模型智能体持久内存错误问题,提出MemTxn治理层,通过Ordered PatchTest等组件实现可靠更新与恢复,在多个基准测试中性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27705 2026-07-31 cs.AI cs.LG 新提交 73%

Albilich: Steerable Proof-State Orchestration for LLM-Based Mathematical Research with CAS Integration

Albilich:用于结合计算机代数系统(CAS)的基于大语言模型的数学研究的可操控证明状态编排工具

Ting Gong, Michael Ruofan Zeng, Yong Yang

专题命中 记忆与上下文管理 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 Albilich是结合CAS等功能的开源数学自主研究智能体框架,在RealMath基准和Kourovka开放问题上取得优异效果,可实现AI辅助的可扩展数学研究。

Comments 7 pages, comments welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27557 2026-07-31 cs.CL 新提交 70%

Training Skills Like Parameters via Self-Supervised Semantic Diffusion

通过自监督语义扩散将技能像参数一样训练

Mo Li, Zixin Yin, Ting Cao, Yunxin Liu

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 记忆与上下文管理 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 该研究提出受扩散模型启发的无监督自进化智能体框架,通过自监督信号更新外部文本技能库,提升了智能体在短剧剧本创作领域的生成能力。

Comments Preprint, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28520 2026-07-31 cs.GT cs.AI cs.MA 新提交 57%

Agents That Certify Their Own Exploits: Confidence-Scheduled Restricted Responses for Safe Opponent Exploitation

可证明自身利用行为的智能体:用于安全利用对手的置信度调度受限响应

Boning Li, Longbo Huang

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 该研究提出CS-RNR方法,通过置信序列跟踪对手行动频率,生成可自我审计的安全利用策略,在Leduc等博弈中实现远超基准的收益且符合预算要求。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28272 2026-07-31 cs.AI 新提交 57%

MemHarness: Memory Is Reconstructed, Not Replayed

MemHarness:记忆是被重构的,而非被重放的

Rong Wu, Daocheng Fu, Licheng Wen, Xuemeng Yang, Shu Zou, Jianbiao Mei, Yuxin Wang, Hairong Zhang, Yu Yang, Tao Hu, Cong Zhang, Botian Shi, Pinlong Cai

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 该研究针对现有记忆增强LLM智能体的逐字重放范式缺陷,提出MemHarness框架,通过GRPO训练实现记忆重构,在ALFWorld、WebShop等任务中性能优于基线,提升了智能体推理与分布外鲁棒性。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28103 2026-07-31 cs.AI 新提交 57%

MIND: Lightweight and Effective Memory Injection Defense for LLM Agents via Intent-Aware Information Bottleneck

MIND:基于意图感知信息瓶颈的轻量且有效的LLM智能体记忆注入防御

Dongyi Liu, Haixing He, Xiaobao Wu, Jia Li

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 针对LLM智能体记忆注入攻击,提出轻量防御框架MIND,通过意图感知信息瓶颈过滤冗余信息并识别恶意记忆,在ReAct-StrategyQA上大幅降低攻击成功率且保留任务性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27497 2026-07-31 cs.CL 新提交 57%

SkillSmith: Learning to Compose Parametric Skills and Textual Knowledge

SkillSmith:学习组合参数化技能与文本知识

Lucio M. Dery, Benedict Aaron Tjandra, Siavash Samiei, Adhiguna Kuncoro, Zohar Yahav, Jiajun Shen, Arthur Szlam

机构 * Google(谷歌)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.CL

AI总结 SkillSmith将模型权重作为可推理模态,结合前缀调优与文本数据,实现指令引导的参数化合成,性能优于单模态基线,解决了文本与权重集成的未探索问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21714 2026-07-31 cs.SD cs.MM 版本更新 50%

MusicWeaver: Programmable Long-Form Music Generation with Provably Local Editing

MusicWeaver: 作曲家风格的结构编辑与分钟级连贯音乐生成

Xuanchen Wang, Heng Wang, Weidong Cai

机构 * The University of Sydney(悉尼大学)

专题命中 记忆与上下文管理 :planning(abstract)

AI总结 MusicWeaver通过结构化计划和全局-局部扩散变换器实现作曲家风格的音乐生成与编辑,具备分钟级连贯性和高保真度。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. Agent评测 49 篇

2605.15040 2026-07-31 cs.AI cs.CL 版本更新 89%

Orchard: An Open-Source Agentic Modeling Framework

Orchard:一个开源的智能体建模框架

Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, Xiao Yu, Rui Yang, Tao Ge, Alessandro Sordoni, Xingdi Yuan, Yelong Shen, Pengcheng He, Tong Zhang, Zhou Yu, Jianfeng Gao

机构 * Microsoft Research(微软研究院) Columbia University(哥伦比亚大学) UIUC(伊利诺伊大学香槟分校)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);tool use(abstract)

AI总结 本文提出Orchard,一个开源的智能体建模框架,通过轻量级环境服务和三种智能体建模食谱,实现了跨领域可重用的智能体数据、训练和评估。

详情

展开后加载摘要…

URL PDF HTML 收藏