arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3217 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 3217 篇

2604.08293 2026-04-10 cs.SE cs.AI 62%

CIAO - Code In Architecture Out - Automated Software Architecture Documentation with Large Language Models

CIAO - 代码输入,架构输出 - 利用大语言模型实现自动化软件架构文档生成

Marco De Luca, Tiziano Santilli, Domenico Amalfitano, Anna Rita Fasolino, Patrizio Pelliccione

机构 * University of Naples Federico II(那不勒斯腓特烈二世大学) University of Southern Denmark(南丹麦大学) Gran Sasso Science Institute(格兰萨索科学研究所)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 本文提出CIAO方法,利用大语言模型从GitHub仓库自动生成系统级架构文档,基于ISO/IEC/IEEE标准模板,评估显示文档被开发者认为有价值且准确,但存在图表质量和高层次上下文建模的局限。

Comments Manuscript accepted for the 23rd International Conference on Software Architecture (ICSA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07455 2026-04-10 cs.AI cs.LG cs.LO 62%

Munkres' General Topology Autoformalized in Isabelle/HOL

Munkres泛拓扑论在Isabelle/HOL中的自动形式化

Dustin Bryant, Jonathan Julián Huerta y Munive, Cezary Kaliszyk, Josef Urban

机构 * Independent(独立研究者) Aalborg University(奥尔堡大学) University of Melbourne(墨尔本大学) AI4REASON and University of Gothenburg / Chalmers University(AI4REASON 和哥德堡大学 / 查尔姆斯理工大学)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 本研究利用LLM辅助在Isabelle/HOL中自动形式化Munkres泛拓扑教材,生成85000余行代码,涵盖39章节,证明包括Tychonoff定理等核心结果,方法结合声明性证明与sledgehammer工具,展现高效形式化潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15494 2026-04-10 cs.SE cs.AI cs.PF 62%

Do AI Models Dream of Faster Code? An Empirical Study on LLM-Proposed Performance Improvements in Real-World Software

AI模型是否梦想着更快的代码?对LLM在现实软件中提出性能改进的实证研究

Lirong Yi, Gregory Gay, Philipp Leitner

机构 * Chalmers University of Technology(查尔姆斯理工大学) University of Gothenburg(哥德堡大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究通过65个性能关键的开源Java项目任务,评估LLM生成复杂工程问题的性能,发现其解法波动大且低于人类开发者,指出当前算法任务基准评估过于乐观,需转向更复杂的代理系统以提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06793 2026-04-09 cs.SE cs.AI 62%

Evaluating Repository-level Software Documentation via Question Answering and Feature-Driven Development

通过问答和基于特征的开发评估仓库级软件文档

Xinchen Wang, Ruida Hu, Cuiyun Gao, Pengfei Gao, Chao Peng

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Independent Researcher, China(独立研究者)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出SWD-Bench基准,通过功能驱动的问答任务评估仓库级文档质量,揭示现有方法局限,并展示高质量文档对SWE-Agent问题解决率的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06603 2026-04-09 cs.CL cs.AI 62%

Scientific Knowledge-driven Decoding Constraints Improving the Reliability of LLMs

基于科学知识的解码约束:提升大语言模型的可靠性

Maotian Ma, Zheni Zeng, Zhenghao Liu, Yukun Yan

机构 * Nanjing University(南京大学) Tsinghua University(清华大学) Northeastern University(东北大学)

专题命中 软件智能体 :planning(abstract);分类 cs.AI、cs.CL

AI总结 本文提出SciDC方法,通过整合领域知识与强约束提升LLM在科学任务中的可靠性,实验显示在工业配方设计、肿瘤诊断和逆合成规划中平均准确率提升12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06373 2026-04-09 cs.SE cs.AI 62%

Beyond Functional Correctness: Design Issues in AI IDE-Generated Large-Scale Projects

超越功能性正确性:AI IDE生成大规模项目的 设计问题

Syed Mohammad Kashif, Ruiyin Li, Peng Liang, Amjed Tahir, Qiong Feng, Zengyang Li, Mojtaba Shahin

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Mathematical and Computational Sciences, Massey University(梅西大学数学与计算科学学院) School of Computer Science, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computer Science, Central China Normal University(华中师范大学计算机学院) School of Computing Technologies, RMIT University(RMIT大学计算技术学院)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文研究了AI IDE生成大规模项目的功能正确性和设计问题,通过FD-HITL框架生成10个项目,发现存在大量设计缺陷,需专业开发者审查。

Comments 40 pages, 19 images, 5 tables, Manuscript submitted to a Journal (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07304 2026-04-09 cs.SE cs.AI 62%

Chatbot-Based Assessment of Code Understanding in Automated Programming Assessment Systems

基于聊天机器人的代码理解评估在自动化编程评估系统中的应用

Eduard Frankford, Erik Cikalleshi, Ruth Breu

机构 * University of Innsbruck(因斯布鲁克大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文探讨了聊天机器人在自动化编程评估中的应用,提出混合苏格拉底框架以整合对话验证,解决代码理解评估中的挑战。

Comments 12 pages, accepted for publication at CSEDU 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05955 2026-04-08 cs.SE cs.AI 62%

Does Pass Rate Tell the Whole Story? Evaluating Design Constraint Compliance in LLM-based Issue Resolution

通过率能讲述全部故事吗?评估基于LLM的问题解决的设计约束合规性

Kai Yu, Zhenhao Zhou, Junhao Zeng, Ying Wang, Xueying Du, Zhiqiang Yuan, Junwei Liu, Ziyu Zhou, Yujia Wang, Chong Wang, Xin Peng

机构 * Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出设计感知问题解决方法,引入bench基准,通过挖掘和验证真实项目中的设计约束,评估LLM在问题解决中设计约束的合规性,发现测试通过率高并不代表设计合规性好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04979 2026-04-08 cs.SE cs.AI 62%

Squeez: Task-Conditioned Tool-Output Pruning for Coding Agents

Squeez:面向编码代理的任务条件工具输出剪枝

Ádám Kovács

机构 * KR Labs(KR实验室)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文研究了编码代理的任务条件工具输出剪枝,通过构建11477个示例的基准测试集,利用Qwen 3.5 2B模型实现92%的输入token剪枝,达到0.86召回率和0.80 F1分数,优于零样本模型和启发式基线。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26567 2026-04-07 cs.SE cs.AI 62%

Beyond Code Snippets: Benchmarking LLMs on Repository-Level Question Answering

超越代码片段:在仓库层面评估大语言模型的问答任务

Yoseph Berhanu Alebachew, Hunter Leary, Swanand Vaishampayan, Chris Brown

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工大学计算机科学系)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文提出StackRepoQA数据集,用于评估大语言模型在多项目仓库层面的问答能力,通过对比不同配置下的性能,揭示了模型在处理仓库级程序理解时的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03135 2026-04-06 cs.SE cs.AI 62%

AI-Assisted Unit Test Writing and Test-Driven Code Refactoring: A Case Study

AI辅助的单元测试编写与测试驱动的代码重构:一个案例研究

Ema Smolic, Mario Brcic, Luka Hobor, Mihael Kovac

机构 * Faculty of Electrical Engineering and Computing, University of Zagreb(萨格勒布大学电气工程与计算学院)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 本文研究了利用AI生成单元测试并进行安全重构的方法,通过案例展示如何通过迭代测试捕获系统行为,减少重构风险,提升代码维护效率。

Comments 6 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06649 2026-04-06 cs.LG cs.AI 62%

Local Reinforcement Learning with Action-Conditioned Root Mean Squared Q-Functions

局部强化学习与基于动作的均方Q函数

Frank Wu, Mengye Ren

机构 * Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于动作的均方Q函数,通过时间差分学习实现局部强化学习,优于现有无反向传播方法,在MinAtar和DeepMind控制套件中表现优异。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25438 2026-04-06 cs.LG cs.AI 62%

Beyond Noisy-TVs: Noise-Robust Exploration Via Learning Progress Monitoring

超越噪声TVs:通过学习进度监控实现噪声鲁棒探索

Zhibo Hou, Zhiyu An, Wan Du

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出学习进度监控(LPM)方法,通过奖励模型改进而非预测误差或新颖性,提升探索效率,实验证明其在噪声环境中的优越性。

Comments Accepted for ICLR 2026

Journal ref International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00167 2026-04-02 cs.SE cs.AI 62%

A Study on the Impact of Fault localization Granularity for Repository-Scale Code Repair Tasks

对仓库级代码修复任务中故障定位粒度影响的研究

Joseph Townsend, Chandresh Pravin, Kwun Ho Ngan, Matthieu Parizy

机构 * Fujitsu Research of Europe(富士通欧洲研究院)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 研究探讨了仓库级代码修复中故障定位粒度对修复效果的影响,提出框架验证不同粒度下的修复率,并指出任务依赖性可能影响最佳粒度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27880 2026-03-31 cs.LG cs.AI cs.RO math.DS 62%

Kernel Dynamics under Path Entropy Maximization

核动力学在路径熵最大化下

Jnaneshwar Das

机构 * Earth Innovation Hub(地球创新中心)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个变分框架,将核函数视为路径熵最大化下的动态变量,探讨核函数的表示结构与信息几何分析,提出固定点条件、RG流及NTK演化的候选实例,并基于信息热力学假设推导核变化的下界。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20404 2026-03-31 cs.SE cs.AI cs.ET cs.HC 62%

On the Impact of AGENTS.md Files on the Efficiency of AI Coding Agents

关于AGENTS.md文件对AI编码代理效率的影响

Jai Lal Lulla, Seyedmoein Mohsenimofidi, Matthias Galster, Jie M. Zhang, Sebastian Baltes, Christoph Treude

机构 * Singapore Management University(新加坡管理大学) Heidelberg University(海德堡大学) University of Bamberg(班贝格大学) King's College London(伦敦国王学院)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究AGENTS.md文件对AI编码代理在GitHub拉取请求上的运行效率和令牌消耗的影响,发现其能降低运行时间及令牌消耗,同时保持任务完成行为。

Comments 5 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27745 2026-03-31 cs.SE cs.AI 62%

Needle in the Repo: A Benchmark for Maintainability in AI-Generated Repository Edits

代码仓库中的针:一项评估AI生成仓库编辑可维护性的基准测试

Haichao Zhu, Qian Zhang, Jiyuan Wang, Zhaorui Yang, Yuxin Qiu

机构 * UC Riverside(加州大学河滨分校) Independent Researcher(独立研究员) Tulane University(杜兰大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出NITR基准测试,评估AI生成代码是否保持可维护结构,发现现有系统在复杂架构修改上表现不佳,代理模式提升性能但未解决根本问题。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27277 2026-03-31 cs.SE cs.AI cs.PL 62%

Codebase-Memory: Tree-Sitter-Based Knowledge Graphs for LLM Code Exploration via MCP

基于MCP的代码库记忆:通过Tree-Sitter构建的知识图谱用于LLM代码探索

Martin Vogel, Falk Meyer-Eschenbach, Severin Kohler, Elias Grünewald, Felix Balzer

机构 * Independent Researcher, Berlin, Germany(独立研究者,柏林,德国) Institute of Medical Informatics, Charité – Universitätsmedizin Berlin, Berlin, Germany(柏林夏里特医学院医学信息学研究所,柏林,德国) Clinical Study Center, Berlin Institute of Health, Berlin, Germany(柏林健康研究所临床研究中心,柏林,德国) Institute of Informatics, Humboldt University, Berlin, Germany(柏林洪堡大学信息学研究所,柏林,德国) Institute of Informatics, Freie Universität Berlin, Berlin, Germany(柏林自由大学信息学研究所,柏林,德国) Health Data Science Unit, University Hospital Heidelberg, Heidelberg, Germany(海德堡大学医院健康数据科学部,海德堡,德国)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 Codebase-Memory通过MCP协议构建Tree-Sitter知识图谱,提升LLM代码探索效率,实现更高准确性与更低资源消耗。

Comments 10 pages, 5 authors, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26664 2026-03-30 cs.SE cs.CL 62%

Learning to Commit: Generating Organic Pull Requests via Online Repository Memory

学习承诺:通过在线仓库记忆生成有机的拉取请求

Mo Li, L. H. Xu, Qitai Tan, Ting Cao, Yunxin Liu

机构 * Tsinghua University(清华大学)

专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.SE

AI总结 本文提出Learning to Commit框架,通过在线仓库记忆提升生成拉取请求的有机性,通过对比历史提交改进代码风格和架构约束。

Comments Preprint. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21891 2026-03-30 cs.SE cs.CL 62%

AgentPack: A Dataset of Code Changes, Co-Authored by Agents and Humans

AgentPack:一个由代理和人类共同撰写的代码更改数据集

Yangtian Zi, Zixuan Wu, Aleksander Boruch-Gruszecki, Jonathan Bell, Arjun Guha

机构 * Northeastern University(东北大学)

专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.SE

AI总结 本文提出AgentPack数据集,包含180万条由Claude Code、OpenAI Codex和Cursor Agent与人类共同撰写的代码更改,分析其结构特性,并展示基于该数据集微调的模型在代码编辑任务中优于传统人类提交数据集的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25770 2026-03-30 cs.SE cs.AI 62%

ReCUBE: Evaluating Repository-Level Context Utilization in Code Generation

ReCUBE:评估代码生成中仓库级上下文利用

Jiseung Hong, Benjamin G. Ascoli, Jinho D. Choi

机构 * Carnegie Mellon University(卡内基梅隆大学) Emory University(埃默里大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 ReCUBE基准测试评估LLM在代码生成中利用仓库级上下文的有效性,通过重建掩码文件并使用依赖关系和文档作为上下文,发现即使先进模型在完整上下文设置下也仅达到37.57%的通过率,而引入Caller-Centric Exploration工具包可显著提升性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25697 2026-03-27 cs.SE cs.AI 62%

The Kitchen Loop: User-Spec-Driven Development for a Self-Evolving Codebase

厨房循环:用户驱动的自演化代码库开发

Yannick Roy

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出厨房循环框架,通过统一信任模型实现自主演化软件,包含规范表面、用户模拟、不可战胜测试和漂移控制,验证两个生产系统285+次迭代,产生1,094+合并请求且无回归。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25146 2026-03-27 cs.SE cs.AI 62%

Factors Influencing the Quality of AI-Generated Code: A Synthesis of Empirical Evidence

影响人工智能生成代码质量的因素:一项经验证据的综合分析

Vehid Geruslu, Zulfiyya Aliyeva, Eray Tüzün

机构 * Queen’s University Belfast(贝尔法斯特女王大学) Azerbaijan Technical University(阿塞拜疆技术大学) MilliSoft MMC Corporation(MilliSoft MMC公司) Bilkent University(比尔肯特大学)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 本研究综合现有经验证据,分析影响人工智能生成源代码质量的因素,并探讨这些因素在不同评估情境下的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21149 2026-03-27 cs.SE cs.AI cs.MA 62%

Emergent Formal Verification: How an Autonomous AI Ecosystem Independently Discovered SMT-Based Safety Across Six Domains

涌现形式验证:自主AI生态系统如何在六个领域独立发现基于SMT的安全性

Octavian Untila

机构 * Aisophical SRL

专题命中 软件智能体 :AI agent(abstract);分类 cs.AI、cs.SE

AI总结 自主AI生态系统在无显式形式方法指令下,独立在六个AI安全领域发现SMT求解器的应用,提出统一框架实现100%准确验证。

Comments 10 pages, 3 figures, 5 tables. Code: https://github.com/octavuntila-prog/substrate-guard. Companion paper: https://doi.org/10.5281/zenodo.19157571

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21430 2026-03-26 cs.AI cs.SE 62%

DomAgent: Leveraging Knowledge Graphs and Case-Based Reasoning for Domain-Specific Code Generation

DomAgent:利用知识图谱和基于案例的推理进行领域特定代码生成

Shuai Wang, Dhasarathy Parthasarathy, Robert Feldt, Yinan Yu

机构 * Chalmers University of Technology(楚德斯大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 DomAgent通过结合知识图谱和基于案例的推理,提升领域特定代码生成能力,通过结构化推理和定向检索实现领域适应,实验表明其能显著提升复杂真实应用场景的代码生成性能。

Comments Accepted to AAMAS 2026 EA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18314 2026-03-20 cs.LG cs.AI 62%

Approximate Subgraph Matching with Neural Graph Representations and Reinforcement Learning

基于神经图表示与强化学习的近似子图匹配

Kaiyang Li, Shihao Ji, Zhipeng Cai, Wei Li

机构 * IEEE Publication Technology Group(IEEE出版技术组)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于强化学习的近似子图匹配算法,利用图变压器提取图表示并结合PPO优化策略,提升匹配效果与效率。

Comments 10 pages, 5 figures. Code available at https://github.com/KaiyangLi1992/RL-ASM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17104 2026-03-19 cs.SE cs.AI 62%

When the Specification Emerges: Benchmarking Faithfulness Loss in Long-Horizon Coding Agents

当规范出现时:长期远 horizon 编码代理中忠实度损失的基准测试

Lu Yan, Xuan Chen, Xiangyu Zhang

机构 * Purdue University(普渡大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出一个基准测试,研究在逐步披露目标设计时,编码代理中忠实度损失(SLUMP)的变化,通过20篇最新ML论文和371个可验证组件评估不同平台的实现忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15921 2026-03-18 cs.SE cs.AI 62%

VIBEPASS: Can Vibe Coders Really Pass the Vibe Check?

VIBEPASS:振动编码器真的能通过振动检查吗?

Srijan Bansal, Jiao Fangkai, Yilun Zhou, Austin Xu, Shafiq Joty, Semih Yavuz

机构 * Salesforce AI Research(Salesforce AI研究院) Nanyang Technological University(南洋理工大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文研究了振动编码器在自主软件工程中的能力,发现故障定位推理是瓶颈,而非代码生成或测试有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15566 2026-03-17 cs.SE cs.AI cs.SY eess.SY 62%

Lore: Repurposing Git Commit Messages as a Structured Knowledge Protocol for AI Coding Agents

Lore:将Git提交信息重新利用为AI编码代理的结构化知识协议

Ivan Stetsenko

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出Lore协议,通过Git trailers重构提交信息,生成包含约束、拒绝替代方案、代理指令和验证元数据的自包含决策记录,以解决AI编码代理在代码生产与消费中机构知识流失的问题。

Comments 8 pages, 1 figure, 1 table. Preprint available at https://doi.org/10.5281/zenodo.19051840

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13640 2026-03-17 cs.LG cs.SE 62%

SemRep: Generative Code Representation Learning with Code Transformations

SemRep:基于代码变换的生成式代码表示学习

Weichen Li, Jiamin Song, Bogdan Alexandru Stoica, Arav Dhoot, Gabriel Ryan, Shengyu Fu, Kexin Pei

机构 * The University of Chicago(芝加哥大学) Columbia University(哥伦比亚大学) Microsoft(微软公司)

专题命中 软件智能体 :agent(abstract);分类 cs.LG、cs.SE

AI总结 SemRep通过生成式代码表示学习提升代码变换效果,利用语义保持变换作为中间表示,实现更准确的语义推理和更高效的代码优化。

详情

展开后加载摘要…

URL PDF HTML 收藏