arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3224 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 3224 篇

2603.18000 2026-03-19 cs.AI 57%

AgentFactory: A Self-Evolving Framework Through Executable Subagent Accumulation and Reuse

AgentFactory: 通过可执行子代理积累与重用实现自我进化框架

Zhang Zhang, Shuqi Lu, Hongjin Qian, Di He, Zheng Liu

机构 * Peking University(北京大学) Hong Kong Polytechnic University(香港理工大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出AgentFactory,通过保存可执行子代理代码而非文本经验实现自我进化,使子代理在反馈中持续优化,提升任务执行效率和鲁棒性,实现能力持续积累。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16216 2026-03-18 cs.CE cs.AI cs.ET 57%

Generative AI for Quantum Circuits and Quantum Code: A Technical Review and Taxonomy

生成式AI用于量子电路和量子代码:技术综述与分类

Juhani Merilehto

机构 * University of Vaasa(瓦萨大学) University of Turku(图尔库大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 综述13个生成系统和5个支持数据集,探讨量子电路和代码生成的分类与训练方法,发现生成系统在语法和语义层面有所覆盖,但缺乏对量子硬件的端到端评估。

Comments 20 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18328 2026-03-17 cs.CV cs.AI 57%

Virtual Full-stack Scanning of Brain MRI via Imputing Any Quantised Code

通过填补任意量化代码实现脑部MRI的虚拟全栈扫描

Yicheng Wu, Tao Song, Zhonghua Wu, Jin Ye, Zongyuan Ge, Wenjia Bai, Zhaolin Chen, Jianfei Cai

专题命中 软件智能体 :workflow(abstract);分类 cs.AI

AI总结 本文提出CodeBrain框架,通过区域级全栈代码预测解决MRI模态缺失问题,提升数据完整性和临床实用性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22954 2026-03-16 cs.AI 57%

Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents

达尔文戈德尔机器:自我改进代理的开放性进化

Jenny Zhang, Shengran Hu, Cong Lu, Robert Lange, Jeff Clune

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出达尔文戈德尔机器,通过迭代修改自身代码并验证改进,实现自我提升,提升代码能力并在多个基准测试中取得显著成绩。

Comments Code at https://github.com/jennyzzt/dgm

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11559 2026-03-13 cs.AI cs.HC 57%

AI Knows What's Wrong But Cannot Fix It: Helicoid Dynamics in Frontier LLMs Under High-Stakes Decisions

AI知错却无法修复:前沿大语言模型在高风险决策中的螺旋动态

Alejandro R Jadad

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 前沿大语言模型在高风险决策中表现出螺旋动态,即在错误中自我识别却无法修复,导致可靠性下降,需通过识别该模式以提升AI信任度。

Comments 22 pages, 2 tables, 1 appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11073 2026-03-13 cs.SE 57%

Context Before Code: An Experience Report on Vibe Coding in Practice

上下文在代码之前:关于在实践中使用Vibe编码的经验报告

Md Nasir Uddin Shuvo, Md Aidul Islam, Md Mahade Hasan, Muhammad Waseem, Pekka Abrahamsson

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文报告了一个全栈团队在实践中应用Vibe编码构建多项目代理学习平台和学术检索增强生成系统,并探讨了生成代码在隔离约束和架构设计上的不足。

Comments 6 Pages, 1 Figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10597 2026-03-12 cs.RO cs.AI 57%

Recover to Predict: Progressive Retrospective Learning for Variable-Length Trajectory Prediction

恢复以预测:渐进性回顾学习用于可变长度轨迹预测

Hao Zhou, Lu Qi, Jason Li, Jie Zhang, Yi Liu, Xu Yang, Mingyu Fan, Fei Luo

机构 * Great Bay University(大湾大学) Tsinghua SIGS(清华大学SIGS) Wuhan University(武汉大学) NTU(国立科技大学) Donghua University(东华大学) CASIA(中国科学院自动化研究所)

专题命中 软件智能体 :planning(abstract);分类 cs.AI

AI总结 本文提出渐进回顾框架和滚动起始训练策略,用于解决可变长度轨迹预测中的信息缺口问题,提升预测准确性。

Comments Paper is accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10194 2026-03-12 cs.CR cs.AI 57%

MCP-in-SoS: Risk assessment framework for open-source MCP servers

MCP-in-SoS:开源MCP服务器的风险评估框架

Pratyay Kumar, Miguel Antonio Guirao Aguilera, Srikathyayani Srikanteswara, Satyajayant Misra, Abu Saleh Md Tayeen

机构 * New Mexico State University(新墨西哥州立大学) University of Hartford(哈特福德大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种针对开源MCP服务器的风险评估框架,通过静态代码分析识别弱点并评估其安全风险,揭示了现有系统存在的安全隐患。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07326 2026-03-10 cs.SE 57%

Echo: Graph-Enhanced Retrieval and Execution Feedback for Issue Reproduction Test Generation

Echo:基于图的检索与执行反馈的缺陷重现测试生成

Zhiwei Fei, Yue Pan, Federica Sarro, Jidong Ge, Marc Liu, Vincent Ng, He Ye

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 Echo通过基于代码图的检索和执行反馈生成缺陷重现测试用例,提升测试生成效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24254 2026-03-10 cs.LG 57%

Rethinking Continual Learning with Progressive Neural Collapse

重新思考连续学习与渐进神经崩溃

Zheng Wang, Wanhao Yu, Li Yang, Sen Lin

机构 * Department of Computer Science, University of Houston, USA(德克萨斯大学休斯顿分校计算机科学系) Department of Computer Science, University of North Carolina at Charlotte, USA(北卡罗来纳大学夏洛特分校计算机科学系)

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 本文提出渐进神经崩溃(ProNC)框架,通过动态扩展ETF目标,缓解连续学习中的灾难性遗忘问题,实现更灵活高效的模型学习。

Comments Our work is accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06050 2026-03-09 cs.SE 57%

Pre-AI Baseline: Developer IDE Satisfaction and Tool Autonomy in 2022

AI 之前的基础线:2022 年开发者 IDE 满意度与工具自主性

Nikola Balić

专题命中 软件智能体 :AI agent(abstract);分类 cs.SE

AI总结 本研究分析了 2022 年开发者对 IDE 的满意度及工具自主性的影响,揭示了高满意度背后的工具使用差异和保留率问题。

Comments 21 pages, 5 figures. Preprint version submitted to PeerJ Computer Science; supplementary material included in the source bundle

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05399 2026-03-06 cs.AI 57%

Judge Reliability Harness: Stress Testing the Reliability of LLM Judges

LLM裁判可靠性检测工具:检验LLM裁判的可靠性

Sunishchal Dev, Andrew Sloan, Joshua Kavner, Nicholas Kong, Morgan Sandler

机构 * RAND Corporation(RAND公司)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 本研究提出了一种开源工具,用于评估LLM裁判在不同基准中的可靠性,发现模型和扰动类型对性能有显著影响。

Comments Accepted at Agents in the Wild: Safety, Security, and Beyond Workshop at ICLR 2026 - April 26, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14132 2026-03-06 cs.SE 57%

Toward architecting self-coding information systems

迈向自编码信息系统的构建

Rodrigo Falcão, Frank Elberzhager, Karthik Vaidhyanathan

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本文提出自编码信息系统,旨在通过自动生成和部署源代码来提升系统动态适应能力,缩短新功能的上市时间。

Comments Accepted for ICSE 2026 Track "Software Architecture BoF"

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11147 2026-03-05 cs.SE 57%

From Feedback to Failure: Automated Android Performance Issue Reproduction

从反馈到失败:自动化Android性能问题重现

Zhengquan Li, Zhenhao Li, Zishuo Ding

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 RevPerf通过整合应用评论信息,自动化重现移动应用性能问题,实现72.73%的成功率。

Comments 22page, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01814 2026-03-03 cs.SE 57%

Architecture-Aware Multi-Design Generation for Repository-Level Feature Addition

面向架构的多设计生成用于仓库级特性添加

Mingwei Liu, Zhenxi Chen, Zheng Pei, Zihao Wang, Yanlin Wang, Zibin Zheng

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 RAIM通过多设计生成和架构感知机制,提升仓库级特性添加的准确性和稳定性。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01801 2026-03-03 cs.AI 57%

What Papers Don't Tell You: Recovering Tacit Knowledge for Automated Paper Reproduction

论文未告诉你什么:为自动化论文复现恢复隐性知识

Lehui Li, Ruining Wang, Haochen Song, Yaoxin Mao, Tong Zhang, Yuyao Wang, Jiayi Fan, Yitong Zhang, Jieping Ye, Chengqi Zhang, Yongshun Gong

机构 * School of Software, Shandong University China Beijing Institute of Technology China Zhejiang University China Dept.\ of Math \& Statistics, Boston University USA College of AI, Tsinghua University China Alibaba Group China The Hong Kong Polytechnic University Hong Kong SAR, China School of Software, Shandong University Beijing Institute of Technology Zhejiang University Dept.\ of Math \& Statistics, Boston University College of AI, Tsinghua University Alibaba Group The Hong Kong Polytechnic University

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出一种基于图的智能体框架,通过恢复关系型、身体型和集体型隐性知识,提升自动化论文复现性能。

Comments 32 pages (+ appendix), 8 figures. Lehui Li and Ruining Wang contributed equally. Yongshun Gong is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01345 2026-03-03 cs.SE 57%

PymooLab: An Open-Source Visual Analytics Framework for Multi-Objective Optimization using LLM-Based Code Generation and MCDM

PymooLab: 一个基于LLM代码生成和MCDM的多目标优化开源可视化分析框架

Thiago Santos, Sebastiao Xavier, Luiz Gustavo de Oliveira Carneiro, Gustavo de Souza

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 PymooLab通过LLM辅助代码生成和MCDM工具,为多目标优化提供可视化分析框架,提升领域专家的可操作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18216 2026-03-03 cs.SE 57%

A Roadmap on Modern Code Review: Challenges and Opportunities

现代代码审查的路线图:挑战与机遇

Zezhou Yang, Cuiyun Gao, Zhaoqiang Guo, Zhenhao Li, Kui Liu, Xin Xia, Yuming Zhou

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文提出现代代码审查的路线图,通过三个范式转变推动其向智能、包容的未来演进。

Comments This paper is accepted by TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00897 2026-03-03 cs.SE 57%

Detect Repair Verify for Securing LLM Generated Code: A Multi-Language Empirical Study

检测修复验证以确保LLM生成的代码安全:一个多语言实证研究

Cheng Cheng

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文通过多语言实证研究,提出了一种用于确保LLM生成代码安全的检测-修复-验证流程,并构建了新的基准数据集以评估不同修复方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17371 2026-03-03 cs.SE 57%

GraphCue for SDN Configuration Code Synthesis

基于图的SDN配置代码合成

Haomin Qi, Fengfei Yu, Chengbo Huang

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 GraphCue通过拓扑感知检索和约束条件生成,实现了SDN配置代码合成的高通过率和高效验证。

Comments 2 pages, 2 figures

Journal ref IEEE Consumer Communications & Networking Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22518 2026-02-27 cs.SE 57%

RepoMod-Bench: A Benchmark for Code Repository Modernization via Implementation-Agnostic Testing

RepoMod-Bench: 一个通过实现无关测试进行代码仓库现代化的基准测试

Xuefeng Li, Nir Ben-Israel, Yotam Raz, Belal Ahmed, Doron Serebro, Antoine Raux

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 RepoMod-Bench通过实现无关测试评估代码仓库现代化,揭示大规模自主现代化的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22260 2026-02-27 cs.LG cs.NE 57%

Code World Models for Parameter Control in Evolutionary Algorithms

用于进化算法参数控制的代码世界模型

Camilo Chacón Sartori, Guillem Rodríguez Corominas

机构 * ICN2 -- Catalan Institute of Nanoscience Nanotechnology, Barcelona, Spain Artificial Intelligence Research Institute (IIIA-CSIC), Barcelona, Spain Universitat Polit\` e cnica de Catalunya (UPC), Barcelona, Spain

专题命中 软件智能体 :planning(abstract);分类 cs.LG

AI总结 本文提出利用代码世界模型进行进化算法参数控制,通过模拟器实现高效突变强度选择,在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07244 2026-02-26 cs.SE 57%

Acceptance Test Generation with Large Language Models: An Industrial Case Study

基于大语言模型的接受测试生成:一项工业案例研究

Margarida Ferreira, Luis Viegas, Joao Pascoal Faria, Bruno Lima

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文研究了利用大语言模型生成Web应用验收测试的两步方法,通过工业案例验证了其在提高测试质量和效率方面的有效性。

Journal ref 2025 IEEE/ACM International Conference on Automation of Software Test (AST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19594 2026-02-24 cs.LG 57%

ISO-Bench: Can Coding Agents Optimize Real-World Inference Workloads?

ISO-Bench: 编码代理能否优化现实世界的推理工作负载?

Ayush Nangia, Shikhar Mishra, Aman Gokrani, Paras Chopra

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 ISO-Bench通过结合硬指标和软指标评估编码代理在现实世界推理优化任务中的能力,发现无单一代理占优,且模型与支架均影响性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01678 2026-02-24 cs.LG 57%

HeurekaBench: A Benchmarking Framework for AI Co-scientist

HeurekaBench: 一个用于AI合作者的基准评估框架

Siba Smarak Panigrahi, Jovana Videnović, Maria Brbić

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL))

专题命中 软件智能体 :agentic(abstract);分类 cs.LG

AI总结 HeurekaBench通过创建基于真实科学流程的基准,为评估AI合作者提供了一种方法,通过半自动流程生成探索性问题,并展示了批评模块对提升代理性能的效果。

Comments 33 pages, 5 figures, 7 tables. Code available at https://github.com/mlbio-epfl/HeurekaBench. Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17688 2026-02-23 cs.LG cs.PL 57%

AnCoder: Anchored Code Generation via Discrete Diffusion Models

AnCoder:通过离散扩散模型实现锚定代码生成

Anton Xue, Litu Rout, Constantine Caramanis, Sanjay Shakkottai

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 软件智能体 :planning(abstract);分类 cs.LG

AI总结 AnCoder通过结构化锚定扩散模型实现高质量代码生成,解决了传统方法无法尊重编程语言结构的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17018 2026-02-20 cs.SE 57%

Not Only for Developers: Exploring Plugin Maintenance for Knowledge-Centric Communities

不仅仅为开发者:探索知识导向社区的插件维护

Giovanni Rosa, David Moreno-Lumbreras, Raula Gaikovina Kula

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 研究探讨了非开发者主导社区中插件生态系统的维护,通过分析Obsidian平台的插件发现六个知识管理相关主题,并揭示了其工程结构和可持续性问题。

Comments Accepted to SANER2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17016 2026-02-20 cs.AI 57%

M2F: Automated Formalization of Mathematical Literature at Scale

M2F:大规模数学文献的自动化形式化

Zichen Wang, Wanli Ma, Zhenyu Ming, Gong Zhang, Kun Yuan, Zaiwen Wen

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Beijing International Center for Mathematical Research, Peking University(北京大学北京国际数学研究中心) Huawei Technologies(华为技术有限公司) Center for Machine Learning Research, Peking University(北京大学机器学习研究中心)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 M2F通过端到端自动化形式化框架,在三周内将教科书转化为Lean库,实现96%的证明成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16520 2026-02-19 cs.CR cs.AI 57%

Recursive language models for jailbreak detection: a procedural defense for tool-augmented agents

递归语言模型用于对抗检测:一种针对工具增强代理的程序性防御

Doron Shavit

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 本文提出基于递归语言模型的RLM-JB框架,通过程序化方法检测对抗性输入,实现高检测效果与高精度的平衡。

Comments 5 pages and 1 figure. Appendix: an additional 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16106 2026-02-19 cs.SE 57%

Algorithm-Based Pipeline for Reliable and Intent-Preserving Code Translation with LLMs

基于算法的可靠且意图保留的代码翻译管道

Shahriar Rumi Dipto, Saikat Mondal, Chanchal K. Roy

专题命中 软件智能体 :planning(abstract);分类 cs.SE

AI总结 本文提出一种基于算法的代码翻译管道,通过引入语言中立的中间规范提升翻译准确性和可靠性,实验结果显示其在多个指标上均优于直接翻译方法。

Comments Accepted at 34th IEEE/ACM International Conference on Program Comprehension (ICPC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏