arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1079 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 1079 篇

2605.17242 2026-05-19 cs.SE 57%

From Runnable to Shippable: Multi-Agent Test-Driven Development for Generating Full-Stack Web Applications from Requirements

从可运行到可发布:多智能体测试驱动开发用于从需求生成全栈Web应用

Yuxuan Wan, Tingshuo Liang, Jiakai Xu, Jingyu Xiao, Yintong Huo, Michael R Lyu

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 本文提出TDDev框架,通过三个阶段自动化测试驱动开发流程,提升Web应用生成质量,发现最佳协议取决于模型生成风格,且TDDev显著减少人工干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16827 2026-05-19 cs.AI 57%

Voices in the Loop: Mapping Participatory AI

循环中的声音:参与式AI的映射

Rashid Mushkani

机构 * Right to AI(人工智能权利) Mila -- Québec AI Institute(魁北克人工智能研究所)

专题命中 软件智能体 :repository(abstract);分类 cs.AI

AI总结 本文研究了参与式AI在公共、公民和人道主义领域的应用,提出了一个开放的参与式AI倡议存储库和交互式地图集,通过整合Maga~na和Shilton的可信AI语料库以及额外的审计案例,揭示了参与式AI在地理分布、参与层级、生命周期、组织形式、验证状态和文档缺口等方面的模式,并展示了如何通过版本发布、记录链接的问题和注释通道、模式反馈流程和删除或限制披露请求来实现参与式AI基础设施的设计和治理框架。

Comments Accepted to The 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26), June 25--28, 2026, Montreal, QC, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16300 2026-05-19 cs.CY cs.AI cs.MA cs.RO 57%

Consent Chain Degradation in Embodied Multi-Agent Systems: Bridging the Gap Between AI Agent Governance and Robot Ethics

具身多智能体系统中的同意链退化:弥合人工智能代理治理与机器人伦理之间的鸿沟

Mehmet Haklidir

机构 * Artificial Intelligence Institute, TÜBİTAK BİLGEM(人工智能研究所,TÜBİTAK BİLGEM)

专题命中 软件智能体 :software agent(abstract);分类 cs.AI

AI总结 本文提出同意链退化(CCD)概念,探讨多机器人委托链中人类同意的具体性、有效性及范围如何退化,并通过医疗、家庭和工业机器人场景展示其实际表现,分析现有法规对CCD核心维度的缺失。

Comments Accepted for oral presentation at the 2nd Workshop on Robot Ethics (WoRoBet), ICRA 2026, Vienna, Austria, June 1, 2026. 6 pages, 3 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16191 2026-05-18 cs.CL cond-mat.other physics.comp-ph 57%

Optimized Three-Dimensional Photovoltaic Structures with LLM guided Tree Search

优化的三维光伏结构与LLM引导的树搜索

Michael P. Brenner, Lizzie Dorfman, John C. Platt

机构 * Google Research School of Engineering and Applied Sciences, Harvard University(谷歌研究工程与应用科学学院,哈佛大学) Google Research(谷歌研究)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 本文利用AI编码系统生成新型科学假设,通过LLM驱动的树搜索算法优化三维光伏结构,解决中纬度地区传统光伏板的效率瓶颈问题。

Comments 10 pages 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14671 2026-05-15 cond-mat.mtrl-sci cs.AI 57%

Agentic Design of Compositional Descriptors via Autoresearch for Materials Science Applications

通过Autoresearch进行组合描述符的代理设计用于材料科学应用

Matteo Cobelli, Stefano Sanvito

机构 * School of Physics(物理系) CRANN Institute, Trinity College, Dublin 2, Dublin, Ireland(CRANN研究所,三一学院,都柏林2号,都柏林,爱尔兰)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文通过Autoresearch框架设计输入描述符,利用大语言模型生成化学化合物的组合描述符,并通过随机森林工作流评估,提升了材料性质预测的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12808 2026-05-15 cs.LG 57%

Neurodata Without Boredom: Benchmarking Agentic AI for Data Reuse

神经数据无厌倦:评估代理AI的数据重用基准测试

Ling-Qi Zhang, Kristin Branson

机构 * HHMI Janelia Research Campus(HHMI贾能利亚研究中心)

专题命中 软件智能体 :coding agent(abstract);分类 cs.LG

AI总结 本文探讨了代理AI在神经数据重用中的应用,通过八篇研究论文评估了通用编码代理在处理多模态数据和任务解码中的表现,发现其在子任务中表现良好,但难以实现端到端无错误解决方案,提出了数据共享的最佳实践。

Comments v2: Added forgotten acknowledgments section

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13624 2026-05-14 cs.CL 57%

Edit-level Majority Voting Mitigates Over-Correction in LLM-based Grammatical Error Correction

基于编辑层面多数投票的过纠正缓解方法:用于基于大语言模型的语法错误修正

Takumi Goto, Yusuke Sakai, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技术研究所)

专题命中 软件智能体 :repository(abstract);分类 cs.CL

AI总结 本文提出一种无需训练的推理方法,通过多候选生成模型进行编辑层面多数投票,缓解LLM在语法纠错中的过纠正问题,在多个语言基准测试中优于贪婪和MBR解码。

Comments BEA Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12493 2026-05-13 cs.CL 57%

LongMemEval-V2: Evaluating Long-Term Agent Memory Toward Experienced Colleagues

LongMemEval-V2:评估长期代理记忆以成为经验丰富的同事

Di Wu, Zixiang Ji, Asmi Kawatkar, Bryan Kwan, Jia-Chen Gu, Nanyun Peng, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 LongMemEval-V2通过451个手动整理的问题评估代理记忆系统是否能帮助代理在定制环境中获取经验,采用上下文收集方法并提出两种记忆方法,实验显示AgentRunbook-C在准确率上表现最佳。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12366 2026-05-13 cs.AI 57%

Classifier Context Rot: Monitor Performance Degrades with Context Length

分类器上下文旋转:通过上下文长度监控性能退化

Sam Martin, Fabien Roger

机构 * Anthropic Fellows Program(Anthropic fellows项目)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 研究发现当前前沿模型在长上下文情况下难以检测危险行为,通过提示技术可部分缓解此问题,强调长上下文退化对监控性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12270 2026-05-13 cs.SE 57%

Characterizing the Failure Modes of LLMs in Resolving Real-World GitHub Issues

表征LLMs在解决现实世界GitHub问题中的故障模式

Yanjie Jiang, Yian Huang, Guancheng Wang, Junjie Chen, Hui Liu, Lionel Briand

专题命中 软件智能体 :program repair(abstract);分类 cs.SE

AI总结 本文通过评估三种先进模型在SWE-bench Verified数据集上的表现,揭示了LLMs在复杂修复任务中故障模式的分类,发现策略制定和逻辑综合是错误率最高的阶段,而故障定位错误率最低,同时揭示了不同模型在鲁棒性和成本上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10480 2026-05-12 cs.AI 57%

ASIA: an Autonomous System Identification Agent

ASIA:一个自主系统识别代理

Dario Piga, Marco Forgione

机构 * Dalle Molle Institute for Artificial Intelligence (IDSIA), SUPSI(达勒莫利人工智能研究所(IDSIA),SUPSI)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 ASIA通过自主编码代理自动完成系统识别中的模型选择与参数调优,基于两个基准测试分析其搜索行为和发现的架构策略,探讨了该方法的潜力与局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09879 2026-05-12 cs.AI 57%

M2A: Synergizing Mathematical and Agentic Reasoning in Large Language Models

M2A:在大型语言模型中协同数学与代理推理

Junjian Wang, Xin Zhou, Qiran Xu, Kun Zhan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Li Auto Inc.(Li Auto公司)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文提出M2A框架,通过模型融合协同数学与代理推理,提升多任务学习下的推理稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09684 2026-05-12 cs.CR cs.AI 57%

MonitoringBench: Semi-Automated Red-Teaming for Agent Monitoring

MonitoringBench: 面向代理监控的半自动化红队测试

Monika Jotautaitė, Maria Angelica Martinez, Ollie Matthews, Tyler Tracy

机构 * Independent(独立)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文提出半自动化红队方法,针对代理监控中的攻击检测问题,通过改进攻击生成和测试流程,构建了包含2644条攻击轨迹的MonitoringBench基准,评估监控能力与失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09534 2026-05-12 cs.CR cs.AI 57%

Governing AI-Assisted Security Operations: A Design Science Framework for Operational Decision Support

治理人工智能辅助的安全运营:一种用于操作决策支持的设计科学框架

Elyson A. De La Cruz, Rishikesh Sahay, Md Rasel Al Mamun

机构 * Department of Artificial Intelligence, University of the Cumberlands(人工智能系,坎伯兰大学) Department of Management Information Systems, University of Illinois Springfield(管理信息系统系,伊利诺伊大学斯普林菲尔德分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文提出了一种设计科学框架,用于在高风险数字基础设施中管理人工智能辅助的操作决策支持,通过定义设计提案、角色问责制、成熟阶段、质量门禁、评估标准和证据边界。

Comments 28 pages, 1 listing, 1 figure, 20 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09055 2026-05-12 cs.RO cs.AI cs.MA 57%

Octopus Protocol: One-Shot Hardware Discovery and Control for AI Agents via Infrastructure-as-Prompts

Octopus Protocol:通过基础设施即提示实现AI代理的一次性硬件发现与控制

Quilee Simeon, Justin M. Wei, Yile Fan

机构 * MIT(麻省理工学院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 Octopus Protocol通过五阶段流程实现硬件发现与控制,利用语言模型API生成MCP协议服务器,使AI代理能自主完成硬件集成与闭环视觉-运动控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08382 2026-05-12 cs.CR cs.CL cs.CY 57%

SecureForge: Finding and Preventing Vulnerabilities in LLM-Generated Code via Prompt Optimization

SecureForge:通过提示优化发现并防止LLM生成代码中的漏洞

Houjun Liu, Lisa Einstein, John Yang, Joachim Baumann, Duncan Eddy, Christopher D. Manning, Mykel Kochenderfer, Diyi Yang

机构 * Stanford University(斯坦福大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 本文提出SecureForge框架,通过自动化流程发现并减少LLM生成代码中的安全漏洞,提升代码安全性的同时保持单元测试性能,实验显示漏洞减少达48%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07420 2026-05-11 cs.LG cs.CV 57%

SR$^2$-LoRA: Self-Rectifying Inter-layer Relations in Low-Rank Adaptation for Class-Incremental Learning

SR$^2$-LoRA: 自适应层间关系的自我校正在低秩适应中的应用用于类别增量学习

Fengqiang Wan, Yipeng Lin, Kan Lv, Yang Yang

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学)

专题命中 软件智能体 :repository(abstract);分类 cs.LG

AI总结 本文提出SR$^2$-LoRA方法,通过约束层间关系漂移来缓解类别增量学习中的灾难性遗忘问题,理论分析显示其对估计扰动具有更强鲁棒性,实验表明其在任务数量增加时表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04320 2026-05-11 cs.SE 57%

Reproduction Test Generation for Java SWE Issues

Java SWE问题的再现测试生成

Toufique Ahmed, Jatin Ganhotra, Avraham Shinnar, Martin Hirzel

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 本文针对Java企业软件中的SWE问题,提出首个Java仓库级再现测试基准TDD-Bench-Java和高绩效的e-Otter++工具,填补了Python以外语言的研究空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16928 2026-05-11 cs.GT cs.AI cs.MA 57%

Discovering Multiagent Learning Algorithms with Large Language Models

用大型语言模型发现多智能体学习算法

Zun Li, John Schultz, Daniel Hennes, Marc Lanctot

机构 * Google DeepMind(谷歌DeepMind)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文利用AlphaEvolve框架自动发现CFR和PSRO算法,提出VAD-CFR和SHOR-PSRO,通过简化核心机制获得更高效的WOP-CFR和PM-PSRO,提升泛化能力。

Comments More experiments and analysis on algorithmic distilliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11535 2026-05-08 cs.AI 57%

Problem Reductions at Scale: Agentic Integration of Computationally Hard Problems

大规模问题规约:代理集成计算难题

Xi-Wei Pan, Shi-Wen An, Jin-Guo Liu

机构 * HKUST (GZ)(香港科技大学(广州)) Institute of Science Tokyo(东京科学研究所) RIKEN AIP(理化学研究所AIP)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文提出通过代理工程实现大规模问题规约库,利用无代码贡献路线、多层验证栈和自动化流程,快速构建包含100多种问题类型和200多种规约规则的工具,实现问题与求解器的高效连接。

Comments The source code is available at https://github.com/CodingThrust/problem-reductions

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05921 2026-05-08 cs.AI cs.HC 57%

Intentmaking and Sensemaking: Human Interaction with AI-Guided Mathematical Discovery

意图生成与意义构建:人类与AI引导的数学发现的交互

Alex Bäuerle, Adam Connors, Alexander Novikov, Adam Zsolt Wagner, Ngân Vũ, Fernanda Viegas, Martin Wattenberg, Lucas Dixon

机构 * Google DeepMind(谷歌DeepMind)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文探讨了专家数学家使用AlphaEvolve进行高级问题研究的流程,提出意图生成与意义构建的协作框架,强调AI工具应作为协作而非黑箱助手。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01548 2026-05-05 cs.LG cs.CV eess.SP 57%

ECG-biometrics-bench: A Unified Framework for Reproducible Benchmarking of ECG Biometrics

ECG生物特征-基准: 一个统一的可重复基准测试框架用于ECG生物特征

Milad Parvan

机构 * Independent Researcher(独立研究者)

专题命中 软件智能体 :repository(abstract);分类 cs.LG

AI总结 本文提出ECG-biometrics-bench框架,用于可重复评估ECG生物特征,揭示随机分割谬误,展示模型失效并非特定于模型,且通过动态多会话模板融合缓解时间老化影响。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01214 2026-05-05 cs.AI cs.CY 57%

Agentic AI Systems Should Be Designed as Marginal Token Allocators

代理AI系统应作为边际令牌分配经济体进行设计

Siqi Zhu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文提出代理AI系统应以边际令牌分配经济体为设计框架,揭示各层在边际效益等于边际成本加延迟成本加风险成本的条件下,导致局部优化全局失衡的问题,提出令牌意识评估、自主定价、拥堵定价和服务风险调整等研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25804 2026-04-29 cs.SE 57%

Key Developer Roles and Organizational Coupling in Microservices: A Longitudinal Analysis

微服务中的关键开发者角色与组织耦合:纵向分析

Xiaozhou Li, Nariman Mani, Jose Sosa Rodriguez, Tomas Cerny

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 本文研究微服务系统中开发者角色对组织耦合的影响,通过GitHub数据纵向分析,发现连接者角色对耦合影响最大,多重角色协同进一步加剧耦合效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24478 2026-04-28 cs.HC cs.SE 57%

Putting a Face to the Issue: Fostering User Empathy of Open Source Software Developers With PersonaFlow

为问题赋予面孔:通过PersonaFlow促进用户对开源软件开发者的同理心

Boniface Bahati Tadjuidje, Jin L. C. Guo, Jinghui Cheng

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 本文提出PersonaFlow工具,通过生成可编辑的用户人设帮助开发者理解用户需求,研究发现大多数开发者在使用后改变了对用户的理解方式,提升了用户导向的行为。

Comments 25 pages, 4 figures, Accepted to DIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24450 2026-04-28 cs.SE 57%

On the Footprints of Reviewer Bots Feedback on Agentic Pull Requests in OSS GitHub Repositories

审查员机器人反馈在OSS GitHub仓库中代理拉取请求的足迹

Syeda Kaneez Fatima, Yousuf Abrar, Abdul Rehman Tahir, Amelia Nawaz, Shamsa Abid, Abdul Ali Bangash

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 研究探讨审查员机器人反馈质量与数量对代理拉取请求接受和解决时间的影响,发现反馈质量下降与评论数量增加相关,建议优先提供高相关性反馈。

Comments 5 pages, 3 figures, 1 table, Mining Software Repositories (MSR'26) Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23080 2026-04-28 cs.MA cs.AI cs.DC 57%

Usable Agent Discovery for Decentralized AI Systems

用于去中心化人工智能系统的可用代理发现

Patrizio Dazzi, Emanuele Carlini, Matteo Mordacchini, Saul Urso

机构 * Department of Computer Science(计算机科学系) University of Pisa(比萨大学) Institute of Information Science and Technologies(信息科学与技术研究所) National Research Council of Italy(意大利国家研究理事会) Institute of Informatics and Telematics(信息学与电信研究所)

专题命中 软件智能体 :software agent(abstract);分类 cs.AI

AI总结 本文研究了在双层 churn 情况下去中心化代理发现,比较了不同机制在路由效率、鲁棒性和服务准备度方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23048 2026-04-28 cs.SE 57%

The Impact of Documentation on Test Engagement in Pull Requests in OSS

在开源软件中拉取请求中文档对测试参与的影响

Teal Amore, Nathan Berman, Siyuan Jiang

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 研究探讨了文档对开发者测试行为的影响,引入测试参与率(TER)并发现文档完整性与测试参与呈正相关,为提高测试参与提供了新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19965 2026-04-23 cs.SE 57%

Insights into Security-Related AI-Generated Pull Requests

对与安全相关的AI生成拉取请求的洞察

Md Fazle Rabbi, Asif K. Turzo, Arifa I. Champa, Minhaz F. Zibran

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 本文分析了33,000多个AI生成的拉取请求,发现675个与安全相关的提交,揭示了AI生成的拉取请求中常见的安全漏洞及审查结果,发现提交质量对接受度影响有限,扩展了拒绝分类。

Comments accepted at the International Conference on Evaluation and Assessment in Software Engineering (EASE), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00253 2026-04-23 cs.SE 57%

Towards Explorative IRBL: Combining Semantic Retrieval with LLM-driven Iterative Code Exploration

迈向探索性IRBL:结合语义检索与LLM驱动的迭代代码探索

Moumita Asad, Rafed Muhammad Yasir, Sam Malek

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 本文提出GenLoc,结合语义检索与LLM驱动的代码探索功能,通过迭代分析代码库识别故障文件,优于传统和深度学习方法。

详情

展开后加载摘要…

URL PDF HTML 收藏