arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1079 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 1079 篇

2604.19022 2026-04-22 cs.AI 57%

On Accelerating Grounded Code Development for Research

在研究中加速基于事实的代码开发

Santosh Ganji

机构 * Nirvawireless

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文提出框架,使代码代理能即时访问研究库和技术文档,从而加速专业领域中的代码代理应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18334 2026-04-21 cs.SE 57%

Reliability of AI Bots Footprints in GitHub Actions CI/CD Workflows

GitHub Actions CI/CD 工作流中 AI 机器人足迹的可靠性

Syed Muhammad Ashhar Shah, Sehrish Habib, Muizz Hussain, Maryam Abdul Ghafoor, Abdul Ali Bangash

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 研究分析了AI机器人在GitHub Actions CI/CD工作流中的可靠性,发现不同AI机器人成功率差异显著,且高频的AI PR可能影响工作流可靠性。

Comments 5 pages, 3 figures. Submitted to the 23rd International Conference on Mining Software Repositories (MSR 2026) Mining Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17950 2026-04-21 cs.AI 57%

CADMAS-CTX: Contextual Capability Calibration for Multi-Agent Delegation

CADMAS-CTX: 多智能体委托中的上下文能力校准

Chuhan Qiao

机构 * Beijing JIAOTONG University(北京交通大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文提出CADMAS-CTX框架,通过上下文条件后验概率实现多智能体委托中的能力校准,结合不确定性惩罚提升鲁棒性,实验表明其在GAIA和SWE-bench基准上显著优于静态方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17111 2026-04-21 cs.DC cs.AI 57%

HiveMind: OS-Inspired Scheduling for Concurrent LLM Agent Workloads

HiveMind: 为并发LLM代理工作负载提供操作系统启发的调度

Justice Owusu Agyemang, Jerry John Kponyo, Obed Kwasi Somuah, Elliot Amponsah, Godfred Manu Addo Boakye, Kwame Opuni-Boachie Obour Agyekum

机构 * Sperix Labs(Sperix实验室) VIA Cybersecurity Lab(VIA网络安全实验室) KNUST(科罗纳大学) Quantum and Assistive Technologies Lab(量子与辅助技术实验室)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 HiveMind通过引入五个操作系统启发的调度原语,解决并发LLM代理在共享API端点时的资源竞争问题,显著降低失败率并减少浪费计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17055 2026-04-21 cs.SE 57%

Workstream: A Local-First Developer Command Center for the AI-Augmented Engineering Workflow

Workstream: 一个面向AI增强工程流程的本地优先开发者指挥中心

Happy Bhati

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 Workstream通过整合多个工具的数据,提供AI读熟度评分和审查智能分析,提升开发者工作效率和响应速度。

Comments 6 pages, 3 figures, 5 tables. Open source: https://github.com/happybhati/workstream

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16736 2026-04-21 cs.AI 57%

When Agents Go Quiet: Output Generation Capacity and Format-Cost Separation for LLM Document Synthesis

当代理变得沉默:LLM文档合成中的输出生成能力与格式-成本分离

Justice Owusu Agyemang, Michael Agyare, Miriam Kobbinah, Nathaniel Agbugblah, Prosper Addo

机构 * Sperix Labs(Sperix实验室) VIA Cybersecurity Lab, KNUST(VIA网络安全实验室,科诺斯大学) GCTU, Ghana(加纳格茨大学) NCA, Ghana(加纳国家计算机学院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文提出OGC衡量输出生成能力,证明格式-成本分离定理,并提出自适应策略选择框架,通过实验验证理论,减少生成token并消除输出停滞问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16336 2026-04-21 cs.HC cs.AI cs.MA 57%

Distributed Human Identity: AI-Enabled Multi-Existence Through Cognitive Replication and Robotic Embodiments

分布式人类身份:通过认知复制和机器人躯体实现的AI赋能多存在

A S M Touhidul Islam, John Tookey

机构 * Faculty of Design and Creative Technologies, Auckland University of Technology(设计与创意技术学院,奥克兰技术大学)

专题命中 软件智能体 :software agent(abstract);分类 cs.AI

AI总结 本文提出多存在身份框架,通过认知、行为和情感属性的复制,实现AI赋能的多场景存在,突破传统物理躯体限制,提升身份一致性与文化相关性,探讨其在专业、教育、医疗等领域的应用与伦理挑战。

Comments 30 pages, 1 figure, 4 tables. cs.AI under Computer Science category

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07043 2026-04-20 cs.LG 57%

COMPASS: Benchmarking Constrained Optimization in LLM Agents

COMPASS:评估LLM代理在约束优化中的表现

Tian Qin, Felix Bai, Ting-Yao Hu, Raviteja Vemulapalli, Hema Swetha Koppula, Zhiyang Xu, Bowen Jin, Mert Cemri, Jiarui Lu, Zirui Wang, Meng Cao

机构 * Harvard University(哈佛大学) Apple(苹果公司) Virginia Tech(弗吉尼亚理工学院) UIUC(伊利诺伊大学香槟分校) UC Berkeley(加州大学伯克利分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.LG

AI总结 COMPASS基准测试评估LLM代理在真实旅行规划中的约束优化能力,揭示当前模型在可行性与最优性之间存在显著差距,表明搜索空间探索不足是核心限制,编码代理提供潜在解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14609 2026-04-17 cs.AI physics.comp-ph 57%

El Agente Forjador: Task-Driven Agent Generation for Quantum Simulation

El Agente Forjador:面向量子模拟的任务驱动代理生成

Zijian Zhang, Aiwei Yin, Amaan Baweja, Jiaru Bai, Ignacio Gustin, Varinia Bernales, Alán Aspuru-Guzik

机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Department of Chemistry, University of Toronto(多伦多大学化学系) Department of Materials Science & Engineering, University of Toronto(多伦多大学材料科学与工程系) Department of Chemical Engineering & Applied Chemistry, University of Toronto(多伦多大学化学工程与应用化学系) Acceleration Consortium(加速联盟) Vector Institute for Artificial Intelligence(人工智能矢量研究所) Canadian Institute for Advanced Research (CIFAR)(加拿大高级研究 institute (CIFAR)) NVIDIA

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文提出El Agente Forjador框架,通过四阶段流程自主生成和复用计算工具,提升量子化学和动力学任务的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12948 2026-04-15 cs.AI 57%

Drawing on Memory: Dual-Trace Encoding Improves Cross-Session Recall in LLM Agents

基于记忆的绘制:双轨迹编码提升LLM代理跨会话回忆

Benjamin Stern, Peter Nadel

机构 * Tufts University(塔夫茨大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文提出双轨迹编码方法,通过将事实与具体场景描述结合,提升LLM代理在跨会话中的回忆能力,实验显示在时间推理、知识更新追踪和多会话聚合方面有显著提升。

Comments 16 pages, 2 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10493 2026-04-14 cs.SE 57%

SWE-Shepherd: Advancing PRMs for Reinforcing Code Agents

SWE-Shepherd:推进基于强化学习的代码代理的PRMs

Mahir Labib Dihan, Md Ashrafur Rahman Khan

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 本文提出SWE-Shepherd框架,通过引入过程奖励模型为代码代理提供密集的步骤级监督,提升代码代理在大型代码库中的交互效率和动作质量。

Comments Code is available at https://github.com/mahirlabibdihan/swe-shepherd

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10248 2026-04-14 cs.LG 57%

A Multi-head Attention Fusion Network for Industrial Prognostics under Discrete Operational Conditions

面向离散操作条件的工业预测性维护多头注意力融合网络

Yuqi Su, Xiaolei Fang

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 软件智能体 :repository(abstract);分类 cs.LG

AI总结 本文提出一种多头注意力融合神经网络,用于在动态变化的操作条件下进行工业预测性维护,通过融合退化趋势、离散操作状态和残余噪声,提升预测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10182 2026-04-14 cs.AI 57%

Credit-Budgeted ICPC-Style Coding: When Agents Must Pay for Every Decision

基于信用的ICPC风格编码:当代理必须为每个决定付费

Lingfeng Zhou, Junhao Shi, Jin Gao, Dequan Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文提出USACOArena,通过引入严格的信用经济机制,使代理在决策时考虑成本,解决资源受限下的高效编码问题。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07066 2026-04-09 cs.CL 57%

SemEval-2026 Task 3: Dimensional Aspect-Based Sentiment Analysis (DimABSA)

SemEval-2026任务3:基于维度的方面情感分析(DimABSA)

Liang-Chih Yu, Jonas Becker, Shamsuddeen Hassan Muhammad, Idris Abdulmumin, Lung-Hao Lee, Ying-Lung Lin, Jin Wang, Jan Philip Wahle, Terry Ruas, Natalia Loukachevitch, Alexander Panchenko, Ilseyar Alimova, Lilian Wanzare, Nelson Odhiambo, Bela Gipp, Kai-Wei Chang, Saif M. Mohammad

机构 * Yuan Ze University(元智大学) University of Göttingen(哥廷根大学) Imperial College London(伦敦帝国学院) University of Pretoria(比勒陀利亚大学) National Yang Ming Chiao Tung University(国立阳明交通大学) Central Police University(中央警察大学) Yunnan University(云南大学) Lomonosov Moscow State University(莫斯科国立大学) Skoltech(斯科尔科沃科学技术学院) AIRI(人工智能研究所) Maseno University(马塞诺大学) UCLA(加州大学洛杉矶分校) National Research Council Canada(加拿大国家研究委员会)

专题命中 软件智能体 :repository(abstract);分类 cs.CL

AI总结 本文提出SemEval-2026任务3,旨在通过建模valence-arousal(VA)维度改进传统ABSA,引入DimStance任务以扩展ABSA至公共议题讨论,包含两个赛道和三个子任务,提出连续F1指标评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06066 2026-04-08 cs.CL 57%

From Hallucination to Structure Snowballing: The Alignment Tax of Constrained Decoding in LLM Reflection

从幻觉到结构雪球效应:约束解码在LLM反思中的对齐税

Hongxu Zhou

机构 * Saarland University(萨尔大学)

专题命中 软件智能体 :repository(abstract);分类 cs.CL

AI总结 研究探讨了在开放式推理任务中,约束解码通过强制结构反思是否能避免错误传播,发现反而引发结构雪球效应,并揭示了约束解码的对齐税问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04705 2026-04-07 cs.CR cs.SE 57%

Bridging Safety and Security in Complex Systems: A Model-Based Approach with SAFT-GT Toolchain

在复杂系统中弥合安全与安全性的方法:基于模型的SAFT-GT工具链

Irdin Pekaric, Raffaela Groner, Alexander Raschke, Thomas Witte, Jubril Gbolahan Adigun, Michael Felderer, Matthias Tichy

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 本文提出基于模型的SAFT-GT工具链,用于解决复杂系统中安全与安全性的挑战,通过攻击-故障树生成和模型组合方法,提升系统安全性和可靠性,通过用户研究验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04059 2026-04-07 cs.SE 57%

Humans Integrate, Agents Fix: How Agent-Authored Pull Requests Are Referenced in Practice

人类整合,代理修复:代理撰写的拉取请求在实践中是如何被引用的

Islem Khemissi, Moataz Chouchen, Dong Wang, Raula Gaikovina Kula

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 研究通过分析AIDev数据集中的代理撰写的拉取请求引用,揭示了人类与代理之间引用意图的分类,发现人类主要用于构建新功能,而代理用于修复错误,且引用的拉取请求生命周期更长,审查时间更长。

Comments Accepted to MSR Mining Challenge paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03964 2026-04-07 cs.AI 57%

SKILLFOUNDRY: Building Self-Evolving Agent Skill Libraries from Heterogeneous Scientific Resources

SKILLFOUNDRY:从异构科学资源构建自演化智能体技能库

Shuaike Shen, Wenduo Cheng, Mingqian Ma, Alistair Turcan, Martin Jinye Zhang, Jian Ma

机构 * Ray and Stephanie Lane Computational Biology Department, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院Ray and Stephanie Lane计算生物学系) Machine Learning Department, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院机器学习系)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 SKILLFOUNDRY通过自演化框架将异构资源转化为验证过的智能体技能包,提升科学代理在基准和领域任务中的性能,扩展覆盖范围,为更强大的科学代理提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03438 2026-04-07 cs.SE 57%

Android Instrumentation Testing in Continuous Integration: Practices, Patterns, and Performance

Android持续集成中的仪器测试:实践、模式与性能

Hamid Parsazadeh, Taher A. Ghaleb, Safwat Hassan

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 研究Android持续集成中仪器测试的实践、模式及性能,发现仅10.6%的仓库使用仪器测试,常用社区组件或自定义脚本设置模拟器,不同设置方式在可靠性、效率和成本上有差异。

Comments Accepted at the 19th IEEE International Conference on Software Testing, Verification and Validation (ICST 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03196 2026-04-06 cs.SE 57%

From Industry Claims to Empirical Reality: An Empirical Study of Code Review Agents in Pull Requests

从行业声明到实证现实:代码审查代理在拉取请求中的实证研究

Kowshik Chowdhury, Dipayan Banik, K M Ferdous, Shazibul Islam Shamim

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 本文通过分析代码审查代理(CRAs)在拉取请求中的表现,探讨其对合并成功率的影响,发现CRAs生成的反馈质量与PR废弃率密切相关,需人类监督以提高代码审查效果。

Comments Accepted at 23rd International Conference on Mining Software Repositories (MSR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01079 2026-04-02 cs.CR cs.SE 57%

Automated Generation of Cybersecurity Exercise Scenarios

自动化生成网络安全演练场景

Charilaos Skandylas, Mikael Asplund

专题命中 软件智能体 :software agent(abstract);分类 cs.SE

AI总结 本文提出自动生成功能性IT系统网络安全场景的方法,生成多种标准的演练场景,并开源了模拟环境和包含10万个样本的数据库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00299 2026-04-02 cs.SE 57%

When is Generated Code Difficult to Comprehend? Assessing AI Agent Python Code Proficiency in the Wild

生成代码难以理解的条件是什么?评估AI代理在真实世界中的Python代码能力

Nanthit Temkulkiat, Chaiyong Ragkhitwetsagul, Morakot Choetkiertikul, Ruksit Rojpaisarnkit, Raula Gaikovina Kula

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 本研究通过分析AI生成的Python代码,发现其主要为初级水平,但特定任务可能需要高级技能来理解和维护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27766 2026-03-31 cs.LG stat.ML 57%

AutoStan: Autonomous Bayesian Model Improvement via Predictive Feedback

AutoStan:通过预测反馈实现自主的贝叶斯模型改进

Oliver Dürr

机构 * Thurgau Institute for Digital Transformation (TIDIT)(图尔高数字转型研究所)

专题命中 软件智能体 :coding agent(abstract);分类 cs.LG

AI总结 AutoStan通过预测反馈机制,使CLI编码代理自主构建并迭代改进Stan中的贝叶斯模型,展示了无需搜索算法或领域指令即可处理多样化贝叶斯建模问题的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08847 2026-03-31 cs.AI cs.MA 57%

What Is Your Agent's GPA? A Framework for Evaluating Agent Goal-Plan-Action Alignment

你的代理的GPA是多少?一个评估代理目标-计划-行动对齐的框架

Allison Sihan Jia, Daniel Huang, Nikhil Vytla, Seung Won Wilson Yoo, Nirvika Choudhury, Shayak Sen, John C. Mitchell, Anupam Datta

机构 * BASIS Independent Silicon Valley Upper School(BASIS独立硅谷高中) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文提出Agent GPA框架,通过评估代理目标、计划和行动的对齐性,验证其在多代理、单代理和企业数据代理中的有效性,展示了高误差覆盖和调试定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24517 2026-03-26 cs.LG 57%

AVO: Agentic Variation Operators for Autonomous Evolutionary Search

AVO:用于自主进化搜索的代理变异算子

Terry Chen, Zhifan Ye, Bing Xu, Zihao Ye, Timmy Liu, Ali Hassani, Tianqi Chen, Andrew Kerr, Haicheng Wu, Yang Xu, Yu-Jung Chen, Hanfeng Chen, Aditya Kane, Ronny Krashinsky, Ming-Yu Liu, Vinod Grover, Luis Ceze, Roger Bringmann, John Tran, Wei Liu, Fung Xie, Michael Lightstone, Humphrey Shi

机构 * NVIDIA

专题命中 软件智能体 :coding agent(abstract);分类 cs.LG

AI总结 AVO通过自主代理实现变异操作,取代传统进化搜索中的固定突变和交叉操作,展示了在多头注意力中发现超越cuDNN和FlashAttention-4的优化结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19452 2026-03-23 cs.MA cs.AI 57%

TrustFlow: Topic-Aware Vector Reputation Propagation for Multi-Agent Ecosystems

TrustFlow:基于主题的向量声誉传播用于多智能体生态系统

Volodymyr Seliuchenko

专题命中 软件智能体 :software agent(abstract);分类 cs.AI

AI总结 TrustFlow通过主题门控转移运算符在交互图中传播声誉,采用多维声誉向量提升精度,有效抵御Sybil攻击和声誉洗白。

Comments 14 pages, 3 figures, demo at https://robutler.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16744 2026-03-20 cs.AI cs.SI 57%

Nonstandard Errors in AI Agents

AI代理中的非标准误差

Ruijiang Gao, Steven Chong Xiao

机构 * School of Management, University of Texas at Dallas(德克萨斯大学达拉斯分校管理学院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 研究AI代理在相同数据和问题下是否产生相同结果,发现其存在显著非标准误差,源于代理间分析选择的不确定性。不同模型家族在方法偏好上存在系统差异,同行评审对分散影响有限,但接触高质量论文可大幅缩小估计范围。

Comments 45 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17639 2026-03-19 cs.AI 57%

VeriGrey: Greybox Agent Validation

VeriGrey:灰盒代理验证

Yuntong Zhang, Sungmin Kang, Ruijie Meng, Marcel Böhme, Abhik Roychoudhury

机构 * National University of Singapore(新加坡国立大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文提出VeriGrey方法,通过工具调用序列反馈函数驱动测试过程,发现LLM代理中隐含的提示注入漏洞,并在实际案例中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22954 2026-03-16 cs.AI 57%

Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents

达尔文戈德尔机器:自我改进代理的开放性进化

Jenny Zhang, Shengran Hu, Cong Lu, Robert Lange, Jeff Clune

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文提出达尔文戈德尔机器,通过迭代修改自身代码并验证改进,实现自我提升,提升代码能力并在多个基准测试中取得显著成绩。

Comments Code at https://github.com/jennyzzt/dgm

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07919 2026-03-10 cs.CY cs.SE 57%

Social Proof is in the Pudding: The (Non)-Impact of Social Proof on Software Downloads

社交证明在馅饼中:社交证明对软件下载的(非)影响

Lucas Shen, Gaurav Sood

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 研究通过两个实验发现,社交证明对软件下载和开发者参与度无显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏