arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-05-28 至 2026-05-28 共收录 29 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 12 篇

2605.27849 2026-05-28 cs.PL cs.AI cs.CL 82%

FPMoE: A Sparse Mixture-of-Experts Approach to Functional Code Generation

FPMoE:一种用于函数式代码生成的稀疏混合专家方法

Loc Pham, Lang Hong Nguyet Anh, Thanh Le-Cong

机构 * GreenNode AI Hanoi University of Science and Technology(河内科学技术大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.CL、cs.AI、cs.PL

AI总结 针对LLM在函数式编程语言上性能差的问题,提出基于稀疏MoE架构的FPMoE模型,通过语言特定专家和共享专家分别消除干扰和捕获跨语言抽象,以3B活跃参数达到远超微调基线并匹配大模型的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28515 2026-05-28 cs.SE cs.AI 81%

Do LLMs Favor Their Providers? Measuring Vertical Integration Bias in Code Generation

LLM 是否偏袒其提供商?测量代码生成中的垂直整合偏差

Melih Catal, Alex Wolf, Tiago Ferreiro Matos, Pooja Rani, Harald Gall

机构 * University of Zurich(苏黎世大学) University of Mannheim(曼海姆大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 本文提出 VIBench 基准,通过 20 个提供商可选的软件集成场景,测量前沿 LLM 在直接和代理代码生成中的垂直整合偏差,发现六成关联模型存在显著偏差,代理工作流加剧偏差至 +39.2 个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28022 2026-05-28 cs.CL cs.SE 81%

Beyond pass@k: Redundancy-Aware RLVR for Multi-Sample Code Generation

超越 pass@k:面向多样本代码生成的冗余感知 RLVR

Le Bronnec Florian, Alexandre Verine, Rio Yokota, Benjamin Negrevergne

机构 * RIKEN Center for Computational Science(日本计算科学中心)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL

AI总结 针对代码生成中重复采样评估的冗余问题,提出基于 JPlag 相似度的反冗余奖励增强 RLVR,在有限预算下提升可执行正确性。

Comments Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28409 2026-05-28 cs.AI 79%

Efficient Post-training of LLMs for Code Generation With Offline Reinforcement Learning

基于离线强化学习的代码生成LLM高效后训练

Mingze Wu, Abhinav Anand, Shweta Verma, Mira Mezini

机构 * Hessian Center for Artificial Intelligence(海德堡人工智能中心) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE)

专题命中 代码生成 :code generation(title,abstract);分类 cs.AI

AI总结 本文探索使用离线强化学习利用现有代码数据集对代码生成LLM进行后训练,实验表明该方法能有效提升模型性能,尤其适用于小模型和复杂编码问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28500 2026-05-28 cs.CL cs.AI cs.LG 67%

Functional Entropy: Predicting Functional Correctness in LLM-Generated Code with Uncertainty Quantification

功能熵:通过不确定性量化预测LLM生成代码的功能正确性

Dylan Bouchard, Mohit Singh Chauhan, Zeya Ahmad, Ho-Kyeong Ra

机构 * CVS Health(CVS健康)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM生成代码功能不正确的问题,提出基于功能等价性的不确定性量化方法(功能熵),在多个编程语言和模型上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28258 2026-05-28 cs.SE cs.AI cs.CV cs.HC 62%

GUI Agents for Continual Game Generation

面向持续游戏生成的GUI智能体

Yixu Huang, Bo Li, Na Li, Zhe Wang, Kaijie Chen, Haonan Ge, Qingyi Si, Yuanzhe Shen, Ruihan Yang, Guangjing Wang, Hongcheng Guo

机构 * Fudan University(复旦大学) Xiaohongshu Inc.(小红书公司) Tongji University(同济大学) University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 提出利用GUI智能体作为客观评估者和主观测试者,通过PlaytestArena和Play2Code框架实现持续游戏生成,显著提升可玩性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27485 2026-05-28 cs.LO cs.LG cs.SE 62%

Automating Formal Verification with Agent-Guided Tree Search

利用智能体引导的树搜索自动化形式验证

Leo Yao

机构 * Massachusetts Institute of Technology(麻省理工学院) Department of Electrical Engineering and Computer Science(电气工程与计算机科学系)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.LG

AI总结 本文提出智能体引导的树搜索方法,通过状态和上下文两种编排器改进基于大语言模型的Lean形式验证代码生成性能,在基准测试中达到95.0%的通过率。

Comments 78 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01745 2026-05-28 cs.LG cs.AI 62%

Probability-Entropy Calibration: An Elastic Indicator for Adaptive Fine-tuning

概率-熵校准:一种用于自适应微调的弹性指标

Wenhao Yu, Shaohang Wei, Jiahong Liu, Yifan Li, Minda Hu, Aiwei Liu, Hao Zhang, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Tsinghua University(清华大学) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 提出概率-熵校准信号(相对排名指标)进行token级重加权,以平衡预训练先验与下游对齐,在数学推理、分布外推理和代码生成任务上优于仅基于概率或熵的方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28482 2026-05-28 cs.SE 57%

Rethinking Software Empirical Studies with Structural Causal Models

用结构因果模型重新思考软件实证研究

Daniel Rodriguez-Cardenas, Aya Garryyeva, David Nader Palacio, Antonio Mastropaolo, Denys Poshyvanyk

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 提出CausalSE框架,利用结构因果模型(SCMs)解决混淆偏差,通过Galeras数据集和倾向得分匹配案例,揭示提示工程策略对代码生成的影响,强调因果分析可避免关联分析中的假阳性。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27935 2026-05-28 cs.AI 57%

Do Agents Think Deeper? A Mechanistic Investigation of Layer-Wise Dynamics in Sequential Planning

智能体思考得更深吗?顺序规划中层间动力学的机制研究

Zhenyu Cui, Xiangzhong Luo

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 通过残差流探针、因果层跳跃干预和有效深度测量,研究了大型语言模型在自主智能体任务(多轮规划、工具使用、迭代状态更新)中层间动态的差异,发现智能体推理表现出与静态任务不同的深度分布,随着轨迹展开,模型逐步招募更多更深层,且后期出现更强的长距离层间依赖,同时残差更新从稳定特征积累转向重复校准,有效深度分析揭示了语义方向形成较早而深层对稳定最终输出仍必要的构建-精炼差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06511 2026-05-28 cs.LG 57%

EvoMAS: Evolutionary Generation of Multi-Agent Systems

EvoMAS:多智能体系统的进化生成

Yuntong Hu, Yuting Zhang, Matthew Trager, Yi Zhang, Shuo Yang, Wei Xia, Stefano Soatto

机构 * Department of Computer Science, Emory University, Atlanta, GA, USA(埃默里大学计算机科学系)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 提出EvoMAS方法,将多智能体系统生成转化为结构化配置生成,通过进化算法在配置空间中优化,提升任务性能、可执行性和鲁棒性。

Comments ICML2026

Journal ref ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28154 2026-05-28 cs.HC cs.RO 50%

Robo-Blocks: Generative Scaffolding in End-User Design and Programming of Social Robots

Robo-Blocks:社交机器人终端用户设计与编程中的生成式支架

Arissa J. Sato, Callie Y. Kim, Nathan Thomas White, Abhinav Maneesh, Yuqing Wang, Hui-Ru Ho, Bilge Mutlu

机构 * Department of Computer Sciences\ of Wisconsin--Madison

专题命中 代码生成 :code generation(abstract)

AI总结 通过研究通过设计(RtD)过程,提出基于LLM的积木式编程环境Robo-Blocks,利用生成式支架将高级想法转化为可执行机器人行为,支持新手程序员,并揭示了用户角色与使用模式。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 4 篇

2605.28122 2026-05-28 cs.CR cs.AI cs.CL 81%

SNARE: Adaptive Scenario Synthesis for Eliciting Overeager Behavior in Coding Agents

SNARE: 自适应场景合成以诱发编码代理中的过度行为

Yubin Qu, Yi Liu, Gelei Deng, Yanjun Zhang, Yuekang Li, Ying Zhang, Leo Yu Zhang

机构 * Griffith University(格里菲斯大学) Quantstamp Nanyang Technological University(南洋理工大学) UNSW Sydney(悉尼大学) Wake Forest University(卫斯理大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL、cs.AI

AI总结 提出SNARE流水线,通过组合良性场景片段并使用无评判器预言机评分与汤普森采样,自适应地诱发编码代理的过度行为,并在4×5代理-模型矩阵上评估,发现19.51%的良性运行触发过度行为,且代理框架比模型影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27787 2026-05-28 cs.MA cs.CL 57%

Long Live the Librarian! A Persistent Search Sub-Agent for Energy-Efficient Multi-Agent Software Engineering Systems

图书馆员万岁!面向节能多智能体软件工程系统的持久搜索子智能体

Seunghyuk Cho, Sunghyun Choi, Jaeseung Heo, Youngbin Choi, Saemi Moon, MoonJeong Park, Dongwoo Kim

机构 * Graduate School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院) Department of Computer Science and Engineering, POSTECH(POSTECH计算机科学与工程系)

专题命中 软件智能体 :repository(abstract);分类 cs.CL

AI总结 针对多智能体系统中输出令牌冗余导致的高能耗问题,提出持久搜索子智能体Librarian,通过跟踪仓库搜索历史并抑制重复探索,减少输出令牌量,在SWE-Bench Verified上实现高达25%的GPU能耗降低且不损失任务性能。

Comments 19 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27547 2026-05-28 cs.MA 50%

From Task Allocation to Risk Clearing: A Unifying Interface for Mixed Human-Agent Societies

从任务分配到风险清算:混合人机社会的统一接口

Vassilis Vassiliades

专题命中 软件智能体 :software agent(abstract)

AI总结 提出风险感知选项清算(ROC)机制,通过将风险摘要与选项结合并由中央清算所优化风险调整任务效用,实现混合人机社会中异构代理的可扩展透明协调。

Comments Presented at EMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17110 2026-05-28 cs.CV 50%

From Clinical Intent to Clinical Model: Autonomous Coding-Agents for Clinician-driven AI Development

从临床意图到临床模型:面向临床医生驱动AI开发的自主编码代理

Zihao Zhao, Frederik Hauke, Juliana De Castilhos, Mathis Bode, Jakob Nikolas Kather, Sven Nebelung, Daniel Truhn

专题命中 软件智能体 :coding agent(abstract)

AI总结 提出一种自主编码代理系统,允许临床医生用自然语言描述任务,系统自动生成并迭代优化模型,在五项临床任务中达到竞争性能,并显著减少胸部X光片模型对胸腔引流管的依赖。

Comments Code is available at https://github.com/zhaozh10/clinical-automata/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2506.08311 2026-05-28 cs.SE cs.AI 81%

Understanding Automated Program Repair Agents Through the Lens of Traceability: An Empirical Study

通过可追溯性视角理解自动化程序修复智能体:一项实证研究

Ira Ceka, Hailie Mitchell, Saurabh Pujar, Luca Buratti, Shyam Ramji, Junfeng Yang, Gail Kaiser, Baishakhi Ray

机构 * Columbia University(哥伦比亚大学) IBM Research(IBM研究院)

专题命中 程序修复 :program repair(title,abstract);分类 cs.SE、cs.AI

AI总结 本文通过追踪五个最先进的自动化程序修复智能体在500个真实世界修复任务中的决策流程,揭示了它们在逻辑密集型错误修复、测试生成和回归测试选择方面的关键局限性,并提出了改进方向。

Comments Accepted for publication (ISSTA '26)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 测试生成 1 篇

2605.27538 2026-05-28 astro-ph.IM astro-ph.CO astro-ph.GA 50%

VROOM-SBI: A Fast Simulation-Based Bayesian Inference Methodology for QU-Fitting

VROOM-SBI: 一种用于QU拟合的快速基于模拟的贝叶斯推断方法

Arpan Pal, Preshanth Jagannathan

专题命中 测试生成 :repository(abstract)

AI总结 提出VROOM-SBI方法,利用基于模拟的推断(特别是神经后验估计)加速QU拟合,实现与经典方法相当的精度,速度提升约500倍。

Comments Submitted in AJ; Comments are welcome. 10 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 代码评测 4 篇

2605.28773 2026-05-28 cs.CL cs.AI cs.LG cs.MA cs.MM 67%

Rethinking Memory as Continuously Evolving Connectivity

重新思考记忆作为持续演化的连接性

Jizhan Fang, Buqiang Xu, Zhixian Wang, Haoliang Cao, Xinle Deng, Baohua Dong, Hangcheng Zhu, Ruohui Huang, Gang Yu, Ying Wei, Guozhou Zheng, Feiyu Xiong, Haofen Wang, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) MemTensor Tongji University(同济大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出 FluxMem 框架,将记忆建模为异构图并通过三个阶段(初始连接形成、反馈驱动优化、长期巩固)动态演化拓扑结构,以解决现有记忆增强型 LLM 代理在动态环境中的脆弱性问题。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27908 2026-05-28 cs.CL cs.AI 62%

ESC-Skills: Discovering and Self-Evolving Skills for Emotional Support Conversations

ESC-Skills: 发现并自我进化情感支持对话技能

Jie Zhu, Huaixia Dou, Shuo Jiang, Junhui Li, Lifan Guo, Feng Chen, Chi Zhang, Fang Kong

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Qwen DianJin Team, Alibaba Cloud Computing(阿里云Qwen团队)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 提出ESC-Skills框架,通过干预单元建模支持交互并构建技能库,结合多轮廓自我进化机制,提升情感支持对话的可解释性、可控性和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28546 2026-05-28 cs.SE 57%

A Minimal Executable Proof for Multi-Language Contract Traceability

多语言合约可追溯性的最小可执行证明

Werner Kasselman

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 本文通过一个包含六种语言实现的DAG-TOML合约的最小可执行证明,展示了合约、实现图、可追溯性链和审查门如何通过可执行见证者进行验证。

Comments 8 pages, 0 figures; executable artifact report. Code: https://github.com/verivus-oss/agent-assurance-papers Spec: https://github.com/verivus-oss/agent-assurance

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28398 2026-05-28 cs.AI 57%

HRBench: Benchmarking and Understanding Thinking-Mode Switch Strategies in Hybrid-Reasoning LLMs

HRBench:混合推理大语言模型中思维模式切换策略的基准测试与理解

Yansong Ning, Mianpeng Liu, Jingwen Ye, Weidong Zhang, Hao Liu

机构 * AI Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)人工智能方向)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 提出HRBench统一评估框架,系统研究混合推理LLM中基于提示、外部路由和推测执行三类切换策略在四种训练机制下的效率-效果权衡,揭示策略选择随模型规模和任务领域的变化规律。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仓库级理解 7 篇

2605.26186 2026-05-28 cs.SE cs.AI cs.CL cs.LG 83%

SetupX: Can LLM Agents Learn from Past Failures in Functionality-Correct Code Repository Setup?

SetupX:LLM代理能否从过去的功能正确代码仓库设置失败中学习?

Zihang Zhou, Ziqian Ren, Yukai Wu, Yingjie Xiong, Wei Zhou, Chao Peng, Dong Zhang, Bingheng Yan, Xuanhe Zhou, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学) Independent Researcher(独立研究者) Jinan Inspur Data Technology Co., Ltd.(济南 Inspur 数据技术有限公司)

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 提出SetupX框架,通过经验学习、推测执行和验证协议解决代码仓库设置中的跨仓库经验迁移、多步试错和鲁棒验证问题,在基准测试中达到92%通过率。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28583 2026-05-28 cs.RO cs.AI cs.LG cs.SY eess.SY 62%

SARAD: LLM-Based Safety-Aware Hybrid Reinforcement Learning with Collision Prediction for Autonomous Driving

SARAD:基于LLM的安全感知混合强化学习与碰撞预测在自动驾驶中的应用

Kangyu Wu, Peng Cui, Guoxi Chen, Ya Zhang

机构 * National Natural Science Foundation (NNSF) of China(中国国家自然科学基金委员会) National Science and Major Project(国家科学技术重大专项)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG

AI总结 提出SARAD框架,结合大语言模型和深度强化学习,通过检索增强生成和碰撞预测模块提升自动驾驶的安全性和效率。

Comments 7 pages, 4 figures, accepted by IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25781 2026-05-28 cs.LG cs.AI cs.NA cs.NE math.NA 62%

A Practitioner's Guide to Kolmogorov-Arnold Networks

Kolmogorov-Arnold网络实践指南

Amir Noorizadegan, Sifan Wang, Leevan Ling, Juan P. Dominguez-Morales

机构 * Department of Mathematics, Hong Kong Baptist University(香港 Baptist大学数学系) Institution for Foundations of Data Science, Yale University(数据科学基础研究所,耶鲁大学) Robotics and Technology of Computers Lab., Universidad de Sevilla(机器人与计算机技术实验室,塞维利亚大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文系统综述了受Kolmogorov叠加定理启发的KAN网络,从理论基础、设计轴心(基函数)到最新进展,并提供了实用选择指南和未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11896 2026-05-28 cs.CR cs.AI cs.SE 62%

VULPO: Context-Aware Vulnerability Detection via On-Policy LLM Optimization

VULPO:基于策略优化的上下文感知漏洞检测

Youpeng Li, Fuxun Yu, Weiliang Qi, Xinda Wang

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Microsoft(微软)

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI

AI总结 提出VULPO框架,通过构建包含上下文信息和推理轨迹的数据集ContextVul,结合冷启动监督微调和自适应策略优化,显著提升大语言模型在真实仓库中的漏洞检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28282 2026-05-28 cs.AI 57%

ResearchLoop: An Evidence-Gated Control Plane for AI-Assisted Research

ResearchLoop: 一种用于AI辅助研究的证据门控控制平面

Yihan Xia, Taotao Wang

机构 * Shenzhen University(深圳大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 提出ResearchLoop,一种通过证据门控控制平面来确保AI辅助研究中声明可审计的协议,包括状态模型、转换规则和实验验证。

Comments 32 pages, 4 figures, 6 tables; technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27399 2026-05-28 cs.CY cs.AI 57%

Short-Term Gain, Long-Term Fragility: AI Labor Substitution and the Erosion of Sustainable Capability

短期收益,长期脆弱:AI劳动力替代与可持续能力的侵蚀

Wolfgang Rohde

机构 * AiSuNe Foundation(AiSuNe基金会)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 本文提出能力掩盖与能力侵蚀机制,论证AI劳动力替代在短期内提升效率的同时,通过消耗难以重建的人力能力导致系统长期脆弱性增加。

Comments 19 pages, 7 figures, Also available on SSRN: https://doi.org/10.2139/ssrn.6577818

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27667 2026-05-28 cs.CR 50%

Silent Consent, Persistent Risk: Android Permission Groups and Custom Permissions

沉默的同意,持续的风险:Android权限组与自定义权限

Olawale Amos Akanji, Manuel Egele, Gianluca Stringhini

专题命中 仓库级理解 :repository(abstract)

AI总结 通过分析1930万APK和Android 16设备验证,揭示权限组自动授予新权限和正常级自定义权限静默安装的机制导致17%的多版本应用在已授权组内静默获得权限,且恶意软件比例更高(OR=1.35),并发现307个跨开发者自定义权限对暴露敏感数据。

Comments 24 pages, 3 figures, 6 tables. To appear in the Proceedings of the 23rd Conference on Detection of Intrusions and Malware & Vulnerability Assessment (DIMVA 2026), July 1-3, 2026, Chania, Greece. Springer Lecture Notes in Computer Science (LNCS)

详情

展开后加载摘要…

URL PDF HTML 收藏