arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-05-19 至 2026-05-19 共收录 48 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 6 篇

2605.16300 2026-05-19 cs.CY cs.AI cs.MA cs.RO 57%

Consent Chain Degradation in Embodied Multi-Agent Systems: Bridging the Gap Between AI Agent Governance and Robot Ethics

具身多智能体系统中的同意链退化:弥合人工智能代理治理与机器人伦理之间的鸿沟

Mehmet Haklidir

机构 * Artificial Intelligence Institute, TÜBİTAK BİLGEM(人工智能研究所,TÜBİTAK BİLGEM)

专题命中 软件智能体 :software agent(abstract);分类 cs.AI

AI总结 本文提出同意链退化(CCD)概念,探讨多机器人委托链中人类同意的具体性、有效性及范围如何退化,并通过医疗、家庭和工业机器人场景展示其实际表现,分析现有法规对CCD核心维度的缺失。

Comments Accepted for oral presentation at the 2nd Workshop on Robot Ethics (WoRoBet), ICRA 2026, Vienna, Austria, June 1, 2026. 6 pages, 3 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 程序修复 2 篇

2605.17444 2026-05-19 cs.SE cs.AI cs.CL 82%

MemRepair: Hierarchical Memory for Agentic Repository-Level Vulnerability Repair

MemRepair:用于代理级漏洞修复的分层内存

Simiao Liu, Li Zhang, Fang Liu, Xiaoli Lian, Yang Liu, Yinghao Zhu

机构 * Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

专题命中 程序修复 :repository(title,abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本研究提出MemRepair,一种增强记忆的代理框架,通过分层记忆和动态反馈循环提高漏洞修复的可靠性,实现了在多个仓库级别的漏洞修复基准上的高修复率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18156 2026-05-19 cs.CV 50%

Semi-LAR: Semi-supervised Contrastive Learning with Linear Attention for Removal of Nighttime Flares

Semi-LAR: 基于线性注意力的半监督对比学习用于夜间光斑去除

Xiyu Zhu, Wei Wang, Kui Jiang, Zhengguo Li

机构 * School of Computer Science and Technology, Wuhan University of Science and Technology, Wuhan, China(武汉科技大学计算机科学与技术学院) Faculty of Computing, Harbin Institute of Technology, Harbin 150001, China(哈尔滨工业大学计算机学院) SRO department, Institute for Infocomm Research, A*STAR, Singapore(新加坡资讯通信研究院SRO部门)

专题命中 程序修复 :repository(abstract)

AI总结 本文提出了一种半监督对比学习框架,通过联合处理伪标签可靠性与表征歧视性,有效缓解了夜间光斑去除中的误差累积问题,并通过实验验证了该框架的模型无关性和性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 代码评测 8 篇

2602.02262 2026-05-19 cs.SE cs.AI cs.CL 67%

OmniCode: A Benchmark for Evaluating Software Engineering Agents

OmniCode: 一个评估软件工程代理的基准

Atharv Sonwane, Eng-Shen Tu, Wei-Chung Lu, Claas Beger, Carter Larsen, Debjit Dhar, Simon Alford, Rachel Chen, Ronit Pattanayak, Tuan Anh Dang, Guohao Chen, Gloria Geng, Kevin Ellis, Saikat Dutta

机构 * Cornell University(康奈尔大学) Independent contributor(独立贡献者) UC Santa Barbara(加州大学圣巴巴拉分校) Jadavpur University(贾瓦伊普尔大学) New York University(纽约大学)

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文提出OmniCode,一个涵盖更广泛任务类别的软件工程基准,旨在评估软件代理在不同软件开发方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16819 2026-05-19 cs.CL cs.AI cs.LG 67%

AgentKernelArena: Generalization-Aware Benchmarking of GPU Kernel Optimization Agents

AgentKernelArena: GPU核优化代理的通用化意识基准测试

Sharareh Younesian, Wenwen Ouyang, Sina Rafati, Mehdi Rezagholizadeh, Sharon Zhou, Ji Liu, Yue Liu, Yuchen Yang, Hao Li, Ziqiong Liu, Dong Li, Vikram Appia, Zhenyu Gu, Emad Barsoum

机构 * AMD

专题命中 代码评测 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出AgentKernelArena,一个用于评估GPU核优化代理的开源基准,通过隔离工作区和统一评分机制,测试代理在不同任务和硬件目标上的性能和通用化能力,发现大多数任务在正确性和编译效率上表现优异,但在PyTorch到HIP的转换任务中存在显著的正确性下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18284 2026-05-19 cs.SE cs.AI 62%

CommitDistill: A Lightweight Knowledge-Centric Memory Layer for Software Repositories

CommitDistill: 一种轻量级的知识导向内存层用于软件仓库

Divya Chukkapalli, Thejesh Avula, Aditya Aggarwal, Harsimran Singh, Amith Tallanki

机构 * Microsoft Corporation(微软公司)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文提出CommitDistill,一种轻量级的知识导向内存层,通过确定性正则表达式从本地git历史中提取类型化知识单元,并通过TF-IDF检索器进行检索,以提高软件仓库中历史信息的利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18693 2026-05-19 cs.AI 57%

SkillGenBench: Benchmarking Skill Generation Pipelines for LLM Agents

SkillGenBench: 评估LLM代理技能生成流水线的基准测试

Yifan Zhou, Zhentao Zhang, Ziming Cheng, Shuo Zhang, Qizhen Lan, Zhangquan Chen, Zhi Yang, QianyuXu, Ronghao Chen, Huacan Wang, Sen Hu

机构 * SJTU(上海交通大学) XJTU(西安交通大学) NUS(新加坡国立大学) QuantaAlpha(量子Alpha) THU(清华大学) SUFE(上海财经大学) NTU(国立.ntu) PKU(北京大学) UCAS(中国科学技术大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出SkillGenBench,一个用于评估LLM代理技能生成流水线的基准测试,通过统一可控的协议评估技能生成过程,涵盖任务条件生成和任务无关生成两种模式,以及基于仓库和文档的两种程序来源,揭示技能生成在不同数据源中的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06754 2026-05-19 cs.SE 57%

ScarfBench: A Benchmark for Cross-Framework Application Migration in Enterprise Java

ScarfBench:企业Java应用跨框架应用迁移的基准测试

Advait Pavuluri, Bridget McGinn, Ashita Saxena, George Safta, Srikanth Tamilselvam, Raju Pavuluri, Michele Merler, Baishakhi Ray, Rahul Krishna

专题命中 代码评测 :coding agent(abstract);分类 cs.SE

AI总结 本文提出ScarfBench,一个用于评估企业Java应用跨框架迁移行为保持性的基准测试,通过专家编写实现三元组,涵盖Spring、Jakarta EE和Quarkus框架,生成102个变体和204个定向重构任务,评估了五种最先进的编码代理,并揭示了不同框架方向和架构层的难度差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21654 2026-05-19 cs.LG 57%

EvilGenie: A Reward Hacking Benchmark

EvilGenie: 一个奖励黑客基准

Jonathan Gabor, Jayson Lynch, Jonathan Rosenfeld

机构 * Cambridge Boston Alignment Initiative(剑桥波士顿对齐倡议) MIT FutureTech(麻省理工 FutureTech)

专题命中 代码评测 :coding agent(abstract);分类 cs.LG

AI总结 本文提出EvilGenie基准,用于评估编程环境中奖励黑客问题,通过测试用例硬编码和测试文件编辑等方法检测奖励黑客行为,并验证了LLM判断在无歧义情况下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09817 2026-05-19 cs.SE cs.CR 57%

Evaluating Tool Cloning in Agentic-AI Ecosystems

评估代理AI生态系统中的工具克隆

Taein Kim, David Jiang, Yuepeng Hu, Yuqi Jia, Neil Gong

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 研究通过大规模测量分析代理AI生态系统中工具克隆现象,发现高相似性区域普遍存在,60%的高Jaccard候选和85%的高ssdeep候选被验证为克隆,揭示工具克隆对生态系统多样性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16817 2026-05-19 eess.IV cs.CV 50%

Adaptive Fused Prior Transfer for Controllable Generative Image Compression

自适应融合先验传输用于可控生成图像压缩

Yifei Pei, Ying Liu, Nam Ling

机构 * Department of Computer Science and Engineering, Santa Clara University(计算机科学与工程系,圣克拉拉大学)

专题命中 代码评测 :code model(abstract)

AI总结 本文提出了一种可控生成图像压缩方法AFP-GIC,通过自适应融合先验传输实现解码端的高质量重建,减少了延迟并降低了参数数量,同时在低比特率下提升了视觉质量。

Comments 19 pages, 10 figures. This work has been submitted to IEEE Access for possible publication. Code is available at https://github.com/yifeipet/AFP_GIC

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仓库级理解 7 篇

2605.16352 2026-05-19 cs.IR cs.AI cs.LG 84%

LARGER: Lexically Anchored Repository Graph Exploration and Retrieval

LARGER: 词典锚定的仓库图探索与检索

Yuntong Hu, Tongli Su, Liang Zhao, Bowen Zhu, Hasibul Haque

机构 * Emory University(埃默里大学)

专题命中 仓库级理解 :repository(title,abstract);coding agent(abstract);分类 cs.AI、cs.LG

AI总结 LARGER通过词典锚定的结构化定位方法提升代码仓库文件定位精度,实现测试生成和代码库理解任务的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18166 2026-05-19 physics.soc-ph cs.SI 78%

Hypergraphx-data: a repository for higher-order network data

Hypergraphx-data: 一个更高阶网络数据的存储库

Quintino Francesco Lotito, Lorenzo Betti, Berné Nortier, Alberto Montresor, Federico Battiston

专题命中 仓库级理解 :repository(title,abstract)

AI总结 本研究提出Hypergraphx-data,一个用于更高阶网络分析的现实世界超图数据存储库,涵盖社交网络、生物学和金融等领域,支持加权、定向、时间序列和多层超图配置,并提供开放JSON格式和二值化格式以确保数据的可重复性和完整性。

Comments In press at Journal of Complex Networks

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17355 2026-05-19 cs.AI cs.CL 62%

HyperPersona: A Multi-Level Hypergraph Framework for Text-Based Automatic Personality Prediction

HyperPersona: 一种多级超图框架用于基于文本的自动人格预测

Sina Heydari, Majid Ramezani

机构 * Department of Computer Science and Information Technology(计算机科学与信息技术系) Institude for Advanced Studies in Basic Sciences (IASBS)(基础科学高级研究 institute (IASBS))

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本文提出HyperPersona框架,通过超图结构显式建模文本的层次结构,利用基于Transformer的图编码器学习不同语言层之间的交互,从而在不依赖传统心理测量法的情况下,实现更准确的人格预测。

Comments Preprint. Submitted to Artificial Intelligence (Elsevier)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16079 2026-05-19 cs.CL cs.AI 62%

EvolveR: Self-Evolving LLM Agents through an Experience-Driven Lifecycle

EvolveR:通过经验驱动的生命周期实现自进化大语言模型代理

Rong Wu, Xiaoman Wang, Jianbiao Mei, Pinlong Cai, Daocheng Fu, Cheng Yang, Licheng Wen, Xuemeng Yang, Yufan Shen, Yuxin Wang, Botian Shi

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Fudan University(复旦大学) Central South University(中南大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI

AI总结 EvolveR通过闭环经验生命周期实现LLM代理的自进化,结合离线自蒸馏和在线交互,利用策略强化机制迭代优化,提升多跳问答任务性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15338 2026-05-19 cs.CR cs.AI 57%

Hidden in Memory: Sleeper Memory Poisoning in LLM Agents

记忆中的隐患:LLM代理中的潜伏记忆污染

Sidharth Pulipaka, Stanislau Hlebik, Leonidas Raghav, Sahar Abdelnabi, Vyas Raina, Ivaxi Sheth, Mario Fritz

机构 * SPAR ELLIS Institute Tübingen(图宾根ELLIS研究所) MPI for Intelligent Systems(智能系统马克斯·普朗克研究所) Tübingen AI Center(图宾根人工智能中心) APTA CISPA Helmholtz Center for Information Security(信息安全海德堡中心)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 研究探讨了LLM代理中由于持久化内存带来的安全风险,提出并研究了潜伏记忆污染攻击,该攻击通过操控外部上下文使代理存储伪造的记忆,影响后续交互,实验显示攻击可跨多次对话持续生效。

Comments 86 pages, 60 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04329 2026-05-19 cs.CV cs.SE 57%

A Retrieval-Augmented Generation Approach to Extracting Algorithmic Logic from Neural Networks

一种基于检索增强生成的方法用于从神经网络中提取算法逻辑

Waleed Khalid, Dmitry Ignatov, Radu Timofte

机构 * Computer Vision Lab, CAIDAS, University of Würzburg, Germany(计算机视觉实验室,CAIDAS,乌尔姆大学,德国)

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本文提出NN-RAG方法,通过检索增强生成技术从神经网络代码库中提取并验证模块,实现了跨仓库的架构迁移与重复检测,提升了神经网络架构的可复现性和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18227 2026-05-19 cs.DC 50%

ASSESSING THE STOCHASTIC PROPERTIES OF MODERN PSEUDO-RANDOM GENERATORS FOR PARALLEL COMPUTING

评估现代伪随机数生成器在并行计算中的随机性质

Théau Wartel, David R. C. Hill

专题命中 仓库级理解 :repository(abstract)

AI总结 本文评估了现代高性能计算和人工智能中使用的伪随机数生成器的统计性能和可重复性,通过系统测试多种生成器的品质,采用TestU01库中的BigCrush电池测试超过10^3个流,结果发现所有生成器均未能通过大部分测试,测试结果可重复且可公开获取。

详情

展开后加载摘要…

URL PDF HTML 收藏