arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-07-03 至 2026-07-03 共收录 8 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 2 篇

2604.22659 2026-07-03 cs.SE 版本更新 83%

RealBench: A Repo-Level Code Generation Benchmark Aligned with Real-World Software Development Practices

RealBench: 一个与真实世界软件开发实践对齐的仓库级代码生成基准测试

Jia Li, Hongyi Deng, Yiran Zhang, Kechi Zhang, Tianqi Shao, Tiankuo Zhao, Weinan Wang, Zhi Jin, Ge Li, Yang Liu, Yingtao Fang, Yihong Dong

专题命中 代码生成 :code generation(title,abstract);repository(abstract);分类 cs.SE

AI总结 RealBench通过结合自然语言需求和UML图,评估LLM在结构化设计下的代码生成能力,揭示了LLM在仓库级代码生成中的性能差距和优化策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22063 2026-07-03 cs.SE cs.AI 版本更新 62%

RedCoder: Automated Multi-Turn Red Teaming for Code LLMs

RedCoder: 面向代码大语言模型的自动化多轮红队测试

Wenjie Jacky Mo, Qin Liu, Xiaofei Wen, Dongwon Jung, Hadi Askari, Wenxuan Zhou, Zhe Zhao, Muhao Chen

机构 * University of California, Davis(加州大学戴维斯分校) University of Southern California(南加州大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 提出RedCoder,一个通过多轮对话诱导代码大模型生成漏洞代码的自动化红队测试智能体,采用多智能体博弈生成原型对话和攻击策略库,并微调LLM作为骨干,实验表明其优于现有单轮和多轮方法。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 2 篇

2603.22435 2026-07-03 cs.RO cs.AI 版本更新 79%

CaP-X: A Framework for Benchmarking and Improving Coding Agents for Robot Manipulation

CaP-X: 用于基准测试和改进机器人操作编码智能体的框架

Letian Fu, Justin Yu, Karim El-Refai, Ethan Kou, Haoru Xue, Huang Huang, Wenli Xiao, Guanzhi Wang, Dantong Niu, Fei-Fei Li, Guanya Shi, Jiajun Wu, Shankar Sastry, Yuke Zhu, Ken Goldberg, Linxi "Jim" Fan

机构 * nvidia stanford(斯坦福大学) cmu(卡内基梅隆大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 提出CaP-X框架,通过CaP-Gym交互环境和CaP-Bench评估,发现编码智能体依赖人工抽象,但通过扩展测试时计算可提升鲁棒性,并推出无需训练的CaP-Agent0和强化学习CaP-RL。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22048 2026-07-03 cs.SE 版本更新 57%

Dynamic analysis enhances issue resolution

动态分析增强问题解决

Mingwei Liu, Zihao Wang, Zhenxi Chen, Zheng Pei, Yanlin Wang, Zibin Zheng

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 本文提出DAIRA框架,通过动态分析提升代码缺陷修复效率,实现高准确率和低资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 2 篇

2605.17965 2026-07-03 cs.SE cs.AI 版本更新 73%

BLAgent: Agentic RAG for File-Level Bug Localization

BLAgent: 一种面向文件级Bug定位的代理RAG

Md Afif Al Mamun, Gias Uddin

机构 * University of Calgary(卡尔加里大学) York University(约克大学)

专题命中 程序修复 :program repair(abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 本文提出BLAgent,一种新型代理RAG框架,用于文件级Bug定位,通过结合代码结构感知的仓库编码、双视角查询转换和两阶段代理重排序,提高了Bug定位的准确性和效率。

Comments Accepted for publication in ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17450 2026-07-03 cs.SE cs.AI cs.CL cs.CR 版本更新 67%

ContraFix: Skill-Enhanced Contrastive Runtime Analysis for Vulnerability Repair

ContraFix:通过差分运行时证据和技能重用进行代理漏洞修复

Simiao Liu, Fang Liu, Peiding Wang, Taichuan Li, Yinghao Zhu, Xiaoli Lian, Li Zhang

机构 * Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

专题命中 程序修复 :repository(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文提出ContraFix框架,通过差分运行时证据和可重用的修复技能,解决大型语言模型代理在自动漏洞修复中的语义误解问题,实现了在SEC-Bench和PatchEval上的高准确率。

Comments Code: https://figshare.com/s/f173c78e44bca88ebaea

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仓库级理解 2 篇

2601.04015 2026-07-03 cs.DL 版本更新 78%

Examining persistence of European open repository infrastructure and its diffusion in the scholarly record

欧洲开放仓储基础设施的持久性及其在学术记录中的扩散研究

George Macgregor, Joy Davidson

专题命中 仓库级理解 :repository(title,abstract)

AI总结 通过整合仓储注册数据和网络抓取信息,评估欧洲仓储的持久性,发现超过20%的仓储已“死亡”,约1.2万篇学术作品引用了无法检索的仓储内容,并提出了政策干预建议。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05362 2026-07-03 cond-mat.mtrl-sci 版本更新 50%

PolyRapid: Automated High-Throughput Screening of Polymers Using a Computational Workflow

PolyRapid:使用计算工作流程进行聚合物的自动化高通量筛选

Lois Smith, Samuel Ericson, Vittoria Fantauzzo, Chin Yong, Paola Carbone, Alessandro Troisi

专题命中 仓库级理解 :repository(abstract)

AI总结 提出PolyRapid自动化工作流程,集成自适应退火协议,实现103种均聚物的高通量筛选,95%系统在4个30纳秒退火周期内达到平衡,节省超过2500小时计算时间,并基于模拟数据构建机器学习模型预测聚合物密度和玻璃化转变温度。

Comments 62 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏