arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-07-29 至 2026-07-29 共收录 25 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 4 篇

2607.25225 2026-07-29 cs.CR cs.LG cs.SE 新提交 62%

SecDrift: Measuring Sector-Conditioned Security Drift in AI-Generated Code

SecDrift:测量人工智能生成代码中特定领域条件下的安全漂移

Narayanaswami Natraj Bharadwaj, Dhivya Chandramouleeswaran

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.LG

AI总结 研究大语言模型在关键基础设施代码生成中特定领域提示的安全效果,提出SecDrift基准,通过多模型多领域评估发现行业提示安全优势不显著,模型选择影响大,强调模型选择是更可靠的安全杠杆并开源相关内容。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25415 2026-07-29 cs.AI 新提交 57%

A Control System, a Dataset, and a Recipe for Making Frozen LLM Agents Learn a Domain

一种用于使冻结的语言模型智能体学习领域的控制系统、数据集和方法

Debjyoti Paul

机构 * Meta AI

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 研究如何让冻结的语言模型智能体学习领域,核心方法是将框架视为特定动作空间,用经典强化学习在线学习策略并以多目标奖励评分,贡献包括用DSPy实例化系统并评估,还发布相关代码、任务套件、训练日志及部署方法。

Comments 8 pages, 1 figure, 3 tables. Code and dataset: https://github.com/dpaul0501/context-optimization-rl

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24755 2026-07-29 cs.HC cs.AI cs.CY 新提交 57%

Patterns of Learner-AI Interaction and Academic Performance in an Object-Oriented Programming Course

面向对象编程课程中学习者与人工智能交互模式及学业表现

Marina Lepp

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 研究面向对象编程课程中学习者与人工智能交互模式,通过对210名本科生调查,发现学生用GenAI多在寻求解释和调试,聚类出五种交互模式,表明自主使用GenAI不会带来学习提升,强调教学指导下人工智能使用的重要性。

Comments This work has been accepted for publication at the IEEE Frontiers in Education (FIE) 2026 Conference. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25865 2026-07-29 quant-ph cs.AI cs.MA 新提交 57%

OmniQEC: discovering practical quantum error-correcting codes by an AI scientist

OmniQEC:通过人工智能科学家发现实用的量子纠错码

Ge Yan, Shanchuan Li, Pengyue Ma, Qixin Zhang, Pingchuan Ma, Jianping Wang, Min-Hsiu Hsieh, Yuxuan Du

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 研究旨在发现实用量子纠错码,核心方法是用OmniQEC,它结合自我进化推理与慢快协同工作流程,通过代码级代理探索候选方案并经电路级评估反馈证据。贡献是发现的代码性能优且硬件友好,为大语言模型辅助量子纠错发现奠基。

Comments Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 8 篇

2607.24882 2026-07-29 cs.IR cs.AI cs.CL 新提交 88%

Agent Retrieval Bench: Evaluating Repository Context Retrieval for Coding Agents

智能体检索基准:评估代码智能体的仓库上下文检索

Bowen Qin, Yi Xie

专题命中 软件智能体 :repository(title,abstract);coding agent(title,abstract);分类 cs.CL、cs.AI

AI总结 研究代码智能体仓库上下文检索问题,引入智能体检索基准,涵盖多种检索任务和样本。评估多种检索方法,发现无单一方法占优,存在校准差距,且记录轨迹有缺失。通过试验表明检索得出的初始上下文有优势,神谕金上下文还有提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25431 2026-07-29 cs.SE 新提交 88%

CodeNib: A Multi-View Data System for Serving Repository Context to Coding Agents

CodeNib:一种用于向编码代理提供仓库上下文的多视图数据系统

Zhongming Yu, Hengjia Yu, Boqin Yuan, Shuting Zhao, Yizhao Chen, Aryan Dokania, Mihir Jagtap, Jiayu Chang, Yitong Ma, Yash Jayswal, Wentao Ni, Hejia Zhang, Zhaoling Chen, Gangda Deng, Jishen Zhao

专题命中 软件智能体 :repository(title,abstract);coding agent(title,abstract);分类 cs.SE

AI总结 研究编码代理从仓库获取上下文的问题,提出CodeNib构建多视图数据系统,可重用视图并映射到源范围,通过运行时提供多种服务,实验表明其在更新速度、延迟等方面有优势,支持多视图仓库上下文服务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25619 2026-07-29 cs.SE cs.CR 新提交 79%

SkillGate: Cost Efficient Runtime Malicious Skill File Detection in Coding Agents

SkillGate:编码代理中经济高效的运行时恶意技能文件检测

Rui Yang, Michael Fu, Kla Tantithamthavorn, Chetan Arora, Joey Chua

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 研究针对编码代理中恶意技能文件检测问题,提出SkillGate安全网关,采用混合正则表达式预过滤器+大语言模型判断管道,在SkillsBench基准测试中,检测效果好、成本低、运行时开销小,相比现有工具性能显著提升。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26563 2026-07-29 cs.SE 版本更新 70%

TrajAudit: Automated Failure Diagnosis for Agentic Coding Systems

TrajAudit:智能体编码系统的自动化故障诊断

Minxing Wang, Xiaofei Xie, Yintong Huo

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE

AI总结 针对仓库级编码轨迹中噪声多、上下文长的问题,提出TrajAudit框架,通过模式匹配过滤和测试报告先验知识辅助,实现高效故障诊断,在RootSE基准上定位准确率提升24.4个百分点,令牌消耗降低18%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25890 2026-07-29 cs.AI 新提交 57%

Distributing Security Controls Through Harness Engineering

通过工具工程分发安全控制

William Robert Gore

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 研究商业AI编码代理安全控制分发问题,通过分阶段测试方法,利用SHarD工具在多种代理配置上测试,证明三类安全控制可通过单个命令嵌入分发,效果与直接安装商业代理相同,还提出相关框架特征及后续研究问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24759 2026-07-29 cs.AI cs.CY cs.DL 新提交 57%

Beyond Memory: A Templated Substrate for Heterogeneous Collaborative Knowledge Work with LLM Agents

超越记忆:一种用于异构协作知识工作的带大语言模型代理的模板化基础架构

Priscila Saboia Moreira, Christopher R. Sweet

机构 * University of Notre Dame(圣母大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 研究指出知识工作成果难传承,大语言模型代理无持久记忆。提出llm-wiki-memory-template,它是异构协作知识工作基础架构,沿多人类、多代理、多领域三个轴,通过案例研究展示其能保留失败路径等,解决负面结果丢失问题。

Comments 15 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25975 2026-07-29 cs.HC 新提交 50%

Who is scientific code for? Maintaining human-readable landmarks in agent-written code

科学代码是为谁而设?在代理编写的代码中维护人类可读的地标

Elle O'Brien

专题命中 软件智能体 :coding agent(abstract)

AI总结 研究在科学家采用编码代理后,代码维护假设瓦解的问题,核心方法是通过多种调查及工作流程,发现科学家发明“地标策略”标记代码,指出明确划分人类可读与代理上下文能利于科学代码的开发、记录与维护。

Comments Position piece submitted to Infrastructure @ CSCW 26 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24964 2026-07-29 cs.CR 新提交 50%

ALIBI: Adaptive Agentic Attacks on LLM-Based Vulnerability Detectors via Adversarial Code Comments

ALIBI:通过对抗性代码注释对基于大语言模型的漏洞检测器进行自适应智能体攻击

Zixuan Wu, Cristina Nita-Rotaru

专题命中 软件智能体 :coding agent(abstract)

AI总结 研究如何通过对抗性代码注释对基于大语言模型的漏洞检测器进行自适应智能体攻击,提出ALIBI框架,将现实世界漏洞修复提交转换为编码任务评估多个检测器,发现其高度易受攻击,揭示攻击面并推动安全意识设计。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2607.25873 2026-07-29 cs.SE cs.AI 新提交 81%

How Do LLMs Read Bug Reports? An Empirical Study of Attention in LLMs for Automated Program Repair

大语言模型如何读取错误报告?基于大语言模型的自动程序修复中注意力的实证研究

Ramtin Ehsani, Irene Manotas, Saurabh Pujar, Luca Buratti, Preetha Chatterjee

专题命中 程序修复 :program repair(title,abstract);分类 cs.SE、cs.AI

AI总结 研究基于大语言模型的自动程序修复中模型注意力模式,通过分析319个真实错误,探究其在错误报告各部分的分布、成功与失败修复的注意力差异及与开发者重视信息的比较,发现注意力分配错误是失败关键因素,为改进系统提供见解。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE) 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 6 篇

2607.07471 2026-07-29 cs.LG cs.AI cs.CR 版本更新 62%

Where to Intervene? Benchmarking Fairness-Aware Learning on Differentially Private Synthetic Tabular Data

在何处进行干预?对差分隐私合成表格数据上的公平感知学习进行基准测试

Vinícius Gabriel Angelozzi, Héber H. Arcolezi

机构 * ÉTS Montréal(蒙特利尔高等商学院) Inria Grenoble(格勒诺布尔计算机科学及自动化研究所)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 研究在差分隐私合成表格数据上公平干预的效果,以自适应迭代机制为基准,在多数据集、指标及策略下评估,比较四种管道配置,发现仅DP会降效,公平干预可部分恢复公平,后处理方法权衡更优,还开源相关内容以支持研究。

Comments Paper accepted at PETS 2026. Code is available at https://github.com/vinicius-verona/dp-fair-intervention-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25992 2026-07-29 cs.DB cs.AI 新提交 57%

MemLens: A Value-Aware Memory Management System with Interactive Analytics for LLM-based Agents

MemLens:一种用于基于大语言模型的智能体的具有交互式分析的价值感知内存管理系统

Shuyue Wei, Chang Liu, Zimu Zhou, Yongxin Tong, Lizhen Cui

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 研究针对基于LLM的智能体内存管理问题,提出价值感知内存管理系统MemLens,通过端到端交互式分析仪表板展示内存生命周期,经学习助手应用程序帮助用户比较策略,可实现高效、可解释和个性化的长期内存管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11007 2026-07-29 cs.LG 版本更新 57%

TabPFN beyond Tabular Data: Calibration and Accuracy on Multimodal Embeddings

超越表格数据的TabPFN:多模态嵌入的校准与准确性

Jingxiang Zhang, Lujia Zhong, Zijie Zhu, Shuo Huang, Yuang Xu

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 研究少样本多模态分类中轻量级头部校准不佳问题,核心方法是评估TabPFN作为即插即用分类头。贡献在于其在多数据集、多编码器和多模态评估中表现优异,能提升校准并保持准确率,为校准敏感多模态分类提供指导。

Comments 19 pages, 13 figures, 10 tables. Jingxiang Zhang and Lujia Zhong contributed equally. Code: https://github.com/Jingxiang-Zhang/tabpfn-multimodal-embeddings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27243 2026-07-29 cs.IR cs.SE 版本更新 57%

NOVA: A Verification-Aware Agent Harness for Architecture Evolution in Industrial Recommender Systems

NOVA: 面向工业推荐系统架构演化的验证感知智能体框架

Shaohua Liu, Liang Fang, Yilong Sun, Shudong Huang, Qingsong Luo, Shaoxin Liu, Xiaoyang Chen, Dongqiang Liu, Chuangang Ma, Zhenzhen Chai, Henghuan Wang, Shijie Quan, Changyuan Cui, Zhangbin Zhu, Peng Chen, Wei Xu, Lei Xiao, Haijie Gu, Jie Jiang

专题命中 代码评测 :coding agent(abstract);分类 cs.SE

AI总结 提出NOVA框架,通过架构梯度、验证级联和层级任务控制实现工业推荐模型架构的自动化演化,有效减少静默失败,缩短文献到生产周期13倍以上。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11665 2026-07-29 cs.RO 版本更新 50%

Nautilus: From One Prompt to Plug-and-Play Robot Learning

Nautilus:从一个提示到即插即用的机器人学习

Yufeng Jin, Jianfei Guo, Xiaogang Jia, Yu Deng, Zechu Li, Han Liu, Weiran Liao, Vignesh Prasad, Mathias Franzius, Gerhard Neumann, Georgia Chalvatzaki

机构 * TU Darmstadt(图宾根大学) KIT(卡尔斯鲁厄理工学院) FZI(弗劳恩霍夫研究所) Robotics Institute Germany(德国机器人研究所) Honda Research Institute Europe(本田欧洲研究院)

专题命中 代码评测 :coding agent(abstract)

AI总结 Nautilus通过单个提示生成可复现、评估、微调和部署的机器人学习工作流程,提供即插即用的代理技能集和统一接口,减少跨家族验证的工程负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08789 2026-07-29 cs.CR 版本更新 50%

Never compromise with vulnerabilities: a comprehensive survey on AI governance

绝不向漏洞妥协:人工智能治理综合调查

Yuchu Jiang, Jian Zhao, Yuchen Yuan, Tianle Zhang, Yao Huang, Yanghao Zhang, Yan Wang, Yanshu Li, Xizhong Guo, Yusheng Zhao, Huilin Zhou, Jun Zhang, Zhi Zhang, Xiaojian Lin, Yixiu Zou, Haoxuan Ma, Yuhu Shang, Yuzhi Hu, Keshu Cai, Ruochen Zhang, Boyuan Chen, Yilan Gao, Ziheng Jiao, Yi Qin, Shuangjun Du, Xiao Tong, Zhekun Liu, Yu Chen, Xuankun Rong, Rui Wang, Yejie Zheng, Zhaoxin Fan, Murat Sensoy, Hongyuan Zhang, Pan Zhou, Lei Jin, Hao Zhao, Xu Yang, Jiaojiao Zhao, Jianshu Li, Joey Tianyi Zhou, Zhi-Qi Cheng, Longtao Huang, Zhiyi Liu, Zheng Zhu, Jianan Li, Gang Wang, Qi Li, Xu-Yao Zhang, Yaodong Yang, Mang Ye, Wenqi Ren, Zhaofeng He, Hang Su, Rongrong Ni, Liping Jing, Xingxing Wei, Junliang Xing, Massimo Alioto, Shengmei Shen, Petia Radeva, Dacheng Tao, Ya-Qin Zhang, Shuicheng Yan, Xuelong Li

专题命中 代码评测 :repository(abstract)

AI总结 针对人工智能发展带来的技术漏洞及社会风险,提出整合技术与社会维度的框架,围绕三个支柱构建,通过系统回顾识别核心挑战,给出综合研究议程,为开发可靠且符合伦理的人工智能系统提供指导。

Comments 26 pages, 3 figures, accepted by SCIS2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 6 篇

2607.25996 2026-07-29 cs.SE 新提交 79%

RepoReasoner: Evaluating Repository-Level Code Reasoning Ability of Long-Context Language Models

RepoReasoner:评估长上下文语言模型的仓库级代码推理能力

Yanlin Wang, Suiquan Wang, Yanli Wang, Bowen Zhang, Daya Guo, Jiachi Chen, Zibin Zheng

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE

AI总结 研究针对现有代码推理基准测试局限,引入RepoReasoner评估仓库级代码推理,通过多阶段管道构建基准,评估输出预测和调用链预测能力,发现当前LLMs在仓库级推理存在局限,为未来相关研究提供方向。

Comments Published in FSE'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25141 2026-07-29 cs.SE cs.LO cs.SY eess.SY 新提交 57%

Specification-Driven DevOps for Multi-Service Environments

多服务环境下基于规范驱动的DevOps

Oleg Grynets, Kyrylo Fursov, Vasyl Lyashkevych, Volodymyr Veres

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 研究探讨前沿大语言模型能否利用存储库内容为多服务应用生成配置,通过对三个异构存储库评估发现生成环境虽能运行,但有遗漏,进而区分功能正确性与部署意图保真度并得出最小显式部署规范。

Comments 25 pages, 8 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25437 2026-07-29 cs.SE quant-ph 新提交 57%

Repositories, Contributors, and Continuity: An Empirical Study of Foundational Quantum Software

存储库、贡献者与连续性:基础量子软件的实证研究

Vincent Gierisch, Nicole Hoess, Ralf Ramsauer, Wolfgang Mauerer

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 研究量子软件生态系统中概念和影响如何跨存储库边界持续存在,运用实证软件工程技术分析基础量子软件存储库,结合跨库活动与贡献者关系研究社区演变,发现多种发展路径并提供实证视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14429 2026-07-29 cs.DL cs.AI cs.CY cs.ET 版本更新 57%

Measuring the State of Open Science in Transportation Using Large Language Models

利用大型语言模型衡量交通运输领域开放科学的状态

Junyi Ji, Ruth Lu, Linda Belkessa, Liming Wang, Silvia Varotto, Yongqi Dong, Nicolas Saunier, Mostafa Ameli, Gregory S. Macfarlane, Bahman Madadi, Cathy Wu

机构 * Massachusetts Institute of Technology(麻省理工学院) Vanderbilt University(范德比大学) Portland State University(波特兰州立大学) Delft University of Technology(代尔夫特理工大学) Brigham Young University(Brigham Young 大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 本文利用大型语言模型自动评估交通研究中数据和代码的开放科学实践,发现仅有少数论文共享代码或数据,揭示了开放科学与传统学术指标之间的不一致,需通过结构性干预促进实践改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25871 2026-07-29 math.NA cs.MS cs.NA 新提交 50%

Multi-Solver Coupling for Parallel Adaptive Multi-Physics Simulations with Trixi$.$jl and deal$.$II

使用Trixi.jl和deal.II进行并行自适应多物理场模拟的多求解器耦合

Vivienne Ehlert, Gregor Gassner, Martin Kronbichler, Hendrik Ranocha, Michael Schlottke-Lakemper

专题命中 仓库级理解 :repository(abstract)

AI总结 该研究利用Trixi.jl和deal.II开发了用于耦合多物理场问题数值模拟的跨语言框架原型,通过开发牛顿自引力气体动力学求解器展示其可用性,验证了收敛性等,还研究了并行扩展性,提供了可重现存储库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24940 2026-07-29 astro-ph.CO gr-qc physics.comp-ph 新提交 50%

EFT-Ramses: a code to simulate the effective field theory of dark energy

EFT-Ramses:一个用于模拟暗能量有效场论的代码

Nathaniel Ota Woodcock, Sownak Bose, Yunhao Gao, Baojiu Li

专题命中 仓库级理解 :repository(abstract)

AI总结 为应对宇宙常数理论挑战,探索动态暗能量和修正引力模型,介绍EFT-RAMSES代码,它将暗能量有效场论框架嵌入数值管道,整合多种理论到单一方程,通过N体模拟验证,为暗能量和修正引力精确宇宙学测试提供强大通用计算工具。

Comments 18 pages, 5 figures (2 more in an Appendix), submitted to MNRAS; comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏