arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-07-10 至 2026-07-10 共收录 23 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 8 篇

2607.08691 2026-07-10 cs.SE cs.AI cs.IR 新提交 88%

ProjAgent: Procedural Similarity Retrieval for Repository-Level Code Generation

ProjAgent:用于仓库级代码生成的过程相似性检索

QiHong Chen, Aaron Imani, Iftekhar Ahmed

机构 * University of California, Irvine(加州大学伊文斯分校)

专题命中 代码生成 :code generation(title,abstract);repository(title,abstract);分类 cs.SE、cs.AI

AI总结 研究仓库级代码生成问题,提出ProjAgent系统,将目标函数分解为中间推理步骤,通过代理工作流程检索相似过程行为的函数,结合语义检索构建丰富上下文,并利用静态分析反馈循环修复代码,实验表明该方法有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07881 2026-07-10 cs.SE cs.CR cs.LG 新提交 81%

Functional and Secure Code Generation with Task Vectors

使用任务向量进行功能和安全代码生成

Felix Wang, Anudeep Das, Mei Nagappan, N. Asokan

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.LG

AI总结 研究旨在解决大语言模型生成安全功能代码的问题,提出SecVecCoder方法,利用任务向量生成可信代码,在CodeGuard+基准测试中提升了可信代码完成率,且解码延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13376 2026-07-10 cs.CV cs.AI cs.CL 版本更新 81%

An Online Reference-Free Evaluation Framework for Flowchart Image-to-Code Generation

用于流程图图像到代码生成的在线无参考评估框架

Giang Son Nguyen, Zi Pong Lim, Sarthak Ketanbhai Modi, Yon Shin Teo, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学) AUMOVIO Singapore(AUMOVIO新加坡) VinUniversity(文理大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.CL、cs.AI

AI总结 针对流程图图像到代码生成在生产中无真实代码难以评估输出质量的问题,提出无参考评估框架,通过RecallOCR和PrecisionVE两个指标及调和均值F1OCR-VE监测生成质量,在FlowVQA数据集验证了其可靠性。

Comments This manuscript was inadvertently made publicly available before all necessary internal review processes had been completed. The authors are withdrawing the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07748 2026-07-10 cs.LG 新提交 79%

Selective Left-Shift: Turning Test-Time Compute and Difficulty-based Curation into Training Data for Low-Resource Code Generation

选择性左移:将测试时计算和基于难度的筛选转化为低资源代码生成的训练数据

Didula Samaraweera, Anjana Supun, Srinath Perera

机构 * WSO2

专题命中 代码生成 :code generation(title,abstract);分类 cs.LG

AI总结 针对低资源代码生成难题,提出三阶段管道,先将推理计算左移合成训练数据,再微调嵌入句法先验,最后用可验证奖励强化学习,相比现有方法提升性能,减少数据使用和成本,且能推广到新语言。

Comments 11 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08010 2026-07-10 cs.CL cs.LG cs.SE 新提交 67%

Tool-Making and Self-Evolving LLM Agents in Low-Latency Systems

低延迟系统中的工具制作与自我进化大语言模型智能体

Kalle Kujanpää, Ning Liu, Shahnawaz Alam, Yeshwanth Reddy Sura, Tianyu Yang, Kristina Klinkner, Shervin Malmasi

机构 * Amazon(亚马逊)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL、cs.LG

AI总结 研究如何解决生产LLM智能体因重复生成代码浪费延迟和可靠性的问题,提出用智能工具制作管道取代推理时编码循环,部署该方法使系统更快、更可靠、易操作,降低延迟和错误率,提高可审计性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07952 2026-07-10 cs.HC cs.CL 新提交 57%

fog: Expressing Motion and Emotion through Function Composition of AI-Generated Code

fog:通过人工智能生成代码的函数组合来表达运动和情感

Vivian Liu, Lydia Chilton

机构 * Columbia University(哥伦比亚大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 介绍fog函数组合框架,用于通过人工智能生成代码表达运动和情感,能创建运动词汇表并由动画编辑器辅助。经感知评估和用户研究,其运动函数识别准确率达68%,相比基线有显著提升,且在界面形式上支持用户快速迭代等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13723 2026-07-10 cs.SE 版本更新 57%

Compiling Large Multi-Modal Requirement Documents into Runnable Software Systems: From an Agentic Test-Driven Perspective

ARC:将大型多模态需求文档编译为可运行软件系统

Weiyu Kong, Yun Lin, Xiwen Teoh, Duc-Minh Nguyen, Ruofei Ren, Jiaxin Chang, Haoxu Hu, Haoyu Chen

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 提出Agentic需求编译(ARC)技术,通过双向测试驱动智能体循环,将多模态DSL文档直接编译为可运行Web系统,在GUI测试通过率上平均提升50.6%。

Comments This work is accepted at issta'26 (SIGSOFT International Symposium on Software Testing and Analysis)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21074 2026-07-10 cs.NI 版本更新 50%

RepLLM: Toward Automatically Reproducing Network Research Results

RepLLM:迈向自动重现网络研究结果

Yining Jiang, Yunxin Xu, Wenyun Xu, Yufan Zhu, Rui Liu, Tangtang He, Haiying Huang, Letian Zhu, Qingyu Song, Qiang Su, Lizhao You, Lu Tang, Wanjian Feng, Yuchao Zhang, Linghe Kong, Qiao Xiang, Jiwu Shu

专题命中 代码生成 :code generation(abstract)

AI总结 针对计算机网络研究结果重现难题,RepLLM提出端到端多智能体框架,通过四个智能体协作及共享内存机制确保一致性,借助特定推理和调试方法解决问题,相比现有框架表现更优,能高效重现基准且减少令牌消耗。

Comments SIGCOMM'26(19 pages, 6 figures, 6 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 4 篇

2607.07946 2026-07-10 cs.SE cs.LG 新提交 81%

DeepSWE: Measuring Frontier Coding Agents on Original, Long-Horizon Engineering Tasks

DeepSWE:在原始的、长周期工程任务上评估前沿编码智能体

Wenqi Huang, Charley Lee, Leonard Tng, Serena Ge

机构 * Datacurve

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.LG

AI总结 研究针对编码智能体评估,指出多数基准测试存在的问题。提出DeepSWE基准测试,其任务从零编写,用手写验证器评分,能避免相关问题,在区分智能体等方面表现出色,还发布了基准测试等相关内容。

Comments 32 pages, 10 figures. Code and data: https://github.com/datacurve-ai/deep-swe ; https://deepswe.datacurve.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07980 2026-07-10 cs.SE cs.AI 新提交 73%

3100 Opinions on Code Review in an AI World: Building Causal Theory from Practitioner Discourse

人工智能时代关于代码审查的3100种观点:从从业者话语中构建因果理论

Shyam Agarwal, Courtney Miller, Christian Kästner, Bogdan Vasilescu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究人工智能对代码审查的影响,通过收集从业者话语构建因果模型,明确审查是控制点,团队决定编码代理对软件影响,转化相关命题,还提供LLM辅助灰色文献理论构建方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02514 2026-07-10 cs.AI 新提交 57%

Distributed Attacks in Persistent-State AI Control

持久状态AI控制中的分布式攻击

Josh Hills, Ida Caspary, Asa Cooper Stickland

机构 * Constellation Astra Fellowship(Constellation Astra 奖学金) Imperial College London(帝国理工学院) UK AI Security Institute(英国人工智能安全研究所)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 研究AI编码代理在持久代码库中跨拉取请求分布攻击的威胁,提出Iterative VibeCoding基准,发现单一监控器无法同时防御渐进与非渐进攻击,而状态跟踪监控器可显著降低渐进攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17510 2026-07-10 cs.SE 版本更新 57%

Psychological Safety Framework in Pull-based Open Source Projects

基于心理安全的拉式开源项目框架

Emeralda Sesari, Federica Sarro, Ayushi Rastogi

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 本文提出基于心理安全理论的框架,通过分析拉取请求互动中的10种可观察行为,构建心理安全指数,并验证其对贡献者短期和长期持续参与的影响。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2607.07882 2026-07-10 cs.SE 新提交 83%

Bug Report Specification Refinement with Trajectory Guidance for Automated Program Repair

基于轨迹引导的自动程序修复的错误报告规范细化

S M Farah Al Fahim, Md Nakhla Rafi, Md Ahasanuzzaman, Zeyang Ma, Dong Jae Kim, Shaowei Wang, Tse-Hsun, Chen

专题命中 程序修复 :program repair(title,abstract);repository(abstract);分类 cs.SE

AI总结 研究针对自动程序修复中错误报告规范不完善的问题,提出TrajSpec方法,通过轨迹引导收集证据并组织成三级表示,经审查生成细化报告,实验表明该方法能有效提高修复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 3 篇

2607.07744 2026-07-10 cs.SE 新提交 74%

PERFOPT-Bench: Evaluating Coding Agents on Software Performance Optimization

PERFOPT-Bench:评估软件性能优化中的编码代理

Yingyun Cui, Yi Xie, Piaohong Wang, Jiawei Ma, Bo Liu, Liangliang Cao

专题命中 代码评测 :coding agent(title);分类 cs.SE

AI总结 该研究介绍PERFOPT-Bench基准,用于评估软件性能优化中编码代理的完整性能工程循环。通过7个长期任务评估7个不同的代理堆栈,发现优化性能取决于工作负载,原始加速作基准分数不安全,还提出中继试验可恢复额外空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08374 2026-07-10 cs.CL cs.AI cs.HC cs.RO cs.SI 新提交 62%

Large-Language-Models-as-a-Judge in Theory-Agnostic Adaptive Metric-Alignment for Prototypical Networks in Personality Recognition

大语言模型作为人格识别中原型网络的理论无关自适应度量对齐的评判器

Jing Jie Tan, Ban-Hoe Kwan, Danny Wee-Kiat Ng, Yan-Chai Hum, Shih-Yu Lo, Po-An Chen, Noriyuki Kawarazaki, Kosuke Takano, Anissa Mokraoui

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对人格识别受理论依赖公式限制的问题,提出理论无关的JAM框架,通过注意力池化图原型网络和跨理论协调方法学习结构化表示并统一数据集,还用大语言模型作为评判器机制,提升了跨框架泛化能力和性能。

Journal ref IEEE Transactions on Affective Computing (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03238 2026-07-10 cs.LG cs.AI 版本更新 62%

When RLHF Fails: A Mechanistic Taxonomy of Reward Hacking, Collapse, and Evaluator Gaming

当RLHF失败时:奖励黑客、崩溃和评估者博弈的机制分类

Zelalem Abahana, David Evans, Satish Mahadevan Srinivasan, Matjaz Gams

机构 * First Citizens Bank(第一公民银行) Alma Mater Europaea University(欧洲大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文通过PPO、DPO等方法的对比实验,提出了一种基于奖励和评估者分数方向的机制分类法,将RLHF失败模式分类为可定位、可预测的训练动态。

Comments 20 pages, 8 figures; includes code, artifacts, and live demo

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 7 篇

2607.07907 2026-07-10 cs.LG cs.AI cs.CL cs.CR cs.MM 新提交 67%

Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks

跨视觉、语言、视频和音频的多模态遗忘:方法、数据集和基准的综述

Nobin Sarwar, Shubhashis Roy Dipta, Zheyuan Liu, Vaidehi Patil

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 综述跨视觉、语言、音频和视频的多模态遗忘,基于相关进展等提供统一视角,通过分类法系统比较模型架构和模态,阐明权衡,强调开放问题与实际考虑,支持未来研究与部署,并发布存储库。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07996 2026-07-10 eess.SP cs.AI cs.LG 新提交 62%

SpO$_2$ Predictor-Guided Stage-Wise Time-Frequency Reconstruction of Low-Quality Dual-Wavelength PPG for Oxygen Saturation Estimation

用于氧饱和度估计的 SpO₂ 预测器引导的低质量双波长 PPG 逐阶段时频重建

Zequan Liang, Elahe Hosseini, Ning Miao, Mahdi Pirayesh Shirazi Nejad, Wei Shao, Ehsan Kourkchi, Setareh Rafatirad, Houman Homayoun

机构 * Department of Computer Science, University of California, Davis, Davis, CA, U.S.A.(加州大学戴维斯分校计算机科学系) Department of Electrical and Computer Engineering, University of California, Davis, Davis, CA, U.S.A.(加州大学戴维斯分校电气与计算机工程系)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG

AI总结 研究针对低质量双波长 PPG 信号估计 SpO₂ 不准确的问题,提出 SpO₂ 预测器引导的逐阶段时频重建框架,结合时域与频域损失及 SpO₂ 预测器约束训练模型,实验表明该方法能降低受试者级平均绝对误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08331 2026-07-10 cs.LG cs.AI 新提交 62%

ArtMine: Discovering and Formalizing Artistic Processes

ArtMine:发现并形式化艺术创作过程

Kaustubh Kumar, Ashutosh Ranjan, Vivek Srivastava, Blessin Varkey, Shirish Karande

机构 * TCS Research(TCS研究)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG

AI总结 研究如何从异构历史证据发现并形式化艺术创作过程,核心方法是将证据合成存储库,由溯因智能体推断生产步骤并优化,主要贡献是迈向以过程为中心的人机协同创作系统,支持多方面研究。

Comments 47 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05969 2026-07-10 cs.CR cs.SE 版本更新 57%

Heimdallr: Characterizing and Detecting LLM-Induced Security Risks in GitHub CI Workflows

Heimdallr:在GitHub CI工作流中识别和检测LLM引发的安全风险

Bonan Ruan, Yeqi Fu, Chuqi Zhang, Jiahao Liu, Jun Zeng, Zhenkai Liang

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本文研究GitHub CI工作流中LLM引发的安全风险,提出Heimdallr框架,通过流程图规范化和威胁向量检测,实现高精度识别LLM节点和威胁向量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08098 2026-07-10 cs.CV cs.RO 新提交 50%

EVIS: A Physics-Grounded Event Camera Plugin for NVIDIA Isaac Sim

EVIS:用于NVIDIA Isaac Sim的基于物理的事件相机插件

Linli Shi, Ruijun Zhang, Ziyun Wang

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 仓库级理解 :repository(abstract)

AI总结 研究针对事件相机数据收集难题,提出基于物理的EVIS插件用于NVIDIA Isaac Sim,能在模拟器内生成带标签事件流,通过特定模型和可配置设置实现实时单GPU生成,其流可供预训练网络用于下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08195 2026-07-10 physics.comp-ph physics.flu-dyn 新提交 50%

Parallel simulation of rarefied gas flows on unstructured meshes using the DIG-augmented DSMC method

使用DIG增强的DSMC方法在非结构化网格上对稀薄气体流动进行并行模拟

Tao Huang, Liyan Luo, Hong Deng, Lei Wu

专题命中 仓库级理解 :repository(abstract)

AI总结 研究针对DSMC在近连续介质区域计算成本高的问题,开发并行DIG增强的DSMC求解器用于非结构化网格三维稀薄气体流动模拟,通过构建耦合框架、采用混合架构和负载平衡策略,减少计算资源需求,提供高效数值工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02434 2026-07-10 hep-ph 50%

Perturbative unitarity for models with singlet and doublet scalars

微扰单位性对于包含单态和双态标量模型的描述

Carolina T. Lopes, André Milagre, João P. Silva

专题命中 仓库级理解 :repository(abstract)

AI总结 本文研究了包含额外SU(2)双态、中性单态和电荷单态标量模型的微扰单位性限制,提出了散射矩阵的分类和最小集,并提供了Mathematica实现BounDS进行分析。

Comments 26 pages; v2: added Refs. 23 and 24; v3: added more references

Journal ref International Journal of Modern Physics A (2026) 2650126

详情

展开后加载摘要…

URL PDF HTML 收藏