arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-04 至 2026-08-04 共收录 65 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 16 篇

2608.00122 2026-08-04 cs.AI 新提交 79%

Shared Organizational Memory for Enterprise Coding Agents: System Design and Deployment Snapshot

企业编码智能体的共享组织记忆:系统设计与部署快照

Harsh Rao Dhanyamraju, Leonidas Raghav

机构 * SAP SE(思爱普公司)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 本文设计部署共享组织记忆系统,将经验捕获融入企业编码工作流,收集并整理任务相关经验,管控风险并供智能体检索,目前其效果仍在评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15854 2026-08-04 cs.SE cs.AI 版本更新 73%

Agentic Synthesis against Counterexample-Supplemented Sketches

针对反例补充草图的智能合成

Muness Castle, Eric Rubeck

机构 * Independent(独立研究者)

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究针对编码智能体修复失败示例易留隐患的问题,提出针对反例补充草图的智能合成方法,通过人类给出草图、智能体生成实现,依据反例修正并保留代码,经实验验证该方法能减少返工,承载审查策略。

Comments 32 pages, 5 displayed figures (4 distinct screenshots). Includes the CatSynth artifact supplement. Code and captured experiment artifacts: https://github.com/open-horizon-labs/counterexample-supplemented-sketches Clarifies the two-check CESS method and Developer change authority; adds the protocol-correct CatSynth rerun and replaces the prior withheld-case headline

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14061 2026-08-04 cs.SE 版本更新 70%

LLM Agents Can See Code Repositories

LLM智能体能够查看代码仓库

Dongjian Ma, Silin Chen, Yufei Yang, Yuling Shi, Yanfu Yan, Xiaodong Gu

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE

AI总结 研究多模态大语言模型在仓库级问题解决中利用视觉表示的效果,发现纯视觉方案降低精度,而结合视觉结构图可减少26%输入token并保持或提升精度。

Comments Accepted by ASE 2026. Our code and data are available at https://github.com/cslsolow/SeeRepo

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00101 2026-08-04 cs.AI cs.LG 新提交 62%

Agentic Coding in the Wild: Characterizing GitHub Copilot Traces at Production Scale

野外环境下的智能体编码:生产规模下GitHub Copilot轨迹的特征分析

Banruo Liu, Haoran Qiu, Íñigo Goiri, Rodrigo Fonseca, Ricardo Bianchini, Esha Choukse

机构 * Microsoft Azure Research(微软Azure研究院) Microsoft Azure(微软Azure)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究对GitHub Copilot等AI编码智能体的生产规模轨迹进行特征分析,揭示其工作负载特性,设计轻量级空闲预测器,为智能体原生LLM服务基础设施提供实证基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03618 2026-08-04 cs.AI 版本更新 57%

Cross-Lingual Token Arbitrage: Optimizing Code Agent Context Windows via Local LLM Preprocessing

跨语言令牌套利:通过本地LLM预处理优化代码智能体上下文窗口

Mehmet Utku Colak

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 提出一种预处理的边缘端提示重写中间件,利用本地Llama 3.2模型进行跨语言翻译和结构重写,在保持或提升任务准确率的同时减少34-47%的提示令牌和最高18.8%的总令牌消耗。

Comments Updated References

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24600 2026-08-04 cs.AI 版本更新 57%

Agent-as-Peer-Debriefer: A Multi-Agent Framework with Perspective-Based Refinement for Qualitative Analysis

Agent-as-Peer-Debriefer: 一种基于视角精炼的多智能体定性分析框架

Zhimin Lin, Kun Cheng, Zhiyao Shu, Junhua Fang, Juntao Li, Fan Bai, Jie Gao

机构 * Soochow University(苏州大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 提出一种多智能体框架,通过模拟同行汇报(peer debriefing)并引入理论驱动、数据驱动和应用三种分析视角,提升大语言模型在定性数据分析中的编码质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01938 2026-08-04 cs.CR 新提交 50%

D-MUTRA: DLT-based MUTual Remote Attestation for Multi-Agent Systems

D-MUTRA:面向多智能体系统的基于分布式账本(DLT)的相互远程证明

Adam Zahir, Vincent Lefebvre, Mark Angoustures, Milan Groshev, Carlos J. Bernardos

专题命中 软件智能体 :software agent(abstract)

AI总结 针对多智能体系统传统远程证明的局限,本文提出基于区块链的D-MUTRA框架,实现智能体间的持续相互证明,可检测恶意软件修改,且扩展时开销可忽略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01315 2026-08-04 cs.IR 新提交 50%

Collaborative Memory Augmentation for Generative Recommendation

用于生成式推荐的协同记忆增强

Enze Liu, Zhen Tian, Wayne Xin Zhao

专题命中 软件智能体 :repository(abstract)

AI总结 针对现有生成式推荐模型未利用跨用户协同信号的问题,提出OMEGA框架,通过潜在上下文压缩、协同记忆库与目标感知检索等机制,在多数据集上显著优于现有先进模型。

Comments Accepted by KDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29007 2026-08-04 q-bio.QM 版本更新 50%

EasyBCI Agent: Towards Universal Neural Data Preprocessing for Brain-Computer Interfaces

EasyBCI Agent:面向脑机接口的通用神经数据预处理

Yu Zhu, Runkai Zhao, Zhimin Zhou, Jinyu Cai, Zhouheng Yao, Chutian Zhang, Peiyuan Li, Xiaoxing Zhang, Qihao Zheng, Jiamin Wu, Mianxin Liu, Chi Zhang, Bin Min, Lei Bai, Chengyu Li, Jingpeng Wu, Chunfeng Song

专题命中 软件智能体 :coding agent(abstract)

AI总结 EasyBCI是两阶段大语言模型智能体,可针对六种信号类型规划执行脑机接口预处理,经评估其在EEG任务中表现优于人工流程及通用编码智能体,可扩展至多模态并提升可复现性。

Comments 15 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 程序修复 2 篇

2602.06090 2026-08-04 cs.SE cs.AI cs.CV 版本更新 86%

SVRepair: Structured Visual Reasoning for Automated Program Repair

SVRepair: 结构化视觉推理用于自动化程序修复

Jincheng Wang, Liwei Luo, Xiaoxuan Tang, Jingxuan Xu, Sheng Zhou, Dajun Chen, Wei Jiang, Yong Li

机构 * Ant Group(蚂蚁集团) Zhejiang Key Laboratory of Accessible Perception and Intelligent Systems(浙江可感知智能系统重点实验室)

专题命中 程序修复 :program repair(title,abstract);repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 SVRepair 通过结构化视觉表示框架,结合多模态信息提升程序修复的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21930 2026-08-04 cs.SE 版本更新 57%

PITMuS: A Tool for Automated Bug Dataset Generation via Source-Level Mutant Reconstruction

PITMuS: 通过源级变异体重建实现自动化bug数据集生成工具

Tasfia Tasnim, Soneya Binta Hossain

专题命中 程序修复 :program repair(abstract);分类 cs.SE

AI总结 本文提出PITMuS工具,通过源级变异体重建生成自动化bug数据集,解决现有工具生成的变异体难以复现和利用的问题,为bug定位和修复技术提供结构化数据支持。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试生成 3 篇

2604.23509 2026-08-04 cs.SE 版本更新 79%

Uncovering Business Logic Bugs via Semantics-Driven Unit Test Generation

通过语义驱动的单元测试生成揭示业务逻辑错误

Chen Yang, Junjie Chen

专题命中 测试生成 :unit test generation(title,abstract);分类 cs.SE

AI总结 本文提出SeGa方法,通过语义知识库生成单元测试以发现业务逻辑错误,实验显示其在检测错误数量和精度提升方面优于现有技术。

Comments Accepted in the Research Track of ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02310 2026-08-04 cs.CL 新提交 57%

An Evidence-Grounded Retrieval-Augmented Transformer Framework for Health Misinformation Verification

用于健康虚假信息验证的基于证据的检索增强Transformer框架

Isah M. Bukar, Bala Mairiga Abduljalil, Bashir Saleh Maina, Abdulbasit Hassan

机构 * Yobe State University(约贝州立大学) Yobe AI Research Laboratory (YAIR Lab)(约贝人工智能研究实验室) Novosibirsk State University(新西伯利亚国立大学) College of Computer Science and Engineering, Hamad Bin Khalifa University(哈马德·本·哈利法大学计算机科学与工程学院)

专题命中 测试生成 :repository(abstract);分类 cs.CL

AI总结 本研究针对发展中国家健康虚假信息验证的本地语境缺失问题,提出基于WHO和尼日利亚疾控中心证据的检索增强Transformer框架,经实验评估BERT模型表现最佳,为资源受限地区开发相关系统提供基础。

Comments 17 pages, 2 figures, To appear in the Reimagining knowledge systems for digital transformation and sustainable development in the 21st century conference 2026, faculty of social sciences education. Federal University of Education, Zaria

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10628 2026-08-04 cs.SE 版本更新 57%

On the Diffusion of Test Smells in LLM-Generated Unit Tests

论LLM生成的单元测试中测试异味的扩散

Wendkûuni C. Ouédraogo, Yinghua Li, Xueqi Dang, Xunzhu Tang, Anil Koyuncu, Jacques Klein, David Lo, Tegawendé F. Bissyandé

专题命中 测试生成 :unit test generation(abstract);分类 cs.SE

AI总结 本研究通过多基准大规模分析,对比LLM生成、人类编写及EvoSuite生成的单元测试,发现LLM生成测试存在特定测试异味,受提示策略等影响,凸显基于LLM的测试生成的潜力与风险,呼吁开发相关优化方案。

Comments Accepted at Transactions on Software Engineering and Methodology (TOSEM) journal on 31 July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 10 篇

2608.00267 2026-08-04 cs.SE cs.CL 新提交 81%

LoopsBench: From Harness Engineering to Loop Engineering in Coding Agent Evaluation

LoopsBench:在基准测试编码智能体中从 harness 工程转向 loop 工程

Han Li, Zhemin Fang, Rili Feng, Yingqi Zhao, Jiaheng Liu, Pengfei Gao, He Ye, Dayi Lin, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

专题命中 代码评测 :coding agent(title,abstract);分类 cs.SE、cs.CL

AI总结 该研究针对编码智能体基准测试中持续执行洞察不足的问题,推出长周期基准 LoopsBench,含112个多领域任务,评估得最强配置解决25%任务,开源相关数据代码。

Comments Project page: https://loopsbench.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03356 2026-08-04 cs.SE 57%

POSTCONDBENCH: Benchmarking Correctness and Completeness in Formal Postcondition Inference

POSTCONDBENCH:形式化后置条件推理中的正确性与完备性基准测试

Gehao Zhang, Juan Zhai

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 本文提出POSTCONDBENCH多语言基准,用于评估LLM生成方法级后置条件的能力,发现正确性与完备性差距显著,仓库级依赖及方法复杂性会加剧该差距。

Journal ref In Findings of the Association for Computational Linguistics: ACL 2026, pages 35478-35507, San Diego, California, United States. Association for Computational Linguistics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02407 2026-08-04 cs.CR cs.AI 新提交 57%

Antares: Foundation Models for Agentic Vulnerability Localization

Antares:用于智能体漏洞定位的基础模型

Supriti Vijay, Aman Priyanshu, Didier Chapoteau, Arthur Goldblatt, Jianliang He, Kimia Majd, Fraser Burch, Baturay Saglam, Takahiro Matsumoto, Zhuoran Yang, Amin Karbasi

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 该研究提出基于IBM Granite的Antares系列紧凑语言模型,经两阶段训练用于智能体漏洞定位,其30亿参数版本性能接近GPT-5.5且远超更大模型,推理高效低成本。

Comments 57 pages, 12 figures, technical report for antares

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01149 2026-08-04 cs.AI 新提交 57%

PATH-Bench: Path-Dependent Evaluation of Lifelong Agents

PATH-Bench:面向终身智能体的路径依赖评估基准

Xidong Yang, Xingyi Zhang, Wenhao Li, Wenyan Liu, Junjie Sheng, Yun Hua, Wei Yin, Tao Fang, Chuyun Shen, Xiangfeng Wang

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 本研究构建了面向终身智能体路径依赖评估的基准PATH-Bench,评估8个智能体后提出SEU机制,该机制可减少遗忘、提升正向迁移,为设计更优终身智能体提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00915 2026-08-04 cs.LG 新提交 57%

UpliftBench: Revealing Outcome-Regime and Objective Mismatch in Uplift Evaluation

UpliftBench:揭示uplift评估中的结果 regime 与目标不匹配问题

Binshuang Li

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 UpliftBench评估12种uplift估计器,发现基准分歧源于指标而非模型,揭示Qini等指标与效应准确性一致性不足等问题,发布可复现基准工具。

Comments 25 pages, 9 figures. Code, data, and results: https://github.com/binshuangli/uplift-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00711 2026-08-04 cs.AI 新提交 57%

Tracing the Cascade: A Topology-Aware Evaluation Framework for Scientific Agent Hallucinations

追踪级联:一种面向科学智能体幻觉的拓扑感知评估框架

Xinshun Feng, Ziqi Miao, Lijun Li, Jing Shao

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 该研究针对科学智能体幻觉的拓扑结构评估缺口,提出SCHEMA框架,通过构建科学概念图等方式评估,发现幻觉集中于知识枢纽、最终准确率与推理轨迹诚实性脱钩,为高风险科学应用提供机制级评估方案。

Comments 36 pages, 7 figures and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00640 2026-08-04 cs.CL 新提交 57%

TreeProbe : A Tibetan Medicine Benchmark for Cultural Bias in LLMs

TreeProbe:面向大型语言模型文化偏见的藏医药基准测试集

Jin Zhang, Linyu Li, Weili Jiang, Yuqing Cai, Yutong Liu, Guanquecairang, Yongbin Yu, Jingye Cai, Nyima Tashi, Gadeng Luosang

机构 * University of Electronic Science and Technology of China(电子科技大学) Tibet University(西藏大学) Peking University(北京大学) Southwest Jiaotong University(西南交通大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 本研究针对大型语言模型的藏医药文化偏见问题,构建了首个基于藏医药“医学之树”框架的基准测试集TreeProbe,发现现有模型存在系统性本体漂移,为公平医疗AI开发提供了诊断基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00227 2026-08-04 cs.SE 新提交 57%

Source Code Authorship Attribution Does Not Generalize from Competitions to Classrooms

源代码作者身份归属无法从竞赛场景泛化到课堂场景

Serhii Yemets, Marek Horváth

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 本研究发现,针对Google Code Jam竞赛数据微调的CodeBERT等模型,在课程作业数据集上的作者身份归属性能远低于随机基线,竞赛场景的基准无法泛化到教育场景,需针对性验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01077 2026-08-04 cs.RO 新提交 50%

VespaSeg: A Resource-Aware Ground-then-Segment Pipeline for Referring Expression Segmentation

VespaSeg:一种用于指代表达分割的资源感知“先定位后分割”流水线

Savindu Dilshan Wickramasinghe

机构 * University of Moratuwa(莫拉图瓦大学)

专题命中 代码评测 :repository(abstract)

AI总结 本文针对指代表达分割中整体式模型部署成本高的问题,提出模块化流水线VespaSeg,采用轻量型视觉-语言模型定位与MobileSAM分割,经适配后在RefCOCO数据集上实现高精度,且内存占用低、推理速度快。

Comments 5 pages, 3 figures. Code and result artifacts: https://github.com/Savidilsh/VespaSeg

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00461 2026-08-04 physics.ins-det hep-ex 新提交 50%

An eightfold equivalence-preserving speedup of the JUNO OMILREC vertex and energy reconstruction

JUNO OMILREC顶点与能量重建的八倍等效保持加速

Guangbao Sun, Qishan Liu, Wenjie Wu, Jun Cao, Xuefeng Ding, Wenxing Fang, Wuming Luo, Liangjian Wen, Zeyuan Yu, Xiang Zhou

专题命中 代码评测 :coding agent(abstract)

AI总结 本研究针对JUNO的OMILREC重建算法,通过分阶段等效保持优化实现了最高8.6倍的单线程加速,保持物理输出一致,为大型探测器似然重建加速提供了可转移模板。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 10 篇

2509.23422 2026-08-04 astro-ph.IM physics.ins-det 版本更新 82%

Cryogenic Materials Repository: A Public Resource and New Measurements for Cryogenic Research Applications

低温材料库:用于低温研究应用的公共资源及新测量数据

Henry E. Nachman, Oorie Desai, Nicholas Galitzki, Daniel Lee, JB Lloyd, Tannishtha Nandi, Ani Pagni, Ray Radebaugh, Elle C. Shaw

专题命中 仓库级理解 :repository(title,abstract)

AI总结 该研究开发了公共GitHub低温材料库(CMR),提供亚开尔文热导率测量数据,支持各学科研究人员设计评估低温系统,服务于宇宙学、天体物理望远镜等低温研究应用。

Journal ref IEEE Transactions on Applied Superconductivity, Volume 36 , Issue 6, September 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00558 2026-08-04 cs.SE cs.AI 新提交 62%

AiFlow: Token-Native Reactive Orchestration with Bounded Backpressure for Streaming LLM Applications

AiFlow:面向流式大语言模型应用的带界背压令牌原生反应式编排框架

Qunhui Zhang

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI

AI总结 针对现有流式LLM工作流编排的背压等管理缺陷,提出AiFlow令牌原生反应式编排模型,经实验验证可降低应用TTFPT并控制队列深度。

Comments 24 pages, 5 figures, 12 tables, 1 algorithm, and 1 code listing. Public implementation: https://github.com/ModelEngine-Group/fit-framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00508 2026-08-04 cs.CV cs.AI cs.LG 新提交 62%

RadYOLO: Computationally Efficient 3D Object Detection and Segmentation in CT and MRI

RadYOLO:面向CT和MRI的计算高效型3D目标检测与分割方法

Kai Geissler, Laurens Müller-Groh, Hans Meine

机构 * Fraunhofer Institute for Digital Medicine MEVIS(弗劳恩霍夫数字医学MEVIS研究所)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文提出针对医学图像的YOLO11 3D扩展模型RadYOLO,通过与nnU-Net、nnDetection在5个CT/MRI数据集上对比,证实其检测性能与推理速度均具优势,适配临床及边缘设备部署需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02599 2026-08-04 eess.SY cs.AI cs.SY 新提交 57%

Bridging Artificial Intelligence and Power Systems Education Using a Hands-On Executable Framework

使用可执行实践框架搭建人工智能与电力系统教育的桥梁

Junjie Yin, Buxin She, Xinyu Feng, Fangxing, Li

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 本文提出可执行实践框架,通过渐进式模块降低电力系统AI入门门槛,经IEEE网络研讨会验证,可满足跨学科学习者对电力专用AI实践课程的需求。

Comments 10 pages, 10 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08645 2026-08-04 cs.CL 版本更新 57%

Quick on the Uptake: Eliciting Implicit Intents from Human Demonstrations for Personalized Mobile-Use Agents

快速响应:从人类演示中提取隐含意图以构建个性化移动使用代理

Zheng Wu, Heyuan Huang, Yanjia Yang, Yuanyi Song, Xingyu Lou, Weiwen Liu, Weinan Zhang, Jun Wang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) OPPO Research Institute(OPPO研究院)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL

AI总结 本文提出IFRAgent框架,通过分析显式和隐式意图流,提升移动代理对人类意图的对齐率和任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22935 2026-08-04 cs.CR cs.SE 版本更新 57%

SPFinder: Improving the Context Length and Scalability for Tracing Known Vulnerability Patches

SPFinder:提升已知漏洞补丁追踪的上下文长度与可扩展性

Jiangrui Zheng, Xueqing Liu, Guanqun Yang, Siyan Wen, Qiushi Liu, Xiaoyin Wang

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 SPFinder是一种用于追踪已知漏洞补丁的可扩展检索框架,通过分层嵌入和三阶段检索解决长上下文与可扩展性问题,在多数据集评估中优于现有方法,可实用关联CVE补丁。

详情

展开后加载摘要…

URL PDF HTML 收藏