arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-04 至 2026-08-04 共收录 37 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 10 篇

2608.01927 2026-08-04 cs.SE cs.AI 新提交 88%

Effective and Efficient Context Retrieval via Partial Dependency Graph for Repository-Level Code Generation

基于部分依赖图的高效上下文检索用于仓库级代码生成

Zhongxin Liu, Zhonghao Jiang, Zhifan Ye, Haoye Wang, Jiakun Liu, Xiaoxue Ren

专题命中 代码生成 :code generation(title,abstract);repository(title,abstract);分类 cs.SE、cs.AI

AI总结 该研究针对仓库级代码生成中RAG方法的不足,提出基于部分依赖图的DyRetriever,构建DyCoder并在CoderEval、DevEval上取得显著性能提升且效率更高。

Comments Accepted by ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02162 2026-08-04 cs.SE cs.AI cs.PL 新提交 82%

Lossless Tensor Compression as Program Synthesis

作为程序综合的无损张量压缩

Jieke Shi, Junda He, Wenjia Jiang, Weifeng Sun, Shidong Pan, Zhensu Sun, Chengran Yang, Peixin Zhang, Yifan Jia, Zhou Yang, Thong Hoang, Xiwei Xu, Zhenchang Xing, David Lo

专题命中 代码生成 :program synthesis(title,abstract);分类 cs.SE、cs.AI、cs.PL

AI总结 Brevis将无损张量压缩转化为程序综合,通过带类型的DSL与有界A*搜索优化压缩,在10类模型检查点上实现了超通用及专用压缩器的存储缩减,且压缩解压速度可观。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00494 2026-08-04 cs.AI 新提交 79%

TaPR: Test-Aware Policy Refinement for Feedback-Conditioned Code Generation

TaPR:面向反馈条件代码生成的感知测试策略优化

Aofan Liu, Jingxiang Meng, Fangxin Liu, Yongbiao Chen

专题命中 代码生成 :code generation(title,abstract);分类 cs.AI

AI总结 该研究针对代码智能体强化学习中反馈利用不足的问题,提出TaPR框架,通过将执行反馈转换为密集每轮测试通过率奖励,在219个代码问题上提升了多轮代码生成成功率。

Comments 9 pages, 3 figures, 3 tables. Aofan Liu and Jingxiang Meng contributed equally; Fangxin Liu and Yongbiao Chen are corresponding authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00434 2026-08-04 cs.CL cs.AI 新提交 62%

AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction

AdaMTP:一种面向多令牌预测的自适应训练范式

Ziqiang Cui, Han Shi, Bowei He, Yu Pan, Peiyang Liu, Shengyin Sun, Yankai Chen, Haoli Bai, Yichun Yin, Xue Liu, Chen Ma

机构 * City University of Hong Kong(香港城市大学) Huawei Technologies(华为技术有限公司) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) McGill University(麦吉尔大学) Peking University(北京大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 AdaMTP是适配序列内在可预测性的自适应MTP训练范式,通过熵算法划分语义边界抑制噪声梯度,在三类主干模型的多任务基准中均优于标准MTP,兼具性能与推理速度优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02353 2026-08-04 cs.CL 新提交 57%

Global Optimization and Inference-Time Region Grafting for Agentic Workflows

智能体工作流的全局优化与推理时区域嫁接

Donghyeok Koh, Gyuwan Kim, Jinyeong Bak, Seung-Hoon Na, Tao Yang, Haneol Jang, Cheoneum Park

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 本文提出GRAFT方法,通过保留全局优化工作流并局部替换选定区域实现智能体工作流的实例级自适应,在多类任务上较MaAS平均提升3.85个百分点,且执行器升级无需重新优化全局工作流。

Comments 9 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02329 2026-08-04 cs.SE 新提交 57%

On Automated and Explainable Provenance of AI-Generated Code

人工智能生成代码的自动化且可解释的来源研究

Alejandro Velasco, Nathan Wintersgill, Trevor Stalnaker, Oscar Chaparro, Denys Poshyvanyk

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 针对AI生成代码来源不透明的问题,本文提出需构建可解释来源的下一代CodeGenAI工具,结合实证研究与因果可解释技术,明确了相关研究挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01851 2026-08-04 cs.RO cs.AI 新提交 57%

Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills

权重还是技能?机器人学习技术综述:从动作预测权重到自主编写技能的机器人

Gaytri Jena, Kapil Wanaskar, Vinija Jain, Aman Chadha, Vasu Sharma, Amitava Das

专题命中 代码生成 :program synthesis(abstract);分类 cs.AI

AI总结 本综述围绕机器人学习的“权重vs技能”轴,梳理两类技术的分类、自我提升机制与开放问题,考察77个代表性系统,为机器人学习领域提供分析框架。

Comments 40 pages, 11 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01667 2026-08-04 cs.AI 新提交 57%

TCPO: Turn-Level Credit Policy Optimization

TCPO:回合级信用策略优化

Sicong Liao, Zhi Chen, Yaohua Tang

机构 * Moore Threads AI(摩尔线程人工智能)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 该研究针对验证器引导多回合强化学习的信用分配问题,提出TCPO方法,在多类任务和模型上提升了LLM的多回合推理与智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00805 2026-08-04 cs.AI 新提交 57%

AgentSLABench: Evaluating and Benchmarking Agentic Systems Under Resource Constraints

AgentSLABench:资源约束下智能体系统的评估与基准测试

Meher Bhaskar Madiraju, Meher Sai Preetam Madiraju

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本研究提出AgentSLABench框架,在资源约束下评估自主AI智能体,通过多维度指标分析发现专用智能体表现优于通用基线,验证了效率调整成功率的重要性并开放相关资源。

Comments 7 pages, 2 figures, 9 tables. Code, sealed test sets, and profiling artifacts available at: https://github.com/MeherBhaskar/agentslabench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01686 2026-08-04 cs.CV 新提交 50%

Generative AI and Foundation Models in Medical Image

医学影像中的生成式AI与基础模型

Masahiro Oda

机构 * Nagoya University(名古屋大学) Graduate School of Informatics, Nagoya University(名古屋大学信息学研究科)

专题命中 代码生成 :code generation(abstract)

AI总结 本文概述生成式AI相关的扩散模型、LLMs及基础模型,介绍其在医疗辅助中的应用,探讨基础模型的构建方法与医疗应用,并研究利用国家资源开发医疗辅助AI的路径。

Comments Review Article

Journal ref Radiological Physics and Technology, vol.18, pp.937-948, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 11 篇

2608.02001 2026-08-04 cs.SE 新提交 88%

VulnGym: Benchmarking Coding Agents for Repository-Level Vulnerability Detection

VulnGym:面向代码智能体的仓库级漏洞检测基准测试

Kexing Ji, Jiachen Liu, Enze Hu, Cuiyun Gao, Keke Lian, Yongheng Liu, Lei Zhang, Tian Dong, Hao Chen, Wang Bin

专题命中 软件智能体 :repository(title,abstract);coding agent(title,abstract);分类 cs.SE

AI总结 研究人员提出VulnGym基准,解决现有基准难以评估代码智能体仓库级漏洞检测能力的问题,发现当前代码智能体在该检测及支撑追踪构建上仍存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02499 2026-08-04 cs.SE cs.AI cs.CL 新提交 85%

SWE-Touch: Benchmarking Coding Agents When Users Touch the Code

SWE-Touch:用户接触代码时的编码智能体基准测试

Yuqiao Tan, Jinxiang Meng, Fangyu Lei, Minzheng Wang, Shizhu He, Jun Zhao, Kang Liu

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 SWE-Touch基准测试显示,编码智能体对共享工作空间的状态感知不足,反编辑使其解决率降低7.7个百分点,需优化相关协作能力。

Comments Preprint. Our code is available at https://github.com/Trae1ounG/SWE-Touch

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00966 2026-08-04 cs.SE 新提交 83%

AgenTag: Attribution of AI Coding Agents from Behavioral Fingerprints

AgenTag:基于行为指纹的AI编码智能体归因

Taher A. Ghaleb

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE

AI总结 本文提出多模态框架AgenTag,基于PR的文本、行为等模态,结合监督对比学习实现开放世界AI编码智能体归因,在AIDev数据集上取得良好效果,且发现归因主要依赖PR描述和提交消息等行为指纹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00808 2026-08-04 cs.SE 新提交 83%

Turning Interaction History into Execution State: A Runtime Layer for Long-Horizon Coding Agents

将交互历史转化为执行状态:面向长程编码智能体的运行时层

Zehao Wang, Yisen Xu, Chenglin Li, Chao Peng, Bram Adams, Ahmed E. Hassan, Tse-Hsun, Chen

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE

AI总结 该研究针对长程编码智能体易受过时状态干扰的问题,提出Ledger运行时层,通过显式执行状态提升编码任务性能并降低成本,效果在多个模型和基准上得到验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01715 2026-08-04 cs.SE cs.AI 新提交 81%

Coding Agents as Test-Suite Auditors: Finding What Official Suites Miss While Approaching What They Catch

编码智能体作为测试套件审计器:在接近官方测试套件检测能力的同时发现官方套件遗漏的问题

Shuyang Xie, Shuxiao Xie, Feng Zhu, Yanli Ji, Wangmeng Zuo

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 该研究提出编码智能体作为测试套件审计器,结合认证链识别官方套件遗漏的缺陷提交,在接近官方套件覆盖度的同时,无官方套件时其构建的套件表现最优。

Comments 24 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01507 2026-08-04 cs.SE cs.AI cs.IR cs.MA 新提交 81%

Deep Agentic Search for Repository-Level Code Question Answering: An Empirical Study

面向仓库级代码问答的深度智能体搜索:一项实证研究

Amirkia Rafiei Oskooei, Bora Ilci, Alperen Kayim, Mehmet Egemen Uzun, Berat Can, Kaan Emre Kara, Ozan Orhan, Mehmet S. Aktas

专题命中 软件智能体 :repository(title,abstract);分类 cs.SE、cs.AI

AI总结 该研究在SWE-QA基准上对比语义搜索与深度智能体搜索的代码问答效果,发现语义搜索正确率更高、成本更低,深度智能体搜索存在交接环节的新失败问题。

Comments 41 pages, 21 figures, 6 tables. Under review at a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00947 2026-08-04 cs.SE 新提交 79%

Claim Plane: Reliability Gains and the Limits of Selective Concurrency for Parallel Coding Agents: A 30-Pair, Three-Seed Confirmatory Study of Deterministic Pre-Write Admission

声明平面:并行编码智能体选择性并发的可靠性提升与局限——确定性预写准入的30对、3种子验证性研究

Maxim Nikolaev

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 该研究提出声明平面机制,通过30对、3种子的验证性实验,发现其可提升并行编码智能体的可靠性,但静态准入会过度串行化执行,动态准入则存在范围覆盖问题,未实现有效并行加速。

Comments 10 pages, 4 figures, 6 main-text tables. Confirmatory follow-up to arXiv:2607.21909. Code: https://github.com/SkeinRank/claim-plane. Data and artifacts: https://huggingface.co/datasets/skeinrank/claim-plane-confirmatory-30x3

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00122 2026-08-04 cs.AI 新提交 79%

Shared Organizational Memory for Enterprise Coding Agents: System Design and Deployment Snapshot

企业编码智能体的共享组织记忆:系统设计与部署快照

Harsh Rao Dhanyamraju, Leonidas Raghav

机构 * SAP SE(思爱普公司)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 本文设计部署共享组织记忆系统,将经验捕获融入企业编码工作流,收集并整理任务相关经验,管控风险并供智能体检索,目前其效果仍在评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00101 2026-08-04 cs.AI cs.LG 新提交 62%

Agentic Coding in the Wild: Characterizing GitHub Copilot Traces at Production Scale

野外环境下的智能体编码:生产规模下GitHub Copilot轨迹的特征分析

Banruo Liu, Haoran Qiu, Íñigo Goiri, Rodrigo Fonseca, Ricardo Bianchini, Esha Choukse

机构 * Microsoft Azure Research(微软Azure研究院) Microsoft Azure(微软Azure)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究对GitHub Copilot等AI编码智能体的生产规模轨迹进行特征分析,揭示其工作负载特性,设计轻量级空闲预测器,为智能体原生LLM服务基础设施提供实证基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01938 2026-08-04 cs.CR 新提交 50%

D-MUTRA: DLT-based MUTual Remote Attestation for Multi-Agent Systems

D-MUTRA:面向多智能体系统的基于分布式账本(DLT)的相互远程证明

Adam Zahir, Vincent Lefebvre, Mark Angoustures, Milan Groshev, Carlos J. Bernardos

专题命中 软件智能体 :software agent(abstract)

AI总结 针对多智能体系统传统远程证明的局限,本文提出基于区块链的D-MUTRA框架,实现智能体间的持续相互证明,可检测恶意软件修改,且扩展时开销可忽略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01315 2026-08-04 cs.IR 新提交 50%

Collaborative Memory Augmentation for Generative Recommendation

用于生成式推荐的协同记忆增强

Enze Liu, Zhen Tian, Wayne Xin Zhao

专题命中 软件智能体 :repository(abstract)

AI总结 针对现有生成式推荐模型未利用跨用户协同信号的问题,提出OMEGA框架,通过潜在上下文压缩、协同记忆库与目标感知检索等机制,在多数据集上显著优于现有先进模型。

Comments Accepted by KDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试生成 1 篇

2608.02310 2026-08-04 cs.CL 新提交 57%

An Evidence-Grounded Retrieval-Augmented Transformer Framework for Health Misinformation Verification

用于健康虚假信息验证的基于证据的检索增强Transformer框架

Isah M. Bukar, Bala Mairiga Abduljalil, Bashir Saleh Maina, Abdulbasit Hassan

机构 * Yobe State University(约贝州立大学) Yobe AI Research Laboratory (YAIR Lab)(约贝人工智能研究实验室) Novosibirsk State University(新西伯利亚国立大学) College of Computer Science and Engineering, Hamad Bin Khalifa University(哈马德·本·哈利法大学计算机科学与工程学院)

专题命中 测试生成 :repository(abstract);分类 cs.CL

AI总结 本研究针对发展中国家健康虚假信息验证的本地语境缺失问题,提出基于WHO和尼日利亚疾控中心证据的检索增强Transformer框架,经实验评估BERT模型表现最佳,为资源受限地区开发相关系统提供基础。

Comments 17 pages, 2 figures, To appear in the Reimagining knowledge systems for digital transformation and sustainable development in the 21st century conference 2026, faculty of social sciences education. Federal University of Education, Zaria

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 9 篇

2608.00267 2026-08-04 cs.SE cs.CL 新提交 81%

LoopsBench: From Harness Engineering to Loop Engineering in Coding Agent Evaluation

LoopsBench:在基准测试编码智能体中从 harness 工程转向 loop 工程

Han Li, Zhemin Fang, Rili Feng, Yingqi Zhao, Jiaheng Liu, Pengfei Gao, He Ye, Dayi Lin, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

专题命中 代码评测 :coding agent(title,abstract);分类 cs.SE、cs.CL

AI总结 该研究针对编码智能体基准测试中持续执行洞察不足的问题,推出长周期基准 LoopsBench,含112个多领域任务,评估得最强配置解决25%任务,开源相关数据代码。

Comments Project page: https://loopsbench.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02407 2026-08-04 cs.CR cs.AI 新提交 57%

Antares: Foundation Models for Agentic Vulnerability Localization

Antares:用于智能体漏洞定位的基础模型

Supriti Vijay, Aman Priyanshu, Didier Chapoteau, Arthur Goldblatt, Jianliang He, Kimia Majd, Fraser Burch, Baturay Saglam, Takahiro Matsumoto, Zhuoran Yang, Amin Karbasi

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 该研究提出基于IBM Granite的Antares系列紧凑语言模型,经两阶段训练用于智能体漏洞定位,其30亿参数版本性能接近GPT-5.5且远超更大模型,推理高效低成本。

Comments 57 pages, 12 figures, technical report for antares

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01149 2026-08-04 cs.AI 新提交 57%

PATH-Bench: Path-Dependent Evaluation of Lifelong Agents

PATH-Bench:面向终身智能体的路径依赖评估基准

Xidong Yang, Xingyi Zhang, Wenhao Li, Wenyan Liu, Junjie Sheng, Yun Hua, Wei Yin, Tao Fang, Chuyun Shen, Xiangfeng Wang

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 本研究构建了面向终身智能体路径依赖评估的基准PATH-Bench,评估8个智能体后提出SEU机制,该机制可减少遗忘、提升正向迁移,为设计更优终身智能体提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00915 2026-08-04 cs.LG 新提交 57%

UpliftBench: Revealing Outcome-Regime and Objective Mismatch in Uplift Evaluation

UpliftBench:揭示uplift评估中的结果 regime 与目标不匹配问题

Binshuang Li

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 UpliftBench评估12种uplift估计器,发现基准分歧源于指标而非模型,揭示Qini等指标与效应准确性一致性不足等问题,发布可复现基准工具。

Comments 25 pages, 9 figures. Code, data, and results: https://github.com/binshuangli/uplift-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00711 2026-08-04 cs.AI 新提交 57%

Tracing the Cascade: A Topology-Aware Evaluation Framework for Scientific Agent Hallucinations

追踪级联:一种面向科学智能体幻觉的拓扑感知评估框架

Xinshun Feng, Ziqi Miao, Lijun Li, Jing Shao

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 该研究针对科学智能体幻觉的拓扑结构评估缺口,提出SCHEMA框架,通过构建科学概念图等方式评估,发现幻觉集中于知识枢纽、最终准确率与推理轨迹诚实性脱钩,为高风险科学应用提供机制级评估方案。

Comments 36 pages, 7 figures and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00640 2026-08-04 cs.CL 新提交 57%

TreeProbe : A Tibetan Medicine Benchmark for Cultural Bias in LLMs

TreeProbe:面向大型语言模型文化偏见的藏医药基准测试集

Jin Zhang, Linyu Li, Weili Jiang, Yuqing Cai, Yutong Liu, Guanquecairang, Yongbin Yu, Jingye Cai, Nyima Tashi, Gadeng Luosang

机构 * University of Electronic Science and Technology of China(电子科技大学) Tibet University(西藏大学) Peking University(北京大学) Southwest Jiaotong University(西南交通大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 本研究针对大型语言模型的藏医药文化偏见问题,构建了首个基于藏医药“医学之树”框架的基准测试集TreeProbe,发现现有模型存在系统性本体漂移,为公平医疗AI开发提供了诊断基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00227 2026-08-04 cs.SE 新提交 57%

Source Code Authorship Attribution Does Not Generalize from Competitions to Classrooms

源代码作者身份归属无法从竞赛场景泛化到课堂场景

Serhii Yemets, Marek Horváth

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 本研究发现,针对Google Code Jam竞赛数据微调的CodeBERT等模型,在课程作业数据集上的作者身份归属性能远低于随机基线,竞赛场景的基准无法泛化到教育场景,需针对性验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01077 2026-08-04 cs.RO 新提交 50%

VespaSeg: A Resource-Aware Ground-then-Segment Pipeline for Referring Expression Segmentation

VespaSeg:一种用于指代表达分割的资源感知“先定位后分割”流水线

Savindu Dilshan Wickramasinghe

机构 * University of Moratuwa(莫拉图瓦大学)

专题命中 代码评测 :repository(abstract)

AI总结 本文针对指代表达分割中整体式模型部署成本高的问题,提出模块化流水线VespaSeg,采用轻量型视觉-语言模型定位与MobileSAM分割,经适配后在RefCOCO数据集上实现高精度,且内存占用低、推理速度快。

Comments 5 pages, 3 figures. Code and result artifacts: https://github.com/Savidilsh/VespaSeg

详情

展开后加载摘要…

URL PDF HTML 收藏