arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-04-29 至 2026-04-29 共收录 14 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 5 篇

2604.25903 2026-04-29 cs.SE cs.LG 62%

Carbon-Taxed Transformers: A Green Compression Pipeline for Overgrown Language Models

碳税变压器:用于过度语言模型的绿色压缩流程

Ajmain Inqiad Alam, Palash Roy, Chanchal K. Roy, Banani Roy, Kevin A. Schneider

机构 * University of Saskatchewan(萨斯喀彻温大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.LG

AI总结 本文提出碳税变压器,通过经济碳税原理设计压缩流程,提升软件工程中大语言模型的效率与环保性能,实现内存、时间及碳排放的显著降低,同时保持高精度。

Journal ref Proceedings of ACM Software Engineering 3, FSE, Article FSE047, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21598 2026-04-29 cs.SE cs.AI 62%

You Don't Need Public Tests to Generate Correct Code

你不需要公共测试来生成正确代码

Kaushitha Silva, Srinath Perera

机构 * WSO2(WSO2公司)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出DryRUN框架,通过让大语言模型自主生成测试输入并模拟执行,避免依赖公共测试用例,从而减少过自信偏差并提升代码生成效率。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14174 2026-04-29 cs.CL cs.LG 62%

Cheaper, Better, Faster, Stronger: Robust Text-to-SQL without Chain-of-Thought or Fine-Tuning

更便宜、更好、更快、更强:无需链式思维或微调的鲁棒性文本到SQL

Yusuf Denizay Dönder, Derek Hommel, Andrea W Wen-Yi, David Mimno, Unso Eun Seo Jo

机构 * Gena Co.(Gena公司) Cornell University(康奈尔大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 本文提出N-rep一致性方法,通过多重表示缓解单一表示的弱点,以更低成本实现与更昂贵方法相似的BIRD基准表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25521 2026-04-29 cs.AI 57%

Automated Adversarial Collaboration for Advancing Theory Building in the Cognitive Sciences

自动化对抗协作促进认知科学理论构建

Suyog Chandramouli, George Kachergis, Akshay Jagadish

机构 * Department of Psychology, Princeton University(普林斯顿大学心理学系) Department of Psychology, Stanford University(斯坦福大学心理学系) Princeton AI Lab, Princeton University(普林斯顿大学人工智能实验室)

专题命中 代码生成 :program synthesis(abstract);分类 cs.AI

AI总结 本文提出自动化对抗协作框架,通过闭环模拟验证认知科学理论 adjudication,展示了在噪声环境下恢复真实理论的可行性。

Comments 2 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25419 2026-04-29 cs.AI 57%

JURY-RL: Votes Propose, Proofs Dispose for Label-Free RLVR

JURY-RL: 选票提议,证明判定用于无标签的RLVR

Xinjie Chen, Biao Fu, Jing Wu, Guoxin Chen, Xinggao Liu, Dayiheng Liu, Minpeng Liao

机构 * Zhejiang University, Hangzhou, China(浙江大学,杭州,中国) Tongyi Lab, Alibaba Group, Hangzhou, China(通义实验室,阿里巴巴集团,杭州,中国)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 JURY-RL提出一种无标签RLVR框架,通过模型回放提议候选答案,形式验证器判定是否可获正奖,从而稳定训练并提升数学推理性能。

Comments Preprint. 32 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 1 篇

2604.25804 2026-04-29 cs.SE 57%

Key Developer Roles and Organizational Coupling in Microservices: A Longitudinal Analysis

微服务中的关键开发者角色与组织耦合:纵向分析

Xiaozhou Li, Nariman Mani, Jose Sosa Rodriguez, Tomas Cerny

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 本文研究微服务系统中开发者角色对组织耦合的影响,通过GitHub数据纵向分析,发现连接者角色对耦合影响最大,多重角色协同进一步加剧耦合效应。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 代码评测 6 篇

2601.22597 2026-04-29 cs.SE cs.CL 76%

TimeMachine-bench: A Benchmark for Evaluating Model Capabilities in Repository-Level Migration Tasks

TimeMachine-bench:一个评估仓库级迁移任务模型能力的基准

Ryo Fujii, Makoto Morishita, Kazuki Yano, Jun Suzuki

机构 * Tohoku University(东大理工大学) Future Corporation(未来公司) RIKEN(日本理化学研究所) NII LLMC(国家信息研究所LLMC)

专题命中 代码评测 :repository(title);分类 cs.SE、cs.CL

AI总结 本文提出TimeMachine-bench基准,用于评估软件迁移任务中的模型能力,通过自动化构建GitHub仓库测试失败数据集,评估基于11种模型的基线方法,发现LLM在迁移任务中仍存在可靠性挑战。

Comments Accepted to EACL 2026 Main, camera-ready

Journal ref Proceedings of the 19th Conference of the European Chapter of the Association for Computational Linguistics (Volume 1: Long Papers), pages 8233-8264, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25778 2026-04-29 cs.SE cs.AI cs.IR 62%

Can Code Evaluation Metrics Detect Code Plagiarism?

代码评估指标能否检测代码抄袭?

Fahad Ebrahim, Mike Joy

机构 * University of Warwick(沃里克大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文通过两个公开标注数据集比较评估五种代码评估指标在不同修改层级下的抄袭检测性能,发现CrystalBLEU等指标在部分层级表现优异,但整体上Dolos仍表现最佳。

Comments 10 pages, 5 figures, accepted at LEARNER 2026 workshop (associated with EASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25737 2026-04-29 cs.SE cs.AI 62%

SAFEdit: Does Multi-Agent Decomposition Resolve the Reliability Challenges of Instructed Code Editing?

SAFEdit:多智能体分解能否解决受指导代码编辑的可靠性挑战?

Noam Tarshish, Nofar Selouk, Daniel Hodisan, Bar Ezra Gafniel, Yuval Elovici, Asaf Shabtai, Eliya Nachmani

机构 * Ben-Gurion University of the Negev(巴伊兰大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 SAFEdit通过多智能体框架分解编辑过程,提升代码编辑的可靠性与准确性,其迭代改进机制显著提高了任务成功率。

Comments Accepted to the EQUISA (Evaluation of Qualitative Aspects of Intelligent Software Assistants) workshop at EASE (Evaluation and Assessment in Software Engineering) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04978 2026-04-29 cs.SE cs.AI cs.CR 62%

Measuring the Permission Gate: A Stress-Test Evaluation of Claude Code's Auto Mode

衡量许可之门:对Claude Code自动模式的压测评估

Zimo Ji, Zongjie Li, Wenyuan Jiang, Yudong Gao, Shuai Wang

机构 * Hong Kong University of Science and Technology(香港科技大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文通过AmPermBench评估Claude Code自动模式在模糊授权场景下的表现,发现其误判率显著高于生产环境,揭示了系统在处理模糊任务时的覆盖边界问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25399 2026-04-29 cs.SE 57%

CoRE: A Fine-Grained Code Reasoning Benchmark Beyond Output Prediction

CoRE:超越输出预测的细粒度代码推理基准

Jun Gao, Yun Peng, Qian Qiao, Changhai Zhou, Yuhua Zhou, Shiyang Zhang, Shichao Weng, Zhenchang Xing, Xiaoxue Ren

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 CoRE基准通过实现不变性和过程透明性评估代码推理,揭示大语言模型在等价实现间存在显著鲁棒性差距,并发现模型可能通过表面执行达到正确输出,表明仅评估输出不足以衡量代码推理能力。

Comments ACL'26 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25109 2026-04-29 cs.CR cs.AI 57%

Structured Security Auditing and Robustness Enhancement for Untrusted Agent Skills

结构化安全审计与不信任代理技能的鲁棒性增强

Lijia Lv, Xuehai Tang, Jie Wen, Jizhong Han, Songlin Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出SkillGuard-Robust,通过角色感知证据提取、选择性语义验证和一致性保持裁决,解决代理技能预加载审计中语义保持重写下恶意意图识别不一致的问题,实验结果显示其在不同数据集上的高准确率和召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仓库级理解 2 篇

2604.25015 2026-04-29 cs.ET cs.CR cs.DC 78%

A Tree-Based Repository Blockchain Framework for Shared Governance in Collaborative Fork Ecosystems

基于树结构的仓库区块链框架用于协作分叉生态系统中的共享治理

Razwan Ahmed Tanvir, Greg Speegle

专题命中 仓库级理解 :repository(title,abstract)

AI总结 本文提出一种基于树结构的仓库区块链框架,用于管理协作生态系统中的硬分叉,通过单一过程访问所有区块,替代了跨链通信。

Comments 15 pages, 4 figures, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25296 2026-04-29 cs.CL 57%

Learning from Medical Entity Trees: An Entity-Centric Medical Data Engineering Framework for MLLMs

从医学实体树学习:一种以实体为中心的医疗数据工程框架用于多模态大语言模型

Jianghang Lin, Haihua Yang, Deli Yu, Kai Wu, Kai Ye, Jinghao Lin, Zihan Wang, Yuhang Wu, Liujuan Cao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, China(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学,中国) ByteDance(字节跳动) Northeastern University(东北大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL

AI总结 本文提出以实体为中心的医疗数据工程框架,通过构建医学实体树,提升多模态大语言模型在医疗领域的表现,通过实体引导检索、双重过滤和知识感知数据合成等方法,增强模型处理复杂临床问题的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏