arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-04-29 至 2026-04-29 共收录 6 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 6 篇

2601.22597 2026-04-29 cs.SE cs.CL 76%

TimeMachine-bench: A Benchmark for Evaluating Model Capabilities in Repository-Level Migration Tasks

TimeMachine-bench:一个评估仓库级迁移任务模型能力的基准

Ryo Fujii, Makoto Morishita, Kazuki Yano, Jun Suzuki

机构 * Tohoku University(东大理工大学) Future Corporation(未来公司) RIKEN(日本理化学研究所) NII LLMC(国家信息研究所LLMC)

专题命中 代码评测 :repository(title);分类 cs.SE、cs.CL

AI总结 本文提出TimeMachine-bench基准,用于评估软件迁移任务中的模型能力,通过自动化构建GitHub仓库测试失败数据集,评估基于11种模型的基线方法,发现LLM在迁移任务中仍存在可靠性挑战。

Comments Accepted to EACL 2026 Main, camera-ready

Journal ref Proceedings of the 19th Conference of the European Chapter of the Association for Computational Linguistics (Volume 1: Long Papers), pages 8233-8264, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25778 2026-04-29 cs.SE cs.AI cs.IR 62%

Can Code Evaluation Metrics Detect Code Plagiarism?

代码评估指标能否检测代码抄袭?

Fahad Ebrahim, Mike Joy

机构 * University of Warwick(沃里克大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文通过两个公开标注数据集比较评估五种代码评估指标在不同修改层级下的抄袭检测性能,发现CrystalBLEU等指标在部分层级表现优异,但整体上Dolos仍表现最佳。

Comments 10 pages, 5 figures, accepted at LEARNER 2026 workshop (associated with EASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25737 2026-04-29 cs.SE cs.AI 62%

SAFEdit: Does Multi-Agent Decomposition Resolve the Reliability Challenges of Instructed Code Editing?

SAFEdit:多智能体分解能否解决受指导代码编辑的可靠性挑战?

Noam Tarshish, Nofar Selouk, Daniel Hodisan, Bar Ezra Gafniel, Yuval Elovici, Asaf Shabtai, Eliya Nachmani

机构 * Ben-Gurion University of the Negev(巴伊兰大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 SAFEdit通过多智能体框架分解编辑过程,提升代码编辑的可靠性与准确性,其迭代改进机制显著提高了任务成功率。

Comments Accepted to the EQUISA (Evaluation of Qualitative Aspects of Intelligent Software Assistants) workshop at EASE (Evaluation and Assessment in Software Engineering) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04978 2026-04-29 cs.SE cs.AI cs.CR 62%

Measuring the Permission Gate: A Stress-Test Evaluation of Claude Code's Auto Mode

衡量许可之门:对Claude Code自动模式的压测评估

Zimo Ji, Zongjie Li, Wenyuan Jiang, Yudong Gao, Shuai Wang

机构 * Hong Kong University of Science and Technology(香港科技大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文通过AmPermBench评估Claude Code自动模式在模糊授权场景下的表现,发现其误判率显著高于生产环境,揭示了系统在处理模糊任务时的覆盖边界问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25399 2026-04-29 cs.SE 57%

CoRE: A Fine-Grained Code Reasoning Benchmark Beyond Output Prediction

CoRE:超越输出预测的细粒度代码推理基准

Jun Gao, Yun Peng, Qian Qiao, Changhai Zhou, Yuhua Zhou, Shiyang Zhang, Shichao Weng, Zhenchang Xing, Xiaoxue Ren

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 CoRE基准通过实现不变性和过程透明性评估代码推理,揭示大语言模型在等价实现间存在显著鲁棒性差距,并发现模型可能通过表面执行达到正确输出,表明仅评估输出不足以衡量代码推理能力。

Comments ACL'26 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25109 2026-04-29 cs.CR cs.AI 57%

Structured Security Auditing and Robustness Enhancement for Untrusted Agent Skills

结构化安全审计与不信任代理技能的鲁棒性增强

Lijia Lv, Xuehai Tang, Jie Wen, Jizhong Han, Songlin Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出SkillGuard-Robust,通过角色感知证据提取、选择性语义验证和一致性保持裁决,解决代理技能预加载审计中语义保持重写下恶意意图识别不一致的问题,实验结果显示其在不同数据集上的高准确率和召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏