arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-03-09 至 2026-03-09 共收录 5 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 5 篇

2603.06358 2026-03-09 cs.SE 79%

A Scalable Benchmark for Repository-Oriented Long-Horizon Conversational Context Management

面向仓库的长 horizon 对话上下文管理可扩展基准

Yang Liu, Li Zhang, Fang Liu, Ping Lin, Xinyi Li

专题命中 代码评测 :repository(title,abstract);分类 cs.SE

AI总结 本文提出LoCoEval,首个面向仓库开发场景的长 horizon 对话上下文管理基准,评估了多种方法并提出改进方案,提升了代码助手在复杂对话中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01646 2026-03-09 cs.CL cs.AI cs.LG 67%

ESGenius: Benchmarking LLMs on Environmental, Social, and Governance (ESG) and Sustainability Knowledge

ESGenius:对环境、社会和治理(ESG)及可持续性知识的LLM基准测试

Chaoyue He, Xin Zhou, Yi Wu, Xinjia Yu, Yan Zhang, Lei Zhang, Di Wang, Shengfei Lyu, Hong Xu, Xiaoqiao Wang, Wei Liu, Chunyan Miao

机构 * Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里巴巴-NTU全球可持续性公司实验室) Alibaba Group(阿里巴巴集团)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ESGenius是首个针对LLM在ESG及可持续性知识评估的综合问答基准,通过RAG方法显著提升模型性能。

Comments EMNLP'25 Main Oral (42 pages, 10 figures, 11 tables), Nominations for Resource Award & Theme Paper Award

Journal ref In Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025), pages 14612-14653

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05764 2026-03-09 cs.LG cs.AI 62%

TML-Bench: Benchmark for Data Science Agents on Tabular ML Tasks

TML-Bench:用于表格机器学习任务的数据科学代理基准

Mykola Pinchuk

机构 * Independent Researcher(独立研究者)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 TML-Bench评估10个开源LLM在Kaggle竞赛中的表现,揭示不同时间预算下模型性能的差异及稳定性。

Comments 19 pages, 16 tables and figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10452 2026-03-09 cs.SE 57%

UniCoR: Modality Collaboration for Robust Cross-Language Hybrid Code Retrieval

UniCoR: 代码多模态协作以实现稳健的跨语言混合代码检索

Yang Yang, Li Kuang, Jiakun Liu, Zhongxin Liu, Yingjie Xia, David Lo

专题命中 代码评测 :code model(abstract);分类 cs.SE

AI总结 UniCoR通过多模态协作和自监督学习提升跨语言混合代码检索的语义理解和泛化能力。

Comments Accepted by the 48th IEEE/ACM International Conference on Software Engineering (ICSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06541 2026-03-09 cs.DB cs.AI cs.MA 57%

KramaBench: A Benchmark for AI Systems on Data-to-Insight Pipelines over Data Lakes

KramaBench:一个用于数据湖上数据到洞察流程的AI系统基准测试

Eugenie Lai, Gerardo Vitagliano, Ziyu Zhang, Om Chabra, Sivaprasad Sudhir, Anna Zeng, Anton A. Zabreyko, Chenning Li, Ferdi Kossmann, Jialin Ding, Jun Chen, Markos Markakis, Matthew Russo, Weiyang Wang, Ziniu Wu, Michael J. Cafarella, Lei Cao, Samuel Madden, Tim Kraska

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Independent(独立研究者) University of Arizona(亚利桑那大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 KramaBench是一个用于评估AI系统在数据湖到洞察流程中端到端能力的基准测试,包含104个挑战,测试AI在自动化编排数据任务方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏