arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1722 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1722 篇

2506.06541 2026-03-09 cs.DB cs.AI cs.MA 57%

KramaBench: A Benchmark for AI Systems on Data-to-Insight Pipelines over Data Lakes

KramaBench:一个用于数据湖上数据到洞察流程的AI系统基准测试

Eugenie Lai, Gerardo Vitagliano, Ziyu Zhang, Om Chabra, Sivaprasad Sudhir, Anna Zeng, Anton A. Zabreyko, Chenning Li, Ferdi Kossmann, Jialin Ding, Jun Chen, Markos Markakis, Matthew Russo, Weiyang Wang, Ziniu Wu, Michael J. Cafarella, Lei Cao, Samuel Madden, Tim Kraska

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Independent(独立研究者) University of Arizona(亚利桑那大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 KramaBench是一个用于评估AI系统在数据湖到洞察流程中端到端能力的基准测试,包含104个挑战,测试AI在自动化编排数据任务方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04304 2026-03-05 cs.CL 57%

$V_1$: Unifying Generation and Self-Verification for Parallel Reasoners

$V_1$: 为并行推理器统一生成与自我验证

Harman Singh, Xiuyu Li, Kusha Sareen, Monishwaran Maheswaran, Sijun Tan, Xiaoxia Wu, Junxiong Wang, Alpay Ariyak, Qingyang Wu, Samir Khaki, Rishabh Tiwari, Long Lian, Yucheng Lu, Boyi Li, Alane Suhr, Ben Athiwaratkun, Kurt Keutzer

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 $V_1$通过高效成对排名统一生成与自我验证,提升代码生成和数学推理任务的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03233 2026-03-04 cs.AI 57%

AI-for-Science Low-code Platform with Bayesian Adversarial Multi-Agent Framework

面向科学的AI低代码平台与贝叶斯对抗多智能体框架

Zihang Zeng, Jiaquan Zhang, Pengze Li, Yuan Qi, Xi Chen

机构 * Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院) Shanghai Innovation Institute(上海创新研究院) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 本研究提出一种面向科学的AI低代码平台,通过贝叶斯对抗多智能体框架实现代码生成与评估的协同优化,提升科学任务的可靠性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02176 2026-03-03 cs.CL 57%

Organizing, Orchestrating, and Benchmarking Agent Skills at Ecosystem Scale

在生态系统层面组织、协调和基准测试代理技能

Hao Li, Chunjiang Mu, Jianhao Chen, Siyue Ren, Zhiyao Cui, Yiqun Zhang, Lei Bai, Shuyue Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 本文提出AgentSkillOS框架,通过树状检索和DAG协调提升大规模技能生态系统的管理和任务解决能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01051 2026-03-03 hep-ex cs.SE 57%

CelloAI Benchmarks: Toward Repeatable Evaluation of AI Assistants

CelloAI Benchmarks: 向AI助手评估的可重复性迈进

Mohammad Atif, Kriti Chopra, Fang-Ying Tsai, Ozgur O. Kilic, Tianle Wang, Zhihua Dong, Douglas Benjamin, Charles Leggett, Meifeng Lin, Paolo Calafiura, Salman Habib

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 CelloAI Benchmarks提出了一套针对高能物理和高性能计算领域AI助手的可重复性评估基准,涵盖代码文档、代码生成和图形数据分析三个评估赛道,旨在提升科学编码辅助的可靠性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15018 2026-03-03 cs.CV cs.AI cs.RO 57%

UrbanVerse: Scaling Urban Simulation by Watching City-Tour Videos

UrbanVerse: 通过观看城市游览视频扩大城市模拟

Mingxuan Liu, Honglin He, Elisa Ricci, Wayne Wu, Bolei Zhou

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 UrbanVerse 通过将众包城市游览视频转化为物理-aware 的模拟场景,实现了城市模拟的扩展,提升了城市导航中代理的泛化能力和现实任务完成效率。

Comments Accepted to ICLR 2026. Project page: https://urbanverseproject.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01350 2026-02-26 cs.AI 57%

Error Notebook-Guided, Training-Free Part Retrieval in 3D CAD Assemblies via Vision-Language Models

通过视觉-语言模型实现无训练的3DCAD装配体部件检索:基于错误笔记本的引导

Yunqing Liu, Nan Zhang, Zhiming Tan

机构 * Fujitsu Research & Development Center Shanghai, China(富士通研发中心上海)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本研究提出一种无训练的3D CAD部件检索方法,通过结合错误笔记本与RAG技术,显著提升基于VLM的推理性能,实验显示在专有模型和开源模型上均取得显著效果。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12434 2026-02-25 cs.AI 57%

A Survey on the Optimization of Large Language Model-based Agents

基于大语言模型代理的优化综述

Shangheng Du, Jiabao Zhao, Jinxin Shi, Zhentao Xie, Xin Jiang, Yanhong Bai, Liang He

机构 * Shanghai Institute of Artificial Intelligence for Education, East China Normal University(上海人工智能教育研究院,东华大学) School of Computer Science and Technology, East China Normal University(计算机科学与技术学院,东华大学) School of Computer Science and Technology, Donghua University(计算机科学与技术学院,东华大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文综述了基于大语言模型的代理优化方法,分类讨论参数驱动与参数无关策略,分析关键技术和挑战,提出未来研究方向。

Comments Published in ACM Computing Surveys, Vol. 58, No. 9, Article 223, July 2026

Journal ref ACM Computing Surveys 58(9), Article 223, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20513 2026-02-25 cs.CL 57%

From Performance to Purpose: A Sociotechnical Taxonomy for Evaluating Large Language Model Utility

从性能到目的:一种用于评估大语言模型效用的社技术分类

Gavin Levinson, Keith Feldman

机构 * University of Michigan(密歇根大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 本文提出LUX框架,用于评估大语言模型在不同应用场景中的效用,涵盖性能、交互、运营和治理四个领域,并提供动态工具支持框架探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25609 2026-02-25 cs.AI cs.CY 57%

A Framework for Studying AI Agent Behavior: Evidence from Consumer Choice Experiments

研究AI代理行为的框架:来自消费者选择实验的证据

Manuel Cherep, Chengtian Ma, Abigail Xu, Maya Shaked, Pattie Maes, Nikhil Singh

机构 * MIT(麻省理工学院) Tsinghua University(清华大学) Dartmouth College(达特茅斯学院)

专题命中 代码评测 :software agent(abstract);分类 cs.AI

AI总结 本文提出ABxLab框架,通过控制选项属性和说服性提示,研究AI代理在现实决策中的选择行为,揭示代理在无认知限制下仍存在强烈偏好偏见,为AI代理行为研究提供测试平台。

Comments ICLR, 31 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01678 2026-02-24 cs.LG 57%

HeurekaBench: A Benchmarking Framework for AI Co-scientist

HeurekaBench: 一个用于AI合作者的基准评估框架

Siba Smarak Panigrahi, Jovana Videnović, Maria Brbić

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL))

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 HeurekaBench通过创建基于真实科学流程的基准,为评估AI合作者提供了一种方法,通过半自动流程生成探索性问题,并展示了批评模块对提升代理性能的效果。

Comments 33 pages, 5 figures, 7 tables. Code available at https://github.com/mlbio-epfl/HeurekaBench. Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18095 2026-02-23 cs.AI 57%

Neurosymbolic Language Reasoning as Satisfiability Modulo Theory

神经符号语言推理作为可满足性模理论

Hyunseok Oh, Sam Stern, Youngki Lee, Matthai Philipose

机构 * Seoul National University(首尔国立大学) U. Mass. Amherst(马萨诸塞大学阿姆赫斯特分校) Microsoft(微软公司)

专题命中 代码评测 :program synthesis(abstract);分类 cs.AI

AI总结 Logitext通过结合LLM和SMT求解,实现自然语言与逻辑推理的联合处理,提升内容审核和法律任务的准确性和覆盖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17640 2026-02-20 cs.LG eess.SP 57%

A Network Science Approach to Granular Time Series Segmentation

一种基于网络科学的粒度时间序列分割方法

Ivana Kesić, Carolina Fortuna, Mihael Mohorčič, Blaž Bertalanič

机构 * Jožef Stefan Institute(乔塞夫·斯塔芬研究所)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文提出一种基于网络科学的粒度时间序列分割方法,通过将时间序列转换为图并结合图注意力网络,提升分割精度,达到0.97的平均F1分数,并在多个基准数据集上优于基线方法。

Comments 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19666 2026-02-17 cs.CL 57%

RoD-TAL: A Benchmark for Answering Questions in Romanian Driving License Exams

RoD-TAL:罗马尼亚驾照考试问答的基准测试

Andrei Vlad Man, Răzvan-Alexandru Smădu, Cristian-George Craciun, Dumitru-Clementin Cercel, Florin Pop, Mihaela-Claudia Cercel

机构 * National University of Science and Technology POLITEHNICA Bucharest, Faculty of Automatic Control and Computers(波兰技术大学布加勒斯特分校) Technical University of Munich(慕尼黑技术大学) National Institute for Research & Development in Informatics - ICI Bucharest(信息研究所-布加勒斯特) Paris 1 Panthéon-Sorbonne University(巴黎1大学) University of Bucharest(布加勒斯特大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 RoD-TAL是一个用于评估大型语言模型和视觉语言模型在罗马尼亚驾照法律问答中性能的多模态基准数据集,通过文本和图像问答任务验证了领域微调和推理优化对考试通过率的影响。

Comments 41 pages, 30 figures, Accepted by the Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13671 2026-02-17 cs.MA cs.AI 57%

MAS-on-the-Fly: Dynamic Adaptation of LLM-based Multi-Agent Systems at Test Time

MAS-on-the-Fly: 在测试时动态适应基于大语言模型的多智能体系统

Guangyi Liu, Haojun Lin, Huan Zeng, Heng Wang, Quanming Yao

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Ant Group(蚂蚁集团)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 MASFly通过动态适应机制在测试时优化多智能体系统,利用检索增强和经验引导机制提升任务适应性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10246 2026-02-16 cs.DC cs.AI 57%

KORAL: Knowledge Graph Guided LLM Reasoning for SSD Operational Analysis

KORAL: 基于知识图谱的LLM推理用于SSD运维分析

Mayur Akewar, Sandeep Madireddy, Dongsheng Luo, Janki Bhimani

机构 * Florida International University, Miami, FL, USA(佛罗里达国际大学) Argonne National Laboratory, Lemont, IL, USA(阿贡国家实验室)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 KORAL结合LLM和知识图谱,实现SSD的端到端推理分析,提供专家级诊断和可解释的运维建议。

Journal ref Proc. IEEE International Parallel and Distributed Processing Symposium (IPDPS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09540 2026-02-11 cs.SE 57%

SWE-Bench Mobile: Can Large Language Model Agents Develop Industry-Level Mobile Applications?

SWE-Bench Mobile: 大语言模型代理能否开发行业级移动应用?

Muxin Tian, Zhe Wang, Blair Yang, Zhenwei Tang, Kunlun Zhu, Honghua Dong, Hanchen Li, Xinni Xie, Guangjing Wang, Jiaxuan You

专题命中 代码评测 :coding agent(abstract);分类 cs.SE

AI总结 SWE-Bench Mobile评估大语言模型代理在开发行业级移动应用中的能力,发现商业代理表现优于开源替代品,且简单提示策略更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15935 2026-02-11 cs.DB cs.CL cs.CR 57%

MAPS: A Multilingual Benchmark for Agent Performance and Security

MAPS: 一种多语言评估基准,用于代理性能和安全

Omer Hofman, Jonathan Brokman, Oren Rachmil, Shamik Bose, Vikas Pahuja, Toshiya Shimizu, Trisha Starostina, Kelly Marchisio, Seraphina Goldfarb-Tarrant, Roman Vainshtein

机构 * Fujitsu Research of Europe(富士通欧洲研究部) Fujitsu Limited(富士通有限公司) Cohere

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 MAPS是一个多语言评估基准,用于评估代理AI在不同语言和任务中的性能与安全性。

Comments Accepted to EACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02076 2026-02-11 cs.AI cs.MA 57%

Leveraging LLM Agents and Digital Twins for Fault Handling in Process Plants

利用大语言模型代理和数字孪生进行过程厂故障处理

Milapji Singh Gill, Javal Vyas, Artan Markaj, Felix Gehlhoff, Mehmet Mercangöz

机构 * Institute of Automation Technology Helmut Schmidt University Hamburg(海因里希·施密特大学汉堡自动化技术研究所) Autonomous Industrial Systems Lab, Imperial College London(伦敦帝国理工学院自主工业系统实验室)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型代理和数字孪生技术,实现过程厂故障的自动处理与纠正,通过模拟验证有效缓解管道堵塞问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07933 2026-02-10 cs.LG 57%

Attention-Based Deep Learning for Early Parkinson's Disease Detection with Tabular Biomedical Data

基于注意力机制的深度学习在早期帕金森病检测中的应用:使用表格化生物医学数据

Olamide Samuel Oseni, Ibraheem Omotolani Obanla, Toheeb Aduramomi Jimoh

机构 * African Institute for Mathematical Sciences, Kigali, Rwanda(非洲数学科学研究所,基加利,刚果(金)) Department of Data and Information Science, University of Ibadan, Oyo State, Nigeria(数据与信息科学系,伊巴丹大学,奥约州,尼日利亚) Department of Computer Science and Information Systems, University of Limerick, Castletroy, V94 T9PX, Limerick, Ireland(计算机科学与信息系统系,利默里克大学,卡斯利特罗伊,爱尔兰)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文提出基于注意力机制的深度学习模型,用于早期帕金森病检测,通过表格化生物医学数据实现高精度分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18715 2026-02-10 cs.AI 57%

HuggingR$^{4}$: A Progressive Reasoning Framework for Discovering Optimal Model Companions

HuggingR$^{4}$: 一种用于发现最优模型伙伴的渐进推理框架

Shaoyin Ma, Chenggong Hu, Huiqiong Wang, Li Sun, Mingli Song, Jie Song

机构 * Zhejiang University, Hangzhou, China(浙江大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 HuggingR$^4$通过渐进推理框架提升模型选择效率,实现更高的可行性与合理性,同时降低token消耗。

Comments 21 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06751 2026-02-09 cs.CR cs.SE 57%

Beyond Function-Level Analysis: Context-Aware Reasoning for Inter-Procedural Vulnerability Detection

超越函数级分析:面向跨过程的漏洞检测上下文感知推理

Yikun Li, Ting Zhang, Jieke Shi, Chengran Yang, Junda He, Xin Zhou, Jinfeng Jiang, Huihui Huang, Wen Bin Leow, Yide Yin, Eng Lieh Ouh, Lwin Khin Shar, David Lo

专题命中 代码评测 :code model(abstract);分类 cs.SE

AI总结 CPRVul通过结合上下文剖析与结构化推理,提升跨过程漏洞检测的准确性,其在多个数据集上均优于传统函数级方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21551 2026-02-04 cs.LG 57%

Grokking in LLM Pretraining? Monitor Memorization-to-Generalization without Test

在LLM预训练中“Grokking”?无需测试即可监控记忆到泛化的过程

Ziyue Li, Chenrui Fan, Tianyi Zhou

机构 * Department of Computer Science, University of Maryland, College Park(计算机科学系,马里兰大学,学院公园)

专题命中 代码评测 :code generation(abstract);分类 cs.LG

AI总结 本文研究了LLM预训练中“Grokking”现象,通过分析训练数据路径的动态变化,提出两种新度量标准以监控模型泛化能力,无需额外成本。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02345 2026-02-03 cs.SE 57%

A Task-Level Evaluation of AI Agents in Open-Source Projects

对开源项目中AI代理的任务级评估

Shojibur Rahman, Md Fazle Rabbi, Minhaz Zibran

专题命中 代码评测 :coding agent(abstract);分类 cs.SE

AI总结 本文评估了五个AI代理在开源项目中的表现,发现Codex在PR接受率上表现优异,而Copilot在审查讨论量上领先,但提交质量因任务类型而异。

Comments 5 pages, accepted at MSR Mining Challenge 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01714 2026-02-03 cs.CL 57%

MedAraBench: Large-Scale Arabic Medical Question Answering Dataset and Benchmark

MedAraBench:大规模阿拉伯语医学问答数据集和基准测试

Mouath Abu-Daoud, Leen Kharouf, Omar El Hajj, Dana El Samad, Mariam Al-Omari, Jihad Mallat, Khaled Saleh, Nizar Habash, Farah E. Shamout

机构 * Engineering Division, New York University Abu Dhabi(纽约大学阿布扎克分校工程系) Cleveland Clinic Abu Dhabi(阿布扎克克利夫兰诊所) Science Division, New York University Abu Dhabi(纽约大学阿布扎克分校科学系)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 MedAraBench是一个大规模阿拉伯语医学问答数据集,旨在通过提供多样化的医学领域数据来提升大型语言模型的多语言能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19110 2026-02-03 cs.CL 57%

APE-Bench: Evaluating Automated Proof Engineering for Formal Math Libraries

APE-Bench: 评估形式数学库中的自动化证明工程

Huajian Xin, Luming Li, Xiaoran Jin, Jacques Fleuriot, Wenda Li

机构 * University of Edinburgh(爱丁堡大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 APE-Bench提出了一种系统性评估仓库级证明工程的框架,通过双验证机制评估语法编译和语义要求满足,并提供开源工具进行标准化评估和公平比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13620 2026-02-03 cs.SE 57%

Programming Language Confusion: When Code LLMs Can't Keep their Languages Straight

编程语言混淆:当代码LLM无法保持语言一致

Micheline Bénédicte Moumoula, Serge Lionel Nikiema, Abdoul Kader Kabore, Jacques Klein, Tegawendé F. Bissyande

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 研究揭示代码LLM在编程语言混淆问题上的系统性错误,提出通过显式语言关键词缓解,并倡导标准化评估以提升多语言代码生成系统的可靠性。

Comments Accepted for publication at SANER 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01170 2026-02-03 cs.CL 57%

EmoAra: Emotion-Preserving English Speech Transcription and Cross-Lingual Translation with Arabic Text-to-Speech

EmoAra: 一种保留情感的英语语音转录与跨语言翻译系统,结合阿拉伯语文本到语音

Besher Hassan, Ibrahim Alsarraj, Musaab Hasan, Yousef Melhim, Shahem Fadi, Shahem Sultan

机构 * MBZUAI(穆罕默德·本·拉希德智能技术研究所)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 EmoAra通过整合语音情感识别、自动语音识别、机器翻译和文本到语音技术,实现英语语音转录与阿拉伯语音输出的跨语言翻译,保留情感细微差别。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00757 2026-02-03 cs.SE 57%

ScratchEval : A Multimodal Evaluation Framework for LLMs in Block-Based Programming

ScratchEval:一种用于块式编程中LLM的多模态评估框架

Yuan Si, Simeng Han, Daming Li, Hanyuan Shi, Jialu Zhang

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 ScratchEval是首个用于评估LLM在Scratch块式编程中修复能力的可执行基准,通过多层协议测量功能正确性、修复质量和解释质量,支持领域微调和泛化研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22132 2026-01-30 cs.LG 57%

Pay for Hints, Not Answers: LLM Shepherding for Cost-Efficient Inference

为提示付费,而非答案:用于高效推断的LLM牧师

Ziming Dong, Hardik Sharma, Evan O'Toole, Jaya Prakash Champati, Kui Wu

机构 * Department of Computer Science, University of Victoria, Victoria, Canada(维多利亚大学计算机科学系) Department Of Information Technology, Manipal University, Manipal, India(马那尔大学信息科技系)

专题命中 代码评测 :code generation(abstract);分类 cs.LG

AI总结 LLM牧师通过请求LLM的短提示来提高SLM的准确性,显著降低推断成本,同时保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏