arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1722 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1722 篇

2603.05764 2026-03-09 cs.LG cs.AI 62%

TML-Bench: Benchmark for Data Science Agents on Tabular ML Tasks

TML-Bench:用于表格机器学习任务的数据科学代理基准

Mykola Pinchuk

机构 * Independent Researcher(独立研究者)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 TML-Bench评估10个开源LLM在Kaggle竞赛中的表现,揭示不同时间预算下模型性能的差异及稳定性。

Comments 19 pages, 16 tables and figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15163 2026-03-06 cs.CL cs.AI 62%

MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers

MCP-SafetyBench:一种用于评估大型语言模型在真实MCP服务器安全性的大规模基准

Xuanjun Zong, Zhiqi Shen, Lei Wang, Yunshi Lan, Chao Yang

机构 * East China Normal University(东华师范大学) Salesforce AI Research(Salesforce人工智能研究) Singapore Management University(新加坡国立大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 MCP-SafetyBench通过真实MCP服务器评估大型语言模型的安全性,揭示了模型在面对MCP攻击时的脆弱性及安全与实用性的权衡问题。

Comments Our benchmark is available at https://github.com/xjzzzzzzzz/MCPSafety

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04212 2026-03-05 cs.SE cs.CL 62%

Code Fingerprints: Disentangled Attribution of LLM-Generated Code

代码指纹:解耦的LLM生成代码归因

Jiaxun Guo, Ziyuan Yang, Mengyu Sun, Hui Wang, Jingfeng Lu, Yi Zhang

机构 * School of Cyber Science and Engineering, Sichuan University, Chengdu, China(四川大学计算机科学与工程学院)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL

AI总结 本文提出DCAN网络,通过解耦语义与风格信息,实现对LLM生成代码的多模型归因。

Comments 11 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21800 2026-02-26 cs.SE cs.AI 62%

An Evaluation of Context Length Extrapolation in Long Code via Positional Embeddings and Efficient Attention

通过位置嵌入和高效注意力机制评估长代码中的上下文长度外推

Madhusudan Ghosh, Rishabh Gupta

机构 * Bosch Research and Technology Centre, Bangalore, India(博世研究与技术中心,班加罗尔,印度)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文通过位置嵌入和高效注意力机制评估长代码中的上下文长度外推,旨在提升代码生成任务的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10953 2026-02-26 cs.CL cs.AI 62%

Search or Accelerate: Confidence-Switched Position Beam Search for Diffusion Language Models

搜索或加速:基于置信度切换的位置束搜索用于扩散语言模型

Mingyu Cao, Alvaro H. C. Correia, Christos Louizos, Shiwei Liu, Lu Yin

机构 * University of Surrey(塞拉利昂大学) Qualcomm AI Research. Qualcomm AI Research is an initiative of Qualcomm Technologies, Inc.(高通人工智能研究) ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 SOAR通过置信度切换机制优化扩散语言模型的解码过程,提高生成质量并保持推理效率。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20048 2026-02-24 cs.AI cs.SE 62%

CodeCompass: Navigating the Navigation Paradox in Agentic Code Intelligence

CodeCompass: 在代理代码智能中导航悖论的探索

Tarakanath Paipuru

机构 * Independent Researcher(独立研究者)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 CodeCompass通过基于图的结构导航提升代码智能代理在隐藏依赖任务中的性能,揭示导航与检索本质不同,需显式引导代理利用结构上下文。

Comments 23 pages, 7 figures. Research study with 258 trials on SWE-bench-lite tasks. Code and data: https://github.com/tpaip607/research-codecompass

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00672 2026-02-24 cs.LG cs.AI 62%

ML-Tool-Bench: Tool-Augmented Planning for ML Tasks

ML-Tool-Bench: 为机器学习任务增强的工具辅助规划

Yaswanth Chittepu, Raghavendra Addanki, Tung Mai, Anup Rao, Branislav Kveton

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Adobe Research(Adobe研究)

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ML-Tool-Bench,通过引入内存中的命名对象管理,评估工具增强的ML代理,改进了ReAct方法,提升了16.52个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15843 2026-02-19 cs.CL cs.AI 62%

The Perplexity Paradox: Why Code Compresses Better Than Math in LLM Prompts

困惑性悖论:为什么代码在LLM提示中比数学压缩得更好

Warren Johnson

机构 * Bona Opera Studios(博纳歌剧工作室)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 本文揭示代码在LLM提示中比数学压缩更有效的原因,并提出TAAC算法实现更高效的压缩。

Comments 19 pages, 5 figures, 4 tables. Second paper in TAAC research series. Code and data at https://github.com/micoverde/taac-llm-compression

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10171 2026-02-12 cs.SE cs.AI 62%

EvoCodeBench: A Human-Performance Benchmark for Self-Evolving LLM-Driven Coding Systems

EvoCodeBench:用于自演化LLM驱动编码系统的性能基准

Wentao Zhang, Jianfeng Wang, Liheng Liang, Yilei Zhao, HaiBin Wen, Zhe Zhao

机构 * Nanyang Technological University(南洋理工大学) East China University of Science and Technology(东华大学) Guangdong Ocean University(广东海洋大学) City University of Hong Kong(香港城市大学) Stanford University(斯坦福大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 EvoCodeBench通过跨语言对比和人类表现评估,评估自演化LLM驱动编码系统的性能提升与效率改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13853 2026-02-03 cs.CL cs.AI cs.DB cs.HC 62%

BenchPress: A Human-in-the-Loop Annotation System for Rapid Text-to-SQL Benchmark Curation

BenchPress:一种用于快速文本到SQL基准定制的人机协作标注系统

Fabian Wenz, Omar Bouattour, Devin Yang, Justin Choi, Cecil Gregg, Nesime Tatbul, Çağatay Demiralp

机构 * TU Munich(慕尼黑技术大学) MIT(麻省理工学院) Intel Labs(英特尔实验室) AWS AI Labs(亚马逊AI实验室)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 BenchPress通过人机协作系统加速特定领域文本到SQL基准的创建,结合LLM生成与人类验证提升标注准确性与基准可靠性。

Comments CIDR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21115 2026-01-30 cs.CL cs.AI 62%

Multi-task Code LLMs: Data Mix or Model Merge?

多任务代码LLM:数据混合还是模型合并?

Mingzhi Zhu, Boris Sobolev, Rahul Krishna, Raju Pavuluri, Stacy Patterson, Michele Merler

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) IBM Research(IBM研究院)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 本研究比较了数据混合与模型合并在多任务代码LLM中的效果,发现模型合并在大模型规模下表现更优,而数据混合在小规模更有效,为资源受限场景提供了高效解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00527 2026-01-30 cs.SE cs.AI 62%

A Hierarchical Imprecise Probability Approach to Reliability Assessment of Large Language Models

一种分层不精确概率方法用于大型语言模型的可靠性评估

Robab Aghazadeh-Chakherlou, Qing Guo, Siddartha Khastgir, Peter Popov, Xiaoge Zhang, Xingyu Zhao

机构 * WMG, University of Warwick(沃里克大学工业与制造业学院) Center for Frontier AI Research, A*STAR(前沿人工智能研究中心) School of Computing, National University of Singapore(新加坡国立大学计算机学院) Center for Software Reliability, City St George's, University of London(伦敦大学圣乔治学院软件可靠性中心) Department of Industrial and Systems Engineering, The Hong Kong Polytechnic University(香港理工大学工业与系统工程系)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文提出HIP-LLM,一种分层不精确概率框架,用于更准确地评估大型语言模型的可靠性。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06047 2026-01-28 cs.LG cs.AI 62%

PYRREGULAR: A Unified Framework for Irregular Time Series, with Classification Benchmarks

PYRREGULAR: 一种用于不规则时间序列的统一框架,包含分类基准

Francesco Spinnato, Cristiano Landi

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 PYRREGULAR提出了一种统一框架和标准化数据集存储库,用于不规则时间序列分类,通过基准测试12种分类器模型,促进跨领域研究与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16520 2026-01-26 cs.CV cs.AI cs.CL 62%

TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning

TangramPuzzle: 通过组合空间推理评估多模态大语言模型

Daixian Liu, Jiayi Kuang, Yinghui Li, Yangning Li, Di Yin, Haoyu Cao, Xing Sun, Ying Shen, Hai-Tao Zheng, Liang Lin, Philip S. Yu

机构 * Tsinghua University(清华大学) Sun-Yat Sen University(孙逸人大学) Tencent Youtu Lab(腾讯优图实验室) University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 TangramPuzzle通过几何基准测试评估多模态大语言模型的组合空间推理能力,发现模型在匹配轮廓时忽视几何约束,导致碎片变形。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15728 2026-01-26 cs.AI cs.SE 62%

Benchmarking Text-to-Python against Text-to-SQL: The Impact of Explicit Logic and Ambiguity

对文本到Python与文本到SQL的基准测试:显式逻辑和歧义的影响

Hangle Hu, Chenyu Hou, Bin Cao, Ruizhe Li

机构 * Zhejiang University of Technology(浙江工业大学) University of Aberdeen(阿伯丁大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出BIRD-Python基准测试,通过逻辑完成框架解决文本到Python与SQL的性能差异问题,证明Python在分析代理中的可行性。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12744 2026-01-21 cs.AI cs.NI cs.SE 62%

Vision Language Models for Optimization-Driven Intent Processing in Autonomous Networks

面向自主网络的基于视觉语言模型的优化驱动意图处理

Tasnim Ahmed, Yifan Zhu, Salimur Choudhury

机构 * School of Computing, Queen's University, Ontario, Canada(计算学院,女王大学,安大略,加拿大)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出IntentOpt基准测试,评估不同视觉语言模型在生成网络优化代码中的性能,发现视觉参数提取和程序化思维提示显著降低执行成功率,开源模型表现低于闭源模型。

Comments Accepted for presentation at The IEEE International Conference on Communications (ICC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16272 2026-01-21 cs.SE cs.AI 62%

Beyond Blind Spots: Analytic Hints for Mitigating LLM-Based Evaluation Pitfalls

超越盲区:用于缓解基于LLM评估缺陷的分析提示

Ora Nova Fandina, Eitan Farchi, Shmulik Froimovich, Raviv Gal, Wesam Ibraheem, Rami Katan, Alice Podolsky

机构 * Ora Nova Fandina(奥拉诺瓦·法丁纳) Eitan Farchi(埃itan·法奇) Shmulik Froimovich(什mulik·弗罗伊米奇) Raviv Gal(拉维夫·加尔) Wesam Ibraheem(韦萨姆·伊布拉希姆) Rami Katan(拉米·卡坦) Alice Podolsky(艾丽斯·波德洛斯基)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出了一种分析提示方法,通过结合LLM和分析检查器,提高代码评估的可靠性,减少LLM的盲区。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18488 2026-01-19 cs.SE cs.AI 62%

Evaluating perturbation robustness of generative systems that use COBOL code inputs

评估使用COBOL代码输入的生成系统对扰动的鲁棒性

Samuel Ackerman, Wesam Ibraheem, Orna Raz, Marcel Zalmanovici

机构 * IBM Research(IBM研究院)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出评估使用COBOL代码输入的生成系统鲁棒性的框架,通过扰动方法和可视化工具提升系统对输入变化的鲁棒性。

Comments 16 pages (8 main, 8 appendix). Accepted to AI-SQE (ICSE, 2026): The 1st International Workshop on AI for Software Quality Evaluation: Judgment, Metrics, Benchmarks, and Beyond

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10496 2026-01-16 cs.SE cs.AI 62%

Model See, Model Do? Exposure-Aware Evaluation of Bug-vs-Fix Preference in Code LLMs

模型看见,模型做?基于暴露的bug-修复偏好评估

Ali Al-Kaswan, Claudio Spiess, Prem Devanbu, Arie van Deursen, Maliheh Izadi

机构 * Delft University of Technology(代尔夫特理工大学) University of California at Davis(加州大学戴维斯分校)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 研究发现LLM在生成代码时更倾向于重复bug而非修复,暴露于bug的示例加剧了这一倾向,而修复暴露则仅有微小改进,揭示了LLM可能传播记忆错误的风险。

Comments MSR 2026 Technical Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09084 2026-01-16 cs.CL cs.LG 62%

How Many Human Judgments Are Enough? Feasibility Limits of Human Preference Evaluation

需要多少人判断?人类偏好评估的可行性极限

Wilson Y. Lee

机构 * Independent Researcher(独立研究者)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 研究发现人类偏好评估中,当偏好信号分散时,比例分配是最佳策略,而精心设计的基准测试能通过减少方差提高检测性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07309 2026-01-14 cs.CL cs.LG 62%

PIE: Performance Interval Estimation for Free-Form Generation Tasks

PIE:用于自由形式生成任务的性能区间估计

Chi-Yang Hsu, Alexander Braylan, Yiheng Su, Matthew Lease, Omar Alonso

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Amazon(亚马逊)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 PIE提出了一种用于自由形式生成任务的性能区间估计方法,通过回归实现更准确的指标评分和校准的不确定性区间。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23367 2026-01-09 cs.LG cs.AI 62%

Post-Training Quantization of OpenPangu Models for Efficient Deployment on Atlas A2

在Atlas A2上对OpenPangu模型进行训练后量化以实现高效部署

Yilun Luo, Huaqing Zheng, Haoqian Meng, Wenyuan Liu, Peng Zhang

机构 * School of Computer Science and Technology, Tianjin University(计算机科学与技术学院,天津大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出在Atlas A2上通过低比特量化提升OpenPangu模型的推理效率,实现高效CoT推理并保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02404 2026-01-07 cs.CL cs.AI 62%

PCEval: A Benchmark for Evaluating Physical Computing Capabilities of Large Language Models

PCEval: 一个评估大型语言模型物理计算能力的基准

Inpyo Song, Eunji Jeon, Jangwon Lee

机构 * Department of Immersive Media Engineering(沉浸媒体工程系) Sungkyunkwan University(成均馆大学)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 PCEval是一个评估大型语言模型物理计算能力的基准,通过自动评估电路生成和硬件交互能力,揭示LLMs在物理布局设计中的不足。

Comments Code and Dataset available at https://github.com/Null99-Dog/PCEval-Dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22334 2026-01-07 cs.AI cs.CL 62%

SciEvalKit: An Open-source Evaluation Toolkit for Scientific General Intelligence

SciEvalKit: 一个用于科学通用智能的开源评估工具包

Yiheng Wang, Yixin Chen, Shuo Li, Yifan Zhou, Bo Liu, Hengjian Gao, Jiakang Yuan, Jia Bu, Wanghan Xu, Yuhao Zhou, Xiangyu Zhao, Zhiwang Zhou, Fengxiang Wang, Haodong Duan, Songyang Zhang, Jun Yao, Han Deng, Yizhou Wang, Jiabei Xiao, Jiaqi Liu, Encheng Su, Yujie Liu, Weida Wang, Junchi Yao, Shenghe Zheng, Haoran Sun, Runmin Ma, Xiangchao Yan, Bo Zhang, Dongzhan Zhou, Shufei Zhang, Peng Ye, Xiaosong Wang, Shixiang Tang, Wenlong Zhang, Lei Bai

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 SciEvalKit是一个开源工具包,用于评估科学通用智能,涵盖科学多模态感知、推理、理解等核心能力,并提供灵活的评估流程和可定制的基准测试环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20159 2025-12-24 cs.SE cs.AI 62%

AXIOM: Benchmarking LLM-as-a-Judge for Code via Rule-Based Perturbation and Multisource Quality Calibration

AXIOM:通过基于规则的扰动和多源质量校准构建LLM-as-a-Judge代码评估基准

Ruiqi Wang, Xinchen Wang, Cuiyun Gao, Chun Yong Chong, Xin Xia, Qing Liao

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Monash University Malaysia(墨尔本大学马来西亚分校) Zhejiang University(浙江大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 AXIOM通过基于规则的扰动和多源质量校准构建代码评估基准,以实现高质量代码评分的平衡分布和可靠评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10713 2025-12-23 cs.SE cs.AI 62%

PACIFIC: a framework for generating benchmarks to check Precise Automatically Checked Instruction Following In Code

PACIFIC:用于检查精确自动指令遵循的代码基准生成框架

Itay Dreyfuss, Antonio Abu Nassar, Samuel Ackerman, Axel Ben David, Eitan Farchi, Rami Katan, Orna Raz, Marcel Zalmanovici

机构 * IBM Research(IBM研究)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 PACIFIC框架通过生成具有明确预期输出的基准,评估LLM在代码指令遵循和dry运行能力上的表现,提供了一种抗污染且可扩展的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17387 2025-12-22 cs.SE cs.CL 62%

CIFE: Code Instruction-Following Evaluation

CIFE:代码指令遵循评估

Sravani Gunnu, Shanmukha Guttula, Hima Patel

机构 * IIT Bombay(印度班加罗尔理工学院) IBM Research India(IBM印度研究)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL

AI总结 CIFE评估了1000个Python任务的代码生成模型,通过13类约束测试,揭示了模型在遵循开发者要求方面的不足,提出C2A分数衡量正确性与约束遵循性。

Comments 20 pages, 22 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05368 2025-12-19 cs.RO cs.AI cs.LG 62%

Long-Horizon Visual Imitation Learning via Plan and Code Reflection

通过计划与代码反思实现长 horizon 视觉模仿学习

Quan Chen, Chenrui Shi, Qi Chen, Yuwei Wu, Zhi Gao, Xintong Zhang, Rui Gao, Kun Wu, Yunde Jia

机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science and Technology, Beijing Institute of Technology, China(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学,中国) Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University, China(广东机器感知与智能计算实验室,深圳MSU-BIT大学,中国) Beijing Innovation Center of Humanoid Robotics, China(北京人形机器人创新中心,中国)

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过计划与代码反思模块提升长 horizon 视觉模仿学习性能,引入 LongVILBench 基准验证方法有效性。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13330 2025-12-16 cs.CL cs.AI 62%

FIN-bench-v2: A Unified and Robust Benchmark Suite for Evaluating Finnish Large Language Models

FIN-bench-v2:一个用于评估芬兰大型语言模型的统一且稳健的基准测试集

Joona Kytöniemi, Jousia Piha, Akseli Reunamo, Fedor Vitiugin, Farrokh Mehryary, Sampo Pyysalo

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 FIN-bench-v2通过整合芬兰语言任务和评估方法,提供统一且稳健的基准测试集,用于评估芬兰大型语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05507 2025-12-11 cs.PL cs.AI 62%

Grammar-Based Code Representation: Is It a Worthy Pursuit for LLMs?

基于语法的代码表示:对于大语言模型来说,这是否值得追求?

Qingyuan Liang, Zhao Zhang, Zeyu Sun, Zheng Lin, Qi Luo, Yueyi Xiao, Yizhou Chen, Yuqun Zhang, Haotian Zhang, Lu Zhang, Bin Chen, Yingfei Xiong

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Kuaishou Technology(快手科技) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系)

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.PL

AI总结 本文探讨了基于语法的代码表示在大语言模型中的有效性,通过实验表明其在提升代码生成准确性和区分细微代码差异方面具有价值。

详情

展开后加载摘要…

URL PDF HTML 收藏