Toward Functional and Non-Functional Evaluation of Application-Level Code Generation
迈向应用级代码生成的功能性和非功能性评估
专题命中 代码评测 :code generation(title,abstract);repository(abstract);分类 cs.SE
AI总结 本文提出RAL-Bench基准,评估应用级代码生成的功能性和非功能性质量,发现功能正确性仍是瓶颈,非功能性质量也需改进。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
迈向应用级代码生成的功能性和非功能性评估
专题命中 代码评测 :code generation(title,abstract);repository(abstract);分类 cs.SE
AI总结 本文提出RAL-Bench基准,评估应用级代码生成的功能性和非功能性质量,发现功能正确性仍是瓶颈,非功能性质量也需改进。
TextBFGS:通过错误-操作符检索的基于案例的推理代码优化方法
机构 * Zhongxing Telecom Equipment (ZTE)(中兴通讯股份有限公司) ; China Mobile(中国移动) ; Nanyang Technological University (NTU)(南洋理工大学) ; Hunan University(湖南大学)
专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG
AI总结 TextBFGS采用基于案例的推理方法,通过检索历史错误-操作符修正轨迹来优化代码生成,相比无状态方法更高效,显著提升了代码优化性能。
ComBench:一个面向编译错误修复的仓库级真实世界基准
机构 * The Chinese University of Hong Kong(香港中文大学) ; School of Software Engineering, Sun Yat-sen University(中山大学软件工程学院) ; Sun Yat-sen University(中山大学)
专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI
AI总结 本文提出ComBench,首个面向C/C++编译错误修复的仓库级真实世界基准,通过自动化框架系统挖掘GitHub CI历史中的真实失败案例,评估12种现代LLM在直接和代理修复设置下的表现,揭示模型在语法正确性与语义正确性上的显著差距。
基于图注意力网络的自闭症谱系障碍检测
机构 * Middle Tennessee State University(中田纳西州立大学)
专题命中 代码评测 :repository(abstract);分类 cs.LG
AI总结 本文提出一种基于图注意力网络的检测方法,利用fMRI数据构建功能连接矩阵,通过注意力机制识别关键连接模式,提升诊断准确性,实验结果显示在测试数据上达到88.79%的平均准确率。