CFCEval: Evaluating Security Aspects in Code Generated by Large Language Models
CFCEval: 评估大型语言模型生成代码的安全性方面
专题命中 代码评测 :code generation(abstract);分类 cs.SE
AI总结 CFCEval通过引入MLVBench和ELRM指标,有效评估大型语言模型生成代码的质量与安全性,提升代码评估的准确性和全面性。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
CFCEval: 评估大型语言模型生成代码的安全性方面
专题命中 代码评测 :code generation(abstract);分类 cs.SE
AI总结 CFCEval通过引入MLVBench和ELRM指标,有效评估大型语言模型生成代码的质量与安全性,提升代码评估的准确性和全面性。
为评估和提升代码效率合成性能约束
专题命中 代码评测 :code generation(abstract);分类 cs.SE
AI总结 WEDGE通过生成性能压力输入,提升代码优化效果,释放PERFFORGE测试以评估未来高效代码生成方法。
Comments Accepted by Neurips 2025 (main poster)
挑战大型语言模型在意大利语中的能力:一项社区倡议
专题命中 代码评测 :code generation(abstract);分类 cs.CL
AI总结 CALAMITA是一项针对意大利语的社区驱动基准测试项目,通过多样化任务和统一评估流程,系统评估大型语言模型的能力,为其他语言提供评估范例。
Defects4C:利用C/C++漏洞基准测试大语言模型的修复能力
专题命中 代码评测 :program repair(abstract);分类 cs.SE
AI总结 Defects4C通过提供高质量C/C++漏洞基准测试,评估大语言模型在修复C/C++程序中的有效性,揭示当前技术的局限性并推动未来研究。
Comments ASE-2025 main research paper
力学建模自动化:LLM作为物理约束神经网络的设计者,用于材料本构建模
机构 * Institute of Material Systems Modeling, Helmholtz-Zentrum Hereon(材料系统建模研究所,海德堡中心) ; Institute for Continuum and Material Mechanics, Hamburg University of Technology(连续力学与材料力学研究所,汉堡技术大学) ; Helmholtz-Zentrum Hereon(海德堡中心) ; Hamburg University of Technology(汉堡技术大学)
专题命中 代码评测 :code generation(abstract);分类 cs.LG
AI总结 本文提出利用LLM自动设计物理约束神经网络,用于材料本构建模,实现建模自动化和高效准确的本构模型生成。
Comments Currently under review
LLM与HPC:在高性能计算任务中评估DeepSeek的性能
机构 * Center of Computation and Technology(计算与技术中心) ; Louisiana State University(路易斯安那州立大学) ; Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)
专题命中 代码评测 :code generation(abstract);分类 cs.AI
AI总结 本文评估了DeepSeek在高性能计算任务中生成代码的能力,发现其在扩展性和执行效率上逊于GPT-4。
Comments 9 pages, 2 figures, 3 tables, conference
解析LLM推理轨迹中的错误:对代码执行模拟的实证研究
专题命中 代码评测 :code generation(abstract);分类 cs.SE
AI总结 本研究通过实证分析揭示LLM推理轨迹中的错误类型,开发了九类错误分类体系,并展示工具增强推理可有效提升LLM的推理能力。
多智能体系统在软件工程数据集适应中的应用:能力、限制与未来方向
专题命中 代码评测 :code generation(abstract);分类 cs.SE
AI总结 本文研究了多智能体系统在软件工程数据集适应中的能力与限制,发现提示干预能显著提升适应效果,为未来更可靠的智能体发展提供方向。
对大型语言模型推理引擎的综述:优化与效率的视角
机构 * Korea Electronics Technology Institute(韩国电子技术研究所) ; Electronics and Telecommunications Research Institute(电子电信研究院)
专题命中 代码评测 :repository(abstract);分类 cs.CL
AI总结 本文综述了大型语言模型推理引擎的优化与效率,评估了25种开源和商用引擎,探讨了其设计目标及生态系统成熟度,并提供未来研究方向和公开存储库。
Comments Under review; 106 pages; 46 figures
利用大语言模型进行视频理解:综述
机构 * University of Rochester(罗切斯特大学) ; The University of Hong Kong(香港大学) ; Southern University of Science and Technology(南方科技大学)
专题命中 代码评测 :repository(abstract);分类 cs.CL
AI总结 本文综述了利用大语言模型进行视频理解的最新进展,探讨了Vid-LLMs的分类、功能及应用场景,并指出了未来研究方向。
Comments Accepted to IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)
利用Tsetlin机约束搜索空间的可扩展贝叶斯网络结构学习
机构 * Department of ICT University of Agder(信息与通信技术系阿格德大学)
专题命中 代码评测 :repository(abstract);分类 cs.LG
AI总结 本文提出利用Tsetlin机约束搜索空间,以提高贝叶斯网络结构学习的效率和准确性。
LLM-CSEC: 对大型语言模型生成的C/C++代码安全性的实证评估
机构 * Independent Researcher(独立研究者) ; Newcastle University(新castle大学)
专题命中 代码评测 :code generation(abstract);分类 cs.AI
AI总结 本研究评估了大型语言模型生成的C/C++代码安全性,发现存在大量漏洞,强调开发人员需谨慎使用此类代码。
大型语言模型的源代码去学习
专题命中 代码评测 :code generation(abstract);分类 cs.SE
AI总结 本研究提出PROD方法,通过精确去学习源代码中的违规片段,提升代码生成的可靠性与安全性。
Comments Accepted to AAAI'26
ORIGAMISPACE:基于数学约束的多模态大语言模型多步空间推理基准测试
机构 * Fudan University(复旦大学) ; SII ; INF Technology(INF技术)
专题命中 代码评测 :code generation(abstract);分类 cs.AI
AI总结 ORIGAMISPACE通过折纸任务评估多模态大语言模型在多步空间推理和数学约束处理中的能力,提出四个评估任务并探索强化学习训练方法。
基于元形态规范变异代理的LLM编码
专题命中 代码评测 :code generation(abstract);分类 cs.SE
AI总结 CodeMetaAgent通过元形态关系驱动LLM代理,提升代码生成准确性与覆盖率,有效解决规范不一致问题。
AutoBackdoor: 通过LLM代理自动化后门攻击
机构 * Singapore Management University(新加坡管理大学) ; The University of Melbourne(墨尔本大学) ; Fudan University(复旦大学)
专题命中 代码评测 :repository(abstract);分类 cs.AI
AI总结 AutoBackdoor通过LLM代理自动化后门攻击,实现高效触发器生成和毒化数据构建,验证了对抗防御的脆弱性。
Comments 23 pages
超越代码相似性:评估LLM生成智能合约的可信度、效率和复杂性
专题命中 代码评测 :code generation(abstract);分类 cs.SE
AI总结 本文评估了LLM生成智能合约的可信度、效率和复杂性,发现检索增强生成显著提升了功能正确性,但生成代码仍需专家验证。
Comments 20 pages
ResearStudio: 一种可人工干预的构建可控深度研究代理的框架
机构 * Southern University of Science and Technology(南方科技大学)
专题命中 代码评测 :repository(abstract);分类 cs.AI
AI总结 ResearStudio是一种可人工干预的深度研究代理框架,通过实时人类控制与自动化相结合,在GAIA基准中取得最佳性能。
Comments EMNLP 2025 Demo, Oral
利用Transformer学习逆Ryu-Takayanagi公式
机构 * KIAS(韩国基础科学研究院)
专题命中 代码评测 :repository(abstract);分类 cs.LG
AI总结 本文利用Transformer模型学习逆Ryu-Takayanagi公式,通过数据驱动的方法重构黑洞函数并外推至无horizon背景。
Comments 15 pages, 6 figures, miner changes
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 代码评测 :repository(abstract);分类 cs.LG
Comments 12 pages
机构 * Department of Electronic Engineering, City University of Hong Kong(DongGuan)(香港城市大学(东莞)电子工程系) ; Department of Electronic Engineering, City University of Hong Kong(香港城市大学电子工程系)
专题命中 代码评测 :repository(abstract);分类 cs.AI
机构 * Sapienza University of Rome(罗马萨皮恩扎大学) ; University of California at Berkeley(加州大学伯克利分校) ; Örebro University(欧雷布罗大学) ; Linköping University(林哈姆斯大学) ; RISE Research Institutes of Sweden(瑞典RISE研究所)
专题命中 代码评测 :code model(abstract);分类 cs.LG
专题命中 代码评测 :code generation(abstract);分类 cs.SE
机构 * Peking University(北京大学) ; Shanghai Jiao Tong University(上海交通大学) ; OriginHub Technology(OriginHub科技) ; Institute for Advanced Algorithms Research, Shanghai(上海先进算法研究所) ; Zhongguancun Academy(中关村学院)
专题命中 代码评测 :repository(abstract);分类 cs.CL
Comments Manuscript
机构 * University of Science and Technology of China(中国科学技术大学) ; Alibaba Group(阿里巴巴集团) ; National University of Singapore(新加坡国立大学)
专题命中 代码评测 :code generation(abstract);分类 cs.CL
Comments Under Review
机构 * Shanghai Jiaotong University(上海交通大学)
专题命中 代码评测 :repository(abstract);分类 cs.AI
专题命中 代码评测 :program repair(abstract);分类 cs.SE
机构 * Zhejiang Univeristy(浙江大学) ; MAPLE Lab, Westlake University(西湖大学MAPLE实验室) ; Matterwave Intelligence ; Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖研究所以高级技术研究所)
专题命中 代码评测 :code generation(abstract);分类 cs.CL
Comments Accepted to NeurIPS 2025. Code link: https://github.com/maple-research-lab/LLaDOU
机构 * NII LLMC(日本信息处理学会大语言模型中心) ; The University of Tokyo(东京大学) ; NAIST(日本科学技术大学) ; Nagoya Institute of Technology(名古屋技术大学)
专题命中 代码评测 :code generation(abstract);分类 cs.CL
Comments Accepted to EMNLP 2025 (Main Conference). Models and evaluation results available at: https://github.com/llm-jp/massive-sft
专题命中 代码评测 :repository(abstract);分类 cs.SE