EGSS: Entropy-guided Stepwise Scaling for Reliable Software Engineering
EGSS: 基于熵引导的逐步缩放以实现可靠的软件工程
机构 * Ant Group(蚂蚁集团)
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 EGSS通过熵引导的自适应搜索和稳健的测试套件增强,解决了代理测试时间缩放中的计算开销问题,提升了性能并降低了推理时间。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
EGSS: 基于熵引导的逐步缩放以实现可靠的软件工程
机构 * Ant Group(蚂蚁集团)
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 EGSS通过熵引导的自适应搜索和稳健的测试套件增强,解决了代理测试时间缩放中的计算开销问题,提升了性能并降低了推理时间。
高效估计用于任务归因的核替代模型
机构 * Northeastern University(东北大学)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出核替代模型用于高效估计任务归因,通过第二阶分析建立线性替代模型与影响函数的联系,并在多个任务设置中验证其有效性,实现更高的相关性和可扩展性。
Comments 27 pages. Appeared in ICLR 2026
CASCADE:基于案例的连续适应:在部署期间为大型语言模型进行持续适应
机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) ; Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University(吉林大学知识驱动人机智能工程研究中心) ; International Center of Future Science, Jilin University(吉林大学未来科学国际中心) ; Department of Informatics, King’s College London(伦敦国王学院信息学院) ; The Alan Turing Institute(艾伦·图灵研究所) ; AI Centre, Department of Computer Science, UCL(UCL计算机科学系人工智能中心)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出CASCADE框架,通过在部署期间持续学习提升LLM性能,实现20.9%的提升,并在多个领域任务中优于基线方法。
重新思考适配器放置:从主导适配模块视角出发
机构 * South China University of Technology, China(华南理工大学) ; Zhejiang University, China(浙江大学)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出DomLoRA方法,通过在主导适配模块放置单个适配器,以提升模型性能,验证了该模块在不同任务中的稳定性。
MAD-OPD: 突破基于策略的蒸馏的天花板:多智能体辩论
机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) ; Alibaba Group(阿里巴巴集团)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 MAD-OPD通过多智能体辩论机制突破单教师限制,提出多教师辩论框架和基于任务的分歧原理,提升代理任务和代码生成性能。
Comments Preprint. 9-page main paper + appendix. 8 figures, 7 tables. Code: https://github.com/chiefovoavicii/MAD-OPD
LLM Ghostbusters: 通过自适应反学习实现精准幻觉抑制
机构 * University of Texas San Antonio(德克萨斯大学圣安东尼奥分校) ; University of California San Diego(加州大学圣地亚哥分校)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出自适应反学习框架,通过混合token级目标和自适应发现循环,有效抑制LLM幻觉,减少81%的包幻觉率,同时保持编码基准性能,验证其对特定分布的针对性效果。
熵中心作为测试时缩放的内在奖励
机构 * HKUST(香港科技大学) ; ZJU(浙江大学) ; Huawei(华为)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出熵中心作为测试时缩放的内在奖励,通过分析不确定性的时间结构提升模型响应质量,在不同规模模型上均优于现有基线。
Comments Under Review, 39 pages
将TIDE转向:用于扩散大语言模型的跨架构蒸馏
机构 * Peking University(北京大学) ; Zhejiang University(浙江大学)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出TIDE框架,通过跨架构蒸馏提升扩散大语言模型性能,采用三个模块解决不同架构间的知识转移问题,在八个基准测试中平均提升1.53分,尤其在代码生成任务中表现突出。
Comments 15 pages, 3 figures. Code: https://github.com/PKU-YuanGroup/TIDE
大型语言模型用于多语言代码智能:综述
机构 * College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院,中国) ; Guangzhou Institute of Technology, Xidian University, China(广州理工大学,西安电子科技大学,中国) ; Guangzhou University of Software, China(广州软件大学,中国) ; Shenzhen University of Information Technology(深圳信息大学) ; National University of Computer and Emerging Sciences Karachi, Pakistan(巴基斯坦卡拉奇国家计算机与新兴科学大学)
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.LG、cs.PL
AI总结 本文综述了多语言代码生成与翻译的关键任务,探讨了现有方法、基准和评估指标,指出多语言代码智能在现实系统中的重要性及挑战。
绿色提示:字符化提示驱动的LLM推理能耗
机构 * School of Computing and communications(计算与通信学院)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过实验分析不同提示和响应特征对LLM推理能耗的影响,发现任务语义和关键词对能耗有显著影响,提示设计优化可提升推理效率。
Comments 9 pages, 5 figures
从执行轨迹生成可验证的推理链
机构 * IBM Research, India(印度IBM研究院) ; IBM Research, Japan(日本IBM研究院)
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI、cs.PL
AI总结 本文提出通过生成执行轨迹验证的推理链,提升模型在代码推理和生成中的准确性,实验显示验证质量显著提升模型性能。
LaDiR:潜在扩散增强大语言模型进行文本推理
机构 * University of California, San Diego(加州大学圣迭戈分校) ; Apple(苹果公司)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 LaDiR通过结合连续潜在表示的表达力与潜在扩散模型的迭代精炼能力,提升大语言模型在文本推理中的准确性、多样性和可解释性。
WebGen-R1: 通过强化学习激励大语言模型生成功能性和美观的网站
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Hong Kong University of Science and Technology(香港科技大学) ; Tongyi Lab, Alibaba Group(阿里云实验室) ; Electronics and Telecommunications Research Institute(电子电信研究院) ; Ant Group(蚂蚁集团)
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL、cs.LG
AI总结 本文提出WebGen-R1框架,通过强化学习生成多页面功能性和美观的网站,解决了传统方法在多页面交互和审美评估上的不足。
通过群体回合策略优化增强多轮工具集成代理推理
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; AWS AI Labs(AWS人工智能实验室) ; NVIDIA ; Meta
专题命中 代码生成 :program synthesis(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出GTPO算法,通过细粒度奖励、优势估计和自监督奖励塑造,提升大语言模型在多轮工具推理任务中的性能,优于GRPO并在常识推理和程序合成任务中表现更佳。
思维概率程序
机构 * University of California Los Angeles(加州大学洛杉矶分校) ; Allen Institute for AI(Allen人工智能研究所)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.PL
AI总结 本文提出思维概率程序框架,通过利用生成程序的分布,减少GPU计算开销,提升代码生成和数学推理任务的效率。
Comments 26 pages
VeriGraphi:一种用于大规模硬件设计的分层RTL生成多智能体框架
机构 * Dept. of Computer Science \& Eng. University of South Florida Tampa, Florida, United States
专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG、cs.PL
AI总结 VeriGraphi通过构建基于规范的图谱,解决LLM在生成分层RTL时的结构失真问题,实现可靠生成并保持功能正确性。
Comments 9 pages, 2 figures, Case studies, v2
AdaExplore: 基于失败的适应与多样性保持搜索用于高效内核生成
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Washington(华盛顿大学) ; Arm Ltd(Arm有限公司)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 AdaExplore通过积累执行反馈实现自我改进,通过失败驱动适应和多样性保持搜索提升内核生成的正确性和优化性能,无需额外微调或外部知识。
Comments Preliminary work. The implementation is available at https://github.com/StigLidu/AdaExplore
CS 1.5:人工智能时代整合计算机科学基础与离散结构的教学实践报告
专题命中 代码生成 :code generation(abstract);repository(abstract)
AI总结 本文探讨了在人工智能时代整合计算机科学基础与离散结构的教学方法,通过设计融合课程提升理论与实践能力,强调AI作为协作工具,并提出教学改革与实践建议。
面向LLM驱动触发生成的领域特定语言
机构 * FZI Research Center for Information Technology(FZI信息与技术研究中心)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG、cs.PL
AI总结 本文提出一种基于领域特定语言的意图驱动数据收集框架,通过自然语言交互与形式化规范相结合,实现多模态传感器数据的选择性采集,提升生成一致性与执行效率。
Comments Version submitted to the IEEE International Conference on Intelligent Transportation Systems (ITSC 2026)
超越输出正确性:评估大型语言模型在编码任务中的推理能力
机构 * University of California, Irvine(加州大学尔湾分校)
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 本文提出CodeRQ-Bench,首个评估LLM在生成、摘要和分类等编码任务中推理质量的基准,通过分析现有评估器的1069个不匹配案例,提出VERA评估器,实验表明其在四个数据集上均优于基线,提升AUCROC和AUPRC最高达0.26和0.21。
数据混合代理:学习重新加权领域以实现持续预训练
机构 * The University of Manchester(曼彻斯特大学) ; Microsoft Research(微软研究院) ; Imperial College London(伦敦帝国学院) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出数据混合代理,通过强化学习学习重新加权领域,实现持续预训练中的平衡性能,优于现有基线方法,并在未见过的领域中表现良好。
Comments Accepted by the ACL 2026 main conference
稀疏自编码器是否有助于Java函数Bug检测?
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 本文探讨了稀疏自编码器在Java函数Bug检测中的有效性,通过GPT-2 Small和Gemma 2B的表示进行评估,发现SAE衍生特征在无需微调的情况下可达到89%的F1分数,优于传统基线模型。
Comments I'm working on a completely new paper with different models and datasets and authors. I believe it to be a more robust contribution. Since the authors, title and hypothesis are different, I believe it to be a better approach to remove this preprint
FLeX:基于傅里叶的低秩扩展用于多语言迁移
机构 * Stanford University(斯坦福大学)
专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG、cs.PL
AI总结 本文研究了通过低秩适应和优化器改进提升Python到Java等语言的跨语言迁移效果,发现低秩适应和傅里叶正则化能显著提升迁移性能。
Comments 19 pages, 25 figures, Stanford CS224N Custom Project
利用大型语言模型自动合成数据库原生函数代码
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学) ; National University of Singapore(新加坡国立大学)
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 本文提出DBCooker系统,通过多模块协同解决数据库原生函数合成难题,实现更高精度的自动代码生成,实验显示在SQLite、PostgreSQL和DuckDB上准确率提升34.55%。
Comments Please visit our homepage at: https://code4db.github.io/hi-opencook/. The code is available at: https://github.com/weAIDB/OpenCook
LLMON:一种面向大语言模型的标记语言,用于在大语言模型接口中利用结构和语义
机构 * IBM Research(IBM研究院)
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI、cs.PL
AI总结 LLMON通过引入一种面向大语言模型的标记语言,使文本的结构和语义元数据能自然地传递给大语言模型,从而提升模型的准确性、安全性和稳定性。
Comments 28 pages
CausalARC:基于因果世界模型的抽象推理
专题命中 代码生成 :program synthesis(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 CausalARC通过因果世界模型进行低数据和分布外推理,结合原则性数据增强提供少量示例反馈,用于评估语言模型在抽象推理、反事实推理、程序合成和因果发现中的表现。
Comments Peer-reviewed workshop paper
Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Bridging Language, Agent, and World Models (LAW)
迈向Python的神经调试器
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 本文提出神经调试器,通过模拟传统调试器实现交互式代码执行控制,提升神经模型在代码执行预测与逆向推理中的能力。
Comments 22 pages
通过自适应链式推理压缩实现高效推理:一个自优化框架
机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) ; State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 SEER通过自适应压缩链式推理,提升LLM在软件工程和数学任务中的效率与鲁棒性。
SAHOO:递归自我改进中高阶优化目标的安全保障
机构 * MARS 4.0 Fellowship, Cambridge AI Safety Hub(CAISH), University of Cambridge(剑桥大学) ; AWS Generative AI Innovation Center, Amazon Web Services, USA(亚马逊网络服务) ; Google, USA(谷歌) ; Stanford University(斯坦福大学) ; Northeastern University, Seattle, WA, USA(东北大学)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 SAHOO通过三种保障措施实现递归自我改进中高阶优化目标的安全保障,显著提升代码生成和推理质量,同时保持约束和事实性。
Comments Published at ICLR 2026 Workshop on AI with Recursive Self-Improvement. 20 pages, 5 figures
评估代码更改对大型语言模型故障定位性的影响
机构 * Carnegie Mellon University, USA(卡内基梅隆大学,美国)
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 本文通过端到端评估框架评估LLM在故障定位中的鲁棒性,发现SPMs导致78%的LLM失败于之前定位的故障,表明LLM推理依赖于语法而非语义。
Comments This paper is currently Under Review. It consists of 12 pages, 11 Figures, and 5 Tables