arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 12097 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 4087 篇

2602.05242 2026-05-14 cs.SE cs.AI cs.LG 67%

EGSS: Entropy-guided Stepwise Scaling for Reliable Software Engineering

EGSS: 基于熵引导的逐步缩放以实现可靠的软件工程

Chenhui Mao, Yuanting Lei, Zhixiang Wei, Ming Liang, Zhixiang Wang, Jingxuan Xu, Dajun Chen, Wei Jiang, Yong Li

机构 * Ant Group(蚂蚁集团)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 EGSS通过熵引导的自适应搜索和稳健的测试套件增强,解决了代理测试时间缩放中的计算开销问题,提升了性能并降低了推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03783 2026-05-12 cs.LG cs.AI cs.CL 67%

Efficient Estimation of Kernel Surrogate Models for Task Attribution

高效估计用于任务归因的核替代模型

Zhenshuo Zhang, Minxuan Duan, Hongyang R. Zhang

机构 * Northeastern University(东北大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出核替代模型用于高效估计任务归因,通过第二阶分析建立线性替代模型与影响函数的联系,并在多个任务设置中验证其有效性,实现更高的相关性和可扩展性。

Comments 27 pages. Appeared in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06702 2026-05-11 cs.AI cs.CL cs.LG 67%

CASCADE: Case-Based Continual Adaptation for Large Language Models During Deployment

CASCADE:基于案例的连续适应:在部署期间为大型语言模型进行持续适应

Siyuan Guo, Yali Du, Hechang Chen, Yi Chang, Jun Wang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University(吉林大学知识驱动人机智能工程研究中心) International Center of Future Science, Jilin University(吉林大学未来科学国际中心) Department of Informatics, King’s College London(伦敦国王学院信息学院) The Alan Turing Institute(艾伦·图灵研究所) AI Centre, Department of Computer Science, UCL(UCL计算机科学系人工智能中心)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CASCADE框架,通过在部署期间持续学习提升LLM性能,实现20.9%的提升,并在多个领域任务中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06183 2026-05-08 cs.AI cs.CL cs.LG 67%

Rethinking Adapter Placement: A Dominant Adaptation Module Perspective

重新思考适配器放置:从主导适配模块视角出发

Suoxin Zhang, Run He, Di Fang, Xiang Tan, Kaixuan Chen, Huiping Zhuang

机构 * South China University of Technology, China(华南理工大学) Zhejiang University, China(浙江大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DomLoRA方法,通过在主导适配模块放置单个适配器,以提升模型性能,验证了该模块在不同任务中的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01347 2026-05-05 cs.CL cs.AI cs.LG 67%

MAD-OPD: Breaking the Ceiling in On-Policy Distillation via Multi-Agent Debate

MAD-OPD: 突破基于策略的蒸馏的天花板:多智能体辩论

Jianze Wang, Ying Liu, Jinlong Chen, Xuchun Hu, Qilong Zhang, Yu Cao, Jun Wang, Hua Yang, Yong Xie, Qianglong Chen

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) Alibaba Group(阿里巴巴集团)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MAD-OPD通过多智能体辩论机制突破单教师限制,提出多教师辩论框架和基于任务的分歧原理,提升代理任务和代码生成性能。

Comments Preprint. 9-page main paper + appendix. 8 figures, 7 tables. Code: https://github.com/chiefovoavicii/MAD-OPD

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01047 2026-05-05 cs.CR cs.AI cs.CL cs.LG 67%

LLM Ghostbusters: Surgical Hallucination Suppression via Adaptive Unlearning

LLM Ghostbusters: 通过自适应反学习实现精准幻觉抑制

Joseph Spracklen, Pedram Aghazadeh, Farinaz Koushanfar, Murtuza Jadliwala

机构 * University of Texas San Antonio(德克萨斯大学圣安东尼奥分校) University of California San Diego(加州大学圣地亚哥分校)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出自适应反学习框架,通过混合token级目标和自适应发现循环,有效抑制LLM幻觉,减少81%的包幻觉率,同时保持编码基准性能,验证其对特定分布的针对性效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26173 2026-05-04 cs.LG cs.AI cs.CL 67%

Entropy Centroids as Intrinsic Rewards for Test-Time Scaling

熵中心作为测试时缩放的内在奖励

Wenshuo Zhao, Qi Zhu, Xingshan Zeng, Fei Mi, Lifeng Shang, Yi R., Fung

机构 * HKUST(香港科技大学) ZJU(浙江大学) Huawei(华为)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出熵中心作为测试时缩放的内在奖励,通过分析不确定性的时间结构提升模型响应质量,在不同规模模型上均优于现有基线。

Comments Under Review, 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26951 2026-04-30 cs.CL cs.AI cs.LG 67%

Turning the TIDE: Cross-Architecture Distillation for Diffusion Large Language Models

将TIDE转向:用于扩散大语言模型的跨架构蒸馏

Gongbo Zhang, Wen Wang, Ye Tian, Li Yuan

机构 * Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TIDE框架,通过跨架构蒸馏提升扩散大语言模型性能,采用三个模块解决不同架构间的知识转移问题,在八个基准测试中平均提升1.53分,尤其在代码生成任务中表现突出。

Comments 15 pages, 3 figures. Code: https://github.com/PKU-YuanGroup/TIDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25960 2026-04-30 cs.SE cs.LG cs.PL 67%

Large Language Models for Multilingual Code Intelligence: A Survey

大型语言模型用于多语言代码智能:综述

Chao Jiang, Dugang Liu, Cheng Wen, Zhiwu Xu, Hua Zheng, Muhammad Sadiq, Jawwad Ahmed Shamsi, Shengchao Qin, Zhong Ming

机构 * College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院,中国) Guangzhou Institute of Technology, Xidian University, China(广州理工大学,西安电子科技大学,中国) Guangzhou University of Software, China(广州软件大学,中国) Shenzhen University of Information Technology(深圳信息大学) National University of Computer and Emerging Sciences Karachi, Pakistan(巴基斯坦卡拉奇国家计算机与新兴科学大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.LG、cs.PL

AI总结 本文综述了多语言代码生成与翻译的关键任务,探讨了现有方法、基准和评估指标,指出多语言代码智能在现实系统中的重要性及挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10666 2026-04-28 cs.CL cs.AI cs.LG 67%

Green Prompting: Characterizing Prompt-driven Energy Costs of LLM Inference

绿色提示:字符化提示驱动的LLM推理能耗

Marta Adamska, Daria Smirnova, Hamid Nasiri, Zhengxin Yu, Peter Garraghan

机构 * School of Computing and communications(计算与通信学院)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过实验分析不同提示和响应特征对LLM推理能耗的影响,发现任务语义和关键词对能耗有显著影响,提示设计优化可提升推理效率。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00127 2026-04-28 cs.SE cs.AI cs.PL 67%

Generating Verifiable Chain of Thoughts from Exection-Traces

从执行轨迹生成可验证的推理链

Shailja Thakur, Vaibhav Saxena, Rohan Kulkarni, Shivdeep Singh, Parameswaran Selvam, Hima Patel, Hiroshi Kanayama

机构 * IBM Research, India(印度IBM研究院) IBM Research, Japan(日本IBM研究院)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI、cs.PL

AI总结 本文提出通过生成执行轨迹验证的推理链,提升模型在代码推理和生成中的准确性,实验显示验证质量显著提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04573 2026-04-24 cs.LG cs.AI cs.CL 67%

LaDiR: Latent Diffusion Enhances LLMs for Text Reasoning

LaDiR:潜在扩散增强大语言模型进行文本推理

Haoqiang Kang, Yizhe Zhang, Nikki Lijing Kuang, Nicklas Majamaki, Navdeep Jaitly, Yi-An Ma, Lianhui Qin

机构 * University of California, San Diego(加州大学圣迭戈分校) Apple(苹果公司)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LaDiR通过结合连续潜在表示的表达力与潜在扩散模型的迭代精炼能力,提升大语言模型在文本推理中的准确性、多样性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20398 2026-04-23 cs.CL cs.LG cs.SE 67%

WebGen-R1: Incentivizing Large Language Models to Generate Functional and Aesthetic Websites with Reinforcement Learning

WebGen-R1: 通过强化学习激励大语言模型生成功能性和美观的网站

Juyong Jiang, Chenglin Cai, Chansung Park, Jiasi Shen, Sunghun Kim, Jianguo Li, Yue Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Tongyi Lab, Alibaba Group(阿里云实验室) Electronics and Telecommunications Research Institute(电子电信研究院) Ant Group(蚂蚁集团)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL、cs.LG

AI总结 本文提出WebGen-R1框架,通过强化学习生成多页面功能性和美观的网站,解决了传统方法在多页面交互和审美评估上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14846 2026-04-21 cs.LG cs.AI cs.CL 67%

Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization

通过群体回合策略优化增强多轮工具集成代理推理

Yifeng Ding, Hung Le, Songyang Han, Kangrui Ruan, Zhenghui Jin, Varun Kumar, Zijian Wang, Anoop Deoras

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) AWS AI Labs(AWS人工智能实验室) NVIDIA Meta

专题命中 代码生成 :program synthesis(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GTPO算法,通过细粒度奖励、优势估计和自监督奖励塑造,提升大语言模型在多轮工具推理任务中的性能,优于GRPO并在常识推理和程序合成任务中表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17290 2026-04-21 cs.CL cs.AI cs.PL 67%

Probabilistic Programs of Thought

思维概率程序

Poorva Garg, Renato Lui Geh, Daniel Israel, Todd Millstein, Kyle Richardson, Guy Van den Broeck

机构 * University of California Los Angeles(加州大学洛杉矶分校) Allen Institute for AI(Allen人工智能研究所)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.PL

AI总结 本文提出思维概率程序框架,通过利用生成程序的分布,减少GPU计算开销,提升代码生成和数学推理任务的效率。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14550 2026-04-21 cs.AR cs.AI cs.LG cs.MA cs.PL 67%

VeriGraphi: A Multi-Agent Framework of Hierarchical RTL Generation for Large Hardware Designs

VeriGraphi:一种用于大规模硬件设计的分层RTL生成多智能体框架

Sazzadul Islam, Tasnim Tabassum, Hao Zheng

机构 * Dept. of Computer Science \& Eng. University of South Florida Tampa, Florida, United States

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG、cs.PL

AI总结 VeriGraphi通过构建基于规范的图谱,解决LLM在生成分层RTL时的结构失真问题,实现可靠生成并保持功能正确性。

Comments 9 pages, 2 figures, Case studies, v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16625 2026-04-21 cs.CL cs.AI cs.LG 67%

AdaExplore: Failure-Driven Adaptation and Diversity-Preserving Search for Efficient Kernel Generation

AdaExplore: 基于失败的适应与多样性保持搜索用于高效内核生成

Weihua Du, Jingming Zhuo, Yixin Dong, Andre Wang He, Weiwei Sun, Zeyu Zheng, Manupa Karunaratne, Ivan Fox, Tim Dettmers, Tianqi Chen, Yiming Yang, Sean Welleck

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学) Arm Ltd(Arm有限公司)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AdaExplore通过积累执行反馈实现自我改进,通过失败驱动适应和多样性保持搜索提升内核生成的正确性和优化性能,无需额外微调或外部知识。

Comments Preliminary work. The implementation is available at https://github.com/StigLidu/AdaExplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16365 2026-04-21 cs.CY 67%

"CS 1.5": An Experience Report on Integrating CS1 and Discrete Structures for the AI Era

CS 1.5:人工智能时代整合计算机科学基础与离散结构的教学实践报告

Ildar Akhmetov, Juancho Buchanan

专题命中 代码生成 :code generation(abstract);repository(abstract)

AI总结 本文探讨了在人工智能时代整合计算机科学基础与离散结构的教学方法,通过设计融合课程提升理论与实践能力,强调AI作为协作工具,并提出教学改革与实践建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13046 2026-04-16 cs.DB cs.CL cs.IR cs.LG cs.PL 67%

A Domain-Specific Language for LLM-Driven Trigger Generation in Multimodal Data Collection

面向LLM驱动触发生成的领域特定语言

Philipp Reis, Philipp Rigoll, Martin Zehetner, Jacqueline Henle, Stefan Otten, Eric Sax

机构 * FZI Research Center for Information Technology(FZI信息与技术研究中心)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG、cs.PL

AI总结 本文提出一种基于领域特定语言的意图驱动数据收集框架,通过自然语言交互与形式化规范相结合,实现多模态传感器数据的选择性采集,提升生成一致性与执行效率。

Comments Version submitted to the IEEE International Conference on Intelligent Transportation Systems (ITSC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12379 2026-04-15 cs.SE cs.AI cs.LG 67%

Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks

超越输出正确性:评估大型语言模型在编码任务中的推理能力

Yuangang Li, Justin Tian Jin Chen, Ethan Yu, David Hong, Iftekhar Ahmed

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文提出CodeRQ-Bench,首个评估LLM在生成、摘要和分类等编码任务中推理质量的基准,通过分析现有评估器的1069个不匹配案例,提出VERA评估器,实验表明其在四个数据集上均优于基线,提升AUCROC和AUPRC最高达0.26和0.21。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15640 2026-04-14 cs.LG cs.AI cs.CL 67%

Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-training

数据混合代理:学习重新加权领域以实现持续预训练

Kailai Yang, Xiao Liu, Lei Ji, Hao Li, Xiao Liang, Zhiwei Liu, Yeyun Gong, Peng Cheng, Mao Yang

机构 * The University of Manchester(曼彻斯特大学) Microsoft Research(微软研究院) Imperial College London(伦敦帝国学院) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出数据混合代理,通过强化学习学习重新加权领域,实现持续预训练中的平衡性能,优于现有基线方法,并在未见过的领域中表现良好。

Comments Accepted by the ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10375 2026-04-10 cs.SE cs.AI cs.LG 67%

Are Sparse Autoencoders Useful for Java Function Bug Detection?

稀疏自编码器是否有助于Java函数Bug检测?

Rui Melo, Claudia Mamede, Andre Catarino, Rui Abreu, Henrique Lopes Cardoso

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文探讨了稀疏自编码器在Java函数Bug检测中的有效性,通过GPT-2 Small和Gemma 2B的表示进行评估,发现SAE衍生特征在无需微调的情况下可达到89%的F1分数,优于传统基线模型。

Comments I'm working on a completely new paper with different models and datasets and authors. I believe it to be a more robust contribution. Since the authors, title and hypothesis are different, I believe it to be a better approach to remove this preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06253 2026-04-09 cs.LG cs.AI cs.PL 67%

FLeX: Fourier-based Low-rank EXpansion for multilingual transfer

FLeX:基于傅里叶的低秩扩展用于多语言迁移

Gaurav Narasimhan

机构 * Stanford University(斯坦福大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG、cs.PL

AI总结 本文研究了通过低秩适应和优化器改进提升Python到Java等语言的跨语言迁移效果,发现低秩适应和傅里叶正则化能显著提升迁移性能。

Comments 19 pages, 25 figures, Stanford CS224N Custom Project

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06231 2026-04-09 cs.DB cs.AI cs.CL cs.IR cs.SE 67%

Automating Database-Native Function Code Synthesis with LLMs

利用大型语言模型自动合成数据库原生函数代码

Wei Zhou, Xuanhe Zhou, Qikang He, Guoliang Li, Bingsheng He, Quanqing Xu, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文提出DBCooker系统,通过多模块协同解决数据库原生函数合成难题,实现更高精度的自动代码生成,实验显示在SQLite、PostgreSQL和DuckDB上准确率提升34.55%。

Comments Please visit our homepage at: https://code4db.github.io/hi-opencook/. The code is available at: https://github.com/weAIDB/OpenCook

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22519 2026-04-01 cs.SE cs.AI cs.PL 67%

LLMON: An LLM-native Markup Language to Leverage Structure and Semantics at the LLM Interface

LLMON:一种面向大语言模型的标记语言,用于在大语言模型接口中利用结构和语义

Michael Hind, Basel Shbita, Bo Wu, Farhan Ahmed, Chad DeLuca, Nathan Fulton, David Cox, Dan Gutfreund

机构 * IBM Research(IBM研究院)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI、cs.PL

AI总结 LLMON通过引入一种面向大语言模型的标记语言,使文本的结构和语义元数据能自然地传递给大语言模型,从而提升模型的准确性、安全性和稳定性。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03636 2026-03-20 cs.AI cs.CL cs.LG 67%

CausalARC: Abstract Reasoning with Causal World Models

CausalARC:基于因果世界模型的抽象推理

Jacqueline Maasch, John Kalantari, Kia Khezeli

专题命中 代码生成 :program synthesis(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CausalARC通过因果世界模型进行低数据和分布外推理,结合原则性数据增强提供少量示例反馈,用于评估语言模型在抽象推理、反事实推理、程序合成和因果发现中的表现。

Comments Peer-reviewed workshop paper

Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Bridging Language, Agent, and World Models (LAW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09951 2026-03-11 cs.LG cs.AI cs.SE 67%

Towards a Neural Debugger for Python

迈向Python的神经调试器

Maximilian Beck, Jonas Gehring, Jannik Kossen, Gabriel Synnaeve

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文提出神经调试器,通过模拟传统调试器实现交互式代码执行控制,提升神经模型在代码执行预测与逆向推理中的能力。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14093 2026-03-11 cs.SE cs.AI cs.CL 67%

Reasoning Efficiently Through Adaptive Chain-of-Thought Compression: A Self-Optimizing Framework

通过自适应链式推理压缩实现高效推理:一个自优化框架

Kerui Huang, Shuhan Liu, Xing Hu, Tongtong Xu, Lingfeng Bao, Xin Xia

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 SEER通过自适应压缩链式推理,提升LLM在软件工程和数学任务中的效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06333 2026-03-09 cs.AI cs.CL cs.LG 67%

SAHOO: Safeguarded Alignment for High-Order Optimization Objectives in Recursive Self-Improvement

SAHOO:递归自我改进中高阶优化目标的安全保障

Subramanyam Sahoo, Aman Chadha, Vinija Jain, Divya Chaudhary

机构 * MARS 4.0 Fellowship, Cambridge AI Safety Hub(CAISH), University of Cambridge(剑桥大学) AWS Generative AI Innovation Center, Amazon Web Services, USA(亚马逊网络服务) Google, USA(谷歌) Stanford University(斯坦福大学) Northeastern University, Seattle, WA, USA(东北大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SAHOO通过三种保障措施实现递归自我改进中高阶优化目标的安全保障,显著提升代码生成和推理质量,同时保持约束和事实性。

Comments Published at ICLR 2026 Workshop on AI with Recursive Self-Improvement. 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04372 2026-03-06 cs.SE cs.AI cs.LG 67%

Assessing the Impact of Code Changes on the Fault Localizability of Large Language Models

评估代码更改对大型语言模型故障定位性的影响

Sabaat Haroon, Ahmad Faraz Khan, Ahmad Humayun, Waris Gill, Abdul Haddi Amjad, Ali R. Butt, Mohammad Taha Khan, Muhammad Ali Gulzar

机构 * Carnegie Mellon University, USA(卡内基梅隆大学,美国)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文通过端到端评估框架评估LLM在故障定位中的鲁棒性,发现SPMs导致78%的LLM失败于之前定位的故障,表明LLM推理依赖于语法而非语义。

Comments This paper is currently Under Review. It consists of 12 pages, 11 Figures, and 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏