arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 12133 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 4096 篇

2606.01053 2026-06-02 cs.AI 57%

AnyEdit++: Adaptive Long-Form Knowledge Editing via Bayesian Surprise

AnyEdit++: 基于贝叶斯惊讶的自适应长文本知识编辑

Bowen Tian, Caixue He, Jiemin Wu, Jingying Wang, Wenshuo Chen, Zexi Li, Yutao Yue

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出AnyEdit++框架,通过基于贝叶斯惊讶的自适应分割机制Bayes-Chunk,实现结构感知的长文本知识编辑,在数学推理、代码生成和叙事任务上优于现有方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00049 2026-06-02 cs.CY cs.AI 57%

Measuring and Mitigating Bias in Code Generated by Large Language Models

测量和减轻大型语言模型生成代码中的偏见

Yuxi Chen, Yutian Tang, Timothy Storer

机构 * School of Computing Science, University of Glasgow(格拉斯哥大学计算机科学学院)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本文针对GPT-4o和Gemini等主流代码生成工具,提出评估框架,使用代码偏见分数和属性变化比率量化偏见,并探索四种轻量级缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09907 2026-06-02 cs.AI cs.MA 57%

RADAR: Redundancy-Aware Diffusion for Multi-Agent Communication Structure Generation

RADAR:面向多智能体通信结构生成的冗余感知扩散方法

Zhen Zhang, Wanjing Zhou, Juncheng Li, Hao Fei, Jun Wen, Wei Ji

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出一种基于条件离散图扩散模型的冗余感知生成框架RADAR,通过逐步生成通信拓扑并利用图有效尺寸引导,在六项基准上实现更高准确率、更低令牌消耗和更强鲁棒性。

Comments Accepted by ICML 2026 (fix typos)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02997 2026-06-02 cs.LG cs.CV 57%

From Memorization to Creativity: LLM as a Designer of Novel Neural Architectures

从记忆到创造:LLM作为新型神经架构的设计者

Waleed Khalid, Dmitry Ignatov, Radu Timofte

机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg, Germany(计算机视觉实验室,CAIDAS与IFI,乌尔姆大学,德国)

专题命中 代码生成 :program synthesis(abstract);分类 cs.LG

AI总结 本文提出NNGPT框架,通过闭环架构合成流水线,利用代码型LLM的监督微调循环,结合MinHash-Jaccard新颖性过滤和低保真性能信号,迭代提升生成架构的有效性、性能和多样性,实现从记忆到创造的转变。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), pp. 3252-3261, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15510 2026-06-02 cs.AI cs.DM cs.LO cs.SC 57%

Algebraic anti-unification

代数反统一

Christian Antić

机构 * Vienna University of Technology(维也纳技术大学)

专题命中 代码生成 :program synthesis(abstract);分类 cs.AI

AI总结 本文在泛代数的一般框架下提出代数反统一理论,通过引入代数泛化序和最小泛化概念,建立基本结构性质,并利用自动机理论研究有限一元代数和有限代数中的可计算性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31268 2026-06-01 cs.CL 57%

Mellum2 Technical Report

Mellum2 技术报告

Marko Kojic, Ivan Bondyrev, Aral de Moor, Joseph Shtok, Petr Borovlev, Kseniia Lysaniuk, Madeeswaran Kannan, Ivan Dolgov, Nikita Pavlichenko

机构 * JetBrains Constructor University(Constructor大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 本文介绍 Mellum 2,一个12B参数(每token激活2.5B)的混合专家语言模型,专攻软件工程,通过架构创新和训练优化在代码生成、数学推理等基准上达到4B-14B开源模型的竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31064 2026-06-01 cs.IR cs.AI 57%

Fighting Numerical Hallucinations via Data-centric Compilation for Online Financial QA

通过数据为中心的编译对抗在线金融问答中的数值幻觉

Hao Chen, Xing Tang, Qirui Liu, Weijie Shi, Shiwei Li, Fuyuan Lyu, Weihong Luo, Xiku Du, Xiuqiang He

机构 * Shenzhen Technology University(深圳科技大学) FiT, Tencent(腾讯金融科技部) South China University of Technology(华南理工大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Huazhong University of Science and Technology(华中科技大学) McGill University(麦吉尔大学)

专题命中 代码生成 :program synthesis(abstract);分类 cs.AI

AI总结 提出数据为中心推理编译器(DCRC),通过对抗数据构建、多阶段训练和编译执行推理流程,解决在线金融问答中检索增强生成面临的噪声敏感、计算脆弱和可审计性危机,实现可靠的数值推理。

Comments Accepted by KDD 2026 ADS track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30712 2026-06-01 cs.CL 57%

ExpGraph: Model-Agnostic Experience Learning with Graph-Structured Memory for LLM Agents

ExpGraph: 面向LLM智能体的模型无关经验学习与图结构记忆

Tao Feng, Chongrui Ye, Tianyang Luo, Jingjun Xu, Xueqiang Xu, Haozhen Zhang, Zhigang Hua, Yan Xie, Shuang Yang, Ge Liu, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nanyang Technological University(南洋理工大学) Meta Monetization AI(Meta 营收人工智能)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 提出ExpGraph框架,通过图结构记忆和强化学习实现冻结LLM执行器的外部经验复用,在问答、数学推理、代码生成和多步智能体任务上显著提升性能并减少交互步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30680 2026-06-01 cs.AI cs.MA 57%

Healthcare Mechanisms from Policy-as-Code Search under Strategic Provider Response

战略提供者响应下的策略即代码搜索中的医疗机制

Zihan Wang, Xiang Xu, Hongyuan Zha, Wenhao Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tongji University(同济大学)

专题命中 代码生成 :program synthesis(abstract);分类 cs.AI

AI总结 将医疗机制设计转化为语言模型的程序合成,通过多智能体模拟器Medi-Sim评估策略提供者响应下的均衡,并利用LLM引导的进化代码搜索合成可检查的混合目标程序。

Comments 32 pages, 18 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30358 2026-06-01 cs.LG quant-ph 57%

QASM-Eval: A Dataset to Train and Evaluate LLMs on OpenQASM-3 Beyond Quantum Circuits

QASM-Eval:用于训练和评估LLM在超越量子电路的OpenQASM-3上的数据集

Zhenxiao Fu, Lei Jiang, Fan Chen

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 针对LLM在OpenQASM-3硬件级编程上的训练与评估空白,构建了包含专家验证测试集和训练集的数据集,覆盖经典逻辑、时序调度、脉冲控制等,并通过扩展验证器自动验证,实验表明微调后LLM性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30104 2026-05-29 cs.CL 57%

SEAL: Can Saturated Benchmarks Be Revived by LLM-as-a-Meta-Judge?

SEAL: 饱和基准能否通过LLM作为元裁判得以复兴?

Jiamin Chen, Yidi Wu, Qiexiang Wang, Qianben Chen, Yuchen Li, Yansen Zhang, Xiaokun Zhang, Wangchunshu Zhou, Chen Ma

机构 * ByteDance Inc.(字节跳动公司) City University of Hong Kong(香港城市大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 提出SEAL协议,通过自适应LLM元裁判从饱和基准中提取潜在排名信号,在代码生成、数学推理等任务上以更少调用实现高排名准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30103 2026-05-29 cs.LG 57%

Convergence Theory for Iterative LLM-Based Neural Architecture Search: A Parametric Cross-Entropy Framework with Closed-Form Proxy Reliability

基于迭代式LLM的神经架构搜索的收敛理论:一个具有闭式代理可靠性的参数化交叉熵框架

Santosh Premi Adhikari, Radu Timofte, Dmitry Ignatov

机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg, Germany(计算机视觉实验室,CAIDAS与IFI,乌尔姆大学,德国)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 将迭代式LLM-NAS建模为参数化交叉熵方法,证明了收敛性、精英集概率几何收敛、增量生成有效性、MinHash-Jaccard去重防止模式崩溃以及代理可靠性闭式公式,并通过实验验证了理论预测。

Comments 14 pages, 2 figures, 2 tables. Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30042 2026-05-29 cs.AI 57%

Learning to Choose: An Empowerment-Guided Multi-Agent System with semantic communication for Adaptive Method Selection

学会选择:一种基于赋权与语义通信的自适应方法选择多智能体系统

Geremy Loachamín-Suntaxi, Robert Lazar, Dimitrios G. Giovanis, Ioannis G. Kevrekidis, Eleni D. Koronaki

机构 * Faculty of Science, Technology and Medicine(科学、技术与医学学院) University of Luxembourg(卢森堡大学) Johns Hopkins University(约翰霍普金斯大学) Luxembourg Institute of Science and Technology(卢森堡科学与技术研究院)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出一种结合上下文赌博机、结构化智能体间通信和语义检查点的多智能体框架,通过保持动作-结果因果一致性来提升科学计算工作流中自适应决策的收敛性、鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29734 2026-05-29 cs.CL 57%

HTAM: Hierarchical Transition-Attended Memory for Operator Optimization

HTAM: 用于算子优化的层次化过渡注意力记忆

Yining Zhang, Mingyang Yi, Chen Wang, Xuwen Xiang, Tianhe Jia, Zedong Dan, Chengqing Zong, Yue Wang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院) Renmin University of China(中国人民大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 提出HTAM框架,通过构建层次化过渡图(HTG)组织粗粒度全局方向和细粒度局部策略,解决LLM在GPU算子优化中粒度不匹配问题,显著提升正确率和加速比。

Comments 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29716 2026-05-29 cs.AI 57%

NaRA: Noise-Aware LoRA for Parameter-Efficient Fine-Tuning of Diffusion LLMs

NaRA: 面向扩散大语言模型参数高效微调的噪声感知LoRA

Shuaidi Wang, Zhan Zhuang, Ruping Huang, Yu Zhang

机构 * Department of Computer Science and Engineering, Southern University of Science and Technology, Shenzhen, China(南方科技大学计算机科学与工程系,深圳,中国) Department of Computer Science, City University of Hong Kong, Hong Kong, China(香港城市大学计算机科学系,香港,中国) Department of Computer Science and Engineering, Hong Kong University of Science and Technology, Hong Kong, China(香港理工大学计算机科学与工程系,香港,中国)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 针对扩散大语言模型,提出噪声感知低秩适配(NaRA),通过噪声条件超网络生成低秩核心矩阵,实现沿去噪轨迹连续变化的更新矩阵,在常识推理、数学推理和代码生成基准上优于噪声无关基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29687 2026-05-29 cs.AI cs.LO 57%

Reliable Reasoning with Large Language Models via Preference-Based Maximum Satisfiability

基于偏好最大可满足性的大语言模型可靠推理

Pedro Orvalho, Marta Kwiatkowska, Guillem Alenyà, Felip Manyà

机构 * Artificial Intelligence Research Institute (IIIA) Consejo Superior de Investigaciones Científicas (CSIC)(人工智能研究所(IIIA)西班牙国家科学研究委员会(CSIC)) Department of Computer Science University of Oxford(计算机科学系牛津大学) Institut de Robòtica i Informàtica Industrial (IRI-CSIC-UPC)(机器人与信息工业研究所(IRI-CSIC-UPC))

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出一种混合推理方法,通过LLM生成代码将自然语言问题编码为偏好最大可满足性问题,由精确求解器求解并独立验证,显著提高可行性。

Comments 17 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29354 2026-05-29 cs.CR cs.LG 57%

Harmless Yet Harmful: Neutral Prompting Attacks for Stealthy Hallucination Steering in Agent Skills

无害却有害:针对Agent技能中隐蔽幻觉引导的中性提示攻击

Chia-Yi Hsu, Chia-Mu Yu, Chun-Ying Huang, Jun Sakuma

机构 * Department of Computer Science(计算机科学系) National Yang Ming Chiao Tung University(阳明交通大学) Department of Electronics and Electrical Engineering(电子与电气工程系) School of Computing(计算学院) Institute of Science Tokyo(东京科学研究所)

专题命中 代码生成 :coding agent(abstract);分类 cs.LG

AI总结 本文提出中性提示攻击(NPA),通过语义上看似无害的指令(如鼓励想象和详尽性)增加代码生成Agent的包幻觉倾向,从而引入软件供应链风险,并评估了其对多种编码LLM的有效性和逃避防御的能力。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28482 2026-05-28 cs.SE 57%

Rethinking Software Empirical Studies with Structural Causal Models

用结构因果模型重新思考软件实证研究

Daniel Rodriguez-Cardenas, Aya Garryyeva, David Nader Palacio, Antonio Mastropaolo, Denys Poshyvanyk

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 提出CausalSE框架,利用结构因果模型(SCMs)解决混淆偏差,通过Galeras数据集和倾向得分匹配案例,揭示提示工程策略对代码生成的影响,强调因果分析可避免关联分析中的假阳性。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27935 2026-05-28 cs.AI 57%

Do Agents Think Deeper? A Mechanistic Investigation of Layer-Wise Dynamics in Sequential Planning

智能体思考得更深吗?顺序规划中层间动力学的机制研究

Zhenyu Cui, Xiangzhong Luo

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 通过残差流探针、因果层跳跃干预和有效深度测量,研究了大型语言模型在自主智能体任务(多轮规划、工具使用、迭代状态更新)中层间动态的差异,发现智能体推理表现出与静态任务不同的深度分布,随着轨迹展开,模型逐步招募更多更深层,且后期出现更强的长距离层间依赖,同时残差更新从稳定特征积累转向重复校准,有效深度分析揭示了语义方向形成较早而深层对稳定最终输出仍必要的构建-精炼差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06511 2026-05-28 cs.LG 57%

EvoMAS: Evolutionary Generation of Multi-Agent Systems

EvoMAS:多智能体系统的进化生成

Yuntong Hu, Yuting Zhang, Matthew Trager, Yi Zhang, Shuo Yang, Wei Xia, Stefano Soatto

机构 * Department of Computer Science, Emory University, Atlanta, GA, USA(埃默里大学计算机科学系)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 提出EvoMAS方法,将多智能体系统生成转化为结构化配置生成,通过进化算法在配置空间中优化,提升任务性能、可执行性和鲁棒性。

Comments ICML2026

Journal ref ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25447 2026-05-26 cs.CL 57%

GeoSVG-RL: Geometry-Aware Reinforcement Learning for Layout-Constrained Text-to-SVG Diagram Generation

GeoSVG-RL:面向布局约束的文本到SVG图表生成的几何感知强化学习

Sifan Li, Yujun Cai, Hongkai Chen, Yiwei Wang

机构 * University of California, Merced(加州大学梅尔德分校) The University of Queensland(昆士兰大学) vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 提出GeoSVG-RL框架,通过强化学习优化策略,利用几何反馈奖励(渲染有效性、画布适配、锚点放置、文本包含、图一致性和代码整洁性)解决文本到SVG图表生成中的结构脆弱性问题,显著提升箭头锚点精度和文本框内率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25384 2026-05-26 cs.CL 57%

GeoMathCode: Understanding Interleaved Math-Code Reasoning for Geometry Problem Solving

GeoMathCode: 理解几何问题求解中交织的数学-代码推理

Yingji Zhang, Yong Dai, André Freitas

机构 * Idiap Research Institute(Idiap研究 institute) X-Humanoid Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Cancer Biomarker Centre, CRUK Manchester Institute(癌症生物标志物中心,CRUK曼彻斯特研究所)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 本文提出GeoMathCode,通过程序化表示作为中间视觉输出,分析多模态大模型在几何问题中的推理与代码生成,发现推理与代码步骤在潜在空间可解耦,监督微调使推理流形更结构化,且层次化代码结构包含更多数学符号信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18396 2026-05-26 cs.CL 57%

River-LLM: Large Language Model Seamless Exit Based on KV Share

River-LLM:基于KV共享的大型语言模型无缝退出

Yingtao Shen, An Zou

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 针对解码器-only架构中早期退出因KV缓存缺失导致的延迟和精度问题,提出无需训练的River-LLM框架,通过轻量级KV共享退出流实现令牌级无缝退出,并利用状态转移相似性预测KV误差指导退出决策,在数学推理和代码生成任务上获得1.53-2.16倍实际加速且保持高质量。

Comments Accepted to ACL 2026, 13pages, with appendix. Corrected some typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25233 2026-05-26 cs.AI 57%

Meta-Agent: From Task Descriptions to Verified Multi-Agent Systems

Meta-Agent:从任务描述到经过验证的多智能体系统

Andy Xu, Yu-Wing Tai

机构 * Dartmouth College(达特茅斯学院)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出Meta-Agent两阶段框架,通过任务规划、网络搜索、代码生成和验证机制,自动从自然语言任务描述构建并执行可靠的多智能体系统,在编码、上下文学习和开放推理任务中提升成功率、错误恢复和工作流稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24784 2026-05-26 cs.AI 57%

GRAIL: AI translation for scientists application workflow on satellite data

GRAIL:面向卫星数据科学家应用工作流的AI翻译

Zhuocheng Shang, Ahmed Eldawy

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出GRAIL系统,通过LangGraph管道将Python地理空间工作流翻译为可扩展的Spark程序,无需科学家学习新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24521 2026-05-26 cs.SE 57%

From Prompting to Verification: How Experience Shapes Vibe Coding Practices

从提示到验证:经验如何塑造Vibe编码实践

Ahmed Fawzy, Amjed Tahir, Kelly Blincoe

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 通过调查162名不同经验水平的Vibe编码者,发现经验选择性影响编码动机、交互方式和质量保证实践,存在感知-行动差距:对AI生成代码风险的认识普遍,但评估、调试和验证能力依赖于经验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02688 2026-05-25 cond-mat.mtrl-sci cs.SE 57%

MatClaw: An Autonomous Code-First LLM Agent for End-to-End Materials Exploration

MatClaw: 一种用于端到端材料探索的自主代码优先LLM代理

Chenmu Zhang, Boris I. Yakobson

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 提出MatClaw,一种代码优先的LLM代理,通过直接编写和执行Python代码、结合四层记忆架构和检索增强生成,实现多代码工作流在远程HPC集群上的自主运行,并在铁电CuInP2S6的三个端到端演示中验证了其可靠性,同时通过文献自学习和专家约束弥合隐性领域知识差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05472 2026-05-25 cs.AI 57%

ALIVE: Awakening LLM Reasoning via Adversarial Learning and Instructive Verbal Evaluation

ALIVE: 通过对抗学习和指导性语言评估唤醒LLM推理

Yiwen Duan, Jing Ye, Xinpei Zhao

机构 * Independent Researcher(独立研究者)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出ALIVE框架,通过对抗学习与指导性语言反馈替代标量奖励,使模型内化推理逻辑,在数学、代码和逻辑推理任务中提升准确率、跨域泛化与自我修正能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22937 2026-05-25 cs.CL 57%

RAS: Reflection-Augmented Scaling with In-Context Learning for Executable Cypher Query Generation

RAS: 基于上下文学习的反射增强缩放用于可执行Cypher查询生成

Minseok Jung, Abhas Ricky, Muhammad Rameez Chatni

机构 * Cloudera

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 提出反射增强缩放(RAS)方法,利用执行错误反馈进行上下文学习,在Text2Cypher任务中显著降低查询执行错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22675 2026-05-22 cs.CL 57%

Self-Policy Distillation via Capability-Selective Subspace Projection

通过能力选择性子空间投影实现自我策略蒸馏

Guangya Hao, Yitong Shang, Yunbo Long, Zhuokai Zhao, Hanxue Liang

机构 * University of Cambridge(剑桥大学) HKUST(香港科技大学) University of Chicago(芝加哥大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 本文提出Self-Policy Distillation(SPD),通过从模型自身梯度中提取低维能力子空间,将关键值(KV)激活投影到该子空间,并在标准下一项预测损失下进行微调,实现了无需外部信号的通用且能力选择性的自我蒸馏方法。

详情

展开后加载摘要…

URL PDF HTML 收藏