arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7539 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7539 篇

2602.12418 2026-06-30 cs.CR cs.CL cs.LG 84%

Sparse Autoencoders are Capable LLM Jailbreak Mitigators

稀疏自编码器是LLM劫持攻击缓解器

Yannick Assogba, Jacopo Cortellazzi, Javier Abad, Pau Rodriguez, Xavier Suau, Arno Blaas

专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于SAE的CC-Delta方法,通过比较带有和无劫持上下文的有害请求的token级表示,识别劫持相关的稀疏特征,从而在稀疏SAE特征空间中实现更优的安全-效用权衡。

Comments Accepted at the Mechanistic Interpretability Workshop, ICML 2026. 31 pages, 20 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24102 2026-06-24 cs.CL cs.LG 新提交 84%

PORTER: Language-Grounded Event Representations for Portable Structured EHR Foundation Models

PORTER:面向便携式结构化电子健康记录基础模型的语言基础事件表示

Lin Lawrence Guo, Adam Paul Yan, Emily Vettese, Lillian Sung

机构 * Child Health Evaluative Sciences(儿童健康评估科学) The Hospital for Sick Children(圣母医院) Division of Haematology/Oncology(血液肿瘤科)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 提出PORTER模型,通过冻结文本编码器和数值路径解耦事件表示与固定词汇,实现跨词汇迁移,在儿科医院74项临床任务中匹配基线性能,跨词汇迁移恢复97.1% AUROC,并在MIMIC上优于固定词汇模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10198 2026-06-11 cs.LG cs.AI cs.CV 版本更新 84%

Density Ridge Selective Prediction for LLM and VLM Hallucination Detection under Calibration Label Scarcity

密度脊选择性预测:校准标签稀缺下的大语言模型与视觉语言模型幻觉检测

Nina I. Shamsi

机构 * Northeastern University Boston, United States(东北大学波士顿分校)

专题命中 知识编辑与模型理解 :LLM(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对校准标签稀缺时大语言模型和视觉语言模型的幻觉检测问题,提出基于核密度估计的密度脊方法,利用隐藏状态生成轨迹的六维运动特征图构建响应流形,通过到最近脊顶点的欧氏距离评分,在标签稀缺协议下AUROC提升5-20点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09646 2026-06-09 cs.CV cs.AI cs.LG 新提交 84%

Do Video Foundation Models Understand Intuitive Physics? A Layerwise Probing Analysis

视频基础模型是否理解直觉物理?逐层探测分析

Samuele Punzo, Niccolò Caselli, Ippokratis Pantelidis, Francesco Massafra, Salvatore Lo Sardo, Mohammadreza Salehi

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 通过冻结特征探测,研究预训练视频基础模型在直觉物理信息上的编码能力,发现V-JEPA表现最佳,物理信息在中后期层最易获取,且时序破坏显著降低性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00566 2026-06-02 cs.LG cs.CL cs.CR 84%

Same Payload, Different Channel: Measuring Trust Asymmetry in Tool-Using Language Models

相同载荷,不同通道:测量使用工具的語言模型中的信任不对称性

Mohammed Sameer Syed, Rozhin Yasaei

机构 * University of Arizona(亚利桑那大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.LG

AI总结 本研究提出安全不对称分数(SAS),通过匹配恶意载荷仅改变传递上下文,系统测量了语言模型在不同通道(用户消息、工具元数据、工具输出)中对对抗性内容的脆弱性差异,发现代理原生模型在工具描述通道更脆弱,而通用模型相反,且机制研究表明安全相关表示在深层网络非线性编码。

Comments 13 pages, 1 figure. Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25459 2026-05-26 cs.LG cs.AI 84%

From Simulation to Enaction: Post-trained language models recognize and react to their own generations

从模拟到行动:后训练语言模型识别并回应自身生成

Asvin G., Jack Lindsey

机构 * Institute for Advanced Study, Princeton(普林斯顿高级研究院) Anthropic

专题命中 知识编辑与模型理解 :language model(title,abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文发现后训练语言模型能够识别自身生成(on-policy)并降低输出熵,通过内部表示输入意外性来调节,且显式识别与隐式识别机制不同。

Comments Anthropic fellows project mentored by Jack Lindsey

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06576 2026-05-12 cs.CL cs.AI 84%

Virtual Personas for Language Models via an Anthology of Backstories

通过背景区 anthology 为语言模型构建虚拟人物

Suhong Moon, Marwa Abdulhai, Minwoo Kang, Joseph Suh, Widyadewi Soedarmadji, Eran Kohen Behar, David M. Chan, John Canny

机构 * University of California, Berkeley(加州大学伯克利分校) Google LLC(谷歌公司)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 anthology 方法,利用开放性生活叙述引导语言模型生成特定虚拟人物,提升实验结果的一致性和可靠性,通过三个人类调查发现其在匹配响应分布和一致性指标上分别提升18%和27%。

Comments EMNLP 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06480 2026-05-08 cs.AI cs.CL 84%

Patch-Effect Graph Kernels for LLM Interpretability

用于LLM可解释性的补丁效应图核

Ruben Fernandez-Boullon, David N. Olivieri

机构 * Department of Computer Science, University of Vigo(维戈大学计算机科学系)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文提出将机械可解释性分析转化为图机器学习问题,通过补丁效应图分析模型组件的激活补丁特征,提升不同任务下的结构比较能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01555 2026-05-05 cs.CL cs.AI cs.HC 84%

Automated Interpretability and Feature Discovery in Language Models with Agents

在语言模型中通过代理实现自动化可解释性和特征发现

Arnau Marin-Llobet, Javier Ferrando

机构 * Harvard University(哈佛大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个自主多代理框架,用于自动化大型语言模型的内部特征发现与解释,通过两个耦合循环提升解释精度和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23719 2026-04-29 cs.CL cs.AI 84%

AIPsy-Affect: A Keyword-Free Clinical Stimulus Battery for Mechanistic Interpretability of Emotion in Language Models

AIPsy-Affect:一种无关键词的临床刺激电池,用于语言模型中情绪的机制可解释性

Michael Keeman

机构 * Keido Labs(Keido实验室)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出AIPsy-Affect,一种480项的临床刺激电池,通过叙事情境引发Plutchik的八种基本情绪,消除关键词混淆,支持情绪机制的可解释性研究。

Comments Dataset paper. 12 pages + appendix, 2 figures. Dataset available at https://huggingface.co/datasets/keidolabs/aipsy-affect. MIT license

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19974 2026-04-23 cs.LG cs.CL 84%

Are LLM Uncertainty and Correctness Encoded by the Same Features? A Functional Dissociation via Sparse Autoencoders

语言模型的不确定性和正确性是否由相同特征编码?通过稀疏自编码器的函数解离

Het Patel, Tiejin Chen, Hua Wei, Evangelos E. Papalexakis, Jia Chen

机构 * University of California, Riverside(加州大学河滨分校) Arizona State University(亚利桑那州立大学)

专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究通过稀疏自编码器探讨语言模型的不确定性与正确性是否由同一内部机制驱动,发现三类功能不同的特征群体,揭示其在模型性能中的作用差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08798 2026-04-13 cs.CL cs.AI 84%

Structured Uncertainty guided Clarification for LLM Agents

结构不确定性引导的LLM代理澄清

Manan Suri, Puneet Mathur, Nedim Lipka, Franck Dernoncourt, Ryan A. Rossi, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校) Adobe Research(Adobe研究院)

专题命中 知识编辑与模型理解 :LLM(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出结构不确定性框架,通过量化潜在问题的澄清价值,提升LLM代理在模糊任务中的推理效率和训练效率,展示了其在SAGE-Agent和ClarifyBench中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04743 2026-04-07 cs.CL cs.AI cs.SY eess.SY 84%

Hallucination Basins: A Dynamic Framework for Understanding and Controlling LLM Hallucinations

幻觉盆地:一种动态框架用于理解和控制LLM幻觉

Kalyan Cherukuri, Lav R. Varshney

机构 * Illinois Mathematics and Science Academy(伊利诺伊数学与科学学院) AI Innovation Institute, Stony Brook University(石溪大学人工智能创新研究所)

专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出几何动态系统框架,通过分析潜在空间中的盆地结构来理解LLM幻觉现象,发现任务依赖性显著影响分离性,并通过任务复杂度和多盆地定理展示几何感知引导可降低幻觉概率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01504 2026-04-03 cs.CL cs.AI cs.CY 84%

Magic, Madness, Heaven, Sin: LLM Output Diversity is Everything, Everywhere, All at Once

魔术、疯狂、天堂、罪恶:LLM输出多样性无处不在

Harnoor Dhingra

机构 * Microsoft(微软)

专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Magic, Madness, Heaven, Sin框架,从四个规范性场景分析LLM输出多样性,揭示任务目标对输出多样性的影响,强调需基于任务目标进行多样性评估。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23524 2026-03-26 cs.CL cs.AI 84%

Navigating the Concept Space of Language Models

在语言模型的概念空间中导航

Wilson E. Marcílio-Jr, Danilo M. Eler

机构 * Adaption Labs(Adaption实验室) São Paulo State University (UNESP)(圣保罗州立大学(UNESP))

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Concept Explorer系统,通过层次化邻域嵌入组织SAE特征,实现对语言模型概念的可扩展交互探索,揭示高阶结构、有意义子簇和稀有概念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20975 2026-03-24 cs.CL cs.LG 84%

DiscoUQ: Structured Disagreement Analysis for Uncertainty Quantification in LLM Agent Ensembles

DiscoUQ:用于LLM代理集合不确定性量化中的结构分歧分析

Bo Jiang

机构 * Temple University(Temple 大学)

专题命中 知识编辑与模型理解 :LLM(title,abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出DiscoUQ框架,通过分析代理间分歧的结构特性,提升不确定性量化效果,实验表明其在多个基准测试中表现优异,尤其在弱分歧层级表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23914 2026-03-19 cs.CL cs.AI 84%

Probing Association Biases in LLM Moderation Over-Sensitivity

探测LLM内容审查中的关联偏差过灵敏问题

Yuxin Wang, Botao Yu, Ivory Yang, Saeed Hassanpour, Soroush Vosoughi

机构 * Department of Computer Science, Dartmouth College(达特茅斯大学计算机科学系) Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系)

专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究LLM在内容审查中因主题关联偏差导致的过灵敏问题,提出Topic Association Analysis方法,发现高级模型在误报中存在更强的主题关联偏移,表明需结合关键词过滤与学习主题关联来缓解。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08139 2026-03-18 cs.CL cs.AI 84%

Can LLMs Detect Their Confabulations? Estimating Reliability in Uncertainty-Aware Language Models

LLMs能否检测其编造?在不确定性感知语言模型中估计可靠性

Tianyi Zhou, Johanne Medina, Sanjay Chawla

机构 * KTH Royal Institute of Technology(皇家理工学院) QCRI, HBKU(哈马德 bin 玉素菲大学量子计算与人工智能研究所)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了上下文信息如何影响模型行为,并提出利用token级不确定性来指导内部表示聚合的可靠性估计方法,通过实验发现正确上下文能提升回答准确性,而误导性上下文常导致自信错误响应。

Comments Published at AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15615 2026-03-17 cs.CL cs.AI 84%

Mechanistic Origin of Moral Indifference in Language Models

语言模型中道德冷漠的机制起源

Lingyu Li, Yan Teng, Yingchun Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示语言模型存在内在道德冷漠,通过构建道德向量并重构其拓扑关系,提升道德推理能力,实现75%的对抗性基准测试胜率。

Comments 24 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05771 2026-03-16 cs.CL cs.AI 84%

Evidence from fMRI Supports a Two-Phase Abstraction Process in Language Models

fMRI证据支持语言模型中的两阶段抽象过程

Emily Cheng, Richard J. Antonello

机构 * Universitat Pompeu Fabra Barcelona(巴塞罗那庞培乌法布拉大学) Columbia University(哥伦比亚大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过fMRI数据表明,语言模型中存在两阶段抽象过程,中间层在预测自然语言刺激脑响应方面表现更优,且抽象过程随训练进行自然形成,与表示的内在维度性有关。

Comments Equal contribution from both authors. Submitted to NeurIPS NeuroAI workshop 2024

Journal ref Best abstract at NeurIPS UniReps 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10587 2026-02-23 cs.CL cs.AI 84%

Anthropomimetic Uncertainty: What Verbalized Uncertainty in Language Models is Missing

拟人化不确定性:语言模型中言语不确定性所缺失的内容

Dennis Ulmer, Alexandra Lorson, Ivan Titov, Christian Hardmeier

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了语言模型中言语不确定性缺失的问题,提出拟人化不确定性的概念,旨在通过模仿人类语言行为提升模型的可信度和人机协作效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08984 2026-02-10 cs.CL cs.AI 84%

Next Concept Prediction in Discrete Latent Space Leads to Stronger Language Models

在离散潜在空间中进行下一步概念预测可使语言模型更强大

Yuliang Liu, Yunchong Song, Yixuan Wang, Kewen Ge, Alex Lamb, Qipeng Guo, Kai Chen, Bowen Zhou, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Department of Electronic Engineering(电子工程系) College of Artificial Intelligence(人工智能学院) Tsinghua University(清华大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 知识编辑与模型理解 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 通过在离散潜在空间中进行下一步概念预测,ConceptLM在预训练任务中实现了更强大的语言模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10602 2026-02-10 cs.CV cs.AI cs.CL 84%

TruthPrInt: Mitigating Large Vision-Language Models Object Hallucination Via Latent Truthful-Guided Pre-Intervention

TruthPrInt: 通过潜在真实引导预干预缓解大视觉-语言模型对象幻觉

Jinhao Duan, Fei Kong, Hao Cheng, James Diffenderfer, Bhavya Kailkhura, Lichao Sun, Xiaofeng Zhu, Xiaoshuang Shi, Kaidi Xu

机构 * Drexel University(德雷塞尔大学) University of Electronic Science and Technology of China(电子科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) LLNL(劳伦斯利弗莫尔国家实验室) Lehigh University(莱斯大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 TruthPrInt通过学习真相方向并引导解码过程,有效缓解大视觉-语言模型中的对象幻觉问题。

Comments 15 pages, 9 figures, the first two authors contributed equally, Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04918 2026-02-09 cs.LG cs.CL cs.CY 84%

Simulated Adoption: Decoupling Magnitude and Direction in LLM In-Context Conflict Resolution

模拟采纳:在大语言模型上下文冲突解决中解耦幅度与方向

Long Zhang, Fangwei Lin

专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究揭示大语言模型在解决上下文冲突时通过几何位移机制实现模拟采纳,而非单纯抑制知识幅度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01771 2026-02-03 cs.CL cs.AI cs.NI 84%

<SOG_k>: One LLM Token for Explicit Graph Structural Understanding

<SOG_k>: 一个LLM令牌用于显式图结构理解

Jingyao Wu, Bin Lu, Zijun Di, Xiaoying Gan, Meng Jin, Luoyi Fu, Xinbing Wang, Chenghu Zhou

机构 * Shanghai Jiao Tong University(上海交通大学) IGSNRR, Chinese Academy of Sciences(中科院信息融合国家重点实验室)

专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出<SOG_k>令牌,通过统一令牌空间实现图结构的显式表示,提升LLM对图结构的理解、生成和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19723 2026-01-28 cs.CL cs.AI 84%

Component-Level Lesioning of Language Models Reveals Clinically Aligned Aphasia Phenotypes

语言模型组件级损伤揭示临床对齐的失语症表型

Yifan Wang, Jichen Zheng, Jingyuan Sun, Yunhao Zhang, Chunyu Ye, Jixing Li, Chengqing Zong, Shaonan Wang

机构 * Department of Computer Science, The University of Manchester, UK(曼彻斯特大学计算机科学系) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, CAS, Beijing, China(多模态人工智能系统国家重点实验室,中国科学院自动化研究所,北京) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院,北京) Department of Linguistics and Translation, City University of Hong Kong, Hong Kong(香港城市大学语言学与翻译系) Department of Language Science and Technology, Hong Kong Polytechnic University, Hong Kong(香港理工大学语言科学与技术系)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 通过模块化LLM的组件级损伤模拟失语症,揭示临床相关的语言功能退化机制

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05309 2026-01-21 q-bio.QM cs.AI cs.CL 84%

ProtSAE: Disentangling and Interpreting Protein Language Models via Semantically-Guided Sparse Autoencoders

ProtSAE:通过语义引导的稀疏自编码器解构和解释蛋白质语言模型

Xiangyu Liu, Haodi Lei, Yi Liu, Yang Liu, Wei Hu

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 ProtSAE通过语义引导的稀疏自编码器解构蛋白质语言模型,提升其潜在空间中生物相关特征的可解释性与重建保真度。

Comments Accepted in the 39th AAAI Conference on Artificial Intelligence (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07873 2026-01-14 cs.LG cs.AI 84%

Multiplicative Orthogonal Sequential Editing for Language Models

乘法正交序列编辑用于语言模型

Hao-Xiang Xu, Jun-Yu Ma, Ziqi Peng, Yuhao Sun, Zhen-Hua Ling, Jia-Chen Gu

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 MOSE通过乘法正交矩阵编辑方法提升语言模型的序列编辑性能,同时保持一般能力。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04948 2026-01-14 cs.CL cs.AI 84%

KaLM: Knowledge-aligned Autoregressive Language Modeling via Dual-view Knowledge Graph Contrastive Learning

KaLM: 通过双视角知识图谱对比学习实现知识对齐的自回归语言模型

Peng Yu, Cheng Deng, Beiya Dai, Xinbing Wang, Ying Wen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 KaLM通过双视角知识图谱对比学习和三元组完成语言模型,实现LLMs与知识图谱的对齐,提升知识驱动任务的性能。

Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-026-50906-6}

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20443 2026-01-13 cs.LG cs.AI 84%

Towards Mitigating Excessive Forgetting in LLM Unlearning via Entanglement-Guidance with Proxy Constraint

面向通过纠缠引导与代理约束缓解大语言模型卸载过度遗忘的方案

Zhihao Liu, Jian Lou, Yuke Hu, Xiaochen Li, Yitian Chen, Tailun Chen, Zhizhen Qin, Kui Ren, Zhan Qin

机构 * Zhejiang University(浙江大学) Sun Yat-sen University(中山大学) Amazon(亚马逊)

专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 EGUP通过纠缠引导与代理约束缓解大语言模型卸载过度遗忘问题,提升卸载-效用权衡性能。

详情

展开后加载摘要…

URL PDF HTML 收藏