arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-05 至 2026-06-05 共收录 26 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 26 篇

2606.06315 2026-06-05 cs.AI 92%

LLM Self-Recognition: Steering and Retrieving Activation Signatures

LLM 自我识别:引导与检索激活签名

Thibaud Ardoin, Jonas Schäfer, Gerhard Wunder

机构 * University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过随机稀疏向量引导内部残差流,在LLM生成文本中嵌入可检测指纹,实现高精度归属,同时保持文本质量。

Comments To appear in Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05972 2026-06-05 cs.LG 92%

LLM Explainability with Counterfactual Chains and Causal Graphs

基于反事实链和因果图的LLM可解释性

Nirit Nussbaum-Hoffer, Nitay Calderon, Liat Ein-Dor, Roi Reichart

机构 * Faculty of Data and Decision Sciences, Technion I IBM Research(数据与决策科学学院,技术离子IBM研究所)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出一种四阶段方法,利用因果图建模LLM推理过程,通过MCMC启发的反事实增强发现类判别性概念并生成可解释图,用于疾病诊断、情感分析等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27489 2026-06-05 cs.CY 90%

Auditing LLM Editorial Bias in News Media Exposure

审查新闻媒体曝光中的LLM编辑偏见

Marco Minici, Cristian Consonni, Federico Cinus, Giuseppe Manco

专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了LLM在新闻聚合中的编辑偏见问题,通过比较三种领先的LLM与Google News,发现LLM在媒体多样性、意识形态和可靠性方面存在显著差异。

Comments Under Peer Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06238 2026-06-05 cs.LG cond-mat.stat-mech hep-lat 90%

Generative Criticality in Large Language Model Temperature Scaling

大型语言模型温度缩放中的生成临界性

Huajian Ruan, Jinyang Li, Xingyu Guo, Lingxiao Wang

机构 * State Key Laboratory of Nuclear Physics and Technology, Institute of Quantum Matter, South China Normal University(核物理与技术国家重点实验室,量子物质研究院,华南师范大学) Key Laboratory of Atomic and Subatomic Structure and Quantum Control (MOE), Guangdong-Hong Kong Joint Laboratory of Quantum Matter(原子与亚原子结构及量子控制重点实验室(MOE),量子物质广深联合实验室) Guangdong Basic Research Center of Excellence for Structure and Fundamental Interactions of Matter, Guangdong Provincial Key Laboratory of Nuclear Science(物质结构与基本相互作用卓越基础研究中心,广东省核科学重点实验室) KEK Theory Center, Institute of Particle and Nuclear Studies(KEK理论中心,粒子与核物理研究所) RIKEN Center for Interdisciplinary Theoretical and Mathematical Sciences (iTHEMS), Wako(RIKEN交叉学科理论与数学科学中心(iTHEMS),Wako) Graduate University for Advanced Studies (SOKENDAI), Oho 1-1, Tsukuba, Ibaraki(高等研究大学(SOKENDAI),Oho 1-1,筑波,Ibaraki) Institute for Physics of Intelligence, The University of Tokyo(智能物理研究院,东京大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 通过统计场框架研究大型语言模型文本生成中的温度缩放,发现接近特征温度时出现类似连续相变的临界现象,为理解解码策略与临界现象的联系提供定量工具。

Comments 9 pages, 7 figures, contributed to PAI 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17256 2026-06-05 cs.CL 90%

Explainability of Large Language Models: Opportunities and Challenges toward Generating Trustworthy Explanations

大型语言模型的可解释性:朝着生成可信解释的方向机遇与挑战

Shahin Atakishiyev, Housam K. B. Babiker, Jiayi Dai, Nawshad Farruque, Teruaki Hayashi, Nafisa Sadaf Hriti, Md Abed Rahman, Iain Smith, Mi-Young Kim, Osmar R. Zaïane, Randy Goebel

机构 * University of Alberta(阿尔伯塔大学) University of Tokyo(东京大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文探讨了大型语言模型的可解释性问题,分析了局部可解释性和机械可解释性方法,并在医疗和自动驾驶两个关键领域进行了实验研究,总结了当前可解释性领域存在的问题和未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05890 2026-06-05 cs.CL cs.AI 90%

Staying with the Uncertainty: Uncertainty-Scaffolding Strategies for Artificial Moral Advisors in LLM-to-LLM Simulated Conversations

与不确定性共处:LLM对LLM模拟对话中人工道德顾问的不确定性支撑策略

Salvatore Greco, Hainiu Xu, Jacopo Domenicucci, Yulan He, Sylvie Delacroix

机构 * Centre for Data Futures, The Dickson Poon School of Law, King’s College London(数据未来中心、迪克森·普恩法学院、伦敦国王学院) Department of Informatics, King’s College London(信息学院、伦敦国王学院) LangAI, Center for Language AI Research, Tohoku University(LangAI、语言人工智能研究中心、东北大学) Neukom Institute for Computational Science, Dartmouth College(计算科学尼科姆研究所、达特茅斯学院)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 研究LLM作为人工道德顾问时,通过三种不确定性策略(视角倍增、张力保持、过程反思)与三种控制条件对比,在模拟对话中探讨如何帮助对话者“与不确定性共处”,发现不同策略在立场改变量上无差异但影响参与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05997 2026-06-05 cs.CV 90%

Multimodal Sexism Identification and Characterization using Large Language Models and Gradient Boosting

使用大语言模型和梯度提升的多模态性别歧视识别与表征

Kyriakos Chaviaras, Maria Lymperaiou, Athanasios Voulodimos

机构 * Artificial Intelligence and Learning Systems Laboratory(人工智能与学习系统实验室) School of Electrical and Computer Engineering(电气与计算机工程学院) National Technical University of Athens(雅典国家技术大学)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(title);language model(title)

AI总结 提出基于特征工程和梯度提升回归模型的后融合管道,结合视觉、文本、人口统计、生物特征及LLM语义指标,用于识别和表征模因和短视频中的多模态性别歧视。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05858 2026-06-05 cs.CL 89%

ReverseEOL: Improving Training-free Text Embeddings via Text Reversal in Decoder-only LLMs

ReverseEOL: 通过解码器仅LLM中的文本反转改进无训练文本嵌入

Ailiang Lin, Zhuoyun Li, Yusong Wang, Keyu Mao, Kotaro Funakoshi, Manabu Okumura

机构 * Institute of Science Tokyo(东京科学研究所) Tencent(腾讯)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出ReverseEOL方法,通过反转输入文本生成互补嵌入,结合前向嵌入提升冻结解码器仅LLM的文本表示能力,在STS和MTEB基准上显著提升无训练基线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06214 2026-06-05 cs.SE cs.AI 89%

Towards the Readability of LLM-Generated Codes through Multitask Representation Engineering

面向大语言模型生成代码可读性的多任务表示工程

Huifan Gao, Liuhua He, Yinghui Pan, Shenbao Yu, Yifeng Zeng, Shengchao Qin, Weidi Sun

机构 * School of Aerospace Engineering, Xiamen University(厦门大学航空航天工程学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) College of Computer and Cyber Security, Fujian Normal University(福建师范大学计算机与网络安全部分) Department of Computer & Information Sciences, Northumbria University(北爱尔兰北安普顿大学计算机与信息科学系) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Peking University(北京大学)

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出多任务表示工程框架,通过低数据依赖和低计算成本的表示工程方法提升LLM生成代码的可读性,并理论分析其对可读性与正确性权衡的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02750 2026-06-05 cs.CL 88%

On the Persistent Effects of Lexicality in Large Language Models

论词汇性在大语言模型中的持久影响

Hammad Rizwan, Muhammad Umair Haider, Nishant Subramani, Mona T. Diab, A. B. Siddique, Hassan Sajjad

机构 * Dalhousie University(达尔豪斯大学) University of Kentucky(肯塔基大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文通过对抗性语义压力测试和信息论视角,量化了大语言模型中词汇重叠相对于语义内容的影响,发现词汇影响贯穿模型深度,并在中间层出现词汇和语义信号同时衰减的过渡区域,进而以摘要和模型编辑为例展示了词汇影响对下游任务的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10063 2026-06-05 cs.CL cs.AI math.AT 87%

Hallucination Detection in LLMs with Topological Divergence on Attention Graphs

基于注意力图拓扑分歧的LLM幻觉检测

Alexandra Bazarova, Andrei Volodichev, Aleksandr Yugay, Andrey Shulga, Alina Ermilova, Konstantin Polev, Julia Belikova, Rauf Parchiev, Dmitry Simakov, Maxim Savchenko, Andrey Savchenko, Serguei Barannikov, Alexey Zaytsev

机构 * Applied AI Institute(应用人工智能研究所) SB AI Lab(SB人工智能实验室) HSE University(俄罗斯高等经济学院) CNRS, Universite Paris Cite(法国国家科学研究中心,巴黎Cité大学)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TOHA方法,通过分析注意力矩阵的拓扑结构来检测LLM中的幻觉现象,实验表明该方法在多个基准测试中表现优异,且对标注数据和计算资源需求较低。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26233 2026-06-05 cs.CL 86%

Ask or Assume? Uncertainty-Aware Clarification-Seeking in Coding Agents

提问还是假设?编码代理中的不确定性意识澄清寻求

Nicholas Edwards, Sebastian Schuster

机构 * Faculty of Computer Science, University of Vienna(维也纳大学计算机科学系) UniVie Doctoral School Computer Science, University of Vienna(维也纳大学计算机科学博士学院)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究评估了LLM代理在未指定任务中的澄清能力,提出了一种不确定性意识的多代理框架,提高了任务解决率,并展示了多代理系统在复杂任务中主动寻求信息的行为。

Comments 18 pages, 7 figures; added experiments evaluating open-weight models (Kimi K2.6), expanded related work, and included dataset validation details

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05557 2026-06-05 cs.CL 83%

AURA: Intent-Directed Probing for Implicit-Need Surfacing in Situated LLM Agents

AURA: 面向情境化LLM代理中隐式需求挖掘的意图导向探测

Yang Li, Jiaxiang Liu, Jiang Cai, Mingkun Xu

机构 * Guangdong Institute of Intelligence Science and Technology(广东省智能科学与技术研究院)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL

AI总结 提出AURA方法,通过在场景感知和工具使用之间插入意图推理步骤生成IntentFrame,以结构化估计隐式需求并控制探测预算,在隐式意图基准上提升覆盖率达+0.07,同时减少82%的探测次数并避免隐私违规。

Comments Submitted to EMNLP 2026. Code, simulator, and benchmark: https://github.com/innovation64/AURA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01844 2026-06-05 cs.CL 83%

The Cylindrical Representation Hypothesis for Language Model Steering

语言模型引导的圆柱表示假说

Lang Gao, Jinghui Zhang, Wei Liu, Fengxian Ji, Chenxi Wang, Zirui Song, Akash Ghosh, Youssef Mohamed, Preslav Nakov, Xiuying Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 提出圆柱表示假说(CRH),通过放宽线性表示假说(LRH)的正交性假设,解释语言模型引导中的不稳定性和不确定性。

Comments ICML 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06333 2026-06-05 cs.LG cs.AI 82%

Subspace-Aware Sparse Autoencoders for Effective Mechanistic Interpretability

子空间感知稀疏自编码器用于有效的机制可解释性

Seyed Arshan Dalili, Mehrdad Mahdavi

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对稀疏自编码器将特征假设为一维导致特征分裂的问题,提出子空间感知稀疏自编码器(SASA),通过学习解码器子空间、块稀疏门控和核范数正则化,在GPT-2和Mistral-7B上减少特征分裂和吸收,提高单义性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05378 2026-06-05 cs.LG cs.AI 81%

Pattern Selectivity is Not Task-Causal Structure: A Cross-Architecture Mechanistic Study of Composed-Task Circuits in 1B-Class Language Models

模式选择性并非任务因果结构:1B类语言模型中组合任务电路的跨架构机制研究

Yongzhong Xu

机构 * B-Class Language Models(1B类语言模型) Cross-Architecture Mechanistic Study(跨架构机理研究)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 通过统一协议测试三个1B类语言模型在四个组合任务上的注意力头电路,发现不同模型对同一任务使用不同的注意力模式,并引入五类筛选结果分类法,提出MoE模型基于前一个token位置基板构建组合任务电路的可证伪假设。

Comments 27 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06273 2026-06-05 cs.IT cs.AI math.IT 79%

Adapting Diffusion Language Models for Lossless Pixel-Level Image Transmission

适应扩散语言模型用于无损像素级图像传输

Tianqi Ren, Rongpeng Li, Xianfu Chen, Yingyu Li, Zhifeng Zhao

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Shenzhen CyberAray Network Technology Co., Ltd(深圳CyberAray网络技术有限公司) School of Mechanical Engineering and Electronic Information, China University of Geosciences(中国地质大学(武汉)机械与电子信息学院) Zhejiang Lab(浙江实验室)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 提出基于离散扩散模型的分离源信道编码框架DDM-SSCC,通过双向注意力下的同步逆向算术编码实现无损像素级图像传输,并引入Halton引导去噪顺序、掩码率感知余弦调度和轻量温度校准模块提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05626 2026-06-05 cs.CL cs.AI cs.LG 75%

When New Generators Arrive: Lifelong Machine-Generated Text Attribution via Ridge Feature Transfer

当新生成器到来:基于岭特征迁移的终身机器生成文本归因

Zhen Sun, Yifan Liao, Zhicong Huang, Jiaheng Wei, Cheng Hong, Yutao Yue, Xinlei He

机构 * Wuhan University(武汉大学) Ant Group(蚂蚁集团) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Institute of Deep Perception Technology, JITRI(感知技术研究院,JITRI)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对终身机器生成文本归因中持续适应新生成器与保留旧知识难以平衡的问题,提出轻量级分析更新框架RidgeFT,通过协方差校准和固定随机特征实现无需示例回放的闭式更新。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22580 2026-06-05 cs.CL cs.AI cs.LG 75%

SpanNorm: Reconciling Training Stability and Performance in Deep Transformers

SpanNorm: 在深度Transformer中协调训练稳定性与性能

Chao Wang, Bei Li, Jiaqi Zhang, Xinyu Liu, Yuchun Fan, Linkun Lyu, Xin Chen, Jingang Wang, Tong Xiao, Peng Pei, Xunliang Cai

机构 * Meituan Inc.(美团公司) NLP Lab, School of Computer Science and Engineering(自然语言处理实验室,计算机科学与工程学院) Northeastern University, Shenyang, China(东北大学,沈阳,中国)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SpanNorm技术,通过结合前归一化和后归一化的优势,解决深度Transformer中训练稳定性与性能之间的根本性权衡问题,理论分析和实验结果表明其在密集和专家混合(MoE)场景中均优于传统归一化方案。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05843 2026-06-05 cs.CL cs.AI 73%

Mechanistic Insights into Functional Sparsity in Multimodal LLMs via CoRe Heads

多模态大语言模型中通过CoRe头的功能稀疏性机制洞察

Ruoxi Sun, Quantong Qiu, Juntao Li, Zecheng Tang, Yihang Lou, Min Zhang

机构 * Soochow University(苏州大学) Peking University(北京大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过识别和分析CoRe头,揭示多模态大语言模型在跨模态检索中功能稀疏的结构特性,并验证其必要性及加速推理的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07253 2026-06-05 cs.AI cs.CL 73%

From Out-of-Distribution Detection to Hallucination Detection: A Geometric View

从分布外检测到幻觉检测:一个几何视角

Litian Liu, Reza Pourreza, Yubing Jian, Yao Qin, Roland Memisevic

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过将幻觉检测重新定义为分布外检测问题,利用几何视角提出了一种无需训练、基于单样本的检测方法,在推理任务中实现了高准确率。

Comments ICML 2026 main conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05641 2026-06-05 cs.CV 71%

Multi-Task Crack Foundation Model for Engineering-Reliable Crack Representation and Topology Preservation in Civil Infrastructure

面向工程可靠裂缝表示与拓扑保持的土木基础设施多任务裂缝基础模型

Blessing Agyei Kyem, Joshua Kofi Asamoah, Eugene Denteh, Armstrong Aboah

机构 * NDSU(内达苏大学)

专题命中 知识编辑与模型理解 :foundation model(title)

AI总结 提出 CrackGeoFM 多任务框架,结合冻结视觉基础骨干与裂缝专用适配模块,实现掩码预测、骨架重建和不确定性估计,在20个数据集上达到最优分割、拓扑保持和校准不确定性。

Comments 60 pages, 17 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06342 2026-06-05 stat.ML cs.LG 70%

Symmetric Divergence and Normalized Similarity: A Unified Topological Framework for Representation Analysis

对称散度与归一化相似性:表示分析的统一拓扑框架

Yan Wang, Tianyang Hu

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳))

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出对称表示拓扑散度(SRTD)和归一化拓扑相似性(NTS),分别解决现有拓扑散度的非对称性和无界性问题,实现细粒度结构诊断与跨场景标准化评估。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16311 2026-06-05 stat.ML cs.LG stat.ME 70%

Generator-Mediated Bandits: Thompson Sampling for GenAI-Powered Adaptive Interventions

生成器介导的老虎机:面向生成式人工智能的自适应干预的汤普森采样

Marc Brooks, Gabriel Durham, Kihyuk Hong, Ambuj Tewari

机构 * Department of Statistics, University of Michigan, Ann Arbor, MI (USA)(密歇根大学统计学系,安阿伯,MI (美国))

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种生成器介导的老虎机算法(GAMBITTS),用于解决生成式人工智能(GenAI)驱动的自适应干预问题。该算法通过建模治疗和奖励生成过程,利用观察到的治疗信息加速策略学习,并在模拟研究中优于传统算法。

Comments 39 pages, 12 figures

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06485 2026-06-05 cs.CV 67%

PAR3D: A Unified 3D-MLLM with Part-Aware Representation for Scene Understanding

PAR3D: 一种用于场景理解的统一部件感知3D多模态大语言模型

Shaohui Dai, Yansong Qu, You Shen, Shengchuan Zhang, Liujuan Cao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(教育部多媒体可信感知与高效计算重点实验室,厦门大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 提出PAR3D框架,通过部件感知3D表示学习和层次化分割查询生成,解决现有3D-MLLM在细粒度部件理解上的不足,在部件级问答和指代分割任务上取得显著提升。

Comments Project page: https://atrovast.github.io/PAR3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05173 2026-06-05 cs.CL cs.AI 62%

Predict and Reconstruct: Joint Objectives for Self-Supervised Language Representation Learning

预测与重构:自监督语言表示学习的联合目标

Aimen Boukhari

机构 * École Nationale Supérieure d’Informatique (ESI)(阿尔及利亚国家信息学院(ESI))

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种结合JEPA潜空间预测损失与MLM目标的混合预训练目标,通过可学习标量平衡两者,在GLUE基准上分析表明混合编码器产生更均匀的嵌入和更丰富的谱几何,且语义-词汇平衡更优。

Comments 12 pages, 10 figures, 11 tables. Preprint. Code available at : https://github.com/aymen-000/predict-reconstruct-language-models

详情

展开后加载摘要…

URL PDF HTML 收藏