arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-29 至 2026-05-29 共收录 54 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 54 篇

2605.29303 2026-05-29 cs.AI 92%

Entropy-KL Divergence-based Token Masking: A Novel Approach for Selective Fine-tuning of Large Language Models

基于熵-KL散度的令牌掩码:一种用于大语言模型选择性微调的新方法

Qi Liu, Mingdi Sun, Yongyi He, Zhi Zheng, Tong Xu, Yi Zheng, Zhefeng Wang, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Cloud(华为云)

专题命中 指令微调 :SFT(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);post-training(abstract)

AI总结 针对低数据场景下标准监督微调导致模型分布偏移的问题,提出EKSFT方法,通过选择性掩码高熵或高KL散度的令牌,在注入任务知识的同时保持预训练分布完整性,在数学推理基准上优于标准SFT并提升后续RL性能。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29496 2026-05-29 cs.CL cs.CV 92%

On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training

视觉语言模型后训练中推理与感知的非对称优化研究

Xueqing Wu, Yu-Chi Lin, Kai-Wei Chang, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 通过合成任务诊断发现,后训练中推理提升显著优于感知,SFT源于感知token少导致训练信号弱,RL源于奖励耦合,提出动态重加权损失和感知奖励可缓解不平衡并提升端到端性能。

Comments Project: https://asymmetric-vlm-post-training.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01058 2026-05-29 cs.LG cs.AI cs.CL 92%

Good SFT Optimizes for SFT, Better SFT Prepares for Reinforcement Learning

好的SFT优化SFT,更好的SFT为强化学习做准备

Dylan Zhang, Yufeng Xu, Haojin Wang, Qingzhi Chen, Hao Peng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) New York University (Shanghai)(纽约大学(上海))

专题命中 指令微调 :SFT(title,title_cn);LLM(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对当前SFT-RL流程中离线SFT数据分布与在线RL策略分布不匹配的问题,提出基于策略评估的离线学习损失重加权方法PEAR,通过重要性采样重加权SFT损失,提升后续RL训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30148 2026-05-29 cs.LG cs.AI 92%

Overcoming Forgetting in LLM Fine-Tuning with Evolution Strategies

克服LLM微调中的遗忘:进化策略方法

Kajetan Schweighofer, Conor F. Hayes, Roberto Dailey, Risto Miikkulainen, Xin Qiu

机构 * Cognizant AI Lab(Cognizant AI实验室) UT Austin(得克萨斯大学奥斯汀分校)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文发现进化策略微调中的先前任务遗忘实为性能漂移且可恢复,并引入锚定权重衰减(AWD)正则化技术有效稳定先前任务性能,表明遗忘可避免,使ES成为LLM持续学习的可行方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29394 2026-05-29 cs.AI 92%

EvoMD-LLM: Learning the Language of Species Evolution in Reactive Molecular Dynamics

EvoMD-LLM:学习反应分子动力学中物种进化的语言

Zhichen Tang, Zhengzheng Dang, Yulin Chen, Jixin Wu, Haiwen Li, Yanming Wang

机构 * Global College, Shanghai Jiao Tong University(上海交通大学全球学院) Global Institute of Future Technology, Shanghai Jiao Tong University(上海交通大学未来技术全球研究院)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出EvoMD-LLM框架,将反应分子动力学轨迹离散化为符号时间序列,通过时间脚手架机制使自回归大语言模型学习物种组成演化,在多项时间预测任务上优于基线模型,并能生成可解释性预测。

Comments 17 pages, ACL Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30247 2026-05-29 cs.LG cs.MM 91%

OOD-GraphLLM: Graph Large Language Model for Out-of-Distribution Generalized Drug Synergy Prediction

OOD-GraphLLM:面向分布外泛化的药物协同预测图大语言模型

Xin Wang, Linxin Xiao, Yang Yao, Wenwu Zhu

机构 * DCST, BNRist, Tsinghua University(国防科技大学、北京理工大学、清华大学) DCST, Tsinghua University(国防科技大学、清华大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);instruction tuning(abstract)

AI总结 针对药物协同预测中因新化合物导致的分布外偏移问题,提出OOD-GraphLLM框架,通过联合优化分子图表示与生物医学语义语言表示实现准确预测。

Comments 12 pages, 9 figures, ACM KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30014 2026-05-29 cs.AI 91%

From GPS Points to Travel Patterns: Flexible and Semantic Trajectory Generation with LLMs

从GPS点到出行模式:基于LLM的灵活语义轨迹生成

Silin Zhou, Chenhao Wang, Yuntao Wen, Shuo Shang, Lisi Chen, Panos Kalnis

机构 * University of Electronic Science and Technology of China(电子科技大学) King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学)

专题命中 指令微调 :LLM(title_cn,summary_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出HTP方法,通过层次化生成出行模式再生成GPS点,利用LLM和RQ-VAE实现灵活、语义丰富的轨迹生成,在质量上平均提升29.78%。

Comments This paper is accepted by KDD2026 second round

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29427 2026-05-29 cs.CL 91%

FinGuard: Detecting Financial Regulatory Non-Compliance in LLM Interactions

FinGuard:检测LLM交互中的金融监管违规

Huaixia Dou, Jie Zhu, Minghao Wu, Shuo Jiang, Junhui Li, Lifan Guo, Feng Chen, Chi Zhang

机构 * Qwen DianJin Team, Alibaba Cloud Computing(阿里云计算Qwen金融团队) Tongyi Lab, Alibaba Group(阿里集团通义实验室) School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对金融领域LLM交互中的监管违规检测问题,提出基于监管文档的自动化管道,构建首个金融合规检测基准FinGuard-Bench,并训练FinGuard模型,在基准上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21909 2026-05-29 cs.AI cs.CL 91%

From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning

从元思维到执行:面向通用且可靠的大语言模型推理的认知对齐后训练

Shaojie Wang, Liang Zhang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 指令微调 :LLM(title,abstract);post-training(title,abstract);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出一种认知启发的两阶段后训练框架,通过元思维链监督学习通用策略和置信度校准强化学习优化执行可靠性,在分布内和分布外分别提升2.10%和3.86%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30334 2026-05-29 cs.AI cs.CL 90%

Demystifying Data Organization for Enhanced LLM Training

揭秘数据组织以增强大语言模型训练

Yalun Dai, Yangyu Huang, Tongshen Yang, Yonghan Wang, Xin Zhang, Wenshan Wu, Qihao Zhao, Hao Li, Yuanyuan Gao, Kim-Hui Yap, Scarlett Li

机构 * Nanyang Technological University(南洋理工大学) Microsoft Research(微软研究院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 指令微调 :LLM(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文系统探索数据组织对大语言模型训练的影响,提出边界锐化、循环调度、课程连续性和局部多样性四项优化准则,并基于此设计了两种新的数据排序方法STR和SAW,实验验证了其在预训练和微调阶段的有效性。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24846 2026-05-29 cs.LG cs.AI 90%

Tiny Brains, Giant Impact: Uncovering the Keystone Neurons of LLM with Just a Few Prompts

微小大脑,巨大影响:仅用少量提示揭示LLM的关键神经元

Xiangtian Ji, Yuxin Chen, Zhengzhou Cai, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Science and Technology of China(中国科学技术大学)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本研究通过跨任务激活强度分析,发现大型语言模型中存在一组极其稀疏的关键神经元,其移除会导致模型行为崩溃,并基于此提出仅更新关键神经元的微调方法,在少量参数修改下达到与全参数微调相当或更优的任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05614 2026-05-29 cs.CL cs.AI 90%

GroundAct: Can LLM Agents Ground Actions in Environmental States?

GroundAct:LLM智能体能否在环境状态中实现动作落地?

Zixuan Wang, Dingming Li, Hongxing Li, Yanrui Miao, Shuo Chen, Yuchen Yan, Wenqi Zhang, Yongliang Shen, Weiming Lu, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本研究提出GroundAct基准,通过1500个场景和16592个任务实例评估15个LLM,发现动作落地能力是多维挑战,不能仅通过模型规模解决。

Comments Project Page: https://zju-real.github.io/OmniEmbodied Code: https://github.com/ZJU-REAL/OmniEmbodied

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29408 2026-05-29 nucl-th 90%

Large language model for unified and accurate description of multidimensional nuclear properties

用于统一准确描述多维核性质的大型语言模型

S. J. Guo, S. Y. Wang, E. H. Wang, Z. M. Niu, Y. M. Ding

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 提出一种先验信息增强的大型语言模型多任务学习框架,通过低秩适配微调预训练模型,在电荷半径、质量、结合能、分离能和衰变能等七个可观测量上实现了超过98%的训练损失降低,为核物理多任务回归提供了高效共享方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30076 2026-05-29 cs.CL 90%

UniSteer: Text-Guided Flow Matching in Activation Space for Versatile LLM Steering

UniSteer: 文本引导的激活空间流匹配用于多功能LLM引导

Yingdong Shi, Ruiming Zhang, Changming Li, Zhiyu Yang, Kaixing Zhang, Jingyi Yu, Kan Ren

机构 * ShanghaiTech University(上海科技大学)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出UniSteer,一种文本引导的激活流匹配模型,通过学习残差流激活的条件分布,实现统一的行为控制、真实性引导、细粒度概念引导、多约束指令遵循和激活空间分类。

Comments 16 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29559 2026-05-29 cs.CL 90%

LiteCoder-Terminal: Scaling Long-Horizon Terminal Environments for Learning Language Agents

LiteCoder-Terminal: 扩展用于学习语言代理的长时程终端环境

Xiaoxuan Peng, Kaiqi Zhang, Xinyu Lu, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 指令微调 :SFT(summary_cn,abstract);language agent(title,abstract);preference optimization(abstract);分类 cs.CL

AI总结 提出零依赖合成框架LiteCoder-Terminal-Gen,自动生成可执行且可验证的终端训练环境,构建大规模SFT和RL数据集,通过监督微调和直接多轮偏好优化显著提升语言代理在终端任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29401 2026-05-29 cs.LG 90%

Rethinking Post-Training Recipes for Multimodal Time-Series Forecasting

重新思考多模态时间序列预测的后训练方法

Haoxin Liu, Yichen Zhou, Rajat Sen, B. Aditya Prakash, Abhimanyu Das

机构 * Georgia Institute of Technology(佐治亚理工学院) Google Research(谷歌研究)

专题命中 指令微调 :post-training(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);foundation model(abstract)

AI总结 提出PostTime后训练方法,结合监督微调和基于可验证奖励的强化学习,利用大语言模型根据多模态上下文修正数值时间序列基础模型的预测,显著提升多模态时间序列预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29000 2026-05-29 cs.CL 90%

Text-Preserving Lossy Text Compression: A Study of Strategic Deletion and LLM Reconstruction

保留文本的有损文本压缩:策略性删除与LLM重建研究

Yuchun Zou, Junhong Tong, Jun Li

机构 * CUNY Graduate Center(纽约大学研究生中心) CUNY Queens College(纽约大学皇后学院)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究有损语义文本压缩,通过策略性删除文本并用大语言模型重建,比较多种删除策略,发现词频删除是低成本基线,语义方法在中度压缩时优势明显,QLoRA微调可得到强解码器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15180 2026-05-29 cs.AI 89%

PuzzleClone: A DSL-Powered Framework for Synthesizing Verifiable Data

PuzzleClone: 一种基于DSL的可验证数据合成框架

Kai Xiong, Yanwei Huang, Rongjunchen Zhang, Kun Chen, Haipang Wu, Yingcai Wu

机构 * HiThink Research(HiThink研究院) HKUST(香港科技大学) Zhejiang University(浙江大学)

专题命中 指令微调 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出PuzzleClone框架,通过DSL驱动的方法合成大规模、高可靠、多样化的可验证数学逻辑数据集,并构建PC-83K基准,实验表明后训练能显著提升LLM在逻辑与数学任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14399 2026-05-29 cs.CV 89%

Multi-Turn Adaptive Prompting Attack on Large Vision-Language Models

多轮自适应提示攻击对大型视觉-语言模型

In Chong Choi, Jiacheng Zhang, Feng Liu, Yiliao Song

机构 * The University of Melbourne(墨尔本大学) The University of Adelaide(阿德莱德大学)

专题命中 指令微调 :language model(title,abstract);prompting(title,abstract);large language model(abstract)

AI总结 提出多轮自适应提示攻击(MAPA),通过交替文本-视觉攻击动作和跨轮迭代调整攻击轨迹,显著提升对大型视觉-语言模型的多轮越狱攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11171 2026-05-29 cs.CL cs.AI 88%

A Language-Guided Bayesian Optimization for Efficient LoRA Hyperparameter Search

语言引导的贝叶斯优化用于高效LoRA超参数搜索

Baek Seong-Eun, Lee Jung-Mok, Kim Sung-Bin, Tae-Hyun Oh

机构 * Grad. School of AI, POSTECH, Pohang, Korea(POSTECH人工智能研究生院,韩国坡安) School of EE, KAIST, Daejeon, Korea(韩国科学技术院电子工程学院,韩国大田) School of Computing, KAIST, Daejeon, Korea(韩国科学技术院计算学院,韩国大田)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出一种利用预训练LLM领域知识的贝叶斯优化框架,通过语言提示将超参数映射到连续空间,结合子集训练代理评估,仅需约30次迭代即可发现比标准超参数提升20%以上性能的LoRA超参数。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29009 2026-05-29 cs.LG cs.AI 88%

Label-Free Reinforcement Learning via Cross-Model Entropy

无标签强化学习:跨模型熵方法

Matt Gorbett, Hossein Shirazi

机构 * Independent Researcher(独立研究者) San Diego State University(圣地亚哥州立大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出跨模型熵(CME)作为无标签奖励信号,用于强化学习后训练大语言模型,在开放指令遵循任务上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29816 2026-05-29 cs.AI 88%

Harnessing non-adversarial robustness in large language models

利用大语言模型中的非对抗鲁棒性

Qinghua Zhou, Ellina Aleshina, Andrey Lovyagin, Oleg Somov, Mikhail Seleznyov, Alexander Panchenko, Ivan Oseledets, Elena Tutubalina, Ivan Y. Tyukin

机构 * Applied AI Institute, Moscow, Russia(莫斯科应用人工智能研究所) King's College London, London, UK(伦敦国王学院) International Joint Laboratory of AI for Industry, QUST, Qingdao, China(工业人工智能联合实验室)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文通过理论分析和实验,提出了一种基于去偏的微调方法,以提升大语言模型对语义相似但文本不同的提示的鲁棒性,并提供了认证保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06431 2026-05-29 cs.AI 88%

LsrIF: Enhancing Logic-Structured Instruction Following of Large Language Models

LsrIF: 增强大语言模型的逻辑结构化指令遵循能力

Qingyu Ren, Qianyu He, Jingwen Chang, Geng Zhang, Jiajie Zhu, Xingzhou Chen, Zhuofei Shi, Jiaqing Liang, Yanghua Xiao, Han Xia, Zeye Sun, Fei Yu

机构 * Shanghai Key Laboratory of Data Science, College of Computer Science and Artificial Intelligence, Fudan University(复旦大学数据科学重点实验室,计算机科学与人工智能学院) School of Data Science, Fudan University(复旦大学数据科学学院) Ant Group(蚂蚁集团)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出LsrIF框架,通过构建并行、顺序、条件和嵌套结构的原子约束数据,并采用结构感知的奖励聚合方法,提升大语言模型在逻辑结构化指令遵循任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28822 2026-05-29 cs.CL 87%

Lightweight Multimodal LLM-Enabled Cost-Effective Defect Grading of Power Transmission Equipment

轻量级多模态大语言模型驱动的输电设备经济高效缺陷分级

Tao Wang, Lipeng Zhu, Jiayong Li, Feng Gao, Siwen Liang

专题命中 指令微调 :LLM(title);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出基于多模态大语言模型的缺陷分级框架,通过上下文学习最大化商业模型潜力,并利用链式思考问答对微调轻量级模型,实现低成本高精度分级。

Comments 9pages, 6figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30260 2026-05-29 cs.CL cs.AI cs.CV cs.LG 87%

How LoRA Remembers? A Parametric Memory Law for LLM Finetuning

LoRA如何记忆?大语言模型微调的参数记忆定律

Ziwen Xu, Haiwen Hong, Linsong Yu, Benglei Cui, Longtao Huang, Hui Xue, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 指令微调 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出参数记忆定律,揭示LoRA在微调中参数与序列长度对损失降低的幂律关系,并基于此设计MemFT优化策略提升记忆保真度与效率。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28826 2026-05-29 cs.CL 86%

From Context Shift to Stylistic Collapse: Why Training Objectives Matter More Than Scale

从语境偏移到风格崩溃:为什么训练目标比规模更重要

Rohan Mahapatra

机构 * Independent Researcher(独立研究者)

专题命中 指令微调 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);language model(abstract);preference optimization(abstract)

AI总结 本文通过分析17个模型(410M-100B+参数)在24个语言探针上的表现,发现指令微调系统会导致语言熵沿语篇和结构维度系统性崩溃,并表明弱干预加剧崩溃而强控制可显著改善,揭示了当前对齐流程在重新分配风格概率质量方面的结构性局限。

Comments 26 pages, 13 tables, 2 figures. Planning to submit to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29414 2026-05-29 cs.CL cs.AI 86%

Beyond Bilingual Transfer: Multilingual Code-Switching in Instruction Tuning

超越双语迁移:指令微调中的多语言代码切换

Shunta Asano, Jeonghun Baek, Toshihiko Yamasaki

机构 * The University of Tokyo(东京大学)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过跨四种语言的句子级多语言代码切换指令微调,验证了多语言代码切换能有效提升大语言模型的多语言理解性能,超越了传统双语迁移设置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00065 2026-05-29 cs.LG cs.CL cs.CR 85%

When the Same Coefficients Reach Different Places: Asymmetric Realizability in Transplanting Tokenizers across Large Language Models

当相同系数到达不同位置:跨大型语言模型移植分词器中的非对称可实现性

Xiaoze Liu, Weichen Yu, Matt Fredrikson, Xiaoqian Wang, Jing Gao

机构 * Purdue University(普渡大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :large language model(title);language model(title);分类 cs.CL、cs.LG

AI总结 本文发现跨词汇模型组合中分词器移植的几何结构非对称性,并构造了“破坏令牌”以利用该漏洞,通过实验验证其在多个模型对中的存在性及对微调、谱滤波等防御措施的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20255 2026-05-29 cs.LG cs.CL cs.SE 85%

HE-SNR: Uncovering Latent Logic via Entropy for Guiding Mid-Training on SWE-bench

HE-SNR:通过熵揭示潜在逻辑以指导SWE-bench上的中期训练

Yueyang Wang, Jiawei Fu, Baolong Bi, Xili Wang, Xiaoqing Liu

机构 * School of Mathematical Sciences, Peking University, Beijing, China(北京大学数学科学学院) Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院计算技术研究所)

专题命中 指令微调 :SFT(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对SWE-bench基准,提出基于熵压缩假说的HE-SNR指标,通过细粒度熵分析指导中期训练数据筛选,在高达560B参数模型上验证有效性。

Comments Accepted at ICML 2026. 21 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29498 2026-05-29 cs.CL cs.CV 84%

Mask the Target: A Plug-and-Play Regularizer Against LoRA Forgetting

Mask the Target: 一种即插即用的正则化器,用于对抗LoRA遗忘

Runze Xu, Arpit Garg, Hemanth Saratchandran, Simon Lucey

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 针对LoRA微调中目标分布与原始训练分布差异大时导致的灾难性遗忘问题,提出一种无需重放数据的输出空间正则化方法,通过遮蔽目标token并仅对非目标词汇进行KL正则化,在不增加推理开销的前提下改善新学习与遗忘之间的平衡。

Comments In Submission

详情

展开后加载摘要…

URL PDF HTML 收藏