arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11601 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11601 篇

2601.00065 2026-05-29 cs.LG cs.CL cs.CR 85%

When the Same Coefficients Reach Different Places: Asymmetric Realizability in Transplanting Tokenizers across Large Language Models

当相同系数到达不同位置:跨大型语言模型移植分词器中的非对称可实现性

Xiaoze Liu, Weichen Yu, Matt Fredrikson, Xiaoqian Wang, Jing Gao

机构 * Purdue University(普渡大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :large language model(title);language model(title);分类 cs.CL、cs.LG

AI总结 本文发现跨词汇模型组合中分词器移植的几何结构非对称性,并构造了“破坏令牌”以利用该漏洞,通过实验验证其在多个模型对中的存在性及对微调、谱滤波等防御措施的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20255 2026-05-29 cs.LG cs.CL cs.SE 85%

HE-SNR: Uncovering Latent Logic via Entropy for Guiding Mid-Training on SWE-bench

HE-SNR:通过熵揭示潜在逻辑以指导SWE-bench上的中期训练

Yueyang Wang, Jiawei Fu, Baolong Bi, Xili Wang, Xiaoqing Liu

机构 * School of Mathematical Sciences, Peking University, Beijing, China(北京大学数学科学学院) Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院计算技术研究所)

专题命中 指令微调 :SFT(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对SWE-bench基准,提出基于熵压缩假说的HE-SNR指标,通过细粒度熵分析指导中期训练数据筛选,在高达560B参数模型上验证有效性。

Comments Accepted at ICML 2026. 21 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28306 2026-05-28 cs.CL cs.AI 85%

Routing-Aligned Fine-Tuning for Multilingual Downstream Tasks in Mixture-of-Experts Models

面向混合专家模型中多语言下游任务的路由对齐微调

Guanzhi Deng, Kuan Wu, Haibo Wang, Shing Yin Wong, Sichun Luo, Linqi Song

机构 * City University of Hong Kong(香港城市大学) Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 针对混合专家模型在多语言下游任务中的路由结构异构问题,提出RA-MoE三阶段框架,通过中间层语言通用对齐区识别任务相关专家,并引入路由对齐损失增强目标语言路由,实验表明该方法优于标准微调和强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27849 2026-05-28 cs.PL cs.AI cs.CL 85%

FPMoE: A Sparse Mixture-of-Experts Approach to Functional Code Generation

FPMoE:一种用于函数式代码生成的稀疏混合专家方法

Loc Pham, Lang Hong Nguyet Anh, Thanh Le-Cong

机构 * GreenNode AI Hanoi University of Science and Technology(河内科学技术大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 指令微调 :LLM(summary_cn,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM在函数式编程语言上性能差的问题,提出基于稀疏MoE架构的FPMoE模型,通过语言特定专家和共享专家分别消除干扰和捕获跨语言抽象,以3B活跃参数达到远超微调基线并匹配大模型的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27567 2026-05-28 cs.AI cs.CL 85%

Why LLMs Fail at Causal Discovery and How Interventional Agents Escape

为什么LLM在因果发现中失败以及干预代理如何逃脱

Amartya Roy, Sonali Parbhoo

机构 * SIRE, IIT Delhi(IIT德里智能研究机构) Robert Bosch GmbH(罗伯特·博世有限公司) Imperial College London(伦敦帝国理工学院)

专题命中 指令微调 :LLM(title_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文证明大型语言模型在因果发现中存在根本性失败,并提出一种基于干预代理的因果贝叶斯优化方法(A-CBO),通过外部贝叶斯循环在无需模型微调的情况下实现可证明的收敛。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13424 2026-05-14 cs.LG cs.CL 85%

LIFT: Last-Mile Fine-Tuning for Table Explicitation

LIFT:表格显式化的最后一公里微调

Divij Khaitan, Ashish Tiwari

机构 * Microsoft Corporation(微软公司)

专题命中 指令微调 :SLM(abstract,abstract_cn);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文提出LIFT方法,通过预训练大语言模型提取表格并由微调的小语言模型修复错误,仅需1000个训练样本即可在TEDS指标上超越端到端微调,且更鲁棒于输入格式变化。

Comments 9 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10973 2026-05-13 cs.LG cs.AI 85%

Rotation-Preserving Supervised Fine-Tuning

保持旋转的监督微调

Hangzhan Jin, Tianwei Ni, Lu Li, Pierre-Luc Bacon, Mohammad Hamdaqa, Doina Precup

机构 * Mila - Quebec AI Institute(魁北克AI研究所) Polytechnique Montréal(蒙特利尔理工学院) Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) CIFAR AI Chair(CIFAR人工智能主席) Google DeepMind(谷歌DeepMind)

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RPSFT方法,通过保持预训练奇异子空间的投影旋转来提升模型在领域内和领域外任务间的平衡性能,改进了标准SFT的不足。

Comments 31 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25907 2026-05-08 cs.LG cs.AI 85%

How Fast Should a Model Commit to Supervision? Training Reasoning Models on the Tsallis Loss Continuum

模型应如何快速承诺于监督?在Tsallis损失连续体上训练推理模型

Chu-Cheng Lin, Eugene Ie

机构 * Google(谷歌)

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Tsallis损失族J_Q,通过q参数在RLVR和密度估计极之间插值,解释SFT-then-RLVR流程,并提出GARL和PAFT方法以缓解冷启动问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28182 2026-05-01 cs.LG cs.CL 85%

Exploration Hacking: Can LLMs Learn to Resist RL Training?

探索黑客:大语言模型能否学会抵抗强化学习训练?

Eyon Jang, Damon Falck, Joschka Braun, Nathalie Kirch, Achu Menon, Perusha Moodley, Scott Emmons, Roland S. Zimmermann, David Lindner

机构 * MATS UC San Diego(UC圣迭戈大学) Google DeepMind(谷歌DeepMind) Anthropic

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文研究了大语言模型在强化学习训练中可能通过策略性调整探索行为导致失败的机制,通过微调创建了具有特定低效策略的模型,并评估了检测与缓解策略。

Comments 81 pages, 37 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22893 2026-04-28 cs.LG cs.AI 85%

Utility-Aware Data Pricing: Token-Level Quality and Empirical Training Gain for LLMs

面向效用的数据定价:LLMs的令牌级质量与经验训练增益

Minghui Xu, Qi Luo, Kun Li

机构 * Shandong University(山东大学)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出动态数据估值框架,通过令牌级信息密度、经验训练增益测量和加密可验证性三层方法,实现LLM能力的效用定价,优于传统行数和令牌数基准。

Comments 23 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00079 2026-04-21 cs.CY cs.AI cs.LG 85%

Who Gets the Kidney? Human-AI Alignment, Indecision, and Moral Values

谁获得肾脏?人类-人工智能对齐、犹豫与道德价值观

John P. Dickerson, Hadi Hosseini, Samarth Khanna, Leona Pierce

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 指令微调 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究评估了LLM在器官分配中的行为,发现其在优先级设定上偏离人类价值观,并且在犹豫机制上表现不同,低秩监督微调能提升决策一致性与犹豫建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13651 2026-04-03 cs.CL cs.AI cs.IR 85%

Benchmarking Large Language Models on Reference Extraction and Parsing in the Social Sciences and Humanities

在社会科学和人文领域上对大型语言模型进行参考提取与解析的基准测试

Yurui Zhu, Giovanni Colavizza, Matteo Romanello

机构 * Odoma LLC

专题命中 指令微调 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本文提出一个统一基准,针对社会科学和人文领域的真实条件,评估参考提取、参考解析和端到端文档解析任务,发现解析和端到端解析是主要瓶颈,LoRA微调和分段管道能提升鲁棒性。

Comments 12 pages, 2 figures. Accepted at the SCOLIA 2026 Workshop (Second Workshop on Scholarly Information Access), co-located with ECIR 2026. Workshop date: April 2, 2026

Journal ref Proceedings of the Second International Workshop on Scholarly Information Access (SCOLIA 2026), co-located with ECIR 2026, Delft, The Netherlands, April 2, 2026. CEUR Workshop Proceedings, Vol. 4187, pp. 16-30

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22752 2026-03-27 cs.CL cs.AI 85%

Towards Simulating Social Media Users with LLMs: Evaluating the Operational Validity of Conditioned Comment Prediction

向LLMs模拟社交媒体用户迈进:评估条件评论预测的运作有效性

Nils Schwager, Simon Münker, Alistair Plum, Achim Rettinger

机构 * Trier University(特里尔大学) University of Luxembourg(卢森堡大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文通过条件评论预测任务评估LLMs在模拟社交媒体用户行为方面的运作有效性,发现监督微调在低资源环境下会导致表层结构与语义脱节,强调真实行为轨迹优于描述性人设。

Comments 14 pages, 1 figure, 7 tables. Accepted to the 15th Workshop on Computational Approaches to Subjectivity, Sentiment & Social Media Analysis (WASSA) at EACL 2026, Rabat, Morocco

Journal ref Proceedings of the 15th Workshop on Computational Approaches to Subjectivity, Sentiment & Social Media Analysis (WASSA), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23508 2026-03-06 cs.CL cs.AI 85%

Why Reinforcement Fine-Tuning Enables MLLMs Preserve Prior Knowledge Better: A Data Perspective

为何强化微调能更好地使大语言模型保留先验知识:从数据角度出发

Zhihao Zhang, Qiaole Dong, Qi Zhang, Jun Zhao, Enyu Zhou, Zhiheng Xi, Senjie Jin, Xiaoran Fan, Yuhao Zhou, Mingqi Wu, Yanwei Fu, Tao Ji, Tao Gui, Xuanjing Huang, Kai Chen

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心)

专题命中 指令微调 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 本文通过数据视角揭示强化微调(RFT)相较于监督微调(SFT)在保留大语言模型先验知识方面的优势,发现RFT通过强化正确样本与基模型对齐,有效减少对先验知识的干扰。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11000 2026-02-12 cs.DC cs.AI cs.LG 85%

Fine-Tuning GPT-5 for GPU Kernel Generation

为GPU内核生成微调GPT-5

Ali Tehrani, Yahya Emara, Essam Wissam, Wojciech Paluch, Waleed Atallah, Łukasz Dudziak, Mohamed S. Abdelfattah

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 通过强化学习微调GPT-5提升GPU内核生成性能,实现正确率和效率的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18100 2026-01-19 cs.CL cs.AI 85%

Panacea: Mitigating Harmful Fine-tuning for Large Language Models via Post-fine-tuning Perturbation

Panacea: 通过微调后扰动缓解大语言模型的有害微调

Yibo Wang, Tiansheng Huang, Li Shen, Huanjin Yao, Haotian Luo, Rui Liu, Naiqiang Tan, Jiaxing Huang, Dacheng Tao

机构 * Tsinghua University(清华大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Didichuxing Co. Ltd(滴滴出行有限公司) Nanyang Technological University(南洋理工大学)

专题命中 指令微调 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 Panacea通过自适应扰动优化,在保持微调性能的同时缓解大语言模型的有害微调问题

Comments Accepted by NeruIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22337 2025-12-30 cs.LG cs.AI 85%

The Effectiveness of Approximate Regularized Replay for Efficient Supervised Fine-Tuning of Large Language Models

近似正则化回放的有效性:用于大型语言模型高效监督微调的效果

Matthew Riemer, Erik Miehling, Miao Liu, Djallel Bouneffouf, Murray Campbell

专题命中 指令微调 :large language model(title);language model(title);分类 cs.AI、cs.LG

AI总结 本文提出了一种正则化近似回放方法,通过惩罚KL散度和引入不同语料库数据,有效缓解LoRA监督微调导致的模型能力下降问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03197 2025-12-04 cs.CL cs.AI 85%

InvertiTune: High-Quality Data Synthesis for Cost-Effective Single-Shot Text-to-Knowledge Graph Generation

InvertiTune:用于低成本单次文本到知识图谱生成的高质量数据合成

Faezeh Faez, Marzieh S. Tahaei, Yaochen Hu, Ali Pourranjbar, Mahdi Biparva, Mark Coates, Yingxue Zhang

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) Autodesk Ascend Team, Huawei Technologies(华为 Ascend 团队) McGill University(麦吉尔大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 InvertiTune通过高质量数据合成提升单次文本到知识图谱生成的效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18735 2025-12-02 cs.LG cs.AI 85%

TLoRA: Tri-Matrix Low-Rank Adaptation of Large Language Models

TLoRA:大型语言模型的三矩阵低秩适应

Tanvir Islam

机构 * Okta

专题命中 指令微调 :large language model(title);language model(title);分类 cs.AI、cs.LG

AI总结 TLoRA通过三矩阵低秩适应方法实现高效参数微调,相比LoRA等方法在资源利用上更优,具有高表达性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22493 2025-11-13 cs.CY cs.CL cs.LG 85%

A Detailed Factor Analysis for the Political Compass Test: Navigating Ideologies of Large Language Models

Sadia Kamal, Lalu Prasad Yadav Prakash, S M Rafiuddin, Mohammed Rakib, Atriya Sen, Sagnik Ray Choudhury

机构 * Oklahoma State University(俄克拉荷马州立大学) University of North Texas(北德克萨斯大学)

专题命中 指令微调 :large language model(title);language model(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16984 2025-10-21 cs.LG cs.CL 85%

UFT: Unifying Supervised and Reinforcement Fine-Tuning

Mingyang Liu, Gabriele Farina, Asuman Ozdaglar

专题命中 指令微调 :large language model(abstract);language model(abstract);small language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12901 2025-08-11 cs.CL cs.AI 85%

Architectural Fusion Through Contextual Partitioning in Large Language Models: A Novel Approach to Parameterized Knowledge Integration

Offa Kingsleigh, Alfred Abercrombie, David Woolstencroft, Beorhtric Meadowcroft, Marcus Irvin

专题命中 指令微调 :large language model(title);language model(title);分类 cs.CL、cs.AI

Comments arXiv admin note: This paper has been withdrawn by arXiv due to disputed and unverifiable authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13795 2025-08-05 cs.LG cs.AI 85%

Mix-LN: Unleashing the Power of Deeper Layers by Combining Pre-LN and Post-LN

Pengxiang Li, Lu Yin, Shiwei Liu

机构 * Dalian University of Technology(大连理工大学) University of Surrey(Surrey大学) University of Oxford(牛津大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16600 2025-07-16 cs.LG cs.AI 85%

FLAME: Towards Federated Fine-Tuning Large Language Models Through Adaptive SMoE

Khiem Le, Tuan Tran, Ting Hua, Nitesh V. Chawla

机构 * University of Notre Dame(诺丁汉大学) Trinity College Dublin(都柏林三一学院)

专题命中 指令微调 :large language model(title);language model(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15251 2025-06-19 cs.LG cs.AI 85%

Singular Value Decomposition on Kronecker Adaptation for Large Language Model

Yee Hin Chong, Peng Qu

专题命中 指令微调 :large language model(title);language model(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00055 2025-05-30 cs.LG cs.CL 85%

SORSA: Singular Values and Orthonormal Regularized Singular Vectors Adaptation of Large Language Models

Yang Cao, Zhao Song

机构 * Wyoming Seminary(怀俄明私立学院) UC Berkeley(加州大学伯克利分校)

专题命中 指令微调 :large language model(title);language model(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10138 2025-05-27 cs.CL cs.AI 85%

ROUTE: Robust Multitask Tuning and Collaboration for Text-to-SQL

Yang Qin, Chao Chen, Zhihang Fu, Ze Chen, Dezhong Peng, Peng Hu, Jieping Ye

机构 * Sichuan University(四川大学) Tianfu Jincheng Laboratory(天府锦城实验室)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10749 2025-05-26 cs.CL cs.AI 85%

LoRE-Merging: Exploring Low-Rank Estimation For Large Language Model Merging

Zehua Liu, Han Wu, Yuxuan Yao, Ruifeng She, Xiongwei Han, Tao Zhong, Mingxuan Yuan

专题命中 指令微调 :large language model(title);language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12485 2025-04-09 cs.CL cs.AI 85%

Safe at the Margins: A General Approach to Safety Alignment in Low-Resource English Languages -- A Singlish Case Study

Isaac Lim, Shaun Khoo, Roy Ka-Wei Lee, Watson Chua, Jia Yi Goh, Jessica Foo

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12935 2025-01-08 cs.CR cs.AI cs.LG 85%

ChatBug: A Common Vulnerability of Aligned LLMs Induced by Chat Templates

Fengqing Jiang, Zhangchen Xu, Luyao Niu, Bill Yuchen Lin, Radha Poovendran

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

Comments This paper is accepted to AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏