arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11567 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11567 篇

2603.27006 2026-04-01 cs.CL cs.AI cs.CY 88%

The Last Fingerprint: How Markdown Training Shapes LLM Prose

最后的指纹:Markdown训练如何塑造LLM的散文

E. M. Freeburg

机构 * Independent Researcher(独立研究员)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究发现LLM中连字符的使用受训练数据影响,通过实验揭示连字符频率作为微调方法的诊断指标,而非风格缺陷。

Comments 14 pages, 3 tables. Code and data: https://github.com/emfreeburg/the-last-fingerprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09195 2026-03-26 cs.CL cs.AI 88%

ProFit: Leveraging High-Value Signals in SFT via Probability-Guided Token Selection

ProFit:通过概率引导的标记选择利用SFT中的高价值信号

Tao Liu, Taiqiang Wu, Runming Yang, Shaoning Sun, Junjie Wang, Yujiu Yang

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 指令微调 :SFT(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 ProFit通过概率引导的标记选择策略,有效缓解SFT中单参考答案导致的过拟合问题,提升模型在通用推理和数学任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18272 2026-03-20 cs.AI cs.CL 88%

Retrieval-Augmented LLM Agents: Learning to Learn from Experience

基于检索的LLM代理:学习从经验中学习

Thomas Palmeira Ferraz, Romain Deffayet, Vassilina Nikoulina, Hervé Déjean, Stéphane Clinchant

机构 * NAVER LABS Europe(NAVER实验室欧洲)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出结合微调与经验检索的方法,通过LoRA优化SFT流程,分析经验检索关键设计,提出整合经验检索的训练流程,提升代理对新任务的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20492 2026-02-25 cs.LG cs.AI 88%

Wireless Federated Multi-Task LLM Fine-Tuning via Sparse-and-Orthogonal LoRA

通过稀疏和正交LoRA实现无线联邦多任务大语言模型微调

Nuocheng Yang, Sihua Wang, Ouwen Huan, Mingzhe Chen, Tony Q. S. Quek, Changchuan Yin

机构 * Beijing Laboratory of Advanced Information Network(北京先进信息网络实验室) Beijing Key Laboratory of Network System Architecture and Convergence(北京网络系统架构与融合重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学) Department of Electrical and Computer Engineering and Institute for Data Science and Computing(电气与计算机工程系和数据科学与计算研究所) University of Miami(迈阿密大学) Information Systems Technology and Design Pillar(信息系统技术与设计支柱)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出稀疏和正交LoRA方法,通过去中心化联邦学习解决多任务大语言模型微调中的知识遗忘、通信效率和推理干扰问题,实验显示通信消耗降低73%,性能提升5%。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20006 2026-01-29 cs.CL cs.AI 88%

On the Effectiveness of LLM-Specific Fine-Tuning for Detecting AI-Generated Text

针对检测AI生成文本的LLM特定微调效果研究

Michał Gromadzki, Anna Wróblewska, Agnieszka Kaliska

机构 * Faculty of Mathematics and Information Science, Warsaw University of Technology(华沙技术大学数学与信息科学学院) Faculty of Modern Languages and Literatures, Adam Mickiewicz University(亚当·密茨凯维奇大学现代语言与文学学院)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过大规模语料库和新颖训练策略,提出Per LLM和Per LLM family微调方法,开发出在词级准确率上达99.6%的AI生成文本检测模型。

Comments 34 pages, 6 figures. Under review at Information Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06534 2026-01-19 cs.AI cs.LG 88%

Beneficial Reasoning Behaviors in Agentic Search and Effective Post-training to Obtain Them

代理搜索中的有益推理行为及有效训练以获得这些行为

Jiahe Jin, Abhijay Paladugu, Chenyan Xiong

专题命中 指令微调 :post-training(title);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出行为引导方法,通过预训练使代理搜索模型具备信息验证、权威评估等有益推理行为,从而在强化学习前提升任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07389 2026-01-13 cs.LG cs.AI cs.IT math.IT 88%

On the Non-decoupling of Supervised Fine-tuning and Reinforcement Learning in Post-training

在训练后阶段,监督微调与强化学习无法解耦

Xueyan Niu, Bo Bai, Wei Han, Weixi Zhang

机构 * Theory Laboratory Central Research Institute, 2012 Laboratories(理论实验室中央研究院,2012实验室) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 指令微调 :post-training(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 研究证明在训练后阶段,监督微调与强化学习无法解耦,且在交替训练顺序下会导致性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15480 2026-01-09 cs.CL cs.AI 88%

Instruction Tuning with and without Context: Behavioral Shifts and Downstream Impact

带有和不带上下文的指令微调:行为变化和下游影响

Hyunji Lee, Seunghyun Yoon, Yunjae Won, Hanseok Oh, Geewook Kim, Trung Bui, Franck Dernoncourt, Elias Stengel-Eskin, Mohit Bansal, Minjoon Seo

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Adobe Research(Adobe研究) KAIST AI(韩国科学技术院人工智能实验室) Mila – Quebec AI Institute(魁北克人工智能研究所) NAVER Cloud AI(NAVER云人工智能)

专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了指令微调中带上下文与不带上下文对模型行为和下游性能的影响,发现上下文增强训练能提升模型基础性并减少幻觉,同时提出在实际部署中分离上下文模型以获得更稳健的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01362 2026-01-06 cs.CL cs.LG stat.ML 88%

Investigating the Multilingual Calibration Effects of Language Model Instruction-Tuning

探究语言模型指令微调的多语言校准效应

Jerry Huang, Peng Lu, Qiuhao Zeng, Yusuke Iwasawa, Yutaka Matsuo, Sarath Chandar, Edison Marrese-Taylor, Irene Li

机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) The University of Tokyo(东京大学) Western University(西方大学) Vector Institute(向量研究所) Polytechnique Montréal(蒙特利尔理工学院) CIFAR AI Chair(CIFAR人工智能主席) AIST(日本产业技术综合研究所)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);foundation model(abstract);SFT(abstract)

AI总结 本研究探讨了多语言环境下语言模型指令微调对校准的影响,发现高资源语言SFT数据能显著提升模型置信度,但准确性提升有限,揭示了标准SFT在多语言中的局限性。

Comments Accepted to The 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21017 2025-12-25 cs.CL cs.AI 88%

Rethinking Supervised Fine-Tuning: Emphasizing Key Answer Tokens for Improved LLM Accuracy

重新思考监督微调:强调关键答案标记以提高LLM准确性

Xiaofeng Shi, Qian Kou, Yuduo Li, Hua Zhou

机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院) Beijing Jiaotong University (BJTU)(北京交通大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 SFTKey通过两阶段训练方案,强调关键答案标记以提高LLM在复杂推理任务中的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01317 2025-12-02 cs.LG cs.AI 88%

T-SHIRT: Token-Selective Hierarchical Data Selection for Instruction Tuning

T-SHIRT: 令牌选择性层次数据选择用于指令微调

Yanjun Fu, Faisal Hamman, Sanghamitra Dutta

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 T-SHIRT通过令牌选择性层次数据选择方法提升指令微调效率,使小规模数据集训练效果优于大规模数据集。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13586 2025-10-28 cs.CL cs.AI 88%

Deflanderization for Game Dialogue: Balancing Character Authenticity with Task Execution in LLM-based NPCs

Pasin Buakhaw, Kun Kerdthaisong, Phuree Phenhiran, Pitikorn Khlaisamniang, Supasate Vorathammathorn, Piyalitt Ittichaiwong, Nutchanon Yongsatianchot

机构 * Department of Computer Engineering and Digital Technology, Faculty of Engineering, Chulalongkorn University(朱拉隆梭大学工程学院计算机工程与数字技术系) Faculty of Engineering, Thammasat School of Engineering, Thammasat University(泰国 Thammasat 大学工程学院) Artificial Intelligence Association of Thailand(泰国人工智能协会) School of Biomedical Engineering & Imaging Sciences, King’s College London(伦敦国王学院生物医学工程与成像科学学院) Siriraj Informatics and Data Innovation Center (SIData+), Faculty of Medicine, Siriraj Hospital, Mahidol University(玛希诺大学医学学院西里拉医院信息与数据创新中心(SIData+))

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00264 2025-10-27 cs.LG cs.AI stat.ML 88%

Calibrated Language Models and How to Find Them with Label Smoothing

Jerry Huang, Peng Lu, Qiuhao Zeng

专题命中 指令微调 :language model(title,abstract);large language model(abstract);instruction tuning(abstract);SFT(abstract)

Comments Accepted to the Forty-second International Conference on Machine Learning (ICML) 2025. First two authors contributed equally. Official proceedings version available at https://proceedings.mlr.press/v267/huang25w.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05288 2025-10-08 cs.LG cs.AI cs.CR 88%

DP-Adam-AC: Privacy-preserving Fine-Tuning of Localizable Language Models Using Adam Optimization with Adaptive Clipping

Ruoxing Yang

机构 * Georgetown University(乔治城大学)

专题命中 指令微调 :language model(title,abstract);LLM(abstract);large language model(abstract);small language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03284 2025-10-07 cs.LG cs.AI 88%

Edge-FIT: Federated Instruction Tuning of Quantized LLMs for Privacy-Preserving Smart Home Environments

Vinay Venkatesh, Vamsidhar R Kamanuru, Lav Kumar, Nikita Kothari

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00268 2025-10-02 cs.CL cs.AI 88%

Efficient Layer-wise LLM Fine-tuning for Revision Intention Prediction

Zhexiong Liu, Diane Litman

机构 * Department of Computer Science, Learning Research & Development Center University of Pittsburgh(计算机科学系、学习研究与开发中心匹兹堡大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

Comments In The Conference on Empirical Methods in Natural Language Processing (EMNLP), November 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26625 2025-10-01 cs.LG cs.AI cs.CV cs.MM 88%

Learning to See Before Seeing: Demystifying LLM Visual Priors from Language Pre-training

Junlin Han, Shengbang Tong, David Fan, Yufan Ren, Koustuv Sinha, Philip Torr, Filippos Kokkinos

机构 * Meta Superintelligence Labs(Meta 超智能实验室) University of Oxford(牛津大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

Comments Project page: https://junlinhan.github.io/projects/lsbs/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20811 2025-09-26 cs.CL cs.AI 88%

Leveraging What's Overfixed: Post-Correction via LLM Grammatical Error Overcorrection

Taehee Park, Heejin Do, Gary Geunbae Lee

机构 * Graduate School of Artificial Intelligence, POSTECH, South Korea(POSTECH人工智能研究生院) ETH Zurich, ETH AI Center(苏黎世联邦理工学院人工智能中心) Department of Computer Science and Engineering, POSTECH, South Korea(POSTECH计算机科学与工程系)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12623 2025-09-24 cs.SD cs.AI cs.CL cs.MM eess.AS 88%

DeepResonance: Enhancing Multimodal Music Understanding via Music-centric Multi-way Instruction Tuning

Zhuoyuan Mao, Mengjie Zhao, Qiyu Wu, Hiromi Wakaki, Yuki Mitsufuji

机构 * Sony Group Corporation(索尼集团公司) Sony AI(索尼人工智能)

专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted to EMNLP 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12892 2025-09-17 cs.CL cs.AI 88%

Conan-Embedding-v2: Training an LLM from Scratch for Text Embeddings

Shiyu Li, Yang Tang, Ruijie Liu, Shi-Zhe Chen, Xi Chen

机构 * Basic Algorithm Center, PCG, Tencent(基础算法中心、PCG、腾讯)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments EMNLP 2025 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20454 2025-09-10 cs.LG cs.CL 88%

CoMMIT: Coordinated Multimodal Instruction Tuning

Xintong Li, Junda Wu, Tong Yu, Yu Wang, Xiang Chen, Jiuxiang Gu, Lina Yao, Julian McAuley, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校) Adobe Research(Adobe研究) The University of New South Wales(新南威尔士大学) CSIRO’s Data61(澳大利亚联邦科学与工业研究组织的数据61)

专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16054 2025-08-25 cs.AI cs.CL 88%

Generative Foundation Model for Structured and Unstructured Electronic Health Records

Sonish Sivarajkumar, Hang Zhang, Yuelyu Ji, Maneesh Bilalpur, Xizhi Wu, Chenyu Li, Min Gu Kwak, Shyam Visweswaran, Yanshan Wang

专题命中 指令微调 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06963 2025-08-12 cs.AI cs.LG 88%

MASteer: Multi-Agent Adaptive Steer Strategy for End-to-End LLM Trustworthiness Repair

Changqing Li, Tianlin Li, Xiaohan Zhang, Aishan Liu, Li Pan

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03571 2025-08-06 cs.CL cs.LG 88%

Tackling Distribution Shift in LLM via KILO: Knowledge-Instructed Learning for Continual Adaptation

Iing Muttakhiroh, Thomas Fevens

机构 * Concordia University(康科迪亚大学)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03705 2025-06-24 cs.CL cs.LG 88%

Enhancing LLM Knowledge Learning through Generalization

Mingkang Zhu, Xi Chen, Zhongdao Wang, Bei Yu, Hengshuang Zhao, Jiaya Jia

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08301 2025-06-24 cs.CL cs.AI cs.CY 88%

Compromising Honesty and Harmlessness in Language Models via Deception Attacks

Laurène Vaugrante, Francesca Carlon, Maluna Menke, Thilo Hagendorff

专题命中 指令微调 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05091 2025-06-23 cs.LG cs.CL cs.CR 88%

Watermarking Language Models through Language Models

Agnibh Dasgupta, Abdullah Tanvir, Xin Zhong

机构 * Department of Computer Science, University of Nebraska Omaha(内布拉斯加大学奥马哈分校计算机科学系)

专题命中 指令微调 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13796 2025-06-18 cs.CL cs.AI 88%

ClimateChat: Designing Data and Methods for Instruction Tuning LLMs to Answer Climate Change Queries

Zhou Chen, Xiao Wang, Yuanhong Liao, Ming Lin, Yuqi Bai

机构 * Tsinghua University(清华大学)

专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments ICLR 2025 camera ready, 13 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02234 2025-06-06 cs.HC cs.AI cs.CL cs.CY 88%

LLM Social Simulations Are a Promising Research Method

Jacy Reese Anthis, Ryan Liu, Sean M. Richardson, Austin C. Kozlowski, Bernard Koch, James Evans, Erik Brynjolfsson, Michael Bernstein

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Published at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12226 2025-06-02 cs.CL cs.AI 88%

EvalYaks: Instruction Tuning Datasets and LoRA Fine-tuned Models for Automated Scoring of CEFR B2 Speaking Assessment Transcripts

Nicy Scaria, Silvester John Joseph Kennedy, Thomas Latinovich, Deepak Subramani

机构 * Computational and Data Science, IISc, Bangalore, India(计算机与数据科学,IISc,班加罗尔,印度) Talking Yak, Inc., Cedarburg, Wisconsin, USA(Talking Yak公司, Cedarburg,威斯康星州,美国) Talking Yak English Learning Private Limited, Bangalore, India(Talking Yak英语学习私人有限公司,班加罗尔,印度)

专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏