arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11502 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11502 篇

2606.09525 2026-06-09 cs.CL cs.AI 新提交 93%

Emergence of Context Characteristics Sensitivity in Large Language Models

大型语言模型中上下文特征敏感性的涌现

Nadya Yuki Wangsajaya, Haeun Yu, Isabelle Augenstein

机构 * Nanyang Technological University(南洋理工大学) University of Copenhagen(哥本哈根大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn)

AI总结 通过测量监督微调、直接偏好优化和可验证奖励强化学习三个阶段,发现大型语言模型对上下文特征的敏感性在指令微调过程中动态变化,其中监督微调使模型倾向于使用易理解的上下文,而后续阶段可能强化或改变这一偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11470 2026-05-12 cs.LG cs.CL 93%

Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning

重新思考在LLM后训练中专家轨迹的利用

Bowen Ding, Yuhan Chen, Jiayang Lyv, Jiyao Yuan, Qi Zhu, Shuangshuang Tian, Dantong Zhu, Futing Wang, Heyuan Deng, Fei Mi, Lifeng Shang, Tao Lin

机构 * Zhejiang University(浙江大学) School of Engineering, Westlake University(西湖大学工程学院) Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖先进研究院技术研究所) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 指令微调 :LLM(title,title_cn);SFT(summary_cn,abstract);post-training(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出Plasticity-Ceiling框架,通过分解最终性能上限,揭示SFT与RL的协同优化方法,建立SFT-然后-RL的流水线,解决同步方法的稳定性问题,并提供精确的缩放指南。

Comments ACL-26, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13734 2024-03-07 cs.CL cs.AI 93%

Prompting and Fine-Tuning Open-Sourced Large Language Models for Stance Classification

Iain J. Cruickshank, Lynnette Hui Xian Ng

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

Comments Submitted to ACM Transactions on Intelligent Systems and Technology, Special Issue on Evaluations of Large Language Models. 28 Pages, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07527 2026-06-09 cs.CL cs.AI cs.LG 新提交 93%

Post-training is (Massive) Supervised Learning

后训练是(大规模)监督学习

Michael Hassid, Yossi Adi, Roy Schwartz

机构 * FAIR, Meta AI(Meta AI 基础人工智能研究团队) The Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 指令微调 :LLM(summary_cn,abstract);SFT(summary_cn,abstract);post-training(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文论证当前LLM后训练阶段(SFT+RL)实质是回归到BERT时代的“预训练-微调”范式,通过实验表明从零开始后训练的模型也能取得显著性能,并提出应转向“学会学习”的训练方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22739 2026-05-18 cs.CL cs.AI cs.LG stat.ML 93%

Painless Activation Steering: An Automated, Lightweight Approach for Post-Training Large Language Models

无痛激活导向:一种自动化、轻量级的微调大型语言模型方法

Sasha Cui, Zhongren Chen

机构 * Yale University(耶鲁大学)

专题命中 指令微调 :language model(title,abstract);post-training(title,abstract);large language model(title);SFT(abstract,abstract_cn)

AI总结 本文提出Painless Activation Steering,一种自动化方法,无需人工干预即可利用标注数据提升模型性能,尤其在行为任务中表现优异,但对智能任务效果有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11831 2026-04-28 cs.CV 93%

Towards High-Fidelity CAD Generation via LLM-Driven Program Generation and Text-Based B-Rep Primitive Grounding

通过LLM驱动的程序生成和基于文本的B-Rep基础构建实现高保真的CAD生成

Jiahao Li, Qingwang Zhang, Qiuyu Chen, Guozhan Qiu, Yunzhong Lou, Xiangdong Zhou

机构 * Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出FutureCAD框架,利用LLM和BRepGround变压器生成高保真的CAD模型,通过自然语言指定几何选择并训练数据集提升生成性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10597 2026-02-12 cs.CY 93%

Llama-Polya: Instruction Tuning for Large Language Model based on Polya's Problem-solving

Llama-Polya:基于波利亚问题解决框架的大型语言模型指令调优

Unggi Lee, Yeil Jeong, Chohui Lee, Gyuri Byun, Yunseo Lee, Minji Kang, Minji Jeon

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title,abstract);LLM(abstract)

AI总结 Llama-Polya通过整合波利亚问题解决框架,提升大型语言模型在数学推理和教学对齐方面的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22453 2025-10-28 cs.CL cs.AI cs.CV cs.LG 93%

First SFT, Second RL, Third UPT: Continual Improving Multi-Modal LLM Reasoning via Unsupervised Post-Training

Lai Wei, Yuting Li, Chen Wang, Yue Wang, Linghe Kong, Weiran Huang, Lichao Sun

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Zhongguancun Academy(中关村学院) Shanghai Innovation Institute(上海创新研究院) Lehigh University(莱特大学)

专题命中 指令微调 :post-training(title,abstract);SFT(title,abstract);LLM(title);large language model(abstract)

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12864 2025-10-16 cs.AI cs.CL cs.LG 93%

From Literal to Liberal: A Meta-Prompting Framework for Eliciting Human-Aligned Exception Handling in Large Language Models

Imran Khan

机构 * Independent Researcher(独立研究者)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);SFT(abstract)

Comments 13 pages. Code and data are available at https://github.com/strongSoda/LITERAL-TO-LIBERAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10792 2025-10-07 cs.CL cs.AI cs.LG 93%

Instruction Tuning for Large Language Models: A Survey

Shengyu Zhang, Linfeng Dong, Xiaoya Li, Sen Zhang, Xiaofei Sun, Shuhe Wang, Jiwei Li, Runyi Hu, Tianwei Zhang, Fei Wu, Guoyin Wang

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title,abstract);SFT(abstract)

Comments V6; Last update: AUG 11, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12950 2024-10-21 q-bio.QM cs.AI cs.CE cs.CL cs.LG 93%

MolecularGPT: Open Large Language Model (LLM) for Few-Shot Molecular Property Prediction

Yuyan Liu, Sirui Ding, Sheng Zhou, Wenqi Fan, Qiaoyu Tan

专题命中 指令微调 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02412 2026-08-04 cs.LG 新提交 92%

Why Large Language Models Fail at Tabular Prediction

为什么大型语言模型在表格预测任务中表现不佳

Marta Garnelo, Wojciech M. Czarnecki

机构 * Fundamental Technologies(基础技术) Voylab

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);foundation model(abstract)

AI总结 该研究探究通用大型语言模型(LLM)在表格预测任务中表现不佳的原因,通过控制实验排除了数据噪声、CSV格式等因素,发现维度是关键,LLM准确率随维度增长下降,而经典基线方法不受影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29303 2026-05-29 cs.AI 92%

Entropy-KL Divergence-based Token Masking: A Novel Approach for Selective Fine-tuning of Large Language Models

基于熵-KL散度的令牌掩码:一种用于大语言模型选择性微调的新方法

Qi Liu, Mingdi Sun, Yongyi He, Zhi Zheng, Tong Xu, Yi Zheng, Zhefeng Wang, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Cloud(华为云)

专题命中 指令微调 :SFT(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);post-training(abstract)

AI总结 针对低数据场景下标准监督微调导致模型分布偏移的问题,提出EKSFT方法,通过选择性掩码高熵或高KL散度的令牌,在注入任务知识的同时保持预训练分布完整性,在数学推理基准上优于标准SFT并提升后续RL性能。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15635 2026-05-18 cs.CL 92%

Evaluating Chinese Ambiguity Understanding in Large Language Models

评估大型语言模型中的中文歧义理解

Junwen Mo, Yuanzhi Lu, Yifang Xue, Ke Xu, Hideki Nakayama

机构 * Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院) School of Software Engineering, South China University of Technology(华南理工大学软件学院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);instruction tuning(abstract)

AI总结 本文设计了首个基于潜在歧义理论的中文歧义数据集CHA-Gen,评估了LLM在歧义检测中的表现,揭示了模型在歧义识别中的常见失败模式及语义不确定性量化结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12197 2026-05-13 cs.LG 92%

A Unified Graph Language Model for Multi-Domain Multi-Task Graph Alignment Instruction Tuning

多领域多任务图对齐指令微调的统一图语言模型

Haibo Chen, Xin Wang, Jiaheng Chao, Ling Feng, Wenwu Zhu

机构 * Tsinghua University(清华大学)

专题命中 指令微调 :LLM(summary_cn,abstract);language model(title,abstract);instruction tuning(title,abstract);large language model(abstract)

AI总结 本文提出UniGraphLM,通过多领域多任务GNN编码器学习可泛化的图表示,并与LLM进行自适应对齐,以解决跨领域和任务的图对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10079 2026-04-27 cs.CL 92%

Why Supervised Fine-Tuning Fails to Learn: A Systematic Study of Incomplete Learning in Large Language Models

为何监督微调失效:对大语言模型中不完全学习现象的系统研究

Chao Xue, Yao Wang, Mengqiao Liu, Di Liang, Xingsheng Han, Peiyang Liu, Xianjie Wu, Chenyao Lu, Lei Jiang, Yu Lu, Haibo Shi, Shuang Liang, Minlong Peng, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) Tencent Hunyuan(腾讯文言) Tencent Yuanbao(腾讯元宝) UESTC(电子科技大学) Peking University(北京大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn)

AI总结 本文系统研究了大语言模型微调中不完全学习现象,揭示了五个导致学习不完整的原因,并提出诊断优先框架和缓解策略,证明监督微调的局限性。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09513 2024-03-15 cs.CR cs.AI 92%

AdaShield: Safeguarding Multimodal Large Language Models from Structure-based Attack via Adaptive Shield Prompting

Yu Wang, Xiaogeng Liu, Yu Li, Muhao Chen, Chaowei Xiao

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

Comments Multimodal Large Language Models Defense, 25 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03573 2026-08-07 cs.CL cs.LG 版本更新 92%

SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs

SFT冲突,RL共存:大语言模型多任务学习的理论与实证分析

Kejian Zhu, Zhuoran Jin, Shangqing Tu, Hongbang Yuan, Yushi Bai, Kang Liu, Juanzi Li, Jun Zhao

专题命中 指令微调 :SFT(title,title_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对大语言模型多任务学习,通过理论与实证分析揭示SFT存在任务冲突而RL可稳定共存的机制,进而提出Parallel-RL范式以解耦多任务训练,提升效率与灵活性。

Comments Code: https://github.com/GaryStack/Parallel-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05176 2026-08-03 cs.CL cs.AI 版本更新 92%

PEFT of SLM for Telecommunications Customer Support: A Comparative Study of LoRA Configurations with Energy Consumption Analysis

面向电信客户支持的SLM的PEFT:LoRA配置与能耗分析的比较研究

Lucas Tamic, Ilan Jaffeux-Cheniout, Xavier Marjou

机构 * Orange

专题命中 指令微调 :SLM(title,title_cn);LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本研究系统比较了不同LoRA配置在Qwen2.5-3B模型上的参数高效微调效果,结合能耗分析和LLM评判框架,发现验证损失最低的配置并不一定获得最佳定性排名,并提出了组合式合成数据生成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24372 2026-07-15 cs.LG cs.AI cs.NE 版本更新 92%

Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning

大规模进化策略:超越强化学习的LLM微调

Xin Qiu, Yulu Gan, Conor F. Hayes, Qiyao Liang, Yinggan Xu, Roberto Dailey, Elliot Meyerson, Babak Hodjat, Risto Miikkulainen

机构 * University of California, Los Angeles, Los Angeles, CA, USA(加州大学洛杉矶分校) Cognizant AI Lab, San Francisco, CA, USA(Cognizant AI实验室) The University of Texas at Austin, Austin, TX, USA(德克萨斯大学奥斯汀分校) Massachusetts Institute of Technology, Cambridge, MA, USA(麻省理工学院)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出使用进化策略进行大规模LLM微调,证明其在多个方面优于强化学习,为LLM微调提供了新的方法。

Comments Published at ICML 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15887 2026-06-16 cs.LG cs.AI 新提交 92%

Intelligence Is Not the Bottleneck: Validating an LLM First-Pass Manuscript Score Against Peer-Review Outcomes

智能并非瓶颈:验证LLM初稿评分与同行评审结果的一致性

Costa Georgantas

机构 * aipr.pub(aipr实验室)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究验证了LLM系统AIPR通过提示对论文进行评分,无需微调,其整体评分能有效区分ICLR会议的接收与拒绝论文(AUROC 0.82),且评分稳定、可复现,为辅助同行评审提供了可靠依据。

Comments 34 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04221 2026-06-11 cs.CL cs.AI 版本更新 92%

Self-Prompting Small Language Models for Privacy-Sensitive Clinical Information Extraction

面向隐私敏感的临床信息抽取的自提示小型语言模型

Yao-Shun Chuang, Tushti Mody, Uday Pratap Singh, Shirindokht Shiraz, Chun-Teh Lee, Ryan Brandon, Muhammad F Walji, Xiaoqian Jiang, Bunmi Tokede

机构 * McWilliams School of Biomedical Informatics, The University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心休斯顿分校麦克威廉斯生物医学信息学学院) School of Public Health, The University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心休斯顿分校公共卫生学院) School of Dentistry, The University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心休斯顿分校牙科学院) Willamette Dental and Skourtes Institute(威廉特牙科与斯库尔特斯研究所)

专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);prompting(title);post-training(abstract)

AI总结 针对牙科病历中非结构化、领域特定且隐私敏感的命名实体识别挑战,提出一种本地可部署的自提示框架,通过多提示集成推理和基于QLoRA的微调及直接偏好优化,使小型语言模型在Qwen2.5-14B-Instruct上达到微宏F1分数0.864/0.837。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14640 2026-05-27 cs.CL cs.AI 92%

Fact4ac at the Financial Misinformation Detection Challenge Task: Reference-Free Financial Misinformation Detection via Fine-Tuning and Few-Shot Prompting of Large Language Models

Fact4ac在金融虚假信息检测挑战赛中的方法:通过微调和少样本提示的大语言模型实现无参考金融虚假信息检测

Cuong Hoang, Le-Minh Nguyen

机构 * KaiNKaiho

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract_cn)

AI总结 本文提出一种结合零样本/少样本提示和LoRA参数高效微调的大语言模型框架,用于无外部证据的金融虚假信息检测,在公开和私有测试集上分别达到95.4%和96.3%的准确率,获得竞赛第一名。

Journal ref Proceedings of the 2nd Workshop on Misinformation Detection in the Era of LLMs (MisD 2026), 20th International AAAI Conference on Web and Social Media

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21357 2026-05-12 cs.AI cs.CL 92%

AgentHER: Hindsight Experience Replay for LLM Agent Trajectory Relabeling

AgentHER: 用于LLM代理轨迹重标记的回溯经验回放

Liang Ding

机构 * The University of Sydney(悉尼大学)

专题命中 指令微调 :LLM(title,title_cn);SFT(summary_cn,abstract);language agent(abstract);分类 cs.CL、cs.AI

AI总结 AgentHER通过四阶段流程将废弃轨迹转化为SFT、DPO和ShareGPT训练数据,在WebArena和ToolBench上提升性能并提高样本效率,同时降低标签噪声。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17972 2026-01-06 cs.LG cs.CL econ.EM 92%

LABOR-LLM: Language-Based Occupational Representations with Large Language Models

LABOR-LLM:基于语言的职业表示与大语言模型

Susan Athey, Herman Brunborg, Tianyu Du, Ayush Kanodia, Keyon Vafa

机构 * Institute for Computational and Mathematical Engineering(计算与数学工程研究所) Stanford University(斯坦福大学) Graduate School of Business(商学院) Harvard Data Science Initiative(哈佛大学数据科学倡议) Harvard University(哈佛大学)

专题命中 指令微调 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);foundation model(abstract)

AI总结 LABOR-LLM通过大语言模型微调,利用职业历史预测下一个职业,展现优于传统模型的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04753 2025-09-08 cs.CL cs.AI 92%

A Study of Large Language Models for Patient Information Extraction: Model Architecture, Fine-Tuning Strategy, and Multi-task Instruction Tuning

Cheng Peng, Xinyu Dong, Mengxian Lyu, Daniel Paredes, Yaoyun Zhang, Yonghui Wu

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20135 2025-08-22 cs.LG cs.CL cs.DC 92%

Optimizing Cross-Client Domain Coverage for Federated Instruction Tuning of Large Language Models

Zezhou Wang, Yaxin Du, Xingjun Ma, Yugang Jiang, Zhuzhong Qian, Siheng Chen

机构 * Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title,abstract);LLM(abstract)

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15021 2025-06-19 cs.LG cs.AI 92%

SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models

Gyuhak Kim, Sumiran Singh Thakur, Su Min Park, Wei Wei, Yujia Bao

机构 * Center for Advanced AI, Accenture(Accenture高级人工智能研究中心)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04512 2024-12-09 cs.CL cs.LG 92%

Prompting Large Language Models for Clinical Temporal Relation Extraction

Jianping He, Laila Rasmy, Haifang Li, Jianfu Li, Zenan Sun, Evan Yu, Degui Zhi, Cui Tao

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13897 2024-09-24 cs.CL cs.AI 92%

LLM for Everyone: Representing the Underrepresented in Large Language Models

Samuel Cahyawijaya

专题命中 指令微调 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);instruction tuning(abstract)

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏