arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11511 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11511 篇

2606.22938 2026-06-23 cs.LG cs.AI 新提交 92%

Provable Benefits of RLVR over SFT for Reasoning Models: Learning to Backtrack Efficiently

RLVR 相对于 SFT 在推理模型中的可证明优势:学习高效回溯

Stanley Wei, Juno Kim

机构 * Princeton University(普林斯顿大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 指令微调 :SFT(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文从理论上证明,在推理任务中,基于可验证奖励的强化学习(RLVR)相比监督微调(SFT)能学习高效回溯,从而在推理时计算上实现指数级优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11562 2026-06-11 cs.LG cs.CL 新提交 92%

GraphInfer-Bench: Benchmarking LLM's Inference Capability on Graphs

GraphInfer-Bench:评估LLM在图上的推理能力基准

Zhuoyi Peng, Jingzhou Jiang, Hanlin Gu, Lixin Fan, Yi Yang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Webank(微众银行)

专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出GraphInfer-Bench基准,通过五个任务(描述与比较)测试LLM能否从节点及其邻域推断出无法从单节点或路径检索的答案,发现所有方法均存在差距。

Comments Code: https://github.com/graphinfer/GraphInfer-Bench ; Dataset: https://huggingface.co/datasets/graphinfer/graphinfer

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17547 2026-06-10 cs.AI cs.CL 92%

KLong: Training LLM Agent for Extremely Long-horizon Tasks

KLong:训练用于超长 horizon 任务的 LLM 代理

Yue Liu

专题命中 指令微调 :LLM(title,title_cn);SFT(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 KLong 通过轨迹分割 SFT 和渐进式 RL 训练,解决超长 horizon 任务,实现 106B 模型在 PaperBench 上超越 Kimi K2 Thinking 11.28%。

Comments We request standard withdrawal of this submission because significant errors were discovered in the data after submission, which affect the validity of the results. We may submit a corrected version later

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18510 2026-06-09 cs.LG cs.AI 版本更新 92%

Just-In-Time Reinforcement Learning: Continual Learning in LLM Agents Without Gradient Updates

即时强化学习:无需梯度更新的LLM智能体持续学习

Yibo Li, Zijie Lin, Ailin Deng, Xuan Zhang, Yufei He, Shuo Ji, Tri Cao, Bryan Hooi

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出JitRL框架,通过动态非参数记忆和即时优势估计,无需梯度更新即可实现LLM智能体的测试时策略优化,在WebArena和Jericho上达到训练无关方法最优,且性能超越微调方法,成本降低30倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01382 2026-06-02 cs.LG cs.AI 92%

Efficient Exploration for Iterative Nash Preference Optimization

迭代纳什偏好优化的高效探索

Tianlong Nan, Xiaopeng Li, Christian Kroer, Tianyi Lin

机构 * Columbia University(哥伦比亚大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 指令微调 :SFT(summary_cn,abstract);preference optimization(title);LLM(abstract,abstract_cn);large language model(abstract)

AI总结 针对通用偏好模型下的迭代NLHF,提出显式探索算法,结合SFT正则化与对抗性策略探索,实现O(√T)遗憾界,避免对KL正则化参数的指数依赖。

Comments 49 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30148 2026-05-29 cs.LG cs.AI 92%

Overcoming Forgetting in LLM Fine-Tuning with Evolution Strategies

克服LLM微调中的遗忘:进化策略方法

Kajetan Schweighofer, Conor F. Hayes, Roberto Dailey, Risto Miikkulainen, Xin Qiu

机构 * Cognizant AI Lab(Cognizant AI实验室) UT Austin(得克萨斯大学奥斯汀分校)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文发现进化策略微调中的先前任务遗忘实为性能漂移且可恢复,并引入锚定权重衰减(AWD)正则化技术有效稳定先前任务性能,表明遗忘可避免,使ES成为LLM持续学习的可行方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26785 2026-05-27 cs.CL cs.AI 92%

EmoDistill: Offline Emotion Skill Distillation for Language Model Agents in Adversarial Negotiation

EmoDistill: 对抗性谈判中语言模型代理的离线情感技能蒸馏

Yunbo Long, Haolang Zhao, Lukas Beckenbauer, Liming Xu, Alexandra Brintrup

机构 * University of Cambridge(剑桥大学) Technical University of Munich(慕尼黑技术大学) Exiger LLC The Alan Turing Institute(艾伦·图灵研究所)

专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);SLM(abstract,abstract_cn);SFT(abstract,abstract_cn)

AI总结 提出EmoDistill离线框架,通过隐式Q学习选择情感和低秩适应策略表达情感,蒸馏情感谈判技能到语言模型代理,在四个高风险谈判领域取得最高效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18309 2026-05-19 cs.LG cs.AI 92%

Alignment Dynamics in LLM Fine-Tuning

在LLM微调中的对齐动力学

Yuhan Huang, Huanran Chen, Yinpeng Dong

机构 * Shanghai Qi Zhi Institue & University of Tokyo(上海启智研究院 & 东京大学) College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在LLM微调过程中对齐的动态特性,提出了一种可计算的对齐评分,并推导了其在微调过程中的闭式更新公式,从而建立了对齐动态的统一框架。通过将对齐更新分解为两种竞争成分:反弹力和驱动力,解释了为何先前的对齐可能被后续微调逆转,以及为何更狭窄的后验结构会增强这种逆转。此外,该框架预测了‘复习强化效应’,即先前的对齐会在重新暴露时留下潜在的后验印记,从而增强驱动力,导致更快的重新对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24496 2026-05-04 cs.LG cs.AI 92%

LLM DNA: Tracing Model Evolution via Functional Representations

LLM DNA:通过功能表示追溯模型进化

Zhaomin Wu, Haodong Zhao, Ziyang Wang, Jizhou Guo, Qian Wang, Bingsheng He

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Zhiyuan College, Shanghai Jiao Tong University(上海交通大学智远学院)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLM DNA概念,通过低维生物利普希茨表示捕捉模型功能行为,解决现有方法的局限性,实验显示其在模型关系分析和进化树构建中的有效性。

Comments ICLR 2026 (Oral)

Journal ref International Conference on Learning Representations 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24468 2026-04-28 cs.CR cs.CL cs.DC cs.LG 92%

A Survey on Split Learning for LLM Fine-Tuning: Models, Systems, and Privacy Optimizations

关于用于LLM微调的分裂学习的综述:模型、系统和隐私优化

Zihan Liu, Yizhen Wang, Rui Wang, Xiu Tang, Sai Wu

机构 * Zhejiang University(浙江大学)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文综述了分裂学习在LLM微调中的应用,探讨了模型、系统和隐私优化方法,旨在为该领域提供清晰的方向和系统的分类比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14116 2026-04-23 cs.AI cs.CL 92%

TREX: Automating LLM Fine-tuning via Agent-Driven Tree-based Exploration

TREX:通过代理驱动的树形探索自动化LLM微调

Zerun Ma, Guoqiang Wang, Xinchen Xie, Yicheng Chen, He Du, Bowen Li, Yanan Sun, Wenran Liu, Kai Chen, Yining Li

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 TREX通过代理驱动的树形探索自动化LLM训练全流程,包括需求分析、文献调研、策略制定和模型训练,提升微调效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16676 2026-04-23 cs.LG cs.CL 92%

WISCA: A Lightweight Model Transition Method to Improve LLM Training via Weight Scaling

WISCA:一种轻量级模型转换方法,通过权重缩放提高LLM训练

Jiacheng Li, Jianchao Tan, Zhidong Yang, Pingwei Sun, Feiye Huo, Jiayu Qin, Xiangyu Zhang, Maoxin He, Yerui Sun, Yuchen Xie, Guangming Tan, Weile Jia, Xunliang Cai, Tong Zhao

机构 * Meituan, Beijing, China(美团,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科技大学,香港特别行政区,中国) Xiamen University, Xiamen, China(厦门大学,厦门,中国)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 WISCA通过优化神经网络权重模式提升LLM训练效率和模型质量,实验显示在GQA架构和LoRA微调任务中显著提升收敛质量。

Comments Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13979 2026-04-16 cs.CL cs.AI cs.DB 92%

Leveraging LLM-GNN Integration for Open-World Question Answering over Knowledge Graphs

利用LLM-GNN集成进行知识图谱上的开放世界问答

Hussein Abdallah, Ibrahim Abdelaziz, Panos Kalnis, Essam Mansour

机构 * Concordia University(康科迪亚大学) IBM KAUST(科威特大学)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GLOW系统,结合预训练GNN和LLM进行开放世界知识图谱问答,通过结构化提示引导LLM推理,提升多跳推理和缺失链接处理能力,在GLOW-BENCH基准上取得显著提升。

Comments 18 pages,6 figures,10 tables. https://aclanthology.org/2026.eacl-long.26/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12016 2026-04-15 cs.AI cs.LG 92%

Identity as Attractor: Geometric Evidence for Persistent Agent Architecture in LLM Activation Space

身份作为吸引子:LLM激活空间中持久代理架构的几何证据

Vladimir Vasilenko

机构 * Independent Researcher(独立研究者) Rapallo, Italy(意大利拉帕洛)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究通过对比不同条件下的隐藏状态,发现语义相似的提示在LLM激活空间中呈现吸引子行为,证明代理身份文档在激活空间中诱导吸引子几何结构。

Comments 16 pages, 5 figures. Code and data: https://github.com/b102e/yar-attractor-experiment

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20100 2026-03-23 cs.CL cs.AI 92%

An Empirical Study of SFT-DPO Interaction and Parameterization in Small Language Models

小语言模型中SFT-DPO交互与参数化的实证研究

Yuming Feng, Christy Yang

机构 * Department of Computer Science(计算机科学系) Stanford University(斯坦福大学)

专题命中 指令微调 :language model(title,abstract);SFT(title,abstract);small language model(title);preference optimization(abstract)

AI总结 本文通过对比SFT、DPO及分阶段训练方法,发现全参数微调在小模型中表现更优,而偏好优化和低秩适应带来的边际收益有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11192 2025-12-09 cs.CL cs.AI 92%

I Learn Better If You Speak My Language: Understanding the Superior Performance of Fine-Tuning Large Language Models with LLM-Generated Responses

我如果能用我的语言说话会学得更好:理解通过微调大型语言模型与LLM生成响应的优越性能

Xuan Ren, Biao Wu, Lingqiao Liu

机构 * University of Adelaide(阿德莱德大学) University of Technology Sydney(悉尼科技大学)

专题命中 指令微调 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM生成响应在微调大型语言模型时的优越性能,发现LLM对自身生成响应的熟悉性是提升学习效果的关键因素。

Comments The paper has been accepted to EMNLP 2024 (Main Conference) there is a follow up paper: Efficiently Selecting Response Generation Strategies for Synthetic Data Construction by Self-Aligned Perplexity Note: This is a revised version of arXiv:2402.11192 (v1, submitted 17 Feb 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04488 2025-09-08 cs.CL cs.AI cs.SD eess.AS 92%

Serialized Output Prompting for Large Language Model-based Multi-Talker Speech Recognition

Hao Shi, Yusuke Fujita, Tomoya Mizumoto, Lianbo Liu, Atsushi Kojima, Yui Sudo

机构 * SB Intuitions

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);prompting(title);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03709 2025-08-07 q-bio.BM cs.CL cs.LG physics.comp-ph 92%

MD-LLM-1: A Large Language Model for Molecular Dynamics

Mhd Hussein Murtada, Z. Faidon Brotzakis, Michele Vendruscolo

机构 * Centre for Misfolding Diseases(折叠疾病中心) Yusuf Hamied Department of Chemistry(尤素夫·哈米德化学系) University of Cambridge(剑桥大学)

专题命中 指令微调 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02062 2025-06-11 cs.LG cs.CL 92%

TPP-LLM: Modeling Temporal Point Processes by Efficiently Fine-Tuning Large Language Models

Zefang Liu, Yinzhu Quan

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 指令微调 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12941 2025-05-30 cs.CL cs.LG 92%

HiDe-LLaVA: Hierarchical Decoupling for Continual Instruction Tuning of Multimodal Large Language Model

Haiyang Guo, Fanhu Zeng, Ziwei Xiang, Fei Zhu, Da-Han Wang, Xu-Yao Zhang, Cheng-Lin Liu

机构 * School of Advanced Interdisciplinary Sciences, UCAS(UCAS先进交叉科学学院) MAIS, CASIA(CASIA人工智能研究所) School of Artificial Intelligence, UCAS(UCAS人工智能学院) Centre for Artificial Intelligence and Robotics, HKISI-CAS(HKISI-CAS人工智能与机器人中心) FKLPRIU, School of Computer and Information Engineering, Xiamen University of Technology(厦门理工学院计算机与信息工程学院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title,abstract);分类 cs.CL、cs.LG

Comments ACL 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17161 2025-05-27 cs.AI cs.CV cs.LG 92%

SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training

Tianzhe Chu, Yuexiang Zhai, Jihan Yang, Shengbang Tong, Saining Xie, Dale Schuurmans, Quoc V. Le, Sergey Levine, Yi Ma

专题命中 指令微调 :foundation model(title,abstract);post-training(title,abstract);SFT(title,abstract);分类 cs.AI、cs.LG

Comments Website at https://tianzhechu.com/SFTvsRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16899 2025-04-16 cs.CL cs.AI 92%

Prompting or Fine-tuning? Exploring Large Language Models for Causal Graph Validation

Yuni Susanti, Nina Holsmoelle

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL、cs.AI

Journal ref Causal-NeSy @ ESWC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23523 2025-04-01 cs.CL cs.LG 92%

Question-Aware Knowledge Graph Prompting for Enhancing Large Language Models

Haochen Liu, Song Wang, Chen Chen, Jundong Li

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01218 2024-12-03 cs.AI cs.LG 92%

FD-LLM: Large Language Model for Fault Diagnosis of Machines

Hamzah A. A. M. Qaid, Bo Zhang, Dan Li, See-Kiong Ng, Wei Li

专题命中 指令微调 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

Comments 20 pages, 2 figures, 16 tables, including the tables in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03077 2024-10-07 cs.CL cs.AI 92%

CommonIT: Commonality-Aware Instruction Tuning for Large Language Models via Data Partitions

Jun Rao, Xuebo Liu, Lian Lian, Shengjun Cheng, Yunjie Liao, Min Zhang

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02198 2024-10-04 cs.LG cs.AI q-bio.QM 92%

G2T-LLM: Graph-to-Tree Text Encoding for Molecule Generation with Fine-Tuned Large Language Models

Zhaoning Yu, Xiangyang Xu, Hongyang Gao

专题命中 指令微调 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12822 2024-09-27 cs.CL cs.AI 92%

Is It Good Data for Multilingual Instruction Tuning or Just Bad Multilingual Evaluation for Large Language Models?

Pinzhen Chen, Simon Yu, Zhicheng Guo, Barry Haddow

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title,abstract);分类 cs.CL、cs.AI

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05457 2024-08-13 cs.CL cs.AI 92%

Investigating Instruction Tuning Large Language Models on Graphs

Kerui Zhu, Bo-Wei Huang, Bowen Jin, Yizhu Jiao, Ming Zhong, Kevin Chang, Shou-De Lin, Jiawei Han

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title,abstract);分类 cs.CL、cs.AI

Comments COLM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09391 2024-08-13 cs.AI cs.CE cs.CL 92%

LlaSMol: Advancing Large Language Models for Chemistry with a Large-Scale, Comprehensive, High-Quality Instruction Tuning Dataset

Botao Yu, Frazier N. Baker, Ziqi Chen, Xia Ning, Huan Sun

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by COLM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04691 2024-07-08 cs.CL cs.AI 92%

Simul-LLM: A Framework for Exploring High-Quality Simultaneous Translation with Large Language Models

Victor Agostinelli, Max Wild, Matthew Raffel, Kazi Ahmed Asif Fuad, Lizhong Chen

专题命中 指令微调 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏