arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11502 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11502 篇

2602.14012 2026-05-05 cs.CR cs.AI cs.SE 96%

From SFT to RL: Demystifying the Post-Training Pipeline for LLM-based Vulnerability Detection

从SFT到RL:解开基于LLM的漏洞检测后训练流程的谜团

Youpeng Li, Fuxun Yu, Xinda Wang

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Microsoft(微软)

专题命中 指令微调 :LLM(title,title_cn);SFT(title,title_cn);post-training(title,abstract);preference optimization(abstract)

AI总结 本文研究了基于LLM的漏洞检测后训练流程,发现基于GRPO的在线RL优于SFT和离线偏好优化方法,提出了数据筛选、阶段交互、奖励机制和评估协议的改进策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04466 2026-06-04 cs.CL 95%

Learning What to Learn: Stage-Specific Data Sets for SFT-then-RL in Small Language Model Reasoning

学习什么:小语言模型推理中SFT-then-RL的阶段特定数据集

Chongyang He, Rui Zhang, Zixuan Wang, Xin Li

机构 * Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) DiDi(滴滴出行) University of Electronic Science and Technology of China(电子科技大学)

专题命中 指令微调 :SFT(title,title_cn);language model(title,abstract);small language model(title,abstract);SLM(abstract,abstract_cn)

AI总结 提出一种难度感知的SFT-then-RL框架,通过阶段特定数据集(SFT阶段使用桥接机制,RL阶段使用批判微调)协调数据难度,提升小语言模型推理性能。

Comments 25 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22606 2026-06-23 cs.CL cs.LG 新提交 95%

Sub-Billion, Super-Frontier: Small Language Models Rival Zero-Shot Frontier LLMs on General and Literary Relation Extraction

十亿以下,超级前沿:小语言模型在通用和文学关系抽取上媲美零样本前沿LLM

Despina Christou, Grigorios Tsoumakas

机构 * School of Informatics, Aristotle University of Thessaloniki(亚里士多德大学塞萨洛尼基分校信息学院) Archimedes, Athena Research Center(雅典娜研究中心阿基米德实验室)

专题命中 指令微调 :LLM(title_cn,summary_cn);language model(title,abstract);small language model(title,abstract);SLM(summary_cn,abstract_cn)

AI总结 研究小语言模型(SLM)在通用和文学关系抽取任务上能否通过任务适配缩小与零样本前沿LLM的差距,发现4位SLM经微调后性能超越GPT-5.4和Claude Sonnet 4.6,归因于任务适配而非生成解码。

Comments 41 pages, 3 figures, 25 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21438 2026-05-11 cs.CL cs.LG 95%

UFT: Unifying Fine-Tuning of SFT and RLHF/DPO/UNA through a Generalized Implicit Reward Function

UFT:通过通用隐式奖励函数统一SFT和RLHF/DPO/UNA的微调

Zhichao Wang, Bin Bi, Zixu Zhu, Xiangbo Mao, Jun Wang, Shiyu Wang, Cheng Wang, Dong Nie, Lingzi Hong

机构 * Salesforce RadixArk ChatAlpha AI University of North Texas(北卡罗来纳州立大学)

专题命中 指令微调 :SFT(title,title_cn);RLHF(title,title_cn);LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 本文提出UFT框架,通过隐式奖励函数整合SFT与对齐过程,提升指令微调和事实性任务的性能,实验显示其优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17967 2026-05-19 cs.AI 94%

Reconciling Contradictory Views on the Effectiveness of SFT in LLMs: An Interaction Perspective

弥合对SFT在LLM中效果的矛盾观点:一种交互视角

Junpeng Zhang, Lei Cheng, Guoxi Zhang, Hua Cai, Qing Xu, Quanshi Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing Institute for General Artificial Intelligence(北京一般人工智能研究院) UniDT

专题命中 指令微调 :SFT(title,title_cn);LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文从交互视角探讨了SFT在LLM中的效果不一致问题,发现SFT主要去除噪声交互但难以获得可靠新交互,且去噪阶段短暂,继续微调易引入过拟合交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24273 2026-08-11 cs.AI 版本更新 94%

How Much Backtracking is Enough? Exploring the Interplay of SFT and RL in Enhancing LLM Reasoning

回溯应达到何种程度?探索SFT与RL在增强大语言模型推理能力中的相互作用

Hongyi James Cai, Junlin Wang, Xiaoyin Chen, Bhuwan Dhingra

机构 * Duke University(杜克大学) Mila - Quebec AI Institute(魁北克人工智能研究所)

专题命中 指令微调 :SFT(title,title_cn);LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究探索SFT与RL在LLM推理中的相互作用,提出回溯是关键算子,发现最优回溯深度随任务难度变化,引入以回溯为核心的训练方案,证实合理回溯可提升模型推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07962 2026-05-22 cs.CL cs.AI 94%

LightReasoner: Can Small Language Models Teach Large Language Models Reasoning?

LightReasoner: 小型语言模型能否教会大型语言模型推理?

Jingyuan Wang, Yankai Chen, Zhonghang Li, Chao Huang

机构 * University of Hong Kong(香港大学) University of Chicago(芝加哥大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);small language model(title);LLM(abstract,abstract_cn)

AI总结 本文提出LightReasoner框架,通过利用强专家模型与弱业余模型之间的行为差异,发现高价值推理时刻,从而提升大型语言模型的推理能力,同时减少资源消耗。

Comments Updated to ACL 2026 camera-ready version with improved method presentation, expanded related work discussion, additional analyses, and presentation refinements

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16097 2026-08-11 cs.LG cs.AI cs.CL 版本更新 94%

Understanding Reasoning from Pretraining to Post-Training

理解从预训练到训练后阶段的推理

Jingyan Shen, Ang Li, Salman Rahman, Yifan Sun, Micah Goldblum, Matus Telgarsky, Pavel Izmailov

机构 * New York University(纽约大学) Modal Labs(模态实验室) University of California, Los Angeles(加州大学洛杉矶分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学)

专题命中 指令微调 :SFT(summary_cn,abstract);pretraining(title,abstract);post-training(title,abstract);LLM(abstract,abstract_cn)

AI总结 研究强化学习在大语言模型从预训练到训练后阶段对推理的作用,以国际象棋为测试平台,按标准流程训练模型,发现预训练损失可预测RL后性能,RL奖励曲线斜率与预训练令牌有关,还揭示RL对SFT策略的影响,且在数学领域也有相同模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23747 2026-04-28 cs.LG cs.AI cs.CL 94%

SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning

在LLM推理中,SFT-然后-RL优于混合策略方法

Alexis Limozin, Eduard Durech, Torsten Hoefler, Imanol Schlag, Valentina Pyatkin

机构 * ETH AI Center, ETH Zürich(苏黎世联邦理工学院人工智能中心) EPFL(瑞士联邦理工学院) Allen Institute for AI(人工智能研究所)

专题命中 指令微调 :SFT(title,title_cn);LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文指出,混合策略方法的性能提升源于两个错误:DeepSpeed优化器在梯度累积中丢失中间微批次,以及OpenRLHF损失聚合错误加权。修正后,标准SFT-然后-RL流程在数学基准上超越了所有混合策略方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25063 2026-07-29 cs.AI 新提交 94%

Similar Models Learn Differently: Final-Window Pretraining Shapes Post-Training Beyond SFT

相似模型学习方式不同:最终窗口预训练对训练后行为的塑造超越监督微调

Cen Lu, Yung-Chen Tang, Andrea Cavallaro

专题命中 指令微调 :SFT(title,summary_cn);pretraining(title,abstract);post-training(title,abstract);instruction tuning(abstract)

AI总结 研究探讨模型预训练最后窗口对训练后行为的影响,通过控制实验发现不同预训练最后窗口数据的分支,SFT后表现相近,但后续训练走向不同,安全文本分支有保护效果,表明不能仅依SFT后行为评估模型,还应考虑预训练最后内容。

Comments 16 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11735 2026-05-13 cs.LG eess.SP 94%

U-STS-LLM A Unified Spatio-Temporal Steered Large Language Model for Traffic Prediction and Imputation

U-STS-LLM:一个统一的时空引导大型语言模型用于交通预测与填补

Yichen Zhang, Jun Li

机构 * School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学)

专题命中 指令微调 :LLM(title,title_cn);language model(title,abstract);large language model(title);foundation model(abstract)

AI总结 本文提出U-STS-LLM,结合时空引导的LLM,解决交通预测与填补问题,通过动态时空注意力偏置生成器和LoRA微调,实现高效稳定的数据表示学习。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06632 2026-05-08 cs.LG 94%

Crafting Reversible SFT Behaviors in Large Language Models

在大型语言模型中构建可逆的SFT行为

Yuping Lin, Pengfei He, Yue Xing, Yingqian Cui, Jiayuan Ding, Subhabrata Mukherjee, Hui Liu, Zhen Xiang

机构 * Michigan State University(密歇根州立大学) Hippocratic AI(希波克拉底AI) University of Georgia(佐治亚大学)

专题命中 指令微调 :SFT(title,title_cn);large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出LCDD和SFT-Eraser方法,通过构建稀疏必要子网络实现对SFT诱导行为的可控逆向,验证了结构对行为因果必要性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12748 2026-05-14 cs.CL cs.AI cs.CY cs.LG 94%

Simulating Students or Sycophantic Problem Solving? On Misconception Faithfulness of LLM Simulators

模拟学生还是阿谀奉承的问题解决?关于LLM模拟器的误解忠实性

Heejin Do, Shashank Sonkar, Mrinmaya Sachan

机构 * ETH Zürich(苏黎世联邦理工学院) ETH AI Center(ETH人工智能中心) University of Central Florida(中央佛罗里达大学)

专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出评估LLM模拟器误解忠实性的框架,发现现有模型在反馈下倾向于修正答案而非维持误解,提出Selective Flip Score指标并改进训练方法以提升误解忠实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25436 2026-06-25 eess.AS cs.CL cs.SD 交叉投稿 94%

Evaluating Japanese Dialect Robustness Across Speech and Text-based Large Language Models

评估日语方言在基于语音和文本的大型语言模型中的鲁棒性

Tomoya Mizumoto, Yusuke Fujita, Hao Shi, Lianbo Liu, Atsushi Kojima, Yui Sudo

机构 * SB Intuitions

专题命中 指令微调 :LLM(summary_cn,abstract);SLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 研究通过日语方言测试,发现语音语言模型(SLM)的方言鲁棒性与文本基座LLM相关,方言数据训练和语音编码器微调可提升鲁棒性。

Comments Accepted to ASRU2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19266 2026-06-18 cs.CL cs.AI 新提交 94%

Trade-offs in Medical LLM Adaptation: An Empirical Study in French QA

医学LLM适应中的权衡:法语问答的实证研究

Ikram Belmadani, Oumaima El Khettari, Carlos Ramisch, Frederic Bechet, Richard Dufour, Benoit Favre

机构 * Aix-Marseille Univ., CNRS, LIS UMR 7020(艾克斯-马赛大学,法国国家科学研究中心,LIS UMR 7020) Nantes Univ., École Centrale Nantes, CNRS, LS2N UMR 6004(南特大学,南特中央理工大学,法国国家科学研究中心,LS2N UMR 6004) Grenoble Alpes Univ., CNRS, INRIA, Grenoble INP, LIG UMR 5217(格勒诺布尔阿尔卑斯大学,法国国家科学研究中心,INRIA,格勒诺布尔INP,LIG UMR 5217)

专题命中 指令微调 :LLM(title,title_cn);SFT(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 通过法语医学问答任务,实证比较持续预训练(CPT)和监督微调(SFT)在多个模型家族和规模下的效果,发现CPT+SFT在多项选择问答上最优但增益小,SFT是强且经济的默认选择,而CPT在开放式问答中提升重叠指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04780 2026-05-26 cs.CL cs.AI 94%

Graph-oriented Instruction Tuning of Large Language Models for Generic Graph Mining

面向通用图挖掘的大语言模型图导向指令微调

Yanchao Tan, Hang Lv, Pengxiang Zhan, Shiping Wang, Carl Yang

机构 * Engineering Research Center of Big Data Intelligence, Ministry of Education(教育部大数据智能工程研究中心) Fujian Key Laboratory of Network Computing and Intelligent Information Processing(福建省网络计算与智能信息处理重点实验室) College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院) Department of Computer Science, Emory University(埃默里大学计算机科学系)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 提出MuseGraph框架,通过紧凑图描述、基于思维链的指令生成和图感知指令微调,将GNN与LLM结合,实现跨任务和数据集的高效图挖掘。

Comments Accepted by TPAMI 2025

Journal ref IEEE Trans. Pattern Anal. Mach. Intell., vol. 48, no. 1, pp. 155-169, Jan. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16826 2026-05-19 cs.LG cs.AI cs.CL 94%

Decoupling KL and Trajectories: A Unified Perspective for SFT, DAgger, Offline RL, and OPD in LLM Distillation

解耦KL与轨迹:为LLM蒸馏中的SFT、DAgger、离线RL和OPD提供统一视角

Anhao Zhao, Haoran Xin, Yingqi Fan, Junlong Tong, Wenjie Li, Xiaoyu Shen

机构 * Eastern Institute of Technology(东技术院) The Hong Kong Polytechnic University(香港理工大学) Shanghai Jiao Tong University(上海交通大学) Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(人工智能 thrust,香港科学与技术大学(广州))

专题命中 指令微调 :LLM(title,title_cn);SFT(title,title_cn);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了知识蒸馏中KL散度与轨迹之间的耦合问题,通过解耦两个轴向,提出了四种有效的蒸馏目标,并通过实验揭示了KL方向、前缀源和训练长度之间的权衡关系,提出了KL混合和熵门长度课程等实用方法。

Comments Code available at https://github.com/EIT-NLP/Decoupled-Distill

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01652 2026-08-04 cs.RO cs.AI 新提交 94%

SyncPlan: Long-Horizon LLM Coordination with Explicit Synchronization and Adaptive Correction

SyncPlan:通过显式同步与自适应修正实现长视 Large Language Model(大语言模型,LLM)协调

Shen You, Xiaoming Zhu, Weining Weng, Hefei Mei, Weixuan Wang, Zhongshen Li, Zeji LI, Ye-Wen Wang, Zijun Liao, Juchao Zhuo, Yang Wei, Fuhao Qiu, Siqin Li, Zhenjie Lian, Danei Gong, Junkai Ji, Xiangtao Li, Qiuzhen Lin, Liang Wang, Ka-Chun Wong

专题命中 指令微调 :LLM(title,title_cn);large language model(title_cn);language model(title_cn);SFT(abstract,abstract_cn)

AI总结 SyncPlan 是用于长视 LLM 多智能体协调的“规划-执行-修正”框架,通过显式同步、自适应修正及轻量级计划过时检测器优化,在低耗时下实现了超越现有方法的任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01436 2026-06-02 cs.CL 94%

Learning from Saturated Data: Signals Beyond Correctness for LLM Training

从饱和数据中学习:LLM训练中超越正确性的信号

Hanno Hiss, Jasper Dekoninck, Martin Vechev

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 指令微调 :LLM(title,title_cn);SFT(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究在基准测试和训练数据集饱和的情况下,如何利用超越二元正确性的细粒度质量信号(如成对LLM自判断和token级熵)来提升下游性能,实验表明在简单算术任务上质量信号显著优于SFT,但在复杂任务上效果有限且需谨慎校准。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22731 2026-05-22 cs.LG cs.AI 94%

Post-Training is About States, Not Tokens: A State Distribution View of SFT, RL, and On-Policy Distillation

训练后是关于状态,而不是标记:一种状态分布视角下的SFT、RL和在线策略蒸馏

Dong Nie

机构 * Independent Researcher(独立研究者)

专题命中 指令微调 :SFT(title,title_cn);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文从状态分布的角度研究了监督微调(SFT)、强化学习(RL)和在线策略蒸馏(OPD)等大语言模型训练后方法,发现训练状态的来源和局部性与监督信号的形式同样重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01712 2026-05-21 cs.AI cs.LG 94%

FT-Dojo: Towards Autonomous LLM Fine-Tuning with Language Agents

FT-Dojo: 向自主LLM微调迈进的语言代理

Qizheng Li, Yifei Zhang, Xiao Yang, Xu Yang, Zhuo Wang, Weiqing Liu, Jiang Bian

机构 * Peking University(北京大学) Nanjing University(南京大学) Microsoft Research Asia(微软亚洲研究院) The University of Chicago(芝加哥大学)

专题命中 指令微调 :LLM(title,title_cn);language agent(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出FT-Dojo交互式基准环境,用于研究自主LLM微调,通过标准化任务接口、共享数据仓库、沙盒执行环境和反馈协议,开发了FT-Agent框架,实现了结构化迭代规划和多级反馈分析,实验显示FT-Agent在13个任务中表现优异,且展示了代理在故障恢复和长期规划中的能力。

Comments 26 pages, 6 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09718 2026-02-12 cs.CL cs.AI 94%

StatLLaMA: Multi-Stage training for domain-optimized statistical large language models

StatLLaMA:面向统计领域优化的多阶段训练方法

Jing-Yi Zeng, Guan-Hua Huang

机构 * Institute of Statistics, National Yang Ming Chiao Tung University(统计研究所,国立阳明交通大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

AI总结 StatLLaMA通过多阶段训练方法优化统计领域,实现高效且平衡的模型性能。

Comments 31 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19294 2026-07-02 cs.LG cs.AI cs.CL 版本更新 94%

Maximizing Mutual Information Between Prompt and Response Improves LLM Performance With No Additional Data

最大化提示与响应之间的互信息无需额外数据即可提升LLM性能

Hyunji Nam, Haoran Li, Natasha Jaques

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出互信息偏好优化(MIPO)方法,通过对比数据增强构建偏好对,利用直接偏好优化最大化提示与响应间的点互信息,无需额外数据或外部监督即可提升LLM在个性化和可验证任务上的性能。

Comments International Conference on Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29709 2026-06-30 cs.SE 94%

Bash-Commenter: Leveraging Syntax-Aware Preference Optimization to Reinforce Large Language Model for Bash Code Comment Generation

Bash-Commenter:利用语法感知偏好优化增强大语言模型生成Bash代码注释

Lei Yu, Jingyuan Zhang, Xin Wang, Li Yang, Fengjun Zhang, Peng Wang, Jia Xu, Jiajia Ma

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract);LLM(abstract,abstract_cn)

AI总结 针对Bash脚本注释缺乏问题,提出基于LLaMA-3.1-8B的Bash-Commenter方法,通过构建高质量数据集、持续预训练和监督微调,并引入语法感知偏好优化(SAPO)利用抽象语法树构造偏好对,显著提升注释生成质量。

Comments Accepted to FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19988 2026-06-19 cs.SE 新提交 94%

Repository-Level Solidity Code Generation with Large Language Models: From Prompting to Fine-Tuning

基于大语言模型的仓库级Solidity代码生成:从提示到微调

Shi Chen, Rongcun Wang, Yuan Tian, Xiaoyuan Xie, Wei Song, Rubing Huang

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(title,abstract)

AI总结 提出SolidityBench基准和SolidityScore指标,评估多种LLM方法在仓库级Solidity代码生成中的表现,发现监督微调最有效。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25956 2026-07-29 cs.AI math.OC 新提交 93%

Large Language Model for Operations Research Formulation Selection in Multi-Warehouse Inventory Allocation

用于多仓库库存分配中运筹学公式选择的大语言模型

Jintao Xu, Yingzheng Ma, Jiong Dong, Yongzhi Qi, Jianshen Zhang

专题命中 指令微调 :SFT(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 研究多仓库库存分配中运筹学公式选择问题,提出求解器引导的大语言模型框架,通过构建SFT记录、转换质量差距为偏好等进行训练,实验表明GRPO能显著提高选择准确性和分配质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02214 2026-07-03 cs.CL eess.AS 新提交 93%

Unlocking Speech-Text Compositional Powers: Instruction-Following Speech Language Models without Instruction Tuning

解锁语音-文本组合能力:无需指令微调的指令跟随语音语言模型

Congrui Du, Yang Zhang, Kaizhi Qian, Shiyu Chang

机构 * University of California, Santa Barbara, USA(加州大学圣芭芭拉分校) MIT-IBM Computing Research Lab, IBM Research, USA(麻省理工-IBM计算研究实验室,IBM研究)

专题命中 指令微调 :LLM(summary_cn,abstract);language model(title,abstract);instruction tuning(title,abstract);SLM(abstract,abstract_cn)

AI总结 提出SpeechCombine,通过单轮30k小时语音预训练和权重组合,无需指令微调即可实现指令跟随,有效将文本LLM能力迁移至语音域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21974 2026-06-23 quant-ph cs.AI 新提交 93%

Fine-Tuning Large Language Models for Quantum Reasoning

微调大型语言模型用于量子推理

Katherine Ip, Casey R. Myers, Udaya Parampalli, James Quach, Peiyong Wang

机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算机与信息系统学院) School of Physics, Mathematics and Computing, The University of Western Australia(西澳大学物理、数学与计算学院) Pawsey Supercomputing Centre(帕韦西超级计算中心) CSIRO Clayton(CSIRO 克莱顿分校)

专题命中 指令微调 :SFT(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 提出通过量子电路模拟微调LLM,比较监督微调与两阶段SFT+GRPO方法,实现量子推理能力提升。

Comments 30 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06948 2026-06-02 cs.CL 93%

Beyond Two-Stage Training: Cooperative SFT and RL for LLM Reasoning

超越两阶段训练:用于大语言模型推理的协作式SFT与RL

Liang Chen, Xueting Han, Li Shen, Jing Bai, Kam-Fai Wong

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 指令微调 :SFT(title,title_cn);LLM(title);large language model(abstract);language model(abstract)

AI总结 提出BRIDGE框架,通过选择性知识迁移使SFT辅助RL训练,在数学推理等任务上优于两阶段和单阶段混合方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27747 2026-05-28 stat.ML cs.LG stat.CO 93%

Soft Specialists: $α$-Rényi Ensembles for Uncertainty-Aware LLM Post-Training

软专家:用于不确定性感知的LLM后训练的$\alpha$-Rényi集成

Paula Cordero-Encinar, Georgy Tyukin, Andrew B. Duncan

机构 * Department of Mathematics, Imperial College London(帝国理工学院伦敦校区数学系) Bessemer AI

专题命中 指令微调 :LLM(title,title_cn);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出一种$\alpha$-Rényi变分框架,通过学习后训练参数的分布来替代深度集成,实现不确定性感知的LLM后训练,并支持软路由和模型专业化。

详情

展开后加载摘要…

URL PDF HTML 收藏