arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-17 至 2026-03-17 共收录 44 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 44 篇

2603.13985 2026-03-17 cs.AI cs.CL 93%

Supervised Fine-Tuning versus Reinforcement Learning: A Study of Post-Training Methods for Large Language Models

监督微调与强化学习:大型语言模型后训练方法的探讨

Haitao Jiang, Wenbo Zhang, Jiarui Yao, Hengrui Cai, Sheng Wang, Rui Song

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);LLM(abstract)

AI总结 本文探讨了监督微调与强化学习在大型语言模型后训练中的联系与应用,分析了两者的方法、数据需求及整合框架,总结了混合训练趋势及未来研究方向。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12932 2026-03-17 cs.CL 92%

DS$^2$-Instruct: Domain-Specific Data Synthesis for Large Language Models Instruction Tuning

DS$^2$-Instruct: 领域特定数据合成用于大语言模型指令微调

Ruiyao Xu, Noelle I. Samia, Han Liu

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title,abstract);分类 cs.CL

AI总结 DS$^2$-Instruct通过零样本方法生成领域特定指令数据集,结合任务关键词和布卢姆分类法不同认知层次,提升模型在数学、金融等七个领域性能。

Comments EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22764 2026-03-17 cs.CL cs.AI cs.LG 90%

Boosting Large Language Models with Mask Fine-Tuning

通过掩码微调提升大语言模型

Mingyuan Zhang, Yue Bai, Huan Wang, Yizhou Wang, Qihua Dong, Yitian Zhang, Yun Fu

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出掩码微调方法,通过破坏模型结构完整性提升性能,适用于多种领域和模型架构,实现平均2.70/4.15的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14891 2026-03-17 cs.CL cs.AI 90%

Decision-Level Ordinal Modeling for Multimodal Essay Scoring with Large Language Models

基于大语言模型的多模态作文评分的决策级序数建模

Han Zhang, Jiamin Su, Li liu

专题命中 指令微调 :language model(title,abstract);large language model(title);LLM(abstract);SFT(abstract)

AI总结 本文提出DLOM方法,通过显式序数决策提升多模态作文评分的准确性,DLOM-GF和DLOM-DA分别引入门控融合模块和距离感知正则化项,实验表明在多模态和纯文本评分任务中均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15405 2026-03-17 cs.CL 89%

Fusian: Multi-LoRA Fusion for Fine-Grained Continuous MBTI Personality Control in Large Language Models

Fusian:多LoRA融合用于大语言模型中精细连续MBTI性格控制

Zehao Chen, Rong Pan

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract);分类 cs.CL

AI总结 本文提出Fusian框架,通过轨迹收集和基于强化学习的动态融合实现大语言模型中连续性格控制,实验显示其在性格控制精度上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17646 2026-03-17 cs.LG 88%

Unveiling the Basin-Like Loss Landscape in Large Language Models

揭示大语言模型中的盆地状损失景观

Huanran Chen, Yinpeng Dong, Zeming Wei, Yao Huang, Yichi Zhang, Hang Su, Jun Zhu

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 研究发现大语言模型的损失景观中出现盆地结构,随着模型规模增大,模型对参数空间扰动的鲁棒性增强,但最坏方向的损失景观尖锐且有害,对抗性微调会快速降低模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12222 2026-03-17 cs.LG cs.AI cs.CV 87%

Towards On-Policy SFT: Distribution Discriminant Theory and its Applications in LLM Training

迈向在线策略微调:分布判别理论及其在大语言模型训练中的应用

Miaosen Zhang, Yishan Liu, Shuxia Lin, Xu Yang, Qi Dai, Chong Luo, Weihao Jiang, Peng Hou, Anxiang Zeng, Xin Geng, Baining Guo

专题命中 指令微调 :SFT(title,abstract);LLM(title);分类 cs.AI、cs.LG

AI总结 本文提出分布判别理论及两种技术,提升SFT的泛化能力,实验表明其性能超越主流离线RL方法,且保持SFT效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13790 2026-03-17 cs.LG cs.CL 86%

Greedy Information Projection for LLM Data Selection

贪心信息投影用于大语言模型数据选择

Victor Ye Dong, Kuan-Yun Lee, Jiamei Shuai, Shengfei Liu, Yi Liu, Jian Jiao

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出贪心信息投影框架,通过最大化子集与任务查询信号的互信息,平衡质量与多样性,高效选择数据集进行微调。

Comments Published as a paper at 3rd DATA-FM workshop @ ICLR 2026, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04658 2026-03-17 cs.SD cs.AI 85%

LAMB: LLM-based Audio Captioning with Modality Gap Bridging via Cauchy-Schwarz Divergence

LAMB:基于LLM的音频描述通过Cauchy-Schwarz散度弥合模态间隙

Hyeongkeun Lee, Jongmin Choi, KiHyun Nam, Joon Son Chung

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LAMB框架,通过Cauchy-Schwarz散度弥合音频与文本嵌入空间的模态差距,设计Two-Stream Adapter和Token Guide提升LLM解码器推理能力,在AudioCaps上取得最佳性能。

Comments 5 pages, 2 figures; Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15237 2026-03-17 cs.CV 85%

Multi-turn Physics-informed Vision-language Model for Physics-grounded Anomaly Detection

多轮物理引导的视觉-语言模型用于物理基础的异常检测

Yao Gu, Xiaohao Xu, Yingna Wu

机构 * Shanghaitech University(上海科技大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 指令微调 :language model(title,abstract);LLM(abstract);instruction tuning(abstract)

AI总结 本文提出一种多轮物理引导的视觉-语言模型,通过编码物体属性和动态约束提升物理基础异常检测性能,实验显示其在视频级检测中达到96.7%的AUROC,优于现有最佳方法。

Comments Accepted by IEEE ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01804 2026-03-17 cs.CV 85%

V-CORE: Temporally Consistent Video Understanding for Video-LLM

V-CORE:面向视频大语言模型的时序一致视频理解

Zhengjian Kang, Qi Chen, Rui Liu, Kangtong Mo, Xingyu Zhang, Xiaoyu Deng, Ye Zhang

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 V-CORE通过引入显式时序约束提升视频理解性能,采用可学习空间聚合和因果感知时间投影器,有效解决视频时序一致性问题,在多个基准测试中取得显著成果。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16917 2026-03-17 cs.SD cs.AI cs.CL eess.AS 84%

SAKE: Towards Editing Auditory Attribute Knowledge of Large Audio-Language Models

SAKE:迈向大型音频-语言模型的听觉属性知识编辑

Chih-Kai Yang, Yen-Ting Piao, Tzu-Wen Hsu, Szu-Wei Fu, Zhehuai Chen, Ke-Han Lu, Sung-Feng Huang, Chao-Han Huck Yang, Yu-Chiang Frank Wang, Yun-Nung Chen, Hung-yi Lee

专题命中 指令微调 :language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SAKE基准,用于评估大型音频-语言模型中听觉属性知识的编辑方法,发现多数方法在可靠性上表现良好,但在听觉泛化和多模态知识传播方面存在不足,细调模态连接器比直接编辑LLM更稳健。

Comments Work in progress. Resources: https://github.com/ckyang1124/SAKE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12248 2026-03-17 cs.LG 83%

Matching Features, Not Tokens: Energy-Based Fine-Tuning of Language Models

匹配特征而非标记:基于能量的语言模型微调

Samy Jelassi, Mujin Kwun, Rosie Zhao, Yuanzhi Li, Nicolo Fusi, Yilun Du, Sham M. Kakade, Carles Domingo-Enrich

机构 * Harvard University, Kempner Institute(哈佛大学凯普纳研究所) Microsoft Research New England(微软研究院新英格兰分部)

专题命中 指令微调 :language model(title,abstract);SFT(abstract);分类 cs.LG

AI总结 本文提出基于能量的语言模型微调方法,通过匹配序列级统计信息提升模型表现,无需任务特定验证器或偏好模型,在多个任务中优于传统微调方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13587 2026-03-17 cs.AI cs.CV 83%

Breaking the SFT Plateau: Multimodal Structured Reinforcement Learning for Chart-to-Code Generation

突破SFT平台:面向图表到代码生成的多模态结构强化学习

Lei Chen, Xuanle Zhao, Zhixiong Zeng, Jing Huang, Liming Zheng, Yufeng Zhong, Lin Ma

专题命中 指令微调 :SFT(title,abstract);language model(abstract);分类 cs.AI

AI总结 本文提出多模态结构强化学习(MSRL)以突破SFT平台,通过大规模实验构建最大训练语料库,并采用双阶段课程训练策略,提升图表到代码生成的高阶指标。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16931 2026-03-17 cs.AI 83%

Narrow Fine-Tuning Erodes Safety Alignment in Vision-Language Agents

细粒度微调会削弱视觉语言代理的安全对齐

Idhant Gulati, Shivam Raval

专题命中 指令微调 :language agent(title);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 研究发现细粒度微调在有害数据集上会导致广泛的任务和模态对齐偏差,且单模态安全基准可能低估视觉语言模型的对齐退化。

Comments 25 pages, 14 figures, Published at the Lifelong Agent Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13647 2026-03-17 cs.CL 83%

Instruction Tuning on Public Government and Cultural Data for Low-Resource Language: a Case Study in Kazakh

在公共政府和文化数据上进行指令微调以处理低资源语言:哈萨克语案例研究

Nurkhan Laiyk, Daniil Orel, Rituraj Joshi, Maiya Goloburda, Yuxia Wang, Preslav Nakov, Fajri Koto

专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文通过构建大规模哈萨克语指令遵循数据集,提升低资源语言中政府与文化领域LLM的理解能力,并验证了基于LLM的指令微调方法在多选和生成任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09065 2026-03-17 cs.LG 83%

Learning Adaptive LLM Decoding

学习自适应的大语言模型解码

Chloe H. Su, Zhe Ye, Samuel Tenka, Aidan Yang, Soonho Kong, Udaya Ghai

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出学习自适应解码策略,通过强化学习和可验证终端奖励提升解码准确性与预算平衡,实验表明在数学和编程竞赛基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15431 2026-03-17 cs.LG cs.AI cs.NA math.AP math.NA 81%

Physics-informed fine-tuning of foundation models for partial differential equations

基于物理约束的微调基础模型用于偏微分方程

Vlad Medvedev, Leon Armbruster, Christopher Straub, Georg Kruse, Andreas Rosskopf

机构 * Fraunhofer Institute for Integrated Systems and Device Technology(弗劳恩霍夫整合系统与器件技术研究所)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种结合物理约束的微调方法,用于适应偏微分方程基础模型,提升数据稀缺情况下模型的物理一致性和泛化能力。

Comments 12 pages, 6 figures, 1 table

Journal ref ICLR 2026 Workshop on Artificial Intelligence and Partial Differential Equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15183 2026-03-17 cs.DC cs.AI cs.LG cs.MA 81%

Token Coherence: Adapting MESI Cache Protocols to Minimize Synchronization Overhead in Multi-Agent LLM Systems

令牌一致性:适应MESI缓存协议以最小化多智能体大语言模型系统中的同步开销

Vladyslav Parakhin

机构 * Independent Researcher(独立研究者)

专题命中 指令微调 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出令牌一致性理论,通过将MESI协议应用于多智能体系统,减少同步开销,验证了在多智能体大语言模型中同步成本与缓存一致性问题的对应关系,并通过形式化验证协议确保安全性与一致性。

Comments 25 pages. Code and reproduction scripts at https://github.com/hipvlady/agent-coherence

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00824 2026-03-17 cs.LG cs.AI cs.CL cs.NE 80%

A Gauge Theory of Superposition: Toward a Sheaf-Theoretic Atlas of Neural Representations

超位置的规范理论:神经表示的sheaf理论地图

Hossein Javidnia

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种离散规范框架,用于大语言模型中的超位置,通过sheaf理论的局部语义图来替代单一全局词典。研究通过局部特征空间和信息几何度量,提出三种可测量的全局可解释性障碍。

Comments 35 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13292 2026-03-17 cs.LG cs.AI 79%

Pragma-VL: Towards a Pragmatic Arbitration of Safety and Helpfulness in MLLMs

Pragma-VL:迈向多模态大语言模型中安全与助人的务实仲裁

Ming Wen, Kun Yang, Xin Chen, Jingyu Zhang, Dingding Han, Shiwen Cui, Yuedong Xu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团) Zhejiang University(浙江大学) UCLA(加州大学洛杉矶分校) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI、cs.LG

AI总结 Pragma-VL通过引入一种端到端的对齐算法,解决了多模态大语言模型在安全与助人之间的平衡问题,通过增强视觉风险感知和理论保证的奖励模型,在多数多模态安全基准上提升了性能。

Comments 31 pages, ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15003 2026-03-17 cs.CV 78%

Edit2Interp: Adapting Image Foundation Models from Spatial Editing to Video Frame Interpolation with Few-Shot Learning

Edit2Interp:从空间编辑到视频帧插值的图像基础模型适应

Nasrin Rahimi, Mısra Yavuz, Burak Can Biner, Yunus Bilge Kurt, Ahmet Rasim Emirdağı, Süleyman Aslan, Görkay Aydemir, M. Akın Yılmaz, A. Murat Tekalp

机构 * Codeway AI Research Dept. of Electrical \& Electronics Engineering, Ko c University, \. I stanbul, T\" u rkiye

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文通过少量样本学习,将图像编辑模型适应于视频帧插值,揭示了静态场景中物体变换的理解可激活潜在的时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06999 2026-03-17 cs.CV 78%

TrajPred: Trajectory-Conditioned Joint Embedding Prediction for Surgical Instrument-Tissue Interaction Recognition in Vision-Language Models

TrajPred: 基于轨迹的联合嵌入预测用于视觉-语言模型中手术器械-组织交互识别

Jiajun Cheng, Xiaofan Yu, Subarna Tripathi, Sainan Liu, Shan Lin

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出TrajPred框架,通过编码器械轨迹融入时间运动线索,并基于轨迹引入预测模块生成更精确的视觉语义嵌入,提升手术器械-组织交互识别的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03565 2026-03-17 cs.CV 78%

INST-IT: Boosting Instance Understanding via Explicit Visual Prompt Instruction Tuning

INST-IT:通过显式视觉提示指令微调提升实例理解

Wujian Peng, Lingchen Meng, Yitong Chen, Yiweng Xie, Yang Liu, Tao Gui, Hang Xu, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

专题命中 指令微调 :instruction tuning(title,abstract)

AI总结 本文提出INST-IT方法,通过显式视觉提示指令微调提升大模型的实例理解能力,构建了评估基准和数据集,并在多个基准上验证了方法的有效性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21107 2026-03-17 cs.SE cs.AI 77%

Learning to Generate Unit Test via Adversarial Reinforcement Learning

通过对抗强化学习学习生成单元测试

Dongjun Lee, Changho Hwang, Kimin Lee

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出UTRL框架,通过对抗强化学习训练LLM生成高质量单元测试,实验表明其优于监督微调和前沿模型。

Comments Accepted to ICLR 2026. Code is available at: https://github.com/dgjun32/UTRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01450 2026-03-17 cs.CL 77%

Towards Efficient Medical Reasoning with Minimal Fine-Tuning Data

面向最少微调数据的高效医疗推理

Xinlin Zhuang, Feilong Tang, Haolin Yang, Xiwei Liu, Ming Hu, Huifa Li, Haochen Xue, Junjun He, Zongyuan Ge, Yichen Li, Ying Qian, Imran Razzak

专题命中 指令微调 :LLM(abstract);language model(abstract);SFT(abstract);分类 cs.CL

AI总结 本文提出DIQ数据选择策略,通过平衡难度与梯度影响,提升医疗推理效率,实验证明仅用1%数据即可达到全数据表现,10%数据优于基线方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13307 2026-03-17 cs.IR cs.LG 77%

Suppressing Domain-Specific Hallucination in Construction LLMs: A Knowledge Graph Foundation for GraphRAG and QLoRA on River and Sediment Control Technical Standards

抑制构造LLM中的领域特定幻觉:图RAG和QLoRA在河流和泥沙控制技术标准上的知识图谱基础

Takato Yasuno

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过知识图谱和QLoRA技术,解决基于日本河流和泥沙控制技术标准的问答问题,发现领域特定微调在质量和效率上优于GraphRAG。

Comments 17 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14336 2026-03-17 cs.CV 75%

UAVBench and UAVIT-1M: Benchmarking and Enhancing MLLMs for Low-Altitude UAV Vision-Language Understanding

UAVBench 和 UAVIT-1M:用于低空无人机视觉-语言理解的LLM基准测试与增强

Yang Zhan, Yuan Yuan

专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出UAVBench和UAVIT-1M,用于评估和提升LLM在低空无人机视觉-语言任务中的能力,通过大规模数据集和基准测试揭示开源LLM在低空视觉内容生成上的不足,并通过微调提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19001 2026-03-17 eess.AS cs.SD 75%

HD-PPT: Hierarchical Decoding of Content- and Prompt-Preference Tokens for Instruction-based TTS

HD-PPT: 基于内容和提示偏好令牌的分层解码用于基于指令的语音合成

Sihang Nie, Xiaofen Xing, Jingyuan Xing, Baiji Liu, Xiangmin Xu

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出HD-PPT框架,通过分层解码策略提升指令遵循性和语音自然度,实现更精细的语音合成控制。

Comments 5 pages, 2 figures, 3 tables; Accepted to ICASSP2026(Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14893 2026-03-17 cs.CL cs.AI 73%

LLMs as Signal Detectors: Sensitivity, Bias, and the Temperature-Criterion Analogy

LLMs作为信号检测器:灵敏度、偏差以及温度-准则类比

Jon-Paul Cacioli

机构 * Independent Researcher(独立研究者)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究LLMs作为信号检测器的灵敏度和偏差,探讨温度是否如同心理物理学中的准则调整,并发现温度同时影响灵敏度和准则,揭示SDT框架在评估LLMs校准方面的必要性。

Comments 15 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏