arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-12 至 2026-03-12 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 15 篇

2603.03203 2026-03-12 cs.AI cs.CL 88%

No Memorization, No Detection: Output Distribution-Based Contamination Detection in Small Language Models

无记忆,无检测:基于输出分布的污染检测在小语言模型中

Omer Sela

机构 * Tel Aviv University(特拉维夫大学)

专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了基于输出分布的污染检测方法CDD在小语言模型中的有效性,发现其在多数情况下表现不佳,而基于概率的方法更优。

Comments Code available at https://github.com/Sela-Omer/Contamination-Detection-Small-LM

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01968 2026-03-12 cs.CL cs.AI 86%

Token Cleaning: Fine-Grained Data Selection for LLM Supervised Fine-Tuning

令牌清理:面向LLM监督微调的细粒度数据选择

Jinlong Pang, Na Di, Zhaowei Zhu, Jiaheng Wei, Hao Cheng, Chen Qian, Yang Liu

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出了一种令牌清洗方法,通过评估令牌质量并过滤无信息令牌,提升LLM监督微调的下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10904 2026-03-12 cs.SD cs.AI cs.ET 86%

When Fine-Tuning Fails and when it Generalises: Role of Data Diversity and Mixed Training in LLM-based TTS

当微调失效且泛化时:数据多样性与混合训练在基于大语言模型的文本到语音系统中的作用

Anupam Purwar, Aditya Choudhary

机构 * Sprinklr AI

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了LoRA微调在语音克隆任务中的有效性,发现其在语音质量和信噪比提升方面优于基模型,尤其在数据多样性支持下表现更佳。

Comments We finetune the Qwen 0.5B backbone in an LLM TTS with LoRA to raise MOS speaker similarity and SNR. It works best with diverse training audio with uniform data it can amplify noise so tune decoding and use GGUF quantization for low latency stable quality

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07527 2026-03-12 cs.AI cs.LG 82%

Learning What Reinforcement Learning Can't: Interleaved Online Fine-Tuning for Hardest Questions

学习强化学习无法做到的:用于最难问题的交错在线微调

Lu Ma, Hao Liang, Meiyi Qiang, Lexiang Tang, Xiaochen Ma, Zhen Hao Wong, Junbo Niu, Chengyu Shen, Runming He, Yanhao Li, Bin Cui, Wentao Zhang

机构 * Peking University(北京大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京数据智能与安全重点实验室(北京大学)) Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems(北京软件与硬件协同人工智能系统重点实验室)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 ReLIFT通过结合强化学习和在线微调,提升模型在复杂问题上的推理能力,实现超过5.2分的性能提升。

Comments 12 pages, 5 figures

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09978 2026-03-12 cs.SE cs.AI cs.LG 79%

One Model, Many Skills: Parameter-Efficient Fine-Tuning for Multitask Code Analysis

一个模型,多种技能:用于多任务代码分析的参数高效微调

Amal Akli, Maxime Cordy, Mike Papadakis, Yves Le Traon

专题命中 指令微调 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文提出多任务PEFT方法,通过共享模块在代码分析中实现性能与效率的平衡,验证了其在多任务场景下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18011 2026-03-12 cs.CL cs.AI 79%

Training with Pseudo-Code for Instruction Following

通过伪代码训练指令跟随

Prince Kumar, Rudra Murthy, Riyaz Bhat, Danish Contractor

专题命中 指令微调 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 通过伪代码训练提升LLM指令跟随能力,实现8-21%的提升并在数学和常识推理中取得平均30%的提升。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10143 2026-03-12 cs.CL 77%

Reason and Verify: A Framework for Faithful Retrieval-Augmented Generation

推理与验证:一种忠实检索增强生成的框架

Eeham Khan, Luis Rodriguez, Marc Queudot

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种领域特定的RAG框架,通过显式推理和验证机制提升检索增强生成的准确性与透明性,在生物医学问答任务中取得显著性能提升。

Comments Accepted to Canadian AI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10011 2026-03-12 cs.CL 77%

Gemma Needs Help: Investigating and Mitigating Emotional Instability in LLMs

Gemma需要帮助:调查并缓解大语言模型中的情绪不稳定

Anna Soligo, Vladimir Mikulik, William Saunders

机构 * Imperial College London(伦敦帝国理工学院) Anthropic

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 研究发现Gemma模型在训练后表现出显著情绪不稳定,通过偏好优化可有效缓解,但需进一步改进训练以提升情绪鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10160 2026-03-12 cs.LG cs.CL 76%

ReMix: Reinforcement routing for mixtures of LoRAs in LLM finetuning

ReMix:用于LoRAs混合的强化路由

Ruizhong Qiu, Hanqing Zeng, Yinglong Xia, Yiwen Meng, Ren Chen, Jiarui Feng, Dongqi Fu, Qifan Wang, Jiayi Liu, Jun Xiao, Xiangjun Fan, Benyu Zhang, Hong Li, Zhining Liu, Hyunsik Yoo, Zhichen Zeng, Tianxin Wei, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta AI Washington University St. Louis(华盛顿大学圣路易斯分校)

专题命中 指令微调 :LLM(title);分类 cs.CL、cs.LG

AI总结 ReMix通过引入不可学习的路由权重和强化学习技术,改进了混合LoRAs模型的路由机制,提升了模型的表达能力和微调效果。

Comments LLA @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09990 2026-03-12 cs.CL cs.AI 76%

A Two-Stage Architecture for NDA Analysis: LLM-based Segmentation and Transformer-based Clause Classification

面向NDA分析的两阶段架构:基于LLM的分段与基于Transformer的条款分类

Ana Begnini, Matheus Vicente, Leonardo Souza

专题命中 指令微调 :LLM(title);分类 cs.CL、cs.AI

AI总结 本文提出基于LLM和Transformer的两阶段架构,用于自动化NDA文档的分段和条款分类,实验结果显示方法在准确率和精确度上均表现优异。

Comments 14 pages, 2 figures, 3 tables. Published at STIL @ BRACIS 2025

Journal ref Simposio Brasileiro de Tecnologia da Informacao e da Linguagem Humana (STIL) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10243 2026-03-12 cs.CL 70%

GR-SAP: Generative Replay for Safety Alignment Preservation during Fine-Tuning

GR-SAP: 生成性重放用于在微调过程中保持安全对齐

Zhouxiang Fang, Jiawei Zhou, Hanjie Chen

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 GR-SAP通过生成领域特定对齐数据来保持微调过程中的安全对齐,有效缓解了微调导致的安全退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10213 2026-03-12 cs.CL 57%

Sabiá-4 Technical Report

Sabiá-4 技术报告

Thiago Laitz, Thales Sales Almeida, Hugo Abonizio, Roseval Malaquias Junior, Giovana Kerche Bonás, Marcos Piau, Celio Larcher, Ramon Pires, Rodrigo Nogueira

机构 * Maritaca AI Jusbrasil

专题命中 指令微调 :language model(abstract);分类 cs.CL

AI总结 Sabiá-4和Sabiazinho-4是新一代巴西葡萄牙语模型,通过四阶段训练流程提升法律文档、多轮对话和智能体任务能力,实现成本与性能的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17923 2026-03-12 cs.AI 57%

Learning Transferable Skills in Action RPGs via Directed Skill Graphs and Selective Adaptation

通过定向技能图和选择性适应在动作RPG中学习可转移的技能

Ali Najar

机构 * Sharif University of Technology(沙斐大学)

专题命中 指令微调 :post-training(abstract);分类 cs.AI

AI总结 本文提出通过定向技能图和选择性适应方法,在动作RPG中实现技能的可转移学习,提高样本效率和适应性。

Comments 5 pages

Journal ref Lifelong Agent Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13043 2026-03-12 cs.CV cs.AI 57%

GTR-Turbo: Merged Checkpoint is Secretly a Free Teacher for Agentic VLM Training

GTR-Turbo:合并的检查点实际上是为代理VLM训练提供免费的教师

Tong Wei, Yijun Yang, Changhao Zhang, Junliang Xing, Yuanchun Shi, Zongqing Lu, Deheng Ye

机构 * Tsinghua University(清华大学) Tencent Hunyuan(腾讯文生) Peking University(北京大学)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 GTR-Turbo通过合并检查点作为免费教师,提升了多模态代理训练的效率和效果。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18810 2026-03-12 cs.RO 50%

MergeVLA: Cross-Skill Model Merging Toward a Generalist Vision-Language-Action Agent

MergeVLA: 朝着通用视觉-语言-动作代理的跨技能模型合并

Yuxia Fu, Zhizhen Zhang, Yuqi Zhang, Zijian Wang, Zi Huang, Yadan Luo

机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室)

专题命中 指令微调 :language model(abstract)

AI总结 MergeVLA通过设计保留模型合并性,利用稀疏激活的LoRA适配器和跨注意力机制,实现多技能任务的高效泛化。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏