arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-05 至 2026-05-05 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 18 篇

2602.14012 2026-05-05 cs.CR cs.AI cs.SE 96%

From SFT to RL: Demystifying the Post-Training Pipeline for LLM-based Vulnerability Detection

从SFT到RL:解开基于LLM的漏洞检测后训练流程的谜团

Youpeng Li, Fuxun Yu, Xinda Wang

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Microsoft(微软)

专题命中 指令微调 :LLM(title,title_cn);SFT(title,title_cn);post-training(title,abstract);preference optimization(abstract)

AI总结 本文研究了基于LLM的漏洞检测后训练流程,发现基于GRPO的在线RL优于SFT和离线偏好优化方法,提出了数据筛选、阶段交互、奖励机制和评估协议的改进策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14258 2026-05-05 cs.AI cs.LG 88%

GFT: From Imitation to Reward Fine-Tuning with Unbiased Group Advantages and Dynamic Coefficient Rectification

GFT:从模仿到奖励微调:无偏组优势与动态系数校正

Wangjie Gan, Miao Pan, Linbo Xi, Wenqi Zhang, Jintao Chen, Jianwei Yin, Xuhong Zhang

机构 * OmniAl Group of ZJU ACES Lab(OMNIAL集团浙江大学ACES实验室) School of Software Technolog,Zhejiang University(浙江大学软件技术学院)

专题命中 指令微调 :SFT(summary_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出GFT框架,通过组优势学习和动态系数校正解决SFT的奖励稀疏性问题,提升模型泛化能力与知识注入效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02921 2026-05-05 q-fin.GN q-fin.TR 88%

Debiasing LLMs by Fine-tuning

通过微调去偏大语言模型

Zhenyu Gao, Wenxi Jiang, Yutong Yan

专题命中 指令微调 :LLM(summary_cn,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出一种基于监督微调的方法,利用LoRA技术训练指令数据集以减少LLM的预测偏差,通过参数层面干预改善模型的预测能力,实验验证了该方法在控制预测和股票收益预测中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10554 2026-05-05 cs.CV 88%

Grounding Everything in Tokens for Multimodal Large Language Models

基于令牌的多模态大语言模型的 grounding

Xiangxuan Ren, Zhongdao Wang, Liping Hou, Pin Tang, Guoqing Wang, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence(人工智能混合专家模型关键实验室) AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院) Central Research Institute, Huawei(华为中央研究院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出GETok方法,通过整合可学习的令牌词汇提升多模态大语言模型在2D空间中的物体定位能力,实验显示其在多种指引用例任务中表现更优。

Comments 19 pages, 16 figures, 12 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05134 2026-05-05 cs.LG cs.AI 87%

How Reasoning Evolves from Post-Training Data: An Empirical Study Using Chess

推理如何从训练数据中演变:使用国际象棋的实证研究

Lucas Dionisopoulos, Nicklas Majamaki, Prithviraj Ammanabrolu

机构 * Department of Computer Science and Engineering, University of California San Diego, San Diego, United States(计算机科学与工程系,加州大学圣地亚哥分校,圣地亚哥,美国)

专题命中 指令微调 :post-training(title);SFT(abstract,abstract_cn);language model(abstract,comments);分类 cs.AI、cs.LG

AI总结 研究语言模型推理从监督微调到强化学习的演变,发现直接预测最佳走法的微调能提升性能,但强化学习阶段导致不一致推理,而多步轨迹训练则能获得更稳定的推理。

Comments Accepted at ICML 2026. An earlier version appeared at the NeurIPS 2025 Foundations of Reasoning in Language Models (FoRLM) Workshop (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20605 2026-05-05 cs.CL cs.AI cs.DL cs.LG 85%

TF1-EN-3M: Three Million Synthetic Moral Fables for Training Small, Open Language Models

TF1-EN-3M:三百万合成道德寓言用于训练小型开放语言模型

Mihai Nadas, Laura Diosan, Andrei Piscoran, Andreea Tomescu

机构 * Babeș-Bolyai University(巴纳德-波耶亚大学) KlusAI Labs(KlusAI实验室)

专题命中 指令微调 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TF1-EN-3M数据集,包含三百万英文寓言,用于训练小型开放语言模型,展示通过指令微调模型生成高质量寓言的方法,验证了无需大模型即可实现大规模道德叙事的可能性。

Comments 18 pages, 6 tables, 1 figure. v2: revised evaluation with open-weight LLM judge panel, expanded citations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01605 2026-05-05 cs.CL cs.AI 84%

Where Do Prompt Perturbations Break Generation? A Segment-Level View of Robustness in LoRA-Tuned Language Models

提示扰动为何破坏生成?基于段级视角的LoRA微调鲁棒性分析

Zhuoyun Li, Boxuan Wang, Jinwei Hu, Zhenglin Huang, Qisong He, Xinmiao Huang, Guangliang Cheng, Xiaowei Huang, Yi Dong

机构 * School of Computer Science and Informatics, University of Liverpool, UK(利物浦大学计算机科学与信息学学院)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出S$^2$R$^2$框架,通过段级语义分割与最优传输对齐提升LoRA微调模型的鲁棒性,有效应对提示扰动导致的关键实体或结论漂移问题。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00845 2026-05-05 cs.DB cs.AI cs.CL 84%

Graph Query Generation with Constraint-guided Large Language Agents

带有约束引导的大语言代理的图查询生成

Mengying Wang, Nicolaas Jedema, Rahul Pandey, RaviKiran Krishnan, Jens Lehmann, Yinghui Wu

机构 * Case Western Reserve University(凯斯西储大学) Amazon(亚马逊) Meta

专题命中 指令微调 :language agent(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出UniQGen框架,利用大语言模型动态提取和优化图查询子句,提升查询准确性和效率,在多个基准测试中表现优异,适用于企业级知识图谱问答。

Comments 42nd IEEE International Conference on Data Engineering (ICDE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01591 2026-05-05 cs.IR cs.CL 81%

Led to Mislead: Adversarial Content Injection for Attacks on Neural Ranking Models

导致误导:针对神经排序模型的对抗性内容注入攻击

Amin Bigdeli, Amir Khosrojerdi, Radin Hamidi Rad, Morteza Zihayat, Charles L. A. Clarke, Ebrahim Bagheri

机构 * University of Waterloo(滑铁卢大学) University of Toronto(多伦多大学) Mila – Quebec AI Institute(魁北克AI研究院) Toronto Metropolitan University(多伦多 Metropolitan 大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CRAFT框架,通过生成对抗性数据集、监督微调和偏好引导优化,提升对抗性攻击效果,验证了生成式AI在排序操纵中的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18232 2026-05-05 cs.LG cs.CR 81%

ACTG-ARL: Differentially Private Conditional Text Generation with RL-Boosted Control

ACTG-ARL: 差分隐私条件下通过RL增强的条件文本生成

Yuzheng Hu, Ryan McKenna, Da Yu, Shanshan Wu, Han Zhao, Zheng Xu, Peter Kairouz

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google Research(谷歌研究院) Meta

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出ACTG-ARL框架,通过分层结构和Anchored RL方法,在差分隐私下提升生成文本质量与条件生成控制,实现MAUVE指标提升20%。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01256 2026-05-05 cs.CL 79%

GIFT: Guided Fine-Tuning and Transfer for Enhancing Instruction-Tuned Language Models

GIFT:指导微调与迁移以增强指令微调语言模型

Zhiwen Ruan, Yichao Du, Jianjie Zheng, Longyue Wang, Yun Chen, Peng Li, Jinsong Su, Yang Liu, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) Alibaba Group(阿里巴巴集团) Shanghai University of Finance and Economics(上海财经大学) Tsinghua University(清华大学) Xiamen University(厦门大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL

AI总结 GIFT通过整合指令模型的指导信息,提升指令微调语言模型的任务适应能力,实验显示其在数学和知识密集型基准上优于直接微调和迁移基线。

Journal ref Main of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01208 2026-05-05 cs.AI 77%

Faithful Mobile GUI Agents with Guided Advantage Estimator

忠实的移动GUI代理与引导优势估计器

Haowen Hu, Pengzhou Cheng, Zheng Wu, Lingzhong Dong, Gongshen Liu, Zhuosheng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 本文提出Faithful-Agent框架,通过两阶段流程提升GUI交互的证据基础性和一致性,引入引导优势估计器GuAE,有效提升任务成功率并保持指令遵循能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01462 2026-05-05 cs.CR 75%

LocalAlign: Enabling Generalizable Prompt Injection Defense via Generation of Near-Target Adversarial Examples for Alignment Training

LocalAlign: 通过生成接近目标的对抗示例实现通用的提示注入防御

Yuyang Gong, Zihao Wang, Jiawei Liu, XiaoFeng Wang

专题命中 指令微调 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 LocalAlign通过生成接近正确响应但错误的对抗示例,提升提示注入防御的泛化能力,采用margin-aware对齐算法增强训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16759 2026-05-05 cs.IR 67%

Can Explanations Improve Recommendations? Evidence from Prediction-Informed Explanations

解释能否提升推荐?来自预测驱动解释的证据

Yuyan Wang, Pan Li, Minmin Chen

专题命中 指令微调 :LLM(abstract,abstract_cn)

AI总结 本文提出RecPIE框架,通过将解释生成与预测优化结合,提升推荐系统可解释性与性能,实验显示其在准确性与数据效率上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01364 2026-05-05 cs.LG cs.SY eess.SY 57%

Toward a foundational thermal model for residential buildings

迈向住宅建筑的基础热模型

Ting-Yu Dai, Kingsley Nweye, Dev Niyogi, Zoltan Nagy

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 指令微调 :foundation model(abstract);分类 cs.LG

AI总结 本文提出一种融合物理知识的Transformer架构,用于构建通用住宅建筑热模型,通过模拟提取静态特征和旋转位置嵌入注意力机制,在不同气候区实现高精度预测和零样本迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02439 2026-05-05 cs.LG cs.CV 57%

WebGym: Scaling Training Environments for Visual Web Agents with Realistic Tasks

WebGym: 通过现实任务扩大视觉网络代理的训练环境

Hao Bai, Alexey Taymanov, Tong Zhang, Aviral Kumar, Spencer Whitehead

机构 * Microsoft(微软) UIUC(伊利诺伊大学香槟分校) CMU(卡内基梅隆大学)

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 WebGym通过大规模现实任务和异步轨迹采样系统提升视觉网络代理训练效果,使基座模型在分布外测试集上的成功率显著提升。

Comments Completed acknowledgements

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00916 2026-05-05 cs.CV 50%

SAMamba3D: adapting Segment Anything for generalizable 3D segmentation of multiphase pore-scale images

SAMamba3D:适应Segment Anything用于多相孔尺度图像的通用3D分割

Rui Zhang, Xianzhi Song, Linqi Zhu, Branko Bijeljic, Gensheng Li, Martin J. Blunt

机构 * Department of Earth Science and Engineering, Imperial College London(帝国理工学院伦敦地球科学与工程系) College of Artificial Intelligence, China University of Petroleum (Beijing)(中国石油大学(北京)人工智能学院) College of Petroleum Engineering, China University of Petroleum (Beijing)(中国石油大学(北京)石油工程学院)

专题命中 指令微调 :foundation model(abstract)

AI总结 SAMamba3D通过结合Mamba体积上下文建模和渐进跨尺度特征交互,实现了通用的3D多相孔尺度分割,减少对特定案例重训练的需求。

Comments Code available at https://github.com/ImperialCollegeLondon/SAMamba-3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00894 2026-05-05 cs.CV 50%

Dino-NestedUNet: Unlocking Foundation Vision Encoders for Pathology Tumor Bulk Segmentation via Dense Decoding

Dino-NestedUNet:通过密集解码解锁基础视觉编码器用于病理肿瘤肿块分割

Tianyang Wang, Ziyu Su, Abdul Rehman Akbar, Usama Sajjad, Usman Afzaal, Lina Gokhale, Charles Rabolli, Wei Chen, Anil Parwani, Muhammad Khalid Khan Niazi

机构 * Department of Pathology, College of Medicine, The Ohio State University Wexner Medical Center, Columbus, OH, USA(病理学系,医学学院,俄亥俄州立大学韦克斯纳医学中心,哥伦布,OH,USA) Department of Biomedical Engineering, The Ohio State University, Columbus, OH, USA(生物医学工程系,俄亥俄州立大学,哥伦布,OH,USA)

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出Dino-NestedUNet框架,通过预训练DINOv3编码器与密集密集解码器结合,改进病理肿瘤肿块分割的边界精度,实验证明其在跨域迁移中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏