arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-22 至 2026-04-22 共收录 25 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 25 篇

2604.19015 2026-04-22 cs.LG cs.AI 91%

FedProxy: Federated Fine-Tuning of LLMs via Proxy SLMs and Heterogeneity-Aware Fusion

FedProxy:通过代理小型语言模型和异质性感知融合实现联邦微调

Tao Fan, Guoqiang Ma, Yuanfeng Song, Lixin Fan, Kai Chen, Qiang Yang

机构 * Hong Kong University of Science and Technology(香港科技大学) WeBank Co., Ltd(WeBank公司) Hong Kong Polytechnic University(香港理工大学)

专题命中 指令微调 :LLM(summary_cn,abstract);SLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 FedProxy通过代理小型语言模型和异质性感知融合解决联邦微调中知识产权保护、隐私安全和性能损失的三重难题,实现高效且高性能的LLM微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19087 2026-04-22 cs.AI 90%

OLLM: Options-based Large Language Models

OLLM:基于选项的大型语言模型

Shashank Sharma, Janina Hoffmann, Vinay Namboodiri

机构 * Department of Computer Science(计算机科学系) University of Bath(巴斯大学) Department of Psychology(心理学系)

专题命中 指令微调 :large language model(title);language model(title);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn)

AI总结 OLLM通过引入学习选项提升语言模型的生成可控性与鲁棒性,利用低维选项空间实现更高效的奖励优化,减少常见对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19321 2026-04-22 cs.LG cs.AI cs.CL cs.CV 90%

RDP LoRA: Geometry-Driven Identification for Parameter-Efficient Adaptation in Large Language Models

RDP LoRA:基于几何的参数高效适应大语言模型的识别

Yusuf Çelebi, Yağız Asker, Özay Ezerceli, Mahmoud ElHussieni, Selva Taş, Reyhan Bayraktar, Fatma Betül Terzioğlu

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RDP LoRA方法,通过几何轨迹分析确定关键层进行参数高效微调,实现在MMLU-Math上取得优于全层和随机选择的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19060 2026-04-22 cs.AI 89%

Reinforcement Learning Improves LLM Accuracy and Reasoning in Disease Classification from Radiology Reports

强化学习提升LLM在放射学报告疾病分类中的准确性和推理能力

Yishu Wei, Yi Lin, Adam Flanders, George Shih, Yifan Peng

机构 * Department of Population Health Sciences, Weill Cornell Medicine, New York, NY(人口健康科学系,韦尔·柯林斯医学中心,纽约,NY) Department of Radiology, Weill Cornell Medicine, New York, NY(放射科,韦尔·柯林斯医学中心,纽约,NY) Department of Radiology, Thomas Jefferson University, Philadelphia, PA(放射科,托马斯·杰斐逊大学,费城,PA)

专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出两阶段方法,通过监督微调优化疾病标签,再用GRPO提升预测准确性与格式,增强推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19526 2026-04-22 cs.CR cs.LG cs.SE 87%

Evaluating LLM-Generated Obfuscated XSS Payloads for Machine Learning-Based Detection

评估基于大语言模型生成的混淆XSS载荷用于基于机器学习的检测

Divyesh Gabbireddy, Suman Saha

机构 * Department of Computer Science and Engineering(计算机科学与工程系) The Pennsylvania State University(宾夕法尼亚州立大学) University Park, PA, USA(帕克大学,宾夕法尼亚州,美国)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种生成和评估混淆XSS载荷的结构化流程,结合确定性转换技术与大语言模型生成,通过浏览器运行时评估比较载荷行为,展示生成模型在对抗性安全数据生成中的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14164 2026-04-22 cs.CL 87%

How to Fine-Tune a Reasoning Model? A Teacher-Student Cooperation Framework to Synthesize Student-Consistent SFT Data

如何微调一个推理模型?一种教师-学生合作框架来合成学生一致的SFT数据

Zixian Huang, Kaichen Yang, Xu Huang, Feiyang Hao, Qiming Ge, Bowen Li, He Du, Kai Chen, Qipeng Guo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Dalian University of Technology(大连理工大学) Nanjing University(南京大学)

专题命中 指令微调 :SFT(title,title_cn);分类 cs.CL

AI总结 本文提出TESSY框架,通过交替生成风格和非风格标记,解决教师生成数据与学生分布之间的风格差异问题,提升推理模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20279 2026-04-22 cs.CV cs.CL 83%

VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction

VLM-3R:融合指令对齐3D重建的视觉-语言模型

Zhiwen Fan, Jian Zhang, Renjie Li, Junge Zhang, Runjin Chen, Hezhen Hu, Kevin Wang, Huaizhi Qu, Shijie Zhou, Dilin Wang, Zhicheng Yan, Hongyu Xu, Justin Theiss, Tianlong Chen, Jiachen Li, Zhengzhong Tu, Zhangyang Wang, Rakesh Ranjan

机构 * UT Austin(德克萨斯大学奥斯汀分校) XMU(厦门大学) TAMU(德克萨斯大学阿灵顿分校) UCR(加州大学河滨分校) UNC(北卡罗来纳大学教堂山分校) Meta UCLA(加州大学洛杉矶分校)

专题命中 指令微调 :language model(title,abstract);instruction tuning(abstract);分类 cs.CL

AI总结 本文提出VLM-3R,通过融合3D重建指令微调,实现单目视频的3D空间辅助与具身推理,提升了视觉-空间推理和时间3D上下文理解的准确性和可扩展性。

Comments Project Page: https://vlm-3r.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19018 2026-04-22 cs.LG cs.AI cs.SY eess.SY math.OC stat.ML 82%

Local Linearity of LLMs Enables Activation Steering via Model-Based Linear Optimal Control

大模型的局部线性性使基于模型的线性最优控制能够实现激活引导

Julian Skifstad, Xinyue Annie Yang, Glen Chou

机构 * Georgia Institute of Technology, Atlanta, GA, USA. Schools of Electrical and Computer Engineering(佐治亚理工学院,亚特兰大,GA,美国。电气与计算机工程学院)

专题命中 指令微调 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 通过利用大模型层间动力学的局部线性特性,本文将LLM推理建模为线性时变动态系统,采用线性二次调节器计算反馈控制器,实现激活的闭环控制,具有低计算开销和无离线训练的优势,同时提供理论误差界保证控制性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18936 2026-04-22 cs.LG cs.AI hep-ph hep-th 82%

Fine-Tuning Small Reasoning Models for Quantum Field Theory

对量子场论进行小规模推理模型的微调

Nathaniel S. Woodward, Zhiqi Gao, Yurii Kvasiuk, Kendrick M. Smith, Frederic Sala, Moritz Münchmeyer

机构 * Department of Physics, University of Wisconsin-Madison(威斯康星大学麦迪逊分校物理系) Department of Computer Science, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系) Perimeter Institute for Theoretical Physics(理论物理研究所)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在训练大型语言模型时,领域特定物理推理能力的发展,通过微调小规模推理模型,生成合成问题和人类编写的问题,进行强化学习和监督微调实验,分析推理错误的变化,并公开数据管道和训练数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09861 2026-04-22 cs.CV cs.AI 81%

A Survey on MLLM-based Visually Rich Document Understanding: Methods, Challenges, and Emerging Trends

基于MLLM的视觉丰富文档理解综述:方法、挑战与新兴趋势

Yihao Ding, Siwen Luo, Yue Dai, Yanbei Jiang, Zechuan Li, Qiang Sun, Geoffrey Martin, Wei Liu, Yifan Peng

机构 * The University of Western Australia(西澳大学) The University of Melbourne(墨尔本大学) Weill Cornell Medicine(韦尔·柯尔医学中心)

专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract);pretraining(abstract)

AI总结 本文综述了基于MLLM的视觉丰富文档理解最新进展,探讨了文本、视觉和布局特征的表示与整合技术,以及预训练、指令微调等训练方法,分析了数据稀缺、多页文档处理等挑战及新兴趋势。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19118 2026-04-22 cs.CR cs.AI 81%

DP-FlogTinyLLM: Differentially private federated log anomaly detection using Tiny LLMs

DP-FlogTinyLLM:基于Tiny LLMs的差分隐私联邦日志异常检测

Isaiah Thompson, Tanmay Sen, Ritwik Bhattacharya

机构 * Department of Mathematical Sciences(数学科学系) SQC & OR Unit(SQC及OR单位) University of Texas at El Paso(德克萨斯大学埃尔帕索分校) Indian Statistical Institute(印度统计研究所)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DP-FLogTinyLLM框架,利用参数高效LLMs实现隐私保护的联邦学习,通过差分隐私和LoRA技术在资源受限环境下实现日志异常检测,实验表明其在精度和F1分数上优于现有联邦基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20816 2026-04-22 cs.CL 81%

Rethinking Information Synthesis in Multimodal Question Answering A Multi-Agent Perspective

重新思考多模态问答中的信息合成:多智能体视角

Krishna Singh Rajput, Tejas Anvekar, Chitta Baral, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出多智能体框架MAMMQA,通过分解查询、跨模态推理和整合答案,提升多模态问答的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18867 2026-04-22 cs.CV cs.AI cs.LG 81%

Hierarchically Robust Zero-shot Vision-language Models

层次化鲁棒零样本视觉-语言模型

Junhao Dong, Yifei Zhang, Hao Zhu, Yew-Soon Ong, Piotr Koniusz

机构 * Nanyang Technological University(南洋理工大学) CFAR, IHPC, A*STAR(CFAR、IHPC、A*STAR) Northwest Polytechnical University(西北工业大学) Data61 CSIRO University of New South Wales(新南威尔士大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于层次嵌入的鲁棒微调框架,提升视觉-语言模型对对抗攻击的鲁棒性,通过多级对抗对齐和层次嵌入深度控制,增强模型泛化能力与语义多样性。

Comments This paper is accepted by CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19042 2026-04-22 cs.IR 80%

STK-Adapter: Incorporating Evolving Graph and Event Chain for Temporal Knowledge Graph Extrapolation

STK-Adapter:融合演进图与事件链以实现时序知识图谱外推

Shuyuan Zhao, Wei Chen, Weijie Zhang, Xinrui Hou, Junfeng Shen, Boyan Shi, Shengnan Guo, Youfang Lin, Huaiyu Wan

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出STK-Adapter,通过融合演进图与事件链,解决时序知识图谱外推中空间-时间信息丢失和特征稀释问题,提升模型推理能力与泛化能力。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21954 2026-04-22 cs.SE cs.AI 79%

Fine-Tuning Code Language Models to Detect Cross-Language Bugs

对代码语言模型进行微调以检测跨语言错误

Zengyang Li, Yimeng Li, Binbin Huang, Peng Liang, Ran Mo, Hui Liu, Yutao Ma

机构 * School of Computer Science, Central China Normal University(中央师范大学计算机科学学院) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Computer Science, Wuhan University(武汉大学计算机学院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 本文研究预训练代码语言模型在跨语言错误检测中的潜力,开发了CLCFinder工具并构建了包含三种编程语言组合的跨语言错误数据集,通过微调13种CodeLMs发现小模型表现优于大模型,且数据集规模和代码注释对性能影响各异。

Comments Preprint accepted for publication in ACM Transactions on Software Engineering and Methodology (TOSEM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19292 2026-04-22 cs.CL cs.AI 79%

Location Not Found: Exposing Implicit Local and Global Biases in Multilingual LLMs

位置未找到:揭示多语言大语言模型中的隐含本地和全球偏见

Guy Mor-Lan, Omer Goldman, Matan Eyal, Adi Mayrav Gilady, Sivan Eiger, Idan Szpektor, Avinatan Hassidim, Yossi Matias, Reut Tsarfaty

机构 * Google Research(谷歌研究)

专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过LocQA测试集研究多语言模型的本地和跨语言偏见,发现模型对美国本地信息有全球偏见,并在指令微调模型中更显著,同时在同一种语言内优先考虑人口多的地区。

Comments ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19254 2026-04-22 cs.CL cs.AI 79%

ShadowPEFT: Shadow Network for Parameter-Efficient Fine-Tuning

ShadowPEFT:用于参数高效微调的影子网络

Xianming Li, Zongxi Li, Tsz-fung Andrew Lee, Jing Li, Haoran Xie, Qing Li

机构 * COMP, PolyU(PolyU计算机科学系) Division of Artificial Intelligence, Lingnan University(岭南大学人工智能学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 ShadowPEFT提出了一种集中化参数高效微调框架,通过共享的影子模块实现层级细化,相比LoRA等方法更高效灵活,实验表明其在参数预算下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19048 2026-04-22 cs.CL cs.AI 73%

SAMoRA: Semantic-Aware Mixture of LoRA Experts for Task-Adaptive Learning

SAMoRA:基于语义的LoRA专家混合方法用于任务自适应学习

Boyan Shi, Wei Chen, Shuyuan Zhao, Junfeng Shen, Shengnan Guo, Shaojiang Wang, Huaiyu Wan

机构 * School of Computer Science and Technology, Beijing Jiaotong University, China(北京交通大学计算机科学与技术学院) Guangxi Key Lab of Trusted Software, Guilin University of Electronic Technology, China(广西trusted软件重点实验室,桂林电子科技大学) Beijing Key Lab of Traffic Data Mining and Embodied Intelligence, China(北京交通数据挖掘与具身智能重点实验室) Institute of AI for Industries, Chinese Academy of Sciences, China(工业人工智能研究院,中国科学院) Nanjing Institute of Software Technology, China(南京软件技术研究院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SAMoRA通过语义感知路由和任务自适应缩放机制,提升多任务学习中的专家专业化与任务适应性,实验显示其性能优于现有方法。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08564 2026-04-22 cs.AI cs.CV cs.LG 73%

How to Teach Large Multimodal Models New Skills

如何向大型多模态模型传授新技能

Zhen Zhu, Yiming Gong, Yao Xiao, Yaoyao Liu, Derek Hoiem

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google DeepMind(谷歌DeepMind) Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文研究了如何在不丧失原有能力的前提下通过序列微调向大型多模态模型传授新技能,提出两种有效的微调方法以平衡学习与遗忘。

Comments In submission. Code is available at https://github.com/jessemelpolio/LMM_CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19204 2026-04-22 cs.CY cs.LG 70%

Auditing LLMs for Algorithmic Fairness in Casenote-Augmented Tabular Prediction

对增强表格预测的大型语言模型进行算法公平性审计

Xiao Qi Lee, Ezinne Nwankwo, Angela Zhou

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文研究了在住房安置预测任务中,结合街道走访案例笔记的大型语言模型在算法公平性方面的表现,发现通过案例笔记摘要微调模型可提升准确性并减少公平性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18944 2026-04-22 cs.CL 70%

A Mechanism and Optimization Study on the Impact of Information Density on User-Generated Content Named Entity Recognition

信息密度对用户生成内容命名实体识别影响的机制与优化研究

Jiang Xiaobo, Dinghong Lai, Song Qiu, Yadong Deng, Xinkai Zhan

机构 * Nuclear Physics B(核物理B)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 研究揭示信息密度低是UGC命名实体识别性能下降的根本原因,提出Window-Aware Optimization Module通过选择性回译提升语义密度,实现4.5%的F1提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03476 2026-04-22 cs.CV cs.AI q-bio.BM 70%

Fine-tuning DeepSeek-OCR-2 for Molecular Structure Recognition

为分子结构识别微调DeepSeek-OCR-2

Haocheng Tang, Xingyu Dang, Junmei Wang

机构 * Department of Computer Science, Princeton University, Princeton, NJ, USA(普林斯顿大学计算机科学系) School of Pharmacy, University of Pittsburgh, Pittsburgh, PA, USA(匹兹堡大学药学院) Khoury College of Computer Science, Northeastern University, Boston, MA, USA(东北大学Khoury计算机科学学院) Computational Chemical Genomics Screening Center, University of Pittsburgh, Pittsburgh, PA, USA(匹兹堡大学计算化学基因组筛选中心)

专题命中 指令微调 :language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出通过图像条件生成SMILES的方法微调DeepSeek-OCR-2,采用分阶段监督微调策略提升稳定性,训练数据结合合成图像和专利图像,模型在精确匹配上表现良好但不如图结构模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01375 2026-04-22 cs.AI 70%

RIFT: A RubrIc Failure Mode Taxonomy and Automated Diagnostics

RIFT:一种基于Rubric的故障模式分类和自动诊断

Zhengyang Qi, Charles Dickens, Derek Pham, Amanda Dsouza, Armin Parchami, Frederic Sala, Paroma Varma

机构 * Snorkel AI University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出RIFT框架,通过系统化分类rubric的故障模式,提升评估的可靠性与有效性,通过人类标注和自动指标验证了其一致性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02200 2026-04-22 cs.NE cs.AI cs.CV cs.LG 62%

Learning Evolution via Optimization Knowledge Adaptation

通过优化知识适应学习进化

Chao Wang, Lingling Li, Licheng Jiao, Jiaxuan Zhao, Fang Liu, Shuyuan Yang

机构 * Key Laboratory of Intelligent Perception and Image Understanding of Ministry of Education(教育部智能感知与图像理解重点实验室) International Research Center for Intelligent Perception and Computation(智能感知与计算国际研究中心) Xidian University(西安电子科技大学)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OKAEM模型,通过注意力机制参数化进化算子,实现优化知识的预训练和自适应优化,提升进化算法的知识转移与在线适应能力。

Comments This work has been accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14779 2026-04-22 cs.CL cs.LG 62%

Smart Bilingual Focused Crawling of Parallel Documents

智能双语聚焦式平行文档抓取

Cristian García-Romero, Miquel Esplà-Gomis, Felipe Sánchez-Martínez

机构 * Dep. de Llenguatges i Sistemes Informàtics, Universitat d’Alacant(语言与信息系统系,阿尔阿坎特大学)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出智能双语抓取方法,利用预训练多语言模型识别文档语言和判断URL对是否为平行文档,提升平行文本发现效率。

Comments Pre-Cambridge University Press publication version

详情

展开后加载摘要…

URL PDF HTML 收藏