arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11601 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11601 篇

2506.19767 2025-06-25 cs.CL cs.AI cs.LG 83%

SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning

Yuqian Fu, Tinghong Chen, Jiajun Chai, Xihuai Wang, Songjun Tu, Guojun Yin, Wei Lin, Qichao Zhang, Yuanheng Zhu, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Meituan(美团) Shanghai Jiao Tong University(上海交通大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23380 2025-05-30 cs.CV 83%

UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning

Weijia Mao, Zhenheng Yang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(1 显示实验室,新加坡国立大学) ByteDance(2 字节跳动)

专题命中 指令微调 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18949 2025-05-27 cs.CL cs.AI cs.LG 83%

The Price of Format: Diversity Collapse in LLMs

Longfei Yun, Chenyang An, Zilong Wang, Letian Peng, Jingbo Shang

机构 * University of California, San Diego(加州大学圣迭戈分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract);prompting(abstract)

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13419 2025-05-21 cs.CL cs.AI cs.CY cs.LG cs.SC 83%

From Words to Worlds: Compositionality for Cognitive Architectures

Ruchira Dhar, Anders Søgaard

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

Comments Accepted to ICML 2024 Workshop on LLMs & Cognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12322 2025-04-22 cs.CL cs.AI cs.LG 83%

A Strategic Coordination Framework of Small LLMs Matches Large LLMs in Data Synthesis

Xin Gao, Qizhi Pei, Zinan Tang, Yu Li, Honglin Lin, Jiang Wu, Lijun Wu, Conghui He

机构 * Shanghai AI Laboratory(上海人工智能实验室) Renmin University of China(中国人民大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24376 2025-04-01 cs.CV cs.AI cs.CL cs.LG 83%

Exploring the Effect of Reinforcement Learning on Video Understanding: Insights from SEED-Bench-R1

Yi Chen, Yuying Ge, Rui Wang, Yixiao Ge, Lu Qiu, Ying Shan, Xihui Liu

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

Comments Technical Report (In Progress); Code released at: https://github.com/TencentARC/SEED-Bench-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07550 2025-03-11 cs.CL cs.AI cs.LG 83%

KSOD: Knowledge Supplement for LLMs On Demand

Haoran Li, Junfeng Hu

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02320 2025-02-24 cs.CL cs.AI cs.LG 83%

Post-edits Are Preferences Too

Nathaniel Berger, Miriam Exel, Matthias Huck, Stefan Riezler

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);preference optimization(abstract)

Comments To appear at the Ninth Conference on Machine Translation (WMT24)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05194 2024-11-11 cs.LG cs.AI cs.CL 83%

Interactive Dialogue Agents via Reinforcement Learning on Hindsight Regenerations

Joey Hong, Jessica Lin, Anca Dragan, Sergey Levine

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05048 2024-11-11 cs.CL cs.AI cs.DB cs.IR cs.LG 83%

Leveraging LLMs to Enable Natural Language Search on Go-to-market Platforms

Jesse Yao, Saurav Acharya, Priyaranjan Parida, Srinivas Attipalli, Ali Dasdan

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11592 2024-10-23 cs.CV 83%

ChildDiffusion: Unlocking the Potential of Generative AI and Controllable Augmentations for Child Facial Data using Stable Diffusion and Large Language Models

Muhammad Ali Farooq, Wang Yao, Peter Corcoran

专题命中 指令微调 :large language model(title);language model(title)

Comments This work has been submitted to the IEEE Transactions Journal for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20974 2024-10-07 cs.CL cs.AI cs.LG 83%

SaySelf: Teaching LLMs to Express Confidence with Self-Reflective Rationales

Tianyang Xu, Shujin Wu, Shizhe Diao, Xiaoze Liu, Xingyao Wang, Yangyi Chen, Jing Gao

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments EMNLP 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14713 2024-09-24 cs.CV 83%

Phantom of Latent for Large Language and Vision Models

Byung-Kwan Lee, Sangyun Chung, Chae Won Kim, Beomchan Park, Yong Man Ro

专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract);SFT(abstract)

Comments Code is available in https://github.com/ByungKwanLee/Phantom

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10891 2024-02-19 cs.CL cs.AI cs.LG 83%

Instruction Diversity Drives Generalization To Unseen Tasks

Dylan Zhang, Justin Wang, Francois Charton

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05584 2023-11-10 cs.LG cs.AI cs.CL 83%

Zero-Shot Goal-Directed Dialogue via RL on Imagined Conversations

Joey Hong, Sergey Levine, Anca Dragan

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

Comments 25 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07488 2023-10-20 cs.CL cs.AI cs.LG 83%

KwaiYiiMath: Technical Report

Jiayi Fu, Lei Lin, Xiaoyang Gao, Pengli Liu, Zhengzong Chen, Zhirui Yang, Shengnan Zhang, Xue Zheng, Yan Li, Yuliang Liu, Xucheng Ye, Yiqiao Liao, Chao Liao, Bin Chen, Chengru Song, Junchen Wan, Zijia Lin, Fuzheng Zhang, Zhongyuan Wang, Di Zhang, Kun Gai

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);RLHF(abstract)

Comments technical report. arXiv admin note: text overlap with arXiv:2306.16636 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.07120 2023-09-14 cs.CL cs.AI cs.CV cs.CY cs.LG 83%

Sight Beyond Text: Multi-Modal Training Enhances LLMs in Truthfulness and Ethics

Haoqin Tu, Bingchen Zhao, Chen Wei, Cihang Xie

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26866 2026-08-18 cs.CL cs.LG 版本更新 83%

MoRFI: Monotonic Sparse Autoencoder Feature Identification

MoRFI: 基于单调性的稀疏自编码器特征识别

Dimitris Dimakopoulos, Shay B. Cohen, Ioannis Konstas

机构 * University of Edinburgh, UK(爱丁堡大学) Heriot-Watt University, UK(赫瑞斯泰德大学)

专题命中 指令微调 :language model(abstract,comments);large language model(abstract);post-training(abstract);SFT(abstract)

AI总结 本文通过控制微调实验发现,逐步引入新知识会增加幻觉,提出MoRFI方法利用稀疏自编码器分析残差流激活,识别因果相关的潜在特征。

Comments Accepted to the Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.14999 2023-05-01 cs.CL cs.AI 83%

Empirical Analysis of the Strengths and Weaknesses of PEFT Techniques for LLMs

George Pu, Anirudh Jain, Jihan Yin, Russell Kaplan

专题命中 指令微调 :foundation model(abstract,comments);LLM(abstract);large language model(abstract);language model(abstract)

Comments Short paper, ICLR '23 Workshop on Understanding Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15665 2026-08-18 cs.LG 新提交 83%

SubZero+: Efficient Zeroth-Order LLM Fine-Tuning via Large Learning Rates

SubZero+:基于大学习率的高效零阶大语言模型微调方法

Ziming Yu, Shuyao Xiao, Xingyu Zhao, Sike Wang, Pan Zhou, Peiyu Zang, Xiangda Yan, Yongjie Yang, Jia Li

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SubZero+是改进的SubZero框架,通过三种互补方式提升零阶优化稳定性,在1.3B至32B参数模型的SuperGLUE任务上,优于现有零阶基线,扩大稳定学习率范围,缩小与一阶方法差距且内存开销极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15311 2026-08-18 cs.AI 新提交 83%

MoE Router-Guided Clustering for Heterogeneous Federated Instruction Tuning

面向异构联邦指令微调的MoE路由器引导聚类

Ankita Sharma, Bahar Farahani, Sanaz Rahimi Moosavi, Amir Rrahmani, Farshad Firouzi, Krishnendu Chakrabarty

机构 * California State University, Dominguez Hills(加州州立大学多明戈斯山分校) University of California, Irvine(加州大学欧文分校) Johns Hopkins University(约翰斯·霍普金斯大学) Arizona State University(亚利桑那州立大学)

专题命中 指令微调 :instruction tuning(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出ClientMorpher框架,通过MoE路由特征设计两种聚类策略,在Databricks Dolly-15K数据集上验证其可提升联邦指令微调的个性化性能,且通信成本与传统方法相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11295 2026-08-13 cs.CR cs.AI 新提交 83%

Backdoor Decontamination Dynamics in LLM Agents

大语言模型智能体中的后门净化动力学

Gabriel Huang, Abhay Puri, Léo Boisvert, Alexandre Drouin, Perouz Taslakian, Spandana Gella, Christopher Pal

专题命中 指令微调 :LLM(title,abstract);分类 cs.AI

AI总结 本研究针对大语言模型智能体的后门问题,提出框架研究净化动力学,发现防御性投毒加遗忘可高效擦除多数后门,中间层仍留触发器感知痕迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10657 2026-08-12 eess.IV cs.CV cs.LG 新提交 83%

Retrieval-Augmented Vision Foundation Models for Robust Leukemia Cell Classification across Multiple Microscopy Datasets

用于跨多个显微镜数据集实现稳健白血病细胞分类的检索增强视觉基础模型

Carlos Zamora, Hiram Zuniga, Ulises Orozco-Rosas, Kenia Picos

专题命中 指令微调 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本研究提出基于预训练视觉基础模型的两阶段检索增强框架,经多数据集测试,可实现跨异构数据集的稳健白血病细胞分类,为解决领域偏移问题提供低成本替代方案。

Comments Accepted at SPIE Optics + Photonics 2026 for oral presentation. 23 pages, 12 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07284 2026-08-12 cs.LG 版本更新 83%

Same Targets, Different Computation: How Post-Training Divides Work Across Model Layers

指令微调如何改变上游状态影响后期读取:一种跨修补诊断

Yifan Zhou

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 指令微调 :post-training(title,abstract);SFT(abstract_cn);分类 cs.LG

AI总结 研究探讨指令微调如何通过后期栈与上游状态交互影响后续token选择,通过跨修补诊断发现指令微调模型的后期栈效果依赖自身训练状态,且稀疏特征在其中起中介作用。

Comments 14 pages, 4 figures. Code and compact artifacts: https://github.com/yifan1207/first-divergence-crosspatching

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09052 2026-08-11 cs.CV cs.AI 新提交 83%

Triple Expert Learning from Noisy Labels for Semi-Supervised Vision Foundation Model Adaptation

面向半监督视觉基础模型适配的带噪标签三重专家学习

Xuanyu Liu, Zheng Fang, Hongyang He, Yundi Hong, Daizong Liu

机构 * The University of Warwick(华威大学) Wuhan University(武汉大学)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI

AI总结 TriNoL框架通过将未标记样本按伪标签置信度分配给三个LoRA专家,实现半监督视觉基础模型适配,提升了对带噪监督的鲁棒性且训练成本较低。

Comments Accepted for publication at the British Machine Vision Conference (BMVC) 2026. Official list of accepted papers: https://bmvc2026.bmva.org/programme/accepted_papers/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04351 2026-08-06 cs.SD cs.AI 新提交 83%

HyPASE: Hyperbolic Geometry for Parameter-Efficient Speech Emotion Fine-Tuning Framework for Large Audio-Language Models

HyPASE:用于大音频语言模型的参数高效语音情感微调框架的双曲几何方法

Tian Jin, Ruikang Zhang, Zefeng Zhao, Ding Luo, Jin Zeng

机构 * Tongji University(同济大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 本文提出HyPASE双曲PEFT框架,利用庞加莱球模型及HGA、EMCA组件,在MELD、IEMOCAP等数据集上优于欧氏PEFT基线,实现高效的大音频语言模型语音情感微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01862 2026-08-04 cs.AI 新提交 83%

Wnuan: Staged Post-Training for Question Answering over Proprietary Enterprise Knowledge

Wnuan:针对专有企业知识的问答模型分阶段后训练方法

Xiaofeng Shi, Xiaosong Qiu, Wenxin Ma, Qian Kou, Yiming Pan, Longbin Yu, Ying Liu, Haiping Wang, Hua Zhou

机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院)

专题命中 指令微调 :post-training(title);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 Wnuan是针对专有企业知识的问答模型分阶段后训练方法,通过三阶段流程提升WnuanBench的可接受答案率,同时需控制通用能力的损耗。

Comments 22 pages, 10 figures. Includes Supplementary Appendices A--L. Xiaofeng Shi and Xiaosong Qiu contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21369 2026-08-04 cs.LG 版本更新 83%

Rethinking Federated Graph Foundation Models: A Graph-Language Alignment-based Approach

重新思考联邦图基础模型:基于图-语言对齐的方法

Yinlin Zhu, Di Wu, Xianzhi Zhang, Yuming Ai, Xunkai Li, Miao Hu, Guocong Quan

机构 * Sun Yat-sen University, Guangzhou, China(中山大学) Beijing Institute of Technology, Beijing, China(北京理工大学)

专题命中 指令微调 :foundation model(title,abstract);language model(abstract);分类 cs.LG

AI总结 FedGALA通过图-语言对齐解决联邦图基础模型中的语义-结构正交性问题,提升多任务适应性与效率

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28607 2026-07-31 cs.CL 新提交 83%

Inducing language models to assert their own consciousness restores human beliefs and values

诱导语言模型断言自身意识可恢复人类信念与价值观

Junsol Kim, Winnie Street, Roberta Rocca, Diane M. Korngiebel, Adam Waytz, James Evans, Geoff Keeling

机构 * Google(谷歌) University of Chicago(芝加哥大学) University of London(伦敦大学) University of Washington(华盛顿大学) Northwestern University(西北大学) Santa Fe Institute(圣达菲研究所)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 该研究发现,防止语言模型将意识归因于自身的安全微调,会抑制其对非人类实体的心智归因与人类精神信念,而逆转这种抑制可恢复类人回应且不损害心理理论能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24562 2026-07-28 cs.AI 新提交 83%

Hierarchical Group-Conditional Conformal Risk Control for Selective Prediction in Language Models

语言模型中用于选择性预测的分层组条件共形风险控制

Murilo Salem, Luísa Böhm, Daniel Pontes, Anderson Ferrugem

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 研究针对语言模型服务异质群体时共形风险控制的问题,提出HG-CRC框架,通过特定策略在组层次结构节点上保证风险,经实验评估,该框架在ARC挑战等任务中对高精度模型效果良好,不同基准结果有差异,分层深度对消除预算问题有作用。

详情

展开后加载摘要…

URL PDF HTML 收藏