arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11567 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11567 篇

2310.01467 2023-10-04 cs.CL cs.AI 88%

FedBPT: Efficient Federated Black-box Prompt Tuning for Large Language Models

Jingwei Sun, Ziyue Xu, Hongxu Yin, Dong Yang, Daguang Xu, Yiran Chen, Holger R. Roth

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.06236 2023-09-13 cs.LG cs.CL 88%

The first step is the hardest: Pitfalls of Representing and Tokenizing Temporal Data for Large Language Models

Dimitris Spathis, Fahim Kawsar

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments Accepted at the Generative AI for Pervasive Computing Symposium (GenAI4PC) at UbiComp 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.02591 2023-09-07 cs.LG cs.CL cs.CV 88%

Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning

Lili Yu, Bowen Shi, Ramakanth Pasunuru, Benjamin Muller, Olga Golovneva, Tianlu Wang, Arun Babu, Binh Tang, Brian Karrer, Shelly Sheynin, Candace Ross, Adam Polyak, Russell Howes, Vasu Sharma, Puxin Xu, Hovhannes Tamoyan, Oron Ashual, Uriel Singer, Shang-Wen Li, Susan Zhang, Richard James, Gargi Ghosh, Yaniv Taigman, Maryam Fazel-Zarandi, Asli Celikyilmaz, Luke Zettlemoyer, Armen Aghajanyan

专题命中 指令微调 :instruction tuning(title);pretraining(title);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10092 2023-08-22 cs.CL cs.AI 88%

Open, Closed, or Small Language Models for Text Classification?

Hao Yu, Zachary Yang, Kellin Pelrine, Jean Francois Godbout, Reihaneh Rabbany

专题命中 指令微调 :language model(title,abstract);small language model(title);large language model(abstract);分类 cs.CL、cs.AI

Comments 14 pages, 15 Tables, 1 Figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18243 2023-07-04 cs.CL cs.AI 88%

Practical PCG Through Large Language Models

Muhammad U Nasir, Julian Togelius

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Published at 2023 IEEE Conference on Games

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00301 2023-06-07 cs.LG cs.CL 88%

CapText: Large Language Model-based Caption Generation From Image Context and Description

Shinjini Ghosh, Sagnik Anupam

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments Update 6/6/23: Fixed typographic error in abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15541 2023-05-26 cs.CL cs.AI 88%

Harnessing the Power of Large Language Models for Natural Language to First-Order Logic Translation

Yuan Yang, Siheng Xiong, Ali Payani, Ehsan Shareghi, Faramarz Fekri

专题命中 指令微调 :large language model(title);language model(title);SFT(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.08575 2023-02-20 cs.CL cs.CV cs.LG cs.MM 88%

Foundation Models for Natural Language Processing -- Pre-trained Language Models Integrating Media

Gerhard Paaß, Sven Giesselbach

专题命中 指令微调 :language model(title,abstract);foundation model(title,abstract);分类 cs.CL、cs.LG

Comments This book has been accepted by Springer Nature and will be published as an open access monograph. https://link.springer.com/book/9783031231896. It is licensed under the CC BY-NC-SA license (https://creativecommons.org/licenses/by-nc-sa/4.0/), except for the material included from other authors, which may have different licenses

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.04417 2022-08-11 cs.CL cs.AI 88%

Debiased Large Language Models Still Associate Muslims with Uniquely Violent Acts

Babak Hemmatian, Lav R. Varshney

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 6 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.09661 2019-11-22 cs.CL cs.LG 88%

Paraphrasing with Large Language Models

Sam Witteveen, Martin Andrews

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments Accepted paper for WNGT workshop at EMNLP-IJCNLP 2019. (7 pages including references and supplemental material)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26626 2026-02-25 cs.LG 88%

Recursive Self-Aggregation Unlocks Deep Thinking in Large Language Models

递归自聚合解锁大语言模型的深度思考

Siddarth Venkatraman, Vineet Jain, Sarthak Mittal, Vedant Shah, Johan Obando-Ceron, Yoshua Bengio, Brian R. Bartoldson, Bhavya Kailkhura, Guillaume Lajoie, Glen Berseth, Nikolay Malkin, Moksh Jain

机构 * Mila – Québec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) LawZero(法零) LLNL(劳伦斯利弗莫尔国家实验室) University of Edinburgh(爱丁堡大学) CIFAR AI Chair(CIFAR人工智能 chair) CIFAR Fellow

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.LG;LLM(comments)

AI总结 递归自聚合通过结合并行与顺序缩放方法,提升大语言模型的推理能力,实验证明其在多个任务中优于传统方法。

Comments 23 pages, 10 figures. Project page: https://rsa-llm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01616 2025-10-03 cs.CL 88%

Efficient Training of Robust Traditional Chinese LLaMA-1B on a Single Consumer GPU: Continual Pre-training, SFT, and DPO

Yu-Cheng Chih, Ming-Tao Duan, Yong-Hao Hou

专题命中 指令微调 :SFT(title,abstract);language model(abstract,comments);small language model(abstract,comments);preference optimization(abstract)

Comments 17 pages, 1 figures, 2 tables. Technical report. Introduces PureTC-1B, an adapter-based pipeline for stabilizing Small Language Models in Traditional Chinese using CPT, SFT, and DPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18608 2025-06-13 cs.CR cs.LG 88%

Breaking Distortion-free Watermarks in Large Language Models

Shayleen Reynolds, Hengzhi He, Dung Daniel T. Ngo, Saheed Obitayo, Niccolò Dalmasso, Guang Cheng, Vamsi K. Potluru, Manuela Veloso

机构 * J.P.Morgan AI Research(摩根大通人工智能研究)

专题命中 指令微调 :large language model(title);language model(title);LLM(abstract,comments);prompting(abstract)

Comments 22 pages, 5 figures, 4 tables, earlier version presented at AAAI'25 Workshop on Preventing and Detecting LLM Generated Misinformation

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10670 2024-11-19 cs.CL 88%

IntentGPT: Few-shot Intent Discovery with Large Language Models

Juan A. Rodriguez, Nicholas Botzer, David Vazquez, Christopher Pal, Marco Pedersoli, Issam Laradji

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL;LLM(comments)

Comments ICLR 2024 Workshop on LLM Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04124 2024-03-08 cs.AI 88%

Privacy-preserving Fine-tuning of Large Language Models through Flatness

Tiejin Chen, Longchao Da, Huixue Zhou, Pingzhi Li, Kaixiong Zhou, Tianlong Chen, Hua Wei

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI;LLM(comments)

Comments Accepted to ICLR 2024 SeT LLM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09907 2026-08-11 cs.CV 新提交 88%

DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning

DistMoE:用于分布式指令调优的混合专家模型中无需私有数据排练的路由机制

Mainak Singha, Niccolò Biondi, Elisa Ricci, Subhankar Roy

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会) University of Bergamo(贝加莫大学)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 针对多模态大语言模型分布式私有数据场景,提出DistMoE混合专家方法,通过公共锚定专家组合阶段实现无需排练的路由,在视觉-语言基准上取得灵活复用与适配的竞争力性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16872 2026-07-21 cs.CL cs.AI cs.LG 新提交 88%

Trace-Based On-Policy Distillation for Masked Diffusion Language Models

基于轨迹的策略蒸馏用于掩码扩散语言模型

Haolin Ren, Ziyang Huang, Chenhao Yuan, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);post-training(abstract);SFT(abstract)

AI总结 研究针对扩散大语言模型推理训练后处理难的问题,提出基于轨迹的策略蒸馏(TOPD)框架,通过在目标模型去噪轨迹上监督,利用教师模型获取令牌分布并以反向KL目标更新,在数学推理基准上提升了模型准确率且减少计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06175 2026-07-08 cs.CL cs.AI cs.LG 新提交 88%

Improving LLM-Generated Process Model Quality Through Reinforcement Learning: The Role of Reward Function Design

通过强化学习提高大语言模型生成的过程模型质量:奖励函数设计的作用

Alexander Rombach, Chantale Lauer, Nijat Mehdiyev

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Saarland University(萨尔兰大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 研究探索基于强化学习的大语言模型生成过程模型时奖励函数设计,训练两个模型家族,发现强化学习可提质量,均等奖励加权效果好,设计选择与模型架构相互作用复杂,奖励构成是优化关键,结果适用于多维度质量评估的结构化生成任务。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23270 2026-06-23 cs.CV 新提交 88%

BoxCtrl: 3D-Aware Visual Prompting for Geometric Image Editing

BoxCtrl: 面向几何图像编辑的3D感知视觉提示

Feifei Wang, Shiyuan Yang, Xiaoyu Li, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Tencent(腾讯)

专题命中 指令微调 :prompting(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出BoxCtrl框架,通过投影到2D的RGB 3D边界框作为视觉提示,结合监督微调与强化学习两阶段训练,实现精确的3D几何编辑(平移、旋转、缩放等),达到最先进性能。

Comments Accepted by SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12801 2026-06-12 cs.CY 新提交 88%

AiAWE: An Open-Source LLM Automated Writing Evaluation System Using LoRA-Adapted Instruction-Tuned Models

AiAWE: 一种使用LoRA适配指令微调模型的开源LLM自动写作评估系统

John Maurice Gayed

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出AiAWE开源自动写作评估系统,通过LoRA适配指令微调Gemma-3-27B模型,在TOEFL独立写作数据集上达到0.474 RMSE和90.56%一致率,优于更大模型和GPT-3.5基线。

Comments 21 pages with 7 tables and 1 figure and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06244 2026-06-05 cs.CR 88%

Steering LLM Viewpoints through Fabricated Evidence Injection

通过捏造证据注入操控LLM观点

Xi Yang, Chang Liu, Zhenglin Huang, Haoran Li, Weiming Zhang, Jian Weng, Yangqiu Song

专题命中 指令微调 :LLM(title,title_cn)

AI总结 提出Ghostwriter两阶段攻击框架,通过注入带有可信标记的捏造证据,利用LLM对外部上下文的盲目信任来操控其观点,并探索防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00198 2026-06-02 cs.LG cs.AI cs.CL 88%

BAGEN: Are LLM Agents Budget-Aware?

BAGEN:LLM 智能体是否具有预算意识?

Yuxiang Lin, Zihan Wang, Mengyang Liu, Yuxuan Shan, Longju Bai, Junyao Zhang, Xing Jin, Boshan Chen, Jinyan Su, Xingyao Wang, Jiaxin Pei, Manling Li

机构 * Northwestern University(西北大学) O2 Lab(O2实验室) Independent(独立) University of Michigan(密歇根大学) Cornell(康奈尔大学) All Hands AI Stanford(斯坦福大学) UT Austin(德克萨斯大学奥斯汀分校)

专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出预算感知智能体(BAGEN)概念,将预算作为主动控制信号而非被动成本指标,通过渐进区间估计方法预测剩余预算上下界,并在四个环境和五个前沿模型上发现强模型不一定具有强预算意识、模型过度乐观等失败模式,早期停止可节省 28-64% 令牌,但精确区间校准仍具挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10778 2026-06-01 cs.CR 88%

GoodVibe: Security-by-Vibe for LLM-Based Code Generation

GoodVibe:基于神经元的LLM代码生成安全增强方法

Maximilian Thang, Lichao Wu, Sasha Behrouzi, Mohamadreza Rostami, Jona te Lintelo, Stjepan Picek, Ahmad-Reza Sadeghi

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出GoodVibe框架,通过梯度归因识别安全相关神经元并进行选择性微调,在保持模型通用性的同时显著提升代码生成安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20740 2026-05-21 cs.LG cs.AI cs.CL 88%

Distribution-Aware Reward: Reinforcement Learning over Predictive Distributions for LLM Regression

Distribution-Aware Reward: 用于LLM回归的预测分布强化学习

Jungsoo Park, Hyungjoo Chae, Ethan Mendes, Jay DeYoung, Varsha Kishore, Wei Xu, Alan Ritter

机构 * Georgia Institute of Technology(佐治亚理工学院) Allen Institute for AI(人工智能研究院)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Distribution-Aware Reward,一种基于预测分布的强化学习方法,旨在提升语言模型在回归任务中的预测分布质量,而非仅优化单个解码输出。通过连续排名概率分数评估多个解码样本的分布,并基于每个rollout对分布质量的边际贡献分配信用,从而提升预测的准确性和分散性。实验表明,该方法在多个任务中优于监督微调和点wise强化学习基线,尤其在KBSS数据集上Spearman相关性提升6点。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00001 2026-05-14 cs.LG cs.AI cs.CL 88%

Filter-then-Weight: Online Data Selection and Reweighting for LLM Fine-Tuning

过滤后再加权:用于大语言模型微调的在线数据选择与重新加权

Fangxin Wang, Peyman Baghershahi, Langzhou He, Henry Peng Zou, Sourav Medya, Philip S. Yu

机构 * Department of Computer Science(计算机科学系)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种优化器感知的在线数据选择与重新加权框架,通过两阶段过滤和加权算法提升大语言模型微调的收敛性和下游性能。

Comments 24 pages, 2 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23723 2026-05-04 cs.CL cs.AI cs.LG 88%

ML-Agent: Reinforcing LLM Agents for Autonomous Machine Learning Engineering

ML-Agent: 通过强化学习增强大语言模型代理以实现自主机器学习工程

Zexi Liu, Jingyi Chai, Xinyu Zhu, Shuo Tang, Rui Ye, Bo Zhang, Lei Bai, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于强化学习的代理机器学习框架,通过探索增强微调、分步强化学习和专用奖励模块,训练出性能媲美大模型但成本更低的ML-Agent,实现跨任务泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25414 2026-04-28 cs.LG cs.AI cs.CL 88%

Rethinking Parameter Sharing for LLM Fine-Tuning with Multiple LoRAs

重新思考多LoRAs的参数共享用于LLM微调

Hao Ban, Kaiyi Ji

机构 * Department of Computer Science and Engineering, University at Buffalo(计算机科学与工程系,布法罗大学)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ALoRA和Fed-ALoRA,通过异构矩阵分解策略,在多任务和联邦微调中实现更平衡的性能,优于现有多LoRA方法。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16622 2026-04-21 cs.CL cs.AI cs.LG 88%

Aligning Backchannel and Dialogue Context Representations via Contrastive LLM Fine-Tuning

通过对比式LLM微调对齐反馈通道和对话上下文表示

Livia Qian, Gabriel Skantze

机构 * Department for Speech, Music and Hearing(语音、音乐与听觉系)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出双阶段框架,通过对话转录微调大语言模型获取上下文表示,并学习对话上下文和反馈通道表示的联合嵌入空间,实验表明学习的投影显著提升了上下文-反馈通道检索性能。

Comments Association for Computational Linguistics (ACL), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13697 2026-01-21 cs.CL cs.AI cs.LG 88%

Uncertainty-Aware Gradient Signal-to-Noise Data Selection for Instruction Tuning

考虑不确定性的梯度信号-噪声数据选择用于指令微调

Zhihang Yuan, Chengyu Yue, Long Huang, Litu Ou, Lei Shi

机构 * Alibaba Cloud Computing(阿里巴巴云 computing) The University of Edinburgh(爱丁堡大学)

专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 GRADFILTERING通过利用GPT-2代理和LoRA集成,提出了一种考虑不确定性的数据选择方法,以提高指令微调的效率和效果。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22905 2026-01-05 cs.CV 88%

JavisGPT: A Unified Multi-modal LLM for Sounding-Video Comprehension and Generation

JavisGPT:一种用于声音-视频理解和生成的统一多模态大语言模型

Kai Liu, Jungang Li, Yuchong Sun, Shengqiong Wu, Jianzhang Gao, Daoan Zhang, Wei Zhang, Sheng Jin, Sicheng Yu, Geng Zhan, Jiayi Ji, Fan Zhou, Liang Zheng, Shuicheng Yan, Hao Fei, Tat-Seng Chua

机构 * ZJU(浙江大学) NUS(国立新加坡大学) HKUST(GZ)(香港科技大学(广州)) RUC(中国人民大学) HZCU(杭州电子科技大学) NTU(国立台湾大学) SMU(新加坡国立大学) USYD(澳大利亚悉尼大学) ANU(澳大利亚国立大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 JavisGPT是一种统一多模态大语言模型,通过三阶段训练流程在声音-视频理解和生成任务中表现出色,尤其在复杂和时间同步场景中表现更优。

Comments Accepted by NeurIPS as a Spotlight paper. Code: https://github.com/JavisVerse/JavisGPT

详情

展开后加载摘要…

URL PDF HTML 收藏