FedBPT: Efficient Federated Black-box Prompt Tuning for Large Language Models
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG
Comments Accepted at the Generative AI for Pervasive Computing Symposium (GenAI4PC) at UbiComp 2023
专题命中 指令微调 :instruction tuning(title);pretraining(title);language model(abstract);SFT(abstract)
专题命中 指令微调 :language model(title,abstract);small language model(title);large language model(abstract);分类 cs.CL、cs.AI
Comments 14 pages, 15 Tables, 1 Figure
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
Comments Published at 2023 IEEE Conference on Games
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG
Comments Update 6/6/23: Fixed typographic error in abstract
专题命中 指令微调 :large language model(title);language model(title);SFT(abstract);RLHF(abstract)
专题命中 指令微调 :language model(title,abstract);foundation model(title,abstract);分类 cs.CL、cs.LG
Comments This book has been accepted by Springer Nature and will be published as an open access monograph. https://link.springer.com/book/9783031231896. It is licensed under the CC BY-NC-SA license (https://creativecommons.org/licenses/by-nc-sa/4.0/), except for the material included from other authors, which may have different licenses
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
Comments 6 pages, 1 figure, 3 tables
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG
Comments Accepted paper for WNGT workshop at EMNLP-IJCNLP 2019. (7 pages including references and supplemental material)
递归自聚合解锁大语言模型的深度思考
机构 * Mila – Québec AI Institute(魁北克AI研究所) ; Université de Montréal(蒙特利尔大学) ; McGill University(麦吉尔大学) ; LawZero(法零) ; LLNL(劳伦斯利弗莫尔国家实验室) ; University of Edinburgh(爱丁堡大学) ; CIFAR AI Chair(CIFAR人工智能 chair) ; CIFAR Fellow
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.LG;LLM(comments)
AI总结 递归自聚合通过结合并行与顺序缩放方法,提升大语言模型的推理能力,实验证明其在多个任务中优于传统方法。
Comments 23 pages, 10 figures. Project page: https://rsa-llm.github.io/
专题命中 指令微调 :SFT(title,abstract);language model(abstract,comments);small language model(abstract,comments);preference optimization(abstract)
Comments 17 pages, 1 figures, 2 tables. Technical report. Introduces PureTC-1B, an adapter-based pipeline for stabilizing Small Language Models in Traditional Chinese using CPT, SFT, and DPO
机构 * J.P.Morgan AI Research(摩根大通人工智能研究)
专题命中 指令微调 :large language model(title);language model(title);LLM(abstract,comments);prompting(abstract)
Comments 22 pages, 5 figures, 4 tables, earlier version presented at AAAI'25 Workshop on Preventing and Detecting LLM Generated Misinformation
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL;LLM(comments)
Comments ICLR 2024 Workshop on LLM Agents
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI;LLM(comments)
Comments Accepted to ICLR 2024 SeT LLM Workshop
DistMoE:用于分布式指令调优的混合专家模型中无需私有数据排练的路由机制
机构 * University of Trento(特伦托大学) ; Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会) ; University of Bergamo(贝加莫大学)
专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract,abstract_cn);language model(abstract,abstract_cn)
AI总结 针对多模态大语言模型分布式私有数据场景,提出DistMoE混合专家方法,通过公共锚定专家组合阶段实现无需排练的路由,在视觉-语言基准上取得灵活复用与适配的竞争力性能。
基于轨迹的策略蒸馏用于掩码扩散语言模型
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 指令微调 :language model(title,abstract);large language model(abstract);post-training(abstract);SFT(abstract)
AI总结 研究针对扩散大语言模型推理训练后处理难的问题,提出基于轨迹的策略蒸馏(TOPD)框架,通过在目标模型去噪轨迹上监督,利用教师模型获取令牌分布并以反向KL目标更新,在数学推理基准上提升了模型准确率且减少计算量。
通过强化学习提高大语言模型生成的过程模型质量:奖励函数设计的作用
机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) ; Saarland University(萨尔兰大学)
专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)
AI总结 研究探索基于强化学习的大语言模型生成过程模型时奖励函数设计,训练两个模型家族,发现强化学习可提质量,均等奖励加权效果好,设计选择与模型架构相互作用复杂,奖励构成是优化关键,结果适用于多维度质量评估的结构化生成任务。
Comments 21 pages, 5 figures
BoxCtrl: 面向几何图像编辑的3D感知视觉提示
机构 * City University of Hong Kong(香港城市大学) ; Tencent(腾讯)
专题命中 指令微调 :prompting(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出BoxCtrl框架,通过投影到2D的RGB 3D边界框作为视觉提示,结合监督微调与强化学习两阶段训练,实现精确的3D几何编辑(平移、旋转、缩放等),达到最先进性能。
Comments Accepted by SIGGRAPH 2026
AiAWE: 一种使用LoRA适配指令微调模型的开源LLM自动写作评估系统
专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出AiAWE开源自动写作评估系统,通过LoRA适配指令微调Gemma-3-27B模型,在TOEFL独立写作数据集上达到0.474 RMSE和90.56%一致率,优于更大模型和GPT-3.5基线。
Comments 21 pages with 7 tables and 1 figure and appendices
通过捏造证据注入操控LLM观点
专题命中 指令微调 :LLM(title,title_cn)
AI总结 提出Ghostwriter两阶段攻击框架,通过注入带有可信标记的捏造证据,利用LLM对外部上下文的盲目信任来操控其观点,并探索防御策略。
BAGEN:LLM 智能体是否具有预算意识?
机构 * Northwestern University(西北大学) ; O2 Lab(O2实验室) ; Independent(独立) ; University of Michigan(密歇根大学) ; Cornell(康奈尔大学) ; All Hands AI ; Stanford(斯坦福大学) ; UT Austin(德克萨斯大学奥斯汀分校)
专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出预算感知智能体(BAGEN)概念,将预算作为主动控制信号而非被动成本指标,通过渐进区间估计方法预测剩余预算上下界,并在四个环境和五个前沿模型上发现强模型不一定具有强预算意识、模型过度乐观等失败模式,早期停止可节省 28-64% 令牌,但精确区间校准仍具挑战。
GoodVibe:基于神经元的LLM代码生成安全增强方法
专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出GoodVibe框架,通过梯度归因识别安全相关神经元并进行选择性微调,在保持模型通用性的同时显著提升代码生成安全性。
Distribution-Aware Reward: 用于LLM回归的预测分布强化学习
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Allen Institute for AI(人工智能研究院)
专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出Distribution-Aware Reward,一种基于预测分布的强化学习方法,旨在提升语言模型在回归任务中的预测分布质量,而非仅优化单个解码输出。通过连续排名概率分数评估多个解码样本的分布,并基于每个rollout对分布质量的边际贡献分配信用,从而提升预测的准确性和分散性。实验表明,该方法在多个任务中优于监督微调和点wise强化学习基线,尤其在KBSS数据集上Spearman相关性提升6点。
Comments 21 pages, 5 figures
过滤后再加权:用于大语言模型微调的在线数据选择与重新加权
机构 * Department of Computer Science(计算机科学系)
专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出一种优化器感知的在线数据选择与重新加权框架,通过两阶段过滤和加权算法提升大语言模型微调的收敛性和下游性能。
Comments 24 pages, 2 figures, 9 tables
ML-Agent: 通过强化学习增强大语言模型代理以实现自主机器学习工程
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出基于强化学习的代理机器学习框架,通过探索增强微调、分步强化学习和专用奖励模块,训练出性能媲美大模型但成本更低的ML-Agent,实现跨任务泛化。
重新思考多LoRAs的参数共享用于LLM微调
机构 * Department of Computer Science and Engineering, University at Buffalo(计算机科学与工程系,布法罗大学)
专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出ALoRA和Fed-ALoRA,通过异构矩阵分解策略,在多任务和联邦微调中实现更平衡的性能,优于现有多LoRA方法。
Comments Accepted to ACL 2026 Findings
通过对比式LLM微调对齐反馈通道和对话上下文表示
机构 * Department for Speech, Music and Hearing(语音、音乐与听觉系)
专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出双阶段框架,通过对话转录微调大语言模型获取上下文表示,并学习对话上下文和反馈通道表示的联合嵌入空间,实验表明学习的投影显著提升了上下文-反馈通道检索性能。
Comments Association for Computational Linguistics (ACL), 2026
考虑不确定性的梯度信号-噪声数据选择用于指令微调
机构 * Alibaba Cloud Computing(阿里巴巴云 computing) ; The University of Edinburgh(爱丁堡大学)
专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
AI总结 GRADFILTERING通过利用GPT-2代理和LoRA集成,提出了一种考虑不确定性的数据选择方法,以提高指令微调的效率和效果。
Comments Preprint
JavisGPT:一种用于声音-视频理解和生成的统一多模态大语言模型
机构 * ZJU(浙江大学) ; NUS(国立新加坡大学) ; HKUST(GZ)(香港科技大学(广州)) ; RUC(中国人民大学) ; HZCU(杭州电子科技大学) ; NTU(国立台湾大学) ; SMU(新加坡国立大学) ; USYD(澳大利亚悉尼大学) ; ANU(澳大利亚国立大学)
专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)
AI总结 JavisGPT是一种统一多模态大语言模型,通过三阶段训练流程在声音-视频理解和生成任务中表现出色,尤其在复杂和时间同步场景中表现更优。
Comments Accepted by NeurIPS as a Spotlight paper. Code: https://github.com/JavisVerse/JavisGPT