GPT4Tools: Teaching Large Language Model to Use Tools via Self-instruction
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);分类 cs.CL
Comments 10 pages, 9 figures, accepted by Findings of ACL2023
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
Comments ACL 2023 Findings; The code is available at https://github.com/OSU-NLP-Group/QA4RE
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
Comments Publised at IEEE ICDM Workshop on Machine Learning for Cybersecurity (MLC) 2022
Journal ref 2022 IEEE International Conference on Data Mining Workshops (ICDMW), pp. 560-566
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);分类 cs.CL
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG
Comments Accepted in DATE 2023. 7 pages, 4 tables, 7 figures
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
Comments 15 pages, 7 figures, 8 tables. Accepted as a long paper at NAACL 2022
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL
专题命中 指令微调 :LLM(title,abstract);language model(title,abstract);large language model(abstract)
Comments LLM-wrapper (v3) is published as a conference paper at ICLR 2025. (v1 was presented at EVAL-FoMo workshop, ECCV 2024.)
基于美国核管理委员会反应堆操作员执照考试的多模态语言模型微调与检索策略基准测试
机构 * organization= Department of Nuclear Engineering, Hanyang University , addressline= 222 Wangsimni-ro , postcode= 04763 , state= Seongdong-gu , city= Seoul , country= South Korea ; organization= The Grainger College of Engineering, Nuclear, Plasma \& Radiological Engineering, University of Illinois Urbana-Champaign , city= Urbana , state= IL , country= USA
专题命中 指令微调 :SFT(summary_cn,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究针对美国核管理委员会反应堆操作员执照考试,评估310亿参数多模态模型应用核知识的能力,通过对比基础模型与多种微调及检索配置,发现固定大小分块RAG的SFT配置表现最佳,并揭示了分块策略规律及RAFT与SFT的性能差异。
当API“说错”语言:重新审视多语言工具使用的后训练
机构 * Amazon(亚马逊)
专题命中 指令微调 :post-training(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 针对多语言API调用中存在的参数语言不匹配问题,研究发现监督微调可实现接近或优于复杂强化学习方法的性能,强化学习仅能提供渐进式改进。
SFGA:一种用于可信SFT数据采购的具有裁决升级的统计优先门控架构
机构 * DGrid AI(DGrid人工智能)
专题命中 指令微调 :SFT(title,title_cn);LLM(abstract);分类 cs.AI、cs.LG
AI总结 研究如何采购监督微调数据,提出统计优先门控架构SFGA,将采购视为成本感知路由问题,经实验在准确率、F1值和成本上取得良好平衡,还报告辩论路径负面诊断,为测量和校准构建合成基准。
基于高斯过程的指令调优在线数据选择
机构 * Amazon(亚马逊)
专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出GAIA框架,利用高斯过程回归建模语义空间中的连续效用流形,通过自适应策略融合动态选择高质量样本,在三个数据集上优于现有方法。
从RAG到智能体RAG:面向可靠的伊斯兰问答
机构 * Qatar Computing Research Institute, HBKU, Qatar(卡塔尔计算研究中心,HBKU,卡塔尔) ; College of Humanities and Social Sciences, HBKU, Qatar(人文与社会科学学院,HBKU,卡塔尔) ; Arab Center for Research and Policy Studies, Qatar(阿拉伯研究中心与政策研究所,卡塔尔) ; College of Islamic Studies, HBKU, Qatar(伊斯兰研究学院,HBKU,卡塔尔) ; College of Public Policy, HBKU, Qatar(公共政策学院,HBKU,卡塔尔)
专题命中 指令微调 :LLM(summary_cn,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract,comments);language model(abstract,comments)
AI总结 针对LLM在伊斯兰问答中的幻觉与弃权问题,构建双语基准IslamicFaithQA,并提出基于结构化工具调用的智能体RAG框架,显著提升正确性与鲁棒性。
Comments Islamic Question Answering; Faithful Question Answering; Retrieval-Augmented Generation; Agentic RAG; Large Language Models
PVminerLLM2:通过偏好优化改进患者声音的结构化提取
机构 * Yale School of Medicine(耶鲁大学医学院) ; Yale School of Public Health(耶鲁大学公共卫生学院) ; Texas State University(德克萨斯州立大学)
专题命中 指令微调 :preference optimization(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出PVminerLLM2,通过偏好优化和令牌级门控稳定项、混淆感知偏好对构建等技术,解决监督微调难以处理的细粒度错误,在患者声音结构化提取任务上优于基线模型。
两个错误,没有正确:审计计算社会科学中LLM标注者的社会期望偏差
机构 * Varun Kotte
专题命中 指令微调 :LLM(title,title_cn);prompting(abstract);分类 cs.CL、cs.LG
AI总结 研究审计了三个开源指令微调模型在TweetEval任务中的社会期望偏差,发现模型存在宽大、过度纠正和中性偏差,且提示干预无法纠正,聚合指标可能掩盖实质结论错误。
监督微调的大语言模型规划器中世界模型恢复的深入探究
机构 * National Laboratory of the Rockies(落基山国家实验室)
专题命中 指令微调 :LLM(title,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 通过可解释性实验,研究监督微调如何影响大语言模型在经典规划任务中恢复世界模型的能力,发现微调使模型线性编码动作有效性和状态谓词,且更广泛的状态空间覆盖有助于更准确的世界模型恢复。
Comments 17 pages. Under review at TMLR
动态跨模态提示生成用于多模态持续指令微调
机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) ; State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室)
专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文提出DRAPE框架,通过生成连续实例特定的软提示提升多模态持续指令微调性能,采用跨模态注意力和投影梯度投影减少遗忘,实验显示优于现有基线方法。
覆盖差距:基于超网络的即时LLM适应中知识冲突失败的幅度解释
机构 * Harbin Institute of Technology(哈尔滨工程大学) ; Imperial College London(伦敦帝国理工学院) ; KigLand Machine Learning Lab(KigLand机器学习实验室)
专题命中 指令微调 :LLM(title,title_cn);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 研究揭示超网络方法在知识冲突中的失败源于幅度问题,通过选择性层提升和意识冲突内部化技术,显著提升深度冲突准确性,同时保持新知识召回。
Comments 35 pages, 15 figures v2: minor layout fixes and author list update
在训练后区分能力激发与能力创造:从自由能视角出发
机构 * Department of Computer Science and Engineering(计算机科学与工程系)
专题命中 指令微调 :post-training(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文从自由能视角出发,区分训练后的能力激发与能力创造,通过引入可及支持的概念,探讨训练过程对行为概率和可达行为空间的影响。
优化器-模型一致性:使用与预训练相同的优化器进行全微调可减少遗忘
机构 * UIUC(伊利诺伊大学香槟分校) ; Apple(苹果公司)
专题命中 指令微调 :pretraining(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文发现使用与预训练相同的优化器进行全微调,在监督微调阶段能更少遗忘并保持性能,提出优化器-模型一致性概念,通过实验和理论分析揭示优化器对模型的影响及微调策略的重要性。
AdaMeZO:一种用于LLM微调的Adam风格零阶优化器,无需维护动量
机构 * Shenzhen Research Institute of Big Data(深圳大数据研究院) ; The Chinese University of Hong Kong-Shenzhen(香港中文大学(深圳)) ; Shenzhen Loop Area Institute(深圳河套学院)
专题命中 指令微调 :LLM(title,title_cn);分类 cs.AI、cs.LG
AI总结 本文提出AdaMeZO,一种基于Adam风格的零阶优化器,通过估计一阶和二阶动量而不存储在内存中,有效减少GPU内存需求,同时在微调LLM时表现出色,比MeZO快70%。
MLLM-CTBench: 一个用于持续指令微调的基准,包含推理过程诊断
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Southeast University(东南大学) ; School of Computing, National University of Singapore(新加坡国立大学计算机学院)
专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 MLLM-CTBench提出一个用于持续指令微调的基准,通过多维评估框架和强化微调方法,分析跨任务知识保留和灾难性遗忘问题。
Comments under review
线性化解释大语言模型中的微调
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文通过线性化视角揭示了大语言模型微调的机制,分析了正则化对NTK特征值谱的影响,并通过LoRA实验证明了微调优化的改进。
Journal ref Afzal, Z.R., Esmaeilbeig, T., Soltanalian, M. and Ohannessian, M.I., 2025. Linearization Explains Fine-Tuning in Large Language Models. In The Thirty-ninth Annual Conference on Neural Information Processing Systems
增强大型语言模型的人类样响应
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);foundation model(comments,journal_ref);分类 cs.CL、cs.AI
AI总结 本文提出通过提升自然语言理解、对话连贯性和情感智能来增强大型语言模型的人类化响应,展示了改进用户交互和跨领域应用的潜力。
Comments Presented at the AAAI-26 Workshop on Personalization in the Era of Large Foundation Models (PerFM), Singapore, January 2026
Journal ref Presented at the AAAI-26 Workshop on Personalization in the Era of Large Foundation Models (PerFM), 2026
临床医生会修改这个草稿多少?评估LLM对患者信息回复草稿的对齐情况
机构 * Department of Computer Science, Dartmouth College(计算机科学系,达特茅斯学院) ; Department of Community and Family Medicine, Dartmouth Health(社区与家庭医学系,达特茅斯健康) ; The Dartmouth Institute, Dartmouth College(达特茅斯研究所,达特茅斯学院)
专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 本研究评估了LLM在患者信息回复起草任务中的对齐情况,提出了一种新的评估框架,并发现需要根据临床医生的偏好进行适应以提高可靠性。
机构 * University of Texas at El Paso(德克萨斯理工大学) ; Southern Illinois University Carbondale(南方伊利诺伊大学卡本代尔分校)
专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)
专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)
Journal ref ACL 2025
机构 * University of Strathclyde(斯特拉思克莱德大学)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
Comments Published at Transaction of Machine Learning Research 08/2025, Large Language Models (LLMs), Interference-time activation shifting, Steerability, Explainability, AI alignment, Interpretability