Towards Robust Instruction Tuning on Multimodal Large Language Models
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title);LLM(abstract)
Comments 24 pages, 7 figures
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title);LLM(abstract)
Comments 24 pages, 7 figures
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title);prompting(abstract)
Comments This article has been accepted for publication in Journal of the American Medical Informatics Association Published by Oxford University Press. https://academic.oup.com/jamia/advance-article-abstract/doi/10.1093/jamia/ocae122/7687618
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title,abstract);分类 cs.CL、cs.LG
Comments This work has been accepted to appear at North American Chapter of the Association for Computational Linguistics (NAACL), 2024
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.AI、cs.LG
Comments Accepted in CVPR 2024 as Poster (Highlight)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title,abstract);分类 cs.CL、cs.AI
Comments 60 pages (9 main), 40 figures, 19 tables
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title,abstract);分类 cs.CL、cs.AI
Comments 14 pages, 6 figures
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title,abstract);分类 cs.CL、cs.AI
Comments 25 pages (12 main), 19 figures, 8 tables
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL、cs.LG
Comments Accepted by MDE Intelligence 2023
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL、cs.AI
专题命中 指令微调 :instruction tuning(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL
Comments Workshop on Instruction Tuning and Instruction Following at NeurIPS 2023
专题命中 指令微调 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL
Comments EMNLP 2023. The code of our framework can be found at AGI-Edgerunners/LLM-Adapters" target="_blank" rel="noopener">https://github.com/AGI-Edgerunners/LLM-Adapters. We will keep all of the code open-source and continue to update the framework with new adapters, LLMs, and tasks
视觉还是认知?多模态大语言模型的视觉上下文敏感性
机构 * University of Copenhagen(哥本哈根大学) ; University of Cambridge(剑桥大学) ; ETH Zürich(苏黎世联邦理工学院) ; Clemson University(克莱姆森大学)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn)
AI总结 该研究探究多模态大语言模型在视觉证据与先验冲突任务上的失效原因,引入WhatIfVis基准,发现其能编码视觉证据但难以控制对其的依赖,监督微调等方法可提升可控性。
在指令微调的LLM中构建组合文学原语:跨架构SAE特征用于自我、风格和情感
机构 * Federal University of Goias(戈亚斯联邦大学)
专题命中 指令微调 :LLM(title_cn,summary_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文通过稀疏自编码器研究了指令微调的LLM中组合文学原语的架构,发现四种特征类别,并通过跨架构SAE特征验证了自我、风格和情感的表达能力。
Comments 36 pages, 6 figures
通过大语言模型提取量子级联激光器嵌套复杂结构的信息
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);prompting(abstract)
AI总结 本文提出基于JSON Schema指导的信息提取流程,提升复杂结构数据提取精度,通过12种先进LLM测试,最高F1分数达83.4%,显著提升中等和开源模型性能。
通过ESG实践开发一个面向ESG的大型语言模型
专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)
AI总结 本文提出一种面向ESG的LLM适应流程,通过整合ESG原则作为目标领域和训练约束,生成三种ESG专用模型,并在零样本和知识增强设置下评估其在ESG问答任务中的表现。
专题命中 指令微调 :language model(title,abstract);instruction tuning(title,abstract);large language model(abstract);RLHF(abstract)
Comments Project code, model and data: https://github.com/findalexli/mllm-dpo
Journal ref Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 14188-14200, 2024
专题命中 指令微调 :LLM(title,abstract);language model(title,abstract);large language model(abstract);SFT(abstract)
探索大语言模型(LLM)在现实世界海事航行场景中的情境理解与《国际海上避碰规则》(COLREG)遵从能力
机构 * Technical University of Denmark(丹麦技术大学) ; University of Copenhagen(哥本哈根大学)
专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究探索LLM在海事航行中的应用,构建含50个真实场景的AIS数据集,评估不同LLM的理解与推理能力,发现不微调则难以解决海事航行任务。
Comments Submitted and accepted to the IFAC WC 2026 as an invited session paper for track 7.2 Transportation and Vehicle Systems - Marine Systems
Hyper-ES:通过下降方向合并实现LLM推理的有效进化策略
机构 * Southern University of Science and Technology(南方科技大学) ; National University of Singapore(新加坡国立大学) ; Nanjing University(南京大学)
专题命中 指令微调 :LLM(title,title_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出Hyper-ES框架,通过梯度微调获取下降方向张成子空间,再用CMA-ES优化DARE-TIES合并系数,在数学推理任务上性能优于GRPO-LoRA,梯度更新量减少10%。
Comments 19 pages, 4 figures, 14 tables. Code: https://github.com/kuangrepi/Hyper-ES
基于内在分布指纹的LLM微调数据来源审计
专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对LLM微调的数据IP侵权审计难题,提出事后框架DPA,通过内在分布指纹实现黑盒恶意场景下的可靠审计,性能优于基线且抗混淆,同时存在审计与隐私攻击的两用张力。
Comments This is the extended version of CCS'26 paper https://doi.org/10.1145/3830454.3832639
使用具有交易成本意识的大语言模型模拟租户对能源政策干预的反应
机构 * Mistral AI(米斯特拉尔人工智能公司) ; Ollama(奥拉马)
专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);SFT(abstract)
AI总结 研究利用感知交易成本,开发摩擦感知角色建模方法,以模拟租户对能源政策干预的反应。通过荷兰公民调查数据,比较不同模型和设置,发现纳入该方法能提升模型性能,为政策理论与LLM政策模拟搭建桥梁。
用于持续指令微调的渐进式多模态对齐
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Center for Excellence in Brain Science and Intelligence Technology, Chinese Academy of Sciences(中国科学院脑科学与智能技术卓越创新中心) ; Kyoto University(京都大学) ; Migu Culture Technology Co.,Ltd.(咪咕文化科技有限公司) ; State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与类脑智能技术国家重点实验室)
专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract,abstract_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn)
AI总结 针对多模态持续指令微调中投影器级遗忘问题,提出渐进式多模态对齐框架PMA,以亚线性参数增长平衡稳定性与可塑性,在多基准实验中提升了现有方法性能且适配多种MLLM主干。
Comments Accepted by ACM MM2026
DatedGPT:通过时间感知预训练防止大语言模型中的前瞻性偏差
机构 * Department of Finance, CUHK Business School, The Chinese University of Hong Kong(香港中文大学商学院金融系,香港中文大学) ; Centre for Artificial Intelligence, University College London(伦敦大学学院人工智能中心)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);pretraining(title);post-training(abstract)
AI总结 DatedGPT通过时间感知预训练和指令微调,防止大语言模型中的前瞻性偏差,确保模型知识受限于数据截止年份,并在基准测试中表现出竞争力。
Multi$^2$:基于LLM智能体在交互环境中的分层多智能体决策
机构 * KAIST(韩国科学技术院)
专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出Multi$^2$分层多智能体决策框架,通过高层智能体(System 1)使用监督微调生成子目标,低层智能体(System 2)使用离线到在线强化学习执行原子动作,以缓解目标漂移并实现长期稳定控制。
Comments Accepted at ICML 2026
从推理轨迹到可复用模块:理解语言模型推理中的组合泛化
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Institute of Foundation Models(基础模型研究院) ; University of Michigan(密歇根大学)
专题命中 指令微调 :SFT(summary_cn,abstract);language model(title,abstract);LLM(abstract_cn);large language model(abstract)
AI总结 本文通过层次化潜在选择模型形式化组合泛化,理论证明SFT提供原子模块,RL分解轨迹实现组合泛化,实验验证RL能从复合轨迹中提取原子模块并重组解决新配置。
Comments ICML2026
基于先进调节控制理论的多智能体AI系统化方法:用于过程控制的安全且可审计的LLM操作员智能体
机构 * Norwegian University of Science and Technology (NTNU)(挪威科技大学)
专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 提出将先进调节控制理论映射为多智能体系统,每个反馈回路对应一个专业LLM操作员智能体,通过确定性或LLM编排器解决约束冲突,在奶牛场通风案例中实现可审计轨迹。
用于训练大语言模型学习模拟电路知识的数据集构建
机构 * Fudan University(复旦大学)
专题命中 指令微调 :LLM(title,abstract);SFT(summary_cn,abstract);large language model(abstract);language model(abstract)
AI总结 本文构建文本数据集并定制训练技术,使大语言模型学习模拟电路知识;通过多智能体框架生成结构化四元组,结合SFT与KL散度正则化提升性能。
基于上下文学习的音频情感分类的LLM合成真实标签生成
机构 * School of Business, Technical University of Applied Sciences Augsburg(应用技术大学阿沙芬堡商学院) ; Data Science und Autonome Systeme Technologietransferzentrum (TTZ)(数据科学与自主系统技术转移中心(TTZ))
专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 提出利用大语言模型(LLM)和上下文学习(ICL)从多用户VR环境的流式语音数据中自动生成情感相关合成真实标签,解决团队协作状态标注难题。
Comments https://icaiit.org/paper.php?paper=14th_ICAIIT_2/3_9
ExpRL: 用于LLM中期训练的探索性强化学习
机构 * Stanford University(斯坦福大学) ; Carnegie Mellon University(卡内基梅隆大学) ; OpenAI ; Rogo
专题命中 指令微调 :LLM(title,title_cn);SFT(summary_cn,abstract);分类 cs.LG
AI总结 提出ExpRL方法,利用人类编写的问答数据作为奖励支架,通过密集奖励强化推理过程中的部分进展和有用行为,在数学推理任务上优于SFT、稀疏奖励GRPO和自蒸馏,并为后续稀疏奖励RL提供更好的初始化。
基于LLM的嵌入:注意力值比隐藏状态更好地编码句子语义
机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) ; School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国)
专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出Value Aggregation方法,利用LLM的注意力值向量而非隐藏状态来生成句子嵌入,在无训练设置下超越现有方法,甚至匹配或超越集成方法MetaEOL。