Dynamic Prompting: A Unified Framework for Prompt Tuning
专题命中 指令微调 :prompting(title);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI
Comments update
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 指令微调 :prompting(title);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI
Comments update
专题命中 指令微调 :language model(title,abstract);instruction tuning(abstract);分类 cs.CL、cs.AI
Comments ACL 2023 camera ready, 23 pages, 9 figures, 11 tables
专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG
Comments ACL 2023 Main Conference. Code: https://github.com/yueyu1030/Patron
Journal ref ACL 2023
专题命中 指令微调 :prompting(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Comments In ACL 2023. Code https://github.com/maxlchen/Controllable-Mixed-Initiative-Dialogue-Generation 14 pages, 3 figures, 8 tables
专题命中 指令微调 :instruction tuning(title,abstract);language model(abstract);分类 cs.CL、cs.AI
Comments Work in Progress. The code is released at https://github.com/sail-sg/symbolic-instruction-tuning
专题命中 指令微调 :prompting(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
专题命中 指令微调 :prompting(title,abstract);language model(abstract);分类 cs.CL、cs.LG
Comments Accepted to COLING 2022
专题命中 指令微调 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.LG
Comments Accepted to be published in the Proceedings of Interspeech 2022
专题命中 指令微调 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI
专题命中 指令微调 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG
专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG
专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG
Comments Blog (https://andreamad8.github.io/few-shot-gpt/), Medium (https://medium.com/@madottoandrea/language-model-as-few-shot-learner-for-task-oriented-dialogue-systems-db4765796744) and Code (https://github.com/andreamad8/TASK-ORIENTED-LM-FEWSHOT)
专题命中 指令微调 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG
专题命中 指令微调 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG
Comments PolEval 2018 Workshop
Omega-S:一种用于大语言模型微调的功能弹性指数
专题命中 指令微调 :LLM(title,comments);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 Omega-S是一种仅依赖权重矩阵的即插即用惩罚项,在Llama-3-8B的LoRA微调中,它在保留模型原有能力上优于无正则化、调优后的权重衰减和EWC,且成本增加不到4%。
Comments 15 pages of main text plus appendices; 12 tables. Code, per-seed data and all negative results at https://github.com/BiomeMakers/OmegaS-LLM
专题命中 指令微调 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG;language model(comments)
Comments Accepted as a spotlight workshop paper at the Socially Responsible Language Modelling Research (SoLaR) workshop, held at NeurIPS 2023
利用交互作用评估与解释大语言模型的提示敏感性
机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)
专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出基于交互作用的IPS指标,分析50个开源LLMs的提示敏感性,发现监督微调等四个因素可通过降低低阶交互作用的敏感性减少提示波动。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026). 46 pages, 48 figures
A-SR:通过分层协调实现符号回归的自进化智能体大语言模型
专题命中 指令微调 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 A-SR是一种自进化智能体框架,通过分层协调实现符号回归,在LLM-SRBench科学领域和真实世界任务上显著提升了符号回归的Acc@0.01和归一化均方误差指标。
Comments 18 pages, 8 figures, including appendix
CP-MoE:一致性保留的混合专家用于持续学习
机构 * School of Computer Science and Engineering University of New South Wales(计算机科学与工程学院 新南威尔士大学)
专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出CP-MoE,一种基于瞬时专家的持续学习框架,通过一致性保留的路由偏置和瞬时专家引导的正则化机制,减少参数干扰和遗忘,同时保留跨任务知识转移。
Comments Accepted at CoLLAs 2026
RMSWeb:面向Web智能体强化学习的反思、失败模式挖掘与Salvage-DS
专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 RMSWeb是针对Qwen3-VL-Instruct 8B和32B模型的Web智能体强化学习方案,通过三部分技术提升训练效率与性能,在多个Web基准数据集上较SFT取得显著提升,且8B模型获同规模开源模型最优Online-Mind2Web结果。
Comments 15 pages, 9 figures, and 6 tables. Includes appendices
UniCoder: 通过符号奖励和参考引导代码优化的统一视觉到代码生成
机构 * The Chinese University of Hong Kong(香港中文大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);SFT(abstract)
AI总结 提出UniCoder框架,通过符号属性对齐实现密集元素级奖励,并利用参考引导代码优化策略克服探索停滞,在多个基准上达到与专有模型相当的性能。
ProactiveBench: 多模态大语言模型主动性的基准测试
机构 * University of Trento(特伦托大学) ; University of Bergamo(贝拉米奥大学) ; Inria Grenoble(格勒诺布尔研究所) ; Bruno Kessler Foundation(布鲁诺·凯斯勒基金会)
专题命中 指令微调 :large language model(title);language model(title)
AI总结 提出ProactiveBench基准,评估多模态大语言模型在遮挡识别等任务中请求用户干预的主动性,发现模型普遍缺乏主动性且与能力无关,但可通过强化学习微调习得。
Comments Accepted at ECCV 2026
改进的大规模语言扩散模型
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) ; Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京市大模型与智能治理重点实验室) ; Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部新一代智能搜索与推荐工程研究中心) ; ByteDance Seed(字节跳动Seed)
专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出iLLaDA,一种8B参数的全双向注意力掩码扩散语言模型,从零训练至12T tokens,在通用、数学和代码基准上显著优于LLaDA,并可与Qwen2.5 7B竞争。
刻意设计的不适定问题:探究VLMs中的证据使用
机构 * Tel Aviv University(特拉维夫大学) ; IBM Research(IBM研究院)
专题命中 指令微调 :LLM(summary_cn,abstract);language model(abstract)
AI总结 提出单目物体尺寸估计作为不适定诊断任务,通过反事实分析分解六种视觉和语言证据通道,评估12个开源VLM,发现最大模型仍落后于纯文本LLM,且模型未有效利用场景几何信息。
VideoSketcher:利用视频模型先验的序列草图生成
机构 * MIT(麻省理工学院)
专题命中 指令微调 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出VideoSketcher方法,结合LLM的语义规划与视频扩散模型的时序渲染,通过两阶段微调从少量样本学习笔画顺序与风格,生成高质量序列草图。
GRIDEX:基于网格的深度伪造频谱图取证解释
机构 * CSIRO(澳大利亚联邦科学与工业研究组织)
专题命中 指令微调 :SFT(summary_cn,abstract);language model(abstract)
AI总结 提出GRIDEX框架,通过两阶段学习(SFT+GRPO)定位频谱图异常区域并生成结构化取证解释,提升伪造检测的可解释性。
基于Bandit的提示设计策略选择改进提示优化器
机构 * Yokohama National University(横滨国立大学)
专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出OPTS方法,通过显式选择提示设计策略提升EvoPrompt性能,采用Thompson采样机制在BIG-Bench Hard上验证效果,实现最优结果。
Comments Accepted to ACL 2025 Findings
面向自然语言引导的多无人机分配中可扩展QAOA的最优性保持分解
机构 * Korea University(高丽大学)
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)
AI总结 提出端到端框架,集成微调大语言模型与量子-经典后端,通过约束保持图分割和动态规划合并,实现自然语言引导下多无人机任务分配的可扩展量子优化。
Comments 10 pages, 2 figures, 3 tables, preprint
通过目标分布设计审视监督微调的统一视角
机构 * University of California, Los Angeles (UCLA)(加州大学洛杉矶分校) ; Arena
专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文重新解读监督微调为目标分布设计,提出Q-target框架,将监督分解为对观测token的依赖强度与替代token的概率分配,并基于此提出Target-SFT方法,在多个推理任务中优于现有方法。
面向快速鲁棒机器人故障检测与恢复的目标导向通信
机构 * Department of Engineering, King’s College London(伦敦国王学院工程系) ; Bristol Research and Innovation Laboratory, Toshiba Europe Ltd.(托bsd欧洲有限公司布里斯托尔研究与创新实验室)
专题命中 指令微调 :SLM(abstract,abstract_cn);large language model(abstract);language model(abstract);small language model(abstract)
AI总结 提出目标导向通信框架,通过联合设计通信-计算-控制回路,利用3D场景图检测故障,并微调小语言模型结合知识蒸馏生成恢复动作,实现故障检测与恢复时间降低82.6%,任务成功率提升76%。
Comments Submit to IEEE for potential publication