Plug-and-Play Policy Planner for Large Language Model Powered Dialogue Agents
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments Accepted by ICLR 2024
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments Accepted by ICLR 2024
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments 11 pages, 14 figures
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract);RLHF(abstract)
Comments Published in NeurIPS 2023 Datasets and Benchmarks
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract);RLHF(abstract)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
专题命中 指令微调 :LLM(title,abstract);instruction tuning(title,abstract);large language model(abstract);language model(abstract)
Comments Code is available at https://github.com/OpenGVLab/LLaMA-Adapter
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)
Comments Accepted to the 34th IEEE International Symposium on Software Reliability Engineering (ISSRE 2023)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)
Comments Try BayLing's online demo at http://nlp.ict.ac.cn/bayling/demo
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)
机构 * Department of Computer Science, School of Computing, Institute of Science Tokyo(计算机科学系、计算学院、科学东京研究所) ; National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院) ; Research and Development Center for Large Language Models, NII(大型语言模型研究与开发中心、日本科学振兴会)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);instruction tuning(abstract)
Comments COLM 2025; Datasets are available at https://huggingface.co/datasets/tokyotech-llm/lmsys-chat-1m-synth
基于检索和微调的大语言模型方法用于工业资产健康监测和决策支持
专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究基于检索和微调的大语言模型方法在工业资产健康监测中的故障传感器诊断推理表现,通过FailureSensorIQ基准测试,发现语义搜索和混合搜索效果好,基于LLM的微调模型性能最佳,且各方法对一些干扰因素敏感。
Comments 6 pages, 4 figures, 6 tables
迈向用于小规模语言模型智能体的稳健强化学习
机构 * University of Waterloo(滑铁卢大学) ; Khulna University of Engineering & Technology(库尔纳工程技术大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 指令微调 :language model(title,abstract);SLM(abstract,abstract_cn);SFT(abstract,abstract_cn);small language model(abstract)
AI总结 研究小规模语言模型强化学习不稳定问题,识别出三种失败模式,提出容量余量假设,采用合并并重新初始化适配器技术等方法,所提系统稳定收敛,提升偏好胜率,优于指令调整基线且减少训练数据。
Comments Proceedings of the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC), Bellevue, WA, USA
主题情感是否导致感知意识形态?比较政治新闻文章中人类与LLM的标注
机构 * Columbia University(哥伦比亚大学)
专题命中 指令微调 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 研究主题情感对感知政治意识形态的因果效应,通过比较人类与LLM标注,发现微调GPT-4o-mini产生显著因果效应,归因于捷径学习。
Comments V1 accepted to ACL SRW 2026. V2 updates experiments
秩序点:面向行动的LLM角色建模用于真实市政模拟
专题命中 指令微调 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出一种可复现的流程,将公开Zoom录像转换为带有角色档案和行动标签的发言转录,通过细调LLM提升角色建模效果,显著降低困惑度并提高模拟真实性和一致性。
Comments 8 pages (39 pages including appendix), 29 figures
用于电信网络故障排除的单 GPU 上的边缘可部署大语言模型微调
专题命中 指令微调 :LLM(title,summary_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 研究电信边缘站点大语言模型微调,用Unsloth框架进行GPU分析,系统分析多因素对训练稳定性和资源效率的影响,给出推理与非推理模型不同行为,为电信边缘环境LLM微调提供配置指南。
Comments 6 pages, 2 figures, 5 tables
SFT 过训练通过熵崩溃预测 RLVR 下的排名反转
机构 * Stanford University(斯坦福大学)
专题命中 指令微调 :SFT(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现 SFT 过度训练导致 rollout 分布熵降低,使 GRPO 中优势信号消失,从而引发排名反转;提出基于熵的两阶段诊断方法可预警高风险检查点。
Comments Accepted at the Deep Learning for Code (DL4C) Workshop at ICML 2026
STRIDE: 通过编辑轨迹对生物序列进行后训练推理与优化
专题命中 指令微调 :LLM(summary_cn,abstract);post-training(title,abstract);SFT(abstract,abstract_cn)
AI总结 提出STRIDE框架,通过后训练使LLM生成可执行的插入/删除/替换轨迹,结合监督微调和策略优化实现离散生物序列的迭代优化,在蛋白质和分子编辑任务上显著提升成功率和新颖性。
Comments Accepted to ICML 2026
灾难性遗忘的机制起源:为什么RL比SFT更好地保留电路?
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; University of Toronto(多伦多大学)
专题命中 指令微调 :SFT(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过引入差异电路脆弱性指标,研究比较了强化学习与监督微调在大型语言模型微调中对内部计算电路的保留程度,发现RL虽任务适应较慢但能更好保留电路,从而减轻灾难性遗忘。
通过融合路由实现令牌级LLM协作
机构 * [cs.AI](计算机科学与人工智能)
专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出FusionRoute框架,通过轻量级路由器在解码步骤中选择最合适的专家并补充对数几率以优化下一个令牌分布,解决了单个通用模型在多个领域表现不佳的问题,同时在多个基准测试中优于其他方法。
Comments 25 pages
学习率至关重要:Vanilla LoRA可能足以用于LLM微调
机构 * National Taiwan University(国立台湾大学) ; IBM Research(IBM研究院) ; Academia Sinica(台湾“学术院”)
专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过广泛的超参数搜索重新评估了九种代表性的LoRA变体和Vanilla LoRA,在数学推理、常识推理、代码生成和指令遵循等任务上,发现不同的LoRA方法偏好不同的学习率范围。当学习率正确调整时,所有方法都能达到相似的峰值性能,这表明Vanilla LoRA仍然是一个有竞争力的基线,而单一训练配置下的改进可能并不反映一致的方法优势。
Comments Project page: https://github.com/yuang-lee/lr-matters-lora
跨不同微调策略和模型规模的大型语言模型可解释性分析用于自动化代码合规
机构 * Department of Civil and Environmental Engineering, National University of Singapore(新加坡国立大学土木与环境工程系) ; School of Transportation Science and Engineering, Harbin Institute of Technology(哈尔滨工业大学交通运输科学与工程学院) ; Research and Innovation, NovaCITYNETS Pte.Ltd.(NovaCITYNETS Pte.Ltd.研究与创新部)
专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过扰动分析比较不同微调策略和模型规模下LLM的可解释行为,发现全微调产生更聚焦的属性模式,且模型规模增大时,LLM发展出优先考虑数值约束和规则标识符的策略,但语义相似度在7B以上模型中趋于平稳。
Comments 8 pages, 9 figures. Accepted at ICCCBE 2026 (International Conference on Computing in Civil and Building Engineering)
机构 * School of Computer Science, Fudan University(复旦大学计算机学院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 指令微调 :SFT(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)
Comments ICLR2024 Camera Ready. Data and model checkpoints are available at https://github.com/hkust-nlp/deita
专题命中 指令微调 :language model(title,abstract);large language model(title);instruction tuning(title);分类 cs.CL、cs.AI、cs.LG
Comments LREC-COLING 2024
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);prompting(title)
Comments 8 pages, 3 figures, rejected by IROS2023
专题命中 指令微调 :language model(title,abstract);large language model(title);small language model(title);分类 cs.CL、cs.AI、cs.LG
基于本体的大型语言模型对话控制:一种轻量级框架用于受约束生成
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.AI
AI总结 本文提出一种轻量级框架,通过对话相关本体定义实现对LLM输出的模块化和可解释控制,通过建模关键方面作为约束并微调LLM,提升对话生成的可控性和可解释性。
Comments Accepted at KG & LLM: Knowledge Graphs and Large Language Models LREC 2026 Workshop
大语言模型中的冲突与一致性效应:言语冲突任务中的权重内与上下文内竞争
专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI
AI总结 本研究通过言语冲突任务,探究LLM中一致性效应的机制,发现其源于权重内默认映射与上下文内规则映射的竞争,为分析此类响应竞争提供了模型系统。
Comments 23 pages, 8 figures