GeoCode-GPT: A Large Language Model for Geospatial Code Generation Tasks
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)
Comments Accepted at 34th USENIX Security Symposium, 2025
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)
Comments AAAI2025, 12 pages, 9 figures
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)
Comments To appear at AAAI 2025
专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SFT(abstract)
Comments Accepted by COLING 2025
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)
Comments Accepted by NAACL 2024
增强大语言模型中的因果推理:一种用于精确微调的因果归因模型
机构 * University of California, Irvine(加州大学尔湾分校) ; North Carolina State University(北卡罗来纳州立大学) ; Amazon(亚马逊公司)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出一种因果归因模型,通过精确微调提升大语言模型的可解释性和因果推理能力,展示了模型在不同领域中的因果发现任务中的有效性。
Comments A Python implementation of our proposed method is available at https://github.com/ncsulsj/Causal_LLM
SLAI T-Rex:在升腾超级集群上对DeepSeek-V4系列进行全参数训练后优化
专题命中 指令微调 :SFT(summary_cn,abstract);post-training(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 研究针对万亿参数规模MoE模型全参数训练后优化的系统挑战,在升腾NPU超级集群上以DeepSeek-V4为目标工作负载开发分层优化框架,建立CPT和SFT工作流程,提升模型性能,推动复杂推理前沿模型系统发展。
Comments 73 pages, 22 figures, 20 tables
大语言模型任务适应如何重塑对齐:行为和表征漂移的多维研究
机构 * University of Cambridge(剑桥大学)
专题命中 指令微调 :SFT(summary_cn,abstract);LLM(title);large language model(abstract);language model(abstract)
AI总结 研究大语言模型任务适应对对齐的影响,通过系统评估监督微调、KL正则化SFT和可验证奖励强化学习等方法,发现训练后调整非均匀重塑对齐,不同方法影响各异,强调任务适应是对齐干预,应进行多维对齐评估。
Comments 21 pages, 7 figures (includes references and appendices)
通过监督微调(SFT)和直接偏好优化(DPO)学习何时对文本到SQL进行推理
机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电气与计算机工程系) ; AI Center, Samsung Electronics(三星电子人工智能中心) ; AIIS, ASRI, INMC, ISRC, and IPAI, Seoul National University(首尔国立大学人工智能研究所、高级科学研究所以及综合纳米技术中心、信息存储研究中心和人工智能平台研究所)
专题命中 指令微调 :SFT(title,title_cn);preference optimization(abstract);分类 cs.CL、cs.AI
AI总结 研究文本到SQL推理问题,提出AutoThinkSQL框架,集成自动思考机制到SFT和DPO中,使模型能根据查询难度动态调整推理,在基准测试中提升效果,减少输出令牌和延迟,让推理决策与查询难度匹配。
Comments 8 pages, 5 figures. Model checkpoints are available at https://huggingface.co/autothinksql
基于整体和分析评分标准的LLM作文评分:提示效应与偏见
机构 * Faculty of Mathematics and Information Science, Warsaw University of Technology(华沙理工大学数学与信息科学学院) ; University of Wolverhampton(伍尔弗汉普顿大学)
专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究评估了指令微调LLM在三种开放性作文评分数据集上的表现,发现整体评分与人类一致,但分析评分存在显著偏见,尤其在低阶关注点如语法上表现更严厉,且简洁提示优于长格式提示。
Journal ref Computational Science - ICCS 2026, Lect. Notes Comput. Sci. 16789 (2026) 531-546
超越SFT到RL:通过黑盒在线策略蒸馏进行预对齐以多模态RL
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) ; Tsinghua University(清华大学) ; Nanyang Technological University(南洋理工大学) ; Renmin University of China(中国人民大学) ; University of Science and Technology of China(中国科学技术大学) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 指令微调 :SFT(title,title_cn);post-training(abstract);分类 cs.CL、cs.AI
AI总结 本文提出PRISM框架,通过在SFT和RLVR之间插入显式分布对齐阶段,解决多模态RL中的分布漂移问题,利用基于策略蒸馏的对抗游戏提升对齐效果,实验显示在多个RL算法和基准上性能提升。
引导噪声:将随机扰动转化为有效下降方向以实现内存高效的LLM微调
机构 * School of Intelligence Science and Technology(智能科学与技术学院) ; Institute for Artificial Intelligence(人工智能研究院) ; Peking University(北京大学) ; State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)
专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 提出一种即插即用框架,通过候选扰动池选择或组合与优化目标对齐的扰动,改进零阶优化梯度估计,提升LLM微调的收敛速度和任务精度。
Comments 12pages, 6figures
视觉指令调优通过抽象对齐模态
机构 * Area Science Park, Trieste, Italy(特里埃斯特Area Science Park)
专题命中 指令微调 :LLM(summary_cn,abstract);instruction tuning(title,abstract);large language model(abstract);language model(abstract)
AI总结 通过探针分析和因果干预,发现视觉指令调优将视觉特征直接嵌入LLM的中间语义层,绕过早期单模态处理层,并通过扩展和强化现有抽象阶段对齐视觉与文本表示。
思考中的思考:评估后训练语言模型的推理能力
机构 * Indian Institute of Technology Roorkee(印度理工学院罗奥克学院) ; Boston University(波士顿大学)
专题命中 指令微调 :SFT(summary_cn,abstract);language model(title,abstract);large language model(abstract);post-training(abstract)
AI总结 研究评估后训练语言模型的推理能力,通过三个核心能力评估其意识、泛化和推理与输出的对齐情况,发现强化学习模型在意识和泛化上优于SFT模型,但推理与输出对齐较差。
有害合规的不同路径:跨大语言模型劫持的行为主效应和机制差异
机构 * Department of Computer Science(计算机科学系) ; Luddy School of Informatics, Computing, and Engineering(信息学、计算与工程学院) ; Indiana University Bloomington(印第安纳大学布卢明顿分校)
专题命中 指令微调 :LLM(title,abstract);SFT(summary_cn,abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了三种不同劫持方法对模型行为和机制的影响,发现RLVR劫持模型在安全性和合规性上表现更稳定,而SFT和ablation劫持则导致显著的性能下降和行为漂移。
fMRI-LM:迈向语言对齐的fMRI理解的通用基础模型
机构 * TReNDS Center (Georgia Institute of Technology, Georgia State University, Emory)(TReNDS中心(佐治亚理工学院、佐治亚州立大学、埃默里大学)) ; University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) ; Jiangsu University(江苏大学)
专题命中 指令微调 :LLM(summary_cn,abstract);foundation model(title);large language model(abstract);language model(abstract)
AI总结 本文提出fMRI-LM,通过三阶段框架将fMRI与语言结合,实现跨模态脑表示,通过神经分词、预训练LLM适应及多任务微调,提升fMRI的语义理解能力。
Comments Code are available: https://github.com/yuxiangwei0808/fMRI-LM
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title);分类 cs.CL、cs.AI
Comments 8 pages
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);prompting(title);分类 cs.CL、cs.AI
Comments Accepted by EMNLP 2024 Main
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title);分类 cs.CL、cs.AI
RF-Agent:用于构建射频集成电路设计语言代理的实用框架
机构 * Rice University(莱斯大学) ; The George Washington University(乔治·华盛顿大学)
专题命中 指令微调 :SFT(summary_cn,abstract);language agent(title);LLM(abstract,comments);large language model(abstract)
AI总结 针对大语言模型在射频电路设计应用受限问题,提出RF-Agent框架,通过教科书驱动知识蒸馏创建数据集及基准,研究监督微调与检索增强生成策略,发现特定领域SFT对中小模型提升大,语义检索的RAG表现最佳,为相关工作提供基础。
Comments Accepted at ICLAD (IEEE International Conference on LLM-Aided Design), 2026
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);RLHF(abstract)
Comments Keywords: Language Model Benchmarking, Pre-Trained LLM Comparison, LLM Performance Analysis, NLP Model Evaluation Tools, Public Dataset Inference for LLMs, BLEU and ROUGE Metrics for LLM, Open Source LLM Testing Tools, Large Language Model Evaluation Software, NLP Benchmarking Suite, Comprehensive LLM Evaluation Toolkit
针对学生数学隐喻回答的密码本引导编码任务微调大型语言模型
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)
AI总结 本研究通过LoRA微调开放权重LLM,使其在学生数学隐喻的密码本引导编码任务中性能提升,表现媲美甚至超越仅提示的专有模型,可用于数学教育的规模化AI辅助测量。
时间偏好概念及其在大语言模型中的功能
机构 * AISC(AI Safety Camp) ; SPAR(Supervised Program for Alignment Research)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 通过因果定位和激活修补,本文发现大语言模型在中间到上层节点编码时间偏好几何结构,且行为分析表明模型对未来折扣比人类更平缓,但偏好不稳定,可通过引导向量调控。
通过代数本体投影控制LLM中的逻辑崩溃
机构 * Mgnite Inc(Mgnite公司)
专题命中 指令微调 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)
AI总结 本文提出代数本体投影(AOP),通过在GF(2)下投影LLM隐藏状态,利用42对关系作为代数密钥,提升零样本包含准确性,揭示逻辑一致性退化问题。
RadLite:用于CPU部署的放射学AI的多任务LoRA微调小型语言模型
机构 * Postgraduate Institute of Medical Education and Research(医学教育与研究研究生院)
专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);large language model(abstract);prompting(abstract)
AI总结 研究通过LoRA微调小型语言模型,实现放射学多任务性能,展示在消费级CPU上部署的可行性,提出RadLite模型。
具有回溯反馈的强化学习
机构 * Google(谷歌) ; Google DeepMind(谷歌DeepMind) ; Virginia Tech(弗吉尼亚理工大学)
专题命中 指令微调 :SFT(summary_cn,abstract);LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文提出RLBF框架,通过强化学习阶段使模型动态纠正生成错误,结合改进的SFT数据生成策略,提升LLM在对抗攻击和内在错误中的安全性。
Comments NeurIPS 2025