arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11511 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11511 篇

2410.17031 2025-03-11 cs.SE cs.AI 91%

GeoCode-GPT: A Large Language Model for Geospatial Code Generation Tasks

Shuyang Hou, Zhangxiao Shen, Anqi Zhao, Jianyuan Liang, Zhipeng Gui, Xuefeng Guan, Rui Li, Huayi Wu

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11423 2025-01-30 cs.CR cs.LG 91%

Generated Data with Fake Privacy: Hidden Dangers of Fine-tuning Large Language Models on Generated Data

Atilla Akkus, Masoud Poorghaffar Aghdam, Mingjie Li, Junjie Chu, Michael Backes, Yang Zhang, Sinem Sav

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

Comments Accepted at 34th USENIX Security Symposium, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12865 2024-12-18 cs.CL 91%

Preference-Oriented Supervised Fine-Tuning: Favoring Target Model Over Aligned Large Language Models

Yuchen Fan, Yuzhong Hong, Qiushi Wang, Junwei Bao, Hongfei Jiang, Yang Song

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)

Comments AAAI2025, 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07667 2024-12-17 cs.CR cs.CL 91%

Simulate and Eliminate: Revoke Backdoors for Generative Large Language Models

Haoran Li, Yulin Chen, Zihao Zheng, Qi Hu, Chunkit Chan, Heshan Liu, Yangqiu Song

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)

Comments To appear at AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08393 2024-12-12 cs.CL 91%

Learning to Reason via Self-Iterative Process Feedback for Small Language Models

Kaiyuan Chen, Jin Wang, Xuejie Zhang

专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SFT(abstract)

Comments Accepted by COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18136 2024-10-25 physics.chem-ph cs.LG cs.NE 91%

Generative Design of Functional Metal Complexes Utilizing the Internal Knowledge of Large Language Models

Jieyu Lu, Zhangde Song, Qiyuan Zhao, Yuanqi Du, Yirui Cao, Haojun Jia, Chenru Duan

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19833 2024-07-10 cs.NI cs.AI 91%

ChatTracer: Large Language Model Powered Real-time Bluetooth Device Tracking System

Qijun Wang, Shichen Zhang, Kunzhe Song, Huacheng Zeng

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04583 2024-06-10 cs.CL 91%

Extroversion or Introversion? Controlling The Personality of Your Large Language Models

Yanquan Chen, Zhen Wu, Junjie Guo, Shujian Huang, Xinyu Dai

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16583 2024-04-03 cs.CL 91%

GPT-Fathom: Benchmarking Large Language Models to Decipher the Evolutionary Path towards GPT-4 and Beyond

Shen Zheng, Yuyu Zhang, Yijie Zhu, Chenguang Xi, Pengyang Gao, Xun Zhou, Kevin Chen-Chuan Chang

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)

Comments Accepted by NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00139 2026-05-22 cs.AI cs.CL cs.LG stat.ME 91%

Enhancing Causal Reasoning in Large Language Models: A Causal Attribution Model for Precision Fine-Tuning

增强大语言模型中的因果推理:一种用于精确微调的因果归因模型

Hengrui Cai, Shengjie Liu, Rui Song

机构 * University of California, Irvine(加州大学尔湾分校) North Carolina State University(北卡罗来纳州立大学) Amazon(亚马逊公司)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种因果归因模型,通过精确微调提升大语言模型的可解释性和因果推理能力,展示了模型在不同领域中的因果发现任务中的有效性。

Comments A Python implementation of our proposed method is available at https://github.com/ncsulsj/Causal_LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20145 2026-07-31 cs.CL cs.AI 版本更新 91%

SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD

SLAI T-Rex:在升腾超级集群上对DeepSeek-V4系列进行全参数训练后优化

Dongfang Li, Xiaodong Luo, Ruoyu Sun, Xuhui Chen, Linyuan Qiu, Jian Meng, Zhengxuan Lu, Yiting Wang, Yucheng Xie, Tao Guo, Tianxiang Fang, Jing Li, Sihang Chen, Shihao Hong, Chang Liu, Weihua Dai, Zirong Zeng, Ziwei Zhu, Zhuohan Wang, Zhengjun Yue, Igor Vasilyev, Min Liu, Weijian Sun, Xin Chen, Yingmeng Gao, Jinhua Zhou, Taolue Chen, Chenwei Wu, Dong Zhang, Wenlong Jin, Jinmin Xiang, Barkova Maria, Ushakov Anton, Xianfei Jin, Tian Ding, Zhihang Lin, Qian Chen, Linxin Yang, Mingzhe Yang, Bingwei Zhang, Hongzhang Yang, Fangxue Zhang, Shijun Qin, Jie Yu, Cuihua Hu, Tolstykh Vasiliy, Nosov Ivan, Abdullin Amir, Zhicheng Zhou, Xin Zhang, Zhixiong Ning, Xutong Zhao, Junjie Huang, Jiajun Liu, Weiyan Kong, Zheng Zhang, Wenhan Luo, Lin Hu, Yangbo Guo, Li Zeng, Shihao Zhang, Baotian Hu, Min Zhang, Haizhou Li, Zhiquan Luo

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究针对万亿参数规模MoE模型全参数训练后优化的系统挑战,在升腾NPU超级集群上以DeepSeek-V4为目标工作负载开发分层优化框架,建立CPT和SFT工作流程,提升模型性能,推动复杂推理前沿模型系统发展。

Comments 73 pages, 22 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22676 2026-07-28 cs.AI cs.CL 新提交 91%

How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift

大语言模型任务适应如何重塑对齐:行为和表征漂移的多维研究

James Elcock, William F. Shen, Xinchi Qiu, Nicholas D. Lane

机构 * University of Cambridge(剑桥大学)

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(title);large language model(abstract);language model(abstract)

AI总结 研究大语言模型任务适应对对齐的影响,通过系统评估监督微调、KL正则化SFT和可验证奖励强化学习等方法,发现训练后调整非均匀重塑对齐,不同方法影响各异,强调任务适应是对齐干预,应进行多维对齐评估。

Comments 21 pages, 7 figures (includes references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22622 2026-07-28 cs.CL cs.AI 新提交 91%

Learning When to Reason for Text-to-SQL via SFT and DPO

通过监督微调(SFT)和直接偏好优化(DPO)学习何时对文本到SQL进行推理

Soohyuk Jang, Jiheum Yeom, Nohil Park, Sang Hun Kim, Yoonyoung Choi, Kiwook Bae, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电气与计算机工程系) AI Center, Samsung Electronics(三星电子人工智能中心) AIIS, ASRI, INMC, ISRC, and IPAI, Seoul National University(首尔国立大学人工智能研究所、高级科学研究所以及综合纳米技术中心、信息存储研究中心和人工智能平台研究所)

专题命中 指令微调 :SFT(title,title_cn);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 研究文本到SQL推理问题,提出AutoThinkSQL框架,集成自动思考机制到SFT和DPO中,使模型能根据查询难度动态调整推理,在基准测试中提升效果,减少输出令牌和延迟,让推理决策与查询难度匹配。

Comments 8 pages, 5 figures. Model checkpoints are available at https://huggingface.co/autothinksql

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00259 2026-07-17 cs.CL cs.AI 91%

LLM Essay Scoring Under Holistic and Analytic Rubrics: Prompt Effects and Bias

基于整体和分析评分标准的LLM作文评分:提示效应与偏见

Filip J. Kucia, Anirban Chakraborty, Anna Wróblewska

机构 * Faculty of Mathematics and Information Science, Warsaw University of Technology(华沙理工大学数学与信息科学学院) University of Wolverhampton(伍尔弗汉普顿大学)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究评估了指令微调LLM在三种开放性作文评分数据集上的表现,发现整体评分与人类一致,但分析评分存在显著偏见,尤其在低阶关注点如语法上表现更严厉,且简洁提示优于长格式提示。

Journal ref Computational Science - ICCS 2026, Lect. Notes Comput. Sci. 16789 (2026) 531-546

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28123 2026-06-30 cs.CV cs.AI cs.CL 91%

Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL

超越SFT到RL:通过黑盒在线策略蒸馏进行预对齐以多模态RL

Sudong Wang, Weiquan Huang, Xiaomin Yu, Zuhao Yang, Hehai Lin, Keming Wu, Chaojun Xiao, Chen Chen, Wenxuan Wang, Beier Zhu, Yunjian Zhang, Chengwei Qin

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 指令微调 :SFT(title,title_cn);post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PRISM框架,通过在SFT和RLVR之间插入显式分布对齐阶段,解决多模态RL中的分布漂移问题,利用基于策略蒸馏的对抗游戏提升对齐效果,实验显示在多个RL算法和基准上性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04710 2026-06-11 cs.CL cs.LG 版本更新 91%

Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning

引导噪声:将随机扰动转化为有效下降方向以实现内存高效的LLM微调

Feihu Jin, Shipeng Cen, Ying Tan

机构 * School of Intelligence Science and Technology(智能科学与技术学院) Institute for Artificial Intelligence(人工智能研究院) Peking University(北京大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出一种即插即用框架,通过候选扰动池选择或组合与优化目标对齐的扰动,改进零阶优化梯度估计,提升LLM微调的收敛速度和任务精度。

Comments 12pages, 6figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03871 2026-06-03 cs.CV cs.CL cs.LG 91%

Visual Instruction Tuning Aligns Modalities through Abstraction

视觉指令调优通过抽象对齐模态

Luis Palacios, Lorenzo Basile, Diego Doimo, Alberto Cazzaniga

机构 * Area Science Park, Trieste, Italy(特里埃斯特Area Science Park)

专题命中 指令微调 :LLM(summary_cn,abstract);instruction tuning(title,abstract);large language model(abstract);language model(abstract)

AI总结 通过探针分析和因果干预,发现视觉指令调优将视觉特征直接嵌入LLM的中间语义层,绕过早期单模态处理层,并通过扩展和强化现有抽象阶段对齐视觉与文本表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16340 2026-04-29 cs.CL cs.AI 91%

Thinking About Thinking: Evaluating Reasoning in Post-Trained Language Models

思考中的思考:评估后训练语言模型的推理能力

Pratham Singla, Shivank Garg, Ayush Singh, Ishan Garg, Ketan Suhaas Saichandran

机构 * Indian Institute of Technology Roorkee(印度理工学院罗奥克学院) Boston University(波士顿大学)

专题命中 指令微调 :SFT(summary_cn,abstract);language model(title,abstract);large language model(abstract);post-training(abstract)

AI总结 研究评估后训练语言模型的推理能力,通过三个核心能力评估其意识、泛化和推理与输出的对齐情况,发现强化学习模型在意识和泛化上优于SFT模型,但推理与输出对齐较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18510 2026-04-21 cs.CR cs.AI cs.CL 91%

Different Paths to Harmful Compliance: Behavioral Side Effects and Mechanistic Divergence Across LLM Jailbreaks

有害合规的不同路径:跨大语言模型劫持的行为主效应和机制差异

Md Rysul Kabir, Zoran Tiganj

机构 * Department of Computer Science(计算机科学系) Luddy School of Informatics, Computing, and Engineering(信息学、计算与工程学院) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 指令微调 :LLM(title,abstract);SFT(summary_cn,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了三种不同劫持方法对模型行为和机制的影响,发现RLVR劫持模型在安全性和合规性上表现更稳定,而SFT和ablation劫持则导致显著的性能下降和行为漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21760 2026-04-16 cs.CL cs.AI 91%

fMRI-LM: Towards a Universal Foundation Model for Language-Aligned fMRI Understanding

fMRI-LM:迈向语言对齐的fMRI理解的通用基础模型

Yuxiang Wei, Yanteng Zhang, Xi Xiao, Chengxuan Qian, Tianyang Wang, Vince D. Calhoun

机构 * TReNDS Center (Georgia Institute of Technology, Georgia State University, Emory)(TReNDS中心(佐治亚理工学院、佐治亚州立大学、埃默里大学)) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Jiangsu University(江苏大学)

专题命中 指令微调 :LLM(summary_cn,abstract);foundation model(title);large language model(abstract);language model(abstract)

AI总结 本文提出fMRI-LM,通过三阶段框架将fMRI与语言结合,实现跨模态脑表示,通过神经分词、预训练LLM适应及多任务微调,提升fMRI的语义理解能力。

Comments Code are available: https://github.com/yuxiangwei0808/fMRI-LM

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00255 2025-02-21 cs.AI cs.CL cs.CV 91%

Robin3D: Improving 3D Large Language Model via Robust Instruction Tuning

Weitai Kang, Haifeng Huang, Yuzhang Shang, Mubarak Shah, Yan Yan

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title);分类 cs.CL、cs.AI

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07549 2024-10-11 cs.CL cs.AI 91%

OneNet: A Fine-Tuning Free Framework for Few-Shot Entity Linking via Large Language Model Prompting

Xukai Liu, Ye Liu, Kai Zhang, Kehang Wang, Qi Liu, Enhong Chen

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);prompting(title);分类 cs.CL、cs.AI

Comments Accepted by EMNLP 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06610 2023-08-15 cs.CL cs.AI 91%

Bio-SIEVE: Exploring Instruction Tuning Large Language Models for Systematic Review Automation

Ambrose Robinson, William Thorne, Ben P. Wu, Abdullah Pandor, Munira Essat, Mark Stevenson, Xingyi Song

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18772 2026-07-22 cs.CL 新提交 91%

RF-Agent: A Practical Framework for Building Language Agents for RFIC Design

RF-Agent:用于构建射频集成电路设计语言代理的实用框架

Yueqi Xing, Houbo He, Jolie Wang, Erin Ni, Shikai Wang, Qiufeng Li, Weidong Cao, Taiyun Chi

机构 * Rice University(莱斯大学) The George Washington University(乔治·华盛顿大学)

专题命中 指令微调 :SFT(summary_cn,abstract);language agent(title);LLM(abstract,comments);large language model(abstract)

AI总结 针对大语言模型在射频电路设计应用受限问题,提出RF-Agent框架,通过教科书驱动知识蒸馏创建数据集及基准,研究监督微调与检索增强生成策略,发现特定领域SFT对中小模型提升大,语义检索的RAG表现最佳,为相关工作提供基础。

Comments Accepted at ICLAD (IEEE International Conference on LLM-Aided Design), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12036 2024-11-13 cs.CL cs.CV 91%

Exploring Advanced Large Language Models with LLMsuite

Giorgio Roffo

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);RLHF(abstract)

Comments Keywords: Language Model Benchmarking, Pre-Trained LLM Comparison, LLM Performance Analysis, NLP Model Evaluation Tools, Public Dataset Inference for LLMs, BLEU and ROUGE Metrics for LLM, Open Source LLM Testing Tools, Large Language Model Evaluation Software, NLP Benchmarking Suite, Comprehensive LLM Evaluation Toolkit

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10276 2026-08-12 cs.HC cs.CY 新提交 91%

Fine-Tuning Large Language Models for Codebook-Guided Coding of Students' Mathematics Metaphor Responses

针对学生数学隐喻回答的密码本引导编码任务微调大型语言模型

Liang Zhang, Stephen Hwang, Yue Ma, Jinfa Cai

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 本研究通过LoRA微调开放权重LLM,使其在学生数学隐喻的密码本引导编码任务中性能提升,表现媲美甚至超越仅提示的专有模型,可用于数学教育的规模化AI辅助测量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05194 2026-07-10 cs.LG cs.AI cs.CL 版本更新 91%

Temporal Preference Concepts and their Functions in a Large Language Model

时间偏好概念及其在大语言模型中的功能

Ian Rios-Sialer, Shantanu Darveshi, Shuai Jiang, Avigya Paudel, Anastasiia Pronina, Ipshita Bandyopadhyay, Justin Shenk

机构 * AISC(AI Safety Camp) SPAR(Supervised Program for Alignment Research)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 通过因果定位和激活修补,本文发现大语言模型在中间到上层节点编码时间偏好几何结构,且行为分析表明模型对未来折扣比人类更平缓,但偏好不稳定,可通过引导向量调控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12968 2026-05-15 cs.LG cs.AI cs.CL cs.LO 91%

Controlling Logical Collapse in LLMs via Algebraic Ontology Projection over F2

通过代数本体投影控制LLM中的逻辑崩溃

Hisashi Miyashita, Mgnite Inc

机构 * Mgnite Inc(Mgnite公司)

专题命中 指令微调 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出代数本体投影(AOP),通过在GF(2)下投影LLM隐藏状态,利用42对关系作为代数密钥,提升零样本包含准确性,揭示逻辑一致性退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00421 2026-05-04 cs.CL cs.AI cs.LG 91%

RadLite: Multi-Task LoRA Fine-Tuning of Small Language Models for CPU-Deployable Radiology AI

RadLite:用于CPU部署的放射学AI的多任务LoRA微调小型语言模型

Pankaj Gupta, Kartik Bose

机构 * Postgraduate Institute of Medical Education and Research(医学教育与研究研究生院)

专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);large language model(abstract);prompting(abstract)

AI总结 研究通过LoRA微调小型语言模型,实现放射学多任务性能,展示在消费级CPU上部署的可行性,提出RadLite模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08377 2026-04-28 cs.LG cs.AI cs.CL 91%

Reinforcement Learning with Backtracking Feedback

具有回溯反馈的强化学习

Bilgehan Sel, Vaishakh Keshava, Phillip Wallis, Lukas Rutishauser, Ming Jin, Dingcheng Li

机构 * Google(谷歌) Google DeepMind(谷歌DeepMind) Virginia Tech(弗吉尼亚理工大学)

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出RLBF框架,通过强化学习阶段使模型动态纠正生成错误,结合改进的SFT数据生成策略,提升LLM在对抗攻击和内在错误中的安全性。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏