arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11601 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11601 篇

2303.02909 2023-05-30 cs.CL cs.AI 84%

Dynamic Prompting: A Unified Framework for Prompt Tuning

Xianjun Yang, Wei Cheng, Xujiang Zhao, Wenchao Yu, Linda Petzold, Haifeng Chen

专题命中 指令微调 :prompting(title);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI

Comments update

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.10560 2023-05-29 cs.CL cs.AI 84%

Self-Instruct: Aligning Language Models with Self-Generated Instructions

Yizhong Wang, Yeganeh Kordi, Swaroop Mishra, Alisa Liu, Noah A. Smith, Daniel Khashabi, Hannaneh Hajishirzi

专题命中 指令微调 :language model(title,abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

Comments ACL 2023 camera ready, 23 pages, 9 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.06995 2023-05-10 cs.CL cs.LG 84%

Cold-Start Data Selection for Few-shot Language Model Fine-tuning: A Prompt-Based Uncertainty Propagation Approach

Yue Yu, Rongzhi Zhang, Ran Xu, Jieyu Zhang, Jiaming Shen, Chao Zhang

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

Comments ACL 2023 Main Conference. Code: https://github.com/yueyu1030/Patron

Journal ref ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.04147 2023-05-09 cs.CL cs.AI cs.HC 84%

Controllable Mixed-Initiative Dialogue Generation through Prompting

Maximillian Chen, Xiao Yu, Weiyan Shi, Urvi Awasthi, Zhou Yu

专题命中 指令微调 :prompting(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments In ACL 2023. Code https://github.com/maxlchen/Controllable-Mixed-Initiative-Dialogue-Generation 14 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.07995 2023-04-18 cs.CL cs.AI 84%

From Zero to Hero: Examining the Power of Symbolic Tasks in Instruction Tuning

Qian Liu, Fan Zhou, Zhengbao Jiang, Longxu Dou, Min Lin

专题命中 指令微调 :instruction tuning(title,abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Work in Progress. The code is released at https://github.com/sail-sg/symbolic-instruction-tuning

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.11890 2022-11-23 cs.CL cs.AI 84%

TEMPERA: Test-Time Prompting via Reinforcement Learning

Tianjun Zhang, Xuezhi Wang, Denny Zhou, Dale Schuurmans, Joseph E. Gonzalez

专题命中 指令微调 :prompting(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.09401 2022-09-21 cs.CL cs.LG 84%

Automatic Label Sequence Generation for Prompting Sequence-to-sequence Models

Zichun Yu, Tianyu Gao, Zhengyan Zhang, Yankai Lin, Zhiyuan Liu, Maosong Sun, Jie Zhou

专题命中 指令微调 :prompting(title,abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Accepted to COLING 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.16773 2022-07-12 eess.AS cs.CL cs.LG cs.SD 84%

SpeechPrompt: An Exploration of Prompt Tuning on Generative Spoken Language Model for Speech Processing Tasks

Kai-Wei Chang, Wei-Cheng Tseng, Shang-Wen Li, Hung-yi Lee

专题命中 指令微调 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.LG

Comments Accepted to be published in the Proceedings of Interspeech 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.01958 2022-06-07 cs.CL cs.AI 84%

Instance-wise Prompt Tuning for Pretrained Language Models

Yuezihan Jiang, Hao Yang, Junyang Lin, Hanyu Zhao, An Yang, Chang Zhou, Hongxia Yang, Zhi Yang, Bin Cui

专题命中 指令微调 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.07869 2021-12-16 cs.CL cs.LG 84%

Fine-Tuning Large Neural Language Models for Biomedical Natural Language Processing

Robert Tinn, Hao Cheng, Yu Gu, Naoto Usuyama, Xiaodong Liu, Tristan Naumann, Jianfeng Gao, Hoifung Poon

专题命中 指令微调 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.01403 2021-04-06 cs.CL cs.LG 84%

Supervised Contrastive Learning for Pre-trained Language Model Fine-tuning

Beliz Gunel, Jingfei Du, Alexis Conneau, Ves Stoyanov

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.06239 2020-08-21 cs.CL cs.LG 84%

Language Models as Few-Shot Learner for Task-Oriented Dialogue Systems

Andrea Madotto, Zihan Liu, Zhaojiang Lin, Pascale Fung

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

Comments Blog (https://andreamad8.github.io/few-shot-gpt/), Medium (https://medium.com/@madottoandrea/language-model-as-few-shot-learner-for-task-oriented-dialogue-systems-db4765796744) and Code (https://github.com/andreamad8/TASK-ORIENTED-LM-FEWSHOT)

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.08593 2020-01-10 cs.CL cs.LG stat.ML 84%

Fine-Tuning Language Models from Human Preferences

Daniel M. Ziegler, Nisan Stiennon, Jeffrey Wu, Tom B. Brown, Alec Radford, Dario Amodei, Paul Christiano, Geoffrey Irving

专题命中 指令微调 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.10222 2018-10-25 cs.CL cs.LG stat.ML 84%

Universal Language Model Fine-Tuning with Subword Tokenization for Polish

Piotr Czapla, Jeremy Howard, Marcin Kardas

专题命中 指令微调 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments PolEval 2018 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03887 2026-08-05 cs.LG cs.NE q-bio.MN 新提交 84%

Omega-S: A Functional Resilience Index for LLM Fine-Tuning

Omega-S:一种用于大语言模型微调的功能弹性指数

Alberto Acedo

专题命中 指令微调 :LLM(title,comments);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Omega-S是一种仅依赖权重矩阵的即插即用惩罚项,在Llama-3-8B的LoRA微调中,它在保留模型原有能力上优于无正则化、调优后的权重衰减和EWC,且成本增加不到4%。

Comments 15 pages of main text plus appendices; 12 tables. Code, per-seed data and all negative results at https://github.com/BiomeMakers/OmegaS-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14751 2023-12-25 cs.LG cs.CY 84%

Hazards from Increasingly Accessible Fine-Tuning of Downloadable Foundation Models

Alan Chan, Ben Bucknall, Herbie Bradley, David Krueger

专题命中 指令微调 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG;language model(comments)

Comments Accepted as a spotlight workshop paper at the Socially Responsible Language Modelling Research (SoLaR) workshop, held at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18539 2026-08-20 cs.LG cs.AI cs.CL 新提交 83%

Evaluating and Explaining Prompt Sensitivity of LLMs Using Interactions

利用交互作用评估与解释大语言模型的提示敏感性

Ruiyang Qin, Qingzhuo Wang, Tian Wang, Zhihua Wei, Wen Shen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于交互作用的IPS指标,分析50个开源LLMs的提示敏感性,发现监督微调等四个因素可通过降低低阶交互作用的敏感性减少提示波动。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026). 46 pages, 48 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04872 2026-08-07 cs.CL cs.AI cs.LG 版本更新 83%

A-SR: Self-Evolving Agentic LLMs for Symbolic Regression via Hierarchical Coordination

A-SR:通过分层协调实现符号回归的自进化智能体大语言模型

Wenxiao Zhao, Dong Liu, Kaiyi Xu, Feng Liu, Zhen Zhao, Fei Ben, Shu Wang, Wenhao Li, Ying Nian Wu, Fenghua Ling, Haobo Li, Lei Bai

专题命中 指令微调 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 A-SR是一种自进化智能体框架,通过分层协调实现符号回归,在LLM-SRBench科学领域和真实世界任务上显著提升了符号回归的Acc@0.01和归一化均方误差指标。

Comments 18 pages, 8 figures, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20247 2026-08-07 cs.LG cs.AI cs.CL cs.CV 版本更新 83%

CP-MoE: Consistency-Preserving Mixture-of-Experts for Continual Learning

CP-MoE:一致性保留的混合专家用于持续学习

Yang Liu, Toan Nguyen, Flora D. Salim

机构 * School of Computer Science and Engineering University of New South Wales(计算机科学与工程学院 新南威尔士大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CP-MoE,一种基于瞬时专家的持续学习框架,通过一致性保留的路由偏置和瞬时专家引导的正则化机制,减少参数干扰和遗忘,同时保留跨任务知识转移。

Comments Accepted at CoLLAs 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00335 2026-08-04 cs.AI cs.CL cs.LG 新提交 83%

RMSWeb: Reflection, Failure-Mode Mining, and Salvage-DS for Web Agent Reinforcement Learning

RMSWeb:面向Web智能体强化学习的反思、失败模式挖掘与Salvage-DS

Chengbo Liu, Lifang Zhou, Ruijie Yan, Pei Tan, Ao Sun, Haojun Huang, Guichun Hua, Sining Wei, Yining Chen, Yingying He, Yutao Xie

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RMSWeb是针对Qwen3-VL-Instruct 8B和32B模型的Web智能体强化学习方案,通过三部分技术提升训练效率与性能,在多个Web基准数据集上较SFT取得显著提升,且8B模型获同规模开源模型最优Online-Mind2Web结果。

Comments 15 pages, 9 figures, and 6 tables. Includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31732 2026-07-01 cs.CV 新提交 83%

UniCoder: Unified Visual-to-Code Generation via Symbolic Rewards and Reference-Guided Code Optimization

UniCoder: 通过符号奖励和参考引导代码优化的统一视觉到代码生成

Yaozhi Zheng, Yilei Jiang, Manyuan Zhang, Yuxuan Wan, Kaituo Feng, Tianshuo Peng, Bo Zhang, Xiangyu Yue

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 提出UniCoder框架,通过符号属性对齐实现密集元素级奖励,并利用参考引导代码优化策略克服探索停滞,在多个基准上达到与专有模型相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19466 2026-06-29 cs.CV 版本更新 83%

ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models

ProactiveBench: 多模态大语言模型主动性的基准测试

Thomas De Min, Subhankar Roy, Stéphane Lathuilière, Elisa Ricci, Massimiliano Mancini

机构 * University of Trento(特伦托大学) University of Bergamo(贝拉米奥大学) Inria Grenoble(格勒诺布尔研究所) Bruno Kessler Foundation(布鲁诺·凯斯勒基金会)

专题命中 指令微调 :large language model(title);language model(title)

AI总结 提出ProactiveBench基准,评估多模态大语言模型在遮挡识别等任务中请求用户干预的主动性,发现模型普遍缺乏主动性且与能力无关,但可通过强化学习微调习得。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25331 2026-06-25 cs.CL cs.AI cs.LG 新提交 83%

Improved Large Language Diffusion Models

改进的大规模语言扩散模型

Shen Nie, Qiyang Min, Shaoxuan Xu, Zihao Huang, Yuxuan Song, Yong Shan, Yankai Lin, Wayne Xin Zhao, Chongxuan Li, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京市大模型与智能治理重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部新一代智能搜索与推荐工程研究中心) ByteDance Seed(字节跳动Seed)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出iLLaDA,一种8B参数的全双向注意力掩码扩散语言模型,从零训练至12T tokens,在通用、数学和代码基准上显著优于LLaDA,并可与Qwen2.5 7B竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24335 2026-06-24 cs.CV 新提交 83%

Ill-Posed by Design: Probing Evidence Use in VLMs

刻意设计的不适定问题:探究VLMs中的证据使用

Boaz Meivar, Shaked Perek, Shani Shvartzman, Eli Schwartz, Shai Avidan

机构 * Tel Aviv University(特拉维夫大学) IBM Research(IBM研究院)

专题命中 指令微调 :LLM(summary_cn,abstract);language model(abstract)

AI总结 提出单目物体尺寸估计作为不适定诊断任务,通过反事实分析分解六种视觉和语言证据通道,评估12个开源VLM,发现最大模型仍落后于纯文本LLM,且模型未有效利用场景几何信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15819 2026-06-19 cs.CV 版本更新 83%

VideoSketcher: Sequential Sketch Generation Using Video Model Priors

VideoSketcher:利用视频模型先验的序列草图生成

Hui Ren, Yuval Alaluf, Omer Bar Tal, Alexander Schwing, Antonio Torralba, Yael Vinker

机构 * MIT(麻省理工学院)

专题命中 指令微调 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出VideoSketcher方法,结合LLM的语义规划与视频扩散模型的时序渲染,通过两阶段微调从少量样本学习笔画顺序与风格,生成高质量序列草图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18738 2026-06-18 cs.SD 新提交 83%

GRIDEX: Grid-Grounded Forensic Explanations for Deepfake Spectrogram Analysis

GRIDEX:基于网格的深度伪造频谱图取证解释

Thi Ngan Ha Do, Tingmin Wu, Alsharif Abuadbba, Kristen Moore

机构 * CSIRO(澳大利亚联邦科学与工业研究组织)

专题命中 指令微调 :SFT(summary_cn,abstract);language model(abstract)

AI总结 提出GRIDEX框架,通过两阶段学习(SFT+GRPO)定位频谱图异常区域并生成结构化取证解释,提升伪造检测的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01163 2026-06-18 cs.AI cs.CL cs.HC cs.LG cs.NE 83%

Bandit-Based Prompt Design Strategy Selection Improves Prompt Optimizers

基于Bandit的提示设计策略选择改进提示优化器

Rin Ashizawa, Yoichi Hirose, Nozomu Yoshinari, Kento Uchida, Shinichi Shirakawa

机构 * Yokohama National University(横滨国立大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出OPTS方法,通过显式选择提示设计策略提升EvoPrompt性能,采用Thompson采样机制在BIG-Bench Hard上验证效果,实现最优结果。

Comments Accepted to ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14252 2026-06-15 cs.RO 新提交 83%

Optimality-Preserving Decomposition for Scalable QAOA in Natural-Language-Guided Multi-Drone Assignment

面向自然语言引导的多无人机分配中可扩展QAOA的最优性保持分解

Junyeop Bang, Byongho Lee, Dohyun An, Hwangnam Kim

机构 * Korea University(高丽大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 提出端到端框架,集成微调大语言模型与量子-经典后端,通过约束保持图分割和动态规划合并,实现自然语言引导下多无人机任务分配的可扩展量子优化。

Comments 10 pages, 2 figures, 3 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11189 2026-06-10 cs.LG cs.AI cs.CL 新提交 83%

A Unifying Lens on Supervised Fine-Tuning Through Target Distribution Design

通过目标分布设计审视监督微调的统一视角

Tong Xie, Yuanhao Ban, Yunqi Hong, Sohyun An, Yihang Chen, Cho-Jui Hsieh

机构 * University of California, Los Angeles (UCLA)(加州大学洛杉矶分校) Arena

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文重新解读监督微调为目标分布设计,提出Q-target框架,将监督分解为对观测token的依赖强度与替代token的概率分配,并基于此提出Target-SFT方法,在多个推理任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18765 2026-06-10 cs.RO 版本更新 83%

Goal-oriented Communication for Fast and Robust Robotic Fault Detection and Recovery

面向快速鲁棒机器人故障检测与恢复的目标导向通信

Shutong Chen, Adnan Aijaz, Yansha Deng

机构 * Department of Engineering, King’s College London(伦敦国王学院工程系) Bristol Research and Innovation Laboratory, Toshiba Europe Ltd.(托bsd欧洲有限公司布里斯托尔研究与创新实验室)

专题命中 指令微调 :SLM(abstract,abstract_cn);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 提出目标导向通信框架,通过联合设计通信-计算-控制回路,利用3D场景图检测故障,并微调小语言模型结合知识蒸馏生成恢复动作,实现故障检测与恢复时间降低82.6%,任务成功率提升76%。

Comments Submit to IEEE for potential publication

详情

展开后加载摘要…

URL PDF HTML 收藏