arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11567 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11567 篇

2310.10449 2023-10-19 cs.CL cs.AI cs.LG 89%

Text Summarization Using Large Language Models: A Comparative Study of MPT-7b-instruct, Falcon-7b-instruct, and OpenAI Chat-GPT Models

Lochan Basyal, Mihir Sanghvi

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 4 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07074 2023-08-16 cs.CL cs.AI cs.LG 89%

#InsTag: Instruction Tagging for Analyzing Supervised Fine-tuning of Large Language Models

Keming Lu, Hongyi Yuan, Zheng Yuan, Runji Lin, Junyang Lin, Chuanqi Tan, Chang Zhou, Jingren Zhou

专题命中 指令微调 :language model(title,abstract);large language model(title);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13292 2023-05-24 cs.CV 89%

VideoLLM: Modeling Video Sequence with Large Language Models

Guo Chen, Yin-Dong Zheng, Jiahao Wang, Jilan Xu, Yifei Huang, Junting Pan, Yi Wang, Yali Wang, Yu Qiao, Tong Lu, Limin Wang

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11715 2026-06-17 cs.LG cs.CL 版本更新 89%

DICE: Diffusion Large Language Models Excel at Generating CUDA Kernels

DICE:扩散大语言模型在生成CUDA内核方面表现出色

Haolei Bai, Lingcheng Kong, Xueyi Chen, Jianmian Wang, Zhiqiang Tao, Huan Wang

机构 * Westlake University(西湖大学) Hong Kong University of Science and Technology(香港科技大学) Rochester Institute of Technology(罗切斯特理工学院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG;LLM(comments)

AI总结 提出CuKe数据集和BiC-RL训练框架,构建DICE系列扩散大语言模型(1.7B/4B/8B),在KernelBench上显著优于同类自回归和扩散模型,实现CUDA内核生成新SOTA。

Comments v2: Expanded with dLLM vs. autoregressive LLM comparisons, ablation studies, and qualitative case studies

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03665 2024-12-06 cs.CV cs.AI cs.CL cs.MM 89%

Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis

Davide Bucciarelli, Nicholas Moratelli, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI;foundation model(comments)

Comments ECCV 2024 Workshop on Green Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03495 2024-11-07 cs.CL cs.AI 89%

Automatic Generation of Question Hints for Mathematics Problems using Large Language Models in Educational Technology

Junior Cedric Tonga, Benjamin Clement, Pierre-Yves Oudeyer

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI;foundation model(comments)

Comments Accepted at NeurIPS 2024 Workshop on Large Foundation Models for Educational Assessment (FM-Assess)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08636 2026-08-12 cs.CL 版本更新 89%

InternAgentHarness: A Scalable Synthetic Environment for Enhancing LLM Agentic Abilities

InternBootcamp 技术报告:通过可验证的任务扩展提升大语言模型推理能力

Xiaozhe Li, Yongkang Chen, Shujian Deng, Peiji Li, Yichuan Ma, Huaxi Huang, Qiye Cai, Tianyi Lyu, Le Ma, Linyang Li, Qipeng Guo, Dahua Lin, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出InternBootcamp框架,通过可验证的任务扩展方法提升大语言模型的推理能力,为基于强化学习的模型优化、合成数据生成和模型评估提供了基础设施。

Comments InternAgentHarness tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27752 2026-08-10 cs.AI 版本更新 89%

Same Answer, Different Confidence: Protocol Sensitivity in LLM Confidence Calibration

询问是不够的:LLM 置信度校准中的协议敏感性

Hankyeol Kim, Pilsung Kang

机构 * Seoul National University(首尔国立大学)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.AI

AI总结 研究通过改变测量协议(如条件上下文、令牌读取方式)发现,LLM 的令牌概率置信度与口头置信度之间的比较高度敏感,且口头置信度不仅反映正确性还反映答案的合理性和来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26023 2026-07-29 cs.AI 新提交 89%

CHARM: A Multimodal Graph Foundation Model with Hierarchical Context Modeling for Zero-Shot Transfer

CHARM:一种用于零样本迁移的具有分层上下文建模的多模态图基础模型

Ankang Yang, Jitao Zhao, Di Jin, Yuxiao Huang, Dongxiao He

机构 * School of Computer Science and Technology, College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部计算机科学与技术学院) Data Science Program, Columbian College of Arts and Sciences, The George Washington University(乔治华盛顿大学文理学院哥伦比亚艺术与科学学院数据科学项目)

专题命中 指令微调 :foundation model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究多模态图零样本迁移问题,提出CHARM模型,通过分层上下文建模,用图上下文替换原始节点,减少对目标域监督或适配的依赖,经实验验证该模型在零样本多模态图任务上有改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22205 2026-07-29 cs.CV cs.AI 版本更新 89%

Filling Before Advancing: Capability-Gap-Driven Post-Training for Scenario-Specialized Remote Sensing MLLMs

推进前填充:能力差距驱动的场景专用遥感多模态大语言模型的训练后处理

Yuheng Zong, Minghua Wang, Xin Zhao, Zhi-Hui Zhan, Antonio Plaza, Jon Atli Benediktsson

专题命中 指令微调 :post-training(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对地球观测应用中遥感多模态大语言模型因高质量数据稀缺和能力覆盖不完整难以实现细粒度场景专业化的问题,提出能力差距驱动的推进前填充(FBA)方法,经实验验证其效果优于其他方法,提升了模型在相关基准上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10887 2026-07-02 cs.CR cs.AI 版本更新 89%

Hey, That's My Model! Introducing Chain & Hash, An LLM Fingerprinting Technique

嘿,那是我的模型!引入链与哈希,一种大语言模型指纹识别技术

Mark Russinovich, Yanan Cai, Ahmed Salem

机构 * Microsoft(微软)

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种基于链与哈希的LLM指纹识别框架,通过加密绑定提示与响应防止碰撞,并利用随机填充和元提示配置增强鲁棒性,实现可验证的所有权证明。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30140 2026-06-30 q-bio.GN cs.CL 89%

DNA Language Models: An Assessment of Pre-Training for Fine-Tuning Tasks

DNA语言模型:面向微调任务的预训练评估

Romain Karpinsky, Julien Mozziconacci, Mickaël Delcey

机构 * CNRS(法国国家科学研究中心) LORIA(洛林大学)

专题命中 指令微调 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);foundation model(abstract)

AI总结 本研究系统比较了基于Transformer和卷积的DNA语言模型在微调任务上的表现,评估了预训练的实际贡献以及BPE分词对基因组学任务的影响。

Comments 12 pages, 2 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24064 2026-06-24 cs.AI 新提交 89%

Beyond Trajectory Imitation: Strategy-Guided Policy Optimization for LLM Reasoning

超越轨迹模仿:策略引导的策略优化用于大语言模型推理

Tianyuan Shi, Canbin Huang, Bei Li, Xin Chen, Xiaojun Quan, Jingang Wang, Qifan Wang

机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(中山大学计算机科学与工程学院) Meituan, Inc., China(美团) Shenzhen Loop Area Institute, China(深圳环区研究所) Meta AI, USA(Meta AI)

专题命中 指令微调 :LLM(title,summary_cn);SFT(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 提出策略引导的策略优化(SGPO),通过可重用策略蒸馏替代实例级轨迹模仿,利用前向KL散度和自适应加权提升LLM推理泛化能力,在数学基准上平均提升2.2分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12882 2026-06-12 cs.AI 新提交 89%

HarnessBridge: Learnable Bidirectional Controller for LLM Agent Harness

HarnessBridge: 用于LLM智能体框架的可学习双向控制器

Xiaoxuan Wang, Haixin Wang, Alexander Taylor, Jason Cong, Yizhou Sun, Wei Wang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 提出HarnessBridge,一种轻量级可学习框架控制器,通过双向投影参数化智能体-环境接口,减少令牌使用和轨迹长度,并泛化到更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00494 2026-06-03 cs.LG 89%

ProjQ: Project-and-Quantize for Adapter-Aware LLM Compression

ProjQ:面向适配器感知的大语言模型压缩的投影与量化

Wenya Yu, Chao Zhang, Li Wang, Samson Lasaulce, Merouane Debbah

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出ProjQ框架,通过正交子空间投影将量化噪声约束到低秩流形,利用交替算法将主导误差卸载给适配器,实现更优的量化误差补偿和下游任务微调。

Comments Acceppted paper in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01137 2026-06-01 cs.LG 89%

Re-examining Low Rank adaptation for private LLM fine-tuning

重新审视用于私有LLM微调的低秩适应

Ali Dadsetan, Frank Rudzicz

机构 * Dalhousie University(达尔豪斯大学) Vector Institute(向量研究所)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究差分隐私SGD中噪声导致的梯度奇异值膨胀问题,提出通过部分恢复原始奇异值分布来提升DP-SGD的样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22655 2026-05-28 cs.AI cs.CV cs.MM 89%

Text-Only Data Synthesis for Vision Language Model Training

仅文本数据合成用于视觉语言模型训练

Xiaomin Yu, Wenjie Zhang, Ziyue Qiao, Chengwei Qin, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Great Bay University(大湾大学)

专题命中 指令微调 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);pretraining(abstract)

AI总结 提出一个跨集成的三阶段多模态数据合成框架,仅从文本生成高质量多模态训练数据,用于视觉语言模型的预训练和指令微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23969 2026-05-26 cs.CL 89%

SLAP: Stratified Loss-based Pruning for On-Policy Data-Efficient Instruction Tuning

SLAP: 基于分层损失剪枝的在线策略数据高效指令微调

Run Zou, Jianhang Ding, Yifan Ding, Wen Wu, Hao Chen, Renshu Gu

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团) Hangzhou Lingju Intelligence AI Lab(杭州灵居智能AI实验室) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 指令微调 :instruction tuning(title,abstract);LLM(summary_cn);large language model(abstract);language model(abstract)

AI总结 提出SLAP框架,通过分布感知分层采样和相对距离优化实现批次级数据选择,在减少20-40%训练数据的同时保持或提升LLM性能。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16274 2026-05-19 cs.HC cs.AI 89%

ChartDesign: Towards LLM Designer of Data Visualization

ChartDesign: 向数据可视化设计的LLM设计师迈进

Mohammed Afaan Ansari, Aniruddh Bansal, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ChartDesign,利用大语言模型生成数据可视化设计属性,提升图表设计性能,实现84%的准确率,并在未见领域中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20863 2026-05-12 cs.CL 89%

GIFT: Guided Importance-Aware Fine-Tuning for Diffusion Language Models

GIFT: 用于扩散语言模型的引导重要性感知微调

Guowei Xu, Wenxin Xu, Jiawang Zhao, Kaisheng Ma

机构 * Institute for Interdisciplinary Information Sciences(交叉信息科学研究院)

专题命中 指令微调 :SFT(summary_cn,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出GIFT方法,通过根据熵分配不同重要性权重来优化扩散语言模型的微调,从而在多个基准测试中优于标准SFT。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07977 2026-05-11 cs.LG 89%

Self-Play Enhancement via Advantage-Weighted Refinement in Online Federated LLM Fine-Tuning with Real-Time Feedback

通过优势加权细化的自我扮演增强在线联邦大语言模型微调与实时反馈

Seohyun Lee, Wenzhi Fang, Dong-Jun Han, Seyyedali Hosseinalipour, Christopher G. Brinton

机构 * Purdue University(普渡大学) Yonsei University(延世大学) University at Buffalo-SUNY(布法罗大学-苏尼扬大学)

专题命中 指令微调 :LLM(title,summary_cn);foundation model(abstract);分类 cs.LG

AI总结 本文提出SPEAR算法,通过反馈引导的自我扮演循环生成对比对,利用标准最大似然和置信度加权不似然训练,在无需昂贵组生成和真实上下文的情况下实现高效的在线联邦LLM微调。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20426 2026-04-30 cs.AI 89%

Learning to Rewrite Tool Descriptions for Reliable LLM-Agent Tool Use

学习重写工具描述以实现可靠的LLM-代理工具使用

Ruocheng Guo, Kaiwen Dong, Xiang Gao, Kamalika Das

机构 * Intuit AI Research(Intuit AI研究院)

专题命中 指令微调 :LLM(title,title_cn);prompting(abstract);分类 cs.AI

AI总结 本文提出Trace-Free+框架,通过渐进式转移监督从轨迹丰富设置到轨迹自由部署,提升代理在大规模工具库中的鲁棒性与泛化能力,同时提高查询成功率。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19060 2026-04-22 cs.AI 89%

Reinforcement Learning Improves LLM Accuracy and Reasoning in Disease Classification from Radiology Reports

强化学习提升LLM在放射学报告疾病分类中的准确性和推理能力

Yishu Wei, Yi Lin, Adam Flanders, George Shih, Yifan Peng

机构 * Department of Population Health Sciences, Weill Cornell Medicine, New York, NY(人口健康科学系,韦尔·柯林斯医学中心,纽约,NY) Department of Radiology, Weill Cornell Medicine, New York, NY(放射科,韦尔·柯林斯医学中心,纽约,NY) Department of Radiology, Thomas Jefferson University, Philadelphia, PA(放射科,托马斯·杰斐逊大学,费城,PA)

专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出两阶段方法,通过监督微调优化疾病标签,再用GRPO提升预测准确性与格式,增强推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18489 2026-04-21 cs.SD cs.CL eess.AS 89%

Aligning Language Models for Lyric-to-Melody Generation with Rule-Based Musical Constraints

基于规则的音乐约束对齐语言模型用于歌词到旋律生成

Hao Meng, Siyuan Zheng, Shuran Zhou, Qiangqiang Wang, Yang Song

机构 * Zuoyebang Education Technology(中关村教育科技)

专题命中 指令微调 :language model(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);preference optimization(abstract)

AI总结 本文提出基于规则的音乐约束对齐框架,通过DPO和KTO优化减少旋律生成中的约束违规,提升音乐性和连贯性。

Comments Accepted by IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00761 2026-04-21 cs.LG 89%

Downgrade to Upgrade: Optimizer Simplification Enhances Robustness in LLM Unlearning

降级到升级:优化器简化增强了大语言模型去学习的鲁棒性

Yicheng Lang, Yihua Zhang, Chongyu Fan, Changsheng Wang, Jinghan Jia, Sijia Liu

机构 * The OPTML Lab, Dept. CSE, Michigan State University(奥普特ML实验室,计算机科学与工程系,密歇根州立大学) MIT-IBM Watson AI Lab, IBM Research(MIT-IBM沃森人工智能实验室,IBM研究院)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文研究优化器对大语言模型去学习鲁棒性的影响,发现降级优化器能提升鲁棒性,提出混合优化器提升去学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16333 2026-04-14 cs.CV cs.LG 89%

RL makes MLLMs see better than SFT

强化学习使多模态大语言模型比监督微调看得更清楚

Junha Song, Sangdoo Yun, Dongyoon Han, Jaegul Choo, Byeongho Heo

机构 * NAVER AI Lab(NAVER AI实验室)

专题命中 指令微调 :SFT(title,abstract);LLM(abstract);language model(abstract);pretraining(abstract)

AI总结 本文研究了强化学习在多模态大语言模型中的视觉编码器影响,发现RL能产生更精确的视觉表示,提出PIVOT方法提升视觉编码性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07754 2026-04-10 cs.CR cs.CL 89%

The Art of (Mis)alignment: How Fine-Tuning Methods Effectively Misalign and Realign LLMs in Post-Training

对齐的艺术:细调方法如何有效地对齐和重新对齐训练后的LLM

Rui Zhang, Hongwei Li, Yun Shen, Xinyue Shen, Wenbo Jiang, Guowen Xu, Yang Liu, Michael Backes, Yang Zhang

机构 * University of Electronic Science and Technology of China(电子科技大学) Flexera CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心) Nanyang Technological University(南洋理工大学)

专题命中 指令微调 :post-training(title);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究探讨细调方法在对齐和重新对齐LLM中的效果,揭示攻击与防御间的机制不对称,发现ORPO在对齐方面最有效,DPO在重新对齐中表现优异但牺牲了模型实用性,同时发现模型特定的抗性及多轮对抗动态的残留效应。

Comments Accepted by ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28191 2026-03-31 cs.CL 89%

DongYuan: An LLM-Based Framework for Integrative Chinese and Western Medicine Spleen-Stomach Disorders Diagnosis

东元:一种基于大语言模型的整合中西医脾胃疾病诊断框架

Hua Li, Yingying Li, Xiaobin Feng, Xinyi Fu, Lifeng Dong, Qingfeng Yang, Yanzhe Chen, Xiaoju Feng, Zhidong Cao, Jianbin Guo, Yanru Du

机构 * Beijing Wenge Technology Co., Ltd.(北京文歌科技有限公司) Hebei Provincial Hospital of Traditional Chinese Medicine(河北省中医院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tianjin University(天津大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出东元框架,通过构建三个中西医脾胃疾病数据集,开发核心诊断LLM和咨询导航模型,建立评估基准,显著提升中西医脾胃疾病诊断性能。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11193 2026-03-13 cs.CL 89%

DeReason: A Difficulty-Aware Curriculum Improves Decoupled SFT-then-RL Training for General Reasoning

DeReason: 一种考虑难度的课程改进了解耦的SFT-然后-RL训练以促进一般推理

Hanxu Hu, Yuxuan Wang, Maggie Huan, Jannis Vamvas, Yinya Huang, Zhijiang Guo, Rico Sennrich

机构 * University of Zurich(苏黎世大学) University of Pennsylvania(宾夕法尼亚大学) ETH Zurich(苏黎世联邦理工学院) HKUST (GZ)(香港科技大学(广州))

专题命中 指令微调 :SFT(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 DeReason通过基于难度的数据解耦策略,优化SFT与RL的训练分配,提升一般推理能力。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07230 2025-10-21 cs.CL 89%

Customer-R1: Personalized Simulation of Human Behaviors via RL-based LLM Agent in Online Shopping

Ziyi Wang, Yuxuan Lu, Yimeng Zhang, Jing Huang, Dakuo Wang

机构 * Northeastern University(东北大学) Michigan State University(密歇根州立大学) Amazon(亚马逊)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏