arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11511 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11511 篇

2311.00262 2024-03-12 cs.CL cs.AI 91%

Plug-and-Play Policy Planner for Large Language Model Powered Dialogue Agents

Yang Deng, Wenxuan Zhang, Wai Lam, See-Kiong Ng, Tat-Seng Chua

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Accepted by ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18381 2024-02-29 cs.AI cs.LG cs.NE 91%

Large Language Models As Evolution Strategies

Robert Tjarko Lange, Yingtao Tian, Yujin Tang

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 11 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07505 2023-11-28 cs.LG cs.CL 91%

Data Race Detection Using Large Language Models

Le Chen, Xianzhong Ding, Murali Emani, Tristan Vanderbruggen, Pei-hung Lin, Chuanhua Liao

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.07327 2023-11-01 cs.CL cs.AI 91%

OpenAssistant Conversations -- Democratizing Large Language Model Alignment

Andreas Köpf, Yannic Kilcher, Dimitri von Rütte, Sotiris Anagnostidis, Zhi-Rui Tam, Keith Stevens, Abdullah Barhoum, Nguyen Minh Duc, Oliver Stanley, Richárd Nagyfi, Shahul ES, Sameer Suri, David Glushkov, Arnav Dantuluri, Andrew Maguire, Christoph Schuhmann, Huu Nguyen, Alexander Mattick

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract);RLHF(abstract)

Comments Published in NeurIPS 2023 Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01581 2023-10-04 cs.LG cs.AI cs.CR 91%

On the Safety of Open-Sourced Large Language Models: Does Alignment Really Prevent Them From Being Misused?

Hangfan Zhang, Zhimeng Guo, Huaisheng Zhu, Bochuan Cao, Lu Lin, Jinyuan Jia, Jinghui Chen, Dinghao Wu

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11364 2023-09-29 cs.CL cs.AI 91%

Visualizing Linguistic Diversity of Text Datasets Synthesized by Large Language Models

Emily Reif, Minsuk Kahng, Savvas Petridis

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.03905 2023-09-13 cs.MM cs.CL cs.CV cs.LG cs.SD eess.AS 91%

ImageBind-LLM: Multi-modality Instruction Tuning

Jiaming Han, Renrui Zhang, Wenqi Shao, Peng Gao, Peng Xu, Han Xiao, Kaipeng Zhang, Chris Liu, Song Wen, Ziyu Guo, Xudong Lu, Shuai Ren, Yafei Wen, Xiaoxin Chen, Xiangyu Yue, Hongsheng Li, Yu Qiao

专题命中 指令微调 :LLM(title,abstract);instruction tuning(title,abstract);large language model(abstract);language model(abstract)

Comments Code is available at https://github.com/OpenGVLab/LLaMA-Adapter

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11148 2023-09-06 cs.SE cs.CL cs.LG 91%

LLaMA-Reviewer: Advancing Code Review Automation with Large Language Models through Parameter-Efficient Fine-Tuning

Junyi Lu, Lei Yu, Xiaojia Li, Li Yang, Chun Zuo

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

Comments Accepted to the 34th IEEE International Symposium on Software Reliability Engineering (ISSRE 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.10930 2023-07-27 cs.CL cs.AI 91%

MediaGPT : A Large Language Model For Chinese Media

Zhonghao Wang, Zijia Lu, Bo Jin, Haiying Deng

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.10968 2023-06-22 cs.CL cs.AI 91%

BayLing: Bridging Cross-lingual Alignment and Instruction Following through Interactive Translation for Large Language Models

Shaolei Zhang, Qingkai Fang, Zhuocheng Zhang, Zhengrui Ma, Yan Zhou, Langlin Huang, Mengyu Bu, Shangtong Gui, Yunji Chen, Xilin Chen, Yang Feng

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

Comments Try BayLing's online demo at http://nlp.ict.ac.cn/bayling/demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.16103 2023-05-26 cs.CV cs.AI cs.CL cs.MM 91%

ChatBridge: Bridging Modalities with Large Language Model as a Language Catalyst

Zijia Zhao, Longteng Guo, Tongtian Yue, Sihan Chen, Shuai Shao, Xinxin Zhu, Zehuan Yuan, Jing Liu

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23714 2025-08-15 cs.CL 91%

Building Instruction-Tuning Datasets from Human-Written Instructions with Open-Weight Large Language Models

Youmi Ma, Sakae Mizuki, Kazuki Fujii, Taishi Nakamura, Masanari Ohi, Hinari Shimada, Taihei Shiotani, Koshiro Saito, Koki Maeda, Kakeru Hattori, Takumi Okamoto, Shigeki Ishida, Rio Yokota, Hiroya Takamura, Naoaki Okazaki

机构 * Department of Computer Science, School of Computing, Institute of Science Tokyo(计算机科学系、计算学院、科学东京研究所) National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院) Research and Development Center for Large Language Models, NII(大型语言模型研究与开发中心、日本科学振兴会)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);instruction tuning(abstract)

Comments COLM 2025; Datasets are available at https://huggingface.co/datasets/tokyotech-llm/lmsys-chat-1m-synth

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24824 2026-07-29 cs.IR 新提交 90%

Retrieval-based and Fine-tuned LLM Approaches for Industrial Asset Health Monitoring and Decision Support

基于检索和微调的大语言模型方法用于工业资产健康监测和决策支持

Seshu Kumar Damarla, Xiuli Zhu

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究基于检索和微调的大语言模型方法在工业资产健康监测中的故障传感器诊断推理表现,通过FailureSensorIQ基准测试,发现语义搜索和混合搜索效果好,基于LLM的微调模型性能最佳,且各方法对一些干扰因素敏感。

Comments 6 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25091 2026-07-29 cs.AI cs.CL cs.LG math.OC stat.CO 新提交 90%

Towards Robust Reinforcement Learning for Small-Scale Language Model Agents

迈向用于小规模语言模型智能体的稳健强化学习

Md Rezwanul Haque, Md. Milon Islam, Fakhri Karray

机构 * University of Waterloo(滑铁卢大学) Khulna University of Engineering & Technology(库尔纳工程技术大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 指令微调 :language model(title,abstract);SLM(abstract,abstract_cn);SFT(abstract,abstract_cn);small language model(abstract)

AI总结 研究小规模语言模型强化学习不稳定问题,识别出三种失败模式,提出容量余量假设,采用合并并重新初始化适配器技术等方法,所提系统稳定收敛,提升偏好胜率,优于指令调整基线且减少训练数据。

Comments Proceedings of the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC), Bellevue, WA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06715 2026-07-15 cs.CL cs.AI cs.LG 版本更新 90%

Does Topic Sentiment Cause Perceived Ideology? Comparing Human and LLM Annotations in Political News Articles

主题情感是否导致感知意识形态?比较政治新闻文章中人类与LLM的标注

Upasana Chatterjee

机构 * Columbia University(哥伦比亚大学)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究主题情感对感知政治意识形态的因果效应,通过比较人类与LLM标注,发现微调GPT-4o-mini产生显著因果效应,归因于捷径学习。

Comments V1 accepted to ACL SRW 2026. V2 updates experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17813 2026-07-13 cs.CL cs.AI cs.LG cs.SD 版本更新 90%

Point of Order: Action-Aware LLM Persona Modeling for Data-Grounded Civic Deliberation

秩序点:面向行动的LLM角色建模用于真实市政模拟

Scott Merrill, Shashank Srivastava

专题命中 指令微调 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种可复现的流程,将公开Zoom录像转换为带有角色档案和行动标签的发言转录,通过细调LLM提升角色建模效果,显著降低困惑度并提高模拟真实性和一致性。

Comments 8 pages (39 pages including appendix), 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02523 2026-07-07 cs.DC cs.NI 新提交 90%

Edge-Deployable LLM Fine-Tuning on a Single GPU for Telecom Network Troubleshooting

用于电信网络故障排除的单 GPU 上的边缘可部署大语言模型微调

Chenhua Shi, Bhavika Jalli, John Zou, Gregor Macdonald, Wanlu Lei, Mridul Jain, Joji Philip

专题命中 指令微调 :LLM(title,summary_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究电信边缘站点大语言模型微调,用Unsloth框架进行GPU分析,系统分析多因素对训练稳定性和资源效率的影响,给出推理与非推理模型不同行为,为电信边缘环境LLM微调提供配置指南。

Comments 6 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18487 2026-06-23 cs.LG cs.AI cs.CL 新提交 90%

SFT Overtraining Predicts Rank Inversion via Entropy Collapse Under RLVR

SFT 过训练通过熵崩溃预测 RLVR 下的排名反转

Siddharth Aphale, Kelly Liu

机构 * Stanford University(斯坦福大学)

专题命中 指令微调 :SFT(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现 SFT 过度训练导致 rollout 分布熵降低,使 GRPO 中优势信号消失,从而引发排名反转;提出基于熵的两阶段诊断方法可预警高风险检查点。

Comments Accepted at the Deep Learning for Code (DL4C) Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03573 2026-06-17 cs.CE 版本更新 90%

STRIDE: Post-Training LLMs to Reason and Refine Bio-Sequences via Edit Trajectories

STRIDE: 通过编辑轨迹对生物序列进行后训练推理与优化

Daiheng Zhang, Shiyang Zhang, Sizhuang He, Yangtian Zhang, Syed Asad Rizvi, David van Dijk

专题命中 指令微调 :LLM(summary_cn,abstract);post-training(title,abstract);SFT(abstract,abstract_cn)

AI总结 提出STRIDE框架,通过后训练使LLM生成可执行的插入/删除/替换轨迹,结合监督微调和策略优化实现离散生物序列的迭代优化,在蛋白质和分子编辑任务上显著提升成功率和新颖性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28860 2026-06-16 cs.LG cs.AI cs.CL cs.CR 版本更新 90%

Mechanistic origins of catastrophic forgetting: why RL preserves circuits better than SFT?

灾难性遗忘的机制起源:为什么RL比SFT更好地保留电路?

Jeanmely Rojas Nunez, Viraj Sawant, Nathan Allen, Nomgondalai Amgalanbaatar, Yannis Zongo, Vasu Sharma, Maheep Chaudhary

机构 * University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) University of Toronto(多伦多大学)

专题命中 指令微调 :SFT(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过引入差异电路脆弱性指标,研究比较了强化学习与监督微调在大型语言模型微调中对内部计算电路的保留程度,发现RL虽任务适应较慢但能更好保留电路,从而减轻灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05106 2026-06-15 cs.AI cs.CL cs.LG 版本更新 90%

Token-Level LLM Collaboration via FusionRoute

通过融合路由实现令牌级LLM协作

Nuoya Xiong, Yuhang Zhou, Hanqing Zeng, Zhaorun Chen, Furong Huang, Shuchao Bi, Lizhu Zhang, Zhuokai Zhao

机构 * [cs.AI](计算机科学与人工智能)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出FusionRoute框架,通过轻量级路由器在解码步骤中选择最合适的专家并补充对数几率以优化下一个令牌分布,解决了单个通用模型在多个领域表现不佳的问题,同时在多个基准测试中优于其他方法。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04998 2026-05-20 cs.LG cs.AI cs.CL 90%

Learning Rate Matters: Vanilla LoRA May Suffice for LLM Fine-tuning

学习率至关重要:Vanilla LoRA可能足以用于LLM微调

Yu-Ang Lee, Ching-Yun Ko, Pin-Yu Chen, Mi-Yen Yeh

机构 * National Taiwan University(国立台湾大学) IBM Research(IBM研究院) Academia Sinica(台湾“学术院”)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过广泛的超参数搜索重新评估了九种代表性的LoRA变体和Vanilla LoRA,在数学推理、常识推理、代码生成和指令遵循等任务上,发现不同的LoRA方法偏好不同的学习率范围。当学习率正确调整时,所有方法都能达到相似的峰值性能,这表明Vanilla LoRA仍然是一个有竞争力的基线,而单一训练配置下的改进可能并不反映一致的方法优势。

Comments Project page: https://github.com/yuang-lee/lr-matters-lora

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15589 2026-04-20 cs.CL cs.AI cs.LG 90%

LLM attribution analysis across different fine-tuning strategies and model scales for automated code compliance

跨不同微调策略和模型规模的大型语言模型可解释性分析用于自动化代码合规

Jack Wei Lun Shi, Minghao Dang, Wawan Solihin, Justin K. W. Yeoh

机构 * Department of Civil and Environmental Engineering, National University of Singapore(新加坡国立大学土木与环境工程系) School of Transportation Science and Engineering, Harbin Institute of Technology(哈尔滨工业大学交通运输科学与工程学院) Research and Innovation, NovaCITYNETS Pte.Ltd.(NovaCITYNETS Pte.Ltd.研究与创新部)

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过扰动分析比较不同微调策略和模型规模下LLM的可解释行为,发现全微调产生更聚焦的属性模式,且模型规模增大时,LLM发展出优先考虑数值约束和规则标识符的策略,但语义相似度在7B以上模型中趋于平稳。

Comments 8 pages, 9 figures. Accepted at ICCCBE 2026 (International Conference on Computing in Civil and Building Engineering)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00018 2025-07-08 cs.LG cs.AI cs.CL 90%

Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections

Bo Wang, Qinyuan Cheng, Runyu Peng, Rong Bao, Peiji Li, Qipeng Guo, Linyang Li, Zhiyuan Zeng, Yunhua Zhou, Xipeng Qiu

机构 * School of Computer Science, Fudan University(复旦大学计算机学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 指令微调 :SFT(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15685 2024-04-17 cs.CL cs.AI cs.LG 90%

What Makes Good Data for Alignment? A Comprehensive Study of Automatic Data Selection in Instruction Tuning

Wei Liu, Weihao Zeng, Keqing He, Yong Jiang, Junxian He

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments ICLR2024 Camera Ready. Data and model checkpoints are available at https://github.com/hkust-nlp/deita

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14252 2024-03-22 cs.CL cs.AI cs.CV cs.LG 90%

LayoutLLM: Large Language Model Instruction Tuning for Visually Rich Document Understanding

Masato Fujitake

专题命中 指令微调 :language model(title,abstract);large language model(title);instruction tuning(title);分类 cs.CL、cs.AI、cs.LG

Comments LREC-COLING 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.03267 2024-03-13 cs.RO cs.CV 90%

Prompter: Utilizing Large Language Model Prompting for a Data Efficient Embodied Instruction Following

Yuki Inoue, Hiroki Ohashi

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);prompting(title)

Comments 8 pages, 3 figures, rejected by IROS2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12962 2023-10-20 cs.CL cs.AI cs.LG 90%

An Emulator for Fine-Tuning Large Language Models using Small Language Models

Eric Mitchell, Rafael Rafailov, Archit Sharma, Chelsea Finn, Christopher D. Manning

专题命中 指令微调 :language model(title,abstract);large language model(title);small language model(title);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04450 2026-04-07 cs.CL cs.AI 90%

Conversational Control with Ontologies for Large Language Models: A Lightweight Framework for Constrained Generation

基于本体的大型语言模型对话控制:一种轻量级框架用于受约束生成

Barbara Gendron, Gaël Guibon, Mathieu d'Aquin

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.AI

AI总结 本文提出一种轻量级框架,通过对话相关本体定义实现对LLM输出的模块化和可解释控制,通过建模关键方面作为约束并微调LLM,提升对话生成的可控性和可解释性。

Comments Accepted at KG & LLM: Knowledge Graphs and Large Language Models LREC 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11510 2026-08-13 q-bio.NC cs.AI 新提交 90%

Conflict and Congruency Effects in Large Language Models: In-Weight and In-Context Competition in a Verbal Conflict Task

大语言模型中的冲突与一致性效应:言语冲突任务中的权重内与上下文内竞争

Xiaoyang Hu, Mike Angstadt, Shane Storks, Zan Huang, Aman Taxali, Alex Weigard, Richard L. Lewis, Chandra Sripada

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 本研究通过言语冲突任务,探究LLM中一致性效应的机制,发现其源于权重内默认映射与上下文内规则映射的竞争,为分析此类响应竞争提供了模型系统。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏