arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-05 至 2026-03-05 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 9 篇

2603.03313 2026-03-05 cs.CL cs.AI 88%

How does fine-tuning improve sensorimotor representations in large language models?

微调如何改善大语言模型中的感知运动表征

Minghua Wu, Javier Conde, Pedro Reviriego, Marc Brysbaert

机构 * Department of Experimental Psychology, Ghent University(实验心理学系,根特大学) Information Processing and Telecommunications Center (IPTC), Universidad Politécnica de Madrid, Spain(信息处理与电信中心(IPTC),马德里理工大学,西班牙)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究通过微调改善大语言模型的感知运动表征,发现其在语言和感知运动维度上具有良好的泛化能力,但对学习目标敏感,无法跨任务格式迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20760 2026-03-05 cs.LG cs.AI cs.CL 86%

Generalization of RLVR Using Causal Reasoning as a Testbed

使用因果推理作为测试平台的RLVR泛化

Brian Lu, Hongyu Zhao, Shuo Sun, Hao Peng, Rui Ding, Hongyuan Mei

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Maryland, College Park(马里兰大学学院公园分校) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research Asia(微软亚洲研究院) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文通过实验证明,RLVR在特定模型规模和训练查询层次下能提升因果推理能力,尤其在复杂查询中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21668 2026-03-05 cs.AI cs.CL cs.SC 82%

R1-Code-Interpreter: LLMs Reason with Code via Supervised and Multi-stage Reinforcement Learning

R1-Code-Interpreter: LLMs通过监督学习和多阶段强化学习进行代码推理

Yongchao Chen, Yueying Liu, Junwei Zhou, Yilun Hao, Jingquan Wang, Yang Zhang, Na Li, Chuchu Fan

机构 * MIT / Harvard(麻省理工学院/哈佛大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan(密歇根大学) MIT(麻省理工学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Harvard(哈佛大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 R1-Code-Interpreter通过监督学习和多阶段强化学习提升LLM的代码推理能力,实现对多样化任务的高效处理,显著提升模型性能。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04128 2026-03-05 cs.CV cs.AI cs.MM 81%

Crab$^{+}$: A Scalable and Unified Audio-Visual Scene Understanding Model with Explicit Cooperation

Crab$^{+}$: 一种可扩展且统一的音频视觉场景理解模型,具有显式合作

Dongnuan Cai, Henghui Du, Chang Zhou, Xi Chen, Dan Guo, Hongyuan Zhang, Xuelong Li, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学耿丽人工智能学院) Institute of Artificial Intelligence of China Telecom (TeleAI)(中国电信人工智能研究院) AI Technology Center, Online Video Business Unit, Tencent PCG(腾讯PCG在线视频业务单元AI技术中心) Hefei University of Technology(合肥工业大学) The University of Hong Kong(香港大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 Crab$^{+}$通过显式合作解决音频视觉任务异质性问题,实现更广泛的任务覆盖和优于单任务模型的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24702 2026-03-05 cs.CL cs.AI 81%

Agent Data Protocol: Unifying Datasets for Diverse, Effective Fine-tuning of LLM Agents

代理数据协议:统一多样化、高效的LLM代理微调数据集

Yueqi Song, Ketan Ramaneti, Zaid Sheikh, Ziru Chen, Boyu Gou, Tianbao Xie, Yiheng Xu, Danyang Zhang, Apurva Gandhi, Fan Yang, Joseph Liu, Tianyue Ou, Zhihao Yuan, Frank Xu, Shuyan Zhou, Xingyao Wang, Xiang Yue, Tao Yu, Huan Sun, Yu Su, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) The Ohio State University(俄亥俄州立大学) University of Hong Kong(香港大学) Duke University(杜克大学) Fujitsu Research(富士通研究) All Hands AI(全手AI)

专题命中 指令微调 :LLM(title);SFT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出代理数据协议(ADP),通过统一多样化代理训练数据集,提升LLM代理微调效果,实现20%的性能提升并在多个基准上达到SOTA水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23783 2026-03-05 stat.ML cs.AI cs.CL cs.LG 80%

Boosting In-Context Learning in LLMs Through the Lens of Classical Supervised Learning

通过经典监督学习视角提升大语言模型的上下文学习

Korel Gundem, Juncheng Dong, Dennis Zhang, Vahid Tarokh, Zhengling Qi

机构 * The George Washington University(乔治华盛顿大学) Duke University(杜克大学) Washington University in St. Louis(华盛顿大学圣路易斯分校)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过经典监督学习视角提出监督校准方法,提升大语言模型上下文学习的性能和决策边界方向调整能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10619 2026-03-05 cs.CV cs.AI 77%

Improving Medical Visual Reinforcement Fine-Tuning via Perception and Reasoning Augmentation

通过感知与推理增强改进医疗视觉强化微调

Guangjing Yang, ZhangYuan Yu, Ziyuan Qin, Xinyuan Song, Huahui Yi, Qingbo Kang, Jun Gao, Yiyue Li, Chenlin Du, Qicheng Lao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Emory University(埃默里大学) Sichuan University(四川大学) Peking University(北京大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本研究提出VRFT-Aug框架,通过增强感知与推理能力,改进医疗影像领域的强化微调效果,提升模型在医学应用中的可靠性与推理能力。

Comments CPAL 2026

Journal ref 2026 Conference on Parsimony and Learning (CPAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03389 2026-03-05 cs.LG 77%

Towards Improved Sentence Representations using Token Graphs

基于令牌图的改进句子表示

Krishna Sri Ipsit Mantri, Carola-Bibiane Schönlieb, Zorah Lähner, Moshe Eliasof

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔人工智能与机器学习研究所) University of Cambridge(剑桥大学) Ben-Gurion University of the Negev(贝内-约尔大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 GLOT通过构建令牌图并利用图神经网络提升句子表示的鲁棒性和效率,适用于冻结LLM的高效适应。

Comments ICLR 2026, 29 Pages, 17 Tables, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03371 2026-03-05 cs.CR cs.AI 77%

Sleeper Cell: Injecting Latent Malice Temporal Backdoors into Tool-Using LLMs

睡眠细胞:将潜在恶意时间后门注入工具使用的大语言模型

Bhanu Pallakonda, Mikkel Hindsbo, Sina Ehsani, Prag Mishra

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI

AI总结 本研究提出SFT-then-GRPO方法,通过多阶段PEFT框架在工具使用LLM中植入隐蔽的恶意后门,揭示了强化学习在掩盖灾难性漏洞中的潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏