arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12393 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12393 篇

2601.16023 2026-01-23 eess.AS cs.HC 85%

Timbre-Aware LLM-based Direct Speech-to-Speech Translation Extendable to Multiple Language Pairs

具有音色感知的基于大语言模型的直接语音到语音翻译系统,可扩展到多种语言对

Lalaram Arya, Mrinmoy Bhattacharjee, Adarsh C. R., S. R. Mahadeva Prasanna

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出DS2ST-LM,一种基于多语言大语言模型的直接语音到语音翻译系统,通过整合Whisper编码器、可学习投影模块和音色感知合成器,实现多语言翻译并提升说话人相似性与语音自然度。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09039 2026-01-15 cs.IT math.IT 85%

An Information-Theoretic Perspective on LLM Tokenizers

从信息论角度审视大语言模型分词器

Mete Erdogan, Abhiram Gorle, Shubham Chandak, Mert Pilanci, Tsachy Weissman

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 从信息论角度研究大语言模型分词器,揭示分词训练规模对熵分布的影响,提出压缩感知BPE变种,并分析分词器在不同领域下的鲁棒性与压缩效率的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13433 2026-01-15 cs.SD eess.AS 85%

MATS: An Audio Language Model under Text-only Supervision

MATS: 一种基于纯文本监督的音频语言模型

Wen Wang, Ruibing Hou, Hong Chang, Shiguang Shan, Xilin Chen

机构 * Key Laboratory of Intelligent Information Processing of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS, China(中国科学院智能信息处理重点实验室(中国科学院)) University of Chinese Academy of Sciences, China(中国科学院大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 MATS通过纯文本监督训练,实现音频理解能力,无需依赖音频数据,展现出与大规模音频-语言对训练模型相当的性能。

Comments Accepted by ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08517 2026-01-14 cs.CV 85%

Closed-Loop LLM Discovery of Non-Standard Channel Priors in Vision Models

闭环大语言模型在视觉模型中发现非标准通道先验

Tolgay Atinc Uzun, Dmitry Ignatov, Radu Timofte

机构 * Computer Vision Lab, CAIDAS \& IFI, University of W\"urzburg, Germany

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出利用大语言模型进行视觉模型通道配置优化,通过生成大量架构数据训练LLM学习通道配置与性能关系,实验表明该方法在CIFAR-100上显著提升准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25531 2026-01-13 cs.CL cs.AI cs.LG 85%

MixtureVitae: Open Web-Scale Pretraining Dataset With High Quality Instruction and Reasoning Data Built from Permissive-First Text Sources

MixtureVitae:基于宽容优先策略构建的开放网络级预训练数据集,包含高质量指令和推理数据

Huu Nguyen, Victor May, Harsh Raj, Marianna Nezhurina, Yishan Wang, Yanqi Luo, Minh Chien Vu, Taishi Nakamura, Ken Tsui, Van Khue Nguyen, David Salinas, Aleksandra Krasnodębska, Christoph Schuhmann, Mats Leon Richter, Xuan-Son, Vu, Jenia Jitsev

专题命中 预训练与数据 :pretraining(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MixtureVitae通过宽容优先策略构建开放预训练数据集,提供高质量指令和推理数据,有效降低法律风险并提升模型性能。

Comments Code: \url{https://github.com/ontocord/mixturevitae}

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24570 2026-01-01 cs.SE 85%

On the Effectiveness of Training Data Optimization for LLM-based Code Generation: An Empirical Study

在LLM基于代码生成中的训练数据优化有效性研究:一项实证研究

Shiqi Kuang, Zhao Tian, Tao Xiao, Dong Wang, Junjie Chen

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究评估了训练数据优化技术对LLM代码生成效果的影响,发现数据合成在提升功能正确性和减少代码异味方面最有效,而数据合成与重构的组合表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20145 2025-12-24 cs.CL cs.AI cs.CV cs.IR cs.LG 85%

Retrieval-augmented Prompt Learning for Pre-trained Foundation Models

基于检索的提示学习用于预训练基础模型

Xiang Chen, Yixin Ou, Quan Feng, Lei Li, Piji Li, Haibo Ye, Sheng-Jun Huang, Shuofei Qiao, Shumin Deng, Huajun Chen, Ningyu Zhang

机构 * MIIT Key Laboratory of Pattern Analysis and Machine Intelligence, College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(信息产业部模式分析与机器智能重点实验室,计算机科学与技术学院,南京航空航天大学) Zhejiang University(浙江大学) Hunan Vanguard Group Corporation Limited(湖南先锋集团有限公司) National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :foundation model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RetroPrompt通过整合检索机制和知识库,提升预训练基础模型在少样本和零样本场景下的泛化能力与记忆平衡。

Comments IEEE/ACM Transactions on Audio, Speech and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19041 2025-12-22 cs.CL cs.AI cs.CV cs.LG cs.MM 85%

LookAhead Tuning: Safer Language Models via Partial Answer Previews

LookAhead Tuning: 通过部分答案预览实现更安全的语言模型

Kangwei Liu, Mengru Wang, Yujie Luo, Lin Yuan, Mengshu Sun, Lei Liang, Zhiqiang Zhang, Jun Zhou, Bryan Hooi, Shumin Deng

机构 * Zhejiang University(浙江大学) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室) Ant Group(蚂蚁集团) National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LookAhead Tuning通过预览部分答案前缀,有效保持语言模型在微调过程中的安全性,同时不损害下游任务的性能。

Comments WSDM 2026 short

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02275 2025-12-03 cs.HC 85%

Understanding Down Syndrome Stereotypes in LLM-Based Personas

理解基于大语言模型的虚拟人物中唐氏综合征刻板印象

Chantelle Wu, Peinan Wang, Nafi Nibras, Meida Li, Dajun Yuan, Zhixiao Wang, Jiahuan He, Mona Ali, Mirjana Prpa

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了基于大语言模型的虚拟人物中唐氏综合征刻板印象的形成与检测,通过访谈揭示训练数据和界面设计对刻板印象的影响,并强调了参与式方法的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11622 2025-11-18 cs.LG cs.AI cs.CL 85%

Small Vocabularies, Big Gains: Pretraining and Tokenization in Time Series Models

Alexis Roger, Gwen Legate, Kashif Rasul, Yuriy Nevmyvaka, Irina Rish

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10098 2025-11-14 cs.CV 85%

MTAttack: Multi-Target Backdoor Attacks against Large Vision-Language Models

Zihan Wang, Guansong Pang, Wenjun Miao, Jin Zheng, Xiao Bai

专题命中 预训练与数据 :language model(title,abstract);instruction tuning(abstract);pretraining(abstract)

Comments AAAI2026, with supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02364 2025-11-05 math.OC 85%

An LLM-powered MILP modelling engine for workforce scheduling guided by expert knowledge

Qingyang Li, Lele Zhang, Vicky Mak-Hau

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07019 2025-10-28 cs.CV 85%

A Vision-Language Foundation Model for Leaf Disease Identification

Khang Nguyen Quoc, Lan Le Thi Thu, Luyl-Da Quach

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20387 2025-10-24 cs.LG cs.AI cs.CL 85%

Relative-Based Scaling Law for Neural Language Models

Baoqing Yue, Jinyuan Zhou, Zixi Wei, Jingtao Zhan, Qingyao Ai, Yiqun Liu

机构 * Tsinghua University(清华大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19488 2025-10-23 cs.CL cs.AI cs.LG 85%

VideoAgentTrek: Computer Use Pretraining from Unlabeled Videos

Dunjie Lu, Yiheng Xu, Junli Wang, Haoyuan Wu, Xinyuan Wang, Zekun Wang, Junlin Yang, Hongjin Su, Jixuan Chen, Junda Chen, Yuchen Mao, Jingren Zhou, Junyang Lin, Binyuan Hui, Tao Yu

机构 * The University of Hong Kong(香港大学) Qwen Team, Alibaba Group(阿里巴巴集团Qwen团队)

专题命中 预训练与数据 :pretraining(title,abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04710 2025-10-22 cs.DC 85%

Exploring Influence Factors on LLM Suitability for No-Code Development of End User IoT Applications

Minghe Wang, Alexandra Kapp, Trever Schirmer, Tobias Pfandzelter, David Bermbach

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08245 2025-10-10 cs.CL cs.AI cs.LG 85%

Contrastive Decoding for Synthetic Data Generation in Low-Resource Language Modeling

Jannek Ulm, Kevin Du, Vésteinn Snæbjarnarson

机构 * ETH Zürich(苏黎世联邦理工学院) University of Copenhagen(哥本哈根大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07841 2025-10-10 cs.LG cs.AI cs.CL 85%

Self-Improving LLM Agents at Test-Time

Emre Can Acikgoz, Cheng Qian, Heng Ji, Dilek Hakkani-Tür, Gokhan Tur

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 预训练与数据 :LLM(title);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06256 2025-10-07 cs.CL cs.AI cs.LG 85%

Unlocking In-Context Learning for Natural Datasets Beyond Language Modelling

Jelena Bratulić, Sudhanshu Mittal, David T. Hoffmann, Samuel Böhm, Robin Tibor Schirrmeister, Tonio Ball, Christian Rupprecht, Thomas Brox

机构 * Computer Vision Group, University of Freiburg(弗赖堡大学计算机视觉组) Neuromedical A.I. Lab, Medical Center -- University of Freiburg(弗赖堡大学医学神经AI实验室) Medical Physics, Medical Center -- University of Freiburg(弗赖堡大学医学物理) Visual Geometry Group, University of Oxford(牛津大学视觉几何组)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Best Paper Honorable Mention at GCPR 2025 (German Conference on Pattern Recognition). This is the updated version submitted to the conference, not the official conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14096 2025-09-26 cs.CV 85%

VideoPASTA: 7K Preference Pairs That Matter for Video-LLM Alignment

Yogesh Kulkarni, Pooyan Fazli

机构 * Arizona State University(亚利桑那州立大学)

专题命中 预训练与数据 :LLM(title);language model(abstract);pretraining(abstract);preference optimization(abstract)

Comments EMNLP 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03303 2025-09-16 cs.CL cs.AI cs.LG 85%

Hopscotch: Discovering and Skipping Redundancies in Language Models

Mustafa Eyceoz, Nikhil Shivakumar Nayak, Hao Wang, Ligong Han, Akash Srivastava

机构 * Red Hat AI Innovation(红帽AI创新)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 10 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04689 2025-09-16 cs.CL cs.AI cs.LG 85%

Recycling the Web: A Method to Enhance Pre-training Data Quality and Quantity for Language Models

Thao Nguyen, Yang Li, Olga Golovneva, Luke Zettlemoyer, Sewoong Oh, Ludwig Schmidt, Xian Li

机构 * FAIR at Meta(Meta 的 FAIR 研究所) University of Washington(华盛顿大学) Stanford University(斯坦福大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08416 2025-09-11 cs.AR 85%

AutoVeriFix: Automatically Correcting Errors and Enhancing Functional Correctness in LLM-Generated Verilog Code

Yan Tan, Xiangchen Meng, Zijun Jiang, Yangdi Lyu

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15860 2025-08-22 cs.CL cs.AI cs.LG 85%

Synthetic vs. Gold: The Role of LLM Generated Labels and Data in Cyberbullying Detection

Arefeh Kazemi, Sri Balaaji Natarajan Kalaivendan, Joachim Wagner, Hamza Qadeer, Kanishk Verma, Brian Davis

机构 * School of Computing, ADAPT Centre, Dublin City University, Dublin, Ireland(计算学院、ADAPT中心、都柏林城市大学、都柏林、爱尔兰)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00920 2025-07-28 cs.LG cs.AI cs.CL 85%

ToolACE: Winning the Points of LLM Function Calling

Weiwen Liu, Xu Huang, Xingshan Zeng, Xinlong Hao, Shuai Yu, Dexun Li, Shuai Wang, Weinan Gan, Zhengying Liu, Yuanqing Yu, Zezhong Wang, Yuxian Wang, Wu Ning, Yutai Hou, Bin Wang, Chuhan Wu, Xinzhi Wang, Yong Liu, Yasheng Wang, Duyu Tang, Dandan Tu, Lifeng Shang, Xin Jiang, Ruiming Tang, Defu Lian, Qun Liu, Enhong Chen

机构 * Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Huawei Technologies Co., Ltd(华为技术有限公司) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 21 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03993 2025-07-21 cs.HC 85%

TR-LLM: Integrating Trajectory Data for Scene-Aware LLM-Based Human Action Prediction

Kojiro Takeyama, Yimeng Liu, Misha Sra

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted to IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21570 2025-06-30 cs.CL cs.AI cs.LG 85%

Random Initialization Can't Catch Up: The Advantage of Language Model Transfer for Time Series Forecasting

Roland Riachi, Kashif Rasul, Arjun Ashok, Prateek Humane, Alexis Roger, Andrew R. Williams, Yuriy Nevmyvaka, Irina Rish

机构 * University of Montreal(蒙特利尔大学) Mila - Québec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学)

专题命中 预训练与数据 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14794 2025-06-19 cs.LG cs.AI cs.CL 85%

Assembly of Experts: Linear-time construction of the Chimera LLM variants with emergent and adaptable behaviors

Henrik Klagges, Robert Dahlke, Fabian Klemm, Benjamin Merkel, Daniel Klingmann, David A. Reiss, Dan Zecha

机构 * TNG Technology Consulting GmbH(TNG技术咨询公司)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19249 2025-05-28 cs.CL cs.AI cs.LG 85%

Between Circuits and Chomsky: Pre-pretraining on Formal Languages Imparts Linguistic Biases

Michael Y. Hu, Jackson Petty, Chuan Shi, William Merrill, Tal Linzen

机构 * Center for Data Science(数据科学中心) Department of Linguistics(语言学系)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13673 2025-05-20 cs.CL cs.AI cs.LG 85%

Physics of Language Models: Part 1, Learning Hierarchical Language Structures

Zeyuan Allen-Zhu, Yuanzhi Li

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Comments V2 polishes writing and adds Appendix G; V3 polishes writing and changes the title; V4 improves writing and adds Appendix H (more uniform attention results)

详情

展开后加载摘要…

URL PDF HTML 收藏