arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138434 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12365 篇

2505.21138 2025-06-17 cs.CL cs.SD eess.AS 85%

Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis

Tianyi Xu, Hongjie Chen, Wang Qing, Lv Hang, Jian Kang, Li Jie, Zhennan Lin, Yongxiang Li, Xie Lei

机构 * Institute of Artificial Intelligence (TeleAI)(人工智能研究所(TeleAI))

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12161 2025-06-17 cs.LG stat.ML 85%

Meta-Learning and Synthetic Data for Automated Pretraining and Finetuning

Fabio Ferreira

专题命中 预训练与数据 :pretraining(title);large language model(abstract);language model(abstract);foundation model(abstract)

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10737 2025-06-13 cs.CL cs.IR 85%

TaxoAdapt: Aligning LLM-Based Multidimensional Taxonomy Construction to Evolving Research Corpora

Priyanka Kargupta, Nan Zhang, Yunyi Zhang, Rui Zhang, Prasenjit Mitra, Jiawei Han

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted to ACL 2025 Main Conference. Code available at: https://github.com/pkargupta/taxoadapt

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10312 2025-06-13 eess.AS cs.CL cs.SD 85%

AC/DC: LLM-based Audio Comprehension via Dialogue Continuation

Yusuke Fujita, Tomoya Mizumoto, Atsushi Kojima, Lianbo Liu, Yui Sudo

机构 * SB IntuitionsJapan(SB Intuitions日本)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);instruction tuning(abstract)

Comments Accepted to Interspeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12658 2025-06-11 cs.CL 85%

R.R.: Unveiling LLM Training Privacy through Recollection and Ranking

Wenlong Meng, Zhenyuan Guo, Lenan Wu, Chen Gong, Wenyan Liu, Weixian Li, Chengkun Wei, Wenzhi Chen

机构 * Zhejiang University(浙江大学) University of Virginia(弗吉尼亚大学) Ant Group(蚂蚁集团)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 13 pages, 9 figures; typos corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05952 2025-06-10 cs.CV cs.CL 85%

Scalable Vision Language Model Training via High Quality Data Curation

Hongyuan Dong, Zijian Kang, Weijie Yin, Xiao Liang, Chao Feng, Jiao Ran

机构 * ByteDance Douyin Content Group(字节跳动抖音内容团队)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);SFT(abstract);分类 cs.CL

Comments ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02592 2025-06-04 cs.CL 85%

Beyond the Surface: Measuring Self-Preference in LLM Judgments

Zhi-Yuan Chen, Hao Wang, Xinyu Zhang, Enrui Hu, Yankai Lin

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学首都人工智能学院) Huawei Poisson Lab(华为Poisson实验室) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理重点实验室)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01814 2025-06-03 cs.CL cs.SI 85%

Analysis of LLM Bias (Chinese Propaganda & Anti-US Sentiment) in DeepSeek-R1 vs. ChatGPT o3-mini-high

PeiHsuan Huang, ZihWei Lin, Simon Imbot, WenCheng Fu, Ethan Tu

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13917 2025-06-03 cs.CL 85%

TESS 2: A Large-Scale Generalist Diffusion Language Model

Jaesung Tae, Hamish Ivison, Sachin Kumar, Arman Cohan

机构 * Yale University(耶鲁大学) University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院) The Ohio State University(俄亥俄州立大学)

专题命中 预训练与数据 :language model(title,abstract);instruction tuning(abstract);pretraining(abstract);分类 cs.CL

Comments ACL 2025 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24263 2025-06-02 cs.CL 85%

Simulating Training Data Leakage in Multiple-Choice Benchmarks for LLM Evaluation

Naila Shafirni Hidayat, Muhammad Dehan Al Kautsar, Alfan Farizki Wicaksono, Fajri Koto

机构 * Faculty of Computer Science, Universitas Indonesia(印度尼西亚大学计算机科学学院) Department of Natural Language Processing, MBZUAI(MBZUAI自然语言处理部门)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15712 2025-06-02 cs.CL cs.HC 85%

Contrastive Learning for Task-Independent SpeechLLM-Pretraining

Maike Züfle, Jan Niehues

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11441 2025-05-29 cs.CL 85%

Which Retain Set Matters for LLM Unlearning? A Case Study on Entity Unlearning

Hwan Chang, Hwanhee Lee

机构 * Department of Artificial Intelligence, Chung-Ang University, Seoul, Korea(人工智能系, Chung-Ang 大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20380 2025-05-28 cs.LG 85%

GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining

Simin Fan, Maria Ios Glarou, Martin Jaggi

机构 * EPFL(瑞士联邦理工学院)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20023 2025-05-27 cs.CL 85%

Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking

Yihan Chen, Benfeng Xu, Xiaorui Wang, Yongdong Zhang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Metastone Technology(Metastone技术公司)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17410 2025-05-26 cs.SD cs.CL eess.AS 85%

LLM-based Generative Error Correction for Rare Words with Synthetic Data and Phonetic Context

Natsuo Yamashita, Masaaki Yamamoto, Hiroaki Kokubo, Yohei Kawaguchi

机构 * Hitachi, Litd.Japan(日本日立公司)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted by INTERSPEECH 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11726 2025-05-21 cs.CL cs.HC 85%

Revealing and Mitigating the Challenge of Detecting Character Knowledge Errors in LLM Role-Playing

Wenyuan Zhang, Shuaiyi Nie, Jiawei Sheng, Zefeng Zhang, Xinghua Zhang, Yongquan He, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Alibaba Inc.(阿里巴巴公司) Meituan Inc.(美团公司)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 25 pages, 6 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12031 2025-05-20 cs.AI 85%

LLM-based Automated Theorem Proving Hinges on Scalable Synthetic Data Generation

Junyu Lai, Jiakun Zhang, Shuo Xu, Taolue Chen, Zihang Wang, Yao Yang, Jiarui Zhang, Chun Cao, Jingwei Xu

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01052 2025-05-14 cs.LG 85%

ALinFiK: Learning to Approximate Linearized Future Influence Kernel for Scalable Third-Party LLM Data Valuation

Yanzhou Pan, Huawei Lin, Yide Ran, Jiamin Chen, Xiaodong Yu, Weijie Zhao, Denghui Zhang, Zhaozhuo Xu

机构 * Google LLC(谷歌公司) Rochester Institute of Technology(罗切斯特理工学院) Stevens Institute of Technology(史蒂文斯理工学院) Northeastern University(东北大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments Proceedings of the NAACL 2025. Keywords: Influence Function, Data Valuation, Influence Estimation. https://aclanthology.org/2025.naacl-long.589/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07609 2025-05-13 eess.AS cs.LG cs.SD 85%

TACOS: Temporally-aligned Audio CaptiOnS for Language-Audio Pretraining

Paul Primus, Florian Schmid, Gerhard Widmer

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments submitted to the IEEE Workshop on Applications of Signal Processing to Audio and Acoustics (WASPAA), 2025. Dataset (Zenodo): https://zenodo.org/records/15379789, Implementation (GitHub): https://github.com/OptimusPrimus/tacos

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04996 2025-05-09 cs.CL 85%

Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models

Weixin Liang, Lili Yu, Liang Luo, Srinivasan Iyer, Ning Dong, Chunting Zhou, Gargi Ghosh, Mike Lewis, Wen-tau Yih, Luke Zettlemoyer, Xi Victoria Lin

专题命中 预训练与数据 :foundation model(title);large language model(abstract);language model(abstract);pretraining(abstract)

Comments Accepted to TMLR 2025; 48 pages

Journal ref Transactions on Machine Learning Research (2025), ISSN: 2835-8856

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03196 2025-05-07 cs.NI cs.AI 85%

A Trustworthy Multi-LLM Network: Challenges,Solutions, and A Use Case

Haoxiang Luo, Gang Sun, Yinqiu Liu, Dusit Niyato, Hongfang Yu, Mohammed Atiquzzaman, Schahram Dustdar

机构 * University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) University of Oklahoma(俄克拉荷马大学) TU Wien(维也纳技术大学) Universitat Pompeu Fabra(庞培法布拉大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00030 2025-05-02 cs.CL 85%

Can Language Models Represent the Past without Anachronism?

Ted Underwood, Laura K. Nelson, Matthew Wilkens

机构 * School of Information Sciences, University of Illinois(伊利诺伊大学信息科学学院) Department of Sociology, University of British Columbia(不列颠哥伦比亚大学社会学系) Department of Information Science, Cornell University(康奈尔大学信息科学系)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08563 2025-04-29 cs.AI cs.CY stat.AP 85%

Vox Populi, Vox AI? Using Language Models to Estimate German Public Opinion

Leah von der Heyde, Anna-Carolina Haensch, Alexander Wenz

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI

Journal ref Social Science Computer Review (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18106 2025-04-28 cs.CL 85%

Comparative Study on the Discourse Meaning of Chinese and English Media in the Paris Olympics Based on LDA Topic Modeling Technology and LLM Prompt Engineering

Yinglong Yu, Zhaopu Yao, Fang Yuan

机构 * Communication University of China(中国传媒大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15548 2025-04-23 cs.CL cs.CY 85%

LLM-based Semantic Augmentation for Harmful Content Detection

Elyas Meguellati, Assaad Zeghina, Shazia Sadiq, Gianluca Demartini

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01534 2025-04-03 cs.CL 85%

Context-Aware Toxicity Detection in Multiplayer Games: Integrating Domain-Adaptive Pretraining and Match Metadata

Adrien Schurger-Foy, Rafal Dariusz Kocielnik, Caglar Gulcehre, R. Michael Alvarez

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11425 2025-03-25 cs.AI 85%

Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training

Siyu Yuan, Zehui Chen, Zhiheng Xi, Junjie Ye, Zhengyin Du, Jiecao Chen

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);language agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19482 2025-03-21 cs.LG 85%

Measuring memorization in language models via probabilistic extraction

Jamie Hayes, Marika Swanberg, Harsh Chaudhari, Itay Yona, Ilia Shumailov, Milad Nasr, Christopher A. Choquette-Choo, Katherine Lee, A. Feder Cooper

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.LG

Comments NAACL 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18042 2025-03-21 cs.CV cs.CL 85%

EMOVA: Empowering Language Models to See, Hear and Speak with Vivid Emotions

Kai Chen, Yunhao Gou, Runhui Huang, Zhili Liu, Daxin Tan, Jing Xu, Chunwei Wang, Yi Zhu, Yihan Zeng, Kuo Yang, Dingdong Wang, Kun Xiang, Haoyuan Li, Haoli Bai, Jianhua Han, Xiaohui Li, Weike Jin, Nian Xie, Yu Zhang, James T. Kwok, Hengshuang Zhao, Xiaodan Liang, Dit-Yan Yeung, Xiao Chen, Zhenguo Li, Wei Zhang, Qun Liu, Jun Yao, Lanqing Hong, Lu Hou, Hang Xu

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);foundation model(abstract);分类 cs.CL

Comments Accepted by CVPR 2025. Project Page: https://emova-ollm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15571 2025-03-21 cs.SE cs.ET cs.IR cs.LG cs.PL 85%

LLM-Aided Customizable Profiling of Code Data Based On Programming Language Concepts

Pankaj Thorat, Adnan Qidwai, Adrija Dhar, Aishwariya Chakraborty, Anand Eswaran, Hima Patel, Praveen Jayachandran

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏