arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138434 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12365 篇

2511.01840 2025-11-04 cs.CY cs.AI 85%

A Detailed Study on LLM Biases Concerning Corporate Social Responsibility and Green Supply Chains

Greta Ontrup, Annika Bush, Markus Pauly, Meltem Aksoy

机构 * Research Center Trustworthy Data Science and Security, University Alliance Ruhr(可信数据科学与安全研究所以及鲁尔大学联盟) Department of Computer Science, University of Duisburg-Essen(杜伊斯堡- Essen大学计算机科学系) Department of Computer Science, Technical University Dortmund(图恩大学计算机科学系) Chair of Mathematical Statistics and Applications in Industry, Technical University Dortmund(工业数学统计与应用教授职位,图恩大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 37 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13996 2025-10-17 cs.CL 85%

The German Commons - 154 Billion Tokens of Openly Licensed Text for German Language Models

Lukas Gienapp, Christopher Schröder, Stefan Schweter, Christopher Akiki, Ferdinand Schlatt, Arden Zimmermann, Phillipe Genêt, Martin Potthast

机构 * University of Kassel, hessian.AI(卡塞尔大学、hessian.AI) Independent Researcher(独立研究者) Leipzig University(莱比锡大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL

Comments 13 pages, 3 figures, 12 tables, includes datasheet

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13697 2025-10-16 cs.SE cs.LG 85%

On Pretraining for Project-Level Code Completion

Maksim Sapronov, Evgeniy Glukhov

机构 * JetBrains Research(JetBrains 研究)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10487 2025-10-14 cs.CV cs.AI 85%

Towards Self-Refinement of Vision-Language Models with Triangular Consistency

Yunlong Deng, Guangyi Chen, Tianpei Gu, Lingjing Kong, Yan Li, Zeyu Tang, Kun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ByteDance US(字节跳动美国公司) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);instruction tuning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09471 2025-10-13 cs.CL 85%

Getting Your Indices in a Row: Full-Text Search for LLM Training Data for Real World

Ines Altemir Marinas, Anastasiia Kucherenko, Alexander Sternfeld, Andrei Kucharavy

机构 * IC, EPFL(EPFL)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06530 2025-10-09 cs.CR cs.ET cs.LG cs.NI 85%

From Description to Detection: LLM based Extendable O-RAN Compliant Blind DoS Detection in 5G and Beyond

Thusitha Dayaratne, Ngoc Duy Pham, Viet Vo, Shangqi Lai, Sharif Abuadbba, Hajime Suzuki, Xingliang Yuan, Carsten Rudolph

机构 * Monash University(莫纳什大学) Swinburne University of Technology(斯威本科技大学) CSIRO’s Data61(澳大利亚联邦科学与工业研究组织(CSIRO)的数据61研究所) The University of Melbourne(墨尔本大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04152 2025-10-09 cs.CL 85%

Rethinking Multilingual Continual Pretraining: Data Mixing for Adapting LLMs Across Languages and Resources

Zihao Li, Shaoxiong Ji, Hengyu Luo, Jörg Tiedemann

机构 * University of Helsinki(赫尔辛基大学) ELLIS Institute Finland(芬兰ELLIS研究所) University of Turku(图尔库大学)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14824 2025-10-08 cs.CL 85%

Tracing Multilingual Factual Knowledge Acquisition in Pretraining

Yihong Liu, Mingyang Wang, Amir Hossein Kargaran, Felicia Körner, Ercong Nie, Barbara Plank, François Yvon, Hinrich Schütze

机构 * Center for Information and Language Processing, LMU Munich(信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML)) Bosch Center for Artificial Intelligence(博世人工智能中心) Sorbonne Université, CNRS, ISIR, France(索邦大学,法国国家科学研究中心,ISIR)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments EMNLP Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01995 2025-10-03 cs.CL 85%

LLM-Based Multi-Task Bangla Hate Speech Detection: Type, Severity, and Target

Md Arid Hasan, Firoj Alam, Md Fahad Hossain, Usman Naseem, Syed Ishtiaque Ahmed

机构 * University of Toronto(多伦多大学) Qatar Computing Research Institute(卡塔尔计算研究院) Daffodil International University(达芙妮国际大学) Macquarie University(麦考瑞大学)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00537 2025-10-02 cs.LG cs.IT math.IT 85%

Spectral Scaling Laws in Language Models: How Effectively Do Feed-Forward Networks Use Their Latent Space?

Nandan Kumar Jha, Brandon Reagen

机构 * New York University(纽约大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.LG

Comments EMNLP 2025 Main Conference (Long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25850 2025-10-01 cs.LG 85%

RL-Guided Data Selection for Language Model Finetuning

Animesh Jha, Harshit Gupta, Ananjan Nandi

机构 * Stanford University(斯坦福大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.LG

Comments To appear in NeurIPS 2025 Constrained Optimization for ML Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23979 2025-09-30 cs.CL 85%

ByteSized32Refactored: Towards an Extensible Interactive Text Games Corpus for LLM World Modeling and Evaluation

Haonan Wang, Junfeng Sun, Xingdi Yuan, Ruoyao Wang, Ziang Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学) Liaoning Technical University(辽宁技术大学) Microsoft Research Montréal(微软研究院蒙特利尔分校) Central University of Finance and Economics(中央财经大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 14 pages,15 figures, Accepted to the 5th Wordplay: When Language Meets Games Workshop, EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16331 2025-09-29 cs.SE cs.LG 85%

Can Code Language Models Learn Clarification-Seeking Behaviors?

Jie JW Wu, Manav Chaudhary, Davit Abrahamyan, Arhaan Khaku, Anjiang Wei, Fatemeh H. Fard

机构 * Michigan Technological University(密歇根技术大学) Indian Institute of Information Technology (IIIT)(印度信息科技研究所) University of California, San Diego (UCSD)(加州大学圣地亚哥分校) University of British Columbia(不列颠哥伦比亚大学) Stanford University(斯坦福大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18569 2025-09-24 cs.SD cs.AI eess.AS 85%

Explore the Reinforcement Learning for the LLM based ASR and TTS system

Changfeng Gao, Yabin Li, Keyu An, Zhifu Gao, Zhihao Du, Han Zhao, Xiangang Li

机构 * Speech Team, Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15692 2025-09-22 cs.SD cs.CL eess.AS 85%

Direct Simultaneous Translation Activation for Large Audio-Language Models

Pei Zhang, Yiming Wang, Jialong Tang, Baosong Yang, Rui Wang, Derek F. Wong, Fei Huang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) NLP$^2$CT Lab(NLP²CT实验室) University of Macau(澳门大学) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);SFT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17390 2025-09-22 cs.CL 85%

Measuring Lexical Diversity of Synthetic Data Generated through Fine-Grained Persona Prompting

Gauri Kambhatla, Chantal Shaib, Venkata Govindarajan

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Northeastern University(东北大学) Ithaca College(伊萨卡学院)

专题命中 预训练与数据 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted to EMNLP Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11414 2025-09-16 cs.CL 85%

Continually Adding New Languages to Multilingual Language Models

Abraham Toluwase Owodunni, Sachin Kumar

机构 * Department of Computer Science and Engineering(计算机科学与工程系) The Ohio State University(俄亥俄州立大学)

专题命中 预训练与数据 :language model(title,abstract);instruction tuning(abstract);pretraining(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13362 2025-09-10 cs.IR cs.LG 85%

Lusifer: LLM-based User SImulated Feedback Environment for online Recommender systems

Danial Ebrat, Eli Paradalis, Luis Rueda

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20038 2025-09-05 cs.CL 85%

Forewarned is Forearmed: Pre-Synthesizing Jailbreak-like Instructions to Enhance LLM Safety Guardrail to Potential Attacks

Sheng Liu, Qiang Sheng, Danding Wang, Yang Li, Guang Yang, Juan Cao

机构 * Sheng Liu Media Synthesis and Forensics Lab, Institute of Computing Technology, Chinese Academy of Sciences University of Chinese Academy of Sciences(媒体合成与取证实验室,计算技术研究所,中国科学院,中国科学院大学) Qiang Sheng Media Synthesis and Forensics Lab, Institute of Computing Technology, Chinese Academy of Sciences(媒体合成与取证实验室,计算技术研究所,中国科学院) Danding Wang Media Synthesis and Forensics Lab, Institute of Computing Technology, Chinese Academy of Sciences(媒体合成与取证实验室,计算技术研究所,中国科学院) Yang Li Media Synthesis and Forensics Lab, Institute of Computing Technology, Chinese Academy of Sciences University of Chinese Academy of Sciences(媒体合成与取证实验室,计算技术研究所,中国科学院,中国科学院大学) Guang Yang Zhongguancun Laboratory(中关村实验室) Juan Cao Media Synthesis and Forensics Lab, Institute of Computing Technology, Chinese Academy of Sciences(媒体合成与取证实验室,计算技术研究所,中国科学院)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments EMNLP 2025 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20525 2025-08-29 cs.AI 85%

Enhancing Health Fact-Checking with LLM-Generated Synthetic Data

Jingze Zhang, Jiahe Qian, Yiliang Zhou, Yifan Peng

机构 * Population Health Sciences, Weill Cornell Medicine(人口健康科学系,韦尔·科恩医学中心) Donald Bren School of Information and Computer Sciences, University of California, Irvine(唐纳德·布伦信息与计算机科学学院,加州大学伊尔弗分校)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17524 2025-08-26 cs.CV cs.AI 85%

OmniMRI: A Unified Vision--Language Foundation Model for Generalist MRI Interpretation

Xingxin He, Aurora Rofena, Ruimin Feng, Haozhe Liao, Zhaoye Zhou, Albert Jang, Fang Liu

机构 * Athinoula A. Martinos Center for Biomedical Imaging(阿提诺拉A.马丁诺斯生物医学成像中心) Harvard Medical School(哈佛医学院) Massachusetts General Hospital(麻省总医院) University Campus Bio-Medico of Rome(罗马生物医学大学校园)

专题命中 预训练与数据 :foundation model(title,abstract);instruction tuning(abstract);pretraining(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15926 2025-08-25 cs.CE cs.AI 85%

Noise, Adaptation, and Strategy: Assessing LLM Fidelity in Decision-Making

Yuanjun Feng, Vivek Choudhary, Yash Raj Shrestha

机构 * University of Lausanne(洛桑大学) Nanyang Technological University(南洋理工大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted to EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09652 2025-08-12 cs.CL 85%

How Chinese are Chinese Language Models? The Puzzling Lack of Language Policy in China's LLMs

Andrea W Wen-Yi, Unso Eun Seo Jo, Lu Jia Lin, David Mimno

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);pretraining(abstract);分类 cs.CL

Comments We have reworked the paper substantially. Please refer to the new, updated article: arXiv:2504.00289

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06157 2025-07-31 cs.SI cs.CL 85%

Masked Language Models are Good Heterogeneous Graph Generalizers

Jinyu Yang, Cheng Yang, Shanyuan Cui, Zeyuan Guo, Liangwei Yang, Muhan Zhang, Zhiqiang Zhang, Chuan Shi

机构 * School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机科学学院) Department of Computer Science, University of Illinois Chicago(伊利诺伊大学芝加哥分校计算机科学系) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Ant Group, Beijing, China(蚂蚁集团(北京))

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14133 2025-07-29 cs.CL 85%

Self-Regularization with Sparse Autoencoders for Controllable LLM-based Classification

Xuansheng Wu, Wenhao Yu, Xiaoming Zhai, Ninghao Liu

机构 * University of Georgia(佐治亚大学) Tencent AI Lab(腾讯AI实验室)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted by SIGKDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15597 2025-07-22 cs.CV cs.LG cs.RO 85%

Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos

Hao Luo, Yicheng Feng, Wanpeng Zhang, Sipeng Zheng, Ye Wang, Haoqi Yuan, Jiazheng Liu, Chaoyi Xu, Qin Jin, Zongqing Lu

机构 * Peking University(北京大学) Renmin University of China(中国人民大学) BeingBeyond

专题命中 预训练与数据 :pretraining(title,abstract);instruction tuning(abstract);post-training(abstract);分类 cs.LG

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17735 2025-07-21 cs.AI 85%

SafeAgent: Safeguarding LLM Agents via an Automated Risk Simulator

Xueyang Zhou, Weidong Wang, Lin Lu, Jiawen Shi, Guiyao Tie, Yongtian Xu, Lixing Chen, Pan Zhou, Neil Zhenqiang Gong, Lichao Sun

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 38 pages;12 figures;12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05265 2025-07-09 q-bio.GN cs.LG 85%

BMFM-DNA: A SNP-aware DNA foundation model to capture variant effects

Hongyang Li, Sanjoy Dey, Bum Chul Kwon, Michael Danziger, Michal Rosen-Tzvi, Jianying Hu, James Kozloski, Ching-Huei Tsou, Bharath Dandala, Pablo Meyer

机构 * IBM Research(IBM研究院)

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04132 2025-07-08 cs.DL cs.CL cs.CV 85%

An HTR-LLM Workflow for High-Accuracy Transcription and Analysis of Abbreviated Latin Court Hand

Joshua D. Isom

机构 * Lehigh University(莱文大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18600 2025-06-24 cs.CL cs.GT cs.MA 85%

Reply to "Emergent LLM behaviors are observationally equivalent to data leakage"

Ariel Flint Ashery, Luca Maria Aiello, Andrea Baronchelli

机构 * City St George’s, University of London(伦敦大学圣乔治学院) IT University of Copenhagen(哥本哈根IT大学) Pioneer Centre for AI(先锋人工智能中心)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Reply to arXiv:2505.23796

详情

展开后加载摘要…

URL PDF HTML 收藏