arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 137794 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12318 篇

2504.04372 2026-03-06 cs.SE cs.AI cs.LG 90%

Assessing the Impact of Code Changes on the Fault Localizability of Large Language Models

评估代码更改对大型语言模型故障定位性的影响

Sabaat Haroon, Ahmad Faraz Khan, Ahmad Humayun, Waris Gill, Abdul Haddi Amjad, Ali R. Butt, Mohammad Taha Khan, Muhammad Ali Gulzar

机构 * Carnegie Mellon University, USA(卡内基梅隆大学,美国)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文通过端到端评估框架评估LLM在故障定位中的鲁棒性,发现SPMs导致78%的LLM失败于之前定位的故障,表明LLM推理依赖于语法而非语义。

Comments This paper is currently Under Review. It consists of 12 pages, 11 Figures, and 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01550 2026-03-05 cs.CL cs.AI 90%

Extracting Training Dialogue Data from Large Language Model based Task Bots

从基于大语言模型的任务机器人中提取训练对话数据

Shuo Zhang, Junzhou Zhao, Junji Hou, Pinghui Wang, Chenxu Wang, Jing Tao

机构 * MOE Key Laboratory for Intelligent Networks and Network Security, Xi’an Jiaotong University(信息网络与网络安全国家重点实验室,西安交通大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种针对基于大语言模型的任务机器人数据提取攻击方法,通过系统性研究揭示LLM记忆在TODS中的继承机制,并有效提取训练对话数据。

Comments Accepted for publication in IEEE Transactions on Information Forensics and Security (TIFS). \c{opyright} 2026 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22227 2026-03-05 cs.LG cs.AI 90%

Dynamic Adversarial Reinforcement Learning for Robust Multimodal Large Language Models

动态对抗强化学习用于鲁棒多模态大语言模型

Yicheng Bao, Xuhong Wang, Qiaosheng Zhang, Chaochao Lu, Xia Hu, Xin Tan

机构 * East China Normal University(东华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);SFT(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AOT方法,通过对抗训练提升多模态大语言模型的鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09396 2026-03-05 cs.CL cs.AI 90%

Multimodal Large Language Models for Low-Resource Languages: A Case Study for Basque

多模态大语言模型用于低资源语言:巴斯克语的案例研究

Lukas Arana, Julen Etxaniz, Ander Salaberria, Gorka Azkune

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文通过开发巴斯克语多模态大语言模型,证明低比例多模态数据即可获得良好性能,且无需巴斯克语指导的LLM即可实现强模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20065 2026-02-24 cs.CL cs.AI 90%

Multilingual Large Language Models do not comprehend all natural languages to equal degrees

多语言大语言模型并非对所有自然语言有同等的理解能力

Natalia Moskvina, Raquel Montero, Masaya Yoshida, Ferdy Hubers, Paolo Morosi, Walid Irhaymi, Jin Yan, Tamara Serrano, Elena Pagliarini, Fritz Günther, Evelina Leivada

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究发现多语言大模型在不同语言上的理解能力存在差异,英语并非表现最佳,部分罗曼语系语言表现更优。

Comments 36 pages, 3 figures, 2 tables, 4 supplementary tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15052 2026-02-16 cs.CL cs.AI 90%

SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification

SGM: 通过神经层面的净化为多模态大语言模型提供安全眼镜

Hongbo Wang, MaungMaung AprilPyone, Isao Echizen

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 SGM通过神经层面的净化技术,有效降低多模态大语言模型的毒性,同时保持生成流畅性和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10825 2026-02-02 cs.IR cs.AI cs.ET cs.LG 90%

Unveiling and Mitigating Bias in Large Language Model Recommendations: A Path to Fairness

揭示和缓解大型语言模型推荐中的偏见:走向公平的一条路

Anindya Bijoy Das, Shahnewaz Karim Sakib

机构 * Computer Science and Engineering, University of Tennessee at Chattanooga(计算机科学与工程系,田纳西大学查塔努加分校)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了基于LLM的推荐系统中的偏见问题,提出通过提示工程和检索增强生成策略来缓解偏见,以实现更公平的推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04177 2026-01-30 cs.CL cs.LG stat.ML 90%

Scaling Laws for Downstream Task Performance of Large Language Models

大语言模型下游任务性能的扩展定律

Berivan Isik, Natalia Ponomareva, Hussein Hazimeh, Dimitris Paparas, Sergei Vassilvitskii, Sanmi Koyejo

机构 * Google Research(谷歌研究) OpenAI(开放人工智能) Stanford University(斯坦福大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本研究探讨了预训练数据规模和分布对齐对大语言模型下游任务性能的影响,揭示了扩展定律在迁移学习中的应用及翻译质量的预测方法。

Comments Published at the International Conference on Learning Representations (ICLR) 2025, with title: "Scaling Laws for Downstream Task Performance in Machine Translation"

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23340 2026-01-29 cs.LG cs.AI cs.MA 90%

The Law of Multi-Model Collaboration: Scaling Limits of Model Ensembling for Large Language Models

多模型协作定律:大型语言模型模型融合的扩展极限

Dakuan Lu, Jiaqi Zhang, Cheng Yuan, Jiawei Shao, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出多模型协作定律,揭示多模型融合在参数预算下的扩展极限,证明模型多样性是提升LLM性能的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10719 2026-01-19 cs.AI cs.CL 90%

Do You Trust Me? Cognitive-Affective Signatures of Trustworthiness in Large Language Models

你信任我吗?大型语言模型中信任worthiness的认知-情感特征

Gerard Yeo, Svetlana Churina, Kokil Jaidka

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示大型语言模型通过认知-情感特征隐式编码信任worthiness,为构建可信AI系统提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13274 2025-12-23 cs.LG cs.CL 90%

AdaLRS: Loss-Guided Adaptive Learning Rate Search for Efficient Foundation Model Pretraining

AdaLRS: 基于损失的自适应学习率搜索用于高效基础模型预训练

Hongyuan Dong, Dingkang Yang, Xiao Liang, Chao Feng, Jiao Ran

机构 * ByteDance Inc.(字节跳动公司)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 AdaLRS通过优化损失下降速度实现高效基础模型预训练,无需大量超参数调优,显著提升模型性能和鲁棒性。

Comments NeurIPS 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14220 2025-12-17 cs.LG cs.AI 90%

Estimating problem difficulty without ground truth using Large Language Model comparisons

无需真实数据即可利用大语言模型比较估计问题难度

Marthe Ballon, Andres Algaba, Brecht Verbeken, Vincent Ginis

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLM compare方法,通过大语言模型的成对比较估计问题难度,克服传统方法在分布外问题上的局限性,具有高一致性与鲁棒性。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22153 2025-12-09 cs.CL cs.AI 90%

Simplex-Optimized Hybrid Ensemble for Large Language Model Text Detection Under Generative Distribution Drif

基于简单形优化的混合集成用于在生成分布漂移下的大语言模型文本检测

Sepyan Purnama Kristanto, Lutfi Hakim, Dianni Yusuf

机构 * Department of Informatics, Politeknik Negeri Banyuwangi(信息学院,波斯瓦基国家技术学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于简单形优化的混合集成方法,用于在生成分布漂移下提高大语言模型文本检测的准确性和鲁棒性。

Comments 8 pages, 2 Figure, Politeknik Negeri Banyuwangi

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00007 2025-12-02 cs.IR cs.AI cs.CL 90%

Use of Retrieval-Augmented Large Language Model Agent for Long-Form COVID-19 Fact-Checking

使用检索增强型大语言模型代理进行长期形式的新冠事实核查

Jingyi Huang, Yuyi Yang, Mengmeng Ji, Charles Alba, Sheng Zhang, Ruopeng An

机构 * New York University, USA(纽约大学) Washington University in St. Louis, USA(华盛顿大学圣路易斯分校) Shanghai University of Sports, China(上海体育大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SAFE系统,结合大语言模型与检索增强生成技术,有效提升长期新冠虚假信息的事实核查能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17946 2025-11-25 cs.CL cs.AI 90%

Measuring the Impact of Lexical Training Data Coverage on Hallucination Detection in Large Language Models

测量词汇训练数据覆盖对大型语言模型中幻觉检测的影响

Shuo Zhang, Fabrizio Gotti, Fengran Mo, Jian-Yun Nie

机构 * Université de Montréal(蒙特利尔大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨词汇训练数据覆盖对大型语言模型幻觉检测的影响,通过构建后缀数组和n-gram统计,发现结合出现特征与对数概率可提升检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19484 2025-10-23 q-bio.BM cs.AI cs.LG 90%

KnowMol: Advancing Molecular Large Language Models with Multi-Level Chemical Knowledge

Zaifei Yang, Hong Chang, Ruibing Hou, Shiguang Shan, Xilin Chen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院,中国) University of Chinese Academy of Sciences (CAS), China(中国科学院大学(中国科学院))

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01675 2025-10-23 cs.LG cs.CL 90%

Using (Not-so) Large Language Models to Generate Simulation Models in a Formal DSL: A Study on Reaction Networks

Justin N. Kreikemeyer, Miłosz Jankowski, Pia Wilsdorf, Adelinde M. Uhrmacher

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments 27 pages, 5 figures; supplemental material available at https://doi.org/10.1145/3733719

Journal ref ACM Trans. Model. Comput. Simul. 35, 4, Article 31 (October 2025), 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09566 2025-10-21 cs.CL cs.LG 90%

Zero-shot generation of synthetic neurosurgical data with large language models

Austin A. Barr, Eddie Guo, Emre Sezgin

机构 * Cumming School of Medicine University of Calgary(卡莱尔大学Cumming医学院) The Abigail Wexner Research Institute Nationwide Children’s Hospital Department of Pediatrics The Ohio State University College of Medicine(阿比盖尔·韦克斯纳研究所全国儿童医院儿科部俄亥俄州立大学医学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments 13 pages, 4 figures, 4 tables (updated version, fixed typos and formatting)

Journal ref Neurosurg Focus 59(1), E17 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16551 2025-10-07 cs.CL cs.AI 90%

Rethinking the Role of Text Complexity in Language Model Pretraining

Dan John Velasco, Matthew Theodore Roque

机构 * Samsung R&D Institute Philippines(三星菲律宾研发中心)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments Camera-ready version for BabyLM Workshop at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19371 2025-09-25 cs.CL cs.AI 90%

How to inject knowledge efficiently? Knowledge Infusion Scaling Law for Pre-training Large Language Models

Kangtao Lv, Haibin Chen, Yujin Yuan, Langming Liu, Shilei Liu, Yongwei Wang, Wenbo Su, Bo Zheng

机构 * Zhejiang University(浙江大学) Taobao & Tmall Group of Alibaba(阿里巴巴集团) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04183 2025-09-24 cs.CL cs.AI 90%

GALLa: Graph Aligned Large Language Models for Improved Source Code Understanding

Ziyin Zhang, Hang Yu, Shijie Li, Peng Di, Jianguo Li, Rui Wang

机构 * Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15714 2025-09-22 cs.CL cs.AI 90%

Once Upon a Time: Interactive Learning for Storytelling with Small Language Models

Jonas Mayer Martins, Ali Hamza Bashir, Muhammad Rehan Khalid, Lisa Beinborn

机构 * University of Göttingen, Institute of Computer Science(哥廷根大学计算机科学学院)

专题命中 预训练与数据 :language model(title,abstract);small language model(title);large language model(abstract);pretraining(abstract)

Comments EMNLP 2025, BabyLM Challenge; 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13380 2025-09-16 cs.CL cs.AI 90%

Persona-Based Synthetic Data Generation Using Multi-Stage Conditioning with Large Language Models for Emotion Recognition

Keito Inoshita, Rushia Harada

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15836 2025-09-09 cs.CL cs.AI 90%

Soft Token Attacks Cannot Reliably Audit Unlearning in Large Language Models

Haokun Chen, Sebastian Szyller, Weilin Xu, Nageen Himayat

机构 * Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Aalto University(艾尔沃斯大学) Intel Labs(英特尔实验室)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13868 2025-08-28 stat.ME cs.CL cs.LG math.ST stat.ML stat.TH 90%

Robust Detection of Watermarks for Large Language Models Under Human Edits

Xiang Li, Feng Ruan, Huiyuan Wang, Qi Long, Weijie J. Su

机构 * University of Pennsylvania(宾夕法尼亚大学) Northwestern University(西北大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments To appear in Journal of the Royal Statistical Society: Series B

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07484 2025-08-12 cs.CL cs.AI 90%

ALOPE: Adaptive Layer Optimization for Translation Quality Estimation using Large Language Models

Archchana Sindhujan, Shenbin Qian, Chan Chi Chun Matthew, Constantin Orasan, Diptesh Kanojia

机构 * Institute for People-Centred AI and Centre for Translation Studies, School of Computer Science and Electronic Engineering, University of Surrey(以人为本的人工智能研究所和翻译研究中心,计算机科学与电子工程学院,萨里大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted to COLM 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15956 2025-07-29 cs.CL cs.AI 90%

Do Large Language Models Have an English Accent? Evaluating and Improving the Naturalness of Multilingual LLMs

Yanzhu Guo, Simone Conia, Zelin Zhou, Min Li, Saloni Potdar, Henry Xiao

机构 * Apple(苹果公司) Inria Paris(巴黎国家信息与自动化研究所) École Polytechnique(巴黎高等理工学院) Sapienza University of Rome(罗马萨皮恩扎大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14241 2025-07-28 cs.CL cs.AI 90%

Promptomatix: An Automatic Prompt Optimization Framework for Large Language Models

Rithesh Murthy, Ming Zhu, Liangwei Yang, Jielin Qiu, Juntao Tan, Shelby Heinecke, Caiming Xiong, Silvio Savarese, Huan Wang

机构 * Salesforce AI Research(Salesforce AI研究院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18044 2025-07-25 cs.CL cs.AI 90%

Synthetic Data Generation for Phrase Break Prediction with Large Language Model

Hoyeon Lee, Sejung Son, Ye-Eun Kang, Jong-Hwan Kim

机构 * NAVER Cloud NHNSouth Korea Yale University(耶鲁大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted at Interspeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10972 2025-07-17 cs.LG cs.AI 90%

Predictable Scale: Part II, Farseer: A Refined Scaling Law in Large Language Models

Houyi Li, Wenzhen Zheng, Qiufeng Wang, Zhenyu Ding, Haoying Wang, Zili Wang, Shijie Xuyang, Ning Ding, Shuigeng Zhou, Xiangyu Zhang, Daxin Jiang

机构 * Fudan University(复旦大学) Xi’an Jiaotong University(西安交通大学) Megvii Technology(科大讯飞)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

Comments 34

详情

展开后加载摘要…

URL PDF HTML 收藏