arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138434 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12365 篇

2506.03820 2026-05-05 cs.CL 84%

Automatic Correction of Writing Anomalies in Hausa Texts

Hausa 文本中书写异常的自动纠正

Ahmad Mustapha Wali, Sergiu Nisioi

机构 * Human Language Technologies Research Center(人类语言技术研究中心) Faculty of Mathematics and Computer Science(数学与计算机科学学院) University of Bucharest(布加勒斯特大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);language model(abstract);pretraining(abstract);prompting(abstract)

AI总结 本文提出通过微调变压器模型自动纠正 Hausa 文本中的书写异常,构建了大规模噪声-清洁句子对数据集,并展示了 M2M100 等模型在提升下游任务中的效果。

Comments Accepted at ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12036 2026-04-23 cs.CL 84%

Composition-RL: Compose Your Verifiable Prompts for Reinforcement Learning of Large Language Models

Composition-RL:为大型语言模型的强化学习编纂可验证提示

Xin Xu, Clive Bai, Kai Yang, Tianhao Chen, Yangkun Chen, Weijie Liu, Hao Chen, Yang Wang, Saiyong Yang, Can Yang

机构 * The Hong Kong University of Science(香港科学与技术大学) HY, Tencent(HY,腾讯) The University of Hong Kong(香港大学)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL

AI总结 Composition-RL通过自动组合多个问题生成新可验证问题,提升有限提示的利用效率,实验表明其能提升推理能力并支持跨领域强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17398 2026-04-21 cs.CL 84%

Contrastive Analysis of Linguistic Representations in Large Language Model Outputs through Structured Synthetic Data Generation and Abstracted N-gram Associations

通过结构化合成数据生成和抽象n-gram关联对大规模语言模型输出中的语言表示进行对比分析

S. A. Desimone, L. Alonso Alemany

机构 * Universidad Nacional de Córdoba(国家科罗纳大学) CONICET

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL

AI总结 本文提出一种通过对比合成文本生成和统计分析发现不同社会群体关联语言和论述模式的方法,重点在于识别细微的偏见表达而非预定义词汇列表诊断偏见,利用上下文数据进行分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05302 2026-04-17 cs.CL 84%

Right at My Level: A Unified Multilingual Framework for Proficiency-Aware Text Simplification

就在我的水平上:一种统一的多语言框架,用于面向能力的文本简化

Jinhong Jeong, Junghun Park, Youngjae Yu

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出Re-RIGHT框架,通过强化学习实现无需平行语料的多语言文本简化,提升目标水平的词汇覆盖和语义保持。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01220 2026-03-03 cs.CL 84%

Generative AI & Fictionality: How Novels Power Large Language Models

生成AI与虚构性:小说如何赋能大语言模型

Edwin Roland, Richard Jean So

机构 * School of Information Science University of Illinois Urbana-Champaign(信息科学学院伊利诺伊大学厄巴纳-香槟分校) Department of English Duke University(英语系杜克大学)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL

AI总结 研究探讨小说如何影响生成AI,发现LLMs利用小说属性并产生新社交回应,强调计算训练数据的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15793 2026-01-23 cs.CL 84%

HumanLLM: Towards Personalized Understanding and Simulation of Human Nature

HumanLLM: 向个性化理解与模拟人类本质迈进

Yuxuan Lei, Tianfu Wang, Jianxun Lian, Zhengyu Hu, Defu Lian, Xing Xie

机构 * University of Science and Technology of China(科学技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Microsoft Research Asia(微软亚洲研究院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 HumanLLM通过构建大规模用户数据集和多阶段训练流程,实现了对个体认知与行为的个性化模拟,提升了社会智能和个性化应用的效果。

Comments 12 pages, 5 figures, 7 tables, to be published in KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13860 2025-12-17 cs.SE cs.AI 84%

Verification-Guided Context Optimization for Tool Calling via Hierarchical LLMs-as-Editors

通过分层大语言模型作为编辑器进行工具调用的验证引导上下文优化

Henger Li, Shuangjie You, Flavio Di Palo, Yiyue Qian, Ayush Jain

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 通过分层LLM作为编辑器,验证引导上下文优化提升工具调用的准确性和泛化能力。

Comments Accepted by AAAI 2026 Workshop on Agentic AI Benchmarks and Applications for Enterprise Tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00469 2025-12-05 cs.CL 84%

Massively Multilingual Adaptation of Large Language Models Using Bilingual Translation Data

利用双语翻译数据进行大规模多语言大语言模型适应

Shaoxiong Ji, Zihao Li, Jaakko Paavola, Hengyu Luo, Jörg Tiedemann

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL

AI总结 本文提出利用双语翻译数据提升大规模多语言大语言模型在500种语言上的适应性能,通过构建MaLA语料库和开发EMMA-500模型,验证了双语数据对语言迁移和低资源语言性能的积极影响。

Comments EMMA-500 Gen 2; refer to Gen 1 in arXiv:2409.17892

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01074 2025-10-31 cs.LG 84%

Omni-Mol: Multitask Molecular Model for Any-to-any Modalities

Chengxin Hu, Hao Li, Yihe Yuan, Zezheng Song, Chenyang Zhao, Haixin Wang

机构 * National University of Singapore(新加坡国立大学) University of Maryland, College Park(马里兰大学 College Park 分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

Comments 44 pages, 9 figures, 13 tables, paper accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22356 2025-10-28 cs.CL 84%

Irony Detection in Urdu Text: A Comparative Study Using Machine Learning Models and Large Language Models

Fiaz Ahmad, Nisar Hussain, Amna Qasim, Momina Hafeez, Muhammad Usman Grigori Sidorov, Alexander Gelbukh

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL

Comments 5 pages, 3 figuers

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05309 2025-10-08 cs.LG 84%

Gamma Mixture Modeling for Cosine Similarity in Small Language Models

Kevin Player

专题命中 预训练与数据 :language model(title);small language model(title);分类 cs.LG

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09404 2025-10-03 cs.LG 84%

Scaling Laws for Optimal Data Mixtures

Mustafa Shukor, Louis Bethune, Dan Busbridge, David Grangier, Enrico Fini, Alaaeldin El-Nouby, Pierre Ablin

机构 * Sorbonne University(索邦大学) Apple(苹果公司)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17994 2025-08-26 cs.CL 84%

A Retail-Corpus for Aspect-Based Sentiment Analysis with Large Language Models

Oleg Silcenco, Marcos R. Machad, Wallace C. Ugulino, Daniel Braun

机构 * University of Twente(特文特大学) Marburg University(马尔堡大学)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL

Comments Accepted at ICNLSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02628 2025-06-23 cs.SE cs.AI 84%

Cracks in The Stack: Hidden Vulnerabilities and Licensing Risks in LLM Pre-Training Datasets

Mahmoud Jahanshahi, Audris Mockus

机构 * Department of Electrical Engineering and Computer Science(电气工程与计算机科学系) University of Tennessee, Knoxville, USA(田纳西大学,基洛纳分校)

专题命中 预训练与数据 :LLM(title);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI

Comments Accepted in the Second International Workshop on Large Language Models for Code (LLM4Code 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07479 2025-06-13 cs.CL 84%

Improving Fairness of Large Language Models in Multi-document Summarization

Haoyuan Li, Rui Zhang, Snigdha Chaturvedi

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL

Comments Accepted to ACL 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20606 2025-05-28 cs.CL cs.MM 84%

Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation

Dancheng Liu, Amir Nassereldine, Chenhui Xu, Jinjun Xiong

机构 * University at Buffalo(布法罗大学)

专题命中 预训练与数据 :foundation model(title);pretraining(title);分类 cs.CL

Comments in submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13828 2025-05-21 cs.AI 84%

Multimodal RAG-driven Anomaly Detection and Classification in Laser Powder Bed Fusion using Large Language Models

Kiarash Naghavi Khanghah, Zhiling Chen, Lela Romeo, Qian Yang, Rajiv Malhotra, Farhad Imani, Hongyi Xu

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.AI

Comments ASME 2025 International Design Engineering Technical Conferences and Computers and Information in Engineering Conference IDETC/CIE2025, August 17-20, 2025, Anaheim, CA (IDETC2025-168615)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11525 2025-05-20 cs.CL 84%

Beyond Single-Task: Robust Multi-Task Length Generalization for LLMs

Yi Hu, Shijia Kang, Haotong Yang, Haotian Xu, Muhan Zhang

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06166 2025-04-17 cs.CL 84%

Assessing how hyperparameters impact Large Language Models' sarcasm detection performance

Montgomery Gole, Andriy Miranskyy

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL

Comments arXiv admin note: substantial text overlap with arXiv:2312.04642

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07633 2024-12-11 cs.CL 84%

ChocoLlama: Lessons Learned From Teaching Llamas Dutch

Matthieu Meeus, Anthony Rathé, François Remy, Pieter Delobelle, Jens-Joris Decorte, Thomas Demeester

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05740 2024-07-10 cs.CL 84%

Do Multilingual Large Language Models Mitigate Stereotype Bias?

Shangrui Nie, Michael Fromm, Charles Welch, Rebekka Görge, Akbar Karimi, Joan Plepi, Nazia Afsan Mowmita, Nicolas Flores-Herr, Mehdi Ali, Lucie Flek

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL

Comments 19 pages, 8 figures, C3NLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00368 2024-06-03 cs.CL cs.IR 84%

Improving Text Embeddings with Large Language Models

Liang Wang, Nan Yang, Xiaolong Huang, Linjun Yang, Rangan Majumder, Furu Wei

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL

Comments Accepted by ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02415 2024-05-31 cs.CL 84%

LLaMA Pro: Progressive LLaMA with Block Expansion

Chengyue Wu, Yukang Gan, Yixiao Ge, Zeyu Lu, Jiahao Wang, Ye Feng, Ying Shan, Ping Luo

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);pretraining(abstract)

Comments Accepted by ACL 2024, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04763 2024-04-09 cs.CV cs.AI 84%

GenEARL: A Training-Free Generative Framework for Multimodal Event Argument Role Labeling

Hritik Bansal, Po-Nien Kung, P. Jeffrey Brantingham, Kai-Wei Chang, Nanyun Peng

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments 20 pages, 15 Figures, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.17519 2023-07-24 cs.CL 84%

GPT-FinRE: In-context Learning for Financial Relation Extraction using Large Language Models

Pawan Kumar Rajpoot, Ankur Parikh

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL

Comments arXiv admin note: text overlap with arXiv:2305.02105 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.14095 2022-05-31 cs.CV cs.AI 84%

PyramidCLIP: Hierarchical Feature Alignment for Vision-language Model Pretraining

Yuting Gao, Jinfeng Liu, Zihan Xu, Jun Zhang, Ke Li, Rongrong Ji, Chunhua Shen

专题命中 预训练与数据 :language model(title);pretraining(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03685 2024-05-07 cs.CV cs.AI cs.CL cs.LG 84%

Language-Image Models with 3D Understanding

Jang Hyun Cho, Boris Ivanovic, Yulong Cao, Edward Schmerling, Yue Wang, Xinshuo Weng, Boyi Li, Yurong You, Philipp Krähenbühl, Yan Wang, Marco Pavone

专题命中 预训练与数据 :LLM(abstract,comments);large language model(abstract);language model(abstract);prompting(abstract)

Comments Project page: https://janghyuncho.github.io/Cube-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15412 2026-08-18 cs.LG cs.AI cs.SE 新提交 84%

Invariant Pretraining for Robust Code Representations

用于鲁棒代码表示的不变预训练

Yifeng He, Yundi Xu, Christopher Castro Gaw Gonzalo, Zili Wang, Hao Chen

机构 * University of California at Davis(加州大学戴维斯分校) The University of Hong Kong(香港大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文针对代码表示模型在不变程序下鲁棒性退化问题,提出仅基于代码的不变预训练(InvPT)方法,在克隆检测、代码分类任务上分别提升鲁棒性最高11、19个百分点,同时保持或提升标准准确率。

Comments To appear in LMPL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10473 2026-08-14 cs.LG cs.AI 版本更新 84%

Critic-Free Pretraining for Efficient Online Reinforcement Learning Fine-Tuning

用于高效在线强化学习微调的无评判者预训练

Daoyi Li, Yixian Zhang, Wenbo Ding, Yu Wang, Chao Yu

机构 * Tsinghua University(清华大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究针对离线转在线强化学习中复用离线评判者导致的适配问题,提出无评判者预训练范式,兼容主流算法且在多任务上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08148 2026-08-11 cs.LG cs.AI 新提交 84%

DoGMA: A Central-Dogma-Guided Foundation Model for Multi-Omics Alignment and Multi-Task Learning in Oncology

DoGMA:一种用于肿瘤学多组学对齐与多任务学习的中心法则引导基础模型

Junfei Ling, Bangzheng Pu, Bingsen Xue, Tianle Li, Ruying Hu, Cheng Jin

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出中心法则引导的多组学基础模型DoGMA,通过Transformer-MoE架构结合定向注意力与掩码分层多组学重构预训练,在泛癌多组学下游任务中展现出优异性能,为多组学注意力机制设计提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏