arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138237 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12353 篇

2603.06264 2026-03-24 cs.CL cs.CY 87%

Mind the Gap: Pitfalls of LLM Alignment with Asian Public Opinion

注意鸿沟:LLM对齐与亚洲公众意见的陷阱

Hari Shankar, Vedanta S P, Sriharini Margapuri, Debjani Mazumder, Ponnurangam Kumaraguru, Abhijnan Chakraborty

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了LLM在多语言多文化环境中的对齐问题,发现其在宗教观点尤其是少数群体方面存在偏差,提出轻量干预无法消除文化鸿沟,强调需系统性地区审计确保公平部署。

Comments 13 pages, including AAAI Paper Checklist. Accepted in Proceedings of the 20th International AAAI Conference on Web and Social Media (ICWSM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20632 2026-03-24 cs.LG 87%

Optimal low-rank stochastic gradient estimation for LLM training

最优低秩随机梯度估计用于大语言模型训练

Zehao Li, Tao Ren, Zishi Zhang, Xi Chen, Yijie Peng

机构 * Guanghua School of Management, Peking University(北京大学光华管理学院) Stern School of Business, New York University(纽约大学 Stern 商学院)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出一种低秩矩阵估计器,通过随机低维子空间投影减少内存占用并控制均方误差,实验证明在RoBERTa-large微调和LLaMA-20M/60M/100M预训练中均取得优异效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05721 2026-03-24 cs.CL 87%

What Are They Filtering Out? An Experimental Benchmark of Filtering Strategies for Harm Reduction in Pretraining Datasets

他们是在过滤什么?一种减少预训练数据集有害内容的过滤策略实验基准

Marco Antonio Stranisci, Christian Hardmeier

机构 * University of Turin(都灵大学) aequa-tech IT University of Copenhagen(哥本哈根技术大学)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文通过实验评估了数据过滤策略对减少有害内容的影响,发现其副作用是加剧了对弱势群体的歧视性不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16594 2026-02-18 cs.CL 87%

A Scoping Review of Synthetic Data Generation by Language Models in Biomedical Research and Application: Data Utility and Quality Perspectives

基于语言模型生成合成数据在生物医学研究与应用中的综述:数据效用和质量视角

Hanshu Rao, Weisi Liu, Haohan Wang, I-Chan Huang, Zhe He, Xiaolei Huang

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

AI总结 本文综述了语言模型在生物医学领域生成合成数据的应用,分析了不同模态下的数据效用与质量挑战,指出需建立标准化评估框架以提升生物医学研究的应用效果。

Journal ref Journal of Healthcare Informatics Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02044 2026-02-11 q-bio.NC cs.LG 87%

A Brain Graph Foundation Model: Pre-Training and Prompt-Tuning across Broad Atlases and Disorders

脑图基础模型:在广泛的大脑图谱和疾病中进行预训练和提示微调

Xinxu Wei, Kanhao Zhao, Yong Jiao, Lifang He, Yu Zhang

机构 * Lehigh University(莱文大学) Stanford University(斯坦福大学)

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 BrainGFM通过图对比学习和图掩码自动编码器预训练,实现跨多种大脑图谱和疾病的高效泛化与迁移。

Comments 30pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00446 2026-02-03 cs.LG cs.CR 87%

Towards Building Non-Fine-Tunable Foundation Models

构建不可微调的基础模型

Ziyao Wang, Nizhang Li, Pingzhi Li, Guoheng Sun, Tianlong Chen, Ang Li

机构 * University of Maryland, College Park(马里兰大学 College Park 分校) Macau University of Science and Technology(澳门科学技术大学) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出PMP框架,通过构建不可微调的基础模型,限制未经授权微调的适应性提升,从而提高模型的安全性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16618 2026-01-26 cs.CL 87%

PROST-LLM: Progressively Enhancing the Speech-to-Speech Translation Capability in LLMs

PROST-LLM:逐步增强大语言模型中的语音到语音翻译能力

Jing Xu, Jiaqi Wang, Daxin Tan, Xiao Chen

机构 * The Chinese University of Hong Kong Huawei Artificial Intelligence Laboratory (Leibniz)(香港中文大学华为人工智能实验室(莱布尼茨))

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 PROST-LLM通过逐步增强方法提升大语言模型在语音到语音翻译中的能力,采用三任务学习和模态链方法,结合自我采样和回译生成偏好对,最终通过偏好优化提升翻译性能。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01153 2026-01-06 cs.CL 87%

SongSage: A Large Musical Language Model with Lyric Generative Pre-training

SongSage:一种具有歌词生成预训练的大型音乐语言模型

Jiani Guo, Jiajia Li, Jie Wu, Zuchao Li, Yujiu Yang, Ping Wang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Information Management, Wuhan University(武汉大学信息管理学院) Tsinghua University(清华大学) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);SFT(abstract)

AI总结 SongSage是一种通过歌词生成预训练的大型音乐语言模型,专为提升歌词理解和播放列表推荐能力而设计,同时具备一般知识理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17385 2025-11-19 cs.CL 87%

Native Design Bias: Studying the Impact of English Nativeness on Language Model Performance

Manon Reusens, Philipp Borchert, Jochen De Weerdt, Bart Baesens

机构 * Research Centre for Information Systems Engineering (LIRIS), KU Leuven(信息系统工程研究中心(LIRIS),库勒文大学) IESEG School of Management(IESEG管理学院) Department of Decision Analytics and Risk, University of Southampton(决策分析与风险系,南安普顿大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)

Comments Accepted at ICJNLP-AACL (findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18962 2025-10-17 cs.LG 87%

Spend Wisely: Maximizing Post-Training Gains in Iterative Synthetic Data Bootstrapping

Pu Yang, Yunzhen Feng, Ziyuan Chen, Yuhang Wu, Zhuoyuan Li

机构 * Peking University(北京大学) New York University(纽约大学) UC Berkeley(加州大学伯克利分校) National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :post-training(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

Comments NeurIPS 2025 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10071 2025-10-14 cs.LG 87%

ADEPT: Continual Pretraining via Adaptive Expansion and Dynamic Decoupled Tuning

Jinyang Zhang, Yue Fang, Hongxin Ding, Weibin Liao, Muyang Ye, Xu Chu, Junfeng Zhao, Yasha Wang

机构 * Key Laboratory of High Confidence Software Technologies, Ministry of Education(高可信软件技术重点实验室,教育部) School of Computer Science, Peking University(北京大学计算机学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14474 2025-10-07 cs.CL cs.CR 87%

LexiMark: Robust Watermarking via Lexical Substitutions to Enhance Membership Verification of an LLM's Textual Training Data

Eyal German, Sagiv Antebi, Edan Habler, Asaf Shabtai, Yuval Elovici

机构 * Department of Software and Information Systems Engineering, Ben-Gurion University of the Negev(软件与信息系统工程系,贝内尔根大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25050 2025-09-30 cs.LG 87%

Advantage Weighted Matching: Aligning RL with Pretraining in Diffusion Models

Shuchen Xue, Chongjian Ge, Shilong Zhang, Yichen Li, Zhi-Ming Ma

机构 * UCAS(中国科学院大学) Adobe Research(Adobe研究) HKU(香港大学) MIT(麻省理工学院)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13794 2025-09-22 cs.CV cs.AI 87%

LED: LLM Enhanced Open-Vocabulary Object Detection without Human Curated Data Generation

Yang Zhou, Shiyu Zhao, Yuxiao Chen, Zhenting Wang, Can Jin, Dimitris N. Metaxas

机构 * Rutgers University(新泽西罗格斯大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16980 2025-09-16 cs.LG 87%

Safety Pretraining: Toward the Next Generation of Safe AI

Pratyush Maini, Sachin Goyal, Dylan Sam, Alex Robey, Yash Savani, Yiding Jiang, Andy Zou, Matt Fredrikson, Zacharcy C. Lipton, J. Zico Kolter

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01649 2025-09-03 cs.LG 87%

Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling

Sachin Goyal, David Lopez-Paz, Kartik Ahuja

机构 * FAIR at Meta(Meta旗下的FAIR) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14373 2025-07-31 cs.CL eess.SP 87%

ECG-Byte: A Tokenizer for End-to-End Generative Electrocardiogram Language Modeling

William Han, Chaojing Duan, Michael A. Rosenberg, Emerson Liu, Ding Zhao

机构 * Carnegie Mellon University(卡内基梅隆大学) Allegheny Health Network(阿勒格尼健康网络) University of Colorado(科罗拉多大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)

Comments 38 pages, 9 figures; Accepted to MLHC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10395 2025-07-15 cs.CV cs.AI 87%

Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation

Zhiyang Xu, Jiuhai Chen, Zhaojiang Lin, Xichen Pan, Lifu Huang, Tianyi Zhou, Madian Khabsa, Qifan Wang, Di Jin, Michihiro Yasunaga, Lili Yu, Xi Victoria Lin, Shaoliang Nie

机构 * Meta University of Maryland(马里兰大学) New York University(纽约大学)

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments Unified image understanding and generation model

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05551 2025-06-03 cs.CL 87%

FRAME: Boosting LLMs with A Four-Quadrant Multi-Stage Pretraining Strategy

Xuemiao Zhang, Feiyu Duan, Liangyu Xu, Yongwei Zhou, Sirui Wang, Rongxiang Weng, Jingang Wang, Xunliang Cai

机构 * Peking University(北京大学) Beihang University(北航) Tsinghua University(清华大学) Meituan(美团)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08232 2025-05-23 cs.CL 87%

Language Models are Universal Embedders

Xin Zhang, Zehan Li, Yanzhao Zhang, Dingkun Long, Pengjun Xie, Meishan Zhang, Min Zhang

机构 * Harbin Institute of Technology(哈尔滨工业大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)

Comments XLLM Workshop, ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03251 2025-04-09 cs.LG 87%

RiemannGFM: Learning a Graph Foundation Model from Riemannian Geometry

Li Sun, Zhenhao Huang, Suyang Zhou, Qiqi Wan, Hao Peng, Philip Yu

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments Accepted by WWW 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11411 2025-03-17 cs.LG 87%

Empowering Time Series Analysis with Synthetic Data: A Survey and Outlook in the Era of Foundation Models

Xu Liu, Taha Aksu, Juncheng Liu, Qingsong Wen, Yuxuan Liang, Caiming Xiong, Silvio Savarese, Doyen Sahoo, Junnan Li, Chenghao Liu

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00263 2025-03-14 cs.CV cs.AI 87%

Procedure-Aware Surgical Video-language Pretraining with Hierarchical Knowledge Augmentation

Kun Yuan, Vinkle Srivastav, Nassir Navab, Nicolas Padoy

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted at the 38th Conference on Neural Information Processing Systems (NeurIPS 2024 Spolight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11275 2025-02-18 cs.CL 87%

Cuckoo: An IE Free Rider Hatched by Massive Nutrition in LLM's Nest

Letian Peng, Zilong Wang, Feng Yao, Jingbo Shang

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07288 2025-02-04 cs.AI 87%

LLM-Net: Democratizing LLMs-as-a-Service through Blockchain-based Expert Networks

Zan-Kai Chong, Hiroyuki Ohsaki, Bryan Ng

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07721 2025-01-15 cs.CL 87%

LLMic: Romanian Foundation Language Model

Vlad-Andrei Bădoiu, Mihai-Valentin Dumitru, Alexandru M. Gherghescu, Alexandru Agache, Costin Raiciu

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);foundation model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17672 2024-11-27 cs.LG 87%

Synthetic Data Generation with LLM for Improved Depression Prediction

Andrea Kang, Jun Yu Chen, Zoe Lee-Youngzie, Shuhao Fu

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 6 pages excluding references and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19854 2024-10-01 cs.CL econ.GN q-fin.CP q-fin.EC 87%

The Construction of Instruction-tuned LLMs for Finance without Instruction Data Using Continual Pretraining and Model Merging

Masanori Hirano, Kentaro Imajo

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14988 2024-09-24 cs.CL 87%

Beyond Fine-tuning: Unleashing the Potential of Continuous Pretraining for Clinical LLMs

Clément Christophe, Tathagata Raha, Svetlana Maslenkova, Muhammad Umar Salman, Praveen K Kanithi, Marco AF Pimentel, Shadab Khan

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09834 2024-06-25 cs.LG 87%

All in One and One for All: A Simple yet Effective Method towards Cross-domain Graph Pretraining

Haihong Zhao, Aochuan Chen, Xiangguo Sun, Hong Cheng, Jia Li

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted to KDD'24, August 25-29, 2024, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏