arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138791 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12393 篇

2506.18221 2026-02-10 cs.LG cs.AI stat.ML 81%

These Are Not All the Features You Are Looking For: A Fundamental Bottleneck in Supervised Pretraining

这些并非你所寻找的所有特征:监督预训练中的一个根本瓶颈

Xingyu Alice Yang, Jianyu Zhang, Léon Bottou

机构 * Fundamental AI Research (FAIR) at Meta(Meta 的基础人工智能研究(FAIR)) New York University(纽约大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过模型集成策略提升迁移学习性能,发现预训练模型存在特征不一致导致的迁移偏差问题,并在ResNet上验证了该方法的有效性。

Comments 10 pages, 6 figures, Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03244 2026-02-03 cs.LG cs.AI 81%

FoMEMO: Towards Foundation Models for Expensive Multi-objective Optimization

FoMEMO:面向昂贵多目标优化的基础模型

Yiming Yao, Fei Liu, Liang Zhao, Xi Lin, Yilu Liu, Qingfu Zhang

机构 * City University of Hong Kong(香港城市大学) Xi’an Jiaotong University(西安交通大学)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 FoMEMO提出一种基础模型,通过预训练合成数据提升昂贵多目标优化的泛化和优化性能,无需后续训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01678 2026-02-03 cs.LG cs.AI cs.CE eess.SP 81%

LEAD: An EEG Foundation Model for Alzheimer's Disease Detection

LEAD:一种用于阿尔茨海默病检测的EEG基础模型

Yihe Wang, Nan Huang, Nadia Mammone, Marco Cecchi, Xiang Zhang

机构 * Department of Computer Science, University of North Carolina at Charlotte, United States(北卡罗来纳州立大学计算机科学系) DICEAM Department, University Mediterranea of Reggio Calabria, Italy(雷焦卡拉布里亚地中海大学DICEAM系)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 LEAD是一种基于EEG的阿尔茨海默病检测基础模型,通过门控时间-空间Transformer和受试者正则化策略,实现大规模数据集上的高效检测与泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11085 2026-02-03 cs.LG cs.AI 81%

On the Importance of Pretraining Data Alignment for Atomic Property Prediction

关于预训练数据对齐在原子性质预测中的重要性

Yasir Ghunaim, Hasan Abed Al Kader Hammoud, Bernard Ghanem

机构 * King Abdullah University of Science and Technology (KAUST)(国王阿卜杜勒-阿齐兹大学科学与技术学院)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本文发现,通过精心选择的任务对齐数据集预训练,可提升原子性质预测的性能,且比大规模混合数据集预训练更有效。

Comments Published in Transactions on Machine Learning Research (TMLR), 2026

Journal ref Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04347 2026-02-02 cs.CL cs.LG 81%

Unmasking Backdoors: An Explainable Defense via Gradient-Attention Anomaly Scoring for Pre-trained Language Models

揭示后门:通过梯度-注意力异常评分对预训练语言模型进行可解释防御

Anindya Sundar Das, Kangjie Chen, Monowar Bhuyan

机构 * Umeå University(乌梅学院) Nanyang Technological University(南洋理工大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过梯度-注意力异常评分对预训练语言模型进行可解释防御,有效降低后门攻击成功率。

Comments 17 pages total (9 pages main text + 6 pages appendix + references), 16 figures. Preprint version; the final camera-ready version may differ. Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20884 2026-01-30 cs.LG cs.AI 81%

Finetune-Informed Pretraining Boosts Downstream Performance

微调引导预训练提升下游性能

Atik Faysal, Mohammad Rostami, Reihaneh Gh. Roshan, Nikhil Muralidhar, Huaxia Wang

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 FIP通过优化目标模态的表示学习,提升多模态下游任务性能,无需额外数据或计算资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00564 2026-01-30 cs.LG cs.AI 81%

Scaling Offline Model-Based RL via Jointly-Optimized World-Action Model Pretraining

通过联合优化的世界-动作模型扩展离线模型基于的强化学习

Jie Cheng, Ruixi Qiao, Yingwei Ma, Binhua Li, Gang Xiong, Qinghai Miao, Yongbin Li, Yisheng Lv

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Alibaba Group(阿里巴巴集团)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 JOWA通过联合优化的世界-动作模型扩展离线RL,实现高效泛化和高性能

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19606 2026-01-28 cs.CV cs.AI cs.LG cs.SD eess.AS 81%

GMS-CAVP: Improving Audio-Video Correspondence with Multi-Scale Contrastive and Generative Pretraining

GMS-CAVP:通过多尺度对比和生成预训练提升音频视频对应关系

Shentong Mo, Zehua Chen, Jun Zhu

机构 * Carnegie Mellon University(卡内基梅隆大学) MBZUAI Tsinghua University(清华大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 GMS-CAVP通过多尺度对比和生成预训练方法提升音频视频对应关系建模,实现更深入的跨模态理解和高保真生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17664 2026-01-27 cs.CL cs.AI 81%

UrduLM: A Resource-Efficient Monolingual Urdu Language Model

UrduLM: 一种资源高效的单语乌尔都语语言模型

Syed Muhammad Ali, Hammad Sajid, Zainab Haider, Ali Muhammad Asad, Haya Fatima, Abdul Samad

机构 * Department of Computer Science Habib University(计算机科学系 哈比大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 UrduLM是一种高效的单语乌尔都语语言模型,通过低资源预训练和定制分词器,在少样本条件下达到与多语言模型相当的性能,为乌尔都语NLP研究提供基准和框架。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08905 2026-01-27 cs.AI cs.CL 81%

Grounding Synthetic Data Evaluations of Language Models in Unsupervised Document Corpora

在无监督文档语料中使语言模型的合成数据评估接地

Michael Majurski, Cynthia Matuszek

机构 * University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出了一种自动化方法,利用文档语料生成事实性合成数据评估,以提高语言模型在无监督文档中的评估效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12053 2026-01-21 q-bio.NC cs.AI cs.LG 81%

A New Strategy for Artificial Intelligence: Training Foundation Models Directly on Human Brain Data

人工智能新策略:直接在人类脑数据上训练基础模型

Maël Donoso

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过直接在人类脑数据上训练基础模型,以突破传统数据的限制,探索认知功能的新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06952 2025-12-30 cs.LG cs.AI 81%

What Has a Foundation Model Found? Using Inductive Bias to Probe for World Models

基础模型发现了什么?利用归纳偏置来探测世界模型

Keyon Vafa, Peter G. Chang, Ashesh Rambachan, Sendhil Mullainathan

机构 * Harvard University(哈佛大学) MIT(麻省理工学院)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究通过归纳偏置探测技术揭示基础模型在适应新任务时无法捕捉底层世界模型结构的问题。

Comments To appear in ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01037 2025-12-22 cs.CL cs.AI 81%

When Safety Blocks Sense: Measuring Semantic Confusion in LLM Refusals

当安全阻止感知:测量大语言模型拒绝中的语义混淆

Riad Ahmed Anonto, Md Labid Al Nahiyan, Md Tanvir Hassan

机构 * Department of Computer Science and Engineering, Bangladesh University of Engineering and Technology (BUET)(计算机科学与工程系,孟加拉国工程与技术大学)

专题命中 预训练与数据 :LLM(title);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出语义混淆的概念及测量框架,通过ParaGuard语料库和三种模型无关指标,揭示大语言模型拒绝中的局部不一致问题,帮助开发者优化安全与准确性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10169 2025-12-12 cs.AI cs.CY cs.LG 81%

The 2025 Foundation Model Transparency Index

2025基础模型透明度指数

Alexander Wan, Kevin Klyman, Sayash Kapoor, Nestor Maslej, Shayne Longpre, Betty Xiong, Percy Liang, Rishi Bommasani

机构 * UC Berkeley(伯克利大学) Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 2025基础模型透明度指数评估了基础模型开发者的透明度,发现整体透明度下降,IBM表现突出,而xAI和Midjourney得分极低,揭示了政策干预的必要性。

Comments Website: https://crfm.stanford.edu/fmti/December-2025/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06642 2025-12-09 cs.CV astro-ph.CO astro-ph.IM cs.AI cs.LG 81%

Masked Autoencoder Pretraining on Strong-Lensing Images for Joint Dark-Matter Model Classification and Super-Resolution

在强引力透镜图像上预训练掩码自动编码器用于联合暗物质模型分类和超分辨率

Achmad Ardani Prasha, Clavino Ourizqi Rachmadi, Muhamad Fauzan Ibnu Syahlan, Naufal Rahfi Anugerah, Nanda Garin Raditya, Putri Amelia, Sabrina Laila Mutiara, Hilman Syachr Ramadhan

机构 * Faculty of Computer Science, Universitas Mercu Buana(默克普布亚大学计算机科学学院)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究通过在强引力透镜图像上预训练MAE,实现了暗物质模型分类和图像超分辨率的双重任务,展示了MAE在天文图像处理中的有效性。

Comments 21 pages, 7 figures, 3 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22307 2025-12-03 cs.AI cs.LG 81%

Enhanced Conditional Generation of Double Perovskite by Knowledge-Guided Language Model Feedback

通过知识引导语言模型反馈增强双钙钛矿的条件生成

Inhyo Lee, Junhyeong Lee, Jongwon Park, KyungTae Lim, Seunghwa Ryu

专题命中 预训练与数据 :language model(title);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出了一种多智能体框架,通过知识引导的文本梯度提升双钙钛矿生成的稳定性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19694 2025-11-27 cs.LG cs.AI 81%

TiCT: A Synthetically Pre-Trained Foundation Model for Time Series Classification

TiCT:一种合成预训练的时间序列分类基础模型

Chin-Chia Michael Yeh, Uday Singh Saini, Junpeng Wang, Xin Dai, Xiran Fan, Jiarui Sun, Yujie Fan, Yan Zheng

机构 * Visa Research(Visa研究)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 TiCT是一种基于Transformer的时间序列分类基础模型,通过合成数据预训练实现无需微调的上下文学习,有效提升时间序列分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19232 2025-11-25 cs.CL cs.AI 81%

In Machina N400: Pinpointing Where a Causal Language Model Detects Semantic Violations

在机器中N400:定位因果语言模型检测语义违规的位置

Christos-Nikolaos Zacharopoulos, Revekka Kyriakoglou

机构 * Independent Researcher(独立研究者) Université Paris 8 Vincennes - Saint-Denis, Paris, France(巴黎第八大学凡尔赛-圣但尼分校)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究探讨因果语言模型如何检测语义违规,发现模型在中间层能有效区分合理与不合理句子,且违规信息在中间瓶颈后坍塌,与人类阅读中语义异常检测的理论相呼应。

Comments Accepted at AICS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17602 2025-11-25 cs.LG cs.AI 81%

Beyond Surface-Level Similarity: Hierarchical Contamination Detection for Synthetic Training Data in Foundation Models

超越表层相似性:面向基础模型合成训练数据的分层污染检测

Sushant Mehta

机构 * Sushant Mehta

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出分层污染检测框架,用于检测基础模型中合成训练数据的语义污染问题,提升评估准确性与数据可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01144 2025-11-21 eess.IV cs.AI cs.CV cs.LG 81%

LEARNER: Contrastive Pretraining for Learning Fine-Grained Patient Progression from Coarse Inter-Patient Labels

LEARNER: 通过对比学习从粗粒度患者间标签中学习细粒度患者进展

Jana Armouti, Nikhil Madaan, Rohan Panda, Tom Fox, Laura Hutchins, Amita Krishnan, Ricardo Rodriguez, Bennett DeBoisblanc, Deva Ramanan, John Galeotti, Gautam Gare

机构 * Carnegie Mellon University(卡内基梅隆大学) LSUHSC Internal Medicine(LSUHSC内科) Cosmetic Surgery Facility LLC(美容外科诊所有限公司)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 LEARNER通过对比学习利用患者间粗粒度标签,学习细粒度患者内变化,提升个性化医学中的治疗响应预测性能。

Comments Under review at ISBI 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12475 2025-11-18 cs.CL cs.AI 81%

PhayaThaiBERT: Enhancing a Pretrained Thai Language Model with Unassimilated Loanwords

Panyut Sriwirote, Jalinee Thapiang, Vasan Timtong, Attapol T. Rutherford

机构 * Department of Linguistics Chulalongkorn University(语言学系朱拉隆功大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI

Comments revised to fix formatting error, content unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10591 2025-11-14 cs.CL cs.AI 81%

Mined Prompting and Metadata-Guided Generation for Wound Care Visual Question Answering

Bavana Durgapraveen, Sornaraj Sivasankaran, Abhinand Balachandran, Sriram Rajkumar

机构 * EXL Health AI Lab at MEDIQA-WV 2025(EXL健康AI实验室)

专题命中 预训练与数据 :prompting(title,abstract);分类 cs.CL、cs.AI

Comments 2 figures, 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12381 2025-11-14 cs.CL cs.AI 81%

From n-gram to Attention: How Model Architectures Learn and Propagate Bias in Language Modeling

Mohsinul Kabir, Tasfia Tahsin, Sophia Ananiadou

机构 * Department of Computer Science, National Center for Text Mining, The University of Manchester(计算机科学系,文本挖掘国家中心,曼彻斯特大学) Department of Computer Science and Engineering, Islamic University of Technology(计算机科学与工程系,伊斯兰技术大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2025 (Findings)

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10269 2025-11-11 cs.LG cs.AI cs.CY 81%

OpenCity: Open Spatio-Temporal Foundation Models for Traffic Prediction

Zhonghang Li, Long Xia, Lei Shi, Yong Xu, Dawei Yin, Chao Huang

机构 * The University of Hong Kong(香港大学) South China University of Technology(华南理工大学) Baidu Inc.(百度公司)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

Comments 12 pages

Journal ref ACM TIST, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21849 2025-11-07 cs.LG cs.AI 81%

TowerVision: Understanding and Improving Multilinguality in Vision-Language Models

André G. Viveiros, Patrick Fernandes, Saul Santos, Sonal Sannigrahi, Emmanouil Zaranis, Nuno M. Guerreiro, Amin Farajian, Pierre Colombo, Graham Neubig, André F. T. Martins

机构 * Instituto Superior Técnico, Universidade de Lisboa(里斯本大学技术高级学院) Instituto de Telecomunicações(电信研究所) Carnegie Mellon University(卡内基梅隆大学) Sword Health(Sword健康) TransPerfect MICS, CentraleSupélec, Université Paris-Saclay(MICS,中央圣艾尔布里大学,巴黎萨克雷大学) ELLIS Unit Lisbon(里斯本ELLIS单位)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.AI、cs.LG

Comments 15 pages, 7 figures, submitted to arXiv October 2025. All models, datasets, and training code will be released at https://huggingface.co/collections/utter-project/towervision

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14766 2025-11-06 cs.LG cs.AI 81%

This Time is Different: An Observability Perspective on Time Series Foundation Models

Ben Cohen, Emaad Khwaja, Youssef Doubli, Salahidine Lemaachi, Chris Lettieri, Charles Masson, Hugo Miccinilli, Elise Ramé, Qiqi Ren, Afshin Rostamizadeh, Jean Ogier du Terrail, Anna-Monica Toon, Kan Wang, Stephan Xie, Zongzhe Xu, Viktoriya Zhukova, David Asker, Ameet Talwalkar, Othmane Abou-Amal

机构 * Datadog AI Research(Datadog AI研究中心) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15705 2025-11-05 cs.LG cs.AI 81%

Generalisation Bounds of Zero-Shot Economic Forecasting using Time Series Foundation Models

Jittarin Jetwiriyanon, Teo Susnjak, Surangika Ranathunga

机构 * School of Mathematical and Computational Sciences(数学与计算科学学院) Massey University(马斯杰大学)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00049 2025-11-04 cs.LG cs.AI 81%

Adaptive Spatio-Temporal Graphs with Self-Supervised Pretraining for Multi-Horizon Weather Forecasting

Yao Liu

机构 * School of Computer Science, Xiangtan University, Xiangtan, 411105, China(计算机学院,湘潭大学,湘潭,411105,中国)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24159 2025-10-29 astro-ph.GA astro-ph.IM cs.AI cs.LG 81%

Self-supervised Synthetic Pretraining for Inference of Stellar Mass Embedded in Dense Gas

Keiya Hirashima, Shingo Nozaki, Naoto Harada

机构 * Center for Interdisciplinary Theoretical and Mathematical Sciences (iTHEMS) RIKEN(交叉学科理论与数学科学中心(iTHEMS)RIKEN) Department of Earth and Planetary Sciences(地球与行星科学系) Department of Astronomy(天文学系)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

Comments 6 pages, 3 figures, 1 table, accepted for NeurIPS 2025 ML4PS workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15870 2025-10-29 cs.CV cs.AI cs.CL 81%

OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM

Hanrong Ye, Chao-Han Huck Yang, Arushi Goel, Wei Huang, Ligeng Zhu, Yuanhang Su, Sean Lin, An-Chieh Cheng, Zhen Wan, Jinchuan Tian, Yuming Lou, Dong Yang, Zhijian Liu, Yukang Chen, Ambrish Dantrey, Ehsan Jahangiri, Sreyan Ghosh, Daguang Xu, Ehsan Hosseini-Asl, Danial Mohseni Taheri, Vidya Murali, Sifei Liu, Yao Lu, Oluwatobi Olabiyi, Yu-Chiang Frank Wang, Rafael Valle, Bryan Catanzaro, Andrew Tao, Song Han, Jan Kautz, Hongxu Yin, Pavlo Molchanov

机构 * NVIDIA

专题命中 预训练与数据 :LLM(title,abstract);分类 cs.CL、cs.AI

Comments Technical Report. Code: https://github.com/NVlabs/OmniVinci

详情

展开后加载摘要…

URL PDF HTML 收藏