arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138791 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12393 篇

2603.04606 2026-03-06 cs.LG physics.plasm-ph 79%

PDE foundation model-accelerated inverse estimation of system parameters in inertial confinement fusion

偏微分方程基础模型加速惯性约束聚变系统参数反演

Mahindra Rautela, Alexander Scheinker, Bradley Love, Diane Oyen, Nathan DeBardeleben, Earl Lawrence, Ayan Biswas

机构 * AOT-IC Group, Los Alamos National Laboratory(AOT-IC组,洛斯阿拉莫斯国家实验室) CAI Division, Los Alamos National Laboratory(CAI部门,洛斯阿拉莫斯国家实验室) HPC Division, Los Alamos National Laboratory(HPC部门,洛斯阿拉莫斯国家实验室)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 本研究利用偏微分方程基础模型加速惯性约束聚变系统参数反演,通过微调和轻量级头部训练实现高精度超光谱重建与参数回归。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03806 2026-03-05 cs.CV cs.AI 79%

Separators in Enhancing Autoregressive Pretraining for Vision Mamba

分离器在增强视觉Mamba自回归预训练中的应用

Hanpeng Liu, Zidan Wang, Shuoxi Zhang, Kaiyuan Gao, Kun He

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI

AI总结 本文提出STAR方法,通过引入分隔符技术扩展视觉Mamba的输入序列长度,提升其在ImageNet-1k上的准确率至83.5%

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04593 2026-03-05 cs.CL 79%

Manipulating language models' training data to study syntactic constraint learning: the case of English passivization

操控语言模型的训练数据以研究句法约束学习:以英语被动化为例

Cara Su-Yi Leong, Tal Linzen

机构 * Department of Linguistics, New York University(语言学系,纽约大学) Department of Linguistics and Center for Data Science, New York University(语言学系和数据科学中心,纽约大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 本研究通过操控语言模型训练数据,探讨英语被动化例外的习得机制,发现频率和语义因素共同影响动词被动化能力。

Comments Journal of Memory and Language

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02333 2026-03-04 cs.CL 79%

Characterizing Memorization in Diffusion Language Models: Generalized Extraction and Sampling Effects

刻画扩散语言模型中的记忆化:通用提取与采样效应

Xiaoyu Luo, Wenrui Yu, Qiongxiu Li, Johannes Bjerva

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 本文研究了扩散语言模型的记忆化现象,提出通用概率提取框架并验证其理论,显示DLMs在记忆化信息泄露方面优于自回归模型。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11582 2026-03-03 cs.LG cs.CV q-bio.NC 79%

Brain-Semantoks: Learning Semantic Tokens of Brain Dynamics with a Self-Distilled Foundation Model

Brain-Semantoks: 通过自蒸馏基础模型学习脑动态的语义标记

Sam Gijsen, Marc-Andre Schulz, Kerstin Ritter

机构 * Hertie Institute for AI in Brain Health, University of Tübingen(图宾根大学脑健康人工智能研究所) Tübingen AI Center, University of Tübingen(图宾根大学图宾根人工智能中心) Charité – Universitätsmedizin Berlin, Department of Psychiatry and Psychotherapy(柏林夏里特医学院心理治疗系)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 Brain-Semantoks通过自蒸馏基础模型学习脑动态的语义标记,提升fMRI时间序列在下游任务中的性能。

Comments Accepted at ICLR 2026. Code and pretrained models available at https://github.com/SamGijsen/Brain-Semantoks

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23465 2026-03-03 cs.AI 79%

ViTSP: A Vision Language Models Guided Framework for Solving Large-Scale Traveling Salesman Problems

ViTSP:一种由视觉语言模型引导的解决大规模旅行商问题的框架

Zhuoli Yin, Yi Ding, Reem Khir, Hua Cai

专题命中 预训练与数据 :language model(title,abstract);分类 cs.AI

AI总结 ViTSP利用预训练视觉语言模型指导大规模TSP求解,通过识别子问题提升全局解的质量,实验表明其在大规模实例上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04097 2026-03-03 cs.LG 79%

Do Vision-Language Models Leak What They Learn? Adaptive Token-Weighted Model Inversion Attacks

视觉-语言模型是否会泄露所学内容?基于自适应令牌加权的模型逆向攻击

Ngoc-Bao Nguyen, Sy-Tuyen Ho, Koh Jun Hao, Ngai-Man Cheung

机构 * Singapore University of Technology and Design (SUTD)(新加坡科技设计大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 本研究提出SMI-AW攻击方法,揭示视觉-语言模型在隐私泄露方面的脆弱性,通过自适应令牌加权提升图像重建效果,验证了VLMs在敏感领域中的隐私风险。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23804 2026-03-02 cs.LG 79%

Actor-Critic Pretraining for Proximal Policy Optimization

行为克隆预训练用于近端策略优化

Andreas Kernbach, Amr Elsheikh, Nicolas Grupp, René Nagel, Marco F. Huber

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 本文提出了一种基于行为克隆的actor-critic预训练方法,用于近端策略优化,通过初始化actor和critic网络提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07452 2026-02-27 cs.CR cs.CL 79%

PATCH: Mitigating PII Leakage in Language Models with Privacy-Aware Targeted Circuit PatcHing

PATCH: 通过隐私意识的针对性电路修补缓解语言模型中的PII泄露

Anthony Hughes, Vasisht Duddu, N. Asokan, Nikolaos Aletras, Ning Ma

机构 * University of Sheffield(谢菲尔德大学) University of Waterloo(滑铁卢大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 PATCH通过针对性电路修补减少语言模型中的PII泄露,实现更好的隐私-实用性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20307 2026-02-25 cs.LG 79%

In-context Pre-trained Time-Series Foundation Models adapt to Unseen Tasks

上下文预训练时间序列基础模型适应于未见任务

Shangqing Xu, Harshavardhan Kamarthi, Haoxin Liu, B. Aditya Prakash

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出ICTP框架,通过增强时间序列基础模型的上下文学习能力,使其无需微调即可提升在未见任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16552 2026-02-23 cs.IR cs.CL 79%

Revela: Dense Retriever Learning via Language Modeling

Revela:通过语言建模进行密集检索器学习

Fengyu Cai, Tong Chen, Xinran Zhao, Sihao Chen, Hongming Zhang, Sherry Tongshuang Wu, Iryna Gurevych, Heinz Koeppl

机构 * Technical University of Darmstadt(达姆施塔特技术大学) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软) Tencent AI Lab(腾讯人工智能实验室)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 Revela通过语言建模方法实现自监督检索器学习,无需标注数据即可在多个基准上超越监督模型。

Comments Accepted to ICLR 2026 (Oral). Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16696 2026-02-19 q-bio.GN cs.LG q-bio.QM 79%

Parameter-free representations outperform single-cell foundation models on downstream benchmarks

无需参数的表示方法在下游基准测试中优于单细胞基础模型

Huan Souza, Pankaj Mehta

机构 * Department of Physics, Boston University, Boston, MA, 02215, USA Faculty of Computing Data Science, Boston University, \ , MA, 02215, USA

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 无需参数的表示方法在单细胞基础模型的下游任务中表现优异,通过简单线性方法超越传统深度学习模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16422 2026-02-19 eess.IV cs.AI cs.CV 79%

Automated Histopathology Report Generation via Pyramidal Feature Extraction and the UNI Foundation Model

通过金字塔特征提取和UNI基础模型实现自动化病理报告生成

Ahmet Halici, Ece Tugba Cebeci, Musa Balci, Mustafa Cini, Serkan Sokmen

机构 * ViseurAI

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出基于UNI基础模型和Transformer解码器的框架,通过金字塔特征提取和生物医学术语分词技术,实现全切片图像的自动化报告生成,并通过检索验证提升可靠性。

Comments 9 pages. Equal contribution: Ahmet Halici, Ece Tugba Cebeci, Musa Balci

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15897 2026-02-19 cs.CL 79%

Mitigating Gradient Inversion Risks in Language Models via Token Obfuscation

通过令牌混淆缓解语言模型中的梯度倒置风险

Xinguo Feng, Zhongkui Ma, Zihan Wang, Alsharif Abuadbba, Guangdong Bai

机构 * The University of Queensland(昆士兰大学) CSIRO's Data61(CSIRO的数据61部门) City University of Hong Kong(香港城市大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 本文提出GHOST机制,通过令牌混淆解耦梯度、嵌入和令牌空间的联系,有效缓解语言模型的梯度倒置风险,同时保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19919 2026-02-18 cs.CL 79%

Your AI Bosses Are Still Prejudiced: The Emergence of Stereotypes in LLM-Based Multi-Agent Systems

你的AI老板仍然有偏见:基于LLM的多智能体系统中刻板印象的出现

Jingyu Guo, Yingying Xu

专题命中 预训练与数据 :LLM(title,abstract);分类 cs.CL

AI总结 研究发现基于LLM的多智能体系统中会自发产生刻板印象,且这种现象在互动轮次和决策权力增加时更加显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02674 2026-02-18 cs.CL 79%

Examining Language Modeling Assumptions Using an Annotated Literary Dialect Corpus

利用标注的文学方言语料库检验语言模型假设

Craig Messner, Tom Lippincott

机构 * Center for Digital Humanities(数字人文中心) Johns Hopkins University(约翰霍普金斯大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 本文通过标注的文学方言语料库,探讨了不同语言建模假设对正写法变化信息提取的影响,发现词标注方案对模型表现有显著影响。

Comments Accepted to NLP4DH@EMNLP2024

Journal ref Proceedings of the 4th International Conference on Natural Language Processing for Digital Humanities (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07087 2026-02-11 cs.LG 79%

When Should We Introduce Safety Interventions During Pretraining?

在预训练过程中何时引入安全干预

Dylan Sam, Sachin Goyal, Pratyush Maini, Alexander Robey, J. Zico Kolter

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 本文研究了在预训练过程中何时引入安全干预以提高模型鲁棒性,发现20%-60%的预训练阶段引入干预效果最佳,且早期干预能更清晰地区分安全与有害内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15792 2026-02-11 cs.LG physics.chem-ph 79%

Deep Learning Foundation Models from Classical Molecular Descriptors

从经典分子描述符构建深度学习基础模型

Jackson W. Burns, Akshat Shirish Zalte, Charlles R. A. Abreu, Jochen Sieg, Christian Feldmann, Miriam Mathea, William H. Green

机构 * BASF SE(巴斯夫股份有限公司)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 CheMeleon通过低噪声分子描述符学习,实现超越经典方法的分子性质预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06654 2026-02-09 cs.IR cs.AI 79%

Multimodal Generative Retrieval Model with Staged Pretraining for Food Delivery on Meituan

具有分阶段预训练的多模态生成检索模型用于美团外卖

Boyu Chen, Tai Guo, Weiyu Cui, Yuqing Li, Xingxing Wang, Chuan Shi, Cheng Yang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI

AI总结 本文提出一种具有分阶段预训练的多模态生成检索模型,通过分阶段任务优化和语义ID利用,提升美团外卖检索性能与商业收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05347 2026-02-06 cs.CL 79%

How Do Language Models Acquire Character-Level Information?

语言模型如何获取字符级信息?

Soma Sato, Ryohei Sasano

机构 * Graduate School of Informatics, Nagoya University(名古屋大学信息学研究科)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 本研究通过对比不同训练设置,揭示了语言模型获取字符级信息的机制,发现合并规则、正字法约束以及子字符串的语义关联和句法信息是关键因素。

Comments Accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17923 2026-02-05 cs.CL 79%

Language models can learn implicit multi-hop reasoning, but only if they have lots of training data

语言模型可以学习隐式多跳推理,但只有在有大量训练数据的情况下

Yuekun Yao, Yupei Du, Dawei Zhu, Michael Hahn, Alexander Koller

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 本文研究了语言模型通过大量训练数据学习隐式多跳推理的能力,并发现训练数据量随推理跳数呈指数增长,但通过课程学习可部分缓解这一需求。

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02511 2026-02-04 cs.CY cs.AI 79%

Training Data Governance for Brain Foundation Models

脑基础模型的训练数据治理

Margot Hanley, Jiunn-Tyng Yeh, Ryan Rodriguez, Jack Pilkington, Nita Farahany

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI

AI总结 本文探讨了在神经数据上训练基础模型所面临的伦理挑战,提出治理框架以规范数据使用和保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02425 2026-02-03 cs.LG q-bio.QM 79%

Repurposing Protein Language Models for Latent Flow-Based Fitness Optimization

重新利用蛋白质语言模型进行潜在流基于的适应度优化

Amaru Caceres Arroyo, Lea Bogensperger, Ahmed Allam, Michael Krauthammer, Konrad Schindler, Dominik Narnhofer

机构 * University of Zurich(苏黎世大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 CHASE通过重新利用预训练蛋白质语言模型的进化知识,结合潜在流匹配模型,在蛋白质设计中实现高适应度变体的高效生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15048 2026-02-03 cs.CL 79%

MaiBERT: A Pre-training Corpus and Language Model for Low-Resourced Maithili Language

MaiBERT: 一种针对低资源马尔瓦里语的预训练语料库和语言模型

Sumit Yadav, Raju Kumar Yadav, Utsav Maskey, Gautam Siddharth Kashyap, Ganesh Gautam, Usman Naseem

机构 * IOE, Pulchowk Campus, Lalitpur, Nepal(尼泊尔拉利特普尔 Pulchowk 校区 IOE) Macquarie University, Sydney, Australia(澳大利亚悉尼麦考瑞大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 MaiBERT是一种针对马尔瓦里语的预训练语言模型,通过掩码语言建模技术在新构建的语料库上训练,实现了新闻分类任务中的高准确率,优于现有区域模型。

Comments Accepted at EACL LoResLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00573 2026-02-03 cs.CL 79%

Training a Utility-based Retriever Through Shared Context Attribution for Retrieval-Augmented Language Models

通过共享上下文归因训练基于效用的检索器以增强检索增强语言模型

Yilong Xu, Jinhua Gao, Xiaoming Yu, Yuanhai Xue, Baolong Bi, Huawei Shen, Xueqi Cheng

机构 * State Key Lab of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) Key Lab of AI Safety, Chinese Academy of Sciences(人工智能安全重点实验室,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 SCARLet通过共享上下文归因和多任务泛化提升检索增强语言模型的检索性能。

Comments EMNLP 2025 Main Conference (Long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00594 2026-02-03 cs.CL cs.SD eess.AS 79%

Kanade: A Simple Disentangled Tokenizer for Spoken Language Modeling

Kanade:一种简单的解耦语音分词器用于语音语言建模

Zhijie Huang, Stephen McIntosh, Daisuke Saito, Nobuaki Minematsu

机构 * The University of Tokyo(东京大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 Kanade是一种单层解耦语音分词器,通过分离声学常量实现高质量语音建模,达到最先进的说话人解耦和词汇可用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18302 2026-01-27 cs.CL 79%

Suppressing Final Layer Hidden State Jumps in Transformer Pretraining

抑制变换器预训练中的最终层隐藏状态跳跃

Keigo Shibata, Kazuki Yano, Ryosuke Takahashi, Jaesung Lee, Wataru Ikeda, Jun Suzuki

机构 * Tohoku University(东京东京大学) RIKEN(日本研究机构) NII LLMC(国家信息基础设施(NII)语言大模型中心)

专题命中 预训练与数据 :pretraining(title);language model(abstract);分类 cs.CL

AI总结 本文提出JREG正则化器,通过抑制变换器预训练中的最终层隐藏状态跳跃,提升模型任务性能。

Comments Accepted to the Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17047 2026-01-27 cs.CV cs.LG eess.IV 79%

A Contrastive Pre-trained Foundation Model for Deciphering Imaging Noisomics across Modalities

一种用于跨模态解码成像噪声组学的对比预训练基础模型

Yuanjie Gu, Yiqun Wang, Chaohui Yu, Ang Xuan, Fan Wang, Zhi Lu, Biqin Dong

机构 * College of Biomedical Engineering, Yiwu Research Institute, Fudan University, Shanghai, China(复旦大学生物医学工程学院) Department of Psychological and Cognitive Sciences, Tsinghua University, Beijing, China(清华大学心理学与认知科学系) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) DAMO Academy, Alibaba Group, Beijing, China(阿里云达摩院) Hupan Laboratory, Hangzhou, Zhejiang, China(华平实验室)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出CoP基础模型,通过对比学习解码成像噪声,实现无需大量数据的高性能噪声分析,提升跨模态成像诊断的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13223 2026-01-26 cs.LG 79%

Data Matters Most: Auditing Social Bias in Contrastive Vision Language Models

数据最为关键:审计对比视觉语言模型中的社会偏见

Zahraa Al Sahili, Ioannis Patras, Matthew Purver

机构 * Queen Mary University of London(伦敦女王学院) Institut Jožef Stefan(Jožef Stefan研究所)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 研究通过对比CLIP和OpenCLIP模型,发现数据来源是偏见的主要驱动因素,不同去偏策略在不同模型和数据规模下效果各异。

Comments Published at TMLR; updated version

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12930 2026-01-21 cs.LG cs.NI 79%

Universal Embedding Function for Traffic Classification via QUIC Domain Recognition Pretraining: A Transfer Learning Success

通过QUIC领域识别预训练实现通用嵌入函数用于流量分类:一种迁移学习的成功

Jan Luxemburk, Karel Hynek, Richard Plný, Tomáš Čejka

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 本文提出通过预训练QUIC领域识别模型实现通用嵌入函数,用于提升加密流量分类的迁移学习性能。

Journal ref IEEE Transactions on Network and Service Management, vol. 23, pp. 1647-1663, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏