arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-27 至 2026-05-27 共收录 22 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 22 篇

2605.26133 2026-05-27 cs.CL cs.AI cs.LG 93%

Pretraining Data Exposure in Large Language Models: A Survey of Membership Inference, Data Contamination, and Security Implications

大型语言模型中的预训练数据暴露:成员推断、数据污染及安全影响综述

Ziyi Tong, Feifei Sun, Le Minh Nguyen

机构 * Japan Advanced Institute of Science and Technology(日本先进科学研究院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文首次统一综述了大型语言模型中的预训练数据暴露问题,涵盖成员推断和数据污染,形式化定义了暴露级别,回顾了攻击与防御方法,并总结了实证发现及未来研究方向。

Comments accepted by NLDB 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27025 2026-05-27 cs.CL cs.MM 92%

Attribute-Based Diagnosis of LLM Alignment with Hate Speech Annotations

基于属性的LLM与仇恨言论标注的对齐诊断

Mohammad Amine Jradi, Faeze Ghorbanpour, Alexander Fraser

机构 * School of Computation, Information and Technology, TU Munich(计算、信息与技术学院,慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 通过分析LLM在十个主观属性上的判断与人类标注的对齐情况,发现行为显式维度对齐良好而评价维度系统性反转,并提出基于置信度加权岭回归的属性组合方法,重构连续仇恨言论分数,R²达0.71。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26492 2026-05-27 cs.CL cs.AI cs.LG 91%

Elias in the Lighthouse, Again? Diagnosing Low Diversity in LLM Stories

灯塔中的伊莱亚斯,再次?诊断LLM故事中的低多样性

Sil Hamilton, David Mimno

机构 * Department of Information Science(信息科学系)

专题命中 预训练与数据 :LLM(title,title_cn);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过采样20000个故事发现,LLM生成的故事中存在高度重复的词汇(如Elias、灯塔等),这些词汇来自偏好数据而非预训练数据,表明小数据集与强对齐算法的结合可能对多样性产生不成比例的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26437 2026-05-27 econ.GN q-fin.EC 89%

Divergent Minds, Convergent Baselines: A Bounded-Rationality Account of LLM-Human Strategic Behaviour

分歧的思维,趋同的基线:LLM与人类战略行为的有界理性解释

Po Han Teo

专题命中 预训练与数据 :LLM(title,title_cn)

AI总结 本文提出有界理性框架,将人类与LLM在战略博弈中的行为差异归因于计算约束的不同,并给出四个操作测试来区分两者的偏差项δ。

Comments 12 pages, 1 table, no figures. Theoretical prequel paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26161 2026-05-27 cs.LG cs.AI 88%

TSFMAudit: Data Contamination Auditing in Forecasting Time Series Foundation Models

TSFMAudit: 时间序列基础模型中的数据污染审计

Hongkai Li, Shifeng Xie, Lefei Shen, Zhuo Li, Mouxiang Chen, Xiaobin Zhang, Han Fu, Jianling Sun, Xiaoxue Ren, Chenghao Liu

机构 * Zhejiang University(浙江大学) Télécom Paris(巴黎高等电信学院) State Street Technology (Zhejiang) Ltd.(State Street Technology(浙江)有限公司) Datadog

专题命中 预训练与数据 :foundation model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 针对时间序列基础模型(TSFMs)预训练数据污染问题,提出基于探针适应动力学的审计方法TSFMAudit,通过检测微调后损失下降更快且骨干网络移动更小的异常现象来识别污染数据集。

Comments 22 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26454 2026-05-27 cs.CL 86%

Model Unlearning Objectives Vary for Distinct Language Functions

模型遗忘目标因语言功能而异

Berk Atil, Vipul Gupta, Rebecca J. Passonneau

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Scale AI

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出针对不同语言功能(危险知识遗忘和毒性遗忘)应设计不同的遗忘方法,并分别提出基于余弦的元学习变体RMU和多层目标方法,在多个7-8B模型上取得良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26992 2026-05-27 cs.CV 82%

On the Robustness of Machine Unlearning for Vision-Language Models

机器遗忘在视觉-语言模型中的鲁棒性研究

Yujie Lin, Kaidi Jia, Jiayao Ma, Chengyi Yang, Jinsong Su

机构 * Xiamen University(厦门大学)

专题命中 预训练与数据 :language model(title,abstract);prompting(abstract)

AI总结 本文首次系统调查了视觉-语言模型机器遗忘的鲁棒性,通过提出三种攻击范式揭示现有方法往往隐藏而非彻底移除目标知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19673 2026-05-27 cs.CV 82%

InHabit: Leveraging Image Foundation Models for Scalable 3D Human Placement

InHabit: 利用图像基础模型实现可扩展的3D人体放置

Nikita Kister, Pradyumna YM, István Sárándi, Jiayi Wang, Anna Khoreva, Gerard Pons-Moll

机构 * Bosch Center of Artificial Intelligence(博世人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息学院)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract)

AI总结 提出InHabit方法,通过渲染-生成-提升流程利用2D基础模型知识自动生成3D场景中与几何一致的人体交互数据,并构建大规模数据集InHabitants,显著提升3D人体-场景重建和接触估计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26683 2026-05-27 cs.CL cs.AI 81%

An In-Vitro Study on Cross-Lingual Generalization in Language Models

语言模型中跨语言泛化的体外研究

Adrian Cosma

机构 * Dalle Molle Institute for Artificial Intelligence (IDSIA)(达勒莫利人工智能研究所(IDSIA))

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 通过构建两种程序生成的语言,独立控制词汇距离、少数语言比例等变量,研究语言模型跨语言迁移的机制,发现迁移主要取决于分词是否保留可复用的跨语言子结构,且词汇量越小越有利于掩码迁移。

Comments 16 Figures, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26661 2026-05-27 cs.CV cs.AI 79%

Respecting Modality Gap in Post-hoc Out-of-distribution Detection with Pre-trained Vision-Language Models

在预训练视觉语言模型的后验分布外检测中尊重模态差距

Yuanwei Hu, Bo Peng, Yadan Luo, Zhen Fang, Ling Chen, Jie Lu

机构 * The University of Queensland(昆士兰大学) University of Technology Sydney(悉尼科技大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.AI

AI总结 针对预训练视觉语言模型在后验分布外检测中文本原型与视觉原型存在模态差距的问题,提出在线伪监督框架直接在视觉特征空间学习类原型,实现新最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07120 2026-05-27 cs.CL 79%

Anchored Decoding: Provably Reducing Copyright Risk for Any Language Model

锚定解码:可证明降低任何语言模型的版权风险

Jacqueline He, Jonathan Hayase, Wen-tau Yih, Sewoong Oh, Luke Zettlemoyer, Pang Wei Koh

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 提出锚定解码,一种即插即用的推理时方法,通过将生成内容约束在许可训练的安全模型附近,可证明地抑制语言模型逐字复制受版权保护的内容,实现可调的风险-效用权衡。

Comments Accepted to ICML 2026. 53 pages, 14 figures, 22 tables. Code is publicly available at https://github.com/jacqueline-he/anchored-decoding

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11253 2026-05-27 cs.CV cs.LG 79%

Lifting Data-Tracing Machine Unlearning to Knowledge-Tracing for Foundation Models

将数据追踪的机器遗忘提升为基础模型的知识追踪

Yuwen Tan, Boqing Gong

机构 * Boston University(波士顿大学)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出将数据追踪的机器遗忘提升为基础模型的知识追踪,以应对多样化遗忘请求,并更接近人类遗忘机制,通过视觉语言模型案例展示实现范式。

Comments Accepted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27268 2026-05-27 cs.CL cs.AI 79%

Lost in Sampling: Assessing Lexical Reachability in LLMs via the Word Coverage Score (WCS)

迷失在采样中:通过词覆盖率评估大语言模型中的词汇可达性

Samer Awad, Javier Conde, Carlos Arriaga, Tairan Fu, Javier Coronado-Blázquez, Pedro Reviriego

机构 * Information and Processing Telecommunications Center(信息与处理电信中心) Universidad Politécnica de Madrid(马德里理工大学) Politecnico di Milano(米兰理工大学) Banco de España(西班牙银行)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出词覆盖率(WCS)指标,量化标准采样过滤器(如Top-p、Top-k、Min-p)如何抑制低频率高信息词汇的生存率,揭示解码机制对语言多样性的影响。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26788 2026-05-27 cs.CL cs.AI 79%

SeDT: Sentence-Transformer Decision-Transformer Conditioning for Multi-Turn Conversation Reliability

SeDT: 基于句子变换器的决策变换器条件化用于多轮对话可靠性

Ramakrishna Vamsi Setti, Jagadeesh Rachapudi, Sachin Chaudhary, Praful Hambarde, Amit Shukla

机构 * Independent Researcher(独立研究者) Drone Lab, IIT Mandi(IIT曼迪无人机实验室) UPES, Dehradun(德里敦UPES)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型在多轮对话中性能下降的问题,提出一种无需训练和额外数据的推理方法SeDT,通过引入离线强化学习中的return-to-go条件化,利用语义、词汇和位置信号计算累积相关性得分并注释对话历史,显著提升模型性能并降低不可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24296 2026-05-27 cs.AI cs.IR 77%

When Does Synthetic Patent Data Help? Volume-Fidelity Trade-offs in Low-Resource Multi-Label Classification

合成专利数据何时有帮助?低资源多标签分类中的数量-保真度权衡

Amirhossein Yousefiramandi, Ciaran Cooney

机构 * Clarivate, Intellectual Property(Clarivate知识产权)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 研究通过LLM生成合成数据用于多标签专利分类时的数量与保真度权衡,发现低资源场景下数量效应主导,高资源场景下保真度更重要,混合数据策略最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26935 2026-05-27 cs.CL 70%

DunbaaBERT: From Sacrifice to Semantics

DunbaaBERT: 从牺牲到语义

Iffat Maab, Waleed Jamil, Raphael Schmitt

机构 * Research and Development Center for Large Language Models (LLMC), National Institute of Informatics, Tokyo(大型语言模型研发中心(LLMC),信息研究所,东京) School of Computation, Information and Technology, Technical University of Munich, Germany(计算、信息与技术学院,慕尼黑技术大学,德国) Institute of General Practice, Faculty of Medicine and Medical Center, University of Freiburg, Germany(临床医学系,弗赖堡大学医学院及医学中心,德国)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出DunbaaBERT,一种从零训练的乌尔都语RoBERTa-base模型族,通过不同词汇表大小在17GB语料上预训练,在多项下游任务中达到与强多语言基线相当的性能,并发现较大词汇表并不持续提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05141 2026-05-27 cs.CL 70%

To model human linguistic prediction, make LLMs less superhuman

为了模拟人类语言预测,让大语言模型不那么超人类

Byung-Doh Oh, Tal Linzen

机构 * Division of Linguistics and Multilingual Studies, Nanyang Technological University, Singapore(南洋理工大学语言学与多语言研究系,新加坡) Department of Linguistics, New York University, New York, USA(纽约大学语言学系,纽约,美国) Center for Data Science, New York University, New York, USA(纽约大学数据科学中心,纽约,美国)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文指出大语言模型因超人类预测能力而无法解释人类阅读行为,主张通过模拟人类记忆来改进模型,并提出新实验方向。

Comments Accepted to Trends in Cognitive Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10774 2026-05-27 cs.SD cs.AI cs.HC cs.LG 62%

ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis

ParsVoice: 面向文本到语音合成的大规模多说话人波斯语语音语料库

Mohammad Javad Ranjbar Kalahroodi, Heshaam Faili, Azadeh Shakery

机构 * School of Electrical and Computer Engineering, University of Tehran(塔里哈大学电气与计算机工程学院) Institute for Research in Fundamental Sciences (IPM)(基础科学研究所(IPM))

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出ParsVoice,目前最大的公开波斯语语音-文本语料库,通过可扩展的流水线从长篇有声读物构建高质量数据,用于训练多说话人TTS系统,并验证了其在零样本多说话人TTS中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26713 2026-05-27 stat.ML cs.LG 57%

Transformers Can Learn Posterior Predictive Distributions In-Context

Transformer可以在上下文中学习后验预测分布

Gyeonghun Kang, Changwoo J. Lee, Xiang Cheng

机构 * Department of Statistical Science, Duke University, Durham, NC, USA(统计科学系,达勒姆大学,达勒姆,NC,美国) Department of Electrical and Computer Engineering, Duke University, Durham, NC, USA(电气与计算机工程系,达勒姆大学,达勒姆,NC,美国)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文通过构造证明Transformer能够实现针对后验预测均值和方差的梯度下降算法,并研究其逼近后验预测分布的误差界,揭示了归一化和注意力深度对泛化能力的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26282 2026-05-27 cs.LG 57%

Scaling World-Model Reinforcement Learning Through Diffusion Policy Optimization

通过扩散策略优化扩展世界模型强化学习

Xiaoyuan Cheng, Wenxuan Yuan, Zhancun Mu, Yuanzhao Zhang, Yiming Yang, Hai Wang, Zhuo Sun, Che Liu

机构 * Dynamic Systems Lab, University College London(伦敦大学学院动态系统实验室) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Santa Fe Institute(圣塔菲研究所) School of Statistics and Data Science, Shanghai University of Finance and Economics(上海财经大学统计与数据科学学院) Department of Computing, Imperial College London(伦敦帝国理工学院计算系)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 针对世界模型强化学习中搜索与价值学习之间的结构错位问题,提出基于扩散策略优化的模型基方法MBDPO,统一搜索与策略优化,实现可扩展的策略学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01188 2026-05-27 cs.CL 57%

Compute Optimal Tokenization

计算最优分词

Tomasz Limisiewicz, Artidoro Pagnoni, Srini Iyer, Mike Lewis, Sachin Mehta, Alisa Liu, Margaret Li, Gargi Ghosh, Luke Zettlemoyer

机构 * FAIR at Meta(Meta 的 FAIR) University of Washington(华盛顿大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 通过训练988个BLT模型,研究压缩率(每token平均字节数)对缩放趋势的影响,发现计算最优配置下模型参数量与数据字节数成比例,且最优压缩率低于BPE并随计算量下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26578 2026-05-27 cs.IR 50%

Is Position Bias in Dense Retrievers Built In-or Learned from Data?

密集检索器中的位置偏差是内置的还是从数据中学习的?

Daegon Yu, SeungYoon Han, Woomyoung Park

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究密集检索器中位置偏差的来源,通过构造位置偏斜的训练集微调模型,发现训练数据中证据的位置分布是影响检索级偏差方向的主要可控因素,并验证了位置平衡训练可显著降低位置敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏