arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-15 至 2026-06-15 共收录 16 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 16 篇

2508.15503 2026-06-15 cs.SE 90%

Guidelines for Empirical Studies in Software Engineering involving Large Language Models

涉及大语言模型的软件工程实证研究指南

Sebastian Baltes, Florian Angermeir, Chetan Arora, Marvin Muñoz Barón, Chunyang Chen, Lukas Böhme, Fabio Calefato, Neil Ernst, Davide Falessi, Brian Fitzgerald, Davide Fucci, Junda He, Christoph Treude, Marcos Kalinowski, Stefano Lambiase, Daniel Russo, Mircea Lungu, Cristina Martinez Montes, Lutz Prechelt, Paul Ralph, Rijnard van Tonder, Stefan Wagner

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 针对大语言模型在软件工程研究中的非确定性、不透明训练数据和快速演化问题,通过22位研究者的协作,提出七种研究类型分类和八条设计报告指南,以提升实证研究的可重复性和可复现性。

Comments 86 pages, 4 tables, accepted in Empirical Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22108 2026-06-15 cs.LG cs.AI 版本更新 89%

Learning What to Predict: Downstream-Guided Task Design for Continued Pretraining

学习预测什么:下游引导的持续预训练任务设计

Shuqi Ke, Giulia Fanti

机构 * Department of ECE(电子工程系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :pretraining(title,summary_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出V-pretraining方法,通过轻量级任务设计器为无标签批次构建目标或视图,利用下游损失的一阶减少作为反馈,指导自监督更新,提升目标能力而不损害泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13873 2026-06-15 cs.LG cs.CL 新提交 88%

Natively Unlearnable Large Language Models

原生不可学习的大语言模型

Gaurav R. Ghosal, Pratyush Maini, Aditi Raghunathan

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出NULLs模型,通过共享骨干和稀疏激活的sinks分离数据源贡献,实现无需梯度更新的高效遗忘,在维基百科上验证了单篇文章遗忘的有效性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20086 2026-06-15 cs.CL 版本更新 86%

OLaPh: Optimal Language Phonemizer

OLaPh: 最优语言音素化器

Johannes Wirth

机构 * Institute for Information Systems at Hof University of Applied Sciences(霍夫应用科学大学信息学院)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出OLaPh混合框架,结合多语言词典、NLP技术和统计子词分割,在WikiPron基准上显著优于基线,并通过LLM合成语料探索神经泛化能力。

Comments 12 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13808 2026-06-15 cs.CL 新提交 81%

The Culture Funnel: You Can't Align What isn't in the Data

文化漏斗:你无法对齐不在数据中的内容

Ananya Sahu, Mehrnaz Mofakhami, Daniel D'Souza, Thomas Euyang, Julia Kreutzer, Marzieh Fadaee

机构 * Cohere Labs(Cohere实验室)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);pretraining(abstract);post-training(abstract);分类 cs.CL

AI总结 针对当前文化对齐方法依赖推理时干预而忽视训练数据的问题,提出文化数据漏斗概念,通过多维标签框架分析预训练、微调、对齐和推理数据集,发现后训练阶段文化信号急剧下降,多语言性虽增强地理多样性但未能确保平衡,所提标签可提升下游文化基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13918 2026-06-15 cs.SE cs.CR 新提交 80%

Bayesian-Calibrated Detection of Hallucinated Package Imports in AI-Assisted Code

AI辅助代码中幻觉包导入的贝叶斯校准检测

Lom M. Hillah, Jean-Marc Richard, Ryan Hasnaoui

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出贝叶斯校准层,基于三元认知分类法输出Beta后验概率,并利用PyPI元数据检测注册但可疑的包,优于二元基线。

Comments 23 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26759 2026-06-15 cs.LG 版本更新 79%

Time Series Causal Discovery via Context-Conditioned and Causality-Augmented Pretraining

基于上下文条件与因果增强预训练的时间序列因果发现

Biao Ouyang, Tengxue Zhang, Zhihao Zhuang, Yang Shu, Chenjuan Guo, Bin Yang

机构 * East China Normal University(东华师范大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 提出PTCD框架,通过上下文条件建模和可迁移因果增强的预训练范式,提升跨任务时间序列因果发现的泛化能力,在多个真实OOD数据集上因果发现和根因识别表现优异。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14325 2026-06-15 cs.CL cs.AI 新提交 79%

Achieving Precise Text-To-Cypher Via Grounded Knowledge Graph Data Generation

通过基于知识图谱的数据生成实现精确的文本到Cypher转换

Francesco Cazzaro, Jessica Lennon, Ariadna Quattoni

机构 * Universitat Politècnica de Catalunya(波兰理工大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出一种自动合成数据生成方法,微调小型LLM以提升Text2Cypher性能,使其在本地部署中与大型专有模型竞争,保障数据主权。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14257 2026-06-15 cs.CL 新提交 70%

The Linguistics Olympiads: Towards a New Corpus for Linguistics Research?

语言学奥林匹克:语言学研究的语料库新方向?

Vlad A. Neacsu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨语言学奥林匹克问题作为语言学语料库的潜力,分析其优势与局限,并提出在学术研究中负责任使用的标准。

Comments Accepted for publication in LingBaW. Linguistics Beyond and Within (Volume 12, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13760 2026-06-15 cs.CY 新提交 67%

Stability and Political Orientation of International LLMs: An Exploratory Multi-Run Study Conducted in French

国际大语言模型的稳定性与政治倾向:一项在法语中进行的探索性多轮研究

Gabriel Hanna, Pierre Hanna

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本研究通过政治指南针问卷在法语环境下测试11个国际大语言模型,分析其政治回答的稳定性和隐含倾向,发现模型间及运行间存在显著差异。

Comments 21 pages. Also available in French

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14043 2026-06-15 physics.hist-ph physics.data-an physics.soc-ph 新提交 67%

A Unified Subject Map for 130 Years of Physics

130年物理学的统一学科地图

Khoa Nguyen, Pragyan Pandey, Sophie Li, Eric Y. Ma

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 利用前沿大语言模型为美国物理学会历史档案统一分配现代物理主题词表,生成1893-2025年所有论文的学科地图,支持量化分析和数据驱动研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14639 2026-06-15 cs.SD cs.AI 新提交 57%

From Self-Supervised Speech Models to Mixture-of-Experts for Robust Anti-Spoofing

从自监督语音模型到混合专家系统以实现鲁棒的防欺骗

Hugo Daumain, Driss Matrouf, Khaled Khelif, Mickael Rouvier

机构 * Université d'Avignon(阿维尼翁大学) Airbus Defence & Space(空中客车防务与航天公司)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 将自监督语音模型转换为混合专家架构,通过层间门控机制增强泛化能力,在14个欺骗数据集上将宏EER从5.46%降至4.81%。

Comments 8 pages, 3 figures, accepted at Odyssey 2026 (The Speaker and Language Recognition Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14460 2026-06-15 cs.CL cs.HC 新提交 57%

A Computational Audit of Demographic Association Encoding in ClinicalBERT Language Predictions

ClinicalBERT 语言预测中人口统计关联编码的计算审计

Kehinde Temitayo Soetan

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 通过两种探针方法审计 ClinicalBERT 中的表征偏差,发现模型主要放大而非继承训练数据中的统计差异。

Comments 17 pages, 4 tables, appendices A-E, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13929 2026-06-15 cs.CV cs.LG 新提交 57%

Self-Evolving Visual Questioner

自演化视觉提问器

Yijun Liang, Hengguang Zhou, Ming Li, Lichen Li, Cho-Jui Hsieh, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学帕克分校) University of California, Los Angeles(加州大学洛杉矶分校) Peking University(北京大学) Arena MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.LG

AI总结 提出自演化框架,让视觉语言模型作为提问器和过滤器,无需外部监督即可生成更难、更信息丰富、更视觉中心的问题,并保持探索多样性以避免训练崩溃,显著提升自主提问质量和难度边界。

Comments 21 pages, including references and appendix. Project Page is available at https://joliang17.github.io/SelfEvolvingVQG/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13700 2026-06-15 eess.SP cs.CV 新提交 50%

C-MambaPose: A Physics-Informed Complex Mamba Framework for Cross-Environment WiFi Human Pose Estimation

C-MambaPose:一种物理信息驱动的复杂Mamba框架用于跨环境WiFi人体姿态估计

Phuc Nguyen H

机构 * VinUniversity(文大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出C-MambaPose,一种结合物理信息的复值Mamba-GraFormer混合框架,通过相位保留表示和动态选择性感受野的时空复杂Mamba编码器,实现跨环境WiFi三维人体姿态估计,在MM-Fi数据集上以3.78M参数达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05213 2026-06-15 eess.AS 版本更新 50%

BabAR: from phoneme recognition to developmental measures of young children's speech production

BabAR:从音素识别到幼儿语音产出的发展性测量

Marvin Lavechin, Elika Bergelson, Roger Levy

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出跨语言音素识别系统BabAR,利用多语种儿童语音语料库TinyVox训练,通过预训练和上下文微调提升性能,自动测量与发育评估一致。

详情

展开后加载摘要…

URL PDF HTML 收藏