arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-02 至 2026-04-02 共收录 16 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 16 篇

2604.00785 2026-04-02 cs.LG cs.AI cs.DC 91%

Scalable Pretraining of Large Mixture of Experts Language Models on Aurora Super Computer

在Aurora超级计算机上可扩展地预训练大型专家混合语言模型

Dharma Teja Vooturi, Dhiraj Kalamkar, Dipankar Das, Bharat Kaul

机构 * Parallel Computing Lab (India) Intel Corporation(英特尔公司印度并行计算实验室)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);LLM(abstract);large language model(abstract)

AI总结 本文在Aurora超级计算机上展示了大规模预训练大型语言模型,开发了Optimus训练库,预训练了多个MoE模型,并通过定制GPU内核和新型EP-Aware分片优化器提升了训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11737 2026-04-02 cs.AI 89%

Auto-Formulating Dynamic Programming Problems with Large Language Models

利用大语言模型自动生成动态规划问题

Chenyu Zhou, Jingyuan Yang, Linwei Xin, Yitian Chen, Ziyan He, Dongdong Ge

机构 * Antai College of Economics and Management, Shanghai Jiao Tong University(上海交通大学安泰经济与管理学院) Booth School of Business, University of Chicago(芝加哥大学布斯商学院) School of Operations Research and Information Engineering, Cornell University(康奈尔大学运筹学与信息工程学院) Cardinal Operations(杉数科技) Shanghai University of Finance and Economics(上海财经大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出DP-Bench基准和DPLM模型,通过DualReflect生成合成数据,实现动态规划问题的自动化建模,展现了在低数据环境下后向生成的优势及大规模下前向生成的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12463 2026-04-02 cs.CL 88%

Community size rather than grammatical complexity better predicts Large Language Model accuracy in a novel Wug Test

社区规模而非语法复杂性更能预测大型语言模型在新型Wug测试中的准确性

Nikoleta Pantelidou, Evelina Leivada, Raquel Montero, Paolo Morosi

机构 * Universitat Autònoma de Barcelona(巴塞罗那自治大学) Institució Catalana de Recerca i Estudis Avançats(加泰罗尼亚高等研究院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究通过多语言Wug测试评估大型语言模型在形态泛化任务中的表现,发现模型准确性更受语言社区规模和数据量影响,而非语法复杂性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00726 2026-04-02 cs.LG 87%

Exploring Silent Data Corruption as a Reliability Challenge in LLM Training

探索在LLM训练中作为可靠性挑战的静默数据损坏

Anton Altenbernd, Philipp Wiesner, Odej Kao

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究静默数据损坏对LLM预训练的影响,通过GPU矩阵乘法指令注入故障,分析不同位位置、内核函数和执行阶段的敏感性,并提出轻量检测方法以缓解有害参数更新。

Comments 10 Pages, 4 Figures, CCGrid 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00920 2026-04-02 cs.CL 85%

GPT-NL Public Corpus: A Permissively Licensed, Dutch-First Dataset for LLM Pre-training

GPT-NL公共语料库:一个许可宽松、以荷兰语为主的用于大语言模型预训练的数据集

Jesse van Oort, Frank Brinkkemper, Erik de Graaf, Bram Vanroy, Saskia Lensink

专题命中 预训练与数据 :LLM(title,abstract);language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本文介绍了GPT-NL公共语料库,这是最大的许可宽松的荷兰语资源语料库,包含21个纯荷兰语集合,总计360亿个预处理荷兰语标记,以及来自现有数据集的英语、代码和德语/丹麦语标记,旨在为合法、有用且无害的语言模型创造提供支持。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00249 2026-04-02 cs.AI cs.MA 85%

A Safety-Aware Role-Orchestrated Multi-Agent LLM Framework for Behavioral Health Communication Simulation

一种安全意识导向的角色协调多智能体LLM框架用于行为健康沟通模拟

Ha Na Cho

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种安全导向的角色协调多智能体LLM框架,通过协调不同角色的智能体模拟支持性行为健康对话,通过分解对话责任并动态激活智能体以确保安全审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00536 2026-04-02 cs.CL cs.AI 82%

Optimsyn: Influence-Guided Rubrics Optimization for Synthetic Data Generation

Optimsyn: 基于影响的合成数据生成 rubrics 优化

Zhiting Fan, Ruizhe Chen, Tianxiang Hu, Ru Peng, Zenan Huang, Haokai Xu, Yixin Chen, Jian Wu, Junbo Zhao, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Inclusion AI, Ant Group(Inclusion AI, 蚂蚁集团) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江省医学影像人工智能重点实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);SFT(abstract);prompting(abstract)

AI总结 本文提出 Optimsyn 框架,通过影响估计优化 rubrics,提升合成数据生成质量,实现跨领域和模型的泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01155 2026-04-02 cs.SD 82%

FineLAP: Taming Heterogeneous Supervision for Fine-grained Language-Audio Pretraining

FineLAP: 通过异质监督驯化细粒度语言-音频预训练

Xiquan Li, Xuenan Xu, Ziyang Ma, Wenxi Chen, Haolin He, Qiuqiang Kong, Xie Chen

机构 * X-LANCE Lab, Shanghai Jiao Tong University(上海交通大学X-LANCE实验室) SJTU Paris Elite Institute of Technology, Shanghai Jiao Tong University(上海交通大学巴黎卓越工程师学院) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract)

AI总结 本文提出FineLAP,一种新型预训练范式,通过异质数据提升CLAP在clip和frame级对齐能力,引入双流sigmoid损失和聚类采样策略,结合大规模合成SED数据集,实现多任务SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00489 2026-04-02 cs.CL 81%

Adapting Text LLMs to Speech via Multimodal Depth Up-Scaling

通过多模态深度扩展适应文本LLM到语音

Kazuki Yano, Jun Suzuki, Shinji Watanabe

机构 * Tohoku University(东北大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出多模态深度扩展方法,通过在冻结的文本LLM中插入新层并仅训练这些层来适应语音数据,实验表明其在ASR性能上接近全微调,且文本能力退化更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20224 2026-04-02 cs.SD cs.AI 79%

DuoTok: Source-Aware Dual-Track Tokenization for Multi-Track Music Language Modeling

DuoTok:面向多轨音乐语言模型的源感知双轨分词

Rui Lin, Zhiyue Wu, Jiahe Le, Kangdi Wang, Weixiong Chen, Junyu Dai, Tao Jiang

专题命中 预训练与数据 :language model(title,abstract);分类 cs.AI

AI总结 DuoTok通过分阶段解耦方法,实现多轨音乐语言模型中高保真重建、强预测性和跨轨对应性的平衡,达到最佳预测性与保真度的折中。

Comments 17 pages, 5 figures, 8 tables. Project page: https://eps-acoustic-revolution-lab.github.io/DUO_TOK/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12993 2026-04-02 cs.SE cs.CR 75%

SmartPoC: Generating Executable and Validated PoCs for Smart Contract Bug Reports

SmartPoC: 为智能合约漏洞报告生成可执行且验证的PoC

Longfei Chen, Ruibin Yan, Taiyu Wong, Yiyang Chen, Jialai Wang, Chao Zhang

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 SmartPoC通过生成并执行可执行的PoC测试用例,验证审计报告中的漏洞。该方法通过提取关键函数切片、生成-修复-执行循环及差分验证提高可执行性与准确性,实现了高精度和召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00066 2026-04-02 cs.LG 74%

Evolution Strategies for Deep RL pretraining

深度强化学习预训练的进化策略

Adrian Martínez, Ananya Gupta, Hanka Goralija, Mario Rico, Saúl Fenollosa, Tamar Alphaidze

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院)

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 研究比较了进化策略与深度强化学习在不同难度任务中的性能,发现ES在简单任务中可提升DRL效果,但复杂任务中表现不优。

Comments 12 pages, 3 figures, 2 algorithms; EE-568 Reinforcement learning course project

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14377 2026-04-02 cs.CL cs.IR cs.LG 62%

PluriHopRAG: Exhaustive, Recall-Sensitive QA Through Corpus-Specific Document Structure Learning

PluriHopRAG: 通过语料库特定文档结构学习实现全面、召回敏感的问答

Mykolas Sveistrys, Richard Kunert

机构 * Turbit Systems GmbH

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文提出PluriHopRAG,通过学习语料库特定文档结构分解查询,改进多跳问答任务的召回敏感性和全面性,在PluriHopWIND和Loong基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15669 2026-04-02 stat.ML cs.LG 57%

Disentanglement of Sources in a Multi-Stream Variational Autoencoder

多流变分自编码器中的源解耦

Veranika Boukun, Jörg Lücke

机构 * Machine Learning Lab, Department of Medical Physics and Acoustics, Carl von Ossietzky Universität Oldenburg, Germany(德国奥尔登堡卡尔·冯·奥西茨基大学医学物理与声学系机器学习实验室) Research Group AI, Department of Computer Science, University of Innsbruck, Austria(奥地利因斯布鲁克大学计算机科学系人工智能研究组)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出多流变分自编码器,结合离散和连续潜在变量实现源解耦,通过显式源组合模型在解码器中叠加多个源,验证了其在手写数字和声音源分离中的有效性。

Comments 14 pages, 4 figures; expanded literature review, added Algorithm 1, and included new benchmarking results on fixed number of overlapping MNIST sources

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00530 2026-04-02 cs.CV 50%

AceTone: Bridging Words and Colors for Conditional Image Grading

AceTone:连接词语与颜色的条件图像评分

Tianren Ma, Mingxiang Liao, Xijin Zhang, Qixiang Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学) ByteDance(字节跳动)

专题命中 预训练与数据 :language model(abstract)

AI总结 AceTone提出了一种基于多模态条件的颜色评分方法,通过生成颜色转换任务实现统一框架,利用VQ-VAE tokenizer压缩LUT向量并结合大规模数据集训练,提升图像评分的感知和美学一致性。

Comments Accepted by CVPR 2026. Project Page: github.com/martian422/AceTone

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01967 2026-04-02 cs.CV 50%

Harnessing the Power of Local Representations for Few-Shot Classification

利用局部表示力提升少样本分类

Shi Tang, Guiming Luo, Xinchen Ye, Zhiyi Xia

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出通过改进的预训练方法和适应性度量机制,提升少样本分类中对新类别的泛化能力,取得新state-of-the-art成果。

详情

展开后加载摘要…

URL PDF HTML 收藏