arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-05 至 2026-05-05 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12 篇

2511.21086 2026-05-05 cs.CL 88%

Orthographic Constraint Satisfaction and Human Difficulty Alignment in Large Language Models

正交约束满足与大语言模型中的人类难度对齐

Bryan E. Tuck, Rakesh M. Verma

机构 * University of Houston(德克萨斯大学休斯顿分校)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文评估了三种大语言模型在字符级约束满足任务上的表现,发现跨家族性能差异显著大于同家族参数扩展效果,且模型在处理常见词时存在系统性失败,揭示了对分布合理性依赖的问题。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01158 2026-05-05 cs.CY 87%

The Hidden Cost of Thinking: Energy Use and Environmental Impact of LMs Beyond Pretraining

思考的隐性成本:语言模型的能耗与环境影响(超出预训练阶段)

Jacob Morrison, Noah A. Smith, Emma Strubell

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);post-training(abstract);preference optimization(abstract)

AI总结 研究分析了语言模型全开发流程的环境影响,发现推理模型在数据中心能耗上是指令模型的17倍,开发成本占总计算量的82.2%,整体能耗达12.3GWh,排放4251吨CO2eq,水耗15887千升,需纳入环境报告标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03820 2026-05-05 cs.CL 84%

Automatic Correction of Writing Anomalies in Hausa Texts

Hausa 文本中书写异常的自动纠正

Ahmad Mustapha Wali, Sergiu Nisioi

机构 * Human Language Technologies Research Center(人类语言技术研究中心) Faculty of Mathematics and Computer Science(数学与计算机科学学院) University of Bucharest(布加勒斯特大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);language model(abstract);pretraining(abstract);prompting(abstract)

AI总结 本文提出通过微调变压器模型自动纠正 Hausa 文本中的书写异常,构建了大规模噪声-清洁句子对数据集,并展示了 M2M100 等模型在提升下游任务中的效果。

Comments Accepted at ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00933 2026-05-05 cs.LG cs.AI 81%

CGM-JEPA: Learning Consistent Continuous Glucose Monitor Representations via Predictive Self-Supervised Pretraining

CGM-JEPA:通过预测自监督预训练学习一致的连续葡萄糖监测表示

Hada Melino Muhammad, Zechen Li, Flora Salim, Ahmed A. Metwally

机构 * University of New South Wales(新南威尔士大学) Google Research(谷歌研究)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CGM-JEPA框架,通过预测掩码的潜在表示来提升多模态数据的迁移能力,实验显示其在不同场景下均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09625 2026-05-05 cs.CV cs.AI 79%

Grounding Synthetic Data Generation With Vision and Language Models

基于视觉和语言模型的合成数据生成基础

Ümit Mert Çağlar, Alptekin Temizel

机构 * Graduate School of Informatics(信息学院)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.AI

AI总结 本文提出一种视觉-语言 grounded 框架,用于可解释的遥感合成数据增强与评估,引入 ARAS400k 数据集,包含 100k 真实图像和 300k 合成图像,用于语义分割和图像描述生成。

Comments Accepted for presentation at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), Synthetic Data for Computer Vision Workshop (SynData4CV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12964 2026-05-05 cs.CV 78%

Cross-Scale Pretraining: Enhancing Self-Supervised Learning for Low-Resolution Satellite Imagery for Semantic Segmentation

跨尺度预训练:增强低分辨率卫星图像的自监督学习以用于语义分割

John Waithaka, Gustave Bwirayesu, Moise Busogi

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出跨尺度预训练方法,利用高分辨率数据提升低分辨率图像的表示学习和分割性能,通过设计空间亲和组件改进自监督学习框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01356 2026-05-05 cs.LG cs.AI 73%

Model-Based Proactive Cost Generation for Learning Safe Policies Offline with Limited Violation Data

基于模型的主动成本生成:用于在有限违规数据下学习安全策略

Ruiqi Xue, Lei Yuan, Kainuo Cheng, Jing-Wen Yang, Yang Yu

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Polixir Technologies Nanjing, China(南京Polixir科技有限公司) Tencent Game AI Center Shenzhen, China(腾讯深圳游戏AI中心)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PROCO框架,利用大语言模型整合自然语言知识,通过构建保守成本函数和模型基于的模拟,减少约束违规并提升安全性,适用于离线数据中极少或无违规样本的高风险场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01407 2026-05-05 cs.IR cs.CL 70%

The Pre-Training Study of Expanded-SPLADE Models on Web Document Titles

扩展SPLADE模型在网页文档标题上的预训练研究

Hiun Kim, Tae Kwan Lee, Taeryun Won

机构 * Naver(纳维尔)

专题命中 预训练与数据 :language model(abstract,abstract_cn);分类 cs.CL

AI总结 本文研究了不同预训练数据集和预训练选项对MLM预训练模型在检索微调中的影响,发现高检索效果模型多基于通用语料库并使用较高学习率,但检索成本和posting列表长度变异较大,且通用预训练数据集重复对检索效果影响有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01640 2026-05-05 cs.LG cs.CL 62%

Prescriptive Scaling Laws for Data Constrained Training

数据受限训练的规范性扩展定律

Justin Lovelace, Christian Belardi, Srivatsa Kundurthy, Shriya Sudhakar, Kilian Q. Weinberger

机构 * Department of Computer Science(计算机科学系)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文提出新的扩展定律,通过引入过拟合惩罚,改进数据受限训练中的计算分配策略,证明过度重复无效,建议增加模型容量,且通过权重衰减系数比较验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07129 2026-05-05 cs.LG cs.CL 62%

Growing Transformers: Modular Composition and Layer-wise Expansion on a Frozen Substrate

生长变换器:在固定基质上的模块化组合与逐层扩展

A. Bochkov

机构 * Moscow Institute of Physics and Technology (MIPT)(莫斯科物理技术学院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了在固定接口下训练解码器Transformer的约束训练方法,通过逐层扩展模型并保持可训练参数预算,展示了在有限参数下持续学习的可行性及与密集训练的权衡。

Comments Limitations added

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00937 2026-05-05 physics.flu-dyn cs.LG 57%

An ALE-Consistent Graph Neural Operator-Transformer Framework for Fluid-Structure Interaction

一种适用于流固耦合的ALE一致图神经运算-变换器框架

Shihang Zhao, Martín Saravia, Haokui Jiang, Zhiyang Xue, Shunxiang Cao

机构 * Institute for Ocean Engineering(海洋工程研究院) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出一种结合图神经运算与视觉变换器的ALE一致框架,用于预测变形无结构网格上的流固耦合,通过轻量级LSTM网络预测结构运动,并通过ALE一致边界修正提升精度与稳定性。

Comments 29 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01165 2026-05-05 cs.CV 50%

CEZSAR: A Contrastive Embedding Method for Zero-Shot Action Recognition

CEZSAR:一种用于零样本动作识别的对比嵌入方法

Valter Estevam, Rayson Laroca, Helio Pedrini, David Menotti

机构 * Federal Institute of Paraná, Irati, Brasil(巴西南里奥格兰德联邦理工学院) Federal University of Paraná, Curitiba, Brasil(巴西南里奥格兰德联邦大学) Pontifical Catholic University of Paraná, Curitiba, Brasil(巴西南里奥格兰德天主教大学) University of Campinas, Campinas, Brasil(坎皮纳斯大学)

专题命中 预训练与数据 :language model(abstract)

AI总结 本文提出了一种基于对比学习的零样本动作识别方法,通过联合嵌入空间对视频和句子进行编码,解决语义鸿沟和领域偏移问题,实验在UCF-101和Kinetics-400数据集上取得最佳效果。

Comments Accepted for presentation at the International Conference on Pattern Recognition (ICPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏