arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-13 至 2026-07-13 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 9 篇

2607.09204 2026-07-13 cs.CL cs.LG 新提交 88%

Complexity-Guided Component-wise Initialization for Language Model Pretraining

用于语言模型预训练的复杂度引导的逐组件初始化

Konstantin Garbers, Nicholas Oh

机构 * Peking University(北京大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.LG

AI总结 研究预训练语言模型中反复出现的谱模式能否用于初始化,通过分析多个检查点构建初始化方案并与其他方法比较,发现预训练权重复用有竞争力,但仅粗略谱匹配非可靠策略,预训练谱是有用诊断,有效复用需保留更多信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03979 2026-07-13 cs.LG cs.AI 版本更新 84%

Language Models Need Sleep: Learning to Self-Modify and Consolidate Memories

语言模型需要睡眠:学习自我修改和巩固记忆

Ali Behrouz, Farnoosh Hashemi, Adel Javanmard, Vahab Mirrokni

机构 * Google(谷歌) Cornell University(康奈尔大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 受人类学习过程启发,提出“睡眠”范式,通过记忆巩固(知识播种)和梦境(自我改进)两阶段,使模型持续学习、将短期记忆转化为长期知识并自我提升。

Comments A version of this work has been publicly available from September 2025 on OpenReview

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10798 2026-07-13 cs.LG 新提交 83%

CITRAS-FM: Tiny Time Series Foundation Model for Covariate-Informed Zero-Shot Forecasting

CITRAS-FM: 面向协变量信息零样本预测的微型时间序列基础模型

Yosuke Yamaguchi, Issei Suemitsu, Yuki Kajihara, Wenpeng Wei

机构 * University of Tokyo(东京大学) Keio University(庆应大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 提出CITRAS-FM,一个仅7M参数的时间序列基础模型,通过引入Shifted Attention和协变量合成方法CovSynth,实现高效零样本预测,在100个任务上达到子10M模型最优精度且CPU推理时间低于0.1秒。

Comments Accepted to EUSIPCO 2026. Code available at https://github.com/hitachi-ais/citras-fm

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09487 2026-07-13 cs.LG cs.CL stat.ML 新提交 81%

Neural Collapse Is Forbidden: Information Floors in Language Models

语言模型中的信息下限:神经坍缩是被禁止的

Bruno Abrahao

机构 * NYU Shanghai Leonard N. Stern School of Business, New York University(纽约大学上海纽约大学斯特恩商学院)

专题命中 预训练与数据 :language model(title);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究语言模型中信息分配定律,通过单行中心化恒等式等方法,揭示宏观类别结构与令牌内上下文方差占比,理论上说明权重衰减影响,证明二元类别下限,表明定律在多方面成立及预训练中类别份额变化规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09543 2026-07-13 cs.LG q-bio.NC 新提交 77%

CoCoT-EEG: Contrastive-Pretrained Multiscale Convolutional Transformer for EEG Decoding

CoCoT-EEG:用于脑电解码的对比预训练多尺度卷积Transformer

Gabriel Mahuas, Victoria Shevchenko, Ugo Tanielian, Yassir Bendou, Richard Gao

机构 * Sigma Nova Paris(巴黎西格玛诺瓦公司) Goethe University Frankfurt(法兰克福歌德大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);prompting(abstract);分类 cs.LG

AI总结 研究针对EEG解码,开发了含多尺度时间卷积输入层和Transformer编码器块的对比预训练模型CoCoT,在广泛基准解码任务中表现出色,优于单任务解码模型,证明对比学习构建EEG基础模型可行,还给出架构设计考量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29858 2026-07-13 cs.CL 版本更新 77%

Smooth Scaling Laws Hide Stepwise Token Learning

平滑缩放定律隐藏了逐步的令牌学习

Pingjie Wang, Zechen Hu, Peiru Yang, Fu Guo, Debing Zhang

机构 * Dots Studio, Xiaohongshu Inc.(dots studio,小红书公司) Shanghai Jiao Tong University(上海交通大学) Tsinghua university(清华大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 本文提出令牌级框架,将缩放定律分解为上下文令牌的局部学习事件,通过拟合S形曲线发现令牌学习集中在局部转换中,并利用学习时间谱定量重建验证损失导数,进而通过重塑训练分布实现11%的验证损失加速降低。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10145 2026-07-13 cs.CL 版本更新 77%

Lost in Backpropagation: The LM Head is a Gradient Bottleneck

陷入反向传播:语言模型头部是一个梯度瓶颈

Nathan Godey, Yoav Artzi

专题命中 预训练与数据 :LLM(abstract_cn);language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 语言模型头部的梯度瓶颈导致表达和优化受限,影响训练效率,需新设计

Comments To be presented at COLM'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09024 2026-07-13 cs.CV cs.AI 新提交 70%

Video Generation Models are General-Purpose Vision Learners

视频生成模型是通用视觉学习者

Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu

机构 * Google DeepMind(谷歌DeepMind)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI

AI总结 研究探讨计算机视觉中实现通用模型的催化剂,提出大规模文本到视频生成是预训练范式。介绍GenCeption模型,利用视频生成扩散主干定义感知模型。实验表明该模型在多任务中性能领先,有数据效率优势且具涌现行为,为通用视觉智能提供基础路径。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09378 2026-07-13 quant-ph cs.AI cs.CR 新提交 57%

When Routes Run Out: Adversarial Co-Learning and Explainable Robustness in Quantum Repeater Networks

当路线耗尽时:量子中继器网络中的对抗协同学习与可解释鲁棒性

Brennan Bell, Inti Gabriel Mendoza Estrada, Andreas Trügler, Paul Erker

机构 * RFI-IRFOS and TU Graz(RFI-IRFOS和格拉茨技术大学) openmaind FlexCo and TU Graz(openmaind FlexCo和格拉茨技术大学) Know Center Research GmbH and University of Graz(Know Center Research GmbH和格拉茨大学) Atominstitut, TU Wien and IQOQI, ÖAW(原子院、维也纳技术大学和ÖAW IQOQI)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI

AI总结 研究量子中继器网络路由对抗博弈问题,通过对抗协同学习,发现保留率与参考值紧密跟踪,拟合决策树解释模型并报告忠实度,构建提示记录形成开源解释工作流程。

Comments 4 pages, 5 figures, submitted to IEEE QCE26, Workshop on Q-GenAI: Synergies between QC & GenAI

详情

展开后加载摘要…

URL PDF HTML 收藏