arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138791 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12393 篇

2602.23135 2026-06-30 cs.LG cs.AI cs.SI 81%

DyGnROLE: Asymmetric Pretraining for Edge Classification on Dynamic Graphs

DyGnROLE:动态图上边分类的非对称预训练

Tyler Bonnet, Marek Rei

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出DyGnROLE,通过非对称预训练学习动态图中源节点与目标节点的异构表示,解决边分类中源目标节点行为不对称性问题,实验表明其在有限标注数据下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18812 2026-06-19 cs.LG cs.AI 新提交 81%

Reinforcement Learning Foundation Models Should Already Be A Thing

强化学习基础模型本应已经存在

Abdelrahman Zighem, Jill-Jênn Vie

机构 * École normale supérieure de Paris, PSL University, Paris, France(巴黎高等师范学院,PSL大学,法国巴黎) Soda team, Inria Saclay, Palaiseau, France(Soda团队,法国国家信息与自动化研究所萨克雷中心,法国帕莱索)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出通过合成MDP构建强化学习基础模型,利用固定大小的充分统计量使注意力架构适用,在线和离线实验均优于传统算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07628 2026-06-19 cs.AI cs.LG 版本更新 81%

SleepMaMi: A Universal Sleep Foundation Model for Integrating Macro- and Micro-structures

SleepMaMi:一种融合宏观与微观结构的通用睡眠基础模型

Keondo Park, Younghoon Na, Yourim Choi, Hyunwoo Ryu, Hyun-Woo Shin, Hyung-Sin Kim

机构 * Graduate School of Data Science, Seoul National University, Seoul, South Korea(首尔国立大学数据科学研究生院,韩国首尔) Department of Biomedical Sciences, Seoul National University College of Medicine, Seoul, Republic of Korea(首尔国立大学医学院生物医学科学系,韩国首尔) Obstructive Upper Airway Research (OUaR) Laboratory, Department of Pharmacology, Seoul National University College of Medicine, Seoul, Republic of Korea(首尔国立大学医学院药理学系阻塞性上气道研究(OUaR)实验室,韩国首尔) Department of Otorhinolaryngology-Head and Neck Surgery, Seoul National University Hospital, Seoul, Republic of Korea(首尔国立大学医院耳鼻喉头颈外科系,韩国首尔)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出SleepMaMi睡眠基础模型,通过分层双编码器设计(宏观编码器建模整夜时间依赖,微观编码器捕捉生物信号短时特征),结合人口统计引导对比学习和混合掩码自编码器训练,在超过2万条PSG记录上预训练,在下游任务中优于或匹配现有基础模型。

Comments 8 pages, Appendix 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19005 2026-06-18 cs.CL cs.LG 新提交 81%

Sumi: Open Uniform Diffusion Language Model from Scratch

Sumi: 从头训练的开放均匀扩散语言模型

Mengyu Ye, Keito Kudo, Wataru Ikeda, Ryosuke Matsuda, Keisuke Sakaguchi, Jun Suzuki

机构 * Tohoku University(东北大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出Sumi,一个从零开始预训练的70亿参数均匀扩散语言模型,在1.5T tokens上训练,性能与同规模自回归模型相当,并开源所有资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04287 2026-06-10 cs.LG cs.CL q-bio.GN 版本更新 81%

Entropy, Disagreement, and the Limits of Foundation Models in Genomics

熵、分歧与基因组基础模型的局限性

Maxime Rochkoulets, Lovro Vrček, Mile Šikić

机构 * Genome Institute of Singapore, A*STAR(新加坡基因组研究院,A*STAR) KU Leuven(卢森堡大学) Faculty of Electrical Engineering and Computing, University of Zagreb(扎格雷布大学电子工程与计算学院)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文通过分析熵对模型学习的影响,发现基因组序列的高熵导致输出分布接近均匀、模型间分歧大和静态嵌入不稳定,且Fisher信息集中在嵌入层,表明仅靠序列自监督训练可能不适用于基因组数据。

Comments Accepted to LMLR Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17907 2026-06-10 cs.CL cs.AI 版本更新 81%

Improving Topic Modeling by Distilling Soft Labels from Language Models

DSL-Topic:通过从语言模型中蒸馏软标签改进主题建模

Raymond Li, Amirhossein Abaskohi, Chuyuan Li, Gabriel Murray, Giuseppe Carenini

机构 * University of Washington(华盛顿大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出DSL框架,通过从语言模型蒸馏软标签来增强主题模型训练,利用上下文感知的软标签重构信号,显著提升主题连贯性和分配准确性。

Comments 22 pages, 5 figures. Camera-ready version for ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05748 2026-06-05 cs.MM cs.AI cs.CL 81%

UNIVID: Unified Vision-Language Model for Video Moderation

UNIVID:用于视频审核的统一视觉语言模型

Kejuan Yang, Yizhuo Zhang, Mingyuan Du, Yue Zhang, Dixin Zheng, Kaili Zhao, Yang Xiao, Hanzhong Liang, Kenan Xiao

机构 * Bytedance(字节跳动)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出UNIVID统一视觉语言模型,通过生成可解释的策略感知字幕,实现端到端视频审核,减少违规泄露42.7%和过度审核率37.0%。

Comments 7 pages, 3 figures. Accepted to ACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05186 2026-06-05 cs.LG cs.CL 81%

Staged Factorial Screening for Budget-Constrained Micro-Pretraining

预算受限的微预训练中的分阶段因子筛选

Felipe Chavarro Polania

机构 * Hewlett Packard Enterprise(惠普企业)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.LG

AI总结 针对预算受限的微预训练,提出分阶段分数因子设计方法,通过短时筛选识别高惩罚方向并确认有效锚点,在共享加速器上实现高效配方筛选。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05029 2026-06-04 cs.LG cs.CL 81%

Validity Threats for Foundation Model Research

基础模型研究的有效性威胁

Gunnar König, Martin Pawelczyk, Ulrike von Luxburg, Sebastian Bordt

机构 * University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心) University of Vienna(维也纳大学)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出一个因果推断评估框架,将基础模型研究中的不同近似实验策略(代理实验、观察性研究、单次运行设计)映射为四种有效性(统计、内部、外部、构念)的权衡,揭示并分析计算节省带来的隐蔽有效性威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03938 2026-06-04 cs.LG cs.AI 81%

q0: Primitives for Hyper-Epoch Pretraining

q0: 超周期预训练的原语

Bishwas Mandal, Shmuel Berman, Akshay Vegesna, Samip Dahal

机构 * Q Labs(Q实验室) Princeton University(普林斯顿大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 针对多周期训练中单模型性能饱和的问题,提出超周期预训练(q0)方法,通过循环调度、链式蒸馏和学习先验三个原语,从多周期预算中生成多样化模型群体并聚合其预测,显著提升数据效率。

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22468 2026-06-03 cs.LG cs.AI 81%

Learning the Neighborhood: Contrast-Free Multimodal Self-Supervised Molecular Graph Pretraining

学习邻域:无对比的多模态自监督分子图预训练

Boshra Ariguib, Mathias Niepert, Andrei Manolache

机构 * University of Tübingen(图宾根大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 提出C-FREE框架,通过预测子图嵌入与互补邻域的关系,融合2D拓扑和3D构象信息,实现无对比、无负样本的多模态自监督分子图预训练,在MoleculeNet上取得最优结果。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01470 2026-06-02 physics.flu-dyn cs.AI cs.LG 81%

Emergent Transfer of a Physics Foundation Model from Simulation to Laboratory Turbulence

物理基础模型从模拟到实验室湍流的涌现迁移

Payel Mukhopadhyay, Stefan S. Nixon, Romain Watteaux, Michael McCabe, Alberto Bietti, Kyunghyun Cho, Cristiana Diaconu, Irina Espejo Morales, David Fouhey, Siavash Golkar, Tom Hehir, Shirley Ho, Jake Kovalic, Geraud Krawezik, Francois Lanusse, Tanya Marwah, Rudy Morel, Mariel Pettee, Helen Qu, Jeff Shen, Hadi Sotoudeh, Stuart B. Dalziel, Miles Cranmer

机构 * University of Cambridge(剑桥大学) CEA, DAM/DIF(法国CEA DAM/DIF) Flatiron Institute(Flatiron研究所) New York University(纽约大学) Princeton University(普林斯顿大学) Yale University(耶鲁大学) AIM, Université Paris-Saclay, Université Paris Cité, CEA, CNRS(AIM,巴黎-萨克雷大学,巴黎城市大学,CEA,CNRS) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Polymathic AI(聚合人工智能)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 通过微调连续介质动力学基础模型Walrus,在仅使用少量模拟数据的情况下,零样本泛化到实验室瑞利-泰勒不稳定性实验,揭示了初始条件在模拟-实验差距中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00241 2026-06-02 cs.LG cs.AI stat.ML 81%

InfoAtlas: A Foundation Model for Zero-Shot Statistical Dependence Estimate

InfoAtlas:用于零样本统计依赖性估计的基础模型

Zhengyang Hu, Yanzhi Chen, Hanxiang Ren, Qunsong Zeng, Youyi Zheng, Adrian Weller, Kaibin Huang, Yanchao Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出InfoAtlas,一种基础模型架构,通过单次前向传播直接推断互信息,实现零样本估计,在保持精度的同时获得100倍加速。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21190 2026-06-01 cs.LG cs.AI 81%

Towards Foundation Models for Zero-Shot Time Series Anomaly Detection: Leveraging Synthetic Data and Relative Context Discrepancy

面向零样本时间序列异常检测的基础模型:利用合成数据和相对上下文差异

Tian Lan, Hao Duong Le, Jinbo Li, Wenjun He, Meng Wang, Chenghao Liu, Chen Zhang

机构 * Department of Industrial Engineering, Tsinghua University, Beijing, China(清华大学工业工程系) Datadog AI Research, Paris, France. This work was completed prior to joining Datadog(Datadog AI 研究院) Lab, Huawei Technologies, ShenZhen, China(华为技术2012实验室)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出基于相对上下文差异(RCD)的预训练范式,通过合成数据训练Transformer模型比较查询模式与上下文,实现零样本时间序列异常检测,在多个基准上超越现有基础模型。

Comments This manuscript is withdrawn, as the authors intend to further extend and develop the work beyond its current scope

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10960 2026-05-29 cs.CL cs.AI 81%

Steering Language Models Before They Speak: Logit-Level Interventions

在语言模型发言前引导它们:Logit 级别的干预

Hyeseon An, Shinwoo Park, Hyundong Jin, Yo-Sub Han

机构 * Department of Computer Science, Yonsei University, Seoul, South Korea(延世大学计算机科学系,首尔,韩国)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出 SWAI 方法,通过基于语料库的 token 统计在 logit 空间直接引导语言模型,无需训练或访问内部激活,在可读性、礼貌性和毒性控制上优于提示和基线方法。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26683 2026-05-27 cs.CL cs.AI 81%

An In-Vitro Study on Cross-Lingual Generalization in Language Models

语言模型中跨语言泛化的体外研究

Adrian Cosma

机构 * Dalle Molle Institute for Artificial Intelligence (IDSIA)(达勒莫利人工智能研究所(IDSIA))

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 通过构建两种程序生成的语言,独立控制词汇距离、少数语言比例等变量,研究语言模型跨语言迁移的机制,发现迁移主要取决于分词是否保留可复用的跨语言子结构,且词汇量越小越有利于掩码迁移。

Comments 16 Figures, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25924 2026-05-26 cs.CL cs.LG 81%

Does Continued Pretraining on a Learner Corpus Improve Automated Essay Scoring on English Proficiency Tests? Evidence from EFCAMDAT

在学习者语料库上继续预训练是否能提高英语水平测试的自动作文评分?来自EFCAMDAT的证据

Duy Anh Nguyen

机构 * University of Greenwich(格林威治大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.LG

AI总结 研究通过在EFCAMDAT学习者语料库上进行领域自适应继续预训练(DAPT),探究其对基于Transformer的自动作文评分(AES)在英语水平测试中的影响,发现全语料库DAPT效果不一,而基于CEFR分级的针对性DAPT能更可靠地提升领域内评分性能。

Comments 16 pages, 3 figures, 10 tables, including references and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02407 2026-05-21 cs.CL cs.CR cs.LG 81%

Towards the Anonymization of the Language Modeling

朝向语言模型的匿名化

Antoine Boutet, Lucas Magnana, Juliette Sénéchal

机构 * INSA Lyon, Inria, CITI, UR3720(里昂国家理工学院、法国国家科学研究中心、CITI、UR3720) Inria, INSA Lyon, CITI, UR3720(法国国家科学研究中心、里昂国家理工学院、CITI、UR3720)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种隐私保护的语言模型方法,通过掩码语言模型(MLM)和因果语言模型(CLM)方法,旨在解决语言模型的匿名化问题,从而促进其共享。研究通过医疗数据集评估了这两种方法,并表明在避免记忆直接和间接标识信息的同时,能够保持高隐私性和高实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13068 2026-05-19 cs.LG cs.AI cs.HC 81%

NeuroRVQ: Multi-Scale Biosignal Tokenization for Generative Foundation Models

NeuroRVQ:多尺度生物信号分词用于生成式基础模型

Konstantinos Barmpas, Na Lee, Dimitrios Chalatsis, William Raftery, Yannis Panagakis, Dimitrios A. Adamos, Nikolaos Laskaris, Alexandros Koliousis, Dario Farina, Stefanos Zafeiriou

机构 * Imperial College London(帝国理工学院伦敦分校) Cogitat National and Kapodistrian University of Athens(国家与资本主义大学雅典分校) Archimedes Research Unit(阿基米德研究单位) Aristotle University of Thessaloniki(亚里士多德大学塞萨洛尼基分校) Northeastern University London(东北大学伦敦分校)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出NeuroRVQ,一种多尺度生物信号分词方法,通过多尺度时序卷积分解生物信号并结合相位感知损失,实现高保真信号重建,验证了高质量分词对下游性能的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16508 2026-05-19 cs.CL cs.AI 81%

The Scaling Laws of Skills in LLM Agent Systems

大语言模型代理系统中技能的扩展规律

Charles Chen, Qiming Yu, Yuhang Gu, Zhuoye Huang, Hanjing Li, Hongyu Liu, Simin Liu, Jinhao Liu, Dengyun Peng, Jiangyi Wang, Zheng Yan, Fanqing Meng, Ethan Qin, Carl Che, Mengkang Hu

机构 * Evolvent AI Team(Evolvent AI团队)

专题命中 预训练与数据 :LLM(title,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究揭示了大规模代理系统中技能扩展的双重规律:路由准确性随库大小对数衰减,执行准确性通过联合路由乘法提升下游任务表现,二者通过路由衰减斜率参数耦合,优化后显著提升性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16088 2026-05-18 cs.LG cs.AI 81%

Multi-level Self-supervised Pretraining on Compositional Hierarchical Graph for Molecular Property Prediction

基于组合层次图的多级自监督预训练用于分子性质预测

Xiayu Liu, Zhengyi Lu, Hou-biao Li

机构 * School of Mathematical Sciences(数学科学学院) University of Electronic Science and Technology of China(电子科技大学) Department of Computer Science and Engineering(计算机科学与工程系) Oakland University(奥克兰大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出MolCHG框架,通过多级自监督预训练提升分子性质预测性能,采用组合层次图组织分子结构,引入bond graph增强bond信息,实现原子与bond语义的平等聚合。

Comments 11pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23068 2026-05-18 cs.LG cs.AI 81%

ExplainerPFN: Towards tabular foundation models for model-free zero-shot feature importance estimations

ExplainerPFN:迈向无模型零样本特征重要性估计的表格基础模型

Joao Fonseca, Julia Stoyanovich

机构 * INESC-ID New York University(纽约大学)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出ExplainerPFN,一种基于TabPFN的表格基础模型,通过预训练合成结构因果数据实现无模型零样本特征重要性估计,展示了其在真实和合成数据集上的竞争力。

Comments 35 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13769 2026-05-14 cs.CL cs.LG 81%

Dense vs Sparse Pretraining at Tiny Scale: Active-Parameter vs Total-Parameter Matching

密集与稀疏预训练在微小规模下的比较:主动参数与总参数匹配

Abdalrahman Wael

机构 * Independent Researcher(独立研究者)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.LG

AI总结 本文研究了在微小预训练规模下密集和混合专家(MoE)Transformer的表现,通过比较主动参数与总参数匹配策略,发现MoE在主动参数匹配下验证损失更优,但总参数匹配下密集模型仍更优。

Comments 10 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22251 2026-05-14 cs.LG cond-mat.mtrl-sci cs.AI 81%

Zatom-1: Towards a Multimodal Foundation Model for 3D Molecules and Materials

Zatom-1:迈向3D分子和材料的多模态基础模型

Alex Morehead, Miruna Cretu, Antonia Panescu, Rishabh Anand, Maurice Weiler, Tynan Perez, Samuel Blau, Steven Farrell, Wahid Bhimji, Anubhav Jain, Hrushikesh Sahasrabuddhe, Pietro Lio, Tommi Jaakkola, Rafael Gomez-Bombarelli, Rex Ying, N. Benjamin Erichson, Michael W. Mahoney

机构 * LBNL(劳伦斯伯克利国家实验室) ICSI(国际计算机科学研究所) University of Cambridge(剑桥大学) Yale University(耶鲁大学) MIT(麻省理工学院) UC Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :foundation model(title);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 Zatom-1是一种跨领域、通用的模型架构,统一了3D分子和材料的生成与预测学习,通过多模态流匹配目标实现高效的预训练和稳定采样,提升了生成推理速度和跨领域预测性能。

Comments 38 pages, 10 figures, 15 tables. ICLR 2026 FM4Science. Code, data, and model weights are available at https://github.com/Zatom-AI/zatom

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15759 2026-05-13 cs.RO cs.AI cs.LG 81%

Simulation Distillation: Pretraining World Models in Simulation for Rapid Real-World Adaptation

模拟蒸馏:在模拟中预训练世界模型以实现快速真实世界适应

Jacob Levy, Tyler Westenbroek, Kevin Huang, Fernando Palafox, Patrick Yin, Shayegan Omidshafiei, Dong-Ki Kim, Abhishek Gupta, David Fridovich-Keil

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Washington(华盛顿大学) FieldAI

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出SimDist框架,利用物理模拟器生成大量动作条件机器人经验,通过蒸馏结构先验提升世界模型性能,实现高效真实世界适应。

Comments Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10737 2026-05-12 cs.CL cs.LG 81%

PolyTruth: Multilingual Disinformation Detection using Transformer-Based Language Models

PolyTruth:基于Transformer语言模型的多语言虚假信息检测

Zaur Gouliev, Jennifer Waters, Chengqian Wang

机构 * School of Information & Communication Studies(信息与通信研究学院) University College Dublin(都柏林大学学院)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文通过比较五种多语言Transformer模型在虚假信息检测任务中的表现,揭示了不同模型在多语言环境下的性能差异及局限性,提出了PolyTruth Disinfo Corpus数据集以促进进一步研究。

Comments 11 pages, 5 figures, 4 tables. Submitted to arXiv in Computation and Language

Journal ref Machine Learning and Principles and Practice of Knowledge Discovery in Databases, ECML PKDD 2025, Communications in Computer and Information Science, vol. 2843, pp. 353-367, Springer, Cham (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09630 2026-05-12 cs.CL cs.LG 81%

Scratchpad Patching: Decoupling Compute from Patch Size in Byte-Level Language Models

字节级语言模型中的Scratchpad补丁:解耦计算与补丁大小

Lin Zheng, Vasilisa Bashlovkina, Timothy Dozat, Dan Garrette, Laura Rimell, Joshua Maynez

机构 * Google DeepMind(谷歌DeepMind) The University of Hong Kong(香港大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出Scratchpad补丁方法,通过在每个补丁中插入临时缓存来优化字节级语言模型的计算效率,提升模型质量并减少KV缓存和推理计算需求。

Comments 23 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10051 2026-05-12 cs.NI cs.AI cs.CR cs.LG 81%

Where Do Flow Semantics Reside? A Protocol-Native Tabular Pretraining Paradigm for Encrypted Traffic Classification

流量语义在哪里?一种协议原生的表格预训练范式用于加密流量分类

Sizhe Huang, Zitong Li, Shujie Yang

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种协议原生的表格预训练范式,解决加密流量分类中传统序列模型的语义丢失问题,通过FlowSem-MAE在保持字段边界和时间模式方面取得显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07756 2026-05-11 cs.LG cs.AI 81%

When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining

当损失对齐:基于梯度的复合损失加权用于高效的预训练

Ivan Karpukhin, Andrey Savchenko

机构 * Sber AI Lab(Sber AI实验室) HSE University(俄罗斯人民友谊大学) ISP RAS Research Center for Trusted Artificial Intelligence(俄罗斯科学院信息与通信系统研究所可信人工智能研究中心)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于梯度的双层方法,通过将复合预训练梯度与下游目标对齐,在线学习预训练损失权重,从而减少超参数调优成本,提升预训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06592 2026-05-08 cs.CV cs.AI cs.LG 81%

DINORANKCLIP: DINOv3 Distillation and Injection for Vision-Language Pretraining with High-Order Ranking Consistency

DINORANKCLIP:基于DINOv3蒸馏与注入的视觉-语言预训练高阶排名一致性方法

Shuyang Jiang, Nan Yu, Yiming Zhang, Zenghui Ding, Zhenyu Wu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Aimaikj(阿米亚克j) HFIPS, Chinese Academy of Sciences(中国科学院HFIPS) University of Science and Technology of China(中国科学技术大学) Chinese Academy of Sciences(中国科学院) National University of Defense Technology(国防科技大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 DINORANKCLIP通过融合DINOv3教师模型与高阶排名一致性损失,改进CLIP在视觉-语言预训练中的表现,提升细粒度和分布外推理能力。

Comments 18 pages, 7 figures, 9 tables. Code will be made publicly available upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏