arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138791 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12393 篇

2603.10963 2026-04-21 cs.CV cs.LG 79%

Pointy - A Lightweight Transformer for Point Cloud Foundation Models

Pointy - 一种轻量级的点云基础模型变压器

Konrad Szafer, Marek Kraft, Dominik Belter

机构 * Institute of Robotics and Machine Intelligence, Poznan University of Technology(机器人与机器智能研究所,波兹南技术大学)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 Pointy通过轻量级的点云变压器架构,在仅使用39k点云数据的情况下,超越了使用超过20万样本训练的更大基础模型,展示了精心设计的训练设置和架构的价值。

Comments To appear in the proceedings of ACIVS 2025. An earlier version was presented at the SCI-FM workshop at ICLR 2025

Journal ref In: Blanc-Talon, J., Delmas, P., Takahashi, H., Yasuhiro, M. (eds) Advanced Concepts for Intelligent Vision Systems. ACIVS 2025. Lecture Notes in Computer Science, vol 15656. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11575 2026-04-14 cs.CL 79%

MIXAR: Scaling Autoregressive Pixel-based Language Models to Multiple Languages and Scripts

MIXAR:将自回归像素基于语言模型扩展到多种语言和文字

Chen Hu, Yintao Tai, Antonio Vergari, Frank Keller, Alessandro Suglia

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 MIXAR是首个基于像素的多语言生成模型,通过八种不同语言和文字训练,提升了多语言任务的性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07466 2026-04-14 cs.CL 79%

Cross-Tokenizer LLM Distillation through a Byte-Level Interface

通过字级接口进行跨分词器语言模型蒸馏

Avyav Kumar Singh, Yen-Chen Wu, Alexandru Cioba, Alberto Bernacchia, Davide Buffelli

机构 * MediaTek Research, Cambridge (United Kingdom)(联发科技研究中心,剑桥(英国)) Orbital Materials, London (United Kingdom)(轨道材料公司,伦敦(英国))

专题命中 预训练与数据 :LLM(title);language model(abstract);分类 cs.CL

AI总结 本文提出字级蒸馏方法,通过统一的字级接口实现跨分词器知识转移,验证了字级作为自然共同基础的有效性,同时指出跨任务改进仍存挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02189 2026-04-14 cs.LG 79%

deCIFer: Crystal Structure Prediction from Powder Diffraction Data using Autoregressive Language Models

deCIFer:基于粉末衍射数据的晶体结构预测方法

Frederik Lizak Johansen, Ulrik Friis-Jensen, Erik Bjørnager Dam, Kirsten Marie Ørnsbjerg Jensen, Rocío Mercado, Raghavendra Selvan

机构 * Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系) Department of Chemistry & Nano-Science Center, University of Copenhagen(哥本哈根大学化学系与纳米科学中心) Department of Computer Science & Engineering, Chalmers University of Technology(查尔姆斯理工大学计算机科学与工程系)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 deCIFer利用自回归语言模型,通过整合粉末X射线衍射数据进行晶体结构预测,实现94%的结构匹配率,为未来复杂实验场景的预测提供基础。

Comments 24 pages, 18 figures, 8 tables. v2: Figure 8 revision. v3: added benchmarks, text revisions. v4: accepted to TMLR (https://openreview.net/forum?id=LftFQ35l47)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10633 2026-04-14 cs.CL 79%

ProUIE: A Macro-to-Micro Progressive Learning Method for LLM-based Universal Information Extraction

ProUIE:一种面向大规模信息提取的宏到微渐进学习方法

Wenda Liu, Zhigang Song, Shuai Nie, Guangyao Liu, Lisung Chen, Binyu Yang, Yaran Chen, Peng Zhou, Hongzhen Wang, Yuchen Liu, Wenyue Hu, Jiaming Xu, Runyu Shi, Ying Huang

机构 * Xiaomi Corporation(小米公司) Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 预训练与数据 :LLM(title,abstract);分类 cs.CL

AI总结 本文提出ProUIE方法,通过宏、中、微三级阶段提升LLM基于统一信息提取性能,实验表明其在多个数据集上优于基线模型,尤其在大规模生产场景中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09849 2026-04-14 cs.CR cs.LG 79%

Improving DNS Exfiltration Detection via Transformer Pretraining

通过变换器预训练改进DNS数据外泄检测

Miloš Tomić, Aleksa Cvetanović, Predrag Tadić

机构 * School of Electrical Engineering, University of Belgrade(贝尔格莱德大学电气工程学院)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 研究变换器预训练对子域级数据外泄检测的影响,通过控制流程验证预训练对分类任务的效果,结果显示在ROC曲线左尾有显著提升,尤其对抗随机初始化基线。

Comments This is the preprint version of the paper. The final version of the paper has been presented at the TELFOR 2025 conference. The paper has 4 pages, 1 figure and 3 tables

Journal ref 2025 33rd Telecommunications Forum (TELFOR), Belgrade, Serbia, 2025, pp. 1-4

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09282 2026-04-14 cs.SD cs.CL 79%

End-to-end Contrastive Language-Speech Pretraining Model For Long-form Spoken Question Answering

端到端对比语言-语音预训练模型用于长形式语音问答

Jiliang Hu, Zuchao Li, Baoyuan Qi, Liu Guoming, Ping Wang

专题命中 预训练与数据 :pretraining(title);language model(abstract);分类 cs.CL

AI总结 本文提出CLSR模型,通过将音频特征转换为文本表示,提升长音频问答任务的性能,实验表明其优于现有方法。

Comments 12 pages, 7 figures, accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08698 2026-04-13 cs.LG q-bio.GN 79%

EvoLen: Evolution-Guided Tokenization for DNA Language Model

EvoLen:基于进化的标记化方法用于DNA语言模型

Nan Huang, Xiaoxiao Zhou, Junxia Cui, Mario Tapia-Pacheco, Tiffany Amariuta, Yang Li, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 EvoLen通过整合进化信息优化DNA标记化,优先保留功能序列模式,提升基因组上下文区分和进化约束对齐,优于标准BPE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11090 2026-04-09 cs.LG stat.ME 79%

Interventional Time Series Priors for Causal Foundation Models

干预时间序列先验用于因果基础模型

Dennis Thumm, Ying Chen

机构 * National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出CausalTimePrior框架,生成合成时间结构因果模型,支持可配置因果图、非线性自回归机制和多干预类型,推动时间序列因果推断的基础模型发展。

Comments ICLR 2026 1st Workshop on Time Series in the Age of Large Models (TSALM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11013 2026-04-08 cs.CL 79%

PIAST: Rapid Prompting with In-context Augmentation for Scarce Training data

PIAST:基于上下文增强的快速提示生成以应对稀少训练数据

Pawel Batorski, Paul Swoboda

机构 * Heinrich Heine Universität Düsseldorf(海因里希·海涅大学杜塞尔多夫)

专题命中 预训练与数据 :prompting(title,abstract);分类 cs.CL

AI总结 PIAST通过生成少量示例快速构建提示,利用蒙特卡洛沙普利估计优化示例效用,实现在有限计算资源下提升文本简化、GSM8K和分类任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04380 2026-04-07 cs.LG 79%

CPT: Controllable and Editable Design Variations with Language Models

CPT:基于语言模型的可控可编辑设计变体

Karthik Suresh, Amine Ben Khalifa, Li Zhang, Wei-ting Hsu, Fangzheng Wu, Vinay More, Asim Kadav

机构 * Adobe Atta

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 本文提出CPT系统,利用解码器-only语言模型生成可编辑的设计变体,通过Creative Markup Language实现结构与细节的精准描述,提升设计流程的可扩展性与个性化。

Comments 18 pages, 6 figures, Accepted at NeurIPS 2025 Workshop on Generative and Protective AI for Content Creation (GenProCC 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03911 2026-04-07 cs.LG q-bio.QM 79%

Align Your Structures: Generating Trajectories with Structure Pretraining for Molecular Dynamics

对齐你的结构:利用结构预训练生成分子动力学轨迹

Aniketh Iyengar, Jiaqi Han, Pengwei Sun, Mingjian Jiang, Jianwen Xie, Stefano Ermon

机构 * Stanford University(斯坦福大学) Lambda, Inc(Lambda公司)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 本文提出利用结构预训练生成分子动力学轨迹的方法,通过扩散模型生成结构并结合插值模块保证时间一致性,有效解决分子动力学数据稀缺问题。

Comments Published at ICLR 2026. 38 pages, 17 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10611 2026-04-03 cs.CV cs.AI 79%

Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding

Molmo2:具有视频理解和 grounding 的开放权重和数据的视觉语言模型

Christopher Clark, Jieyu Zhang, Zixian Ma, Jae Sung Park, Mohammadreza Salehi, Rohun Tripathi, Sangho Lee, Zhongzheng Ren, Chris Dongjoo Kim, Yinuo Yang, Vincent Shao, Yue Yang, Weikai Huang, Ziqi Gao, Taira Anderson, Jianrui Zhang, Jitesh Jain, George Stoica, Winson Han, Ali Farhadi, Ranjay Krishna

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.AI

AI总结 Molmo2 是一种开放源代码的视频语言模型,通过7个新视频数据集和2个多图像数据集,实现了单图像、多图像和视频任务中的点驱动 grounding 能力,其8B模型在短视频计数和描述任务中表现优异,在视频 grounding 任务中超越了现有开源和专有模型。

Comments Updated first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03485 2026-04-03 cs.LG q-bio.QM 79%

TEDDY: A Family Of Foundation Models For Understanding Single Cell Biology

TEDDY:单细胞生物学理解的模型家族

Alexis Chevalier, Soumya Ghosh, Urvi Awasthi, James Watkins, Julia Bieniewska, Nichita Mitrea, Olga Kotova, Kirill Shkura, Andrew Noble, Michael Steinbaugh, Vijay Sadashivaiah, George Dasoulas, Julien Delile, Christoph Meier, Leonid Zhukov, Iya Khalil, Srayanta Mukherjee, Judith Mueller

机构 * BCG AI Science Institute, Boston, USA(BCG人工智能科学研究所,波士顿,美国) MSD (UK) Limited, London, UK(默沙东(英国)有限公司,伦敦,英国)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出TEDDY模型家族,通过扩大预训练数据和利用大规模生物注释提升单细胞基础模型性能,验证了模型在疾病状态识别和生物学探索中的有效性。

Comments ICML 2025 Generative AI and Biology (GenBio) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15828 2026-04-03 cs.CL cs.SD eess.AS 79%

J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling

J-CHAT:用于 spoken dialogue 语言建模的日本大规模口语对话语料库

Wataru Nakata, Kentaro Seki, Hitomi Yanaka, Yuki Saito, Shinnosuke Takamichi, Hiroshi Saruwatari

机构 * The University of Tokyo(东京大学) Keio University(庆应义塾大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 本文提出 J-CHAT,一个76000小时的日本口语对话语料库,用于改进 spoken dialogue 语言模型,通过自动化方法确保高质量和自然性,推动人机对话研究。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20224 2026-04-02 cs.SD cs.AI 79%

DuoTok: Source-Aware Dual-Track Tokenization for Multi-Track Music Language Modeling

DuoTok:面向多轨音乐语言模型的源感知双轨分词

Rui Lin, Zhiyue Wu, Jiahe Le, Kangdi Wang, Weixiong Chen, Junyu Dai, Tao Jiang

专题命中 预训练与数据 :language model(title,abstract);分类 cs.AI

AI总结 DuoTok通过分阶段解耦方法,实现多轨音乐语言模型中高保真重建、强预测性和跨轨对应性的平衡,达到最佳预测性与保真度的折中。

Comments 17 pages, 5 figures, 8 tables. Project page: https://eps-acoustic-revolution-lab.github.io/DUO_TOK/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29644 2026-04-01 cs.LG 79%

Disentangled Graph Prompting for Out-Of-Distribution Detection

解耦图提示用于分布外检测

Cheng Yang, Yu Hao, Qi Zhang, Chuan Shi

机构 * Beijing Key Lab of Intelligent Telecommunications Software and Multimedia, Beijing University of Posts and Telecommunications(北京邮电大学智能通信软件与多媒体北京市重点实验室) China Mobile Group Shaanxi Co., Ltd.(中国移动通信集团陕西有限公司)

专题命中 预训练与数据 :prompting(title,abstract);分类 cs.LG

AI总结 本文提出解耦图提示方法,通过预训练和提示机制捕捉细粒度分布内模式,提升图分布外检测性能,实验表明其在多个数据集上优于现有基线。

Comments Accepted for publication in IEEE Transactions on Knowledge and Data Engineering (TKDE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27950 2026-03-31 cs.LG 79%

Scaling Atomistic Protein Binder Design with Generative Pretraining and Test-Time Compute

基于生成预训练和测试时计算的原子级蛋白质结合物设计扩展

Kieran Didi, Zuobai Zhang, Guoqing Zhou, Danny Reidenbach, Zhonglin Cao, Sooyoung Cha, Tomas Geffner, Christian Dallago, Jian Tang, Michael M. Bronstein, Martin Steinegger, Emine Kucukbenli, Arash Vahdat, Karsten Kreis

机构 * NVIDIA(英伟达) University of Oxford(牛津大学) Mila - Québec AI Institute(米拉-魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) HEC Montréal(蒙特利尔高等商学院) CIFAR AI Chair(CIFAR人工智能主席) AITHYRA School of Biological Sciences, Seoul National University(首尔大学生物科学学院) Interdisciplinary Program in Bioinformatics, Seoul National University(首尔大学生物信息学跨学科项目) Institute of Molecular Biology and Genetics, Seoul National University(首尔大学分子生物学与遗传学研究所) Artificial Intelligence Institute, Seoul National University(首尔大学人工智能研究所)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 本文提出Proteina-Complexa方法,结合生成模型与结构预测,实现高精度蛋白质结合物设计,优于现有生成和幻觉方法,同时扩展至小分子和酶设计。

Comments ICLR 2026 Oral Presentation. Project page: https://research.nvidia.com/labs/genair/proteina-complexa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26049 2026-03-30 cs.CV cs.AI 79%

Seeing Like Radiologists: Context- and Gaze-Guided Vision-Language Pretraining for Chest X-rays

像放射科医生一样观察:面向胸部X光片的上下文和目光引导的视觉-语言预训练

Kang Liu, Zhuoqi Ma, Siyu Liang, Yunan Li, Xiyue Gao, Chao Liang, Kun Xie, Qiguang Miao

机构 * Xidian University(西安电子科技大学) Wuhan University(武汉大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI

AI总结 本文提出CoGaze框架,通过整合临床上下文和放射科医生目光引导,提升胸部X光片的视觉-语言预训练效果,实验显示在多个任务上均优于现有方法。

Comments Code: https://github.com/mk-runner/CoGaze

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25537 2026-03-27 cs.CL 79%

Humans vs Vision-Language Models: A Unified Measure of Narrative Coherence

人类与视觉-语言模型:叙事连贯性的一种统一衡量方法

Nikolai Ilinykh, Hyewon Jang, Shalom Lappin, Asad Sayeed, Sharid Loáiciga

机构 * University of Gothenburg(哥德堡大学) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 研究通过比较人类写作与视觉语言模型生成的叙事,评估视觉基础故事中的叙事连贯性,发现模型在连贯性方面与人类存在系统性差异。

Comments 9 pages of content, 1 page of appendices, 9 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05696 2026-03-27 cs.LG q-bio.QM 79%

SMILES-Mamba: Chemical Mamba Foundation Models for Drug ADMET Prediction

SMILES-Mamba:用于药物ADMET预测的化学Mamba基础模型

Bohao Xu, Yingzhou Lu, Chenhao Li, Ling Yue, Xiao Wang, Tianfan Fu, Minjie Shen, Lulu Chen

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) Stanford University(斯坦福大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Washington(华盛顿大学) Virginia Tech(弗吉尼亚理工大学)

专题命中 预训练与数据 :foundation model(title);pretraining(abstract);分类 cs.LG

AI总结 SMILES-Mamba通过自监督预训练和微调策略,利用未标记和标记数据预测药物ADMET属性,在22个数据集上表现优异,提升分子属性预测准确性并减少对大规模标注数据的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01591 2026-03-24 eess.IV cs.AI cs.CV 79%

Imaging foundation model for universal enhancement of non-ideal measurement CT

用于非理想测量CT通用增强的成像基础模型

Rongjun Ge, Yuxin Liu, Zhan Wu, Shangwen Yang, Yuan Gao, Chenyu You, Ge Wang, Shuo Li, Yuting He, Yang Chen

机构 * School of Instrument Science and Engineering, Southeast University, China(东南大学仪器科学与工程学院, 中国) School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院, 中国) Department of Radiology, Nanjing Drum Tower Hospital, Affiliated Hospital of Medical School, Nanjing University(南京鼓楼医院放射科, 南京大学附属医院) Shandong Fundamental Research Center for Computer Science, Qilu University of Technology (Shandong Academy of Sciences), China(山东省计算机科学基础研究中心, 青鲁科技大学(山东科学院), 中国) Department of Electrical & Computer Engineering, Yale University, USA(耶鲁大学电气与计算机工程系, 美国) Department of Biomedical Engineering, Rensselaer Polytechnic Institute, USA(雷士拉尔理工学院生物医学工程系, 美国) Department of Computer and Data Sciences, Case Western Reserve University, USA(凯斯西储大学计算机与数据科学系, 美国) Department of Biomedical Engineering, Case Western Reserve University, USA(凯斯西储大学生物医学工程系, 美国)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出TAMP模型,通过多尺度集成Transformer架构,提升非理想测量CT图像质量,适用于多种临床场景,实验验证其在医学影像中的有效性。

Comments This paper has been accepted by Nature Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19473 2026-03-23 q-bio.BM cs.LG 79%

Reinforcement-guided generative protein language models enable de novo design of highly diverse AAV capsids

强化引导的生成性蛋白质语言模型实现高多样性的AAV衣壳从头设计

Lucas Ferraz, Ana F. Rodrigues, Pedro Giesteira Cotovio, Mafalda Ventura, Gabriela Silva, Ana Sofia Coroadinha, Miguel Machuqueiro, Catia Pesquita

机构 * LASIGE, Faculdade de Ciências da Universidade de Lisboa(里斯本大学科学学院LASIGE实验室) BioISI, Faculdade de Ciências da Universidade de Lisboa(里斯本大学科学学院BioISI实验室) iBET – Instituto de Biologia Experimental e Tecnológica(生物实验与技术研究所)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 本文提出基于蛋白质语言模型和强化学习的生成设计框架,用于从头设计高多样性的AAV衣壳,通过强化学习引导序列生成,提升序列空间探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16936 2026-03-19 cs.CV cs.AI 79%

TDMM-LM: Bridging Facial Understanding and Animation via Language Models

TDMM-LM:通过语言模型弥合面部理解与动画之间的差距

Luchuan Song, Pinxin Liu, Haiyang Liu, Zhenchao Jin, Yolo Yunlong Tang, Zichong Xu, Susan Liang, Jing Bi, Jason J Corso, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) University of Tokyo(东京大学) University of Michigan(密歇根大学) Voxel51

专题命中 预训练与数据 :language model(title,abstract);分类 cs.AI

AI总结 本文通过语言模型实现面部动作的双向建模,提出TDMM-LM框架,利用生成模型合成面部行为数据集,并通过Motion2Language和Language2Motion任务实现面部动画与理解的统一路径。

Comments 12 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19596 2026-03-18 eess.SP cs.LG 79%

Towards Robust Multimodal Physiological Foundation Models: Handling Arbitrary Missing Modalities

迈向稳健的多模态生理基础模型:处理任意缺失模态

Wei-Bang Jiang, Xi Fu, Yi Ding, Cuntai Guan

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出PhysioOmni模型,通过解耦多模态信号提取通用表示,解决现有方法在跨数据集泛化和缺失模态处理上的不足,实验显示其在情绪识别等任务中表现优异。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15005 2026-03-17 cs.CL 79%

Pretraining and Benchmarking Modern Encoders for Latvian

为拉脱维亚语预训练和基准测试现代编码器

Arturs Znotins

机构 * Institute of Mathematics and Computer Science, University of Latvia(拉脱维亚大学数学与计算机科学学院)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL

AI总结 本文通过预训练基于RoBERTa、DeBERTaV3和ModernBERT架构的拉脱维亚语专用编码器,评估其在拉脱维亚语诊断和语言基准测试中的表现,提出了一种性能优异的模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14420 2026-03-17 cs.AI 79%

Data Darwinism Part II: DataEvolve -- AI can Autonomously Evolve Pretraining Data Curation

数据达尔文主义 第二部分:DataEvolve -- AI可以自主进化预训练数据筛选

Tiantian Mi, Dongming Shan, Zhen Huang, Yiwei Qin, Muhang Xie, Yuxuan Qiao, Yixiu Liu, Chenyang Zhou, Pengfei Liu

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI

AI总结 本文提出DataEvolve框架,通过迭代优化而非手动设计实现预训练数据筛选策略的自动化进化,生成Darwin-CC数据集并在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11378 2026-03-13 cs.SD cs.LG eess.AS 79%

Continued Pretraining for Low-Resource Swahili ASR: Achieving State-of-the-Art Performance with Minimal Labeled Data

持续预训练用于低资源斯瓦希里语语音识别:在极少量标注数据下实现最先进的性能

Hillary Mutisya, John Mugane

机构 * Harvard University(哈佛大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 通过持续预训练和监督微调,在极少量标注数据下实现斯瓦希里语ASR的高性能,较基线提升82%,超越现有最佳系统61%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22511 2026-03-13 cs.CL 79%

Mock Worlds, Real Skills: Building Small Agentic Language Models with Synthetic Tasks, Simulated Environments, and Rubric-Based Rewards

假世界,真实技能:利用合成任务、模拟环境和评分标准奖励构建小型代理语言模型

Yuanjie Lyu, Chengyu Wang, Lei Shen, Jun Huang, Tong Xu

专题命中 预训练与数据 :language model(title);LLM(abstract);分类 cs.CL

AI总结 SYNTHAGENT框架通过合成多样化任务和模拟环境,结合评分标准奖励,提升小型LLM在数学、搜索和工具使用等任务中的代理能力。

Comments The first author prefers the more commonly used English name "Yuanjie Lyu" over "Yuan-Jay Lü", so we have updated it; both refer to the same person

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04731 2026-03-06 cs.LG 79%

When Priors Backfire: On the Vulnerability of Unlearnable Examples to Pretraining

当先验知识失效:在预训练模型中不可学习示例的易受性

Zhihao Li, Gezheng Xu, Jiale Cai, Ruiyi Fang, Di Wu, Qicheng Lao, Charles Ling, Boyu Wang

机构 * Western University(西方大学) Concordia University(康科迪亚大学) Beijing University of Posts and Telecommunications(北京邮电大学) Vector Institute(向量研究所)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 本文提出BAIT方法,通过双层优化机制有效对抗预训练先验对不可学习示例的干扰,保持数据不可学习性。

Comments ICLR 2026 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏