arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-19 至 2026-05-19 共收录 40 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 40 篇

2508.06524 2026-05-19 cs.CL cs.AI cs.CY cs.DC cs.LG 92%

CarbonScaling: Extending Neural Scaling Laws for Carbon Footprint in Large Language Models

CarbonScaling:扩展神经缩放定律以用于大型语言模型中的碳足迹

Lei Jiang, Fan Chen

机构 * Indiana University(印第安纳大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CarbonScaling框架,结合神经缩放定律和分布式训练策略,准确建模前沿LLM训练的碳足迹,提高硬件配置和排放估计的精度。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25525 2026-05-19 cs.CL cs.HC 92%

From Chatbots to Confidants: A Cross-Cultural Study of LLM Adoption for Emotional Support

从聊天机器人到知己:一项跨文化的LLM用于情感支持的使用研究

Natalia Amat-Lefort, Mert Yazan, Amanda Cercas Curry, Flor Miriam Plaza-del-Arco

机构 * Leiden University(莱顿大学) Hogeschool van Amsterdam(阿姆斯特丹大学) Independent Researcher(独立研究员)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究探讨了不同国家用户对LLM用于情感支持的接受度及影响因素,通过大规模跨文化调查发现社会经济地位是关键预测因素,并揭示了多语言提示语中用户主要寻求帮助的领域。

Comments 28 pages (9 pages main text, 19 pages references and appendices), 14 figures. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18562 2026-05-19 stat.ME cs.AI cs.LG stat.AP 91%

Estimating Item Difficulty with Large Language Models as Experts

利用大语言模型作为专家估算项目难度

Diana Kolesnikova, Kirill Fedyanin, Abe D. Hofman, Matthieu J. S. Brinkhuis, Maria Bolsinova

机构 * Department of Methodology and Statistics, Tilburg University(蒂尔堡大学方法学与统计学系) Smart Business Technologies(智能商务技术公司) Department of Psychological Methods, University of Amsterdam(阿姆斯特丹大学心理方法系) Prowise Learn, Amsterdam(Prowise Learn公司,阿姆斯特丹) Department of Information and Computing Sciences, Utrecht University(乌得勒支大学信息与计算科学系)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本文研究了如何利用大语言模型估算新任务的难度,通过对比不同配置下的模型表现,发现基于对偶比较的配置在无额外优化时表现更优,而结合token概率和已知难度示例的绝对判断配置也表现出中等至高水平的对齐度。

Comments 24 pages, 2 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14466 2026-05-19 cs.CL cs.AI 88%

Toward Robust Multilingual Adaptation of LLMs for Low-Resource Languages

迈向低资源语言LLM鲁棒多语言适应

Haolin Li, Haipeng Zhang, Mang Li, Yaohua Wang, Lijie Wen, Yu Zhang, Biqing Huang

机构 * Department of Automation, Tsinghua University, Beijing, China(清华大学自动化系) Alibaba International Digital Commerce Group, Beijing, China(阿里巴巴国际数字 commerce 集团) School of Software, Tsinghua University, Beijing, China(清华大学软件学院)

专题命中 预训练与数据 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LiRA框架,通过轻量级微调实现低资源语言LLM的鲁棒多语言适应,结合Arca和LaSR组件提升跨语言语义一致性与表示稳定性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13397 2026-05-19 cs.CY cs.AI 88%

The threat of analytic flexibility in using large language models to simulate human data

使用大语言模型模拟人类数据时分析灵活性的威胁

Jamie Cummins

机构 * University of Bern, Switzerland(伯尔尼大学,瑞士) University of Oxford, United Kingdom(牛津大学,英国)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文研究了在使用大语言模型生成合成数据时,分析选择对合成数据与人类数据一致性的影响,发现不同的配置选择可能导致结论差异显著,呼吁关注分析灵活性的潜在威胁并提出减少该威胁的策略。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17528 2026-05-19 cs.LG cs.AI cs.CL 88%

CasualSynth: Generating Structurally Sound Synthetic Data

CasualSynth: 生成结构上合理的合成数据

Zehua Cheng, Wei Dai, Jiahao Sun, Thomas Lukasiewicz

机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系) Institute of Logic and Computation, TU Wien(维也纳技术大学逻辑与计算研究所)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CasualSynth框架,通过解耦因果结构生成与语义实现,生成既符合因果机制又语义丰富的合成数据,解决了LLM在生成合成数据时无法保证因果正确性的问题。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17849 2026-05-19 cs.CL cs.AI cs.LG 87%

Generating Pretraining Tokens from Organic Data for Data-Bound Scaling

从有机数据生成预训练令牌以实现数据驱动的扩展

Zichun Yu, Chenyan Xiong

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SynPro框架,通过重新表述和重新格式化操作,帮助大语言模型更充分地利用有限的有机数据,从而在数据驱动的预训练中实现更高效的扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16455 2026-05-19 cs.CR 85%

MalwarePT: A Binary-Level Foundation Model for Malware Analysis

MalwarePT:一种用于恶意软件分析的二进制级基础模型

Saastha Vasan, Yuzhou Nie, Kaie Chen, Yigitcan Kaya, Hojjat Aghakhani, Roman Vasilenko, Wenbo Guo, Christopher Kruegel, Giovanni Vigna

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出MalwarePT,一种基于ModernBERT编码器的二进制级基础模型,通过预训练实现跨任务的迁移学习,提升恶意软件分析中API预测和功能分类的性能。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05813 2026-05-19 cs.LG math.OC 84%

Where Does Warm-Up Come From? Adaptive Scheduling for Norm-Constrained Optimizers

自适应调度机制:规范约束优化器中的暖启动来源

Artem Riabinin, Andrey Veprikov, Arman Bolatov, Martin Takáč, Aleksandr Beznosikov

机构 * Basic Research of Artificial Intelligence Laboratory(人工智能基础研究实验室) Federated Learning Problems Laboratory(联邦学习问题实验室) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Innopolis University(因诺普里斯大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文研究了规范约束优化器的自适应学习率调度,提出了一种通用平滑性假设,证明了在优化轨迹中局部曲率随次优间隙减小,从而自然产生暖启动而非人工设定。

Comments 30 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16600 2026-05-19 cs.LG cs.AI cs.CL 82%

Where Pretraining writes and Alignment reads: the asymmetry of Transformer weight space

预训练写入,对齐读取:Transformer权重空间的不对称性

Valeria Ruscio, Eli-Shaoul Khedouri, Keiran Thompson

机构 * Intuition Machines

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示了预训练和对齐在Transformer权重空间中的不对称性,通过分析权重变化在残差流激活子空间和预测子空间中的对齐情况,发现读路径权重集中于注意力输入激活的主方向,而写路径权重在预测子空间中保持各向同性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19134 2026-05-19 cs.CL cs.IR 81%

QuCo-RAG: Quantifying Uncertainty from the Pre-training Corpus for Dynamic Retrieval-Augmented Generation

QuCo-RAG:从预训练语料库中量化不确定性以实现动态检索增强生成

Dehai Min, Kailin Zhang, Tongtong Wu, Lu Cheng

机构 * University of Illinois at Chicago(伊利诺伊大学香槟分校) New York University(纽约大学) Monash University(莫纳什大学)

专题命中 预训练与数据 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL

AI总结 本研究提出QuCo-RAG,通过从预训练语料库中提取客观统计信息来量化不确定性,以解决动态检索增强生成中大语言模型的幻觉问题,实验表明其在多跳问答基准测试中优于现有方法,并在多个模型上实现了显著的提升。

Comments ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16691 2026-05-19 cs.CL cs.DC cs.MA 81%

Responsible Federated LLMs via Safety Filtering and Constitutional AI

通过安全过滤和宪法AI实现负责任的联邦大语言模型

Eunchung Noh, Jeonghun Baek

机构 * Samsung Electronics(三星电子) The University of Tokyo(东京大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出在联邦大语言模型中引入安全过滤和宪法AI技术,以提升模型安全性,实验显示在AdvBench上安全性能提升超过20%。

Comments Accepted at the 6th Workshop on Trustworthy NLP (TrustNLP), ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13068 2026-05-19 cs.LG cs.AI cs.HC 81%

NeuroRVQ: Multi-Scale Biosignal Tokenization for Generative Foundation Models

NeuroRVQ:多尺度生物信号分词用于生成式基础模型

Konstantinos Barmpas, Na Lee, Dimitrios Chalatsis, William Raftery, Yannis Panagakis, Dimitrios A. Adamos, Nikolaos Laskaris, Alexandros Koliousis, Dario Farina, Stefanos Zafeiriou

机构 * Imperial College London(帝国理工学院伦敦分校) Cogitat National and Kapodistrian University of Athens(国家与资本主义大学雅典分校) Archimedes Research Unit(阿基米德研究单位) Aristotle University of Thessaloniki(亚里士多德大学塞萨洛尼基分校) Northeastern University London(东北大学伦敦分校)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出NeuroRVQ,一种多尺度生物信号分词方法,通过多尺度时序卷积分解生物信号并结合相位感知损失,实现高保真信号重建,验证了高质量分词对下游性能的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16508 2026-05-19 cs.CL cs.AI 81%

The Scaling Laws of Skills in LLM Agent Systems

大语言模型代理系统中技能的扩展规律

Charles Chen, Qiming Yu, Yuhang Gu, Zhuoye Huang, Hanjing Li, Hongyu Liu, Simin Liu, Jinhao Liu, Dengyun Peng, Jiangyi Wang, Zheng Yan, Fanqing Meng, Ethan Qin, Carl Che, Mengkang Hu

机构 * Evolvent AI Team(Evolvent AI团队)

专题命中 预训练与数据 :LLM(title,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究揭示了大规模代理系统中技能扩展的双重规律:路由准确性随库大小对数衰减,执行准确性通过联合路由乘法提升下游任务表现,二者通过路由衰减斜率参数耦合,优化后显著提升性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17846 2026-05-19 eess.AS 80%

UrduSpeech: A 156-Hour Urdu Speech Corpus with 12-Dimension Paralinguistic Annotations

UrduSpeech: 一个包含12维副语言标注的156小时乌尔都语语音语料库

Attia Nafees ul Haq, Zeyu Zhu, Jingbin Hu, ChunJiang He, Lei Xie

专题命中 预训练与数据 :LLM(summary_cn,abstract)

AI总结 本文提出UrduSpeech语料库,包含156小时乌尔都语语音和12维副语言标注,通过LLM驱动的流程处理多种类别,如新闻、戏剧和罕见文学形式,并发布了一个9小时的基准集,用于评估语音质量。

Comments 6 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18491 2026-05-19 cs.CV 78%

Benchmarking transferability of SSL pretraining to same and different modality segmentation tasks

对SSL预训练在相同和不同模态分割任务中转移性的基准测试

Jue Jiang, Harini Veeraraghavan

机构 * Department of Medical Physics, Memorial Sloan Kettering Cancer Center(医学物理系,纪念斯隆凯特勒癌症中心)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文通过九种SSL方法在相同和不同模态的分割任务中进行基准测试,评估了预训练模型的迁移能力和效率,发现自蒸馏masked image transformer在分割精度、收敛速度和少量样本到大量样本的性能差距方面表现最佳。

Comments Paper submitted to Medical Physics for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17957 2026-05-19 cs.SE 78%

Contextualized Code Pretraining for Code Generation

基于上下文的代码预训练用于代码生成

Chen Liu, Qingyuan Liang, Hanwen Zhang, Zeyu Sun, Yakun Zhang, Lu Zhang

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出了一种基于上下文的代码预训练方法,通过整合调用上下文来改进代码生成模型的训练和评估,实验表明该方法在代码生成任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10239 2026-05-19 cs.CV 78%

AdaptSplat: Adapting Vision Foundation Models for Feed-Forward 3D Gaussian Splatting

AdaptSplat: 为前馈3D高斯点划法适应视觉基础模型

Mingwei Xing, Xinliang Wang, Yifeng Shi

机构 * Ke Holdings Inc.(凯控股公司)

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 本文提出AdaptSplat,通过在通用架构中引入一个仅含1.5M参数的轻量级适配器,有效提升了前馈3D高斯点划法在跨领域泛化和高频几何保真度方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18732 2026-05-19 cs.CL cs.AI cs.LG 75%

Predictable Confabulations: Factual Recall by LLMs Scales with Model Size and Topic Frequency

可预测的编造:大型语言模型的事实回忆能力随模型大小和主题频率而增加

Matthew L. Smith, Jonathan P. Shock, Samuel T. Segun, Iyiola E. Olatunji, Tegawendé F. Bissyandé

机构 * International Development Research Centre Canada(加拿大国际发展研究中心) University of Cape Town(开普敦大学) Global Center on AI Governance(人工智能治理全球中心) SnT, University of Luxembourg(卢森堡大学SnT分校) CITADEL AI Centre of Excellence, Burkina Faso(布基纳法索CITADEL人工智能卓越中心)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨了大型语言模型在事实回忆方面的可预测性,发现模型大小和训练数据中主题频率是影响回忆质量的关键因素,且模型大小和主题频率的组合能解释60%-94%的方差。

Comments 18 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18552 2026-05-19 cs.LG q-bio.BM q-bio.QM 74%

Protein Fold Classification at Scale: Benchmarking and Pretraining

大规模蛋白质折叠分类:基准测试与预训练

Dexiong Chen, Andrei Manolache, Mathias Niepert, Karsten Borgwardt

机构 * Max Planck Institute of Biochemistry(马克斯·普朗克生物化学研究所) Computer Science Department, University of Stuttgart(斯图加特大学计算机科学系)

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 本文提出TEDBench,一个大规模非冗余的蛋白质折叠分类基准,通过Encyclopedia of Domains和Foldseek-clustered AlphaFold结构构建。基于此基准,作者提出Masked Invariant Autoencoders (MiAE)框架,通过高掩码率和SE(3)不变编码器实现蛋白质结构表示学习,从而在TEDBench上取得优异性能。

Comments Accepted at ICML 2026 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08704 2026-05-19 cs.CV cs.LG 74%

Rethinking Generative Image Pretraining: How Far Are We From Scaling Up Next-Pixel Prediction?

重新思考生成图像预训练:我们离扩大下一步像素预测还有多远?

Xinchen Yan, Chen Liang, Lijun Yu, Adams Wei Yu, Yifeng Lu, Quoc V. Le

机构 * Google Deepmind(谷歌DeepMind)

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 本文研究了自回归下一步像素预测的扩展特性,探讨了统一视觉模型中简单且端到端但尚未充分探索的框架。通过在32x32分辨率的图像上训练Transformer模型,评估了三个目标指标:下一步像素预测目标、ImageNet分类准确率和基于生成的完成度(通过Fr'echet距离测量)。研究发现,最优扩展策略高度依赖任务,且随着图像分辨率的增加,模型大小必须比数据量增长得更快。通过预测发现,计算能力是主要瓶颈,而非训练数据量。随着计算能力每年增长四到五倍,预计在五年内可实现像素级图像建模。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18607 2026-05-19 cs.CL cs.LG 73%

Forecasting Downstream Performance of LLMs With Proxy Metrics

通过代理指标预测大语言模型的下游性能

Arkil Patel, Siva Reddy, Marius Mosbach, Dzmitry Bahdanau

机构 * Mila – Quebec AI Institute & McGill University(魁北克AI研究院与麦吉尔大学) CIFAR AI Chair(CIFAR人工智能主席) ServiceNow Research Periodic Labs(ServiceNow研究周期实验室)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过聚合候选模型的下一个token分布中的token级统计信息(如熵、top-k准确率和专家token排名)来构建代理指标,以更准确地预测大语言模型的下游性能,优于传统的损失和计算量基线方法。

Comments Preprint. 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00901 2026-05-19 cs.LG cs.CL 73%

Provable Knowledge Acquisition and Extraction in One-Layer Transformers

在单层变换器中可证明的知识获取与提取

Ruichen Xu, Kexin Chen

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了单层变换器中知识获取与提取的机制,通过理论分析和实验验证,揭示了预训练和微调过程中知识存储与提取的关系,以及低秩微调如何恢复预训练的事实知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08702 2026-05-19 cs.CL 70%

Scaling Laws for Code: A More Data-Hungry Regime

代码的缩放规律:一个更数据渴求的阶段

Xianzhen Luo, Wenzhen Zheng, Qingfu Zhu, Rongyi Zhang, Houyi Li, Siming Huang, YuanTao Fan, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学) Chinese Academy of Sciences(中国科学院) Fudan University(复旦大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了代码的缩放规律,通过大规模实验发现Farseer定律在准确性上更优,代码模型在模型大小上表现良好,但需要更高的数据与参数比,且在代码-自然语言混合数据中,自然语言在资源受限场景下有益,但在更高计算预算下成为负担。

Comments Accepted by ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17180 2026-05-19 cs.LG math.OC stat.ML 70%

The Geometry of Projection Heads: Conditioning, Invariance, and Collapse

投影头的几何学:条件性、不变性与坍缩

Faris Chaudhry

机构 * Department of Computing, Imperial College London, United Kingdom(伦敦帝国学院计算机系,英国)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出了一种投影头的几何理论,通过将投影头建模为可训练的黎曼度量来研究自监督学习中的条件性、不变性和坍缩问题,揭示了投影头在不同深度下的适应能力和稳定性。

Comments Accepted at ICML 2026. 29 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18530 2026-05-19 cs.CL cs.AI cs.LG stat.ML 67%

Continuous Diffusion Scales Competitively with Discrete Diffusion for Language

连续扩散在语言领域中能与离散扩散竞争性地扩展

Zhihan Yang, Wei Guo, Shuibai Zhang, Subham Sekhar Sahoo, Yongxin Chen, Arash Vahdat, Morteza Mardani, John Thickstun

机构 * NVIDIA & Cornell(NVIDIA与康奈尔大学) NVIDIA & Georgia Tech(NVIDIA与佐治亚理工学院) UW-Madison(威斯康星大学麦迪逊分校) MBZUAI-IFM(梅兰德大学-IFM) Cornell(康奈尔大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了连续扩散模型在语言建模中的扩展能力,通过改进Plaid模型构建RePlaid,证明连续扩散模型在计算效率和性能上可与离散模型竞争,并提供了理论支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18610 2026-05-19 cs.CV cs.AI cs.LG 62%

CATA: Continual Machine Unlearning via Conflict-Averse Task Arithmetic

CATA: 通过冲突厌恶任务算术实现持续机器去学习

Shen Lin, Junhao Dong, Rongjie Chen, Xiaoyu Zhang, Li Xu, Xiaofeng Chen

机构 * Fujian Normal University(福建师范大学) Nanyang Technological University(南洋理工大学) Xidian University(西安电子科技大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文首次研究了视觉语言模型的持续去学习问题,提出CATA方法,通过冲突厌恶任务算术有效解决去学习中的有效性、模型保真度和持续性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18232 2026-05-19 cs.CL cs.AI cs.IR 62%

SomaliWeb v1: A Quality-Filtered Somali Web Corpus with a Matched Tokenizer and a Public Language-Identification Benchmark

SomaliWeb v1: 一个经过质量过滤的索马里网页语料库,配有匹配的分词器和公开的语言识别基准

Khalid Yusuf Dahir

机构 * Independent researcher(独立研究者)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了SomaliWeb v1,一个经过质量过滤的索马里语语料库,包含匹配的BPE-16K分词器和首个公开的索马里语言识别基准,揭示了现有分布中的质量问题。

Comments 16 pages, 6 figures, 6 tables. Code: https://github.com/khaledyusuf44/somali-corpus Dataset: https://huggingface.co/datasets/khaledyusuf44/somaliweb-v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12145 2026-05-19 cs.LG cs.AI cs.SE 62%

Automatic Generation of High-Performance RL Environments

自动生成高性能强化学习环境

Seth Karten, Rahul Dev Appapogu, Chi Jin

机构 * Princeton University(普林斯顿大学) Independent Researcher(独立研究者)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种闭环方法,通过最小的计算成本生成等效的高性能强化学习环境,展示了三种不同的工作流程,并在五个环境中验证了无仿真到仿真的差距,同时展示了新的环境创建方法。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17276 2026-05-19 cs.LG cs.AI 62%

How Do Electrocardiogram Models Scale?

ECG模型如何扩展?

Jiawei Li, Fabio Bonassi, Ming Jin, Stefan Gustafsson, Johan Sundström, Thomas B. Schön, Antônio H. Ribeiro

机构 * Uppsala University(乌普萨拉大学) Griffith University(格里菲斯大学)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了ECG模型在不同规模下的扩展规律,发现监督学习模型在数据受限时表现不佳,而自监督学习模型在模型和数据规模上都具有鲁棒性,同时自监督Transformer在非常大的模型规模上超越了ResNet。

详情

展开后加载摘要…

URL PDF HTML 收藏