arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-23 至 2026-03-23 共收录 16 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 16 篇

2602.02632 2026-03-23 cs.LG cs.AI 92%

Performance of Small Language Model Pretraining on FABRIC: An Empirical Study

小型语言模型在FABRIC上的预训练性能:一项实证研究

Praveen Rao

机构 * The University of Missouri(密苏里大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);small language model(title);large language model(abstract)

AI总结 本文研究小型语言模型在FABRIC实验平台上的预训练性能,探讨数据并行、操作符并行及流水线并行等技术对预训练效果的影响,发现Alpa在地理分布GPU上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15851 2026-03-23 cs.CL cs.AI 91%

Control Illusion: The Failure of Instruction Hierarchies in Large Language Models

控制幻觉:大型语言模型中指令层级的失效

Yilin Geng, Haonan Li, Honglin Mu, Xudong Han, Timothy Baldwin, Omri Abend, Eduard Hovy, Lea Frermann

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);post-training(abstract)

AI总结 研究探讨了大型语言模型中指令层级机制的有效性,发现模型在处理简单格式冲突时难以保持一致的优先级,且系统/用户提示分离方法无法建立可靠层级,社会层级框架对模型行为影响更大。

Comments Accepted to AAAI-26 Main Technical Track Proceedings

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(36): 30816-30824, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19269 2026-03-23 cs.CL 89%

From Tokens To Agents: A Researcher's Guide To Understanding Large Language Models

从标记到代理:研究者理解大型语言模型的指南

Daniele Barolo

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文探讨了如何有效使用大型语言模型,分析了预训练数据、标记化、Transformer架构等六个关键组成部分,通过案例研究展示如何评估LLM在特定研究中的适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19427 2026-03-23 cs.CL cs.AI cs.LG 85%

Vocabulary shapes cross-lingual variation of word-order learnability in language models

词汇如何塑造语言模型中词序可学习性的跨语言变异

Jonas Mayer Martins, Jaap Jumelet, Viola Priesemann, Lisa Beinborn

机构 * University of Göttingen, Germany(德国哥廷根大学) University of Groningen, Netherlands(荷兰格罗宁根大学) MPI for Dynamics and Self-Organization, Germany(德国动态与自组织研究所)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过预训练变换器语言模型探讨不同词序语言的可学习性差异,发现词汇结构是影响词序可学习性的关键因素。

Comments Submitted to ACL 2026. 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19473 2026-03-23 q-bio.BM cs.LG 79%

Reinforcement-guided generative protein language models enable de novo design of highly diverse AAV capsids

强化引导的生成性蛋白质语言模型实现高多样性的AAV衣壳从头设计

Lucas Ferraz, Ana F. Rodrigues, Pedro Giesteira Cotovio, Mafalda Ventura, Gabriela Silva, Ana Sofia Coroadinha, Miguel Machuqueiro, Catia Pesquita

机构 * LASIGE, Faculdade de Ciências da Universidade de Lisboa(里斯本大学科学学院LASIGE实验室) BioISI, Faculdade de Ciências da Universidade de Lisboa(里斯本大学科学学院BioISI实验室) iBET – Instituto de Biologia Experimental e Tecnológica(生物实验与技术研究所)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 本文提出基于蛋白质语言模型和强化学习的生成设计框架,用于从头设计高多样性的AAV衣壳,通过强化学习引导序列生成,提升序列空间探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19773 2026-03-23 cs.CV 78%

Template-based Object Detection Using a Foundation Model

基于模板的对象检测使用基础模型

Valentin Braeutigam, Matthias Stock, Bernhard Egger

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃朗根-纽伦堡弗里德里希-亚历山大大学) e.solutions GmbH(e.solutions公司)

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 本文提出一种无需训练数据的模板基于对象检测方法,通过分割基础模型和简单特征分类结合,实现快速检测与分类,适用于自动化界面测试场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19695 2026-03-23 cs.CV 78%

Demographic-Aware Self-Supervised Anomaly Detection Pretraining for Equitable Rare Cardiac Diagnosis

具有人口统计学意识的自监督异常检测预训练用于公平的罕见心脏诊断

Chaoqin Huang, Zi Zeng, Aofan Jiang, Yuchen Xu, Qing Cao, Kang Chen, Chenfei Chi, Yanfeng Wang, Ya Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) National University of Defense Technology(国防科技大学) Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(瑞金医院,上海交通大学医学院) Renji Hospital, Shanghai Jiao Tong University School of Medicine(仁济医院,上海交通大学医学院)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出一种两阶段ECG框架,结合自监督异常检测与人口统计学意识表征学习,提升罕见心脏异常检测的灵敏度并确保公平性,实验显示在超过一百万临床ECG数据上,方法在罕见异常检测中达到94.7%的AUROC,并缩小了常见-罕见性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18090 2026-03-23 cs.SD cs.AI cs.CL 73%

MOSS-TTS Technical Report

MOSS-TTS 技术报告

Yitian Gong, Botian Jiang, Yiwei Zhao, Yucheng Yuan, Kuangwei Chen, Yaozhou Jiang, Cheng Chang, Dong Hong, Mingshu Chen, Ruixiao Li, Yiyang Zhang, Yang Gao, Hanfu Chen, Ke Chen, Songlin Wang, Xiaogui Yang, Yuqian Zhang, Kexin Huang, ZhengYuan Lin, Kang Yu, Ziqi Chen, Jin Wang, Zhaoye Fei, Qinyuan Cheng, Shimin Li, Xipeng Qiu

机构 * SII-OpenMOSS Team(SII-OpenMOSS团队)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 MOSS-TTS 基于可扩展的 recipe 提出语音生成基础模型,支持多语言和开放域场景,具备零样本语音克隆、音素级发音控制等能力。

Comments Project page: https://github.com/OpenMOSS/MOSS-TTS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19280 2026-03-23 cs.CL cs.AI cs.CY 73%

From Feature-Based Models to Generative AI: Validity Evidence for Constructed Response Scoring

从基于特征的模型到生成式AI:构造响应评分的效度证据

Jodi M. Casabianca, Daniel F. McCaffrey, Matthew S. Johnson, Naim Alper, Vladimir Zubenko

机构 * BroadMetrics ETS

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了生成式AI在构造响应评分中的效度证据收集,对比了传统特征模型与生成式AI的差异,提出最佳实践以支持AI评分系统的使用和解释。

Comments 37 pages, 8 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03962 2026-03-23 cs.CL 70%

Exploring NLP Benchmarks in an Extremely Low-Resource Setting

在极低资源环境下探索NLP基准测试

Ulin Nuha, Adam Jatowt

机构 * National Kaohsiung University of Science and Technology(高雄科技大学) University of Innsbruck(因斯布鲁克大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文针对濒危罗曼语Ladin的Val Badia变体,利用少量平行语料生成合成数据集,提升低资源环境下的情感分析和多项选择问答性能,提供首个公开可用的Ladin数据集。

Comments The Association for Computational Linguistics: EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18014 2026-03-23 cs.LG 70%

Predictive Scaling Laws for Efficient GRPO Training of Large Reasoning Models

为高效训练大推理模型的预测缩放定律

Datta Nimmaturi, Vaishnavi Bhargava, Rajat Ghosh, Johnu George, Debojyoti Dutta

机构 * Nutanix

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出预测框架,通过实验推导出基于模型大小、初始性能和训练进度的经验缩放定律,识别三个训练阶段并建议提前停止以减少计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19711 2026-03-23 cs.CL 57%

EvoTaxo: Building and Evolving Taxonomy from Social Media Streams

EvoTaxo:从社交媒体流中构建和演化分类体系

Yiyang Li, Tianyi Ma, Yanfang Ye

机构 * University of Notre Dame(诺丁汉大学)

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL

AI总结 本文提出EvoTaxo框架,通过结构化草案动作和双视角聚类,有效处理动态社交媒体数据,实现更平衡且结构质量更高的分类体系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17470 2026-03-23 cs.CV cs.AI 57%

VirPro: Visual-referred Probabilistic Prompt Learning for Weakly-Supervised Monocular 3D Detection

VirPro: 基于视觉引用的概率提示学习用于弱监督单目3D检测

Chupeng Liu, Jiyong Rao, Shangquan Sun, Runkai Zhao, Weidong Cai

机构 * The University of Sydney(悉尼大学) Tongji University(同济大学) Nanyang Technological University(南洋理工大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 本文提出VirPro,通过生成场景条件化提示并结合多高斯提示建模,提升单目3D检测的弱监督性能,实验表明在KITTI基准上平均精度提升4.8%。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19497 2026-03-23 cs.LG 57%

ICLAD: In-Context Learning for Unified Tabular Anomaly Detection Across Supervision Regimes

ICLAD:跨监督模式的上下文学习统一表格异常检测

Jack Yi Wei, Narges Armanfard

机构 * Department of Electrical and Computer Engineering, McGill University, Canada(麦吉尔大学电气与计算机工程系,加拿大) Mila - Quebec Artificial Intelligence Institute, Montreal, Canada(魁北克人工智能研究所,蒙特利尔,加拿大)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.LG

AI总结 ICLAD通过元学习训练合成表格异常检测任务,实现跨数据集和监督模式的统一表格异常检测框架,实验显示在57个数据集上取得最佳性能。

Comments 33 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19283 2026-03-23 cs.CL 57%

Automated Motif Indexing on the Arabian Nights

阿拉伯之夜上的自动动机索引

Ibrahim H. Alyami, Mark A. Finlayson

机构 * College of Computer Science and Information Systems(计算机科学与信息系统学院) Najran University(纳杰兰大学) Knight Foundation School of Computing and Information Sciences(骑士基金会计算与信息科学学院)

专题命中 预训练与数据 :prompting(abstract);分类 cs.CL

AI总结 本文提出首个自动动机索引方法,利用《阿拉伯之夜》文本和El-Shamy的动机索引,通过五种方法检测动机表达,最佳系统在F1分数上达到0.85。

Comments 30 pages, 4 figures, 9 tables Preprint. Submitted to Digital Scholarship in the Humanities(DSH) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19256 2026-03-23 cs.CL 57%

ShobdoSetu: A Data-Centric Framework for Bengali Long-Form Speech Recognition and Speaker Diarization

ShobdoSetu: 一种以数据为中心的孟加拉语长篇语音识别与说话人聚类框架

Md. Nazmus Sakib, Shafiul Tanvir, Mesbah Uddin Ahamed, H. M. Aktaruzzaman Mukdho

机构 * Dept.\ of Computer Science \& Engineering Bangladesh University of Engineering

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL

AI总结 本文提出了一种以数据为中心的孟加拉语长篇语音识别与说话人聚类框架,通过数据工程和领域适应微调,在低资源条件下实现了竞争力的性能。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏