arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-19 至 2026-03-19 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 11 篇

2603.17220 2026-03-19 cs.CL cs.AI cs.LG 90%

TharuChat: Bootstrapping Large Language Models for a Low-Resource Language via Synthetic Data and Human Validation

TharuChat:通过合成数据和人类验证提升低资源语言的大型语言模型

Prajwal Panth, Agniva Maiti

机构 * School of Computer Engineering KIIT Deemed to be University(计算机工程学院 KIIT 研究生大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Tharu-LLaMA(3B)模型,通过合成数据和人类验证构建TharuChat数据集,解决低资源语言在AI中的代表性问题,提升模型性能并证明生成式AI在保护濒危语言中的可行性。

Comments 6 pages, 1 figure, 2 tables. Preprint. Code and dataset available on Hugging Face

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15119 2026-03-19 cs.CV 82%

A Tutorial on ALOS2 SAR Utilization: Dataset Preparation, Self-Supervised Pretraining, and Semantic Segmentation

ALOS2 SAR利用教程:数据准备、自监督预训练与语义分割

Nevrez Imamoglu, Ali Caglayan, Toru Kouyama

机构 * National Institute of Advanced Industrial Science(国家先进工业科学促进机构)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract)

AI总结 本文介绍如何利用ALOS2 SAR数据进行预训练和语义分割,通过改进的预训练方法减少噪声影响,提升分割性能。

Comments 10 pages, 8 figures, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17326 2026-03-19 cs.CV 80%

FineViT: Progressively Unlocking Fine-Grained Perception with Dense Recaptions

FineViT: 通过密集描述逐步解锁细粒度感知

Peisen Zhao, Xiaopeng Zhang, Mingxing Xu, Ruoyu Sun, Zewei Du, Dunzheng Wang, Guanghao Zheng, Haohang Xu, Zhibo Zhang, Yuhang Zhang, Yi Ai, Lin Liu, Qi Tian

机构 * Huawei Inc.(华为公司)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 FineViT通过密集描述逐步训练,提升细粒度视觉感知能力,在长上下文检索中表现优异,超越现有多模态视觉编码器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16936 2026-03-19 cs.CV cs.AI 79%

TDMM-LM: Bridging Facial Understanding and Animation via Language Models

TDMM-LM:通过语言模型弥合面部理解与动画之间的差距

Luchuan Song, Pinxin Liu, Haiyang Liu, Zhenchao Jin, Yolo Yunlong Tang, Zichong Xu, Susan Liang, Jing Bi, Jason J Corso, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) University of Tokyo(东京大学) University of Michigan(密歇根大学) Voxel51

专题命中 预训练与数据 :language model(title,abstract);分类 cs.AI

AI总结 本文通过语言模型实现面部动作的双向建模,提出TDMM-LM框架,利用生成模型合成面部行为数据集,并通过Motion2Language和Language2Motion任务实现面部动画与理解的统一路径。

Comments 12 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15248 2026-03-19 cs.CL 77%

The Moralization Corpus: Frame-Based Annotation and Analysis of Moralizing Speech Acts across Diverse Text Genres

道德化语料库:跨多样文本体的基于框架的道德化言语行为标注与分析

Maria Becker, Mirko Sommer, Lars Tapken, Yi Wan Teh, Bruno Brocai

机构 * Department of German Linguistics, Heidelberg University(海德堡大学德语语言学系) Department of Computational Linguistics, Heidelberg University(海德堡大学计算语言学系)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出道德化语料库,用于分析道德价值观在论证话语中的策略使用,评估大型语言模型在道德化检测与成分提取中的表现,并揭示其高度主观性和情境敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.05545 2026-03-19 cs.CL cs.CY cs.LG 73%

The Moral Foundations Reddit Corpus

道德基础Reddit语料库

Jackson Trager, Alireza S. Ziabari, Elnaz Rahmati, Aida Mostafazadeh Davani, Preni Golazizian, Farzan Karimi-Malekabadi, Ali Omrani, Zhihe Li, Brendan Kennedy, Georgios Chochlakis, Nils Karl Reimer, Melissa Reyes, Kelsey Cheng, Mellow Wei, Christina Merrifield, Arta Khosravi, Evans Alvarez, Morteza Dehghani

机构 * University of Southern California(南加州大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出一个包含16123条Reddit评论的语料库,用于标注道德情感,通过评估不同模型表现,强调了人工标注数据在AI对齐评估中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17884 2026-03-19 cs.CL 70%

DebugLM: Learning Traceable Training Data Provenance for LLMs

DebugLM: 为大语言模型学习可追溯的训练数据来源

Wenjie Jacky Mo, Qin Liu, Xiaofei Wen, Wenxuan Zhou, Zhe Zhao, Muhao Chen

机构 * University of California, Davis(加州大学戴维斯分校) University of Southern California(南加州大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DebugLM通过内置数据溯源能力,使LLM能追溯行为来源,支持测试时针对性修复,提升调试效率和模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13047 2026-03-19 cs.CL 70%

Automated stance detection in complex topics and small languages: the challenging case of immigration in polarizing news media

复杂主题和小语言中的自动化立场检测:极化新闻媒体中移民问题的挑战性案例

Mark Mets, Andres Karjus, Indrek Ibrus, Maximilian Schich

机构 * School of Humanities, Tallinn University, Estonia(塔林大学人文学科学院,爱沙尼亚) Baltic Film, Media and Arts School, Tallinn University, Estonia(巴尔蒂克电影、媒体与艺术学院,塔林大学,爱沙尼亚) ERA Chair for Cultural Data Analytics, Tallinn University, Estonia(塔林大学文化数据分析埃拉教席,爱沙尼亚)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨了在形态复杂、低资源语言和复杂社会文化主题下,使用大语言模型进行自动化立场检测的可行性,通过对比多种语言模型和ChatGPT的表现,展示了其在新闻分析中的应用潜力。

Journal ref Plos one, 19(4), e0302380 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15151 2026-03-19 cs.LG 70%

Time Tracker: Mixture-of-Experts-Enhanced Foundation Time Series Forecasting Model with Decoupled Training Pipelines

时间追踪:混合专家增强的基础时间序列预测模型与解耦训练流水线

Aobo Liang, Yan Sun, Xiaohou Shi, Ke Li

机构 * School of Computer Science (National Pilot Software Engineering School)(计算机学院(国家级试点软件工程学院)) Beijing University of Posts and Telecommunications(北京邮电大学) China Telecom Research Institute(中国电信研究院)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出Time Tracker模型,通过稀疏混合专家和Any-variate Attention处理多变量时间序列,提升预测精度和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03818 2026-03-19 cs.LG cs.AI cs.RO 62%

Pretrained Vision-Language-Action Models are Surprisingly Resistant to Forgetting in Continual Learning

预训练视觉-语言-动作模型在持续学习中出人意料地表现出遗忘抵抗性

Huihan Liu, Changyeon Kim, Bo Liu, Minghuan Liu, Yuke Zhu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Microsoft Superintelligence(微软超级智能)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究发现预训练的视觉-语言-动作模型在持续学习中表现出较强的遗忘抵抗性,简单经验回放在这些模型上效果显著,即使数据量小也能实现零遗忘。

Comments Project website: https://continual-vlas.github.io/forget-me-not/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17947 2026-03-19 cs.LG q-bio.NC 57%

Unified Policy Value Decomposition for Rapid Adaptation

统一的策略价值分解用于快速适应

Cristiano Capone, Luca Falorsi, Andrea Ciardiello, Luca Manneschi

机构 * Computational Neuroscience Unit, Istituto Superiore di Sanità(国家卫生研究院计算神经科学单位) School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出一种统一的策略价值分解框架,通过共享低维系数向量实现快速任务适应。该方法结合了结构化价值基础和兼容策略基础,利用乘法门控机制在无需重新训练的情况下适应新任务。

详情

展开后加载摘要…

URL PDF HTML 收藏