arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-20 至 2026-08-20 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 15 篇

2608.18144 2026-08-20 cs.CL cs.AI 新提交 91%

The Deontic Gap: Large Language Models and the Modal Language of Obligation

义务缺口:大语言模型与义务的模态语言

Daniel Hart, Sarah Allred, Joseph Abbas, Morenike Alugo

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究发现大语言模型的义务情态使用模式与当代人类存在缺口,其情态使用反映训练的正式书面资源,少用标记即时人际义务的情态结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16246 2026-08-20 cs.LG cs.AI cs.CL 版本更新 90%

Demystifying Training-Time Augmentation for Data-Constrained Language Model Pretraining

数据受限语言模型预训练的数据增强

Michael K. Chen, Xikun Zhang, Fan Bai, Zhengding Hu, Zhen Wang

机构 * UC San Diego(加州大学圣地亚哥分校) RMIT University(皇家墨尔本理工大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对数据受限下标准自回归预训练严重过拟合的问题,提出三类数据增强方法(token级噪声、序列排列、目标偏移预测),有效降低验证损失并支持数百epoch训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18816 2026-08-20 cs.CL cs.AI 新提交 88%

Do Large Language Models Hallucinate Electric Fata Morganas?

大语言模型会产生“电气海市蜃楼”式的幻觉吗?

Kristina Šekrst

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探讨大语言模型幻觉的哲学意义,通过两项实证研究分析其成因,结合相关理论指出模型的情感自我陈述属于幻觉范畴,未来机器意识或因与高级幻觉无法区分而无法被认知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18655 2026-08-20 cs.CL 新提交 81%

TranslatePsy-AfriSLM: High-Quality Data Scaling For Low-Resource Machine Translation

TranslatePsy-AfriSLM:面向低资源机器翻译的高质量数据扩展

Milan Gritta, Patrik Lambert, Jihye Back, Amril Nazir

机构 * Tether AI Research(泰瑟人工智能研究院)

专题命中 预训练与数据 :LLM(abstract_cn);language model(abstract);small language model(abstract);SLM(abstract_cn)

AI总结 针对非洲语言机器翻译的数字鸿沟问题,推出面向19种撒哈拉以南非洲语言的开源资源TranslatePsy-AfriSLM,经质量过滤后构建的小参数模型性能远超更大规模的同类系统。

Comments EMNLP 2026 (under ARR, meta review of 4, awaiting accept decision)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18138 2026-08-20 cs.CL cs.AI 新提交 81%

Language Models for Portuguese: A Systematic Mapping Study

面向葡萄牙语的语言模型:一项系统映射研究

Jhessica Silva, Carlos Caetano, Helena Maia, Breno Bernard Nicolau de França, Sandra Avila, Helio Pedrini

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究通过系统映射梳理出46个葡萄牙语语言模型,分析其特征、演变及关系,明确研究缺口并展望未来方向,为该领域发展提供全面概览。

Comments 37 pages; 7 figures; 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18094 2026-08-20 cs.CL cs.AI 新提交 81%

NE-BERT: A Multilingual Language Model for Nine Northeast Indian Languages

NE-BERT:适用于9种印度东北部语言的多语言语言模型

Badal Nyalang

机构 * MWire Labs(MWire实验室)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对印度东北部9种低资源语言的代表性不足问题,提出NE-BERT多语言语言模型,通过加权采样等技术提升性能,解决词汇碎片化,发布资源推动当地NLP研究与数字包容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18681 2026-08-20 cs.CL 新提交 77%

Learning What to Fail On: Failure-Mode Contextual Bandits for Adversarial Data Curation

学习失败的诱因:用于对抗性数据策展的失败模式上下文多臂老虎机

Roie Kazoom, Ofir Cohen, Rami Puzis, Asaf Shabtai, Ofer Hadar

机构 * Ben Gurion University of The Negev(本古里安大学内盖夫分校)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL

AI总结 该研究提出失败模式上下文多臂老虎机框架,通过检索增强等技术优化对抗性数据策展,在多项自然语言理解基准上提升模型准确率,还可迁移至事实核查任务,实现无需额外人工标注的鲁棒性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18821 2026-08-20 cs.CL cs.AI 新提交 73%

Identifying Implicit Premises for Logical Reconstruction of Argument Graphs

识别论证图逻辑重构的隐含前提

Xuyao Feng, Anthony Hunter

机构 * University College London(伦敦大学学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文针对论证图逻辑重构中省略式论证的隐含前提问题,提出神经符号管道方法,结合大型语言模型生成隐含前提并评估,用于证明陈述间的逻辑关系。

Comments Accepted at the 11th International Conference on Computational Models of Argument (COMMA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18689 2026-08-20 cs.CL cs.AI 新提交 71%

Aslema at NADI 2026: Augmentation through Fewshot for SLU

Aslema 参与 NADI 2026:基于少样本的 SLU 增强方法

Tajwaar Shafiq, Hunzalah Hassan Bhatti, Shammur Absar Chowdhury, Firoj Alam

机构 * Qatar Computing Research Institute(卡塔尔计算研究所)

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.AI;large language model(comments);language model(comments)

AI总结 Aslema 系统参与 NADI 2026 共享任务 5,通过微调模型及合成数据增强(含文化适配语句生成与语音克隆)提升性能,在官方测试集槽填充排第1、意图识别排第4,将公开脚本与合成数据集。

Comments LLMs, Native, Arabic LLMs, Augmentation, Multilingual, Multimodal, Language Diversity, Contextual Understanding, Minority Languages, Culturally Informed, Foundation Models, Large Language Models, Audio Models, Omni Models, Slot Filling

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18613 2026-08-20 cs.AI cs.CR 新提交 70%

CTIFoundry: An Agent-Native Corpus Scaffold for Cyber Threat Intelligence

CTIFoundry:用于网络威胁情报的智能体原生语料库支架

Yutong Cheng, Changze Li, Qian Cui, Wei Ding, Lingzhi Wang, Yan Chen, Peng Gao

机构 * Virginia Tech(弗吉尼亚理工大学) Amazon(亚马逊公司) Northwestern University(西北大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 CTIFoundry是用于网络威胁情报的智能体原生语料库支架,在CTIConnect基准测试中可使智能体F1提升0.19至0.28,小型模型在其上表现优于旗舰模型,且无需增加搜索工作量。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18486 2026-08-20 cs.CL cs.LG 新提交 62%

WhiteMatter: All-to-All Cross-Layer Connections via KV Mixing

WhiteMatter:通过KV混合实现全对全跨层连接

Wenbo Zhang, Xiang Ren

机构 * University of Southern California(南加州大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.LG

AI总结 WhiteMatter通过将每个注意力层连接到所有过去token的所有层表示,以可变连接权重实现全对全跨层KV混合,在预训练中性能优于多50%层数的普通Transformer,缓存压缩50%仍保留大部分增益。

Comments 15 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19133 2026-08-20 cs.CL 新提交 57%

Comment-level Topic Drift Analysis in the Reddit Corpus

Reddit语料库中评论级别的主题漂移分析

Steven Morse, Daniel Runfola, Trenton W. Ford

机构 * William & Mary(威廉玛丽学院)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 该研究将嵌入式动态主题建模技术应用于Reddit语料库,分析127亿条2006-2022年的评论,提出嵌入空间内语义漂移分析方法,发现争议性主题漂移显著而文体类主题相对稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15091 2026-08-20 cs.HC cs.AI 版本更新 57%

Sensory Restoration via Brain-Computer Interfaces: A Scoping Review

通过脑机接口的感觉恢复:统一的2×2框架与融合路线图

Xuan-The Tran

机构 * School of Mechanical Engineering, Vietnam Maritime University(机械工程学院,越南海防大学)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI

AI总结 本文提出一个统一的2×2框架,按侵入性和信号方向分类脑机接口,并定义恢复、替代和增强范式,同时给出近中长期的融合路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18667 2026-08-20 cs.CV 新提交 50%

Teeth2Point: A Two-Stage Dental CBCT ROI-to-Point Segmentation Framework

Teeth2Point:一种两阶段牙科CBCT ROI到点的分割框架

Qi Ma, Shipra Jain, Niko Benjamin Huber, Ender Konukoglu

机构 * ETH Zurich(苏黎世联邦理工学院) Align Technology(Align Technology公司)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对牙科CBCT中牙齿缺失或错位的标注难题,提出Teeth2Point框架,通过卷积定位ROI、自适应采样转点令牌,结合SSL预训练与监督微调,在四个数据集上较基线显著提升异常病例分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18515 2026-08-20 cs.CV 新提交 50%

Cross-Modal MRI Ovary Segmentation in Endometriosis Using Unpaired TVUS Prototype Priors

基于未配对经阴道超声(TVUS)原型先验的子宫内膜异位症跨模态MRI卵巢分割

Xingjian Kang, Lina Felsner, Dominik Perrin, Daiqi Liu, Jasmin Arjomandi, Franziska Mathis-Ullrich, Alexandra Stoll, Katharina Breininger

机构 * Center for AI and Data Science (CAIDAS), Julius-Maximilians-Universität Würzburg(维尔茨堡大学人工智能与数据科学中心) Institute for Computational Imaging and AI in Medicine (CompAI), Technical University of Munich(慕尼黑工业大学计算成像与医学人工智能研究所) Pattern Recognition Lab, Friedrich-Alexander Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡大学模式识别实验室) Department Artificial Intelligence in Biomedical Engineering (AIBE), Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡大学生物医学工程人工智能系)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对子宫内膜异位症MRI卵巢分割难题,本研究提出结合TVUS原型库的双分支框架,适配MedSAM3对齐跨模态特征,在相关数据集上较SOTA方法提升超5个百分点,验证了原型库与热身预训练的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏