arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138627 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12379 篇

2310.17025 2026-05-13 cs.NI cs.AI 83%

netFound: Principled Design for Network Foundation Models

netFound:网络基础模型的原理化设计

Sylee Beltiukov, Satyandra Guthula, Haarika Manda, Jaber Daneshamooz, Wenbo Guo, Walter Willinger, Arpit Gupta, Inder Monga

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) Northwestern University(西北大学) ESNet

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 netFound通过四个设计原则提升网络基础模型性能,实现高质量表示与隐私保护,在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10184 2026-05-12 cs.CV cs.AI 83%

Developing a foundation model for high-resolution remote sensing data of the Netherlands

为荷兰高分辨率遥感数据开发一个基础模型

Paul Vermeeren, Heysem Kaya

机构 * Utrecht University, Department of Information and Computing Sciences(乌得勒支大学信息与计算科学系)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出结合卷积神经网络与视觉Transformer的基础模型,用于处理荷兰1.2米高分辨率卫星图像,通过融合时序数据提升遥感特征表示,实现更高效的遥感任务性能。

Comments 9 pages, 4 figures, under review in a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10129 2026-05-12 cs.CL 83%

Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data

合成预预训练提升语言模型对噪声预训练数据的鲁棒性

Xu Guo, Runyu Peng, Jian Tong, Yunhua Zhou, Haijun Lv, Zhihui Lu, Qipeng Guo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文研究了基于合成数据的轻量预预训练(PPT)阶段对提升语言模型在预训练阶段对噪声的鲁棒性的作用,实验表明PPT能有效降低噪声影响,尤其在高噪声水平下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04306 2026-05-12 cs.CV cs.AI 83%

HighFM: Towards a Foundation Model for Learning Representations from High-Frequency Earth Observation Data

HighFM:面向高频率地球观测数据学习表示的基础模型

Stella Girtsou, Konstantinos Alexis, Giorgos Giannopoulos, Charalambos Kontoes

机构 * National Observatory of Athens(国家天文台) National Technical University of Athens(雅典国家技术大学) National and Kapodistrian University of Athens(雅典国家与卡波迪斯特里亚大学) Athena Research Center(雅典研究所以及研究中心)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出HighFM,一种针对高时间分辨率多光谱地球观测数据的基础模型,通过SEVIRI影像和SatMAE框架学习时空表示,并在云遮蔽和主动火检测任务中展现优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21015 2026-05-12 cs.IR cs.CL 83%

Don't Retrieve, Generate: Prompting LLMs for Synthetic Training Data in Dense Retrieval

不检索,生成:通过提示LLMs生成合成训练数据用于密集检索

Aarush Sinha

专题命中 预训练与数据 :prompting(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出通过提示大型语言模型生成合成硬负样本,用于密集检索模型训练,通过在10个BEIR基准数据集上评估发现,生成模型性能不优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08472 2026-05-12 cs.AI 83%

Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models

中期使用自生成数据提升语言模型中的强化学习

Aswin RRV, Jacob Dineen, Divij Handa, Mihir Parmar, Ben Zhou, Swaroop Mishra, Chitta Baral

机构 * Arizona State University(亚利桑那州立大学) Google Cloud AI Research(谷歌云人工智能研究) Google DeepMind(谷歌DeepMind)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文研究在强化学习前使用多样化的自生成数据提升语言模型的强化学习效果,通过自生成数据训练后,模型在数学推理等任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07302 2026-05-11 cs.LG 83%

Pretraining Induces a Reusable Spectral Basis for Downstream Task Adaptation

预训练诱导了可重用的谱基底以用于下游任务适应

Junjie Yu, Yue Wang, Zihan Deng, Yan Zhu, Wenxiao Ma, Quanying Liu

机构 * Department of Biomedical Engineering, Southern University of Science and Technology(生物医学工程系,南方科技大学) Department of Psychology, The University of Hong Kong(心理学系,香港大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.LG

AI总结 本文通过系统谱分析揭示预训练模型的主奇异向量在微调中保持稳定且跨任务共享,表明预训练建立了可重用的谱坐标系,且更大规模预训练提升几何可迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07204 2026-05-11 cs.LG 83%

Arrow: A Foundation Model for Causal Discovery

Arrow:一种因果发现的基础模型

Ryan Thompson, He Zhao, Daniel M. Steinberg, Edwin V. Bonilla

机构 * University of Technology Sydney(技术科技大学) CSIRO’s Data61(CSIRO数据61)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 Arrow模型通过将有向无环图分解为无向骨架和拓扑序,实现零样本因果发现。该模型基于Transformer架构预测边概率和节点顺序,训练于合成数据集,能在多种数据集上实现高效准确的因果发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11016 2026-05-08 cs.CV cs.AI 83%

SoccerMaster: A Vision Foundation Model for Soccer Understanding

SoccerMaster: 一种用于足球理解的视觉基础模型

Haolin Yang, Jiayuan Rao, Haoning Wu, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出SoccerMaster,一种统一的足球视觉理解模型,通过多任务预训练统一处理从细粒度感知到高层语义推理的多种任务,实验表明其在多种下游任务中表现优异。

Comments Accepted by CVPR 2026 (Oral); Project Page: https://haolinyang-hlyang.github.io/SoccerMaster

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05773 2026-05-08 cs.AI 83%

CircuitFormer: A Circuit Language Model for Analog Topology Design from Natural Language Prompt

CircuitFormer:一种用于从自然语言提示中进行模拟拓扑设计的电路语言模型

Md Touhidul Islam, Sujan Kumar Saha, Farimah Farahmandi, Mark Tehranipoor

机构 * Department of Electrical and Computer Engineering, University of Florida, Gainesville, FL, USA(佛罗里达大学电气与计算机工程系,盖恩斯维尔,佛罗里达州,美国)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文提出CircuitFormer,一种专门用于模拟拓扑设计的电路语言模型,通过改进的电路图分词器CKT,实现了更高效的电路拓扑表示,提升了设计准确率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26960 2026-05-01 cs.CY cs.AI 83%

LLM Biases

LLM偏见

Jinhui Han, Ming Hu, Xilin Zhang

机构 * Guanghua School of Management, Peking University(北京大学光华管理学院) Rotman School of Management, University of Toronto(多伦多大学罗特曼管理学院)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI

AI总结 本文研究了基于Transformer的生成推荐系统中四种系统性偏见机制,指出其可能影响长期多样性和用户选择,强调需关注运营风险而非仅依赖性能指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04950 2026-04-23 cs.CV cs.AI 83%

Location-Aware Pretraining for Medical Difference Visual Question Answering

面向位置的预训练方法用于医学差异视觉问答

Denis Musinguzi, Caren Han, Prasenjit Mitra

机构 * Department of Electrical and Computer Engineering, Carnegie Mellon University, Kigali, Rwanda(电气与计算机工程系,卡内基梅隆大学,刚果(金)基利齐) University of Melbourne, Melbourne, Australia(墨尔本大学,墨尔本,澳大利亚)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种面向位置的预训练框架,结合AREF、GCAP和CAREF任务,提升医学差异VQA中细粒度空间视觉表征能力,实现胸部X光图像中临床相关变化的准确识别与推理。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15353 2026-04-21 cs.CL 83%

Establishing a Scale for Kullback-Leibler Divergence in Language Models Across Various Settings

在不同设置中为语言模型建立KL散度量表

Ryo Kishino, Yusuke Takase, Momose Oyama, Hiroaki Yamagiwa, Hidetoshi Shimodaira

机构 * Kyoto University(京都大学) RIKEN(日本科学技术研究所)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 本文通过扩展log-likelihood空间,建立统一的KL散度量表,分析预训练轨迹显示log-likelihood空间变化比权重空间更小,导致学习轨迹亚扩散并早稳定语言模型行为。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23807 2026-04-21 cs.AI cs.CV 83%

Beyond the Failures: Rethinking Foundation Models in Pathology

超越失败:重新思考病理学中的基础模型

Hamid R. Tizhoosh

机构 * Kimia Lab, Department of Artificial Intelligence and Informatics, Mayo Clinic, Rochester, MN, USA(Kimia实验室,人工智能与信息学系,梅奥诊所,罗切斯特,明尼苏达州,美国)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 病理学中基础模型表现不佳,需设计专门处理生物图像的模型,而非通用自然图像方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11983 2026-04-21 cs.LG math.OC 83%

Low-rank Orthogonalization for Large-scale Matrix Optimization with Applications to Foundation Model Training

大规模矩阵优化中的低秩正交化:应用于基础模型训练

Chuan He, Zhanwang Deng, Zhaosong Lu

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出低秩正交化方法,通过利用神经网络训练中的梯度低秩特性,改进矩阵正交化以提升基础模型训练性能,理论分析了低秩MSGD和低秩Muon的迭代复杂度。

Comments 20 pages, add numerical comparison with Galore and SOAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10471 2026-04-15 cond-mat.mtrl-sci cs.AI 83%

Siamese Foundation Models for Crystal Structure Prediction

孪生基础模型用于晶体结构预测

Liming Wu, Wenbing Huang, Rui Jiao, Jianxing Huang, Liwei Liu, Yipeng Zhou, Hao Sun, Yang Liu, Fuchun Sun, Yuxiang Ren, Jirong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) Advanced Computing and Storage Lab, Huawei Technologies(华为技术有限公司先进计算与存储实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部下一代智能搜索与推荐工程研究中心)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出Diffusion-based Crystal Omni框架,结合孪生生成模型和能量预测模型,提升晶体结构预测性能,并在实际超导材料中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11066 2026-04-14 cs.CL 83%

ks-pret-5m: a 5 million word, 12 million token kashmiri pretraining dataset

ks-pret-5m: 一个500万词、1200万token的克什米尔语言预训练数据集

Haq Nawaz Malik, Nahfid Nissar

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL

AI总结 本文介绍了一个包含500万词和1200万token的克什米尔语言最大公开预训练数据集,通过清理流程和分词方法,提升了数据质量,支持语言模型预训练和计算语言学研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10591 2026-04-14 cs.CV cs.AI 83%

GeoMeld: Toward Semantically Grounded Foundation Models for Remote Sensing

GeoMeld:迈向遥感领域语义引导的基模模型

Maram Hasan, Md Aminur Hossain, Savitra Roy, Souparna Bhowmik, Ayush V. Patel, Mainak Singha, Subhasis Chaudhuri, Muhammad Haris Khan, Biplab Banerjee

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) Space Applications Centre, ISRO(印度空间研究组织空间应用中心) University of Trento(特伦托大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出GeoMeld数据集,通过语义引导的监督方法,结合多模态对齐,提升遥感领域基模模型的性能和鲁棒性。

Comments Accepted at CVPR Workshop 2026; 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06903 2026-04-09 cs.CL 83%

Is Biomedical Specialization Still Worth It? Insights from Domain-Adaptive Language Modelling with a New French Health Corpus

生物医学专业化仍然值得吗?基于新法语健康语料库的领域自适应语言建模洞察

Aidan Mannion, Cécile Macaire, Armand Violle, Stéphane Ohayon, Xavier Tannier, Didier Schwab, Lorraine Goeuriot, François Portet

机构 * Université Grenoble Alpes, CNRS, Grenoble INP, LIG(格勒诺布尔阿尔卑斯大学,法国国家科学研究中心,格勒诺布尔国立理工学院,格勒诺布尔信息学实验室) Sorbonne Université, LIMICS(索邦大学,医学信息学与知识工程实验室)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文探讨了在法语生物医学领域通过持续预训练对小型至中型LLM进行专业化的方法,发现DAPT在资源受限情况下有效,但需通过模型合并缓解泛化权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04271 2026-04-07 cs.NI cs.LG 83%

A Family of Open Time-Series Foundation Models for the Radio Access Network

面向无线接入网络的开放时间序列基础模型家族

Ioannis Panitsas, Leandros Tassiulas

机构 * Department of Electrical and Computer Engineering, Yale University(耶鲁大学电气与计算机工程系)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出TimeRAN框架,通过轻量时间序列基础模型和少量任务特定头部,实现跨任务的可迁移表示,提升RAN分析性能并减少系统复杂度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07571 2026-04-07 cs.CL cs.MM 83%

A Simple Method to Enhance Pre-trained Language Models with Speech Tokens for Classification

一种通过语音标记增强预训练语言模型用于分类的简单方法

Nicolas Calbucura, Jose Guillen, Valentin Barriere

机构 * Universidad de Chile, DCC(智利大学计算机科学系) Universidad Tecnica Santa Maria(圣玛利亚理工大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出一种简单方法,通过语音信息增强预训练语言模型以提高分类任务性能,采用多模态词袋表示和自监督语言建模目标,实验证明在论证谬误检测和情感计算任务中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28743 2026-04-07 cs.LG 83%

Rethinking Language Model Scaling under Transferable Hypersphere Optimization

重新思考在可转移超球优化下的语言模型扩展

Liliang Ren, Yang Liu, Yelong Shen, Weizhu Chen

机构 * Microsoft(微软)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 本文提出HyperP框架,通过Frobenius球约束和Muon优化器,在模型宽度、深度、训练token和MoE粒度间转移最优学习率,实现更稳定的扩展,同时引入SqrtGate机制提升MoE粒度扩展性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01277 2026-03-31 cs.SD cs.LG eess.AS q-bio.QM 83%

Foundation Models for Bioacoustics -- a Comparative Review

生物声学中的基础模型——比较综述

Raphael Schwinger, Paria Vali Zadeh, Lukas Rauch, Mats Kurz, Tom Hauschild, Sam Lapp, Sven Tomforde

机构 * Kiel University(基尔大学) University of Kassel(卡塞尔大学) University of Pittsburgh(匹兹堡大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文综述了大规模预训练生物声学基础模型,分析其在多种分类任务中的迁移能力,并通过实验验证不同模型的性能,为选择合适模型提供指导。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24826 2026-03-27 cs.CL 83%

Synthetic Rewriting as a Quality Multiplier: Evidence from Portuguese Continued Pretraining

合成重写作为质量乘数:来自葡萄牙持续预训练的证据

Thales Sales Almeida, Rodrigo Nogueira, Hélio Pedrini

机构 * Maritaca AI

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL

AI总结 该研究通过控制实验探讨合成重写在葡萄牙持续预训练中对数据质量的影响,发现高质量数据通过重写可提升模型性能,而低质量数据效果有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24539 2026-03-26 cs.CV cs.AI 83%

CliPPER: Contextual Video-Language Pretraining on Long-form Intraoperative Surgical Procedures for Event Recognition

CliPPER:基于长形式术中手术程序的上下文视频-语言预训练用于事件识别

Florian Stilz, Vinkle Srivastav, Nassir Navab, Nicolas Padoy

机构 * University of Strasbourg, CNRS, INSERM, ICube, UMR7357, France(斯特拉斯堡大学,法国国家科学研究中心,法国国家医学研究院,ICube,UMR7357,法国) IHU Strasbourg, France(斯特拉斯堡IHU,法国) Technical University of Munich, Germany(慕尼黑技术大学,德国)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 本文提出CliPPER框架,通过手术讲座视频预训练,提升长形式手术视频的细粒度时间视频-文本识别,引入VTC_CTX和COP等预训练策略,改进多模态对齐,实现多个公开手术基准的新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02566 2026-03-26 cs.CV cs.AI 83%

From Panel to Pixel: Zoom-In Vision-Language Pretraining from Biomedical Scientific Literature

从面板到像素:从生物医学科学文献中进行缩放视觉-语言预训练

Kun Yuan, Min Woo Sun, Zhen Chen, Alejandro Lozano, Xiangteng He, Shi Li, Nassir Navab, Xiaoxiao Sun, Nicolas Padoy, Serena Yeung-Levy

机构 * University of Strasbourg, CNRS, INSERM, ICube, UMR7357, Strasbourg, France(斯特拉斯堡大学、法国国家科学研究中心、法国国家医学研究院、ICube、UMR7357、斯特拉斯堡,法国) Technical University of Munich(慕尼黑技术大学) Stanford University(斯坦福大学) DSAI, The Hong Kong Polytechnic University(香港理工大学DSAI实验室) University of British Columbia(不列颠哥伦比亚大学) Munich Center for Machine Learning(慕尼黑机器学习中心) IHU Strasbourg, Strasbourg(斯特拉斯堡IHU医院,斯特拉斯堡) Vector Institute for AI(人工智能向量研究所) Yale University(耶鲁大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Panel2Patch方法,通过挖掘生物医学文献中的层次结构,生成多粒度监督,提升视觉-语言预训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21847 2026-03-24 cs.CL 83%

Riding Brainwaves in LLM Space: Understanding Activation Patterns Using Individual Neural Signatures

在LLM空间中骑行脑波:利用个体神经特征理解激活模式

Ajan Subramanian, Sumukh Bettadapura, Rohan Sathish

机构 * Kubo Technologies

专题命中 预训练与数据 :LLM(title,abstract);language model(abstract);分类 cs.CL

AI总结 研究通过训练个性化线性探针,发现冻结的LLM表示能编码个体特定的EEG信号,且在高伽马功率上表现显著优于群体探针。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24302 2026-03-24 cs.LG 83%

LEAF: Language-EEG Aligned Foundation Model for Brain-Computer Interfaces

LEAF:语言-脑电对齐的基础模型用于脑机接口

Muyun Jiang, Shuailei Zhang, Zhenjie Yang, Mengjun Wu, Weibang Jiang, Zhiwei Guo, Wei Zhang, Rui Liu, Shangen Zhang, Yong Li, Yi Ding, Cuntai Guan

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Shanghai Jiao Tong University, China(上海交通大学,中国) University of Science and Technology Beijing, China(北京科技大学,中国) Southeast University, China(东南大学,中国)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 LEAF通过整合语义指导生成结构化的脑电嵌入,提升解码鲁棒性和迁移性,实现语言与脑电信号的对齐,取得12个数据集上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20732 2026-03-24 cs.CL 83%

MzansiText and MzansiLM: An Open Corpus and Decoder-Only Language Model for South African Languages

MzansiText 和 MzansiLM:一种面向南非语言的开放语料库和解码器-only 语言模型

Anri Lombard, Simbarashe Mawere, Temi Aina, Ethan Wolff, Sbonelo Gumede, Elan Novick, Francois Meyer, Jan Buys

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 本文介绍MzansiText和MzansiLM,针对南非11种官方语言中的9种低资源语言,通过任务特定微调在自然语言理解与生成任务中取得显著成果,但小规模下少量推理仍具挑战性。

Comments 15 pages, 11 tables, appendix included. Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06134 2026-03-20 cs.LG eess.SP q-bio.NC 83%

DeeperBrain: A Neuro-Grounded EEG Foundation Model Towards Universal BCI

DeeperBrain: 一种面向通用脑机接口的神经 grounded EEG 基础模型

Jiquan Wang, Sha Zhao, Yangxuan Zhou, Yiming Kang, Shijian Li, Gang Pan

机构 * State Key Laboratory of Brain-machine Intelligence, Zhejiang University(浙江大学脑机智能国家重点实验室) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) MOE Frontier Science Center for Brain Science and Brain-machine Integration(教育部脑科学与脑机集成前沿科学中心)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 DeeperBrain 通过整合生物物理和动态原理,提出神经 grounded 的 EEG 基础模型,实现通用脑机接口的高效和鲁棒性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏