arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138627 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12379 篇

2603.12343 2026-03-16 cs.CL 83%

LLM-Augmented Therapy Normalization and Aspect-Based Sentiment Analysis for Treatment-Resistant Depression on Reddit

基于大型语言模型的疗法规范化与基于方面的情感分析用于抗药性抑郁症的Reddit研究

Yuxin Zhu, Sahithi Lakamana, Masoud Rouhizadeh, Selen Bozkurt, Rachel Hershenberg, Abeed Sarker

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过Reddit数据研究抗药性抑郁症患者的药物使用和情感倾向,利用大型语言模型进行情感分析,揭示药物感知差异及治疗经验特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08216 2026-03-10 eess.AS cs.CL cs.SD 83%

DualTurn: Learning Turn-Taking from Dual-Channel Generative Speech Pretraining

DualTurn: 从双通道生成式语音预训练中学习轮流对话

Shangeth Rajaa

机构 * Anyreach AI

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);分类 cs.CL

AI总结 DualTurn通过双通道生成式语音预训练,实现了更自然的轮流对话处理,优于现有方法在代理动作预测和词级轮流预测上的表现。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14106 2026-03-06 cs.AI 83%

HydroGEM: A Self Supervised Zero Shot Hybrid TCN Transformer Foundation Model for Continental Scale Streamflow Quality Control

HydroGEM:一种用于大陆尺度径流质量控制的自监督零样本混合TCN-Transformer基础模型

Ijaz Ul Haq, Byung Suk Lee, Julia N. Perdrial, David Baude

机构 * Department of Computer Science, University of Vermont(维珍尼亚大学计算机科学系) Water Resources Institute, University of Vermont(维珍尼亚大学水文资源研究所) Department of Geography and Geosciences, University of Vermont(维珍尼亚大学地理与地质学系)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 HydroGEM通过自监督预训练和混合TCN-Transformer架构,实现了对大陆尺度径流质量控制的高效检测与重建,性能优于基线模型,展示了跨国家的泛化能力。

Comments Supplementary materials, datasets, and implementation code will be made publicly available upon acceptance for publication in a peer-reviewed journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02840 2026-03-04 cs.LG stat.ML 83%

Adapting Time Series Foundation Models through Data Mixtures

通过数据混合适应时间序列基础模型

Thomas L. Lee, Edoardo M. Ponti, Amos Storkey

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 MixFT通过数据混合重新划分数据,以更好地适应不同子领域,提升时间序列基础模型的零样本预测性能。

Comments Preprint, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02711 2026-03-04 cs.AI 83%

A Natural Language Agentic Approach to Study Affective Polarization

一种自然语言代理方法研究情感极化

Stephanie Anneris Malvicini, Ewelina Gajewska, Arda Derbent, Katarzyna Budzynska, Jarosław A. Chudziak, Maria Vanina Martinez

机构 * Warsaw University of Technology (WUT)(华沙技术大学)

专题命中 预训练与数据 :language agent(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于自然语言代理的多代理模型,用于研究社交媒体中的情感极化现象,通过虚拟社区模拟和实验分析,提供新的研究视角和方法。

Comments Accepted at ICAART 2026 (18th International Conference on Agents and Artificial Intelligence). The final published version is available in the conference proceedings (SCITEPRESS)

Journal ref In Proceedings of the 18th International Conference on Agents and Artificial Intelligence (ICAART 2026), Vol. 1, pp. 339-346. SCITEPRESS, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23652 2026-03-04 cs.CV cs.AI 83%

3D Modality-Aware Pre-training for Vision-Language Model in MRI Multi-organ Abnormality Detection

面向MRI多器官异常检测的3D模态感知预训练

Haowen Zhu, Ning Yin, Xiaogen Zhou

机构 * School of Electronic, Electrical Engineering and Physics, Fujian University of Technology(福建工程学院电子电气工程学院) School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院) Department of Medical Imaging, Suzhou Traditional Chinese Medicine Hospital, China(苏州中医医院影像科)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出MedMAP框架,通过3D MRI的模态感知预训练提升多器官异常检测性能,实验表明其优于现有视觉-语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22879 2026-02-27 cs.AI 83%

Towards LLM-Empowered Knowledge Tracing via LLM-Student Hierarchical Behavior Alignment in Hyperbolic Space

基于大语言模型的知识追踪:通过超几何空间中的LLM-学生层次行为对齐

Xingcheng Fu, Shengpeng Wang, Yisen Gao, Xianxian Li, Chunpei Li, Qingyun Sun, Dongran Yu

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出L-HAKT框架,通过超几何空间中的层次行为对齐,提升知识追踪对认知状态层次演化和个性化问题难度感知的建模能力。

Comments 9 pages, 6 figures, Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21193 2026-02-25 cs.CL 83%

On Data Engineering for Scaling LLM Terminal Capabilities

关于扩大LLM终端能力的数据工程

Renjie Pi, Grace Lam, Mohammad Shoeybi, Pooya Jannaty, Bryan Catanzaro, Wei Ping

机构 * NVIDIA

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Terminal-Task-Gen和Terminal-Corpus,通过训练Nemotron-Terminal模型显著提升终端任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00994 2026-02-25 cs.CL 83%

Should We Still Pretrain Encoders with Masked Language Modeling?

我们还应该用掩码语言模型预训练编码器吗?

Hippolyte Gisserot-Boukhlef, Nicolas Boizard, Manuel Faysse, Duarte M. Alves, Emmanuel Malherbe, André F. T. Martins, Céline Hudelot, Pierre Colombo

机构 * Artefact Research Center(Artefact 研究中心) Diabolocom TransPerfect Cohere MICS, CentraleSupélec, Université Paris-Saclay(MICS,CentraleSupélec,巴黎萨克雷大学) Instituto de Telecomunicações(电信研究所) Instituto Superior Técnico & Universidade de Lisboa (Lisbon ELLIS Unit)(里斯本大学(里斯本 ELLIS 单位))

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 本文研究了在文本表示任务中,使用CLM还是MLM预训练编码器的优劣,发现双阶段训练策略在计算预算固定时表现最佳,并展示了从预训练CLM模型初始化的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16873 2026-02-20 cs.MA cs.AI 83%

AdaptOrch: Task-Adaptive Multi-Agent Orchestration in the Era of LLM Performance Convergence

AdaptOrch:在LLM性能收敛时代的任务自适应多智能体协调

Geunbin Yu

机构 * Department of Artificial Intelligence, Korea National Open University(人工智能系,韩国国立开放大学)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AdaptOrch通过动态选择多智能体协调拓扑,提升任务性能,证明协调设计优于模型选择。

Comments 21 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12414 2026-02-20 cs.CL 83%

propella-1: Multi-Property Document Annotation for LLM Data Curation at Scale

propella-1:大规模LLM数据整理中的多属性文档标注

Maximilian Idahl, Benedikt Droste, Björn Plüster, Jan Philipp Harries

机构 * ellamind Leibniz University Hannover(汉诺威莱布尼茨大学)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 propella-1通过多属性文档标注提升大规模LLM数据整理的效率和质量,揭示预训练数据集在质量、推理深度和内容组成上的显著差异。

Comments Release: https://hf.co/collections/ellamind/propella-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15004 2026-02-17 cs.LG physics.ao-ph 83%

PDE foundation models are skillful AI weather emulators for the Martian atmosphere

偏微分方程基础模型是火星大气的技能型AI天气模拟器

Johannes Schmude, Sujit Roy, Liping Wang, Theodore van Kessel, Levente Klein, Marcus Freitag, Eloisa Bentivegna, Robert Manson-Sawko, Bjorn Lutjens, Manil Maskey, Campbell Watson, Rahul Ramachandran, Juan Bernabe-Moreno

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 基于预训练的偏微分方程基础模型,通过扩展至三维并适应稀疏初始条件,实现了对火星大气天气的高精度模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10858 2026-02-17 cs.LG 83%

Scaling Behavior of Discrete Diffusion Language Models

离散扩散语言模型的扩展行为

Dimitri von Rütte, Janis Fluri, Omead Pooladzandi, Bernhard Schölkopf, Thomas Hofmann, Antonio Orvieto

机构 * ETH Zürich(苏黎世联邦理工学院) ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems, Tübingen(图宾根人工智能研究所)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本研究探讨了离散扩散语言模型在不同噪声类型下的扩展行为,发现其扩展特性与自回归语言模型有显著差异,并展示了在数据受限环境下均匀扩散的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11139 2026-02-12 cs.LG 83%

TabICLv2: A better, faster, scalable, and open tabular foundation model

TabICLv2:一种更优、更快、可扩展且开源的表格基础模型

Jingang Qu, David Holzmüller, Gaël Varoquaux, Marine Le Morvan

机构 * inria(法国国家信息与自动化研究所)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 TabICLv2通过合成数据生成、架构创新和优化预训练协议,在无需调优的情况下超越现有最佳模型,实现更快、更高效的表格数据处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16612 2026-02-11 cs.CV cs.LG 83%

Federated EndoViT: Pretraining Vision Transformers via Federated Learning on Endoscopic Image Collections

联邦端oscopeViT:通过联邦学习在内窥镜图像集上预训练视觉Transformer

Max Kirchner, Alexander C. Jenke, Sebastian Bodenstedt, Fiona R. Kolbinger, Oliver L. Saldanha, Jakob N. Kather, Martin Wagner, Stefanie Speidel

机构 * National Center for Tumor Diseases (NCT)(国家肿瘤中心) Translational Surgical Oncology(转化外科肿瘤学) Faculty of Medicine and University Hospital Carl Gustav Carus, TUD Dresden University of Technology(医学系和图林根大学技术大学卡尔·古斯塔夫·卡尔医院) DKFZ, Faculty of Medicine and University Hospital Carl Gustav Carus, TUD Dresden University of Technology(德累斯顿大学技术大学医学系和德累斯顿癌症研究中心) Helmholtz-Zentrum Dresden-Rossendorf (HZDR)(德累斯顿-罗斯多夫亥姆霍兹中心) Centre for Tactile Internet with Human-in-the-Loop (CeTI), TU Dresden(具有人类在环的触觉互联网中心,德累斯顿技术大学) Visceral, Thoracic and Vascular Surgery, Faculty of Medicine and University Hospital Carl Gustav Carus, TU Dresden(visceral、胸外科和血管外科,医学系和图林根大学技术大学卡尔·古斯塔夫·卡尔医院) Weldon School of Biomedical Engineering, Purdue University(生物医学工程韦尔登学校,普渡大学) Medical Oncology, NCT, University Hospital Heidelberg, Germany(医学肿瘤学,国家肿瘤中心,海德堡大学医院,德国) Medicine I, Faculty of Medicine and University Hospital Carl Gustav Carus, TU Dresden(医学I,医学系和图林根大学技术大学卡尔·古斯塔夫·卡尔医院)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 本文提出FL-EndoViT框架,通过联邦学习在内窥镜图像集上预训练视觉Transformer,解决数据隐私问题,提升手术基础模型的稳健性和泛化能力。

Comments Preprint submitted to MIDL

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08387 2026-02-10 cs.LG cs.DC 83%

Modalities, a PyTorch-native Framework For Large-scale LLM Training and Research

模态,一种用于大规模大语言模型训练和研究的PyTorch原生框架

Max Lübbering, Timm Ruland, Richard Rutmann, Felix Stollenwerk, David Fitzek, Michael Fromm, Alexander Weber, Rafet Sifa, Nicolas Flores-Herr, Joachim Köhler, Mehdi Ali

机构 * Fraunhofer IAIS(弗劳恩霍夫智能系统研究所) AI Sweden(人工智能瑞典) University of Bonn(波恩大学) Lamarr Institute(拉马尔研究所)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 Modalities是一个基于PyTorch的框架,旨在通过整合先进的并行策略和模块化设计,提升大规模大语言模型训练和研究的效率与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07790 2026-02-10 cs.LG 83%

MaD-Mix: Multi-Modal Data Mixtures via Latent Space Coupling for Vision-Language Model Training

MaD-Mix: 通过潜在空间耦合实现多模态数据混合用于视觉-语言模型训练

Wanyun Xie, Francesco Tonin, Volkan Cevher

机构 * LIONS, EPFL(EPFL 雷奥尼实验室)

专题命中 预训练与数据 :language model(title,abstract);instruction tuning(abstract);分类 cs.LG

AI总结 MaD-Mix通过潜在空间耦合实现多模态数据混合,提升视觉-语言模型训练效率,减少训练步骤并增强复杂场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06394 2026-02-09 cs.AI cs.CE q-bio.GN q-fin.CP 83%

Unlocking Noisy Real-World Corpora for Foundation Model Pre-Training via Quality-Aware Tokenization

通过质量感知的分词解锁噪声真实世界语料用于基础模型预训练

Arvid E. Gollwitzer, Paridhi Latawa, David de Gruijl, Deepak A. Subramanian, Adrián Noriega de la Colina

机构 * Broad Institute of MIT and Harvard, Cambridge, MA, USA(麻省理工学院与哈佛大学Broad研究所) Massachusetts Institute of Technology, Cambridge, MA, USA(麻省理工学院) Koch Institute for Integrative Cancer Research, MIT, Cambridge, MA, USA(麻省理工学院Koch整合癌症研究 institute) Department of Neurology and Neurosurgery, McGill University, Montreal, Canada(麦吉尔大学神经学与神经外科系) The Montreal Neurological Hospital-Institute, Montreal, Canada(蒙特利尔神经科学医院-研究所)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本研究提出质量感知分词方法,通过双层优化、强化学习和自适应参数学习机制,提升基础模型在基因组和金融领域的预训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06184 2026-02-09 cs.CV cs.CL 83%

PhenoLIP: Integrating Phenotype Ontology Knowledge into Medical Vision-Language Pretraining

PhenoLIP:将表型本体知识整合到医学视觉-语言预训练中

Cheng Liang, Chaoyi Wu, Weike Zhao, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL

AI总结 PhenoLIP通过整合表型本体知识提升医学视觉-语言模型的表型识别与跨模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05646 2026-02-06 cs.LG 83%

Empowering Time Series Analysis with Large-Scale Multimodal Pretraining

通过大规模多模态预训练增强时间序列分析

Peng Chen, Siyuan Wang, Shiyan Hu, Xingjian Wu, Yang Shu, Zhongwen Rao, Meng Wang, Yijie Li, Bin Yang, Chenjuan Guo

机构 * East China Normal University, Shanghai, China(华东师范大学) HuaWei, ShenZhen, China(华为,深圳,中国)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 本文提出HORAI模型,通过多模态预训练提升时间序列分析的泛化能力,实现零样本预测和异常检测的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00151 2026-02-06 cs.CV cs.AI 83%

Investigating the Impact of Histopathological Foundation Models on Regressive Prediction of Homologous Recombination Deficiency

探究病理基础模型对同源重组缺陷的回归预测影响

Alexander Blezinger, Wolfgang Nejdl, Ming Tang

机构 * Leibniz University Hannover(汉诺威莱布尼茨大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本研究探讨了病理基础模型在预测同源重组缺陷评分中的影响,通过实验发现基于基础模型的模型在预测准确性方面优于基线,并提出了缓解数据不平衡的上采样策略。

Comments 9 pages, 7 figures and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14865 2026-02-03 cs.CL 83%

Midtraining Bridges Pretraining and Posttraining Distributions

中期训练连接预训练和后训练分布

Emmy Liu, Graham Neubig, Chenyan Xiong

机构 * Language Technologies Institute, Carnegie Mellon University, USA(语言技术研究所,卡内基梅隆大学,美国)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL

AI总结 中期训练通过提供更好的初始化提升模型性能,尤其在与通用预训练数据距离较远的领域表现突出,且起始时间和混合权重的相互作用影响其效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00816 2026-02-03 stat.ML cs.LG 83%

Hessian Spectral Analysis at Foundation Model Scale

基础模型规模下的Hessian谱分析

Diego Granziol, Khurshid Juarev

机构 * Mathematical Institute, University of Oxford, UK(牛津大学数学研究所)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);分类 cs.LG

AI总结 本研究在大规模基础模型上实现了Hessian谱的准确分析,揭示了块对角曲率近似在中等规模LLM中的失效问题,展示了谱探测的计算效率与实际应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00405 2026-02-03 cs.AI 83%

RobustDebias: Debiasing Language Models using Distributionally Robust Optimization

RobustDebias: 使用分布鲁棒优化去偏语言模型

Deep Gandhi, Katyani Singh, Nidhi Hegde

机构 * Deep Gandhi University of Alberta(Deep Gandhi 阿尔伯塔大学) Katyani Singh University of Alberta(Katyani Singh 阿尔伯塔大学) Nidhi Hegde University of Alberta(Nidhi Hegde 阿尔伯塔大学) Alberta Machine Intelligence Institute(阿尔伯塔人工智能研究所)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 RobustDebias通过分布鲁棒优化在微调过程中减少语言模型的偏见,有效缓解偏见的同时保持性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21768 2026-01-30 cs.CL 83%

Zonkey: A Hierarchical Diffusion Language Model with Differentiable Tokenization and Probabilistic Attention

Zonkey:一种具有可微分分词和概率注意力的分层扩散语言模型

Alon Rozental

机构 * Alon Rozental(独立研究者)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 Zonkey是一种通过可微分分词和概率注意力机制实现的分层扩散语言模型,能够从噪声中生成连贯文本并提升领域适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18067 2026-01-27 cs.AI cs.NE cs.PL 83%

EvolVE: Evolutionary Search for LLM-based Verilog Generation and Optimization

EvolVE: 基于LLM的Verilog生成与优化的进化搜索

Wei-Po Hsin, Ren-Hao Deng, Yao-Ting Hsieh, En-Ming Huang, Shih-Hao Hung

机构 * Department of Electrical Engineering(电气工程系) National Taiwan University(国立台湾大学) Department of Computer Science and Information Engineering(计算机科学与信息工程系) Institute of Information Science(信息科学研究所)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 EvolVE通过进化搜索方法提升LLM在Verilog生成与优化中的性能,达到98.1%的准确率并优化行业级集成电路设计。

Comments 17 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15888 2026-01-23 cs.CV cs.AI 83%

Understanding the Transfer Limits of Vision Foundation Models

理解视觉基础模型的迁移限制

Shiqi Huang, Yipei Wang, Natasha Thorley, Alexander Ng, Shaheer Saeed, Mark Emberton, Shonit Punwani, Veeru Kasivisvanathan, Dean Barratt, Daniel Alexander, Yipeng Hu

机构 * University College London(伦敦大学学院)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文研究了视觉基础模型在迁移时的限制,发现预训练目标与下游任务需求的匹配程度影响迁移性能,提出通过改进预训练目标以提升模型效果。

Comments accepted in ISBI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00040 2026-01-15 cs.CV cs.AI 83%

Uncovering Intrinsic Capabilities: A Paradigm for Data Curation in Vision-Language Models

揭示内在能力:一种用于视觉-语言模型数据整理的范式

Junjie Li, Ziao Wang, Jianghong Ma, Xiaofeng Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Hong Kong Baptist University, China(香港 Baptist大学) City University of Hong Kong, China(香港城市大学)

专题命中 预训练与数据 :language model(title,abstract);instruction tuning(abstract);分类 cs.AI

AI总结 CADC通过揭示视觉-语言模型的内在能力,提供了一种基于能力分析的数据整理范式,以提升指令微调的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03646 2026-01-15 cs.LG cs.NI 83%

Lens: A Knowledge-Guided Foundation Model for Network Traffic

Lens: 一种基于知识的网络流量基础模型

Xiaochang Li, Chen Qian, Qineng Wang, Jiangtao Kong, Yuchen Wang, Ziyu Yao, Bo Ji, Long Cheng, Gang Zhou, Huajie Shao

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 Lens提出了一种基于知识的网络流量基础模型,通过知识引导的预训练和上下文感知微调,在分类和生成任务中均取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02867 2026-01-14 cs.CL 83%

Training Language Models with homotokens Leads to Delayed Overfitting

通过homotokens训练语言模型导致过拟合延迟

Adrian Cosma, Stefan Ruseti, Emilian Radoi, Mihai Dascalu

机构 * Dalle Molle Institute for Artificial Intelligence (IDSIA)(达勒莫莱人工智能研究所) National University of Science and Technology POLITEHNICA Bucharest(科学与技术国家大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 通过homotokens训练语言模型可延迟过拟合并提升泛化能力,方法通过辅助编码器和注意力机制实现tokenization不变性。

Comments 8 pages, 6 figures, 3 Appendices

详情

展开后加载摘要…

URL PDF HTML 收藏