arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12353 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12353 篇

2605.28818 2026-08-05 cs.CL q-bio.NC 版本更新 88%

Do VLMs Align Better with Humans than LLMs during Natural Reading?

VLMs 在自然阅读中可能不会全局性地增强与人类的对齐性优于 LLMs

Jinzhou Wu, Zhengwu Ma, Jixing Li, Baoping Tang, Zitong Lu

机构 * Department of Mechanical and Vehicle Engineering, Chongqing University(重庆大学机械与车辆工程学院) Department of Linguistics and Translation, City University of Hong Kong(香港城市大学语言学与翻译系) McGovern Institute for Brain Research, Massachusetts Institute of Technology(麻省理工学院麦戈文脑科学研究所)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 通过严格文本设置比较LLM和VLM,发现多模态预训练在自然阅读中未带来全局性人类对齐优势,但视觉语义内容强的句子中VLM有选择性优势。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18927 2026-07-22 cs.AI 新提交 88%

OntoBook: Ontology-Grounded Synthetic Textbooks for Medical Encoder Pretraining

OntoBook:用于医学编码器预训练的基于本体的合成教科书

Rian Touchent, Éric de la Clergerie

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract,journal_ref);language model(abstract,journal_ref);LLM(abstract)

AI总结 研究提出OntoBook方法,将医学本体结构转为预训练信号,经随机游走、大语言模型重述等三阶段,用生成文本训练法语编码器,在多基准测试中有显著改进,强调目标对齐必要,还发布了相关教科书与模型检查点。

Journal ref Proceedings of Knowledge Graphs and Large Language Models Workshop, May 2026, Palma de Mallorca, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18413 2026-07-22 cs.CL 新提交 88%

Convolution for Large Language Models

大语言模型中的卷积

Yuchuan Tian, Yingte Shu, Wei He, Shuo Zhang, Tianchen Zhao, Chao Xu, Xinghao Chen, Yunhe Wang, Hanting Chen, Yu Wang

机构 * Peking University(北京大学) Huawei Technologies(华为技术有限公司) Tsinghua University(清华大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究大语言模型中,轻量级深度卷积能否在不大幅增模型大小的情况下提供局部归纳偏差。通过实验发现特定位置应用卷积效果最佳,采用特定残差深度卷积设计,在多个模型和数据预算下提升了下游基准平均准确率,支持其作为自注意力补充建模短程交互。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14703 2026-07-17 cs.CV cs.AI 新提交 88%

Pretraining Multiple Instance Learning Networks with Multi-Teacher Distillation from Pathology Slide Foundation Models

基于病理切片基础模型的多教师蒸馏预训练多实例学习网络

Mingxi Fu, Jiawen Li, Renao Yan, Jiali Hu, Qiehe Sun, Tian Guan, Yonghong He

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) University of Washington(华盛顿大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞)) Medical Optical Technology R&D Center, Research Institute of Tsinghua(清华研究院医学光学技术研发中心) Jinfeng Laboratory(金凤实验室)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI

AI总结 针对计算病理学中多实例学习存在的问题,提出基于蒸馏的预训练框架,利用两个基础模型作为教师,引入角分散归一化蒸馏损失,将蒸馏权重用于下游适应,实验表明该方法在少样本场景中优势明显,能提升计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13182 2026-07-14 cs.CL 88%

Evaluating Large Language Models for Diacritic Restoration in Romanian Texts: A Comparative Study

评估大型语言模型在罗马尼亚文本中的重音恢复性能:一项比较研究

Mihai Nadas, Laura Diosan

机构 * Babeș-Bolyai University(巴贝什-波雅伊大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究评估了多种大型语言模型在罗马尼亚文本重音恢复任务中的性能,发现GPT-4o表现优异,揭示了模型架构和提示设计对重音恢复的影响。

Comments The original submission contained metadata errors and requires correction. A revised and complete version will be submitted as a replacement

Journal ref Innovative Perspectives on Computational Intelligence and Data Science (InnoComp 2025), Communications in Computer and Information Science, vol. 2794, Springer, Cham, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03925 2026-07-07 cs.LG 新提交 88%

NeuroOnline: Bridging Pretraining and Online Adaptation for EEG Foundation Models

NeuroOnline:为脑电图基础模型搭建预训练与在线适应的桥梁

Weibin Li, Wendu Li, Yushan You, Chen Wei, Quanying Liu

机构 * Southern University of Science and Technology(南方科技大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.LG

AI总结 研究脑电图基础模型,提出NeuroOnline框架,集成多视图一致性学习和上下文感知表示调制机制,统一表示对齐和动态适应,实验表明其在在线设置中性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13254 2026-06-12 cs.CL 新提交 88%

Evaluating Pluralism in LLMs through Latent Perspectives

通过潜在视角评估LLM中的多元主义

Laura Majer, Jan Šnajder, Martin Tutek

机构 * University of Helsinki(赫尔辛基大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 预训练与数据 :LLM(title_cn,summary_cn);prompting(abstract);分类 cs.CL

AI总结 提出一种领域无关的多层无监督框架,从LLM生成文本中提取潜在视角,评估多元主义差距,发现稀有视角仍被不成比例地低估。

Comments Pluralistic Alignment Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06888 2026-06-10 cs.LG 版本更新 88%

Data-Constrained Language Model Pretraining: Improved Regularization and Scaling Laws

数据受限的语言模型预训练:改进的正则化与缩放定律

Zhiwei Xu, Shihao Wu, Hanseul Cho, Wei Hu, Yixin Wang

机构 * University of Michigan(密歇根大学) KAIST AI(韩国科学技术院人工智能研究所)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.LG

AI总结 研究数据受限下语言模型预训练的正则化与缩放,提出掩码输入正则化(MIR)改善验证损失,并设计SoftQ缩放定律更准确拟合重复数据下的模型与数据规模交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07590 2026-06-09 cs.CV cs.AI 新提交 88%

SlideCheck: Guiding Self-Supervised Pretraining of Pathology Foundation Models via Dataset Distributions

SlideCheck: 通过数据集分布引导病理基础模型的自监督预训练

Mingyi He, Xinyi Guo, Xitong Ling, Weiming Chen, Jiawen Li, Lianghui Zhu, Minxi Ouyang, Mingxi Fu, Yizhi Wang, Tian Guan

机构 * Beijing University of Chemical Technology(北京化工大学) South China Normal University(华南师范大学) Tsinghua University(清华大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI

AI总结 提出SlideCheck工具,利用冻结病理基础模型的特征,通过双头MLP评分异常和恶性证据,引导自监督预训练数据筛选,实验表明数据分布影响模型下游性能。

Comments 9 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14752 2026-06-09 cs.LG 版本更新 88%

LLMSynthor: Macro-Aligned Micro-Records Synthesis with Large Language Models

LLMSynthor: 使用大语言模型进行宏观对齐的微观记录合成

Yihong Tang, Menglin Kong, Junlin He, Tong Nie, Wei Ma, Lijun Sun

机构 * McGill University(麦吉尔大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出LLMSynthor方法,利用大语言模型作为非参数copula,通过迭代生成与目标宏观统计一致的微观记录,解决大规模细粒度数据收集困难的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06373 2026-06-05 eess.SP cs.AI 88%

LatentWave: JEPA Pretraining for Wireless Foundation Models

LatentWave: 无线基础模型的JEPA预训练

Ahmed Mohamed, Ahmed Aboulfotouh, Hatem Abou-Zeid

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI

AI总结 提出LatentWave,采用联合嵌入预测架构(JEPA)在潜空间预测掩码区域,学习可迁移的无线信号表示,并在四个下游任务中优于掩码建模基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05936 2026-06-05 cs.CL 88%

Epistemic Injustice in Language Models: An Audit of Pretraining Filters and Guardrails

语言模型中的认知不公正:预训练过滤器和护栏的审计

Marco Antonio Stranisci, A Pranav, Rossana Damiano, Christian Hardmeier, Anne Lauscher

机构 * University of Turin(都灵大学) IT University of Copenhagen(哥本哈根技术大学) Trustworthy AI Lab(可信人工智能实验室)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL

AI总结 通过审计预训练过滤器和推理时护栏,发现它们对边缘群体(如跨性别者、女性和中美洲人)的提及存在过度标记,导致认知抹除,而人类标注者会保留大部分被标记内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03681 2026-06-03 cs.LG 88%

Speedrunning Tabular Foundation Model Pretraining

表格基础模型预训练的速通

Salih Bora Ozturk, Alexander Pfefferle, Frank Hutter

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.LG

AI总结 提出一种速通竞赛格式,通过优化单文件训练脚本,在nanoTabPFN上实现81倍预训练加速,并建立社区排行榜以累积改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28456 2026-05-28 cs.AI cs.CV eess.AS 88%

Diffusion Large Language Models for Visual Speech Recognition

用于视觉语音识别的扩散大语言模型

Jeong Hun Yeo, Chae Won Kim, Hyeongseop Rha, Yong Man Ro

机构 * Integrated Vision Language Lab, KAIST, South Korea(韩国加耶大学集成视觉语言实验室)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出首个基于扩散大语言模型(DLLM)的视觉语音识别框架DLLM-VSR,通过迭代掩码去噪和灵活顺序解码,结合置信度引导的解掩码策略及两阶段训练,并引入长度引导候选解码以降低目标长度不确定性,在LRS3上取得19.5%的词错误率。

Comments Code: https://github.com/JeongHun0716/dllm-vsr

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04777 2026-05-21 cs.LG math.OC 88%

Optimization Hyper-parameter Laws for Large Language Models

大语言模型的优化超参数规律

Xingyu Xie, Kuangyu Ding, Shuicheng Yan, Kim-Chuan Toh, Tianwen Wei

机构 * Department of Mathematics, National University of Singapore, Singapore(新加坡国立大学数学系) School of Computing, National University of Singapore(新加坡国立大学计算机学院) Department of Mathematics and Institute of Operations Research and Analytics, National University of Singapore, Singapore(新加坡国立大学数学系和运筹分析研究所) Skywork AI, Beijing(北京Skywork AI)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出Opt-Laws框架,通过分析SDE收敛和逃逸特性,预测最终训练损失,从而在小规模实验中预选学习率调度方案,提高了超参数选择的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13397 2026-05-19 cs.CY cs.AI 88%

The threat of analytic flexibility in using large language models to simulate human data

使用大语言模型模拟人类数据时分析灵活性的威胁

Jamie Cummins

机构 * University of Bern, Switzerland(伯尔尼大学,瑞士) University of Oxford, United Kingdom(牛津大学,英国)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文研究了在使用大语言模型生成合成数据时,分析选择对合成数据与人类数据一致性的影响,发现不同的配置选择可能导致结论差异显著,呼吁关注分析灵活性的潜在威胁并提出减少该威胁的策略。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12492 2026-05-13 cs.LG stat.ML 88%

Pion: A Spectrum-Preserving Optimizer via Orthogonal Equivalence Transformation

Pion:通过正交等价变换实现的谱保持优化器

Kexuan Shi, Hanxuan Li, Zeju Qiu, Yandong Wen, Simon Buchholz, Weiyang Liu

机构 * The Chinese University of Hong Kong(香港中文大学) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Westlake University(西交利物浦大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 Pion通过正交等价变换实现谱保持优化,不同于Adam等加法优化器,其通过左右正交变换更新权重矩阵,保持奇异值不变,从而在保持谱范数的同时调节权重矩阵几何结构,实验表明其在LLM预训练和微调中具有稳定且竞争力的性能。

Comments Technical report v1 (30 pages, 19 figures, project page: https://spherelab.ai/pion/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05687 2026-05-08 cs.AI 88%

DataDignity: Training Data Attribution for Large Language Models

DataDignity: 为大语言模型训练数据的归因

Xiaomin Li, Andrzej Banburski-Fahey, Jaron Lanier

机构 * Microsoft(微软)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract_cn);prompting(abstract)

AI总结 研究提出通过归因方法识别支持语言模型响应的文档,引入FakeWiki基准测试,评估ScoringModel在九个模型上的表现,提升Recall@10至52.2,展示训练数据归因需区分真实支持与主题或词汇相似性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21086 2026-05-05 cs.CL 88%

Orthographic Constraint Satisfaction and Human Difficulty Alignment in Large Language Models

正交约束满足与大语言模型中的人类难度对齐

Bryan E. Tuck, Rakesh M. Verma

机构 * University of Houston(德克萨斯大学休斯顿分校)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文评估了三种大语言模型在字符级约束满足任务上的表现,发现跨家族性能差异显著大于同家族参数扩展效果,且模型在处理常见词时存在系统性失败,揭示了对分布合理性依赖的问题。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21104 2026-04-24 cs.CV cs.LG 88%

Pretrain Where? Investigating How Pretraining Data Diversity Impacts Geospatial Foundation Model Performance

预训练在哪里?探究预训练数据多样性如何影响地理空间基础模型性能

Amandeep Kaur, Mirali Purohit, Gedeon Muhawenayo, Esther Rolf, Hannah Kerner

机构 * Arizona State University(亚利桑那州立大学) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.LG

AI总结 本文研究预训练数据地理组成对模型下游性能的影响,发现欧洲预训练数据在全局和本地评估中表现最佳,发现光谱多样性与性能强相关。

Comments Accepted at EarthVision workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01687 2026-04-22 cs.CL 88%

StochasTok: Improving Fine-Grained Subword Understanding in LLMs

StochasTok:提升大语言模型的细粒度子词理解

Anya Sims, Thom Foster, Klara Kaleb, Tuan-Duy H. Nguyen, Joseph Lee, Jakob N. Foerster, Yee Whye Teh, Cong Lu

机构 * FLAIR, University of Oxford(FLAIR,牛津大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) University of British Columbia(不列颠哥伦比亚大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出StochasTok,一种高效的随机分词方法,通过在训练中随机分割token,提升LLM在子词层面的任务表现,包括字符计数和数学任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12463 2026-04-02 cs.CL 88%

Community size rather than grammatical complexity better predicts Large Language Model accuracy in a novel Wug Test

社区规模而非语法复杂性更能预测大型语言模型在新型Wug测试中的准确性

Nikoleta Pantelidou, Evelina Leivada, Raquel Montero, Paolo Morosi

机构 * Universitat Autònoma de Barcelona(巴塞罗那自治大学) Institució Catalana de Recerca i Estudis Avançats(加泰罗尼亚高等研究院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究通过多语言Wug测试评估大型语言模型在形态泛化任务中的表现,发现模型准确性更受语言社区规模和数据量影响,而非语法复杂性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19660 2026-03-30 cs.CV cs.LG 88%

Towards Knowledge Guided Pretraining Approaches for Multimodal Foundation Models: Applications in Remote Sensing

面向多模态基础模型的知识引导预训练方法:遥感应用

Praveen Ravirathinam, Ajitesh Parthasarathy, Ankush Khandelwal, Rahul Ghosh, Vipin Kumar

机构 * University of Minnesota(明尼苏达大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.LG

AI总结 本文提出KG-VSF方法,通过条件生成任务建模预测,提升遥感任务中因果关系的建模能力,提升下游任务性能。

Comments 33 pages with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21584 2026-03-24 cs.LG cs.CV 88%

SSAM: Singular Subspace Alignment for Merging Multimodal Large Language Models

SSAM:奇异子空间对齐用于融合多模态大语言模型

Md Kaykobad Reza, Ameya Patil, Edward Ayrapetian, M. Salman Asif

机构 * University of California Riverside(加州大学河滨分校) Amazon(亚马逊)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 SSAM通过参数空间对齐融合多模态大语言模型,无需训练数据实现跨模态统一,提升性能并降低资源消耗。

Comments 25 Pages, 9 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18013 2026-03-20 cs.CL 88%

Learned but Not Expressed: Capability-Expression Dissociation in Large Language Models

学会但未表达:大型语言模型中的能力-表达脱节

Toshiyuki Shigemura

机构 * Independent Researcher(独立研究员)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究探讨了大型语言模型在特定条件下能重构训练数据内容,但无法在常规生成任务中表现的能力脱节现象,发现生成输出中未出现非因果解决方案框架。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14563 2026-03-17 cs.CL 88%

Multilingual TinyStories: A Synthetic Combinatorial Corpus of Indic Children's Stories for Training Small Language Models

多语言TinyStories:一种印度儿童故事的合成组合语料库,用于训练小型语言模型

Deepon Halder, Angira Mukherjee

专题命中 预训练与数据 :language model(title,abstract);small language model(title,abstract);分类 cs.CL

AI总结 本文提出一个多语言TinyStories语料库,包含17种印度语言的儿童故事,用于训练和评估小型语言模型,通过混合编纂流程生成了132,942个故事和9390万词。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14178 2026-03-12 cs.CV cs.AI 88%

UniWeTok: An Unified Binary Tokenizer with Codebook Size $\mathit{2^{128}}$ for Unified Multimodal Large Language Model

UniWeTok: 一种具有 $2^{128}$ 大小代码本的统一二进制分词器用于统一多模态大语言模型

Shaobin Zhuang, Yuang Ai, Jiaming Han, Weijia Mao, Xiaohui Li, Fangyikang Wang, Xiao Wang, Yan Li, Shanchuan Lin, Kun Xu, Zhenheng Yang, Huaibo Huang, Xiangyu Yue, Hao Chen, Yali Wang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 UniWeTok通过大规模二进制代码本和改进的训练框架,实现统一多模态大语言模型的高效视觉表示。

Comments 29 pages, 9 figures, 33 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23184 2026-03-10 cs.CL 88%

PonderLM-2: Pretraining LLM with Latent Thoughts in Continuous Space

PonderLM-2: 在连续空间中通过潜在思想预训练语言模型

Boyi Zeng, He Li, Shixiang Song, Yixuan Wang, Zitong Wang, Ziwei He, Xinbing Wang, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Sun Yat-sen University(中山大学)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(title);language model(abstract);分类 cs.CL

AI总结 PonderLM-2通过在预训练过程中引入潜在思想的连续空间优化,提升了语言模型的生成能力与下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04478 2026-03-06 cs.LG 88%

Standing on the Shoulders of Giants: Rethinking EEG Foundation Model Pretraining via Multi-Teacher Distillation

站在巨人肩膀上:通过多教师蒸馏重新思考EEG基础模型预训练

Chenqi Li, Yu Liu, Shuo Zhang, Timothy Denison, Tingting Zhu

机构 * Department of Engineering Science, University of Oxford(工程科学系,牛津大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.LG

AI总结 本文提出MTDP框架,通过多教师蒸馏预训练EEG基础模型,提升模型性能并减少预训练数据需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00253 2026-03-04 cs.LG 88%

CoPeP: Benchmarking Continual Pretraining for Protein Language Models

CoPeP:蛋白质语言模型持续预训练基准测试

Darshan Patil, Pranshu Malviya, Mathieu Reymond, Quentin Fournier, Sarath Chandar

机构 * Mila - Quebec AI Institute(魁北克AI研究所) Polytechnique Montréal(蒙特利尔理工学院) Chandar Research Lab(昌达尔研究实验室) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.LG

AI总结 CoPeP基准测试通过评估持续学习方法在蛋白质语言模型中的表现,揭示了整合时间元信息对模型性能的提升效果。

Comments 29 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏