arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138627 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12379 篇

2608.10595 2026-08-12 q-bio.BM cs.AI 新提交 83%

DegradeQuery: Counterfactual Tuple Pretraining for Context-Aware PROTAC Degradation Prediction

DegradeQuery:面向上下文感知PROTAC降解预测的反事实元组预训练

Dong Xu, Zhangfan Yang, Jiantao Wu, Zexuan Zhu, Jianqiang Li, Junkai Ji

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI

AI总结 DegradeQuery是一种上下文感知PROTAC降解预测框架,通过反事实元组预训练利用标签缺失的PROTAC记录,在PROTAC-8K基准上AUC达0.9065、准确率0.8500,性能优于对比方法。

Comments 19 pages, 2 figures, with supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09558 2026-08-11 cs.LG cs.NA math.NA math.ST stat.TH 新提交 83%

Training-Free Universal Approximation by Prompting Random Transformers

通过提示随机Transformer实现无训练的通用逼近

Alexander Hsu, Rongjie Lai

机构 * Purdue University(普渡大学)

专题命中 预训练与数据 :prompting(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 该研究证明预训练Transformer可选,随机未训练的单层softmax注意力网络经软提示引导可实现通用逼近,其继承核回归的极小极大最优速率,还揭示了提示相关参数的权衡关系。

Comments 31 pages, 5 figures. Comments welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06659 2026-08-10 cs.AI 新提交 83%

CellWorld: From Gene-Level Reconstruction to Latent Cell Prediction in Spatial Transcriptomics Foundation Models

CellWorld:空间转录组学基础模型中从基因水平重建到潜在细胞预测

Haiping Liu, Qian Zhao, Lijing Lin, Jingyuan Sun, Hongpeng Zhou

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出CellWorld,将空间转录组学基础模型的预测目标从基因测量转向潜在细胞表示,在多基准测试中其性能优于现有基线,仅用5%语料库预训练的大型模型也表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05000 2026-08-07 cs.CV cs.LG cs.MM 版本更新 83%

Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes

迈向多模态预训练的物理学:知识流、模态协同、早期统一与方法指南

Junlin Han, Shengbang Tong, David Fan, Minghao Chen, Philip Torr, Filippos Kokkinos, Mike Lewis

机构 * FAIR, Meta(Meta FAIR研究院) Reality Labs, Meta(Meta Reality Labs) University of Oxford(牛津大学)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 该研究探索多模态预训练的机制,得出知识流、模态协同等四个关键见解,推导高效预训练方法,为多模态预训练的理解与扩展提供基础。

Comments Project page: https://junlinhan.github.io/projects/physics_of_mm_pretrain/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03949 2026-08-07 cs.CV cs.LG 版本更新 83%

TESSERA v2: Scaling Pixel-wise Earth Foundation Models

TESSERA v2:扩展逐像素地球基础模型

Zhengpeng Feng, Sadiq Jaffer, Ira Shokar, Jovana Knezevic, James Ball, Pedro Sousa, Mark Elvers, Madeline Lisaius, Clement Atzberger, Robin Young, Aneesh Naik, Niall Robinson, David Coomes, Anil Madhavapeddy, Srinivasan Keshav

机构 * University of Cambridge(剑桥大学) NVIDIA(英伟达) dClimate Labs(dClimate实验室)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 研究逐像素地球观测基础模型的扩展及预训练预算分配,通过大规模实验发现预训练损失难预测下游性能,给出计算分配规则,训练并蒸馏模型,其成果优于其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05028 2026-08-06 cs.CL 新提交 83%

Language Models Generalize to Human-like Word Order Preferences

语言模型可泛化出类人的词序偏好

Amanda Popadich, Shane Steinert-Threlkeld

机构 * University of Washington(华盛顿大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 本研究发现不同规模的语言模型可从贫乏输入中泛化出类人的范围同态名词短语修饰语顺序偏好,且该偏好无法用点互信息解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04268 2026-08-06 cs.CL 新提交 83%

The Fairness Collapse Phenomenon: Bias Amplification in Language Models Trained on Synthetic Data

公平性崩溃现象:在合成数据上训练的语言模型中的偏差放大

Irina Proskurina, Antoine Gourru, Julien Velcin

机构 * Laboratoire Hubert Curien(于贝尔·屈里安实验室) CNRS(法国国家科学研究中心) Université Claude Bernard Lyon 1(里昂第一大学) Université Lumière Lyon 2(里昂第二大学) École Centrale de Lyon(里昂中央理工学院)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 该研究发现,在合成数据上反复训练语言模型会出现公平性崩溃,即偏差在标准指标未明显下降时悄然放大,揭示了合成数据污染的关键风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03457 2026-08-05 cs.AI 新提交 83%

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models

LLaDA MoE v2:扩展混合专家扩散语言模型

Fengqi Zhu, Shaoxuan Xu, Jingyang Ou, Zebin You, Yipeng Xing, Huabin Liu, Xiaolu Zhang, Jun Zhou, Zhenzhong Lan, Yankai Lin, Wayne Xin Zhao, Jianguo Li, Chongxuan Li, Ji-Rong Wen

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 该研究明确MoE扩散语言模型的扩展规律,训练30B-A3B的LLaDA MoE v2,其预训练令牌量为Qwen3的65%,经微调后在多数推理编码基准上优于SDAR Chat且接近Qwen3。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00114 2026-08-04 eess.SP cs.AI 新提交 83%

EEG-JEPA: Structured Latent Prediction for EEG Foundation Models

EEG-JEPA:用于脑电基础模型的结构化隐变量预测

Jinhao Li, Zhiyuan Ma, Xueqiao Han, Zhongye Xia, Xinche Zhang, Shanghong Xie, Yixuan Liu, Yongjian Li, Runmin Gan, Tianlin Huo, Sen Song

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本研究提出EEG-JEPA结构化隐变量预测框架,通过优化目标设计提升EEG基础模型性能,在EEG-FM-Bench等基准上实现了14任务、9任务的平衡准确率提升,为EEG基础建模提供了新方案。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02252 2026-08-04 cs.CV cs.AI 新提交 83%

HarMoE: Multi-Source Chest Radiograph Pretraining with Dataset-Disentangled Experts

HarMoE:基于数据集解耦专家的多源胸部X射线预训练

Haozhe Luo, Ziyu Zhou, Shelley Zixin Shu, Mauricio Reyes

机构 * University of Bern(伯尔尼大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出HarMoE框架,通过解耦数据集专家从异构胸部X射线数据集学习,提升了放射学视觉-语言模型的零样本分类、分布外迁移等性能,相关代码与87.3万份数据集将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01898 2026-08-04 cs.LG 新提交 83%

Understanding and Correcting Low-Frequency Bias in EEG Foundation Model

脑电(EEG)基础模型中低频偏差的理解与修正

Junjie Yu, Zihan Deng, Jianyu Zhang, Junrong Mu, Jiahui An, Wenxiao Ma, Ziling Lu, Yue Wang, Yan Zhu, Kexin Lou, Quanying Liu

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 针对EEG基础模型存在的低频偏差问题,提出频率平衡掩码自编码框架FAME,在OmniEEG-Bench的41项下游任务中24项达到SOTA,凸显平衡频谱监督的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28135 2026-07-31 cs.LG 新提交 83%

LM-GRASP: Instance-Specific Language Models for Combinatorial Construction via Online Imitation Learning

LM-GRASP:基于在线模仿学习的组合构造的实例特定语言模型

Mohand Mezmaz, Grégoire Danoy

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本研究提出LM-GRASP框架,将GRASP随机构造阶段转为在线模仿学习任务,用仅解码器Transformer作构造策略,在Taillard PFSP基准上平均比GPU-GRASP提升28.4个制造跨度单位,是手工构造器的实用替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23377 2026-07-30 hep-ex cs.AI 交叉投稿 83%

Predict before you train: Scaling Laws for particle physics foundation models

训练前预测:粒子物理基础模型的缩放定律

Jan-Lucas Uslu, Benjamin Nachman, Christopher Re

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 研究粒子物理基础模型训练成本高及缩放回报难测问题,通过在小模型上拟合联合缩放定律预测大模型损失,还将其与下游物理性能关联,发布相关预训练模型、训练方法及代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.16038 2026-07-30 cs.CL 版本更新 83%

ChineseBERT: Chinese Pretraining Enhanced by Glyph and Pinyin Information

ChineseBERT:通过字形和拼音信息增强的中文预训练模型

Zijun Sun, Xiaoya Li, Xiaofei Sun, Yuxian Meng, Guoyin Wang, Xiang Ao, Qing He, Fei Wu, Jiwei Li

机构 * Zhejiang University(浙江大学) Key Lab of Intelligent Information Processing of Chinese Academy of Sciences(中国科学院智能信息处理重点实验室)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL

AI总结 研究针对中文预训练模型忽略字形和拼音信息的问题,提出ChineseBERT,将二者纳入预训练,在大规模语料库上训练后,在多种中文NLP任务中性能显著提升,取得新SOTA,代码和模型已公开。

Comments To appear at ACL2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03773 2026-07-29 cs.CL 版本更新 83%

KletterMix: Climbing Toward High-Quality German Pretraining Data - The Full Report

KletterMix: 攀登高质量德语预训练数据

Maurice Kraus, Ruben Härle, Sebastian Sztwiertnia, Abbas Goher Khan, Mehdi Ali, Michael Fromm, Nicolas Flores-Herr, Kristian Kersting

机构 * AI & ML Group, TU Darmstadt(人工智能与机器学习小组,德累斯顿技术大学) Lab1141 Lamarr Institute(拉马尔研究所) Fraunhofer IAIS(弗劳恩霍夫人工智能研究所) hessian.AI(海斯坦.AI) German Research Center for AI (DFKI)(德国人工智能研究中心(DFKI)) Centre for Cognitive Science, TU Darmstadt(认知科学中心,德累斯顿技术大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL

AI总结 通过翻译高质量英语语料库构建德语预训练语料库KletterMix,并验证其在德语下游任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22662 2026-07-28 cs.AI 新提交 83%

CuraWeb: Joint Optimization of Quality, Redundancy, and Diversity for Web-Scale Pretraining Data

CuraWeb:网络规模预训练数据的质量、冗余性和多样性联合优化

Peiguang Li, Yongwei Zhou, Juncheng Diao, Yuchun Fan, Jian Yang, Jianxiao Yang, Zhongda Su, Shuguang Jiao, Xiao Wei, Zhiye Zou, Gan Dong, Zhizhao Zeng, Rongxiang Weng, Jingang Wang, Xunliang Cai

机构 * Meituan(美团)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究针对开放网络语料库预训练数据优化的局限性,提出质量、冗余性和多样性联合优化范式,结合双轨清理与混合去重,构建CuraWeb语料库,实验证明其在多基准测试中性能显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21458 2026-07-24 cs.AI stat.ME 新提交 83%

Detecting LLM-Generated Tokens in Human--LLM Coauthored Text

在人类与大语言模型合作撰写的文本中检测大语言模型生成的令牌

Yangjun Lu, Hongyi Zhou, Fabian Spill, Kai Ye, Chengchun Shi, Jin Zhu

机构 * School of Mathematics, University of Birmingham(伯明翰大学数学学院) School of Statistics and Data Science, Shanghai University of Finance and Economics(上海财经大学统计与数据科学学院) Department of Statistics, The London School of Economics and Political Science(伦敦政治经济学院统计系)

专题命中 预训练与数据 :LLM(title,abstract);language model(abstract);分类 cs.AI

AI总结 针对人类与大语言模型合作撰写文本中难以检测大语言模型生成内容的问题,提出在令牌级别运行、基于现有分数并平滑分数降低变异性的新方法,在合成与真实数据集上性能强,还部署了网站。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21402 2026-07-24 cs.AI 新提交 83%

MSBraM: A Multi-scale Self-supervised Brain Foundation Model for Hierarchical EEG Dynamics Learning

MSBraM:用于分层脑电动力学学习的多尺度自监督脑基础模型

Tao Zhou, Jing Han, Lingyu Shu, Zixing Zhang

机构 * Hunan University(湖南大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 针对现有方法难捕捉EEG信号多尺度时间结构的问题,提出MSBraM模型。该模型采用两阶段预训练框架,经多尺度神经分词器和课程多尺度掩码策略学习分层EEG表征。实验显示其在多个下游任务中性能优越,证明显式建模多尺度时间动态对EEG基础模型的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21384 2026-07-24 cs.AI 新提交 83%

Multimodal Pretraining for Generalizable EEG Representation Learning

用于可泛化脑电信号表征学习的多模态预训练

Targol Bakhtiarvand, Jugal Kalita, Adham Atyabi

机构 * University of Colorado Colorado Springs(科罗拉多大学科罗拉多斯普林斯分校)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 研究针对癫痫EEG模型应用局限问题,开发多模态EEG基础模型,结合多种编码器,通过创新预训练技术创建癫痫相关表征。在多个数据集和评估设置下实验,该模型实现强大癫痫检测与适应新场景能力,支持可解释癫痫定位,性能达当前最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17782 2026-07-21 cs.CV cs.AI 新提交 83%

BrainNext: A General-Purpose Self-Supervised Foundation Model for Brain MRI Analysis

BrainNext:用于脑MRI分析的通用自监督基础模型

Moona Mazher, Abdul Qayyum, Steven A. Niederer, Daniel C. Alexander

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 研究提出BrainNext通用自监督基础模型用于脑MRI分析,结合MAE预训练与三维双向xLSTM-UNet架构,从大量未标记数据学习,经微调用于下游任务,在FOMO 2025评估中表现出色,证明其可转移性和作为基础模型的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04344 2026-07-21 stat.ML cs.LG math.ST stat.TH 版本更新 83%

Perturbation is All You Need for Extrapolating Language Models

扰动是语言模型外推所需的一切

Zetai Cen, Jin Zhu, Xinwei Shen, Chengchun Shi

机构 * School of Mathematics, University of Bristol(布里斯托大学数学系) School of Mathematics, University of Birmingham(伯明翰大学数学系) Department of Statistics, University of Washington(华盛顿大学统计系) Department of Statistics, London School of Economics and Political Science(伦敦政治经济学院统计系)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 本文针对大语言模型外推问题,提出基于扰动的方法,先转换前缀为语义邻域再进行下一个token预测,构建分层模型。通过建立五个属性发展外推性理论,经合成与真实数据评估,该方法提升支持域外预测性能,为语言建模提供实用路径。

Comments 59 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16152 2026-07-21 cs.CR cs.LG 版本更新 83%

Gradient-Free Privacy Leakage in Federated Language Models through Selective Weight Tampering

通过选择性权重篡改在联邦语言模型中实现无梯度隐私泄露

Md Rafi Ur Rashid, Vishnu Asutosh Dasu, Kang Gu, Najrin Sultana, Shagufta Mehnaz

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Dartmouth College(达特茅斯学院)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 研究联邦语言模型中隐私敏感数据泄露问题,发现中间轮次模型快照及恶意参与者篡改选择性权重会加剧泄露,提出无梯度攻击方法,提升了成员推理召回率和私有数据重建率,还给出客户端防御隐私风险的技术建议。

Comments 21 pages (including bibliography and Appendix), Submitted to PETS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12831 2026-07-15 cs.CL 新提交 83%

Knowledgeless Language Models: Suppressing Parametric Recall for Evidence-Grounded Language Modeling

无知识语言模型:抑制参数化记忆以进行基于证据的语言建模

Roi Cohen, Yvan Carré, Nick Lechtenbörger, Hendrik Droste, Lucas Kerschke, Russa Biswas, Gerard de Melo, Jan Buys

机构 * HPI / University of Potsdam(波茨坦大学哈索·普拉特纳数字工程学院) African Institute for Mathematical Sciences(非洲数学科学研究所) Department of Computer Science Aalborg University(奥尔堡大学计算机科学系) Department of Computer Science University of Cape Town(开普敦大学计算机科学系) Polytechnique Montréal(蒙特利尔理工大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 研究修改预训练信号能否使语言模型从参数化记忆转向基于证据的推理,引入无知识语言模型(KLLMs),其在命名实体匿名化语料库上预训练,实验表明能降低闭卷事实记忆,在多任务基准上表现优,提升鲁棒性与校准,为语言模型训练提供新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10798 2026-07-13 cs.LG 新提交 83%

CITRAS-FM: Tiny Time Series Foundation Model for Covariate-Informed Zero-Shot Forecasting

CITRAS-FM: 面向协变量信息零样本预测的微型时间序列基础模型

Yosuke Yamaguchi, Issei Suemitsu, Yuki Kajihara, Wenpeng Wei

机构 * University of Tokyo(东京大学) Keio University(庆应大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 提出CITRAS-FM,一个仅7M参数的时间序列基础模型,通过引入Shifted Attention和协变量合成方法CovSynth,实现高效零样本预测,在100个任务上达到子10M模型最优精度且CPU推理时间低于0.1秒。

Comments Accepted to EUSIPCO 2026. Code available at https://github.com/hitachi-ais/citras-fm

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06145 2026-07-08 cs.CL 新提交 83%

Prompting Complexity: Shortest Prompts for Texts and Behaviors in LLMs

提示复杂性:大语言模型中用于文本和行为的最短提示

Adrian Cosma

机构 * Dalle Molle Institute for Artificial Intelligence (IDSIA)(达勒·莫利人工智能研究所)

专题命中 预训练与数据 :prompting(title,abstract);language model(abstract);分类 cs.CL

AI总结 研究提示复杂性,定义其为固定语言模型产生目标文本的最短合理提示量,类似资源受限柯尔莫哥洛夫复杂性。介绍计算方法、扩展定义到软提示复杂性,定义提示距离等,据此制定研究议程以探究短提示可实现的文本和行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04081 2026-07-07 cs.LG stat.ML 新提交 83%

A Unified Framework for In-Context Learning with Causal and Masked Language Models

一种用于上下文学习的因果和掩码语言模型统一框架

Chenrui Liu, Chuanlong Xie, Falong Tan, Yicheng Zeng, Lixing Zhu

机构 * Beijing Normal University at Zhuhai(北京师范大学珠海分校) Hunan University(湖南大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 研究上下文学习,提出统计学习框架,将自回归和掩码预训练目标置于共同风险分析中,在特定条件下得出推理时MASK和自回归目标的同阶上界等成果,做了实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02546 2026-07-03 cs.CV cs.LG 版本更新 83%

RGB-Pointmap Pretraining for Unified 3D Scene Understanding

对比语言-彩色点图预训练用于统一3D场景理解

Ye Mao, Weixun Luo, Ranran Huang, Junpeng Jing, Krystian Mikolajczyk

机构 * Imperial College London(帝国理工学院伦敦分校)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 提出UniScene3D,一种基于Transformer的编码器,通过多视图彩色点图联合建模外观和几何,并引入跨视图几何对齐和接地视图对齐,在少样本和任务特定微调中达到SOTA。

Comments 19 Pages, ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18466 2026-07-03 cs.CL 83%

CEFR-Annotated WordNet: LLM-Based Proficiency-Guided Semantic Database for Language Learning

CEFR标注的WordNet:基于大语言模型的 proficiency 指导语义数据库用于语言学习

Masato Kikuchi, Masatsugu Ono, Toshioki Soga, Tetsu Tanabe, Tadachika Ozono

机构 * Nagoya Institute of Technology(名古屋技术大学) Kitami Institute of Technology(Kitami技术学院) Chitose Institute of Science and Technology(常立科学技术学院) Hokkaido University(北海道大学)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于CEFR的WordNet标注数据库,利用大语言模型自动整合语义网络与语言水平,开发出有效的上下文词法分类器,实验表明其性能与标准标注相当,且在语言教育中具有应用价值。

Comments The 15th edition of the Language Resources and Evaluation Conference (LREC 2026); resources are available at https://doi.org/10.5281/zenodo.17395388

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00784 2026-07-02 cs.CV cs.AI 新提交 83%

LeVLJEPA: End-to-End Vision-Language Pretraining Without Negatives

LeVLJEPA:无负样本的端到端视觉语言预训练

Lukas Kuhn, Giuseppe Serra, Randall Balestriero, Florian Buettner

机构 * German Cancer Research Center(德国癌症研究中心) German Cancer Consortium(德国癌症联盟) Goethe University Frankfurt(法兰克福大学) Brown University(布朗大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI

AI总结 提出首个完全非对比的端到端视觉语言预训练方法LeVLJEPA,通过跨模态预测与分布正则化学习,无需负样本、温度参数等,生成更强的密集语义特征,在下游任务中优于对比基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00510 2026-07-02 cs.LG stat.ML 新提交 83%

Prototype Language Models

原型语言模型

Dan Ley, Giang Nguyen, Himabindu Lakkaraju, Julius Adebayo

机构 * Harvard University(哈佛大学) Guide Labs Inc.(Guide Labs公司)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract_cn);分类 cs.LG

AI总结 提出原型语言模型架构PRISM,通过稀疏非负原型混合进行预测,在保持下游精度的同时实现快速训练数据归因和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏