arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 10821 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 737 篇

2606.20089 2026-06-19 cs.CL cs.AI 新提交 84%

IHUBERT: Vector-Based Semantic Deduplication and Domain-Balanced Pretraining for Persian Resources

IHUBERT: 面向波斯语资源的基于向量的语义去重与领域平衡预训练

Arash Ghafouri, Mahdi Firouzmandi, Hossein Saberi, Mohammad Reza Hasani Ahangar

机构 * Department of Artificial Intelligence and Cognitive Science, Imam Hossein Comprehensive University(人工智能与认知科学系,伊玛目·侯赛因综合大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出IHUBERT,一个基于RoBERTa-base的波斯语预训练模型,通过多阶段预处理(包括基于向量数据库的语义去重和领域平衡)在45GB语料上训练,在多项NLU任务上取得领先结果,尤其抽取式问答表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14752 2026-06-16 cs.CV cs.AI cs.LG cs.RO 新提交 84%

X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining

X-Tokenizer: 一种用于视觉-语言-动作预训练的多模态动作分词器

Miracle Kang, Lights Shi, Lucy Liang, Roy Gan, Dongxiu Liu, Pushi Zhang, Sylas Chen, Shawn Qin, Yinan Zheng, Jinliang Zheng, Hao Wang, Xianyuan Zhan, Hang Su

机构 * Square Robot City University of Hong Kong(香港城市大学) Tsinghua University(清华大学)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出X-Tokenizer,通过语义残差量化(SRQ)和掩码动作建模(MAM)将动作离散化为语义接口,在2.4M轨迹上预训练后提升VLA模型的多模态接地和长程任务性能。

Comments Project page: https://x-square-robot.github.io/X-Tokenizer_projectPage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12595 2026-06-12 cs.LG cs.AI cs.CV 新提交 84%

Emerging Flexible Designs for Geospatial Multimodal Foundation Models

地理空间多模态基础模型的新兴灵活设计

Philipe Dias, Waqwoya Abebe, Abhishek Potnis, Aristeidis Tsaris, Dan Lu, Xiao Wang, Dalton Lunga

机构 * Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文系统比较了不同架构的地理空间基础模型,在统一设置下评估其灵活性与性能,为多模态推理提供设计指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11499 2026-06-11 cs.CL cs.AI 新提交 84%

Hubs or Fringes: Pretraining Data Selection via Web Graph Centrality

枢纽或边缘:基于网页图中心性的预训练数据选择

Vedant Badoni, Danqi Chen, Xinyi Wang

机构 * Princeton Language and Intelligence(普林斯顿语言与智能) Princeton University(普林斯顿大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出WebGraphMix框架,利用Common Crawl主机级网页图的结构中心性得分调整预训练数据中中心与边缘文档的比例,无需模型训练或标注数据,在400M和1B参数模型上平均性能提升至41.4%。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09893 2026-06-10 eess.IV cs.AI cs.LG 新提交 84%

Tractogram foundation model

TractFM:纤维束图基础模型

Guikun Chen, Yuqian Chen, Yijie Li, Yogesh Rathi, Nikos Makris, Fan Zhang, Wenguan Wang, Lauren J. O'Donnell

机构 * The State Key Lab of Brain-Machine Intelligence, Zhejiang University, Hangzhou(脑机智能国家重点实验室,浙江大学,杭州) Department of Radiology, Brigham and Women’s Hospital, Mass General Brigham, Boston(放射科,布里洛妇女医院,马萨诸塞总医院,波士顿) Harvard Medical School, Boston(哈佛医学院,波士顿) Academy of Medical Engineering and Translational Medicine, Tianjin University, Tianjin(医学工程与转化医学研究院,天津大学,天津) School of Information and Communication Engineering, University of Electronic Science and Technology of China, Chengdu(信息与通信工程学院,电子科技大学,成都) Psychiatry Neuroimaging Laboratory, Brigham and Women’s Hospital, Mass General Brigham, Boston(精神病神经影像实验室,布里洛妇女医院,马萨诸塞总医院,波士顿) Department of Psychiatry, Center for Morphometric Analysis, Massachusetts General Hospital, Boston(精神病科,形态分析中心,马萨诸塞总医院,波士顿)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出TractFM基础模型,直接从全脑纤维束集学习可复用表示,结合局部纤维编码器和置换等变纤维束编码器,通过密集解剖束分割预训练,实现纤维束级和受试者级任务的迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07692 2026-06-09 cs.LG cs.AI cs.ET 新提交 84%

BCG-FM: A Foundation Model for Ambient Cardiac Health Sensing

BCG-FM:一种用于环境心脏健康感知的基础模型

Magnus Ruud Kjaer, Haejun Han, Ashish Neupane, David Q. Sun

机构 * Department of Computer Science and Engineering, University of California, San Diego(1 加州大学圣迭戈分校计算机科学与工程系)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出首个环境机械生物信号基础模型BCG-FM,利用床垫压电传感器无感采集心冲击图,通过14.6万人的275万小时数据预训练,在生物年龄估计上达到3.26年MAE,并实现15种健康状态的临床相关判别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07365 2026-06-08 cs.LG cs.AI 新提交 84%

A robust PPG foundation model using multimodal physiological supervision

一种使用多模态生理监督的鲁棒PPG基础模型

Eloy Geenjaar, Vince Calhoun, Scott Daly, Gouthaman KV, Lie Lu, Trisha Mittal, Daniel P. Darcy

机构 * Dolby Laboratories(杜比实验室)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出一种PPG基础模型,利用ICU数据集中的心电和呼吸信号选择对比样本,无需高质量或场域数据预训练,在15个下游任务中14个取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29129 2026-08-03 cs.LG 新提交 84%

PluRel-to-RDB-PFN: Schema-Guided Synthetic Relational Pretraining

PluRel-to-RDB-PFN:模式引导的合成关系预训练

Mohammad Sadeq Abolhasani, Viswanath Ganapathy

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract,comments);分类 cs.LG

AI总结 该研究将合成关系数据库生成器PluRel作为RDB-PFN的外部预训练数据源,通过三种课程策略对比,发现模式优先引导策略仅用少量数据即可恢复RDB-PFN近94%的性能,证实早期接触真实模式的有效性。

Comments Proceedings of the 2nd ICML on Foundation Models for Structured Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16899 2026-06-16 cs.LG 新提交 84%

Fantastic Pretraining Optimizers and Where to Find Them II: Hyperball Optimization

奇妙预训练优化器及其发现之处 II:超球优化

Kaiyue Wen, Xingyu Dang, Kaifeng Lyu, Tengyu Ma, Percy Liang

机构 * Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Tsinghua University(清华大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.LG

AI总结 针对Muon等优化器在大模型预训练中增益随规模增大而减弱的问题,提出Hyperball包装器,固定权重矩阵及其更新的Frobenius范数,在1.2B参数模型上实现20-30%的token等效加速,并改善学习率迁移。

Comments Corresponding blog post: https://psychedelic-sunstone-851.notion.site/Fantastic-Pretraining-Optimizers-and-Where-to-Find-Them-2-1-Hyperball-Optimization-2e924306e6f280e7a5ffee00eb40a0dd

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00208 2026-07-02 cs.CL cs.AI cs.LG 新提交 83%

SLIM-RL: Risk-Budgeted Random-Masking RL for Diffusion LLMs Without Trajectory Slicing

SLIM-RL: 无需轨迹切分的扩散LLM风险预算随机掩码强化学习

Ruikang Zhao, Zhenting Wang, Han Gao, Ligong Han

机构 * Technical University of Denmark(丹麦技术大学) MBZUAI Institute of Foundation Models(穆罕默德·本·扎耶德人工智能大学基础模型研究所) Iowa State University(爱荷华州立大学) Red Hat AI Innovation(红帽人工智能创新实验室) MIT–IBM Watson AI Lab(麻省理工学院-IBM沃森人工智能实验室)

专题命中 预训练与数据 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SLIM-RL方法,通过τ预算解码器控制每步提交风险,结合无迹随机掩码目标和自适应方差缩减技术,在不重构训练轨迹的情况下匹配或超越现有轨迹感知方法,在数学和代码任务上取得显著提升。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27379 2026-06-29 cs.CL cs.AI cs.LG 新提交 83%

Position: The Term "Machine Unlearning" Is Overused in LLMs

立场:术语“机器遗忘”在大型语言模型中被过度使用

Sangyeon Yoon, Yeachan Jun, Albert No

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文主张机器遗忘应限于数据集定义的删除,而许多标为“遗忘”的任务(如拒绝有害请求、实体/知识移除)实为不同目标,需不同术语和基线,并指出术语混淆导致指标误用。

Comments 13 pages; ICML 2026 Position Paper Track. Sangyeon Yoon and Yeachan Jun contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21292 2026-06-23 cs.CV 新提交 83%

Lightweight 3D Feature Pretraining by Bayesian Inversion of 2D Foundation Models

轻量级3D特征预训练:基于2D基础模型的贝叶斯反演

Marwane Hariat, Gianni Franchi, David Filliat, Antoine Manzanera

机构 * U2IS, ENSTA – Institut Polytechnique de Paris, Palaiseau, France(U2IS,ENSTA – 巴黎综合理工学院,法国帕莱索) Pôle Recherche, Agence Ministérielle pour l’IA de Défense, Palaiseau, France(研究部,国防人工智能部级机构,法国帕莱索)

专题命中 预训练与数据 :foundation model(title);pretraining(title)

AI总结 提出Casper3D,一种轻量级概率框架,通过贝叶斯反演将多视图2D基础模型嵌入转换为潜在3D语义表示,实现开放词汇3D理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10595 2026-08-12 q-bio.BM cs.AI 新提交 83%

DegradeQuery: Counterfactual Tuple Pretraining for Context-Aware PROTAC Degradation Prediction

DegradeQuery:面向上下文感知PROTAC降解预测的反事实元组预训练

Dong Xu, Zhangfan Yang, Jiantao Wu, Zexuan Zhu, Jianqiang Li, Junkai Ji

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI

AI总结 DegradeQuery是一种上下文感知PROTAC降解预测框架,通过反事实元组预训练利用标签缺失的PROTAC记录,在PROTAC-8K基准上AUC达0.9065、准确率0.8500,性能优于对比方法。

Comments 19 pages, 2 figures, with supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09558 2026-08-11 cs.LG cs.NA math.NA math.ST stat.TH 新提交 83%

Training-Free Universal Approximation by Prompting Random Transformers

通过提示随机Transformer实现无训练的通用逼近

Alexander Hsu, Rongjie Lai

机构 * Purdue University(普渡大学)

专题命中 预训练与数据 :prompting(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 该研究证明预训练Transformer可选,随机未训练的单层softmax注意力网络经软提示引导可实现通用逼近,其继承核回归的极小极大最优速率,还揭示了提示相关参数的权衡关系。

Comments 31 pages, 5 figures. Comments welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06659 2026-08-10 cs.AI 新提交 83%

CellWorld: From Gene-Level Reconstruction to Latent Cell Prediction in Spatial Transcriptomics Foundation Models

CellWorld:空间转录组学基础模型中从基因水平重建到潜在细胞预测

Haiping Liu, Qian Zhao, Lijing Lin, Jingyuan Sun, Hongpeng Zhou

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出CellWorld,将空间转录组学基础模型的预测目标从基因测量转向潜在细胞表示,在多基准测试中其性能优于现有基线,仅用5%语料库预训练的大型模型也表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05028 2026-08-06 cs.CL 新提交 83%

Language Models Generalize to Human-like Word Order Preferences

语言模型可泛化出类人的词序偏好

Amanda Popadich, Shane Steinert-Threlkeld

机构 * University of Washington(华盛顿大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 本研究发现不同规模的语言模型可从贫乏输入中泛化出类人的范围同态名词短语修饰语顺序偏好,且该偏好无法用点互信息解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04268 2026-08-06 cs.CL 新提交 83%

The Fairness Collapse Phenomenon: Bias Amplification in Language Models Trained on Synthetic Data

公平性崩溃现象:在合成数据上训练的语言模型中的偏差放大

Irina Proskurina, Antoine Gourru, Julien Velcin

机构 * Laboratoire Hubert Curien(于贝尔·屈里安实验室) CNRS(法国国家科学研究中心) Université Claude Bernard Lyon 1(里昂第一大学) Université Lumière Lyon 2(里昂第二大学) École Centrale de Lyon(里昂中央理工学院)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 该研究发现,在合成数据上反复训练语言模型会出现公平性崩溃,即偏差在标准指标未明显下降时悄然放大,揭示了合成数据污染的关键风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03457 2026-08-05 cs.AI 新提交 83%

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models

LLaDA MoE v2:扩展混合专家扩散语言模型

Fengqi Zhu, Shaoxuan Xu, Jingyang Ou, Zebin You, Yipeng Xing, Huabin Liu, Xiaolu Zhang, Jun Zhou, Zhenzhong Lan, Yankai Lin, Wayne Xin Zhao, Jianguo Li, Chongxuan Li, Ji-Rong Wen

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 该研究明确MoE扩散语言模型的扩展规律,训练30B-A3B的LLaDA MoE v2,其预训练令牌量为Qwen3的65%,经微调后在多数推理编码基准上优于SDAR Chat且接近Qwen3。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00114 2026-08-04 eess.SP cs.AI 新提交 83%

EEG-JEPA: Structured Latent Prediction for EEG Foundation Models

EEG-JEPA:用于脑电基础模型的结构化隐变量预测

Jinhao Li, Zhiyuan Ma, Xueqiao Han, Zhongye Xia, Xinche Zhang, Shanghong Xie, Yixuan Liu, Yongjian Li, Runmin Gan, Tianlin Huo, Sen Song

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本研究提出EEG-JEPA结构化隐变量预测框架,通过优化目标设计提升EEG基础模型性能,在EEG-FM-Bench等基准上实现了14任务、9任务的平衡准确率提升,为EEG基础建模提供了新方案。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02252 2026-08-04 cs.CV cs.AI 新提交 83%

HarMoE: Multi-Source Chest Radiograph Pretraining with Dataset-Disentangled Experts

HarMoE:基于数据集解耦专家的多源胸部X射线预训练

Haozhe Luo, Ziyu Zhou, Shelley Zixin Shu, Mauricio Reyes

机构 * University of Bern(伯尔尼大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出HarMoE框架,通过解耦数据集专家从异构胸部X射线数据集学习,提升了放射学视觉-语言模型的零样本分类、分布外迁移等性能,相关代码与87.3万份数据集将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01898 2026-08-04 cs.LG 新提交 83%

Understanding and Correcting Low-Frequency Bias in EEG Foundation Model

脑电(EEG)基础模型中低频偏差的理解与修正

Junjie Yu, Zihan Deng, Jianyu Zhang, Junrong Mu, Jiahui An, Wenxiao Ma, Ziling Lu, Yue Wang, Yan Zhu, Kexin Lou, Quanying Liu

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 针对EEG基础模型存在的低频偏差问题,提出频率平衡掩码自编码框架FAME,在OmniEEG-Bench的41项下游任务中24项达到SOTA,凸显平衡频谱监督的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28135 2026-07-31 cs.LG 新提交 83%

LM-GRASP: Instance-Specific Language Models for Combinatorial Construction via Online Imitation Learning

LM-GRASP:基于在线模仿学习的组合构造的实例特定语言模型

Mohand Mezmaz, Grégoire Danoy

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本研究提出LM-GRASP框架,将GRASP随机构造阶段转为在线模仿学习任务,用仅解码器Transformer作构造策略,在Taillard PFSP基准上平均比GPU-GRASP提升28.4个制造跨度单位,是手工构造器的实用替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22662 2026-07-28 cs.AI 新提交 83%

CuraWeb: Joint Optimization of Quality, Redundancy, and Diversity for Web-Scale Pretraining Data

CuraWeb:网络规模预训练数据的质量、冗余性和多样性联合优化

Peiguang Li, Yongwei Zhou, Juncheng Diao, Yuchun Fan, Jian Yang, Jianxiao Yang, Zhongda Su, Shuguang Jiao, Xiao Wei, Zhiye Zou, Gan Dong, Zhizhao Zeng, Rongxiang Weng, Jingang Wang, Xunliang Cai

机构 * Meituan(美团)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究针对开放网络语料库预训练数据优化的局限性,提出质量、冗余性和多样性联合优化范式,结合双轨清理与混合去重,构建CuraWeb语料库,实验证明其在多基准测试中性能显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21458 2026-07-24 cs.AI stat.ME 新提交 83%

Detecting LLM-Generated Tokens in Human--LLM Coauthored Text

在人类与大语言模型合作撰写的文本中检测大语言模型生成的令牌

Yangjun Lu, Hongyi Zhou, Fabian Spill, Kai Ye, Chengchun Shi, Jin Zhu

机构 * School of Mathematics, University of Birmingham(伯明翰大学数学学院) School of Statistics and Data Science, Shanghai University of Finance and Economics(上海财经大学统计与数据科学学院) Department of Statistics, The London School of Economics and Political Science(伦敦政治经济学院统计系)

专题命中 预训练与数据 :LLM(title,abstract);language model(abstract);分类 cs.AI

AI总结 针对人类与大语言模型合作撰写文本中难以检测大语言模型生成内容的问题,提出在令牌级别运行、基于现有分数并平滑分数降低变异性的新方法,在合成与真实数据集上性能强,还部署了网站。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21402 2026-07-24 cs.AI 新提交 83%

MSBraM: A Multi-scale Self-supervised Brain Foundation Model for Hierarchical EEG Dynamics Learning

MSBraM:用于分层脑电动力学学习的多尺度自监督脑基础模型

Tao Zhou, Jing Han, Lingyu Shu, Zixing Zhang

机构 * Hunan University(湖南大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 针对现有方法难捕捉EEG信号多尺度时间结构的问题,提出MSBraM模型。该模型采用两阶段预训练框架,经多尺度神经分词器和课程多尺度掩码策略学习分层EEG表征。实验显示其在多个下游任务中性能优越,证明显式建模多尺度时间动态对EEG基础模型的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21384 2026-07-24 cs.AI 新提交 83%

Multimodal Pretraining for Generalizable EEG Representation Learning

用于可泛化脑电信号表征学习的多模态预训练

Targol Bakhtiarvand, Jugal Kalita, Adham Atyabi

机构 * University of Colorado Colorado Springs(科罗拉多大学科罗拉多斯普林斯分校)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 研究针对癫痫EEG模型应用局限问题,开发多模态EEG基础模型,结合多种编码器,通过创新预训练技术创建癫痫相关表征。在多个数据集和评估设置下实验,该模型实现强大癫痫检测与适应新场景能力,支持可解释癫痫定位,性能达当前最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17782 2026-07-21 cs.CV cs.AI 新提交 83%

BrainNext: A General-Purpose Self-Supervised Foundation Model for Brain MRI Analysis

BrainNext:用于脑MRI分析的通用自监督基础模型

Moona Mazher, Abdul Qayyum, Steven A. Niederer, Daniel C. Alexander

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 研究提出BrainNext通用自监督基础模型用于脑MRI分析,结合MAE预训练与三维双向xLSTM-UNet架构,从大量未标记数据学习,经微调用于下游任务,在FOMO 2025评估中表现出色,证明其可转移性和作为基础模型的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12831 2026-07-15 cs.CL 新提交 83%

Knowledgeless Language Models: Suppressing Parametric Recall for Evidence-Grounded Language Modeling

无知识语言模型:抑制参数化记忆以进行基于证据的语言建模

Roi Cohen, Yvan Carré, Nick Lechtenbörger, Hendrik Droste, Lucas Kerschke, Russa Biswas, Gerard de Melo, Jan Buys

机构 * HPI / University of Potsdam(波茨坦大学哈索·普拉特纳数字工程学院) African Institute for Mathematical Sciences(非洲数学科学研究所) Department of Computer Science Aalborg University(奥尔堡大学计算机科学系) Department of Computer Science University of Cape Town(开普敦大学计算机科学系) Polytechnique Montréal(蒙特利尔理工大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 研究修改预训练信号能否使语言模型从参数化记忆转向基于证据的推理,引入无知识语言模型(KLLMs),其在命名实体匿名化语料库上预训练,实验表明能降低闭卷事实记忆,在多任务基准上表现优,提升鲁棒性与校准,为语言模型训练提供新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10798 2026-07-13 cs.LG 新提交 83%

CITRAS-FM: Tiny Time Series Foundation Model for Covariate-Informed Zero-Shot Forecasting

CITRAS-FM: 面向协变量信息零样本预测的微型时间序列基础模型

Yosuke Yamaguchi, Issei Suemitsu, Yuki Kajihara, Wenpeng Wei

机构 * University of Tokyo(东京大学) Keio University(庆应大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 提出CITRAS-FM,一个仅7M参数的时间序列基础模型,通过引入Shifted Attention和协变量合成方法CovSynth,实现高效零样本预测,在100个任务上达到子10M模型最优精度且CPU推理时间低于0.1秒。

Comments Accepted to EUSIPCO 2026. Code available at https://github.com/hitachi-ais/citras-fm

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06145 2026-07-08 cs.CL 新提交 83%

Prompting Complexity: Shortest Prompts for Texts and Behaviors in LLMs

提示复杂性:大语言模型中用于文本和行为的最短提示

Adrian Cosma

机构 * Dalle Molle Institute for Artificial Intelligence (IDSIA)(达勒·莫利人工智能研究所)

专题命中 预训练与数据 :prompting(title,abstract);language model(abstract);分类 cs.CL

AI总结 研究提示复杂性,定义其为固定语言模型产生目标文本的最短合理提示量,类似资源受限柯尔莫哥洛夫复杂性。介绍计算方法、扩展定义到软提示复杂性,定义提示距离等,据此制定研究议程以探究短提示可实现的文本和行为。

详情

展开后加载摘要…

URL PDF HTML 收藏