arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 5444 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 358 篇

2606.08164 2026-07-28 cs.CV 版本更新 82%

How Much MRI Preprocessing Is Enough? A Cost-Utility Study for Brain MRI Foundation Models

MRI预处理需要多少才够?脑MRI基础模型的成本效用研究

Jiangshuan Pang, Wangyang Tang, Jing Yan, Zhixuan Cheng, Youzhe He, Yiting Deng, Zhenkun Zhuang, Shiping Liu

机构 * University of the Chinese Academy of Sciences(中国科学院大学) BGI Research(华大研究院)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本研究通过比较P0-P7预处理级别对自监督3D MRI预训练的影响,发现并非预处理越强越好,P2是最低成本可行级别,更强预处理仅在特定任务中带来有限提升,且下游可补偿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18821 2026-07-24 cs.PL 版本更新 82%

VirtualSet: Typed Ontology Worlds as an LLM Generation Target for Grounded Queries and Guarded Decisions

虚拟集:作为大语言模型生成目标的类型化本体世界,用于有根据的查询和有保障的决策

Qunhui Zhang

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract)

AI总结 针对大语言模型操作企业数据时SQL错误信号延迟的问题,提出VirtualSet,通过集合表达式、通用约束投影等技术实现有根据的查询和有保障的决策,在实验中展现出优势,在SQL基准测试中保持竞争力。

Comments 21 pages, 13 figures, 1 table; added a reference to the companion GCP paper (arXiv:2607.19693) and aligned GCP terminology; results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08639 2026-07-17 cs.RO cs.CV 版本更新 82%

Native Video-Action Pretraining for Generalizable Robot Control

用于可泛化机器人控制的原生视频动作预训练

Qihang Zhang, Lin Li, Luyao Zhang, Shuai Yang, Yiming Luo, Shuaiting Li, Ruilin Wang, Junke Wang, Jiahao Shao, Gangwei Xu, Jiaming Zhou, Yishu Shen, Yudong Jin, Fangyi Xu, Shuailei Ma, Jiaqi Liao, Guanxing Lu, Zifan Shi, Yongkun Wen, Yujie Zhao, Weixuan Tang, Xinyang Wang, Chaojian Li, Jiapeng Zhu, Ka Leong Cheng, Nan Xue, Xing Zhu, Yujun Shen, Yinghao Xu

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract)

AI总结 研究针对机器人控制中视频动作模型应用于物理环境的不足,提出LingBot-VA 2.0,通过语义视觉动作分词器等四个核心设计原则构建基础模型,经真实世界部署验证其在复杂操作任务中的少样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08949 2026-07-16 cs.CR cs.SE 版本更新 82%

SeedSmith: LLM-Driven Seed Synthesis for Directed Fuzzing

SeedSmith:用于定向模糊测试的基于大语言模型的种子合成

Junmin Zhu, Siyu Liu, Jie Hu, Fabio Gritti, Ati Priya Bajaj, Hulin Wang, Wenbo Guo, Tiffany Bao, Christopher Kruegel, Giovanni Vigna

专题命中 预训练与数据 :LLM(title,abstract);prompting(abstract)

AI总结 研究针对定向模糊测试常无法触发崩溃的问题,提出SeedSmith这一基于大语言模型的管道,通过复制分析师工作流程合成种子,提升模糊器性能,在Magma和ARVO上取得显著加速和发现新漏洞的成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19802 2026-07-16 cs.CV 版本更新 82%

Evaluating Vision Foundation Models for Pixel and Object Classification in Microscopy

评估显微镜中用于像素和物体分类的视觉基础模型

Carolin Teuber, Anwai Archit, Tobias Boothe, Peter Ditte, Jochen Rink, Constantin Pape

机构 * Georg-August-University Göttingen, Institute of Computer Science Department of Tissue Dynamics Regeneration, Max Planck Institute for Multidisciplinary Sciences, Göttingen Georg-August-University Göttingen, Faculty of Biology Psychology CAIMed - Lower Saxony Center for AI \& Causal Methods in Medicine, Göttingen Cluster of Excellence Multiscale Bioimaging (MBExC), Georg-August-University Göttingen

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文评估了视觉基础模型在显微镜像素和物体分类中的应用,探讨了其在提升分类性能方面的潜力,并建立了相关基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17390 2026-07-09 cs.CV 版本更新 82%

FMMC: Harnessing the Power of Foundation Models for Accurate Material Classification

利用基础模型提升材料分类的准确性

Qingran Lin, Fengwei Yang, Chaolun Zhu

机构 * Georgia Institute of Technology(佐治亚理工学院) Duke University(杜克大学) Waseda University(早稻田大学)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract)

AI总结 本文提出一种利用基础模型克服数据限制并提升分类准确性的新框架,通过生成高质量数据集和融合视觉语言模型先验知识,有效提高材料分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10547 2026-07-08 cs.SD 版本更新 82%

HeartMuLa: A Family of Open Sourced Music Foundation Models

HeartMuLa:一个开源音乐基础模型家族

Dongchao Yang, Yuxin Xie, Yuguo Yin, Zheyu Wang, Xiaoyu Yi, Gongxi Zhu, Xiaolong Weng, Zihan Xiong, Yingzhe Ma, Dading Cong, Jingliang Liu, Zihang Huang, Jinghan Ru, Rongjie Huang, Haoran Wan, Peixu Wang, Kuoxi Yu, Helin Wang, Liming Liang, Xianwei Zhuang, Yuanyuan Wang, Dingdong Wang, Haohan Guo, Junjie Cao, Zeqian Ju, Songxiang Liu, Yuewen Cao, Heming Weng, Yuexian Zou

机构 * HeartMuLa Teams(HeartMuLa团队)

专题命中 预训练与数据 :foundation model(title,abstract);LLM(abstract)

AI总结 介绍开源音乐基础模型家族HeartMuLa,含四个组件及两种特殊模式,能跨任务和模态推动音乐理解与生成,扩展到7B参数时有显著改进,可重现商业级系统,为未来研究提供基线并促进多模态应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27465 2026-06-18 q-bio.GN 版本更新 82%

Poisoning the Genome: Targeted Backdoor Attacks on DNA Foundation Models

基因组投毒:针对DNA基础模型的目标后门攻击

Charalampos Koilakos, Ioannis Mouratidis, Ilias Georgakopoulos-Soares

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract)

AI总结 本研究首次系统研究基因组语言模型的训练数据投毒,通过在预训练和微调阶段注入少于1%的对抗序列,可选择性破坏目标基因组上下文的生成性能,并实现条件后门攻击和下游任务分类破坏。

Comments 23 pages, double column format

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12678 2026-06-16 cs.CV cs.CY 版本更新 82%

No One Knows the State of the Art in Geospatial Foundation Models

没有人知道地理空间基础模型的现状

Isaac Corley, Nils Lehmann, Caleb Robinson, Gabriel Tseng, Anthony Fuller, Hamed Alemohammad, Evan Shelhamer, Jennifer Marcus, Hannah Kerner

机构 * Taylor Geospatial(泰勒地理空间公司) Technical University of Munich(慕尼黑技术大学) Microsoft AI for Good Research Lab(微软AI for Good研究实验室) Allen Institute for AI(艾伦人工智能研究所) Vector Institute(向量研究所) Carleton University(卡尔顿大学) Clark University(克拉克大学) University of British Columbia(不列颠哥伦比亚大学) Arizona State University(亚利桑那州立大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文指出地理空间基础模型缺乏标准化评估和训练协议,提出六项具体期望以促进社区共识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04061 2026-06-16 cs.RO cs.CV 版本更新 82%

CLAP: Contrastive Latent Action Pretraining for Learning Vision-Language-Action Models from Human Videos

CLAP: 从人类视频中学习视觉-语言-动作模型的对比潜在动作预训练

Chubin Zhang, Jianan Wang, Zifeng Gao, Yue Su, Tianru Dai, Cai Zhou, Jiwen Lu, Yansong Tang

机构 * Tsinghua University(清华大学) Astribot University of Hong Kong(香港大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :pretraining(title,abstract);post-training(abstract)

AI总结 提出CLAP框架,通过对比学习将人类视频与机器人动作词汇对齐,利用伪标签训练VLA模型,实现从人类视频到机器人执行的有效技能迁移。

Comments The code is available at: https://github.com/LinShan-Bin/OpenCLAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01747 2026-06-11 eess.SP 版本更新 82%

AnyPPG: An ECG-Guided PPG Foundation Model Trained on Over 100,000 Hours of Recordings for Holistic Health Profiling

AnyPPG:基于心电引导的PPG基础模型,在超过10万小时记录上训练,用于全面健康分析

Guangkun Nie, Xiaocheng Fang, Gongzheng Tang, Yujie Xiao, Jun Li, Bo Liu, Hongyan Li, Shenda Hong

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 提出AnyPPG,一种基于心电引导预训练的光电容积描记(PPG)基础模型,在超10万小时数据上训练,首次开展覆盖1468种疾病表型的全表型关联研究,证明PPG可超越传统心血管应用,对307种表型(含230种非循环系统疾病)实现有效判别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26661 2026-08-14 cs.AI 版本更新 81%

AgenticCANN: Automated Ascend C Operator Generation via Knowledge-Augmented Agentic Evolution

AgenticCANN:基于知识增强的智能体演化的自动昇腾C算子生成

Junhao Qiu, Zidong Wang, Yansong Sun, Zhitong Ma, Ping Guo, Qingfu Zhang

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对昇腾C算子生成的独特挑战,提出AgenticCANN知识增强智能体演化框架,在昇腾910B实验中实现高可行性与加速效果,验证了知识注入的通用性优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21597 2026-08-11 cs.SE cs.CL cs.IR 版本更新 81%

ATLAS: Agentic Taxonomy of Large-Scale Software Ecosystems

ATLAS: 大规模软件生态系统的智能体分类体系

Junyi Lu, Mengyao Lyu, Jiahui Wu, Lei Yu, Chengwei Liu, Fengjun Zhang, Li Yang, Chun Zuo, Yang Liu

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Nankai University(南开大学) Sinosoft Company Limited(中软国际有限公司)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出ATLAS框架,结合LLM全局知识与实际仓库分布,通过智能体协作和自修正循环自动构建软件仓库的层次化分类体系,在54,387个GitHub仓库上评估,分类质量F1达83.13%,优于基线15个百分点。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04884 2026-08-07 cs.CL 版本更新 81%

Building Open-Retrieval Conversational Question Answering Systems by Generating Synthetic Data and Decontextualizing User Questions

通过生成合成数据和去语境化用户问题构建开放检索式对话问答系统

Christos Vlachos, Nikolaos Stylianou, Alexandra Fiotaki, Spiros Methenitis, Elisavet Palogiannidi, Themos Stafylakis, Ion Androutsopoulos

机构 * Department of Informatics, Athens University of Economics and Business(雅典经济与商业大学信息学院) Omilia - Conversational Intelligence(Omilia-对话智能) Archimedes, Athena Research Center(雅典研究中心Archimedes) NCSR Demokritos(德摩斯蒂斯国家研究中心)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 针对开放检索式对话问答数据集获取困难的问题,提出基于组织纯文本文档生成合成带标注对话的流程,训练问题重写器去语境化用户问题,结合LLM构建OR-CONVQA系统。

Comments Accepted at SIGDIAL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06835 2026-08-06 cs.CL 版本更新 81%

Translate-R1: Cost-Aware Translation Tool Use via Reinforcement Learning

Translate-R1:通过强化学习实现成本感知的翻译工具使用

Pratik Jayarao, Chaitanya Dwivedi, Himanshu Gupta, Neeraj Varshney, Adithya M Devraj, Meet Vadera, Priyanka Nigam, Bing Yin

机构 * Amazon Stores Foundation AI(亚马逊商店基金会人工智能)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);pretraining(abstract);分类 cs.CL

AI总结 提出一种基于强化学习的门控策略,让LLM自主评估理解能力,仅在必要时调用翻译工具,在22种语言上提升奖励并降低翻译成本。

Comments 14 pages main text plus appendix, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24941 2026-07-28 cs.SD cs.AI 版本更新 81%

EmotionAI: A Privacy-Preserving Computational Intelligence Pipeline for Speech-Emotion-Grounded Conversational Analysis

EmotionAI:一种面向语音情感驱动的对话分析的隐私保护计算智能流水线

Wai Laam Mak, Isibor Kennedy Ihianle, Pedro Machado

机构 * School of Science and Technology, Nottingham Trent University(诺丁汉特伦特大学科学与技术学院)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种完全本地的计算智能流水线,结合语音情感识别与生成式推理,实现隐私保护的对话情感分析,在RAVDESS数据集上达到48.8%准确率,零外部调用。

Comments 12 pages, 4 figures. Submitted to UK Workshop on Computational Intelligence (UKCI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00462 2026-07-23 cs.CV cs.AI 版本更新 81%

LatentLens: Revealing Highly Interpretable Visual Tokens in LLMs

LatentLens: 揭示大语言模型中高度可解释的视觉标记

Benno Krojer, Shravan Nayak, Oscar Mañas, Vaibhav Adlakha, Desmond Elliott, Siva Reddy, Marius Mosbach

机构 * University of Cambridge(剑桥大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出 LatentLens 方法,通过将视觉标记与文本语料库中的上下文标记表示进行最近邻匹配,实现视觉标记的可解释性,发现大多数视觉标记在各层均具有可解释性。

Comments ICML 2026 (Camera Ready)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05235 2026-07-14 cs.CL 版本更新 81%

FedMosaic: Federated Retrieval-Augmented Generation via Parametric Adapters

FedMosaic:通过参数适配器进行联邦检索增强生成

Zhilin Liang, Yuxiang Wang, Zimu Zhou, Hainan Zhang, Boyi Liu, Yongxin Tong

机构 * SKLCCSE Lab Beihang University Beijing China(SKLCCSE实验室 北航) Department of Data Science City University of Hong Kong Hong Kong China(数据科学系 香港城市大学) Beijing Advanced Innovation Center Beihang University Beijing China(北京先进创新中心 北航) Beihang University(北航) City University of Hong Kong(香港城市大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对隐私敏感领域,解决联邦检索增强生成中高存储通信及适配器聚合问题。核心方法是提出FedMosaic框架,聚类文档成多文档适配器并选择性聚合。主要贡献是准确率提高,存储和通信成本降低,且不共享原始文档。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00074 2026-06-16 q-bio.GN cs.AI 版本更新 81%

CRC-Screen: Certified DNA-Synthesis Hazard Screening Under Taxonomic Shift

CRC-Screen:分类偏移下认证的DNA合成危害筛查

Najmul Hasan

机构 * Najmul Hasan(纳杰姆·哈桑)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对DNA合成订单中危害序列因分类偏移导致基线筛查100%误报的问题,提出基于k-mer Jaccard相似度、五LLM评委修剪均值和嵌入聚类质心余弦相似度的融合信号,经单调逻辑聚合器和共形风险控制校准,在保证假阴性率受控的同时实现零漏检和低误报。

Comments Accepted at the 6th Muslims in ML (MusIML) Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22777 2026-06-16 cs.CL 版本更新 81%

RASST: Retrieval-Augmented Simultaneous Speech Translation

RASST:检索增强的同声传译

Jiaxuan Luo, Siqi Ouyang, Jiaxing Xu, Lei Li

机构 * Johns Hopkins University(约翰霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对同声传译中罕见术语翻译不准的问题,提出检索增强方法RASST,通过轻量级语音-文本检索器提供分块术语提示,并合成训练数据教会模型何时应用检索术语,在ACL 60/60和ESO测试集上术语准确率提升近40%,BLEU提升最多3点。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02424 2026-06-09 cond-mat.mtrl-sci cs.AI 版本更新 81%

A large-scale nanocrystal database with aligned synthesis and properties enabling generative inverse design

大规模纳米晶体数据库:对齐合成与性质实现生成式逆向设计

Kai Gu, Yingping Liang, Senliang Peng, Aotian Guo, Haizheng Zhong, Ying Fu

机构 * MIIT Key Laboratory for Low-Dimensional Quantum Structure and Devices, School of Materials Sciences & Engineering, Beijing Institute of Technology(信息产业部低维量子结构与器件重点实验室,材料科学与工程学院,北京理工大学) School of Computer Science and Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 构建大规模对齐的纳米晶体合成-性质数据库,开发基于大语言模型的NanoExtractor提取文献数据,并利用NanoDesigner实现生成式逆向设计,成功设计PbSe和MgF2纳米晶体的合成路线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28551 2026-08-11 cs.CV cs.CL cs.LG 版本更新 81%

DataComp-VLM: Improved Open Datasets for Vision-Language Models

DataComp-VLM:改进的视觉语言模型开放数据集

Matteo Farina, Vishaal Udandarao, Thao Nguyen, Selim Kuzucu, Maximilian Böther, Andreas Hochlehnert, Adhiraj Ghosh, Marianna Nezhurina, Karsten Roth, Joschka Struber, Yuhui Zhang, Sebastian Dziadzio, Elaine Sui, Soumya Jahagirdar, Dhruba Ghosh, Hasan Hammoud, Thomas De Min, Simone Caldarella, Jehanzeb Mirza, Sedrick Keh, Mehdi Cherti, Hilde Kuehne, Bernt Schiele, Serena Yeung-Levy, Muhammad Ferjad Naeem, Federico Tombari, Ana Klimovic, Elisa Ricci, Matthias Bethge, Sewoong Oh, Ameya Prabhu, Alessio Tonioni, Jenia Jitsev, Massimiliano Mancini, Ludwig Schmidt, Nikhil Parthasarathy

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 提出DataComp-VLM基准,通过数据混合(而非过滤)策略提升视觉语言模型训练效果,在8B模型上达到63.6%准确率,比现有最优数据集提升5.4个百分点。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15011 2026-07-31 cs.LG cs.AI cs.CY cs.MA 版本更新 81%

Epistemic diversity across language models mitigates knowledge collapse

语言模型中的知识崩溃与认知多样性

Damian Hodel, Jevin D. West

专题命中 预训练与数据 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究通过增加语言模型多样性缓解知识崩溃,发现单一模型短期表现好但长期崩溃加剧,多样性水平随训练迭代增加而提升,实验显示生态多样性对缓解崩溃至关重要。

Comments 30 pages, 21 figures. v3 changelog: updated introduction. v2 changelog: added experimental variations, updated theory, writing revisions, updated metadata

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11020 2026-07-15 cs.CL cs.LG 版本更新 81%

Can a Language Model Learn Facts Continually in Its Weights?

语言模型能否在其权重中持续学习事实?

Charles O'Neill

机构 * Baseten(巴斯滕)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究语言模型能否在权重中持续学习事实,通过追踪写入Qwen3模型的虚构事实及实验发现,训练数据广度决定知识类型,事实可行为遗忘但不擦除,广泛数据能创建可用知识,可靠通道是上下文而非权重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10840 2026-07-07 cs.LG cs.AI q-bio.QM 版本更新 81%

Clin-JEPA: A Multi-Phase Co-Training Framework for Joint-Embedding Predictive Pretraining on EHR Patient Trajectories

Clin-JEPA:一种多阶段协同训练框架,用于EHR患者轨迹的联合嵌入预测预训练

Yixuan Yang, Mehak Arora, Ryan Zhang, Baraa Abed, Junseob Kim, Tilendra Choudhary, Md Hassanuzzaman, Kevin Zhu, Ayman Ali, Chengkun Yang, Alasdair Edward Gent, Victor Moas, Rishikesan Kamaleswaran

机构 * Duke University(杜克大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Clin-JEPA框架,通过多阶段预训练稳定协同训练编码器和预测器,解决EHR数据中联合嵌入预测的挑战,实现多任务下游任务的高性能表现。

Comments 18 pages, 4 figures, 8 tables. Code: https://github.com/Kamaleswaran-Lab/Clin-JEPA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20757 2026-07-07 cs.CL cs.LG 版本更新 81%

TokSuite: Measuring the Impact of Tokenizer Choice on Language Model Behavior

TokSuite:衡量分词器选择对语言模型行为的影响

Gül Sena Altıntaş, Malikeh Ehghaghi, Brian Lester, Fengyuan Liu, Wanru Zhao, Marco Ciccone, Colin Raffel

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Google DeepMind(谷歌DeepMind) McGill University(麦吉尔大学) University of Cambridge(剑桥大学) Hugging Face

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 提出TokSuite,含模型集合与基准测试,通过不同分词器的预训练模型及多语言鲁棒性基准测试,解耦分词器影响,阐明多种流行分词器优缺点。

Comments ICML 2026. 46 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15637 2026-07-01 cs.LG cs.AI stat.ML 版本更新 81%

Mantis: Lightweight Foundation Model for Time Series Classification

Mantis: 用于时间序列分类的轻量级基础模型

Vasilii Feofanov, Songkang Wen, Shifeng Xie, Simon Roschmann, Marius Alonso, Hongbo Guo, Romain Ilbert, Malik Tiomoko, Quentin Bouniot, Zeynep Akata, Lujia Pan, Jianfeng Zhang, Ievgen Redko

机构 * com(42.com) Helmholtz Munich(亥姆霍兹慕尼黑中心) Technical University of Munich(慕尼黑工业大学) Criteo Meta Telecom Paris(巴黎电信学院)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出基于Transformer的轻量级基础模型Mantis,通过自监督对比学习在合成数据上预训练,并引入新颖的令牌生成单元和增强测试方法,在多个数据集上超越现有基础模型。

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07628 2026-06-19 cs.AI cs.LG 版本更新 81%

SleepMaMi: A Universal Sleep Foundation Model for Integrating Macro- and Micro-structures

SleepMaMi:一种融合宏观与微观结构的通用睡眠基础模型

Keondo Park, Younghoon Na, Yourim Choi, Hyunwoo Ryu, Hyun-Woo Shin, Hyung-Sin Kim

机构 * Graduate School of Data Science, Seoul National University, Seoul, South Korea(首尔国立大学数据科学研究生院,韩国首尔) Department of Biomedical Sciences, Seoul National University College of Medicine, Seoul, Republic of Korea(首尔国立大学医学院生物医学科学系,韩国首尔) Obstructive Upper Airway Research (OUaR) Laboratory, Department of Pharmacology, Seoul National University College of Medicine, Seoul, Republic of Korea(首尔国立大学医学院药理学系阻塞性上气道研究(OUaR)实验室,韩国首尔) Department of Otorhinolaryngology-Head and Neck Surgery, Seoul National University Hospital, Seoul, Republic of Korea(首尔国立大学医院耳鼻喉头颈外科系,韩国首尔)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出SleepMaMi睡眠基础模型,通过分层双编码器设计(宏观编码器建模整夜时间依赖,微观编码器捕捉生物信号短时特征),结合人口统计引导对比学习和混合掩码自编码器训练,在超过2万条PSG记录上预训练,在下游任务中优于或匹配现有基础模型。

Comments 8 pages, Appendix 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04287 2026-06-10 cs.LG cs.CL q-bio.GN 版本更新 81%

Entropy, Disagreement, and the Limits of Foundation Models in Genomics

熵、分歧与基因组基础模型的局限性

Maxime Rochkoulets, Lovro Vrček, Mile Šikić

机构 * Genome Institute of Singapore, A*STAR(新加坡基因组研究院,A*STAR) KU Leuven(卢森堡大学) Faculty of Electrical Engineering and Computing, University of Zagreb(扎格雷布大学电子工程与计算学院)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文通过分析熵对模型学习的影响,发现基因组序列的高熵导致输出分布接近均匀、模型间分歧大和静态嵌入不稳定,且Fisher信息集中在嵌入层,表明仅靠序列自监督训练可能不适用于基因组数据。

Comments Accepted to LMLR Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17907 2026-06-10 cs.CL cs.AI 版本更新 81%

Improving Topic Modeling by Distilling Soft Labels from Language Models

DSL-Topic:通过从语言模型中蒸馏软标签改进主题建模

Raymond Li, Amirhossein Abaskohi, Chuyuan Li, Gabriel Murray, Giuseppe Carenini

机构 * University of Washington(华盛顿大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出DSL框架,通过从语言模型蒸馏软标签来增强主题模型训练,利用上下文感知的软标签重构信号,显著提升主题连贯性和分配准确性。

Comments 22 pages, 5 figures. Camera-ready version for ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏