arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-12 至 2026-05-12 共收录 878 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 58 篇

2605.08765 2026-05-12 cs.LG cs.AI 92%

Unlearners Can Lie: Evaluating and Improving Honesty in LLM Unlearning

无法学习者可以撒谎:评估和改进LLM去学习中的诚实性

Renjie Gu, Jiazhen Du, Yihua Zhang, Sijia Liu

机构 * Fudan University(复旦大学) Central South University(中南大学) Michigan State University(密歇根州立大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文评估并改进LLM去学习中的诚实性,提出正式定义并引入评估指标,实验显示现有方法无法满足标准,提出ReVa方法提升去学习效果和诚实性。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13618 2026-05-12 cs.CL cs.LG 91%

Temporal Tokenization Strategies for Event Sequence Modeling with Large Language Models

基于大语言模型的时间序列事件建模中的时间标记策略

Zefang Liu, Nam H. Nguyen, Yinzhu Quan, Shi-Xiong Zhang

机构 * Capital One Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文研究了大语言模型中时间序列事件建模的时间标记策略,通过对比不同编码方法发现,标记器需与数据统计特性匹配才能提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08220 2026-05-12 cs.AI cs.CE cs.CL cs.CV cs.SE 91%

Spatial Priming Outperforms Semantic Prompting: A Grid-Based Approach to Improving LLM Accuracy on Chart Data Extraction

空间提示优于语义提示:一种基于网格的方法以提高LLM在图表数据提取上的准确性

Andrei Lazarev, Dmitrii Sedov, Alexander Galkin

机构 * Russian Federation(俄罗斯联邦)

专题命中 预训练与数据 :LLM(title,title_cn);prompting(title);large language model(abstract);language model(abstract)

AI总结 本文通过对比空间提示与语义提示,发现基于网格的提示方法能显著降低图表数据提取误差,优于传统语义引导策略。

Comments his is the version of the article accepted for publication in SUMMA 2025 after peer review. The final, published version is available at IEEE Xplore: https://doi.org/10.1109/SUMMA68668.2025.11302248

Journal ref 2025 7th International Conference on Control Systems, Mathematical Modeling, Automation and Energy Efficiency (SUMMA), Lipetsk, Russian Federation, 2025, pp. 799-804

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08382 2026-05-12 cs.CR cs.CL cs.CY 90%

SecureForge: Finding and Preventing Vulnerabilities in LLM-Generated Code via Prompt Optimization

SecureForge:通过提示优化发现并防止LLM生成代码中的漏洞

Houjun Liu, Lisa Einstein, John Yang, Joachim Baumann, Duncan Eddy, Christopher D. Manning, Mykel Kochenderfer, Diyi Yang

机构 * Stanford University(斯坦福大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出SecureForge框架,通过自动化流程发现并减少LLM生成代码中的安全漏洞,提升代码安全性的同时保持单元测试性能,实验显示漏洞减少达48%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21698 2026-05-12 cs.LG cs.AI 90%

Curriculum Learning for LLM Pretraining: An Analysis of Learning Dynamics

针对LLM预训练的课程学习:学习动态分析

Mohamed Elgaar, Hadi Amiri

机构 * University of Massachusetts Lowell(马萨诸塞大学洛文分校)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过对比不同课程策略,分析预训练动态,发现课程顺序影响各阶段训练时间及稳定性,尤其在小模型中更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26089 2026-05-12 cs.LG cs.AI cs.CL 89%

Selective Deficits in LLM Mental Self-Modeling in a Behavior-Based Test of Theory of Mind

对LLM心理自我建模能力的有选择性缺陷的测试:基于行为的理论自我认知测试

Christopher Ackerman

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过行为测试探讨LLM在理论自我认知任务中的能力,发现较早的LLM无法完成任务,而较新的LLM在他人认知建模上表现接近人类,但自我建模仍存在缺陷,除非使用推理轨迹辅助。

Comments 22 pages, 13 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26961 2026-05-12 cs.SE cs.AI cs.PL 89%

Static Program Slicing Using Language Models With Dataflow-Aware Pretraining and Constrained Decoding

基于语言模型的数据流感知静态程序切片

Pengfei He, Shaowei Wang, Tse-Hsun Chen, Muhammad Asaduzzaman

机构 * Department of Computer Science, University of Manitoba(曼尼托巴大学计算机科学系) School of Engineering and Computer Science, Concordia University(Concordia大学工程与计算机科学学院) School of Computer Science, University of Windsor(温莎大学计算机科学学院)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);small language model(abstract);分类 cs.AI

AI总结 本文提出Sliceformer,通过数据流感知预训练和约束解码改进静态程序切片,提升依赖建模精度和减少生成幻觉,实验显示在Java和Python基准上精确匹配提升22%。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08415 2026-05-12 cs.AI 89%

Political Plasticity: An Analysis of Ideological Adaptability in Large Language Models

政治可塑性:对大型语言模型中意识形态适应性的一种分析

Bruno Bianchi, Diego Tiscornia, Matias Travizano, Ariel Futoransky

机构 * Lab. de Inteligencia Artificial Aplicada, Instituto de Ciencias de la Computación(应用人工智能实验室,计算机科学研究所) Dpto. de Computación, Facultad de Cs. Exactas y Naturales, UBA-Argentina(计算系,精确自然科学学院,UBA-阿根廷)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 本文研究了大型语言模型在政治语境下的意识形态适应性,通过实验框架发现用户提示能显著影响模型响应,尤其在经济自由轴上表现更明显,而较新模型展现出稳定的适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08875 2026-05-12 cs.LG cs.AI 89%

When Tables Leak: Attacking String Memorization in LLM-Based Tabular Data Generation

表格泄露:攻击基于大语言模型的表格数据生成中的字符串记忆化

Joshua Ward, Bochao Gu, Chi-Hua Wang, Guang Cheng

机构 * University of California Los Angeles(加州大学洛杉矶分校)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了基于大语言模型的表格数据生成中字符串记忆化带来的隐私风险,提出LevAtt攻击方法并设计防御策略,验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08809 2026-05-12 cs.CL cs.AI 88%

SimReg: Achieving Higher Performance in the Pretraining via Embedding Similarity Regularization

SimReg:通过嵌入相似性正则化提升预训练性能

Yan Sun, Guoxia Wang, Jinle Zeng, JiaBin Yang, Shuai Li, Li Shen, Dacheng Tao, DianHai Yu, Haifeng Wang

机构 * Baidu Inc.(百度公司) Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出SimReg,通过增强相同标签嵌入的相似性与不同标签嵌入的对比,提升预训练效率和下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10504 2026-05-12 cs.CL 86%

Learning Less Is More: Premature Upper-Layer Attention Specialization Hurts Language Model Pretraining

少即是多:提前的上层注意力专业化损害语言模型预训练

Jinchang Zhu, Jindong Li, Yuwen Hao, Chengyu Zou, Rong Fu, Menglin Yang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 预训练与数据 :pretraining(title,abstract);language model(title);分类 cs.CL

AI总结 本文发现GPT预训练中上层注意力过早专业化导致性能下降,通过减缓上层Q/K投影可提升效果,揭示解码器架构与优化的交互点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24244 2026-05-12 cs.AI 86%

Model Merging Scaling Laws in Large Language Models

大语言模型中的模型合并缩放规律

Yuanyi Wang, Yanggan Gu, Yiming Zhang, Qi Zhou, Zhaoyi Yan, Congkai Xie, Xinyao Wang, Jianbo Yuan, Hongxia Yang

机构 * The Hong Kong Polytechnic University (PolyU)(香港理工大学) Amazon(亚马逊) Innovation Research Institute(创新研究院)

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.AI

AI总结 研究语言模型合并的缩放规律,发现模型大小与专家数量间存在幂律关系,揭示合并收益随专家数量增加而递减的规律,为模型合并提供可预测的规划方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06663 2026-05-12 cs.CL 85%

EMO: Pretraining Mixture of Experts for Emergent Modularity

EMO:用于涌现模块化的专家混合预训练

Ryan Wang, Akshita Bhagia, Sewon Min

机构 * University of California, Berkeley(加州大学伯克利分校) Allen Institute for AI(人工智能研究院)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出EMO,通过在预训练中利用文档边界实现专家模块化,使模型在内存受限下仍能保持高性能,同时实现专家的语义层面专业化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21954 2026-05-12 cs.CL 84%

Model-Aware Tokenizer Transfer

模型感知的分词迁移

Mykola Haltiuk, Aleksander Smywinski-Pohl

机构 * Faculty of Computer Science AGH University of Krakow(克拉科夫AGH大学计算机科学学院)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出MATT方法,通过整合模型内部信息提升分词迁移效果,实验表明其在多语言LLM中能有效恢复模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10760 2026-05-12 cs.CL cs.LG stat.ML 84%

Why is prompting hard? Understanding prompts on binary sequence predictors

为何提示难以掌握?理解二进制序列预测器上的提示

Li Kevin Wenliang, Anian Ruoss, Jordi Grau-Moya, Marcus Hutter, Tim Genewein

机构 * Google DeepMind(谷歌DeepMind)

专题命中 预训练与数据 :prompting(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了二进制序列预测器上提示的挑战,通过实验揭示了预训练分布对最优提示识别的影响,并分析了前沿模型中提示的统计和经验模式。

Journal ref Artificial Intelligence and Statistics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18091 2026-05-12 cs.LG cs.AI cs.CL 83%

Data Mixing Can Induce Phase Transitions in Knowledge Acquisition

数据混合可在知识获取中引发相变

Xinran Gu, Kaifeng Lyu, Jiazheng Li, Jingzhao Zhang

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) College of AI, Tsinghua University(清华大学人工智能学院) Shanghai Qizhi Institute(上海启智研究院) Simons Institute for the Theory of Computing, UC Berkeley(伯克利理论计算研究所)

专题命中 预训练与数据 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了在数据混合训练中LLM的知识获取行为,发现混合比例和模型规模会影响知识获取的相变现象,揭示了容量分配机制与信息理论框架下的预测关系。

Comments NeurIPS'25 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10184 2026-05-12 cs.CV cs.AI 83%

Developing a foundation model for high-resolution remote sensing data of the Netherlands

为荷兰高分辨率遥感数据开发一个基础模型

Paul Vermeeren, Heysem Kaya

机构 * Utrecht University, Department of Information and Computing Sciences(乌得勒支大学信息与计算科学系)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出结合卷积神经网络与视觉Transformer的基础模型,用于处理荷兰1.2米高分辨率卫星图像,通过融合时序数据提升遥感特征表示,实现更高效的遥感任务性能。

Comments 9 pages, 4 figures, under review in a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10129 2026-05-12 cs.CL 83%

Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data

合成预预训练提升语言模型对噪声预训练数据的鲁棒性

Xu Guo, Runyu Peng, Jian Tong, Yunhua Zhou, Haijun Lv, Zhihui Lu, Qipeng Guo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文研究了基于合成数据的轻量预预训练(PPT)阶段对提升语言模型在预训练阶段对噪声的鲁棒性的作用,实验表明PPT能有效降低噪声影响,尤其在高噪声水平下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04306 2026-05-12 cs.CV cs.AI 83%

HighFM: Towards a Foundation Model for Learning Representations from High-Frequency Earth Observation Data

HighFM:面向高频率地球观测数据学习表示的基础模型

Stella Girtsou, Konstantinos Alexis, Giorgos Giannopoulos, Charalambos Kontoes

机构 * National Observatory of Athens(国家天文台) National Technical University of Athens(雅典国家技术大学) National and Kapodistrian University of Athens(雅典国家与卡波迪斯特里亚大学) Athena Research Center(雅典研究所以及研究中心)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出HighFM,一种针对高时间分辨率多光谱地球观测数据的基础模型,通过SEVIRI影像和SatMAE框架学习时空表示,并在云遮蔽和主动火检测任务中展现优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21015 2026-05-12 cs.IR cs.CL 83%

Don't Retrieve, Generate: Prompting LLMs for Synthetic Training Data in Dense Retrieval

不检索,生成:通过提示LLMs生成合成训练数据用于密集检索

Aarush Sinha

专题命中 预训练与数据 :prompting(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出通过提示大型语言模型生成合成硬负样本,用于密集检索模型训练,通过在10个BEIR基准数据集上评估发现,生成模型性能不优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08472 2026-05-12 cs.AI 83%

Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models

中期使用自生成数据提升语言模型中的强化学习

Aswin RRV, Jacob Dineen, Divij Handa, Mihir Parmar, Ben Zhou, Swaroop Mishra, Chitta Baral

机构 * Arizona State University(亚利桑那州立大学) Google Cloud AI Research(谷歌云人工智能研究) Google DeepMind(谷歌DeepMind)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文研究在强化学习前使用多样化的自生成数据提升语言模型的强化学习效果,通过自生成数据训练后,模型在数学推理等任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10391 2026-05-12 cs.CL cs.AI cs.CV 82%

Phoenix-VL 1.5 Medium Technical Report

Phoenix-VL 1.5 中等技术报告

Team Phoenix, :, Arka Ray, Askar Ali Mohamed Jawad, Biondi Lee, Elijah Seah, Eva Lim, Fiona Teo, Grace Toh, Guang Xiang Teo, Jun En Tan, Jia Hui Bong, Jiale Wang, Jonathan Ng, Justin Tan, Kai Zhe Yew, Matthew Ong, Shun Yi Yeo, Wen Jett Lam, Wen Xiu Tan, Ze Yu Zhang, Gee Wah Ng, Chee Wee Ang, Mistral AI, :, Adrien Sadé, Guillaume Kunsch, Jia Sin Loh, Nicolas Schuhl, Rupert Menneer, Umar Jamil, Vincent Maladière, Yimu Pan

机构 * Mistral AI

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);post-training(abstract);preference optimization(abstract)

AI总结 Phoenix-VL 1.5 是一个123B参数的多模态多语言基础模型,适应区域语言和新加坡环境,通过本地化数据集和对齐优化实现深度领域适应,同时在多项基准测试中表现优异。

Comments Release page: https://medium.com/htx-ai/introducing-phoenix-vl-1-5-medium-multimodal-intelligence-uniquely-singaporean-ef8214c8cfa1

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08524 2026-05-12 cs.DC 82%

Unleashing Scalable Context Parallelism for Foundation Models Pre-Training via FCP

通过FCP释放可扩展的上下文并行性以实现基础模型预训练

Yilong Zhao, Xiaonan Nie, Kan Zhu, Shuang Ma, Zhichao Lai, Hongxiang Hao, Yang Zhou, Baris Kasikci, Ion Stoica

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文提出FCP,一种灵活的上下文并行范式,通过块级粒度划分和调度序列,实现高效计算和负载平衡,提升基础模型预训练的可扩展性。

Comments Accepted by MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08276 2026-05-12 cs.CV 82%

Beyond ViT Tokens: Masked-Diffusion Pretrained Convolutional Pathology Foundation Model for Cell-Level Dense Prediction

超越ViT标记:面向细胞级密集预测的掩码扩散预训练卷积病理基础模型

Weiming Chen, Xitong Ling, Zhenyang Cai, Xidong Wang, Jiawen Li, Tian Guan, Benyou Wang, Yonghong He

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Research Institute of Tsinghua, Pearl River Delta(清华大学 Pearl River Delta 研究院) The Chinese University of Hong Kong, ShenZhen(香港中文大学(深圳))

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文提出ConvNeXt Masked-Diffusion模型,通过卷积生成预训练框架提升病理图像细胞级密集预测性能,实验表明其在有限标注条件下表现更优,优于现有ViT模型和端到端分割方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12286 2026-05-12 q-bio.GN cs.CL 81%

Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer

不再有间隙:通过一个分词器实现零间隙多模态整合

Yanan Li, Christina Yi Jin, Yuan Jin, Manli Luo, Tie Xu, Shuai Jiao, Wei He, Qing Zhang

机构 * Research Center for Frontier Fundamental Studies, Zhejiang Lab(前沿基础研究研究中心,浙江实验室) Research Center for Scientific Data Hub, Zhejiang Lab(科学数据枢纽研究中心,浙江实验室)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出One Tokenizer,通过统一词汇实现多模态无缝整合,克服传统架构的几何模态间隙问题,提升生物推理性能。

Comments Under review at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10737 2026-05-12 cs.CL cs.LG 81%

PolyTruth: Multilingual Disinformation Detection using Transformer-Based Language Models

PolyTruth:基于Transformer语言模型的多语言虚假信息检测

Zaur Gouliev, Jennifer Waters, Chengqian Wang

机构 * School of Information & Communication Studies(信息与通信研究学院) University College Dublin(都柏林大学学院)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文通过比较五种多语言Transformer模型在虚假信息检测任务中的表现,揭示了不同模型在多语言环境下的性能差异及局限性,提出了PolyTruth Disinfo Corpus数据集以促进进一步研究。

Comments 11 pages, 5 figures, 4 tables. Submitted to arXiv in Computation and Language

Journal ref Machine Learning and Principles and Practice of Knowledge Discovery in Databases, ECML PKDD 2025, Communications in Computer and Information Science, vol. 2843, pp. 353-367, Springer, Cham (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09630 2026-05-12 cs.CL cs.LG 81%

Scratchpad Patching: Decoupling Compute from Patch Size in Byte-Level Language Models

字节级语言模型中的Scratchpad补丁:解耦计算与补丁大小

Lin Zheng, Vasilisa Bashlovkina, Timothy Dozat, Dan Garrette, Laura Rimell, Joshua Maynez

机构 * Google DeepMind(谷歌DeepMind) The University of Hong Kong(香港大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出Scratchpad补丁方法,通过在每个补丁中插入临时缓存来优化字节级语言模型的计算效率,提升模型质量并减少KV缓存和推理计算需求。

Comments 23 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10051 2026-05-12 cs.NI cs.AI cs.CR cs.LG 81%

Where Do Flow Semantics Reside? A Protocol-Native Tabular Pretraining Paradigm for Encrypted Traffic Classification

流量语义在哪里?一种协议原生的表格预训练范式用于加密流量分类

Sizhe Huang, Zitong Li, Shujie Yang

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种协议原生的表格预训练范式,解决加密流量分类中传统序列模型的语义丢失问题,通过FlowSem-MAE在保持字段边界和时间模式方面取得显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10825 2026-05-12 cs.NI 80%

Large Spectrum Models (LSMs): Decoder-Only Transformer-Powered Spectrum Activity Forecasting via Tokenized RF Data

大规模频谱模型(LSMs):通过令牌化射频数据的解码器-only变换器进行频谱活动预测

Mohammad Mosiur Lunar, Mehmet C. Vuran

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出大规模频谱模型(LSMs),通过令牌化射频数据利用大规模语言模型架构进行频谱预测,展示了LSMs在频谱预测中的有效性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09110 2026-05-12 cs.LG 79%

CodeBrain: Bridging Decoupled Tokenizer and Multi-Scale Architecture for EEG Foundation Model

CodeBrain: 桥接解耦分词器与多尺度架构的EEG基础模型

Jingying Ma, Feng Wu, Qika Lin, Yucheng Xing, Chenyu Liu, Ziyu Jia, Mengling Feng

机构 * Saw Swee Hock School of Public Health, National University of Singapore(新加坡国立大学 Saw Swee Hock 公共卫生学院) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) Guangzhou Research Translation and Innovation Institute, National University of Singapore(新加坡国立大学广州研究翻译与创新研究所) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Beijing Key Laboratory of Brainnetome and Brain-Computer Interface, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所脑网络与脑机接口重点实验室) Brainnetome Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所脑网络中心)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 CodeBrain通过解耦分词器和多尺度架构提升EEG基础模型的表示能力,实现对大脑活动的高效捕捉与可解释性。

Comments Published as a conference paper at the International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏