arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-18 至 2026-05-18 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 21 篇

2605.15615 2026-05-18 cs.CV cs.LG 89%

Neutral-Reference Prompting for Vision-Language Models

视觉-语言模型的中性参考提示

Senmao Tian, Xiang Wei, Shunli Zhang

机构 * Beijing Jiaotong University(北京交通大学)

专题命中 预训练与数据 :language model(title,abstract);prompting(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出NeRP策略,通过中性提示和参考图像提升模型对未知类别的判别能力,同时保持对已知类别的准确性。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15854 2026-05-18 eess.AS 87%

Improving Automatic Speech Recognition for Speakers Treated for Oral Cancer using Data Augmentation and LLM Error Correction

通过数据增强和大语言模型错误校正提升口腔癌患者语音识别性能

Hidde Folkertsma, Thomas Tienkamp, Sebastiaan de Visscher, Max Witjes, Rob van Son, Jiapan Guo, Bence Mark Halpern

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过数据增强和大语言模型错误校正技术,有效提升了口腔癌患者语音识别的性能,实验结果显示在Whisper和MMS模型上分别实现了40%和50%的词错误率降低。

Comments 7 pages, 3 tables. Accepted by EMBC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15334 2026-05-18 cs.LG cs.AI cs.CL cs.SE 86%

From I/O to Code with Discovery Agent

从输入输出到代码:发现代理

Yihong Dong, Jiaru Qian, Haoran Zhang, Peixu Wang, Binhua Li, Zhi Jin, Yongbin Li, Ge Li, Xiaokang Yang, Xue Jiang

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Wuhan University(武汉大学) Renmin University of China(中国人民大学) National University of Singapore(新加坡国立大学) Shanghai Jiaotong University(上海交通大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DIO-Agent,通过将IO2Code视为离散程序空间的进化搜索,利用LLM作为突变算子,结合执行误差信号指导突变,解决从输入输出行为合成代码的难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16069 2026-05-18 cs.LG 85%

ITGPT: Generative Pretraining on Irregular Timeseries

ITGPT:对不规则时间序列的生成预训练

Antoine Honoré, Ming Xiao

机构 * Division of Information Science and Engineering, KTH Royal Institute of Technology(信息科学与工程系,皇家理工学院)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出ITGPT,一种针对多模态不规则时间序列的注意力架构,通过自监督学习和生成预训练目标处理不规则采样数据,在医疗和预测维护任务中实现SOTA性能。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16026 2026-05-18 cs.CL cs.AI 85%

From Flat Language Labels to Typological Priors: Structured Language Conditioning for Multilingual Speech-to-Speech Translation

从平铺语言标签到类型学先验:面向多语言语音到语音翻译的结构化语言条件化

Yu Pan, Yang Hou, Xiongfei Wu, Liang Zhang, Yves Le Traon, Lei Ma, Jianjun Zhao

机构 * School of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电子工程学院) Recho Inc.(Recho公司) National Institute of Informatics(国家信息研究所) Interdisciplinary Research Centre on Security, Reliability and Trust (SnT), University of Luxembourg(卢森堡大学安全、可靠性与信任跨学科研究中心) Donghua University(东华大学) Department of Computer Science, The University of Tokyo(东京大学计算机科学系) Department of Electrical and Computer Engineering, University of Alberta(阿尔伯塔大学电子与计算机工程系)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出S2ST-Omni 2框架,通过结构化类型学先验改进多语言语音到语音翻译,实验显示其在多个评估指标上表现优异,且在数据受限条件下仍能提升翻译效率。

Comments Submitted to IEEE/ACM TASLP. This work extends S2ST-Omni, accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12715 2026-05-18 cs.LG cs.CL 84%

Scaling Laws for Mixture Pretraining Under Data Constraints

混合预训练下的扩展规律

Anastasiia Sedova, Skyler Seto, Natalie Schluter, Pierre Ablin

机构 * Apple(苹果公司)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究混合预训练中数据限制下的扩展规律,发现重复是影响目标领域性能的核心因素,提出考虑重复的混合扩展定律以优化预训练配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23410 2026-05-18 cs.LG cs.AI eess.SP q-bio.NC 84%

Brain-OF: An Omnifunctional Foundation Model for fMRI, EEG and MEG

Brain-OF:一种适用于fMRI、EEG和MEG的多功能基础模型

Hanning Guo, Hanwen Bi, Farah Abdellatif, Andrei Galbenus, Jon. N. Shah, Abigail Morrison, Jürgen Dammers

机构 * INM-4, Forschungszentrum Jülich, Germany(Jülich 研究中心 INM-4 实验室,德国) Department of Computer Science(计算机科学系) Software Engineering, RWTH Aachen University, Germany(软件工程,亚琛工业大学,德国) INM-7, Forschungszentrum Jülich, Germany(Jülich 研究中心 INM-7 实验室,德国) Institute of Systems Neuroscience, Heinrich Heine University, Germany(系统神经科学研究所,海因里希·海涅大学,德国) Department of Neurology, RWTH Aachen University, Germany(神经病学系,亚琛工业大学,德国) JARA-BRAIN-Translational Medicine, Germany(JARA-BRAIN 转化医学,德国) INM–11, JARA, Forschungszentrum Jülich, Germany(JARA-INM-11 实验室,Jülich 研究中心,德国) IAS-6, Forschungszentrum Jülich, Germany(IAS-6 实验室,Jülich 研究中心,德国) Department of Psychiatry, Psychotherapy and Psychosomatics, RWTH Aachen University, Germany(精神病学、心理治疗和精神病理学系,亚琛工业大学,德国)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 Brain-OF通过联合预训练fMRI、EEG和MEG数据,解决多模态数据语义异质性和分辨率差异问题,提升跨模态数据处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14572 2026-05-18 cs.IR cs.AI cs.CL cs.MA 82%

Don't Retrieve, Navigate: Distilling Enterprise Knowledge into Navigable Agent Skills for QA and RAG

不要检索,导航:将企业知识转化为可导航的代理技能用于问答和RAG

Yiqun Sun, Pengfei Wei, Lawrence B. Hsieh

机构 * Magellan Technology Research Institute(马格纳技术研究 institute)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Corpus2Skill,通过将文档库转化为层次化技能目录,使LLM代理在服务时能导航该目录,提升问答质量和 grounding,但指出导航并非所有场景下的最佳替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02812 2026-05-18 cs.RO 82%

Learning Structured Robot Policies from Vision-Language Models via Synthetic Neuro-Symbolic Supervision

通过合成神经符号监督学习结构化机器人策略

Alessandro Adami, Tommaso Tubaldo, Marco Todescato, Ruggero Carli, Pietro Falco

机构 * University of Padova, Dept. of Information Engineering(帕多瓦大学信息工程系) Fraunhofer Italia Research(弗劳恩霍夫意大利研究所) Polytechnic of Bari Dept. of Electrical and Information Engineering(巴里理工学院电气与信息工程系)

专题命中 预训练与数据 :language model(title,abstract);foundation model(abstract)

AI总结 本文提出通过合成神经符号监督方法,利用视觉语言模型生成结构化机器人策略,结合多模态感知与符号控制,实现高维学习与符号控制的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15698 2026-05-18 cs.HC 82%

Handwriting decoding as a challenging motor task for EEG Foundation Models

手写解码作为EEG基础模型中的一个具有挑战性的运动任务

Srinivas Ravishankar, Ishayu Ghosh, Nora Zajzon, Teng Fei, Virginia de Sa

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文提出将手写解码作为EEG基础模型的挑战性运动任务,发现现有数据集可能存在问题,并引入更严谨的评估数据集,显示基础模型在手写解码任务中不如专门模型表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16088 2026-05-18 cs.LG cs.AI 81%

Multi-level Self-supervised Pretraining on Compositional Hierarchical Graph for Molecular Property Prediction

基于组合层次图的多级自监督预训练用于分子性质预测

Xiayu Liu, Zhengyi Lu, Hou-biao Li

机构 * School of Mathematical Sciences(数学科学学院) University of Electronic Science and Technology of China(电子科技大学) Department of Computer Science and Engineering(计算机科学与工程系) Oakland University(奥克兰大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出MolCHG框架,通过多级自监督预训练提升分子性质预测性能,采用组合层次图组织分子结构,引入bond graph增强bond信息,实现原子与bond语义的平等聚合。

Comments 11pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23068 2026-05-18 cs.LG cs.AI 81%

ExplainerPFN: Towards tabular foundation models for model-free zero-shot feature importance estimations

ExplainerPFN:迈向无模型零样本特征重要性估计的表格基础模型

Joao Fonseca, Julia Stoyanovich

机构 * INESC-ID New York University(纽约大学)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出ExplainerPFN,一种基于TabPFN的表格基础模型,通过预训练合成结构因果数据实现无模型零样本特征重要性估计,展示了其在真实和合成数据集上的竞争力。

Comments 35 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15284 2026-05-18 cs.LG 79%

Tadpole: Autoencoders as Foundation Models for 3D PDEs with Online Learning

Tadpole:用于3D偏微分方程的自动编码器作为基础模型的在线学习

Qiang Liu, Felix Koehler, Benjamin Holzschuh, Nils Thuerey

机构 * TUM School of Computation, Information and Technology(慕尼黑技术大学计算、信息与技术学院) Technical University of Munich, Garching, Germany(慕尼黑技术大学,慕尼黑,德国) MCML, Munich Center for Machine Learning, Munich, Germany(慕尼黑机器学习中心,慕尼黑,德国)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 Tadpole通过在线数据生成框架预训练自动编码器,学习跨异构物理系统的丰富可迁移表示,支持高维扩展和多任务应用,包括动态学习和生成建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15711 2026-05-18 cs.CV 75%

EntropyScan: Towards Model-level Backdoor Detection in LVLMs via Visual Attention Entropy

EntropyScan: 向通过视觉注意力熵实现LVLMs的模型级后门检测

Xuanyu Ge, Zhongqi Wang, Jie Zhang, Shiguang Shan, Xilin Chen

机构 * China University of Geosciences(中国地质大学) University of the Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出EntropyScan,一种轻量且不依赖触发器的模型级后门检测方法,通过量化视觉注意力分布的结构扭曲来检测后门模型,实验显示其在两个LVLM架构和三种高级攻击场景中达到98.5%的F1分数和96.6%的AUC。

Comments 20 pages, 6 figures, 8tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21850 2026-05-18 cs.CV 75%

Visual Compositional Tuning

视觉组合调谐

Xindi Wu, Hee Seung Hwang, Polina Kirichenko, Esin Tureci, Olga Russakovsky

机构 * Princeton University(普林斯顿大学) Meta AI

专题命中 预训练与数据 :large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出COMPACT方法,通过组合多个基本视觉能力提升视觉指令调谐数据效率,减少训练样本数量并提升多模态任务性能。

Comments See the project website at this [URL](https://princetonvisualai.github.io/compact/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15290 2026-05-18 cs.LG cs.AI 73%

GQA-μP: The maximal parameterization update for grouped query attention

GQA-μP:组查询注意力的最大参数更新

Kyle R. Chickering, Huijuan Wang, Mengxi Wu, Alexander Moreno, Muhao Chen, Xuezhe Ma, Daria Soboleva, Joel Hestness, Zhengzhong Liu, Eric Xing

机构 * UC Davis(加州大学戴维斯分校) MBZUAI IFM(脑科学与人工智能研究院(MBZUAI IFM)) USC(南加州大学) Cerebras(Cerebras公司) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文基于谱特征学习观点,提出组查询注意力的最大参数更新方法,通过数学分析实现参数转移,解决了新模型架构下的参数更新难题。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15465 2026-05-18 cs.LG eess.SP 70%

Toward World Modeling of Physiological Signals with Chaos-Theoretic Balancing and Latent Dynamics

向生理信号的世界建模迈进:基于混沌理论的平衡与潜在动态

Yunfei Luo, Xi Chen, Yuliang Chen, Lanshuang Zhang, Md Mofijul Islam, Siwei Zhao, Peter Kotanko, Subhasis Dasgupta, Andrew Campbell, Rakesh Malhotra, Tauhidur Rahman

机构 * University of California San Diego(加州大学圣地亚哥分校) Dartmouth College(达特茅斯学院) Amazon Web Services(亚马逊网络服务) Sanderling Renal Services(Sanderling 肾脏服务) Renal Research Institute(肾脏研究研究所) Icahn School of Medicine at Mount Sinai(辛克尔医学院(Mount Sinai))

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出NormWear-2模型,通过将多变量生理信号与临床干预变量编码到共享潜在空间,结合先验知识推理与非参数潜在状态转移适应,实现多时间尺度的预测。混沌理论平衡动态制度多样性提升了表示鲁棒性,且在不同临床场景下表现优异。

Comments NormWear Collection: https://huggingface.co/collections/mosaic-laboratory/normwear

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15831 2026-05-18 cs.SD cs.AI 57%

Modeling Music as a Time-Frequency Image: A 2D Tokenizer for Music Generation

将音乐建模为时频图像:一种用于音乐生成的2D分词器

Yuqing Cheng, Xingyu Ma, Guochen Yu, Xiaotao Gu

机构 * Department of Music AI and Information Technology, Central Conservatory of Music(音乐人工智能与信息技术系,中央音乐学院) Zhipu AI(智谱AI)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI

AI总结 本文提出BandTok,一种面向生成的2D梅尔频谱分词器,通过单个共享码本生成梅尔频带token,提升自回归建模能力,实验表明其在数据有限情况下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03964 2026-05-18 cs.LG physics.chem-ph 57%

Pretrained Model Representations as Acquisition Signals for Active Learning of MLIPs

预训练模型表示作为主动学习MLIPs的获取信号

Eszter Varga-Umbrich, Shikha Surana, Paul Duckworth, Jules Tilly, Olivier Peltre, Zachary Weller-Davies

机构 * University of Cambridge(剑桥大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文研究预训练MLIP的潜在空间是否包含有效获取信息,提出两种获取信号提升主动学习效率,减少数据需求,提升性能。

Comments 8 main pages, 28 total pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15403 2026-05-18 cs.LG math.OC stat.ML 57%

$ϕ$-Balancing for Mixture-of-Experts Training

$ϕ$-平衡用于专家混合训练

Lizhang Chen, Jonathan Li, Qi Wang, Runlong Liao, Shuozhe Li, Chen Liang, Ni Lao, Qiang Liu

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Northwestern University(西北大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出$ϕ$-平衡框架,通过最小化严格凸、对称且可导的潜在函数,实现专家资源的群体平衡,优于现有启发式方法,在大规模预训练和下游微调中表现更稳定有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00867 2026-05-18 physics.comp-ph 50%

Self-supervised neural operator for solving partial differential equations

自监督神经算子用于求解偏微分方程

Wen You, Shaoqian Zhou, Xuhui Meng

专题命中 预训练与数据 :foundation model(abstract)

AI总结 本文提出自监督神经算子,通过无需数值求解器生成高质量训练数据,高效求解偏微分方程,且轻量微调进一步提升预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏