arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-25 至 2026-06-25 共收录 24 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 24 篇

2501.18916 2026-06-25 cs.LG 版本更新 92%

LLM Program Optimization via Retrieval Augmented Search

通过检索增强搜索实现LLM程序优化

Sagnik Anupam, Alexander Shypula, Osbert Bastani

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出检索增强搜索(RAS)方法,利用LLM进行黑盒程序优化,通过检索慢-快程序对引导束搜索,并基于LLM生成的自然语言描述进行上下文检索,显著优于源码检索;同时提出AEGIS方法通过原子编辑提升可解释性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17945 2026-06-25 cs.AI 新提交 90%

Small Initialization Matters for Large Language Models

小初始化对大语言模型至关重要

Liangkai Hang, Junjie Yao, Zhiyu Li, Feiyu Xiong, Hongkang Yang, Zhi-Qin John Xu

机构 * School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院) Institute of Natural Sciences, Shanghai Jiao Tong University(上海交通大学自然科学研究院) MemTensor (Shanghai) Technology Co., Ltd.(上海记忆张量科技有限公司) Institute for Advanced Algorithms Research(先进算法研究所)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);pretraining(abstract)

AI总结 本文发现减小初始化尺度能持续改善大语言模型预训练,尤其在推理任务上提升显著,并揭示了小初始化驱动参数从低复杂度结构向丰富表示演化的机制。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01163 2026-06-25 cs.LG stat.ML 版本更新 89%

How Does the Pretraining Distribution Shape In-Context Learning? A Fundamental Trade-Off

预训练分布如何塑造上下文学习?一个基本的权衡

Waïss Azizian, Ali Hasan

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 通过理论框架和实验,揭示预训练分布的统计特性(如重尾行为)在上下文学习中导致任务选择鲁棒性与泛化能力之间的基本权衡。

Comments 57 pages, 15 figures; to be presented at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26050 2026-06-25 cs.LG cond-mat.dis-nn cs.AI cs.CL 新提交 87%

Natural Ungrokking: Asymmetric Control of Which Rules Survive Pretraining

自然去突现:不对称控制哪些规则在预训练中幸存

Juliana Li, Diya Sreedhar

机构 * Harvard University(哈佛大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 发现语言模型在预训练中学习规则后会自动遗忘,规则存亡由训练数据中支持频率决定,且遗忘不可逆。

Comments Foundations of Deep Generative Models (FoGen) Workshop at ICML 2026. 23 pages (5-page main text plus appendices), 5 figures. Code: https://github.com/lijuliana/Natural-Ungrokking

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24998 2026-06-25 cs.LG cs.AI 新提交 84%

Internal Data Repetition Destroys Language Models

内部数据重复破坏语言模型

Jessica Chudnovsky, Joshua Kazdan, Noam Levi, Rylan Schaeffer, Yegor Denisov-Blanch, Bo He, Mehmet Donmez, Sanmi Koyejo, David Donoho

机构 * Stanford Computer Science(斯坦福大学计算机科学系) Stanford Statistics(斯坦福大学统计学系) Tel Aviv University(特拉维夫大学) IMC Trading

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究重复数据对语言模型的影响,通过无重复缩放定律量化计算等效损失,发现重复次数存在最坏点,且该点随模型规模呈幂律增长。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20673 2026-06-25 cs.LG cs.AI cs.CV 新提交 84%

NeuroShield: A Device-Agnostic Foundation Model for EEG Authentication

NeuroShield: 一种设备无关的EEG认证基础模型

Matin Fallahi, Patricia Arias-Cabarcos, Thorsten Strufe

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) Joint Research Centre, European Commission(欧盟委员会联合研究中心)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 针对EEG认证中模型因采集设备差异而难以复用的问题,提出NeuroShield基础模型,采用双阶段Transformer架构从变通道、变长度EEG中学习身份判别嵌入,在三个公开数据集预训练后,微调后等错误率降低0.44-8.06个百分点,并泛化至未见过的通道布局和更长信号段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00866 2026-06-25 cs.LG cs.CL 版本更新 84%

Removing Noise, not Finding Gold: Quality Filtering for Large-Scale Pretraining

去除噪声,而非寻找黄金:大规模预训练的质量过滤

Thiziri Nait Saada, Louis Bethune, Michal Klein, David Grangier, Marco Cuturi, Pierre Ablin

机构 * Work done as an intern at Apple(苹果公司实习生) University of Oxford(牛津大学) Apple(苹果公司)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文深入分析基于分类器的质量过滤(CQF)方法,发现其虽提升下游任务性能,但会隐式过滤高质量数据,且与基于合成数据的模型行为趋势不同,质疑CQF捕捉数据质量的有效性。

Comments 21 pages, 22 figures, 2 tables, accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11483 2026-06-25 cs.LG cs.AI 84%

A Multi-Center Study on the Adaptability of a Shared Foundation Model for Electronic Health Records

多中心研究:共享电子健康记录基础模型的适应性

Lin Lawrence Guo, Jason Fries, Ethan Steinberg, Scott Lanyon Fleming, Keith Morse, Catherine Aftandilian, Jose Posada, Nigam Shah, Lillian Sung

机构 * Program in Child Health Evaluative Sciences, The Hospital for Sick Children, Toronto, ON, 1 Canada(儿童健康评估科学计划,多伦多医院儿童医学中心,多伦多,加拿大) Stanford Center for Biomedical Informatics Research, Stanford University, Palo Alto, CA, USA(斯坦福大学生物医学信息学研究中心,斯坦福大学,帕洛阿尔托,美国) Universidad del Norte, Barranquilla, Columbia(北方大学,巴兰基利亚,哥伦比亚) Division of Haematology/Oncology, The Hospital for Sick Children, Toronto, ON, Canada(血液肿瘤科,多伦多医院儿童医学中心,多伦多,加拿大)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本研究评估了共享电子健康记录基础模型在不同医院间的适应性,证明其在较少标注数据下仍能提供优于本地训练的性能,且更高效。

Comments 46 pages, 5 figures, 3 tables, 14 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26062 2026-06-25 cs.CL 新提交 81%

When Certainty Is an Artifact: Keyword Lexicon Blindness and the (Mis)Measurement of Rhetorical Stance

当确定性是人为产物:关键词词典盲点与修辞立场的(误)测量

Bo Chen

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 通过对比关键词词典与LLM零样本分类在85篇访谈(2016-2026)中的表现,发现关键词计数产生的显著负情绪-确定性共现模式是测量伪影,而LLM揭示出悲观话语实际吸引的是模糊化而非确定性。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25721 2026-06-25 cs.CR cs.CL cs.IR 新提交 81%

Tracing Target Answers in Poisoned Retrieval Corpora via Token Influence Attribution

通过令牌影响归因追踪中毒检索语料库中的目标答案

Yan-Lun Chen, Pin-Yu Chen, Chia-Mu Yu, Ying-Dar Lin, Yu-Sung Wu, Wei-Bin Lee

机构 * National Yang Ming Chiao Tung University(阳明交通大学) IBM Research(IBM研究院) Hon Hai Research Institute(宏海研究院)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出TRACE框架,通过令牌影响归因识别检索增强生成系统中的语料投毒攻击,无需额外分类器或LLM验证,在三个QA基准和六个LLM上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24897 2026-06-25 cs.DL cs.CL cs.IR 新提交 81%

Invisible to humans, visible to machines: a preregistered audit of Unicode fidelity across four biomedical bibliographic APIs

对人类不可见,对机器可见:四个生物医学文献API的Unicode保真度预注册审计

Przemysław Czuma

机构 * Przemysław Czuma(普拉姆斯拉夫·茨马)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过预注册审计,评估四个生物医学API(PubMed、Crossref、OpenAlex、Semantic Scholar)返回摘要的Unicode保真度,发现PubMed和OpenAlex存在系统性字符丢失,影响文献计量和语料构建。

Comments 14 pages, 1 figure. Pre-registered on OSF. Data and code available on Zenodo and GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26021 2026-06-25 cs.CR cs.AI 新提交 79%

Privacy Vulnerabilities of Attention Layers in Tabular Foundation Models and Protection of High-Risk Queries

表格基础模型中注意力层的隐私漏洞及高风险查询的保护

Tânia Carvalho, Maxime Cordy

机构 * SnT, University of Luxembourg(卢森堡大学SnT研究所)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI

AI总结 本文发现表格基础模型的注意力机制会泄露成员信息,提出无影子模型的AMIA攻击,并基于k-匿名原理设计推理时防御,降低成员泄露风险。

Comments 18 pages, 12 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13432 2026-06-25 cs.CV cs.AI 版本更新 79%

Spatial Transcriptomics as Images for Large-Scale Pretraining

空间转录组学作为图像进行大规模预训练

Yishun Zhu, Jiaxin Qi, Jian Wang, Yuhua Zheng, Jianqiang Huang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Hangzhou Institute for Advanced Study, University of the Chinese Academy of Sciences(中国科学院大学杭州高等研究院)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI

AI总结 提出将空间转录组学数据视为可裁剪的多通道图像,通过空间分块和基因子集选择来增加训练样本并保留空间上下文,实现大规模预训练,显著提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25935 2026-06-25 cs.CL cs.AI 新提交 73%

Overview of HIPE-2026: Person-Place Relation Extraction from Multilingual Historical Texts

HIPE-2026 概述:从多语言历史文本中提取人物-地点关系

Juri Opitz, Maud Ehrmann, Corina Raclé, Andrianos Michail, Matteo Romanello, Simon Clematide

机构 * University of Zurich(苏黎世大学) École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) Swiss Federal Institute of Technology Zurich (ETHZ)(苏黎世联邦理工学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出HIPE-2026评测任务,针对多语言历史文档中的人物-地点关系(at和isAt)进行提取,采用三方面评估框架,比较了多种方法在准确性、效率和跨域泛化上的表现。

Comments Condensed Overview of CLEF-HIPE-2026 Shared Task Results

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25010 2026-06-25 cs.LG cs.CL 新提交 73%

Emergent Capabilities Arise Randomly from Learning Sparse Attention Patterns

涌现能力随机地从学习稀疏注意力模式中产生

Vatsal Baherwani, Zixi Chen, Shikai Qiu, Andrew Gordon Wilson, Pavel Izmailov

机构 * New York University(纽约大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究发现,transformer模型的下游能力(如上下文学习)在训练过程中随机涌现,较大模型平均更早获得,且涌现对应于任务相关注意力模式的突然学习。

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25008 2026-06-25 cs.LG cs.CL 新提交 73%

Neural Scaling Universality: If Exponents Are Fixed, Time to Understand Coefficients

神经缩放普适性:如果指数固定,是时候理解系数了

Yizhou Liu, Jeff Gore

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文论证神经缩放定律中的幂律指数由通用机制固定,而系数对数据和架构细节敏感,理解系数是近期性能提升的关键。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25546 2026-06-25 cs.CV 新提交 71%

Disease-Centric Vision-Language Pretraining with Hybrid Visual Encoding for 3D Computed Tomography

面向3D计算机断层扫描的疾病中心视觉语言预训练与混合视觉编码

Bowen Shi, Weiwei Cao, Ruifeng Yuan, Wanxing Chang, Wenrui Dai, Hongkai Xiong, Ling Zhang, Jianpeng Zhang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab, 310023, Hangzhou, China(虎扑实验室,杭州,中国) Shanghai Jiao Tong University, China(上海交通大学,中国) Zhejiang University, China(浙江大学,中国) Fudan University, China(复旦大学,中国)

专题命中 预训练与数据 :pretraining(title)

AI总结 提出一种结合CNN-ViT混合编码器、疾病级对比学习和诊断感知提示的视觉语言预训练框架,在CT-RATE和Rad-ChestCT上取得最优性能,并提升零样本诊断可靠性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10386 2026-06-25 cs.CV cs.AI cs.MM 70%

Handling Missing Modalities in Multimodal Survival Prediction for Non-Small Cell Lung Cancer

多模态生存预测中缺失模态的处理:非小细胞肺癌的应用

Filippo Ruffini, Camillo Maria Caruso, Claudia Tacconi, Lorenzo Nibid, Francesca Miccolis, Marta Lovino, Carlo Greco, Edy Ippolito, Michele Fiore, Alessio Cortellini, Bruno Beomonte Zobel, Giuseppe Perrone, Bruno Vincenzi, Claudio Marrocco, Alessandro Bria, Elisa Ficarra, Sara Ramella, Valerio Guarrasi, Paolo Soda

机构 * Unit of Artificial Intelligence and Computer Systems, Department of Engineering(人工智能与计算机系统单位,工程系) Università Campus Bio-Medico di Roma(罗马生物医学大学) Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering(诊断与介入部门,辐射物理,生物医学工程) Umeå University(乌梅学院) Research Unit of Radiation Oncology, Department of Medicine and Surgery(放射肿瘤研究单位,医学与外科部门) Fondazione Policlinico Universitario Campus Bio-Medico(生物医学大学附属医院基金会) Anatomical Pathology Operative Research Unit(解剖病理学操作研究单位) Research Unit of Anatomical Pathology, Department of Medicine and Surgery(解剖病理学研究单位,医学与外科部门) Department of Medicine and Surgery(医学与外科部门)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出一种缺失感知的多模态生存框架,结合CT、WSI和临床数据,通过基础模型提取特征并融合,提升NSCLC生存预测的准确性与临床适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25253 2026-06-25 cs.CL cs.DL cs.IR 新提交 57%

Automatic Generation of Highlights for Academic Paper Via Prompt-based Learning

基于提示学习的学术论文亮点自动生成

Yi Xiang, Chengzhi Zhang, Heng Zhang

机构 * Department of Information Management, Nanjing University of Science and Technology(南京理工大学信息管理学院)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 研究利用提示学习自动生成学术论文亮点,设计特定提示模板结合摘要输入,评估GPT-2、T5及ChatGPT等模型,在三个数据集上达到甚至超越监督方法性能,且对提示设计敏感。

Journal ref Library Hi Tech, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24962 2026-06-25 cs.LG 新提交 57%

Towards Scalable Multi-Task Reinforcement Learning with Large Decision Models

迈向可扩展的多任务强化学习与大决策模型

Thibaut Kulak

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 提出LDM-v0,一个在大规模异构强化学习环境上离线预训练的Transformer策略,通过监督下一动作预测实现多任务学习,在约1000个环境中达到与独立训练策略相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25579 2026-06-25 eess.IV cs.CV 交叉投稿 50%

Cross-Attention Multimodal Learning for Predicting Response to Neoadjuvant Imatinib in Gastrointestinal Stromal Tumors: A Multicenter Retrospective Study

跨注意力多模态学习预测胃肠道间质瘤新辅助伊马替尼治疗反应:一项多中心回顾性研究

Fariba Tohidinezhad, Douwe J. Spaanderman, Natalia Oviedo Acosta, Kaouther Mouheb, Karthik Prathaban, David F. Hanff, Dirk J. Grünhagen, Cornelis Verhoef, Joris M. van Sabben, Evelyne Roets, Jette J. Slettenhaar, Hans Gelderblom, Ingrid M. E. Desar, Anna K. L. Reyners, Neeltje Steeghs, Stefan Klein, Martijn P. A. Starmans

机构 * Department of Radiology and Nuclear Medicine, Erasmus MC Cancer Institute, University Medical Center Rotterdam(埃拉斯姆斯MC癌症研究所放射学与核医学部,埃因霍温医学院鲁特沃特分校) Department of Surgical Oncology, Erasmus MC Cancer Institute, University Medical Center Rotterdam(埃拉斯姆斯MC癌症研究所外科肿瘤部,埃因霍温医学院鲁特沃特分校) Department of Pathology, Erasmus MC Cancer Institute, University Medical Center Rotterdam(埃拉斯姆斯MC癌症研究所病理学部,埃因霍温医学院鲁特沃特分校) Department of Medical Oncology, The Netherlands Cancer Institute, Amsterdam(荷兰癌症研究所医学肿瘤部,阿姆斯特丹) Department of Medical Oncology, Leiden University Medical Center, Leiden(莱顿大学医学中心医学肿瘤部,莱顿) Department of Medical Oncology, Radboud University Medical Centre, Nijmegen(拉德堡德大学医学中心医学肿瘤部,尼日梅根) Department of Medical Oncology, University Medical Center Groningen, University of Groningen(格罗宁根大学医学中心医学肿瘤部,格罗宁根) Department of Medical Oncology, Netherlands Cancer Institute, Antoni Van Leeuwenhoek(荷兰癌症研究所医学肿瘤部,安托万·弗莱明)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本研究开发了一种可解释的跨注意力多模态深度学习框架,整合CT影像和临床变量,用于预测胃肠道间质瘤对新辅助伊马替尼的治疗反应,在内部验证中达到高AUC但外部泛化性有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09457 2026-06-25 cs.RO 新提交 50%

$ω$-EVA: Envision, Verify, and Act with Latent Interactive World Models

$ω$-EVA:基于潜在交互世界模型的构想、验证与行动

Zhenguo Sun, Yu Sun, Hande Huang, Alois Knoll

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出$ω$-EVA框架,通过潜在交互世界模型实现“构想-验证-行动”循环,利用动作条件潜在动力学和语言条件流策略生成动作,无需生成未来视频,在多种机器人操作任务中提升策略性能。

Comments Add some ablation experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28090 2026-06-25 cs.CV 版本更新 50%

To View Transform or Not to View Transform: NeRF-based Pre-training Perspective

视图变换还是不视图变换:基于NeRF的预训练视角

Hyeonjun Jeong, Juyeb Shin, Dongsuk Kum

机构 * KAIST(韩国科学技术院)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出NeRP3D检测器,避免视图变换与NeRF的冲突先验,保留预训练NeRF网络,实现连续3D表示学习,在nuScenes上提升场景重建和检测性能。

Comments The Fourteenth International Conference on Learning Representations (ICLR'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21416 2026-06-25 cs.RO 版本更新 50%

Spotlighting Task-Relevant Features: Object-Centric Representations for Better Generalization in Robotic Manipulation

聚焦任务相关特征:面向机器人操作泛化的对象中心表示

Alexandre Chapin, Bruno Machado, Emmanuel Dellandréa, Liming Chen

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对机器人操作策略泛化受视觉表示中任务无关信息干扰的问题,提出基于槽的对象中心表示(SBOCR),通过将密集特征分组为对象级实体来减少噪声,在模拟和真实实验中优于全局和密集特征表示。

详情

展开后加载摘要…

URL PDF HTML 收藏