arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-24 至 2026-06-24 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 18 篇

2603.15510 2026-06-24 cs.LG 版本更新 92%

Not All Invariants Are Equal: Curating Training Data to Accelerate Program Verification with SLMs

并非所有不变式都同等重要:利用SLM通过精选训练数据加速程序验证

Ido Pinto, Yizhak Yisrael Elboher, Haoze Wu, Nina Narodytska, Guy Katz

机构 * Hebrew University of Jerusalem, Israel(特拉维夫大学) Amherst College, USA(阿默斯特学院) VMware Research by Broadcom, USA(Broadcom VMware 研究)

专题命中 预训练与数据 :SLM(title_cn,summary_cn);LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出Wonda数据筛选流水线,通过AST归一化和LLM语义重写从原始验证器输出中提取高质量训练不变式,微调小语言模型(SLM)后,在多个模型上使不变式正确性和加速率翻倍甚至三倍,小模型性能媲美大模型。

Comments A preprint of the ICML 2026 paper with the same title

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24133 2026-06-24 cs.LG cs.CL 新提交 90%

Holistic Data Scheduler for LLM Pre-training via Multi-Objective Reinforcement Learning

基于多目标强化学习的LLM预训练整体数据调度器

Chenhao Dang, Jing Ma, Mingjie Liao

机构 * China Electronics Technology Group Corporation 15th Research Institute(中国电子科技集团公司第十五研究所) Renmin University of China(中国人民大学) Alibaba Group(阿里巴巴集团)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出HDS框架,将数据调度建模为连续控制空间的强化学习问题,利用SAC算法和融合数据质量、跨域影响及模型权重的多目标奖励函数,在The Pile上减少44%训练迭代达到同等困惑度,并在MMLU等任务上提升7.2%。

Comments Our code is at https://github.com/DANG-ai/LLM-Training-Holistic-Data-Schedule

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026), Vol. 1, pp. 176-187, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23911 2026-06-24 cs.IR 新提交 89%

Scaling Dense Retrieval with LLM-Annotated Training Data: Structured Mining and Progressive Curriculum for E-Commerce Sponsored Search

使用LLM标注的训练数据扩展稠密检索:面向电商赞助搜索的结构化挖掘与渐进式课程

Md Omar Faruk Rokon, Shasvat Desai, Jhalak Nilesh Acharya, Isha Shah, Kumar Priyam, Brahanyaa Somasundaram, Vamsee Tangirala, Minuteresa Thomas, Vivek Arora, Vijay Manchi, Hong Yao, Kuang-chih Lee

专题命中 预训练与数据 :LLM(title,title_cn)

AI总结 针对电商搜索中点击信号偏差和人工标注成本高的问题,提出利用多通道检索挖掘、校准的LLM级联标注和五级渐进式课程训练,在Walmart搜索中实现NDCG@10提升5.1%,尾查询提升显著。

Comments Accepted at E-Commerce Workshop, SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24752 2026-06-24 cs.AI 新提交 89%

Can Scale Save Us From Plasticity Loss in Large Language Models?

规模能拯救大型语言模型的可塑性丧失吗?

J. Fernando Hernandez-Garcia, Tomás Figliolia, Beren Millidge

机构 * Zyphra

专题命中 预训练与数据 :language model(title,abstract);large language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究GPT风格Transformer模型在持续学习中的可塑性丧失问题,发现可塑性丧失随模型规模呈亚线性增长,表明增大模型只能延缓而非阻止该现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23130 2026-06-24 cs.CR cs.SE 新提交 88%

Understanding the (In)Security of Vibe-Coded Applications

理解“氛围编码”应用的安全性(与非安全性)

Junquan Deng, Zhiyu Fan, Ruijie Meng

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文系统研究了通过“氛围编码”范式开发的应用的安全性,发现其存在占位符逻辑、未过滤输入和秘密泄露等重复性漏洞模式,根源在于AI代理的系统性局限,且即使改进LLM能力也无法消除根本风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22413 2026-06-24 cs.SE cs.FL 新提交 88%

Formal-Method-Guided Vibe Coding: Closing the Verification Loop on AI-Generated Safety-Critical Software Through Model-Driven Engineering

形式化方法引导的Vibe编码:通过模型驱动工程关闭AI生成安全关键软件的验证循环

Ran Wei, Le Zhu, Haochi Wang, Jim Woodcock, Fang Yan, Simon Foster, Xiangyang Ji

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出Forge管道,结合Vibe编码与模型驱动工程,通过多种形式化验证(Dafny、CSP、Isabelle)迭代修正LLM生成的Java代码,生成符合安全标准的验证证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14167 2026-06-24 cs.CL 81%

Synthetic Clarification and Correction Dialogues about Data-Centric Tasks -- A Teacher-Student Approach

数据导向任务的合成澄清与纠正对话——一种教师-学生方法

Christian Poelitz, Nick McKenna

机构 * Microsoft Research(微软研究院) Cambridge UK(剑桥英国)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文提出一种教师-学生框架,用于合成多轮对话以解决基于表格的问题回答任务,通过强教师模型验证生成对话质量,验证了其在前沿LLM基准中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24080 2026-06-24 eess.AS 新提交 78%

Audio--Image Alignment as a Continued-Pretraining Stage Improves Low-Resource ASR

音频-图像对齐作为持续预训练阶段改善低资源ASR

Sujith Pulikodan, Nihar Desai, Prasanta Kumar Ghosh

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出在预训练和监督微调之间引入音频-图像表示对齐阶段,利用Vaani数据集中的配对数据,无需转录即可提升低资源ASR性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24120 2026-06-24 cs.CV eess.IV 新提交 78%

Flood Mapping from RGB imagery using a Vision Foundation Model

使用视觉基础模型从RGB图像进行洪水制图

Vladyslav Polushko, Tilman Bucher, Ronald Rösch, Thomas März, Markus Rauhut, Andreas Weinmann

机构 * ACIDA Lab(ACIDA实验室)

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 研究利用卫星预训练的地球观测基础模型Prithvi-2.0-UPN,通过微调适应厘米级RGB洪水制图,在零样本和少量样本迁移中取得优于CNN和小型ViT的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22984 2026-06-24 cond-mat.dis-nn cond-mat.stat-mech cs.LG 新提交 70%

Scalable Physics-Inspired Transformers for Spin Glasses

可扩展的物理启发式Transformer用于自旋玻璃

Lu Zhong, Wenli Duan, Jing Liu, Pan Zhang, Ying Tang

机构 * Institute of Fundamental and Frontier Sciences, University of Electronic Science and Technology of China(基础与前沿科学研究院,电子科技大学) School of Physical Science and Technology, Beijing University of Posts and Telecommunications(物理科学与技术学院,北京邮电大学) Institute of Theoretical Physics, Chinese Academy of Sciences(理论物理研究所,中国科学院) School of Fundamental Physics and Mathematical Sciences, Hangzhou Institute for Advanced Study, UCAS(基础物理与数学科学学院,杭州先进研究院,UCAS) School of Physics, University of Electronic Science and Technology of China(物理学院,电子科技大学) Key Laboratory of Quantum Physics and Photonic Quantum Information, Ministry of Education, University of Electronic Science and Technology of China(量子物理与光量子信息重点实验室,教育部,电子科技大学) Non-classical Information Science Basic Discipline Research Center of Sichuan Province, University of Electronic Science and Technology of China(四川省非经典信息科学基础学科研究中心,电子科技大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对受阻自旋玻璃中玻尔兹曼分布采样效率低的问题,提出一种具有可解释稀疏注意力和自旋定制位置嵌入的物理启发式Transformer,利用FlashAttention实现并行祖先采样,在单GPU上实现前所未有的系统规模模拟,并解决现有方法在特定温度下的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17110 2026-06-24 cs.CR cs.LG 新提交 70%

Loss Landscape Poisoning: Targeted Extraction of Unseen Training Data from LLMs

损失景观投毒:从大语言模型中定向提取未见训练数据

Md Abdullah Al Mamun, Ngoc Phu Doan, Pedram Zaree, Nael Abu-Ghazaleh, Ihsen Alouani

机构 * Queen's University Belfast(女王大学贝尔法斯特) CSIT, Queen's University Belfast(女王大学贝尔法斯特计算机科学与技术研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出一种通过投毒重塑模型损失景观,迫使模型记忆目标数据并实现高成功率提取的攻击方法,在语言和视觉-语言模型上验证有效性,并发现差分隐私可防御但存在绕过攻击。

Comments Updated author order. No technical changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24226 2026-06-24 cs.CY cs.CR 新提交 67%

Inside Crypter-as-a-Service: An Ecosystem Analysis of the exploit.in Underground Forum Research Talks

加密器即服务:exploit.in 地下论坛的生态系统分析研究讲座

Mathieu Jeannot, Jean-Yves Marion, Manon Pamar, Maira Nassau, Pierre Marty, Romain Guittienne

专题命中 预训练与数据 :LLM(abstract,abstract_cn)

AI总结 通过分析俄语网络犯罪论坛 exploit.in 上的491个帖子和2949条回复,揭示了加密器即服务(CraaS)生态系统的特征,包括服务化运营、信任机制和分层市场结构。

Journal ref Workshop on Attackers and Cyber-Crime Operations, IEEE European Symposium on Security and Privacy, Jul 2026, Lisbon (Portugal), Portugal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24164 2026-06-24 eess.AS cs.AI cs.SD 新提交 57%

Breaking Shortcut Learning for Cross-Trial EEG-Guided Target Speech Extraction via Two-Stage Training

通过两阶段训练打破跨试验EEG引导目标语音提取中的捷径学习

Wonchul Shin, Inyong Choi, Kyogu Lee

机构 * Department of Intelligence and Information(智能信息系) Seoul National University(首尔国立大学) Department of Communication Sciences and Disorders(沟通科学与障碍系) University of Iowa(爱荷华大学) Interdisciplinary Program in Artificial Intelligence(人工智能交叉学科项目) Artificial Intelligence Institute(人工智能研究所)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 针对EEG引导目标语音提取中模型依赖试验特定结构导致泛化差的问题,提出两阶段框架TRUST-TSE,通过对比预训练和置信加权提取目标抑制捷径学习,在跨试验协议下优于端到端基线。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24855 2026-06-24 cs.AI 新提交 57%

OpenThoughts-Agent: Data Recipes for Agentic Models

OpenThoughts-Agent: 智能体模型的数据配方

Negin Raoof, Richard Zhuang, Marianna Nezhurina, Etash Guha, Atula Tejaswi, Ryan Marten, Charlie F. Ruan, Tyler Griggs, Alexander Glenn Shaw, Hritik Bansal, E. Kelly Buchanan, Artem Gazizov, Reinhard Heckel, Chinmay Hegde, Sankalp Jajee, Daanish Khazi, Emmanouil Koukoumidis, Xiangyi Li, Hange Liu, Shlok Natarajan, Harsh Raj, Nicholas Roberts, Ethan Shen, Nishad Singhi, Michael Siu, Ashima Suvarna, Hanwen Xing, Patrick Yubeaton, Robert Zhang, Leon Liangyu Chen, Xiaokun Chen, Steven Dillmann, Saadia Gabriel, Xunyi Jiang, Anurag Kashyap, Boxuan Li, Yein Park, Minh Pham, Sujay Sanghavi, Lin Shi, Ke Sun, Yixin Wang, Zhiwei Xu, Erica Zhang, Siyan Zhao, Wanjia Zhao, Jenia Jitsev, Alex Dimakis, Benjamin Feuer, Ludwig Schmidt

机构 * UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) JSC(于利希超级计算中心) LAION University of Texas at Austin(德克萨斯大学奥斯汀分校) Bespoke Labs Laude Institute UCLA(加州大学洛杉矶分校) Harvard University & Harvard Medical School(哈佛大学与哈佛医学院) TU Munich & Munich Center for Machine Learning(慕尼黑工业大学与慕尼黑机器学习中心) New York University(纽约大学) Medical University of South Carolina(南卡罗来纳医科大学) The LLM Data Company BenchFlow Independent Researcher(独立研究员) Northeastern University(东北大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Washington(华盛顿大学) TU Darmstadt(达姆施塔特工业大学) University of Southern California(南加州大学) UC San Diego(加州大学圣地亚哥分校) Amazon(亚马逊) Microsoft(微软) Korea University(高丽大学) Cornell Tech(康奈尔科技) University of Michigan(密歇根大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI

AI总结 提出全开放数据筛选流水线,通过100多次消融实验研究任务来源与多样性,构建10万样本训练集,在7个智能体基准上平均44.8%准确率,较最强开源模型提升3.9个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24696 2026-06-24 physics.flu-dyn cs.LG 新提交 57%

A Physics-Informed Fourier-Wavelet Transformer for Multiscale Computational Fluid Dynamics Surrogate Modeling

物理信息傅里叶-小波变换器用于多尺度计算流体动力学代理建模

Somyajit Chakraborty, Ming Pan, Xizhong Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 提出一种物理信息傅里叶-小波变换器,结合混合频谱编码与基于PDE残差的物理偏置自注意力,通过自监督预训练,在圆柱尾流和流固耦合基准上实现多尺度流场重建,精度优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23566 2026-06-24 cs.CL 新提交 57%

LangMAP: A Language-Adaptive Approach to Tokenization

LangMAP:一种语言自适应的分词方法

Clara Meister, Suchir Salhan, Andrzej Szablewski, Pietro Lesci, Paula Buttery, Tiago Pimentel

机构 * EPFL(瑞士联邦理工学院洛桑) University of Cambridge(剑桥大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 提出LangMAP分词方案,扩展UnigramLM到多语言设置,从共享词汇表生成语言特定分词,无需改变词汇表即可适配预训练模型,在14个分词器、9种自然语言和9种编程语言上提升了形态边界对齐和AST叶边界对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24774 2026-06-24 cs.CV 新提交 50%

Revealing Training Data Exposure in Vision Language Large Models via Parameter Gradients

揭示视觉语言大模型中的训练数据暴露:基于参数梯度的方法

Zhihao Zhu, Hongyi Tang, Yi Yang, Ahmed Abbasi

机构 * Department of Information Systems, Business Statistics and Operations Management (ISOM), Hong Kong University of Science and Technology, Hong Kong, China(信息系统、商业统计与运营管理系(ISOM),香港科技大学,香港,中国) Department of IT, Analytics, and Operations, University of Notre Dame, Notre Dame, Indiana, USA(信息技术、分析与运营系,诺丁汉大学,诺丁汉,印第安纳州,美国)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出梯度审计框架GradAudit,通过分析模型参数梯度特征检测训练数据,在医疗和通用数据集上显著优于现有方法,并揭示现有方法低估了未经授权数据使用程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24484 2026-06-24 cs.CV 新提交 50%

Advancing WordArt-Oriented Scene Text Recognition: Datasets and Methods

推进面向艺术字的场景文本识别:数据集与方法

Xingsong Ye, Yongkun Du, Jiaxin Zhang, Haojie Zhang, Chong Sun, Chen Li, Jing Lyu, Zhineng Chen

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI, Fudan University(复旦大学上海市多模态具身人工智能重点实验室) WeChat Vision, Tencent Inc.(腾讯微信视觉团队) South China University of Technology(华南理工大学)

专题命中 预训练与数据 :language model(abstract)

AI总结 针对艺术字场景文本识别(WATER)的挑战,构建了百万级合成数据集WATER-S,并提出支持任意形状输入和自回归解码的WATERec模型,在WordArt-Bench上达到90.40%准确率。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏