arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-15 至 2026-04-15 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 17 篇

2509.26404 2026-04-15 cs.CR cs.AI cs.CL 93%

SeedPrints: Fingerprints Can Even Tell Which Seed Your Large Language Model Was Trained From

SeedPrints: 指纹甚至能告诉你是哪种种子训练了你的大型语言模型

Yao Tong, Haonan Wang, Siquan Li, Kenji Kawaguchi, Tianyang Hu

机构 * National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);pretraining(abstract)

AI总结 本文提出SeedPrints方法,通过随机初始化偏倚实现LLM的内在指纹识别,解决了传统指纹方法在大规模预训练阶段可靠性不足的问题,实现了从初始化到全生命周期的身份验证。

Comments Accepted to ICLR 2026. The code repository linked on OpenReview is outdated; the latest code is available via the final arXiv version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12097 2026-04-15 cs.CL 92%

Temporal Flattening in LLM-Generated Text: Comparing Human and LLM Writing Trajectories

时间扁平化在LLM生成文本中的表现:比较人类与LLM写作轨迹

Zhanwei Cao, YeoJin Go, Yifan Hu, Shanu Sushmita

机构 * Northeastern University(东北大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究比较了人类和LLM在不同时间跨度内的写作轨迹,发现LLM生成文本存在时间扁平化现象,其词汇多样性更高但语义和认知情感变化更小,预测准确率高达94%。

Comments 25 pages, 6 figures. To appear in Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12350 2026-04-15 cs.LG cs.AI 91%

Scaffold-Conditioned Preference Triplets for Controllable Molecular Optimization with Large Language Models

基于 Scaffold 的偏好三元组用于大语言模型可控分子优化

Yi Xiong, Liang Xiong, Xiaohong Ji, Sen Yang, Zhifeng Gao, Huaimin Wang, Kele Xu

机构 * National Key Laboratory of Parallel and Distributed Processing(平行与分布式处理国家重点实验室) College of Computer Science and Technology(计算机科学与技术学院) National University of DefenseTechnology(国防科技大学) DP Technology(DP科技)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出 Scaffold-Conditioned Preference Triplets (SCPT) 方法,通过构建约束三元组实现可控分子优化,提升分子性质改进的同时保持 Scaffold 相似性,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11810 2026-04-15 cs.DB cs.AI 90%

GRACE: A Dynamic Coreset Selection Framework for Large Language Model Optimization

GRACE:一种用于大语言模型优化的动态聚类选择框架

Tianhao Tang, Haoyang Li, Lei Chen

机构 * CSE, HKUST(香港科技大学计算机科学与工程系) Computing, PolyU(PolyU计算机系) DSA, HKUST (GZ)&HKUST Guangzhou, China(香港科技大学(广州)数据科学与应用系)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 GRACE通过结合表示多样性与梯度重要性度量,动态构建和更新聚类,提升大语言模型训练效率和下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12540 2026-04-15 cs.CL cs.AI 90%

When Does Data Augmentation Help? Evaluating LLM and Back-Translation Methods for Hausa and Fongbe NLP

当数据增强有助于什么?评估LLM和回译方法在豪萨语和丰贝语NLP中的应用

Mahounan Pericles Adjovi, Roald Eiselen, Prasenjit Mitra

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校) Centre for Text Technology(文本技术中心) North-West University(北开普大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文评估了LLM生成和回译方法在豪萨语和丰贝语中的有效性,发现任务类型而非语言或LLM质量决定增强效果,不同任务对增强结果有不同影响。

Comments 13 pages, 6 tables; previously submitted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12223 2026-04-15 cs.CL cs.AI cs.LG 89%

LLM-Guided Semantic Bootstrapping for Interpretable Text Classification with Tsetlin Machines

基于Tsetlin机的语义引导语义引导可解释文本分类

Jiechao Gao, Rohan Kumar Yadav, Yuangang Li, Yuandong Pan, Jie Wang, Ying Liu, Michael Lepech

机构 * Stanford University(斯坦福大学) University of California, Irvine(加州大学伊文斯顿分校) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 预训练与数据 :LLM(title,summary_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种将LLM知识转化为符号形式的框架,通过三阶段课程生成子意图,利用非否定Tsetlin机提取高置信度语义线索,提升文本分类的可解释性和准确性。

Comments Accepted to Findings of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10471 2026-04-15 cond-mat.mtrl-sci cs.AI 83%

Siamese Foundation Models for Crystal Structure Prediction

孪生基础模型用于晶体结构预测

Liming Wu, Wenbing Huang, Rui Jiao, Jianxing Huang, Liwei Liu, Yipeng Zhou, Hao Sun, Yang Liu, Fuchun Sun, Yuxiang Ren, Jirong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) Advanced Computing and Storage Lab, Huawei Technologies(华为技术有限公司先进计算与存储实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部下一代智能搜索与推荐工程研究中心)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出Diffusion-based Crystal Omni框架,结合孪生生成模型和能量预测模型,提升晶体结构预测性能,并在实际超导材料中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12398 2026-04-15 eess.AS 82%

Contextual Biasing for ASR in Speech LLM with Common Word Cues and Bias Word Position Prediction

基于常见词提示和偏置词位置预测的语音LLM上下文偏置

Sashi Novitasari, Takashi Fukuda, Kurata Gakuto, George Saon

专题命中 预训练与数据 :LLM(title,title_cn)

AI总结 本文提出基于声音线索的上下文偏置方法,利用常见词发音相似性提升稀有词识别,通过多输出学习增强鲁棒性,实验显示在基准系统基础上错误率降低16.3%。

Comments Copyright 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12012 2026-04-15 cs.CV 82%

TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment

TIPSv2:通过增强的补丁-文本对齐推进视觉-语言预训练

Bingyi Cao, Koert Chen, Kevis-Kokitsi Maninis, Kaifeng Chen, Arjun Karpur, Ye Xia, Sahil Dua, Tanmaya Dabral, Guangxing Han, Bohyung Han, Joshua Ainslie, Alex Bewley, Mithun Jacob, René Wagner, Washington Ramos, Krzysztof Choromanski, Mojtaba Seyedhosseini, Howard Zhou, André Araujo

机构 * Google(谷歌) DeepMind(深度Mind)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract)

AI总结 本文提出TIPSv2,通过改进的预训练方法提升视觉-语言模型的补丁-文本对齐能力,实验表明其在多种任务和数据集上表现优异。

Comments CVPR2026 camera-ready + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12596 2026-04-15 cs.LG cs.AI 81%

KumoRFM-2: Scaling Foundation Models for Relational Learning

KumoRFM-2:关系学习的规模化基础模型

Valter Hudovernik, Federico López, Vid Kocijan, Akihiro Nitta, Jan Eric Lenssen, Jure Leskovec, Matthias Fey

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 KumoRFM-2是一种新型关系学习基础模型,支持上下文学习和微调,可处理多种预测任务。相比传统表格模型,其原生处理关系数据,无需手动展平表格或生成目标变量,且保持时间一致性。通过实验表明,KumoRFM-2在8%以内超越监督方法,且在冷启动和噪声数据下表现稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08977 2026-04-15 cs.LG cs.AI stat.ML 81%

Simulation as Supervision: Mechanistic Pretraining for Scientific Discovery

模拟作为监督:用于科学发现的机理预训练

Carson Dudley, Reiden Magdaleno, Christopher Harding, Marisa Eisenberg

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出SGNN框架,通过机理模拟作为训练数据提升科学推断的鲁棒性,展示了其在多个学科中的预测优势和对模型不规范的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12105 2026-04-15 cs.SE 78%

Automated BPMN Model Generation from Textual Process Descriptions: A Multi-Stage LLM-Driven Approach

从文本过程描述自动生成BPMN模型:一种多阶段大语言模型驱动的方法

Ion Matei, Maksym Zhenirovskyy, Praveen Kumar Menaka Sekar, Hon Yung Wong

专题命中 预训练与数据 :LLM(title,abstract)

AI总结 本文提出一种多阶段大语言模型驱动的方法,通过多语言BPMN XML文件翻译、验证和修复生成可靠数据,从而自动生成可执行的BPMN 2.0模型,实现高相似度的重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12946 2026-04-15 cs.LG 74%

Parcae: Scaling Laws For Stable Looped Language Models

Parcae:稳定循环语言模型的扩展定律

Hayden Prairie, Zachary Novack, Taylor Berg-Kirkpatrick, Daniel Y. Fu

机构 * University of California, San Diego(加州大学圣地亚哥分校) Together AI

专题命中 预训练与数据 :language model(title);分类 cs.LG

AI总结 本文提出Parcae,一种稳定的循环架构,通过限制注入参数的谱范数来解决现有循环架构的不稳定性问题,实验表明其在验证 perplexity 和测试性能上均优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12335 2026-04-15 cs.CV cs.LG 70%

All in One: A Unified Synthetic Data Pipeline for Multimodal Video Understanding

一站式:一个多模态视频理解统一合成数据管道

Tanzila Rahman, Renjie Liao, Leonid Sigal

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(向量人工智能研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出统一合成数据管道,用于生成多模态视频数据,支持多种任务格式,提升模型推理能力,并在视频物体计数、视觉问答和分割任务中验证了其有效性。

Comments 8 Pages, 4 Tables, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12905 2026-04-15 cs.RO cs.LG 57%

Frequency-aware Decomposition Learning for Sensorless Wrench Forecasting on a Vibration-rich Hydraulic Manipulator

面向频率的分解学习用于振动丰富的液压机械臂无传感器力预测

Hyeonbeen Lee, Min-Jae Jung, Tae-Kyeong Yeu, Jong-Boo Han, Daegil Park, Jin-Gyun Kim

机构 * Department of Mechanical Engineering, Kyung Hee University(Kyung Hee 大学机械工程系) Korea Research Institute of Ships and Ocean Engineering(韩国船舶海洋研究院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出频率感知分解网络(FDN)用于预测振动丰富的力,通过自适应增强输入频谱和频率带先验,提升高频力预测性能,实验表明FDN在高频段优于基线方法,在低频段表现稳健,且迁移学习进一步提升性能。

Comments 11 pages, 6 figures, submitted to IEEE/ASME Transactions on Mechatronics

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22220 2026-04-15 cs.CL cs.SD 57%

StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs

StableToken:一种抗噪声的语义语音分词器用于鲁棒的语音大语言模型

Yuhan Song, Linhao Zhang, Chuhan Wu, Aiwei Liu, Wei Jia, Houfeng Wang, Xiao Zhou

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Basic Model Technology Center, WeChat AI, Tencent Inc.(微信AI基础模型技术中心,腾讯公司)

专题命中 预训练与数据 :LLM(abstract_cn);分类 cs.CL

AI总结 本文提出StableToken,通过共识机制提升语音分词器的稳定性,减少噪声下的单位编辑距离,提升语音大语言模型的鲁棒性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12342 2026-04-15 cs.CR cs.CV 50%

CoLA: A Choice Leakage Attack Framework to Expose Privacy Risks in Subset Training

CoLA:一种用于揭示子集训练中隐私风险的泄露攻击框架

Qi Li, Cheng-Long Wang, Yinzhi Cao, Di Wang

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹大学科学与技术学院) Provable Responsible AI and Data Analytics Lab(可证责任AI与数据分析实验室) National University of Singapore(新加坡国立大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 预训练与数据 :language model(abstract)

AI总结 本文提出CoLA框架,揭示子集训练中隐私泄露问题,通过两种攻击场景分析训练成员和选择参与的隐私风险,扩展隐私范围至数据-模型供应链。

详情

展开后加载摘要…

URL PDF HTML 收藏