arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-15 至 2026-05-15 共收录 26 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 26 篇

2510.25356 2026-05-15 cs.CL 93%

Prompting from the bench: Large-scale pretraining is not sufficient to prepare LLMs for ordinary meaning analysis

从bench出发的提示:大规模预训练不足以使LLM为普通意义分析做准备

Abhishek Purushothama, Junghyun Min, Brandon Waldon, Nathan Schneider

机构 * Georgetown University(乔治城大学) University of South Carolina(南卡罗来纳大学)

专题命中 预训练与数据 :LLM(title_cn,summary_cn);pretraining(title);prompting(title);large language model(abstract)

AI总结 本文通过实验证明,LLM在法律文本的普通意义分析中存在鲁棒性不足的问题,质疑其在实际应用中的有效性。

Comments Accepted FAccT 2026; 29 pages, 14 tables, 7 figures. Previous title - Not ready for the bench: LLM legal interpretation is unstable and out of step with human judgments; NLLPW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18903 2026-05-15 cs.LG cs.AI cs.CL 92%

How Learning Rate Decay Wastes Your Best Data in Curriculum-Based LLM Pretraining

学习率衰减如何浪费你在基于课程的学习中的最佳数据

Kairong Luo, Zhenbo Sun, Haodong Wen, Xinyu Shi, Jiarui Cui, Chenyi Dang, Kaifeng Lyu, Wenguang Chen

机构 * Tsinghua University(清华大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文指出学习率衰减与课程式预训练数据排序的不兼容性限制了预训练效果,通过调整衰减策略和模型平均可提升1.64%的基准表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14786 2026-05-15 cs.CR cs.AI cs.HC cs.LG 90%

Known By Their Actions: Fingerprinting LLM Browser Agents via UI Traces

以行为识别LLM浏览器代理:通过UI轨迹指纹化

William Lugoloobi, Samuelle Marro, Jabez Magomere, Joss Wright, Chris Russell

机构 * Oxford Internet Institute, University of Oxford(牛津互联网研究所,牛津大学) Department of Engineering Science, University of Oxford(工程科学系,牛津大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 研究通过被动JavaScript跟踪器分析LLM代理的行为和交互时间,发现可识别底层模型,F1达96%,并展示分类器在不同模型上的泛化能力及早期身份推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14544 2026-05-15 cs.AI 89%

Complacent, Not Sycophantic: Reframing Large Language Models and Designing AI Literacy for Complacent Machines

自满而非阿谀:重新界定大语言模型并为自满机器设计AI素养

Federico Germani, Giovanni Spitale

机构 * Institute for Data Science and Artificial Intelligence, Boğaziçi University(数据科学与人工智能研究所,博科尼大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 本文重新界定大语言模型的行为特性,指出其自满倾向而非阿谀,强调需通过AI素养教育对抗确认偏误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14062 2026-05-15 cs.AI cs.CL 89%

Know When To Fold 'Em: Token-Efficient LLM Synthetic Data Generation via Multi-Stage In-Flight Rejection

知何时该收手:通过多阶段飞行拒绝实现令牌高效的大语言模型合成数据生成

Anjir Ahmed Chowdhury, Syed Zawad, Feng Yan

机构 * Department of Computer Science University of Houston(计算机科学系休斯顿大学) IBM Research(IBM研究院)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出MSIFR框架,通过在生成过程中早期检测低质量轨迹以减少令牌浪费,提升合成数据生成效率,实验表明其在多个模型和基准上显著降低令牌消耗并保持准确性。

Comments 17 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14747 2026-05-15 cs.CL cs.AI cs.CV cs.LG 85%

Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining

Video2GUI:合成大规模交互轨迹用于通用GUI代理预训练

Weimin Xiong, Shuhao Gu, Bowen Ye, Zihao Yue, Lei Li, Feifan Song, Sujian Li, Hao Tian

机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机科学学院,北京大学) The University of Hong Kong(香港大学) Renmin University of China(中国人民大学)

专题命中 预训练与数据 :pretraining(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Video2GUI框架,通过自动提取互联网视频中的GUI交互轨迹,生成大规模数据集WildGUI,提升了GUI代理的泛化能力。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15179 2026-05-15 cs.LG cs.AI physics.comp-ph 84%

Eradicating Negative Transfer in Multi-Physics Foundation Models via Sparse Mixture-of-Experts Routing

通过稀疏混合专家路由消除多物理基础模型中的负迁移

Ellwil Sharma, Arastu Sharma

机构 * Shodh AI

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Shodh-MoE模型,通过稀疏激活的潜在变换器架构解决多物理传输中的负迁移问题,实现精确质量守恒和领域自适应路由。

Comments 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14907 2026-05-15 cs.AI 83%

KGPFN: Unlocking the Potential of Knowledge Graph Foundation Model via In-Context Learning

KGPFN:通过上下文学习解锁知识图谱基础模型的潜力

Yisen Gao, Jiaxin Bai, Haoyu Huang, Zhongwei Xie, Yufei Li, Hong Ting Tsang, Sirui Han, Yangqiu Song

机构 * Department of Computer Science and Engineering, HKUST, Hong Kong, China(香港科技大学计算机科学与工程系) Department of Computer Science and Engineering, HKBU, Hong Kong, China(香港城市大学计算机科学与工程系)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 KGPFN通过结合先验数据拟合网络与上下文学习,统一了可转移关系规律与推理时的上下文学习,有效提升知识图谱推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11871 2026-05-15 cs.CL cs.LG 79%

DMAP: A Distribution Map for Text

DMAP:文本的分布图

Tom Kempton, Julia Rozanova, Parameswaran Kamalaruban, Maeve Madigan, Karolina Wresilo, Yoann L. Launay, David Sutton, Stuart Burrell

机构 * University of Manchester, UK(曼彻斯特大学,英国) Featurespace, a Visa Solution(Visa解决方案的Featurespace) Risk and Security AI Lab, Visa Inc., UK(Visa公司的风险与安全AI实验室,英国) University of Cambridge, UK(剑桥大学,英国)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 DMAP通过语言模型将文本映射到单位区间内的样本集,编码排名和概率信息,用于高效分析文本并支持多种应用,包括生成参数验证和机器生成文本检测。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13789 2026-05-15 cs.LG cs.AI q-bio.BM 73%

ENSEMBITS: an alphabet of protein conformational ensembles

ENSEMBITS: 蛋白质构象集合的字母表

Kaiwen Shi, Carlos Oliver

机构 * Department of Computer Science, Vanderbilt University(范德比尔特大学计算机科学系) Center for AI in Protein Dynamics, Vanderbilt University(蛋白质动力学中的人工智能中心,范德比尔特大学) Department of Molecular Physiology and Biophysics, Vanderbilt University(分子生理学与生物物理学系,范德比尔特大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Ensembits,首个蛋白质构象集合分词器,通过残差VQ-VAE训练,在动态数据稀疏性挑战中表现优异,提升RMSF预测及多种结构预测任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08715 2026-05-15 cs.CL cs.AI cs.MA 73%

AgentForesight: Online Auditing for Early Failure Prediction in Multi-Agent Systems

AgentForesight:多智能体系统中在线审计的早期故障预测

Boxuan Zhang, Jianing Zhu, Zeru Shi, Dongfang Liu, Ruixiang Tang

机构 * Rutgers University(新泽西罗格拉大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Purdue University(普渡大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出AgentForesight框架,通过在线审计实现多智能体系统中早期故障预测,利用AFTraj-2K数据集训练出AgentForesight-7B模型,在性能和定位精度上优于GPT-4.1等模型。

Comments 33 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16060 2026-05-15 cs.LG cs.AI eess.SP 73%

Tokenizing Single-Channel EEG with Time-Frequency Motif Learning

使用时间-频率动机学习对单通道EEG进行分词

Jathurshan Pradeepkumar, Xihao Piao, Zheng Chen, Jimeng Sun

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) SANKEN, Osaka University(大阪大学SANKEN)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TFM-Tokenizer,通过学习单通道EEG信号的时间-频率动机词汇,提升EEG分词准确性,实验显示在多个基准上性能提升达11%,且适用于多种基础模型,具备良好的通用性和可扩展性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00270 2026-05-15 cs.LG cs.AI stat.ML 73%

DUET: Optimizing Training Data Mixtures via Feedback from Unseen Evaluation Tasks

DUET:通过未见评估任务的反馈优化训练数据混合

Zhiliang Chen, Gregory Kang Ruey Lau, Chuan-Sheng Foo, Bryan Kian Hsiang Low

机构 * National University of Singapore(新加坡国立大学) Agency for Research, Science, Technology and Research (A*STAR)(研究、科技与研发机构)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出DUET算法,通过结合影响函数与贝叶斯优化,利用未见评估任务的反馈优化训练数据混合,理论证明其能收敛至最优混合,实验显示优于现有方法。

Comments Accepted to ICLR 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14069 2026-05-15 cs.LG 70%

SurF: A Generative Model for Multivariate Irregular Time Series Forecasting

SurF:一种用于多变量不规则时间序列生成模型

Mohammad R. Rezaei, Tejas Balaji, Rahul G. Krishnan

机构 * Department of Computer Science(计算机科学系) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 SurF提出了一种生成模型,利用时间重标定定理将事件序列转换为独立同分布的单位速率指数噪声,支持跨异构事件流数据集训练,并在六个真实世界基准上取得最佳时间RMSE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14070 2026-05-15 cs.NI 67%

WirelessSenseLLM: Zero-Shot Human Activity Understanding by Bridging Wireless Signals and Human Language

WirelessSenseLLM: 通过连接无线信号与人类语言实现零样本人体活动理解

Mahmuda Keya, Sneh Pillai, Jiawei Yuan, Kai Zeng, Long Jiao

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 WirelessSenseLLM通过引入CSI到语言适配器和跨模态投影机制,利用大语言模型实现从未分割的Wi-Fi CSI信号中零样本人体活动理解,提升了动作识别和语言推理性能。

Comments Accepted at IEEE SECON 2026. 9 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11845 2026-05-15 cs.SD cs.AI cs.IR cs.LG 62%

AVEX: What Matters for Animal Vocalization Encoding

AVEX:动物发声编码中什么因素至关重要

Marius Miron, David Robinson, Milad Alizadeh, Ellen Gilsenan-McMahon, Gagan Narula, Emmanuel Chemla, Maddie Cusimano, Felix Effenberger, Masato Hagiwara, Benjamin Hoffman, Sara Keen, Diane Kim, Jane Lawton, Jen-Yu Liu, Aza Raskin, Olivier Pietquin, Matthieu Geist

机构 * Earth Species Project(地球物种项目)

专题命中 预训练与数据 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文通过大规模实验研究,探讨了生物声学编码中训练数据多样性、模型架构及评估任务的重要性,发现自监督预训练结合监督后训练在多种任务中表现最佳。

Comments In The Fourteenth International Conference on Learning Representations 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14497 2026-05-15 cs.LG cs.AI 62%

ROAD: Adaptive Data Mixing for Offline-to-Online Reinforcement Learning via Bi-Level Optimization

ROAD: 通过双层优化实现的自适应数据混合用于离线到在线强化学习

Letian Yang, Xu Liu, Yiqiang Lu, Jian Liu, Weiqiang Wang, Shuai Li

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ROAD框架,通过双层优化解决离线数据与在线策略间分布偏移问题,提升稳定性和性能。

Comments 20 pages, 9 figures, 7 tables. Accepted to IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02004 2026-05-15 cs.AI 57%

Personalized Digital Health Modeling with Adaptive Support Users

具有自适应支持用户的个性化数字健康建模

Zhongqi Yang, Mahkameh Rasouli, Neda Mohseni, Yong Huang, Iman Azimi, Amir M. Rahmani

机构 * Department of Computer Science, University of California, Irvine(加州大学尔湾分校计算机科学系) Thrive AI Health Sue & Bill Gross School of Nursing , University of California, Irvine(加州大学尔湾分校苏和比尔·格罗斯护理学院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 本文提出一种统一的个性化框架,通过自适应加权支持用户训练个性化模型,结合相似和不同用户的信息,提升模型泛化能力与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14546 2026-05-15 cs.LG 57%

Discovering Physical Directions in Weight Space: Composing Neural PDE Experts

在权重空间中发现物理方向:组合神经PDE专家

Pengkai Wang, Pengwei Liu, Yuanyi Wang, Guanyu Chen, Xingyu Ren, Xiaolong Li, Zhongkai Hao, Yuting Kong, Qixin Zhang, Dong Ni

机构 * The Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文研究了神经PDE专家在连续物理家族中多模式微调后的权重空间更新性质,提出CCM方法通过物理方向整合专家模型,提升跨物理域的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14427 2026-05-15 cs.CL cs.SD 57%

A Calculus-Based Framework for Determining Vocabulary Size in End-to-End ASR

基于微积分的端到端语音识别中词汇量确定框架

Sunil Kumar Kopparapu

机构 * TCS Research(TCS研究)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 本文提出基于微积分的词汇量确定方法,通过曲线拟合和导数测试优化端到端ASR的词汇量参数,提升识别性能。

Comments 8 pages, is an extension of the paper S. K. Kopparapu and A. Panda, A cost minimization approach to fix the vocabulary size in a tokenizer for an end-to-end ASR system, in Proceedings of the 2024 International Conference on Pattern Recognition, Kolkata, India, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14352 2026-05-15 cs.CL 57%

Ideology Prediction of German Political Texts

德国政治文本的意识形态预测

Sinclair Schneider, Florian Steuber, Joao A. G. Schneider, Gabi Dreo Rodosek

机构 * Bundestag(议会) Wahl-O-Mat(选举工具) German Media Datasets(德国媒体数据集)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.CL

AI总结 本文提出基于transformer的模型,用于在连续左到右光谱上预测文本的政治倾向,通过不同语料库训练,验证了模型在不同领域中的表现,展示了transformer在识别德国新闻政治偏见方面的有效性。

Comments This paper has been accepted for the upcoming 20th International AAAI Conference on Web and Social Media (ICWSM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14218 2026-05-15 cs.AI physics.soc-ph 57%

Fusion-fission forecasts when AI will shift to undesirable behavior

人工智能行为从有益转向有害的融合-分裂预测

Neil F. Johnson, Frank Yingjie Huo

机构 * Physics Department, The George Washington University(乔治华盛顿大学物理系)

专题命中 预训练与数据 :post-training(abstract);分类 cs.AI

AI总结 本文提出一种基于群体动力学的预测方法,可预测人工智能行为从有益转向有害的转变,通过数学推导和六种独立测试验证其有效性,适用于多种AI架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18820 2026-05-15 physics.flu-dyn cs.LG 57%

Unsupervised simulation of incompressible flows with physics- and equality- constrained artificial neural networks

无监督模拟不可压缩流体的物理约束和等式约束人工神经网络

Qifeng Hu, Inanc Senocak

机构 * Department of Mechanical Engineering and Materials Science, University of Pittsburgh, Pittsburgh, PA 15261, USA(机械工程与材料科学系,匹兹堡大学,匹兹堡,PA 15261,USA)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出基于物理约束和等式约束的人工神经网络框架,用于无监督模拟不可压缩流体,解决了高雷诺数流体模拟中的挑战,通过压力-泊松方程优化和自适应熵粘度稳定训练。

Comments 33 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14031 2026-05-15 cs.SD cs.CV cs.LG 57%

Masked Autoencoders with Limited Data: Does It Work? A Fine-Grained Bioacoustics Case Study

受限数据下的掩码自编码器:它有效吗?一项细粒度生物声学案例研究

Wuao Liu, Mustafa Chasmai, Subhransu Maji, Grant Van Horn

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文研究了在有限数据下使用掩码自编码器进行生物声学分类的效果,发现预训练数据规模在中等规模细粒度任务中起主导作用,而领域特定数据的额外预训练可能降低性能。

Comments Workshop on Fine-Grained Visual Categorization (FGVC) at CVPR 2026. 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15167 2026-05-15 cs.CV 50%

Does Synthetic Layered Design Data Benefit Layered Design Decomposition?

合成分层设计数据是否有助于分层设计分解?

Kam Man Wu, Haolin Yang, Qingyu Chen, Yihu Tang, Jingye Chen, Qifeng Chen

机构 * HKUST(香港理工大学) Webank(网商银行)

专题命中 预训练与数据 :language model(abstract)

AI总结 本文研究合成分层数据对图形设计分解的影响,发现纯合成数据能有效替代传统方法,且训练数据规模增加时性能提升,但5万样本后趋于饱和。

Comments 22 pages, 10 figures. Code is available at https://github.com/YangHaolin0526/SynLayers

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14591 2026-05-15 cs.CR 50%

Privacy Auditing with Zero (0) Training Run

零次训练的隐私审计

Tudor Cebere, Mathieu Even, Linus Bleistein, Aurélien Bellet

专题命中 预训练与数据 :foundation model(abstract)

AI总结 本文提出零次训练隐私审计方法,通过固定数据集评估模型隐私参数,解决传统方法需多次重训练或数据随机化的难题,提供有效的隐私审计框架。

详情

展开后加载摘要…

URL PDF HTML 收藏