arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-04 至 2026-08-04 共收录 444 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 31 篇

2608.01388 2026-08-04 cs.CR cs.AI cs.LG 新提交 90%

Why Formal Monitors Fail: Attack Distribution Entropy as a Coverage Bound for LTL-Based LLM Agent Safety

形式化监视器为何失效:攻击分布熵作为基于LTL的LLM智能体安全的覆盖边界

Ruiyang Zhang

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 该研究揭示基于LTL的LLM智能体安全监视器覆盖差异源于攻击分布熵,提出熵-覆盖边界并验证,引入部署前熵测试,可预测监视器覆盖并支持架构感知选择。

Comments 6 pages, 1 figure. Accepted at the 13th IEEE International Conference on Intelligent Systems (IS'26), Varna, Bulgaria, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00432 2026-08-04 cs.CL 新提交 90%

Deep Research Pretraining via Predictive Navigation

基于预测导航的深度研究预训练

Jiang Zhou, Zhiyuan Fan, Xing Wu, Tinghao Yu, Feng Zhang, Lilin Wang

机构 * Tencent(腾讯) Hunyuan Team(混元团队)

专题命中 预训练与数据 :pretraining(title,summary_cn);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 提出Deep Research Pretraining(DRP)离线框架,在学术引用图和维基百科超链接上预训练Qwen3-14B-Base模型,可提升智能体在多个基准任务上的表现,是轨迹智能体训练的补充方法。

Comments working in progress; correspondence to {ucaswu,maxwellyu}@tencent.com or wuxing@iie.ac.cn

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00661 2026-08-04 cs.SE 新提交 89%

Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code

实践中不可靠?对大语言模型生成代码中的错误的综合研究

Rodrigo Pato Nogueira, Marco Vieira, João R. Campos

专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究分析7款LLMs生成的86726个含错代码样本,对比不同模型、语言的错误模式,发现大型模型也常犯简单错误,代码常省略关键安全检查,为提升LLM生成代码可靠性提供依据。

Comments Accepted for publication in the 37th IEEE International Symposium on Software Reliability Engineering (ISSRE) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00013 2026-08-04 cs.CL cs.AI cs.CV 新提交 87%

What Transfers from Text to Vision? Capability Scaling Laws and Transfer Dynamics for VLMs

从文本到视觉的可迁移性:视觉语言模型(VLM)的能力缩放定律与迁移动态

Ziran Li, Qiang Wang, Zhengyu Chen, Shanglin Lei, Borun Chen, Jingang Wang, Xunliang Cai

机构 * Meituan(美团) Tsinghua University(清华大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出首个跨家族的能力驱动多模态缩放定律,可通过LLM文本能力预测VLM性能,将主干选择从经验搜索转为定量决策,还揭示了LLM作为VLM主干的相关见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00114 2026-08-04 eess.SP cs.AI 新提交 83%

EEG-JEPA: Structured Latent Prediction for EEG Foundation Models

EEG-JEPA:用于脑电基础模型的结构化隐变量预测

Jinhao Li, Zhiyuan Ma, Xueqiao Han, Zhongye Xia, Xinche Zhang, Shanghong Xie, Yixuan Liu, Yongjian Li, Runmin Gan, Tianlin Huo, Sen Song

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本研究提出EEG-JEPA结构化隐变量预测框架,通过优化目标设计提升EEG基础模型性能,在EEG-FM-Bench等基准上实现了14任务、9任务的平衡准确率提升,为EEG基础建模提供了新方案。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02252 2026-08-04 cs.CV cs.AI 新提交 83%

HarMoE: Multi-Source Chest Radiograph Pretraining with Dataset-Disentangled Experts

HarMoE:基于数据集解耦专家的多源胸部X射线预训练

Haozhe Luo, Ziyu Zhou, Shelley Zixin Shu, Mauricio Reyes

机构 * University of Bern(伯尔尼大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出HarMoE框架,通过解耦数据集专家从异构胸部X射线数据集学习,提升了放射学视觉-语言模型的零样本分类、分布外迁移等性能,相关代码与87.3万份数据集将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01898 2026-08-04 cs.LG 新提交 83%

Understanding and Correcting Low-Frequency Bias in EEG Foundation Model

脑电(EEG)基础模型中低频偏差的理解与修正

Junjie Yu, Zihan Deng, Jianyu Zhang, Junrong Mu, Jiahui An, Wenxiao Ma, Ziling Lu, Yue Wang, Yan Zhu, Kexin Lou, Quanying Liu

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 针对EEG基础模型存在的低频偏差问题,提出频率平衡掩码自编码框架FAME,在OmniEEG-Bench的41项下游任务中24项达到SOTA,凸显平衡频谱监督的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02573 2026-08-04 astro-ph.IM 新提交 82%

Foundation Models for Astrophysics

天体物理学领域的基础模型

Xiaosheng Zhao, Yuan-Sen Ting

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本章介绍面向天文领域的基础模型,阐述其核心是可迁移表示,指出当前天文领域此类模型的可迁移性验证案例较少,未来需进一步探索提升路径。

Comments Invited chapter for the edited book "Machine Learning Techniques for Astrophysics and Cosmology" (Eds. Cosimo Bambi, Vinay Kashyap, Swarnim Shashank, Naoki Yoshida, Springer Singapore, expected in 2026). Submitted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02359 2026-08-04 cs.CL 新提交 81%

Fast and Accurate Quotation Attribution in Literary Texts

文学文本中快速准确的引语归属

Gaspard Michel, Hugo Attali, Elena V. Epure

机构 * Deezer Research(Deezer研究院) LORIA(洛里亚实验室) Université Sorbonne Paris Nord(巴黎北索邦大学) CNRS(法国国家科学研究中心) LIPN(巴黎第十三大学计算机科学实验室) IDIAP(IDIAP研究所)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究针对文学文本引语归属的效率与精度难题,提出基于编码器的联合评分方案,在Project Dialogism小说语料库上实现94.5%准确率,速度远超同类方法,且发布了修改后的ModernBookNLP工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01158 2026-08-04 cs.CL 新提交 81%

PlainMedScale: A Corpus of Multi-Level Simplified Medical Texts in German and English

PlainMedScale:德语和英语的多级别简化医学文本语料库

Bruno Brocai, Ilaria Papagno, Mayumi Ohta

机构 * Heidelberg University(海德堡大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本研究构建了德语和英语的多级别简化医学语料库PlainMedScale,开展试点研究发现现有可读性指标无法跨层级泛化、SOTA开放权重LLM的Plain Language提示仍保留部分输入难度,并公开了代码与数据。

Comments accepted at KONVENS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00383 2026-08-04 cs.LO cs.AI cs.LG 新提交 81%

Pretrain on Small Synthetic Data, Scale Large for Free: Symmetry-Aware Foundation Model for Logic Rule Induction

在小型合成数据上预训练,免费实现大规模扩展:用于逻辑规则归纳的感知对称性基础模型

Yin Jun Phua

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出一种感知对称性的逻辑规则归纳基础模型,通过构造强制对称性将小型合成数据预训练的Neural Rule Inducer扩展至更大模式,提升了规则的可迁移性与保真度。

Comments Accepted at 20th Conference on Neurosymbolic Learning and Reasoning (NeSy 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00135 2026-08-04 cs.LG cs.CV 新提交 79%

Rethinking Pretraining for Specialized Design Data: Evidence from the JONES-19 Cultural Design Dataset

重新思考针对专业设计数据的预训练:来自JONES-19文化设计数据集的证据

Alexandros Haridis, Charles Zhou

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 该研究以JONES-19文化设计数据集为对象,对比两种CNN训练策略,发现小型高质量设计数据集结合多裁剪采样,可替代大规模通用预训练,为专业设计领域的ML研究提供新思路。

Comments 2026 Design Computing and Cognition Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00096 2026-08-04 cs.CV cs.AI 新提交 79%

Logographic Character Visual Pretraining via Semantic-based Contrastive Learning

基于语义对比学习的表意文字视觉预训练

Daqian Shi, Wei Cao, Xiaoyu Zheng, Lida Shi, Xiaolei Diao, Cedric M John

机构 * Queen Mary University of London(伦敦玛丽女王大学) Jilin University(吉林大学) King’s College London(伦敦国王学院) University College London(伦敦大学学院)

专题命中 预训练与数据 :pretraining(title);language model(abstract);分类 cs.AI

AI总结 针对表意文字数据集不平衡问题,提出结合视觉与上下文语义的多模态学习方法,通过语义对比预训练提升字符识别性能,在多数据集及下游任务上优于现有最优方法。

Comments ACM MM 2026 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01620 2026-08-04 eess.SP 新提交 78%

Smartwatch Photoplethysmography-Derived Heart Age via ECG-Guided Cross-Modal Pretraining as a Digital Biomarker of Vascular Aging

通过心电引导跨模态预训练从智能手表光体积描记术衍生的心龄作为血管衰老的数字生物标志物

Donglin Xie, Xueying Gui, Yutian Zhu, Feng Xu, Guangkun Nie, Chenyang Xu, Jun Li, Shuailong Tang, Xiaoyu Li, Qi Xie, Yelei Li, Shenda Hong

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本研究开发心电引导跨模态框架,利用智能手表PPG衍生的心龄差作为数字生物标志物,证实其与动脉僵硬度、高血压显著相关,可用于血管衰老评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01535 2026-08-04 cs.CV cs.RO 新提交 78%

STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision

STAR-VLM:基于汽车雷达监督的时空视觉语言模型,用于运动与速度估计

Pou-Chun Kung, Aryaman Rao, Utkrisht Sahai, Hemanth Murali, Yi Liu, Rui-Yu Lin, Katherine A. Skinner

机构 * University of Michigan(密歇根大学)

专题命中 预训练与数据 :language model(title,abstract)

AI总结 该研究提出STAR-VLM框架,利用汽车雷达监督提升时空视觉语言模型的运动推理与度量速度估计能力,在驾驶场景相关任务上实现了优于特定任务方法的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00231 2026-08-04 cs.CV 新提交 78%

Learning How Much, Not Just What: Cross-Patient Burden Order for CT Vision-Language Pretraining

学习多少,而非仅学习是什么:用于CT视觉-语言预训练的跨患者负担顺序

Guoliang You, Haifan Gong, Xiaomeng Chu

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本研究提出Spectrum框架,利用跨患者弱负担顺序补充解剖感知对应关系,无需纵向数据即可学习负担感知CT表示,在CT-RATE和RAD-ChestCT数据集上取得良好性能。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02084 2026-08-04 cs.SE cs.CR cs.LG 新提交 74%

Pretraining on Call Graphs: When Binary Analysis Tasks Profit From Context

在调用图上进行预训练:当二进制分析任务从上下文获益时

Samuel Valenzuela, Johannes Kinder

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 本研究探究调用图对二进制分析任务的影响,发现结合过程间上下文可提升嵌入鲁棒性但未必泛化到下游任务,且对命名空间相关函数更有益。

Comments 12 pages, 5 figures. Accepted at ICPC '26

Journal ref Proceedings of the 34th IEEE/ACM International Conference on Program Comprehension, pp. 14-25, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01881 2026-08-04 cs.MM cs.AI 新提交 74%

Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models

聆听、调用与理解:面向大型音频语言模型的技能调用多模态智能体

Yuwen Wang, Tian-Hao Zhang, Minghao Cai, Yilin Ren, Ziyang Jiang, Xin Wang, Zhichao Wang, Pan Zhou, Kun Zhan, Xinyuan Qian

专题命中 预训练与数据 :language model(title);分类 cs.AI

AI总结 本研究针对工具交互型音频推理问题,开发了SpeechAgent-R智能体,构建了HIU-Corpus与HIU-Bench,经实验验证其在分布内外任务上均较基础模型有显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01153 2026-08-04 cs.CL 新提交 74%

Morphology Aware Reversible Semantic Tokenization and Hierarchical Word Composition for Tamil Language Models

面向泰米尔语语言模型的形态学感知可逆语义分词与分层词组合

Anand Murugan

专题命中 预训练与数据 :language model(title);分类 cs.CL

AI总结 该研究针对泰米尔语,提出结合ThamizhiMorph的形态系统与分层词组合方法,在固定小模型预算下提升翻译性能,同时大幅降低序列长度与推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00985 2026-08-04 cs.LG cs.AI q-bio.GN 新提交 73%

Beyond Gene Reconstruction: Learning Cell Representations through Complementary Transcriptomic Views

超越基因重构:通过互补转录组视图学习细胞表示

Jiaqi Xiong, Yuntao hu, Yu Zheng, Yifei Shi, Xinyue Guo, Jiaxin Qi

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对基因重构预训练模型未直接优化全细胞表示的问题,提出含三种适配的互补转录组视图对比预训练框架,在细胞类型注释和基因调控网络推断任务中表现出竞争力。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01005 2026-08-04 cs.LG cs.AI cs.IT math.IT 新提交 73%

Hierarchical Solomonoff Induction: An Unbounded Machine Learning Model

分层所罗门诺夫归纳法:一种无界机器学习模型

Nathan Young

机构 * University of Auckland(奥克兰大学) Strong AI Lab(强人工智能实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出分层所罗门诺夫归纳法(HSI),将德菲涅蒂定理应用于所罗门诺夫归纳法(SolInd),证明HSI等价于SolInd,其超额误差受生成器复杂度约束,随数据集增长收敛至0,是适用于给定数据集的无界序列预测理想模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00705 2026-08-04 cs.IR cs.CL 新提交 70%

A Triple-Robustness Analysis of Retrieval-Augmented Generation for Multi-Hop Requirements Traceability

检索增强生成在多跳需求可追溯性中的三重鲁棒性分析

Meftun Akarsu, Burak Özdemir, Doğancan Büyükçolak, Recep Kaan Karaman

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文针对多跳需求可追溯性,开展三重鲁棒性分析,对比不同RAG架构、嵌入器等的表现,发现现有结论分歧的原因,提出需按该鲁棒性标准验证RAG架构主张。

Comments 6 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00452 2026-08-04 cs.IR cs.AI 新提交 70%

CeQe: Grounding Lexical Retrieval in Semantic Evidence

CeQe:在语义证据中实现词汇检索

Adam Kahirov, Umesh Deshpande, Swaminathan Sundararaman

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对BM25的语义词汇鸿沟问题,本文提出CE-QE方法,利用交叉编码器的语义检索结果扩展BM25查询,在多个BEIR数据集上显著提升检索性能且不修改底层索引。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01449 2026-08-04 cs.DC 新提交 67%

NIXT: A NCCL Inspector Exporter Tool for Observability of Collective Communication in Large Model Training

NIXT:用于大模型训练中集合通信可观测性的NCCL检查器导出工具

Ziyang Jia, Sirshak Das, Jason Sewall, Laxmi Bhuyan, Pasha Shamis, Daniel Wong

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract)

AI总结 本文提出NIXT工具,解决NCCL Inspector数据量大难以分析的问题,通过案例展示其在大模型训练中提升集合通信可观测性、定位性能问题的作用。

Comments Accepted at IEEE IISWC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02052 2026-08-04 cs.LG 新提交 57%

Secrets Everywhere: Auditing Memorization in Mobility Prediction Models

无处不在的秘密:移动性预测模型中的记忆审计

Anne Josiane Kouam, Hristo Boyadzhiev, Konrad Rieck

机构 * Inria(法国国家信息与自动化研究所) TU Berlin(柏林工业大学) BIFOLD(数据科学与人工智能柏林研究所)

专题命中 预训练与数据 :language model(abstract);分类 cs.LG

AI总结 本文首次系统审计移动性预测模型的记忆风险,提出框架量化不同粒度的移动性记忆,发现普遍记忆模式关联用户规律性并提升数据提取风险,呼吁开展强制性隐私审计。

Comments Full version of the paper accepted for publication at the ACM SIGSAC Conference on Computer and Communications Security (CCS 2026). Includes supplementary appendices omitted from the proceedings version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01767 2026-08-04 cs.AI 新提交 57%

Leveraging AI for fine-grained food safety risk forecasting in sparse data conditions

利用人工智能在稀疏数据条件下进行细粒度食品安全风险预测

Dongqi Wang, Weiwei Chen, Han Zhou, Weihua Zhou

机构 * Zhejiang University(浙江大学) Rutgers University(罗格斯大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 该研究提出基于Transformer的框架,整合多类数据与Wilson区间预训练,在稀疏数据下细粒度预测城市食品安全风险,实验及浙江实地测试显示其性能优于基线,可提升检测率与检查资源分配效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01075 2026-08-04 cs.AI 新提交 57%

Role-Decoupled Attention Residuals: Separating Matching and Content Retrieval Across Depth

角色解耦注意力残差:跨深度分离匹配与内容检索

Kehan Wang

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 该研究提出角色解耦注意力残差(RD-AttnRes),将注意力的匹配与内容检索解耦,在多参数规模模型上验证其可提升语言建模性能,证实二者需从残差层级差异化读取。

Comments a improvement of attnres

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00658 2026-08-04 cs.CL 新提交 57%

Select-And-Extract: A Lightweight Plugin for Retrieval-Augmented Generation

Select-And-Extract:一种用于检索增强生成的轻量级插件

Chenming Tang, Jiawei Han

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 该研究针对RAG的检索与阅读两类失效模式,提出轻量级插件SANE,通过语义检索+LM选候选、蓝图引导证据提取实现稳定性能提升,且开销适度。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02580 2026-08-04 cs.RO 新提交 50%

Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data

Ego2Robot:从第一视角人类数据生成可扩展机器人数据

Ye Wang, Pei Lin, Xiong-Hui Chen, Haoqi Yuan, Zhixuan Liang, Yiyang Huang, Anzhe Chen, Zixing Lei, Jie Zhang, Tao Zhang, Haoyang Li, Tong Zhang, Chenxi Xiao, Ziyuan Jiao, Qin Jin

机构 * AIM3 Lab, Renmin University of China(中国人民大学AIM3实验室) Qwen Team, Alibaba Inc.(阿里巴巴通义千问团队) ShanghaiTech University(上海科技大学) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 Ego2Robot提出将第一视角人类操控视频转换为机器人训练数据的可扩展流水线,生成18561小时机器人数据,扩展RoboTwin2.0验证其联合预训练可提升机器人分布外泛化能力并经真实部署验证

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01726 2026-08-04 cs.CV 新提交 50%

G-Skin: Learning to Bind 3D Gaussians with Generative Visual Priors

G-Skin:学习结合生成式视觉先验的3D高斯绑定方法

Yuxin Yao, Kendong Liu, Shiqi Zhou, Jiazhi Xia, Junhui Hou

机构 * City University of Hong Kong(香港城市大学) Central Media Technology Institute, Huawei(华为中央媒体技术研究院) Central South University(中南大学)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 本文针对3D高斯资产绑定的难题,提出生成式蒙皮框架G-Skin,利用2D视觉基础模型提炼运动先验构建优化流程,可灵活泛化并优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏