arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-05 至 2026-08-05 共收录 281 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 19 篇

2608.03089 2026-08-05 cs.CL 新提交 90%

Scalable Frequency- and Length-Aware Subdocument Deduplication for Large Language Model Pretraining

面向大语言模型预训练的可扩展、感知频率与长度的子文档去重

Hai Wang, Chenhao Wang, Qifeng Cai, Yixiu Liu, Miao Peng, Nuo Chen, Yuanlin Tu, Chengcheng Xu, Feng Zhang

专题命中 预训练与数据 :pretraining(title,abstract);large language model(title);language model(title);分类 cs.CL

AI总结 针对大语言模型预训练的子文档去重难题,提出解耦重复检测与副本保留的可扩展框架,在基准数据集上实现最优模型性能,凸显显式副本保留控制的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03733 2026-08-05 cs.AI 新提交 88%

Failure-Informed Image Self-Augmentation for Multimodal Large Language Model Self-Improvement

面向多模态大语言模型自我改进的故障感知图像自增强

Chunyang Jiang, Pingping Zhang, Yuzhi Zhao, Wenao Ma, Zhijian Hou, Mengyang Wu, Yiyang Cai, Senkang Hu, Sitong Cheng, Chi-Min Chan, Wei Xue, Yike Guo

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出FISA框架,基于MLLM失败案例生成保留答案的增强图像,经自检验与双重保真过滤后,可提升视觉问答性能,且兼容文本自增强、数据效率更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03883 2026-08-05 cs.CL 新提交 87%

DS@GT-ARC at eRisk 2026 Task 3: Sparse, Semantic, and LLM Reranking for ADHD Symptom Sentences

佐治亚理工学院DS团队参加eRisk 2026任务3:针对ADHD症状句子的稀疏、语义及大语言模型重排序

David Guecha

专题命中 预训练与数据 :LLM(title,summary_cn);分类 cs.CL

AI总结 本文介绍佐治亚理工学院DS团队针对eRisk 2026任务3,采用分阶段检索结合稀疏BM25、语义及LLM重排序的方案,其中LLM重排序器取得官方最优成绩,分阶段重排序具发展前景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02678 2026-08-05 cs.CR cs.AI cs.LG 新提交 87%

DenialRAG: Single-Document RAG Poisoning via Embedded Parametric Denial

DenialRAG:通过嵌入参数化弃权的单文档RAG污染攻击

Abay Zhurekbay, Tao Liu, Fan Li

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DenialRAG单文档RAG污染攻击,通过嵌入参数化弃权引导LLM生成错误答案,经多数据集、多模型及防御评估,其在Mistral-7B上攻击效果最优,凸显RAG污染风险的复杂性。

Comments Submit to ACSAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03711 2026-08-05 cs.CV cs.CL cs.LG 新提交 85%

Attention is Case-Sensitive

注意力对字母大小写敏感

Maximilian Dillitzer, Tin Stribor Sohn, Jason J. Corso, Michael Auerbach

专题命中 预训练与数据 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现LLMs和VLMs存在大小写效应,即文本中目标信息采用特定大小写格式会调节注意力分配,但该效应不一定提升任务准确率,推理模型的思考阶段可缓解此效应,且该效应可部分迁移至VLMs。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03930 2026-08-05 cs.CL cs.AI cs.LG 新提交 85%

Logic Before Language: Pre-pretraining on Formal Derivations Fosters Skill Acquisition and Compressibility

语言之前的逻辑:基于形式推导的预预训练可促进技能获取与可压缩性

Jo-Ku Cheng, Nikolaos Aletras, Marco Valentino

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出Logic-PPT策略,通过形式推导预预训练语言模型,可加速技能获取、提升性能,还能增强模型可压缩性,在少用36B token时达80%准确率,33%稀疏度下匹配密集基线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03457 2026-08-05 cs.AI 新提交 83%

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models

LLaDA MoE v2:扩展混合专家扩散语言模型

Fengqi Zhu, Shaoxuan Xu, Jingyang Ou, Zebin You, Yipeng Xing, Huabin Liu, Xiaolu Zhang, Jun Zhou, Zhenzhong Lan, Yankai Lin, Wayne Xin Zhao, Jianguo Li, Chongxuan Li, Ji-Rong Wen

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 该研究明确MoE扩散语言模型的扩展规律,训练30B-A3B的LLaDA MoE v2,其预训练令牌量为Qwen3的65%,经微调后在多数推理编码基准上优于SDAR Chat且接近Qwen3。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03372 2026-08-05 cs.CL cs.AI 新提交 82%

FACTWASH: Catching AI Rewrites That Wash Hearsay into Fact

FACTWASH:捕捉将传闻洗成事实的AI改写

Alex Kwon

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出开源工具factwash,用于捕捉AI将传闻洗成事实的改写,明确否定线索检测F1达0.91,LLM见证者可提升线索检测召回率,在mem0 2.0.7上标记8个模糊传闻写入中的5个。

Comments 15 pages, 3 figures. Code and data: https://github.com/collapseindex/factwash

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03999 2026-08-05 cs.SD cs.CL 新提交 79%

Agogic: Performance-Timed Music Tokens for LLM-Native Text-to-Symbolic-Music Generation

Agogic:适用于大语言模型原生文本到符号音乐生成的性能计时音乐 token

Junhao Chen, Mingjin Chen, Jingjia Mao, Lin Chen, Saining Zhang, Minglin Chen, Ruocheng Wu, Liaoyuan Fan, Wenyi Li, Mingju Gao, Henghaofan Zhang, Zhihao Li, Hao Zhao, Yufei Wang, Ruqi Huang

专题命中 预训练与数据 :LLM(title);language model(abstract);分类 cs.CL

AI总结 该研究固定模型规模、数据等变量,发现音乐 token 化的表示形式而非模型规模是影响文本到符号音乐生成分布保真度的关键,发布了相关工具链、模型及语料库,为该领域提供了可测量的表示形式研究基础。

Comments Project Page: https://yisuanwang.github.io/Agogic

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03599 2026-08-05 cs.CL 新提交 79%

Disentangling Language Modeling and Boundaries

解耦语言建模与边界

Mykola Haltiuk

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 该研究提出字节级语言模型可解耦下一字节分布与边界位置分布,设计实验验证该假设,主张采用字节级接口作为共享标准以实现模型间低成本的能力传递与边界重塑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03260 2026-08-05 cs.LG 新提交 79%

ED-DiT: Physics-Guided Diffusion Pretraining for Transferable Molecular Representations from Electron Density

ED-DiT:用于从电子密度学习可迁移分子表示的物理引导扩散预训练

Liang Shuang, Haocheng Wang, Jiayi Song, Shuquan Ye, Ben Fei

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 本研究提出ED-DiT,一种物理引导的扩散Transformer,通过电子密度点云自监督预训练学习可迁移分子表示,在6项EDBench任务及低监督场景下均优于基线,展现出良好效果。

Comments 16 pages, 9 figures, 7 tables, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02961 2026-08-05 cs.LG cs.AI q-bio.GN 新提交 73%

Scaling an Autoregressive Transformer for Single-Cell Generation

为单细胞生成任务扩展自回归Transformer模型

Aleksandr Sharipov, Yusif Mukhtarov, Igor Molybog

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对单细胞基因表达向量的自监督生成任务,扩展因果Transformer模型,发现单细胞基础模型的双指数缩放定律与计算最优前沿,还探讨其微调用于扰动响应预测的可能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02807 2026-08-05 cs.CL cs.AI 新提交 73%

Learning a Vector-Symbolic Model for Socio-Cultural Tasks

学习面向社会文化任务的向量符号模型

Meera Ray, Swapnika Dulam, Christopher L. Dancy

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对社会文化结构对决策的表征问题,在ACT-R认知架构中提出带向量符号自编码器的陈述性记忆系统,结合HRR编码,通过IAT测试验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03500 2026-08-05 cs.CY 新提交 71%

LLM-Assisted Review Prioritization for German Statutory Health Insurance Websites: A Multi-Stage Corpus Audit

大语言模型辅助的德国法定医疗保险网站审核优先级排序:多阶段语料审计

Martin Möller

专题命中 预训练与数据 :LLM(title)

AI总结 本研究针对德国法定医疗保险网站,提出一种结合多步骤的大语言模型辅助审核优先级排序工作流程,经实验验证可有效分配审核工作量,区分AI来源信号与质量声明。

Comments 31 pages, 5 figures. Also archived at Zenodo: https://doi.org/10.5281/zenodo.21738595

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03585 2026-08-05 cs.AI cs.CY 新提交 70%

From Social Coding to Agentic Coding: Productivity and Relational Reconfiguration in Open-Source Communities

从社交编码到智能体编码:开源社区中的生产力与关系重构

Mengying Zhou, Yongjie Yin, Yang Chen

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究基于含1084名开发者的GitHub数据模拟发现,编码智能体(CA)可提升开源社区生产力,但采用率低且收益集中于活跃开发者,还会减少人类直接交互、降低公共知识实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03994 2026-08-05 cs.CL 新提交 57%

When Attention Goes Blind: Numerical Failure in ALiBi Positional Encodings

当注意力失效:ALiBi位置编码中的数值故障

Christopher Schröder, Lukas Gienapp, Ferdinand Schlatt, Martin Potthast, Gerhard Heyer

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL

AI总结 该研究发现ALiBi位置编码存在线性偏置缩放导致浮点下溢的失效模式,提出四种训练缓解策略,发现对数缩放距离在密码检索中改进最稳定,为ALiBi模型训练提供具体建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03023 2026-08-05 cs.CV cs.AI 新提交 57%

Standalone DINOv3 for Training-Free Open-Vocabulary Semantic Segmentation in Remote Sensing

用于遥感领域无需训练的开放词汇语义分割的独立DINOv3模型

Changhao Zhao, Haoxiang Li, Yuke Li, Hai Liu, LingLin Zeng

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 针对遥感语义分割标注成本高的问题,提出无需训练的DinoSplat-OV框架,结合DINOv3的文本感知拉普拉斯传播与高斯溅射上采样模块,在多数据集上取得优于现有方法的性能,填补了DINO系列模型在该领域的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02946 2026-08-05 cs.LG 新提交 57%

Sedentary Behavior Classification for Wearable Sensors with a CNN-BiLSTM Model

基于CNN-BiLSTM模型的可穿戴传感器久坐行为分类

Yuliang Chen, Weiwei Shi, Jingjing Zou, Rong Zablocki, Animesh Kumar, Jordan A. Carlson, Sheri J. Hartman, Mikael Anne Greenwood-Hickman, Paul R. Hibbing, Marta Jankowska, Jay Yang, Arun Kumar, Loki Natarajan

机构 * Halıcıoğlu Data Science Institute, University of California, San Diego(加州大学圣迭戈分校哈利乔格鲁数据科学学院) Herbert Wertheim School of Public Health and Human Longevity Science, University of California, San Diego(加州大学圣迭戈分校赫伯特韦特海姆公共卫生与人类长寿科学学院) Department of Computer Science and Engineering, University of California, San Diego(加州大学圣迭戈分校计算机科学与工程系) Center for Children’s Healthy Lifestyles & Nutrition, Children’s Mercy Kansas City, University of Missouri-Kansas City(密苏里大学堪萨斯城分校儿童慈善医疗堪萨斯城分院儿童健康生活方式与营养中心) Kaiser Permanente Washington Health Research Institute(凯撒永久华盛顿健康研究所) Department of Kinesiology and Nutrition, University of Illinois Chicago(芝加哥伊利诺伊大学运动机能学与营养系)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本研究提出基于髋部加速度计数据预训练的CNN-BiLSTM模型CHAP,可迁移至腕部数据实现坐/非坐分类,微调后性能优于从头训练的Transformer,为腕部传感器久坐行为检测提供了有效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02939 2026-08-05 cs.LG cs.CY 新提交 57%

Federated generative event models for tokenized electronic health records

面向分词电子健康记录的联邦生成事件模型

Michael C. Burkhart, Luke Solo, Inhyeok Lee, S'Khaja Charles, Zewei "Whiskey" Liao, Kaveri Chhikara, Dema Therese, Wan-Ting Liao, Catherine A. Gao, William F. Parker, Brett K. Beaulieu-Jones

机构 * University of Chicago(芝加哥大学) Northwestern University Feinberg School of Medicine(西北大学费恩伯格医学院)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.LG

AI总结 本研究评估了面向分词电子健康记录的联邦生成事件模型(GEMs),其跨站点性能优于LightGBM,联邦学习(FedAvg、FedAvgM)表现接近集中式训练,为解决电子健康记录模型的数据孤岛问题提供了可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 20 篇

2608.03063 2026-08-05 cs.CL 新提交 89%

SeqLLM: Augmenting LLMs with Behavioral-Sequence Modeling for High-Stakes Decisions at WeChat Pay

SeqLLM:为高风险决策场景下的微信支付增强序列大语言模型(LLM)的行为序列建模能力

Guilin Li, Jiaxing Zhang, Matthias Hwai Yong Tan, Bo Wang, Weiran Huang

专题命中 指令微调 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SeqLLM是一种在保留LLM语言能力的同时增强其行为序列建模能力的框架,已部署于微信支付,在风险筛查等任务上性能显著优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03277 2026-08-05 cs.LG cs.CR 新提交 88%

Noise-Aware Shrinkage for Differentially Private Zeroth-Order Fine-Tuning of Large Language Models

面向大语言模型的差分隐私零阶微调的噪声感知收缩方法

Lele Zheng, Weifeng Kong, Xinyi Zhang, Ke Cheng, Tao Zhang, Yulong Shen

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文针对差分隐私零阶微调大语言模型的噪声问题,提出SAGE噪声感知收缩方法,经理论分析和多模型实验验证,该方法在相同隐私预算下多数场景优于基线,且保留内存效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03660 2026-08-05 cs.AI 新提交 85%

Taming the Implicit: Dual-Channel Risk-Aware Reinforcement Fine-Tuning for Continual Multimodal Post-Training

驯服隐式:面向持续多模态后训练的双通道风险感知强化微调

Yibei Liu, Jiajun Chen, Qianle Zhang, Tangyue Jin, Mengying Zhu, Meng Xi, Yangyang Wu

专题命中 指令微调 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对持续多模态后训练中RFT算法在任务分布偏移下遗忘加剧的问题,提出双通道风险感知强化微调框架RAPO,通过策略与数据通道的风险管控降低遗忘,在MLLM-CL基准上使遗忘减少79.8%且保留新任务竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03769 2026-08-05 cs.CL cs.AI 新提交 84%

MDLMPE: Distribution Aware Positional Encoding for Masked Diffusion Language Models

MDLMPE:面向掩码扩散语言模型的分布感知位置编码

Tong Ling, Hang Lei, Feng Xiao, Changhui Sun, Jiahang Xie, Hao Liu, Lu Liu, Yanlong Du

专题命中 指令微调 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 针对掩码扩散语言模型位置编码对动态标记可用性结构不敏感的问题,提出MDLMPE,通过编码标记可用性等实现分布感知,在LLaDA、DREAM等实验中性能优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03887 2026-08-05 cs.LG cs.NE q-bio.MN 新提交 84%

Omega-S: A Functional Resilience Index for LLM Fine-Tuning

Omega-S:一种用于大语言模型微调的功能弹性指数

Alberto Acedo

专题命中 指令微调 :LLM(title,comments);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Omega-S是一种仅依赖权重矩阵的即插即用惩罚项,在Llama-3-8B的LoRA微调中,它在保留模型原有能力上优于无正则化、调优后的权重衰减和EWC,且成本增加不到4%。

Comments 15 pages of main text plus appendices; 12 tables. Code, per-seed data and all negative results at https://github.com/BiomeMakers/OmegaS-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04010 2026-08-05 cs.CV cs.CL 新提交 81%

ParVL: Parallel Scaling and Expandable Compute Allocation for Multimodal LLMs

ParVL:面向多模态大语言模型的并行缩放与可扩展计算分配

Yang Yang, Qinyu Zhao, Mouxiang Chen, Xiaohui Li, Lixin Gu, Wenhai Wang, Hongjie Zhang, Wenwei Zhang

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究针对多模态大语言模型的计算分配僵化问题,提出ParVL框架,通过复用骨干参数扩展并行计算,在13B token上微调后,其多模态性能优于同配置单分支基线,且最优分配随任务变化。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03292 2026-08-05 cs.AI 新提交 81%

DocTrace: Towards Traceable Long Document VQA via Hierarchical Evidence Graph Reasoning

DocTrace:面向可追溯的长文档视觉问答的分层证据图推理方法

Le Xiang, Zhicheng Guan, Hong Chen, Xiaocong Lin, Zhenghua Lei, Teng Hu, Bolei He, Long Zeng

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DocTrace分层框架,将长文档视觉问答建模为显式证据图推理问题,经两阶段训练优化后,在三个基准上优于现有模型,且推理可追溯。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03428 2026-08-05 cs.CV cs.AI 新提交 79%

OliveGemma: A 3 Billion Visual Language Model for Recognising the Mediterranean & European Diet

OliveGemma:一款用于识别地中海与欧洲饮食的30亿参数视觉语言模型

Dimitrios I. Zaridis, Traianos Tsiokris, Vasileios C. Pezoulas, Daphni Plati, Eugenia Mylona, Eleni Georga, Nikos Tsiknakis, Antonis Sakellarios, Dimitrios I. Fotiadis

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 本研究构建基于PaliGemma-2-3B的OliveGemma,经LoRA微调后在欧洲饮食识别任务上超越多数前沿模型,仅逊于DenseNet-121,小型VLM经PEFT适配可在专业任务超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02830 2026-08-05 cs.CV cs.AI 新提交 79%

In-Context Collapse in Vision-Language Models and How to Mitigate it?

视觉语言模型中的上下文坍缩及其缓解方法

Mohammad Rostami

机构 * Amazon Generative AI Innovation Center(亚马逊生成式AI创新中心)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 本文发现视觉语言模型存在随演示增多的上下文坍缩问题,通过因果定位将其归因于视觉-语言整合通路,提出CircA干预方法可有效缓解该问题并实现抗坍缩能力迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02790 2026-08-05 cs.CV 新提交 78%

Confident but Unreliable: A Behavioral Safety Audit of Vision-Language Models on Brain MRI

自信但不可靠:对基于脑MRI的视觉语言模型的行为安全审计

Amir Sabbaghziarani, Mohammadsajad Abavisani, Sergey Plis

机构 * Georgia State University(佐治亚州立大学) Georgia Institute of Technology(佐治亚理工学院) Emory University(埃默里大学) TReNDS Center(TReNDS中心)

专题命中 指令微调 :language model(title,abstract)

AI总结 本研究对6个指令微调VLMs开展脑MRI行为安全审计,发现其置信度校准差、存在大量高置信度错误,提出医学图像VLM评估需报告置信度可靠性等指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03605 2026-08-05 cs.AI 新提交 77%

FraQ: Efficient Coordinate-Space Recompression for Federated Low-Rank Adaptation

FraQ:用于联邦低秩适配的高效坐标空间重压缩方法

Shenghui Li, Thiemo Voigt

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 FraQ是一种联邦低秩适配的高效坐标空间重压缩方法,可在接近未压缩基线准确率的同时减少下行通信,降低服务器端重压缩开销。

详情

展开后加载摘要…

URL PDF HTML 收藏