arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-05 至 2026-08-05 共收录 26 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 26 篇

2511.03942 2026-08-05 cs.SD cs.CL cs.MM 版本更新 94%

MIDI-LLM: Improving Text-to-MIDI Music Generation via Adapting Large Language Models

MIDI-LLM:通过适配大语言模型改进文本到MIDI的音乐生成

Shih-Lun Wu, Dave Carlton, Ryan Miyakawa, Yoon Kim, Chris Donahue, Cheng-Zhi Anna Huang

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract);pretraining(abstract)

AI总结 该研究提出MIDI-LLM,通过适配Llama 3.2(1B)采用两阶段训练改进文本到MIDI生成,在用户研究中证实其在人机音乐协同创作中的有效性。

Comments Accepted to International Society for Music Information Retrieval (ISMIR) Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00123 2026-08-05 cs.CL cs.AI cs.GT cs.LG 版本更新 90%

LLM-OSDA: An Optimal-Stopping Dynamic Auction for Native Advertising in Multi-Turn LLM Conversations

LLM-OSDA:多轮大语言模型对话中原生广告的最优停止动态拍卖机制

Yan Fang, Jialin Chen, Chun Gan, Hang Yu, Mingjun Nie, Yeyu Zhang, Fengxiang He, Ching Law

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对多轮LLM对话中原生广告的时机与分配耦合问题,提出LLM-OSDA动态拍卖机制,结合贝尔曼最优停止等,在模拟实验中使净收益提升11%且用户留存相当。

Comments 14 pages, 7 figures. Submitted to the 41st AAAI Conference on Artificial Intelligence (AAAI 2027)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05149 2026-08-05 eess.AS cs.AI cs.CL 版本更新 90%

Speech LLMs in Low-Resource Scenarios: Data Volume Requirements and the Impact of Pretraining on High-Resource Languages

低资源场景下的语音大语言模型:数据量需求及高资源语言预训练的影响

Seraphina Fong, Marco Matassoni, Alessio Brutti

机构 * Department of Information Engineering(信息工程系) Center for Augmented Intelligence(增强智能中心)

专题命中 预训练与数据 :LLM(summary_cn,abstract);pretraining(title);large language model(abstract);language model(abstract)

AI总结 该研究针对低资源ASR任务,基于SLAM-ASR框架探究语音LLM的数据量需求,发现高资源语言预训练的投影器可缓解数据稀缺问题,并结合多语LLM在公开基准上验证性能,为相关研究提供方向。

Comments Accepted at Interspeech 2025. 5 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03089 2026-08-05 cs.CL 新提交 90%

Scalable Frequency- and Length-Aware Subdocument Deduplication for Large Language Model Pretraining

面向大语言模型预训练的可扩展、感知频率与长度的子文档去重

Hai Wang, Chenhao Wang, Qifeng Cai, Yixiu Liu, Miao Peng, Nuo Chen, Yuanlin Tu, Chengcheng Xu, Feng Zhang

专题命中 预训练与数据 :pretraining(title,abstract);large language model(title);language model(title);分类 cs.CL

AI总结 针对大语言模型预训练的子文档去重难题,提出解耦重复检测与副本保留的可扩展框架,在基准数据集上实现最优模型性能,凸显显式副本保留控制的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25857 2026-08-05 cs.LG 版本更新 89%

In-Context Molecular Property Prediction with LLMs: A Blinding Study on Memorization and Knowledge Conflicts

基于LLM的上下文分子性质预测:关于记忆与知识冲突的盲化研究

Matthias Busch, Marius Tacke, Sviatlana V. Lamaka, Mikhail L. Zheludkevich, Christian J. Cyron, Christian Feiler, Roland C. Aydin

机构 * Institute for Continuum and Material Mechanics, Technical University of Hamburg(持续与材料力学研究所,汉堡技术大学) Institute of Material Systems Modeling, Helmholtz-Zentrum Hereon(材料系统建模研究所,海德堡-这里恩研究中心) Institute of Surface Science, Helmholtz-Zentrum Hereon(表面科学研究所,海德堡-这里恩研究中心) German Center for Artificial Intelligence (DFKI), Saarland, Germany(德国人工智能中心(DFKI),萨尔兰州,德国) Saarland University(萨尔兰州大学)

专题命中 预训练与数据 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 通过渐进盲化实验和上下文样本量控制,研究LLM在分子性质预测中是否真正进行上下文回归,还是依赖记忆值,并分析预训练知识与上下文信息的冲突。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03733 2026-08-05 cs.AI 新提交 88%

Failure-Informed Image Self-Augmentation for Multimodal Large Language Model Self-Improvement

面向多模态大语言模型自我改进的故障感知图像自增强

Chunyang Jiang, Pingping Zhang, Yuzhi Zhao, Wenao Ma, Zhijian Hou, Mengyang Wu, Yiyang Cai, Senkang Hu, Sitong Cheng, Chi-Min Chan, Wei Xue, Yike Guo

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出FISA框架,基于MLLM失败案例生成保留答案的增强图像,经自检验与双重保真过滤后,可提升视觉问答性能,且兼容文本自增强、数据效率更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28818 2026-08-05 cs.CL q-bio.NC 版本更新 88%

Do VLMs Align Better with Humans than LLMs during Natural Reading?

VLMs 在自然阅读中可能不会全局性地增强与人类的对齐性优于 LLMs

Jinzhou Wu, Zhengwu Ma, Jixing Li, Baoping Tang, Zitong Lu

机构 * Department of Mechanical and Vehicle Engineering, Chongqing University(重庆大学机械与车辆工程学院) Department of Linguistics and Translation, City University of Hong Kong(香港城市大学语言学与翻译系) McGovern Institute for Brain Research, Massachusetts Institute of Technology(麻省理工学院麦戈文脑科学研究所)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 通过严格文本设置比较LLM和VLM,发现多模态预训练在自然阅读中未带来全局性人类对齐优势,但视觉语义内容强的句子中VLM有选择性优势。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03883 2026-08-05 cs.CL 新提交 87%

DS@GT-ARC at eRisk 2026 Task 3: Sparse, Semantic, and LLM Reranking for ADHD Symptom Sentences

佐治亚理工学院DS团队参加eRisk 2026任务3:针对ADHD症状句子的稀疏、语义及大语言模型重排序

David Guecha

专题命中 预训练与数据 :LLM(title,summary_cn);分类 cs.CL

AI总结 本文介绍佐治亚理工学院DS团队针对eRisk 2026任务3,采用分阶段检索结合稀疏BM25、语义及LLM重排序的方案,其中LLM重排序器取得官方最优成绩,分阶段重排序具发展前景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02678 2026-08-05 cs.CR cs.AI cs.LG 新提交 87%

DenialRAG: Single-Document RAG Poisoning via Embedded Parametric Denial

DenialRAG:通过嵌入参数化弃权的单文档RAG污染攻击

Abay Zhurekbay, Tao Liu, Fan Li

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DenialRAG单文档RAG污染攻击,通过嵌入参数化弃权引导LLM生成错误答案,经多数据集、多模型及防御评估,其在Mistral-7B上攻击效果最优,凸显RAG污染风险的复杂性。

Comments Submit to ACSAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03711 2026-08-05 cs.CV cs.CL cs.LG 新提交 85%

Attention is Case-Sensitive

注意力对字母大小写敏感

Maximilian Dillitzer, Tin Stribor Sohn, Jason J. Corso, Michael Auerbach

专题命中 预训练与数据 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现LLMs和VLMs存在大小写效应,即文本中目标信息采用特定大小写格式会调节注意力分配,但该效应不一定提升任务准确率,推理模型的思考阶段可缓解此效应,且该效应可部分迁移至VLMs。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03930 2026-08-05 cs.CL cs.AI cs.LG 新提交 85%

Logic Before Language: Pre-pretraining on Formal Derivations Fosters Skill Acquisition and Compressibility

语言之前的逻辑:基于形式推导的预预训练可促进技能获取与可压缩性

Jo-Ku Cheng, Nikolaos Aletras, Marco Valentino

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出Logic-PPT策略,通过形式推导预预训练语言模型,可加速技能获取、提升性能,还能增强模型可压缩性,在少用36B token时达80%准确率,33%稀疏度下匹配密集基线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03457 2026-08-05 cs.AI 新提交 83%

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models

LLaDA MoE v2:扩展混合专家扩散语言模型

Fengqi Zhu, Shaoxuan Xu, Jingyang Ou, Zebin You, Yipeng Xing, Huabin Liu, Xiaolu Zhang, Jun Zhou, Zhenzhong Lan, Yankai Lin, Wayne Xin Zhao, Jianguo Li, Chongxuan Li, Ji-Rong Wen

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 该研究明确MoE扩散语言模型的扩展规律,训练30B-A3B的LLaDA MoE v2,其预训练令牌量为Qwen3的65%,经微调后在多数推理编码基准上优于SDAR Chat且接近Qwen3。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03372 2026-08-05 cs.CL cs.AI 新提交 82%

FACTWASH: Catching AI Rewrites That Wash Hearsay into Fact

FACTWASH:捕捉将传闻洗成事实的AI改写

Alex Kwon

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出开源工具factwash,用于捕捉AI将传闻洗成事实的改写,明确否定线索检测F1达0.91,LLM见证者可提升线索检测召回率,在mem0 2.0.7上标记8个模糊传闻写入中的5个。

Comments 15 pages, 3 figures. Code and data: https://github.com/collapseindex/factwash

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03999 2026-08-05 cs.SD cs.CL 新提交 79%

Agogic: Performance-Timed Music Tokens for LLM-Native Text-to-Symbolic-Music Generation

Agogic:适用于大语言模型原生文本到符号音乐生成的性能计时音乐 token

Junhao Chen, Mingjin Chen, Jingjia Mao, Lin Chen, Saining Zhang, Minglin Chen, Ruocheng Wu, Liaoyuan Fan, Wenyi Li, Mingju Gao, Henghaofan Zhang, Zhihao Li, Hao Zhao, Yufei Wang, Ruqi Huang

专题命中 预训练与数据 :LLM(title);language model(abstract);分类 cs.CL

AI总结 该研究固定模型规模、数据等变量,发现音乐 token 化的表示形式而非模型规模是影响文本到符号音乐生成分布保真度的关键,发布了相关工具链、模型及语料库,为该领域提供了可测量的表示形式研究基础。

Comments Project Page: https://yisuanwang.github.io/Agogic

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03599 2026-08-05 cs.CL 新提交 79%

Disentangling Language Modeling and Boundaries

解耦语言建模与边界

Mykola Haltiuk

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 该研究提出字节级语言模型可解耦下一字节分布与边界位置分布,设计实验验证该假设,主张采用字节级接口作为共享标准以实现模型间低成本的能力传递与边界重塑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03260 2026-08-05 cs.LG 新提交 79%

ED-DiT: Physics-Guided Diffusion Pretraining for Transferable Molecular Representations from Electron Density

ED-DiT:用于从电子密度学习可迁移分子表示的物理引导扩散预训练

Liang Shuang, Haocheng Wang, Jiayi Song, Shuquan Ye, Ben Fei

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 本研究提出ED-DiT,一种物理引导的扩散Transformer,通过电子密度点云自监督预训练学习可迁移分子表示,在6项EDBench任务及低监督场景下均优于基线,展现出良好效果。

Comments 16 pages, 9 figures, 7 tables, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17746 2026-08-05 cs.NI 版本更新 78%

FlowCLIP: Contrastive Pretraining Using Domain Names for Encrypted Traffic Classification

FlowCLIP: 使用域名的对比预训练进行加密流量分类

Eun Hun Choi

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出FlowCLIP框架,利用数据包侧信道特征(间隔、大小、方向)和CLIP对比目标对齐流量与域名表示,在QUIC流量数据集上跨周评估,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02961 2026-08-05 cs.LG cs.AI q-bio.GN 新提交 73%

Scaling an Autoregressive Transformer for Single-Cell Generation

为单细胞生成任务扩展自回归Transformer模型

Aleksandr Sharipov, Yusif Mukhtarov, Igor Molybog

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对单细胞基因表达向量的自监督生成任务,扩展因果Transformer模型,发现单细胞基础模型的双指数缩放定律与计算最优前沿,还探讨其微调用于扰动响应预测的可能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02807 2026-08-05 cs.CL cs.AI 新提交 73%

Learning a Vector-Symbolic Model for Socio-Cultural Tasks

学习面向社会文化任务的向量符号模型

Meera Ray, Swapnika Dulam, Christopher L. Dancy

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对社会文化结构对决策的表征问题,在ACT-R认知架构中提出带向量符号自编码器的陈述性记忆系统,结合HRR编码,通过IAT测试验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03500 2026-08-05 cs.CY 新提交 71%

LLM-Assisted Review Prioritization for German Statutory Health Insurance Websites: A Multi-Stage Corpus Audit

大语言模型辅助的德国法定医疗保险网站审核优先级排序:多阶段语料审计

Martin Möller

专题命中 预训练与数据 :LLM(title)

AI总结 本研究针对德国法定医疗保险网站,提出一种结合多步骤的大语言模型辅助审核优先级排序工作流程,经实验验证可有效分配审核工作量,区分AI来源信号与质量声明。

Comments 31 pages, 5 figures. Also archived at Zenodo: https://doi.org/10.5281/zenodo.21738595

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03585 2026-08-05 cs.AI cs.CY 新提交 70%

From Social Coding to Agentic Coding: Productivity and Relational Reconfiguration in Open-Source Communities

从社交编码到智能体编码:开源社区中的生产力与关系重构

Mengying Zhou, Yongjie Yin, Yang Chen

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究基于含1084名开发者的GitHub数据模拟发现,编码智能体(CA)可提升开源社区生产力,但采用率低且收益集中于活跃开发者,还会减少人类直接交互、降低公共知识实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04000 2026-08-05 cs.HC 版本更新 67%

After Talking with 1,000 Personas: Learning Preference-Aligned Proactive Assistants From Large-Scale Persona Interactions

与1000个角色交谈后:从大规模角色交互中学习偏好对齐的主动助手

Ziyi Xuan, Yiwen Wu, Zhaoyang Yan, Vinod Namboodiri, Yu Yang

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 通过大规模角色交互模拟,学习偏好对齐的主动助手,实现设备端个性化适应与冷启动优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03994 2026-08-05 cs.CL 新提交 57%

When Attention Goes Blind: Numerical Failure in ALiBi Positional Encodings

当注意力失效:ALiBi位置编码中的数值故障

Christopher Schröder, Lukas Gienapp, Ferdinand Schlatt, Martin Potthast, Gerhard Heyer

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL

AI总结 该研究发现ALiBi位置编码存在线性偏置缩放导致浮点下溢的失效模式,提出四种训练缓解策略,发现对数缩放距离在密码检索中改进最稳定,为ALiBi模型训练提供具体建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03023 2026-08-05 cs.CV cs.AI 新提交 57%

Standalone DINOv3 for Training-Free Open-Vocabulary Semantic Segmentation in Remote Sensing

用于遥感领域无需训练的开放词汇语义分割的独立DINOv3模型

Changhao Zhao, Haoxiang Li, Yuke Li, Hai Liu, LingLin Zeng

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 针对遥感语义分割标注成本高的问题,提出无需训练的DinoSplat-OV框架,结合DINOv3的文本感知拉普拉斯传播与高斯溅射上采样模块,在多数据集上取得优于现有方法的性能,填补了DINO系列模型在该领域的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02946 2026-08-05 cs.LG 新提交 57%

Sedentary Behavior Classification for Wearable Sensors with a CNN-BiLSTM Model

基于CNN-BiLSTM模型的可穿戴传感器久坐行为分类

Yuliang Chen, Weiwei Shi, Jingjing Zou, Rong Zablocki, Animesh Kumar, Jordan A. Carlson, Sheri J. Hartman, Mikael Anne Greenwood-Hickman, Paul R. Hibbing, Marta Jankowska, Jay Yang, Arun Kumar, Loki Natarajan

机构 * Halıcıoğlu Data Science Institute, University of California, San Diego(加州大学圣迭戈分校哈利乔格鲁数据科学学院) Herbert Wertheim School of Public Health and Human Longevity Science, University of California, San Diego(加州大学圣迭戈分校赫伯特韦特海姆公共卫生与人类长寿科学学院) Department of Computer Science and Engineering, University of California, San Diego(加州大学圣迭戈分校计算机科学与工程系) Center for Children’s Healthy Lifestyles & Nutrition, Children’s Mercy Kansas City, University of Missouri-Kansas City(密苏里大学堪萨斯城分校儿童慈善医疗堪萨斯城分院儿童健康生活方式与营养中心) Kaiser Permanente Washington Health Research Institute(凯撒永久华盛顿健康研究所) Department of Kinesiology and Nutrition, University of Illinois Chicago(芝加哥伊利诺伊大学运动机能学与营养系)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本研究提出基于髋部加速度计数据预训练的CNN-BiLSTM模型CHAP,可迁移至腕部数据实现坐/非坐分类,微调后性能优于从头训练的Transformer,为腕部传感器久坐行为检测提供了有效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02939 2026-08-05 cs.LG cs.CY 新提交 57%

Federated generative event models for tokenized electronic health records

面向分词电子健康记录的联邦生成事件模型

Michael C. Burkhart, Luke Solo, Inhyeok Lee, S'Khaja Charles, Zewei "Whiskey" Liao, Kaveri Chhikara, Dema Therese, Wan-Ting Liao, Catherine A. Gao, William F. Parker, Brett K. Beaulieu-Jones

机构 * University of Chicago(芝加哥大学) Northwestern University Feinberg School of Medicine(西北大学费恩伯格医学院)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.LG

AI总结 本研究评估了面向分词电子健康记录的联邦生成事件模型(GEMs),其跨站点性能优于LightGBM,联邦学习(FedAvg、FedAvgM)表现接近集中式训练,为解决电子健康记录模型的数据孤岛问题提供了可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏