arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-14 至 2026-08-14 共收录 23 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 23 篇

2608.12419 2026-08-14 cs.LG 新提交 94%

LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining

LoKiFormer:面向高效大语言模型预训练的 locality-aware 注意力与解耦知识记忆

Qiuwu Chen, Zimo Liu, Yuchen Li, Ying Sun, Yifan Zhang, Zhijie Qiu, Zeng You, Ryan Dong, Simeng Ma, Yaofo Chen, Mingkui Tan

机构 * AIGCode South China University of Technology(华南理工大学) Pazhou Laboratory(琶洲实验室)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);pretraining(title,abstract)

AI总结 针对LLM预训练效率问题,提出含局部融合注意力与知识记忆模块的LoKiFormer,使预训练收敛速度提升1.33倍,性能优于现有架构。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12339 2026-08-14 cs.CL cs.AI cs.HC 新提交 90%

Mimicry without understanding: the origins of decision bias in large language models

无理解的模仿:大语言模型中决策偏差的起源

Eldad Yechiam, Adi Tarabeih

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究揭示大语言模型(LLMs)存在两类偏差生成机制,经四项经济偏差实验发现ChatGPT-4o和Qwen会表现出社会认同偏差与损失厌恶偏差,偏差程度可被科学报告预测,还明确了LLMs偏差的潜在组成过程。

Comments 33 pages, 3 figures, 2 boxs

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13545 2026-08-14 cs.CL cs.AI cs.LG 新提交 89%

LittleLearner: Language Models Under Pedagogically Controlled Knowledge Exposure

LittleLearner:受教学可控知识暴露约束的语言模型

Fanfei Li, Jana Zeller, Manuel Prada-Corral, Thaddäus Wiedemer, Prasanna Mayilvahanan, Ryan Cotterell, Wieland Brendel

机构 * Ellis Institute(埃利斯研究所)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract);post-training(abstract)

AI总结 本研究推出专为美国小学定制的LITTLECURRICULUM语料库,训练得到受知识边界约束的LittleLearner模型,构建沙盒用于研究模型知识习得,实验证实其注入新知识后不会提升超范围能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12741 2026-08-14 cs.IR 新提交 89%

Knowledge Synthesis Review Framework: Task-Level Benchmarking of LLM-Based Systems for Multi-Source Evidence Synthesis

知识综合评审框架:面向多源证据综合的基于大语言模型系统的任务级基准测试

Wafa Shafqat, Mark Patterson, Steven N. Liss

专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出KSR人机协作框架,将证据综合拆分为4项任务,对4款LLM系统开展任务级基准测试,发现各系统各有优劣,该框架可揭示单源综合遗漏的信息,且透明可审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13515 2026-08-14 cs.CL 新提交 88%

Measuring Task-Agnostic Training Data Influence Across Language Model Pretraining

测量语言模型预训练中与任务无关的训练数据影响

Yuto Nishida, Hirokazu Kiyomaru, Yusuke Oda, Takashi Kodama, Chaoran Liu, Daisuke Kawahara, Yusuke Miyao, Max Müller-Eberstein, Masaru Isonuma

机构 * Nara Institute of Science and Technology(奈良科学技术研究所) Waseda University(早稻田大学) The University of Tokyo(东京大学) IT University of Copenhagen(哥本哈根信息技术大学) Tohoku University(东北大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL

AI总结 本文提出无需依赖下游任务或验证集的训练数据影响度量方法,经实验发现预训练中有影响力的数据存在时间变化,早期文献相关数据、后期STEM数据与最终参数轨迹的一致性更强。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13101 2026-08-14 cs.CL eess.AS 新提交 88%

CASA: Content-Acoustic Speaking Assessment with Speech Encoder and Large Language Model

CASA:结合语音编码器与大语言模型的内容-语音口语评估

Nhan Phan, Ilona Lähteenmäki, Anna von Zansen, Olli-Pekka Pauna, Yaroslav Getman, Tamás Grósz, Mikko Kurimo

机构 * Aalto University(阿尔托大学) University of Helsinki(赫尔辛基大学) Walton Institute(沃尔顿研究所)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 该研究提出结合Whisper-medium与Qwen3.5-2B的CASA架构,在Speak & Improve Corpus 2025上RMSE达0.358,参数量减半,可分离语音表达与内容,还分析了声学与内容信息的贡献及性能稳定性。

Comments To be submitted to ICASSP 2027. Code is available at https://github.com/aalto-speech/casa

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12762 2026-08-14 cs.AI 新提交 88%

PROVE-RT: Generating Mechanized Theorem Prover Scripts for Real-Time Systems using LLMs

PROVE-RT:使用大语言模型为实时系统生成机械化定理证明器脚本

Sadat Shahriyar, Shareef Ahmed, Abdullah Al Arafat

机构 * Florida International University(佛罗里达国际大学) University of South Florida(南佛罗里达大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 PROVE-RT是一种LLM辅助框架,通过依赖感知草图、PROSA文档检索等步骤生成PROSA/ROCQ脚本,在1191篇实时系统论文构建的语料库上,其机械化可调度性分析的成功率达44.7%,优于直接提示的LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13277 2026-08-14 cs.CL cs.AI 新提交 87%

Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model

训练混合:将小规模支架式预训练运行重组为更大的语言模型

Mohammed Sabry, Sean Augenstein, Keith Rush, Lucio Dery

机构 * Google(谷歌公司) School of Computing, Dublin City University(都柏林城市大学计算机学院)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.AI

AI总结 本研究提出训练混合(MoT)框架,将Transformer划分为层块在冻结对齐器内独立训练后重组,在13亿参数Gemma模型上验证其可重组为可用语言模型,可复用对齐器实现计算优势,用于研究可复用训练单元。

Comments Accepted at the Workshop on Methods and Opportunities at Small Scale (MOSS), COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13517 2026-08-14 cs.CL cs.AI 新提交 86%

DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data

DFM Mimir v1:仅使用许可的后训练数据,在10亿参数规模下实现前沿性能的开放HRM模型

Peter Schneider-Kamp, Jacob Nielsen, Gianluca Barmina, Kenneth Enevoldsen, Lukas Galke Poech

专题命中 预训练与数据 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究人员因大模型开发依赖非许可数据受阻,本文提出仅用许可后训练数据训练的10亿参数HRM模型Mimir v1,其在多基准测试中性能优于同规模HRM-Text 1B,可与更大前沿模型媲美,且在丹麦语任务达新SOTA,已发布于Hugging Face Hub

Comments Technical Report, 20 Pages, 1 Model, Hierarchical Reasoning Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11911 2026-08-14 quant-ph cond-mat.dis-nn cond-mat.str-el cs.AI 版本更新 85%

Hamilton-Zero: A Neural Tensor-Network Foundation Model for Ground States of Arbitrary Quadratic Qubit Hamiltonians

Hamilton-Zero:适用于任意二次量子比特哈密顿量基态的神经张量网络基础模型

Timothy Heightman, Elena Orlova, Philip Mantrov, Aleksei Ustimenko

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出Hamilton-Zero基础模型,将二次量子比特哈密顿量基态学习转化为流形变分优化,经预训练、微调后可在8100量子比特系统上评估,突破经典模拟局限,实现量子基态的高效计算。

Comments 22 pages main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13482 2026-08-14 cs.LG cs.AI cs.CL 新提交 85%

Synthetic Persona Pretraining: Alignment from Token Zero

合成角色预训练:从零开始的对齐

Julian Minder, Viktor Moskvoretskii, Raghav Singhal, Difan Jiao, Andy Arditi, Shaobo Cui, Yiderigun Borjigin, Kartik Bali, Stefan Krsteski, Harsh Raj, Huu Nguyen, Jannik Brinkmann, Ashton Anderson, Roland Aydin, Robert West

机构 * EPFL(洛桑联邦理工学院) University of Toronto(多伦多大学) Northeastern University(东北大学) SJTU(上海交通大学) Saarland University(萨尔大学) Hereon(亥姆霍兹极地与海洋研究中心) TUHH(汉堡工业大学) Ontocord AI(Ontocord人工智能公司) TUC(德累斯顿工业大学) DFKI(德国人工智能研究中心)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出合成角色预训练(SPP),在预训练token零阶段植入助手角色,通过标注反思、预训练及角色绑定,提升模型价值构成遵循度与鲁棒性,降低对齐错误率,证明预训练时角色干预是对齐的有效方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10473 2026-08-14 cs.LG cs.AI 版本更新 84%

Critic-Free Pretraining for Efficient Online Reinforcement Learning Fine-Tuning

用于高效在线强化学习微调的无评判者预训练

Daoyi Li, Yixian Zhang, Wenbo Ding, Yu Wang, Chao Yu

机构 * Tsinghua University(清华大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究针对离线转在线强化学习中复用离线评判者导致的适配问题,提出无评判者预训练范式,兼容主流算法且在多任务上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18383 2026-08-14 cs.LG 版本更新 83%

TabH2O: A Unified Foundation Model for Tabular Prediction

TabH2O:用于表格预测的统一基础模型

Pascal Pfeiffer, Dmitry Gordeev, Mathias Müller, Laura Fink, Joan Salvà Soler, Mark Landry, Branden Murray, Marcos V. Conde, Sri Satish Ambati

机构 * H2O.ai

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出TabH2O,一种统一的基础模型,通过上下文学习在单次前向传递中实现分类和回归。该模型基于TabICL架构进行了关键改进,包括统一训练、单阶段预训练和噪声感知预训练,从而在表格数据预测任务中表现出色。

Comments Technical Report - https://tabh2o.h2oai.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13183 2026-08-14 cs.CV 新提交 82%

A Controlled Study of Self-Supervised Image and Video Pretraining under Limited Resources

有限资源下自监督图像与视频预训练的对照研究

Brunó B. Englert, Gijs Dubbelman

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract)

AI总结 该研究对照研究有限资源下的图像与视频自监督预训练,发现DINOv2式预训练性能最优,结合其与VideoMAE可提升图像任务性能但降低部分视频任务性能,为资源有限场景的视觉模型训练提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26661 2026-08-14 cs.AI 版本更新 81%

AgenticCANN: Automated Ascend C Operator Generation via Knowledge-Augmented Agentic Evolution

AgenticCANN:基于知识增强的智能体演化的自动昇腾C算子生成

Junhao Qiu, Zidong Wang, Yansong Sun, Zhitong Ma, Ping Guo, Qingfu Zhang

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对昇腾C算子生成的独特挑战,提出AgenticCANN知识增强智能体演化框架,在昇腾910B实验中实现高可行性与加速效果,验证了知识注入的通用性优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06161 2026-08-14 cs.AI 版本更新 77%

iARCS: Iterative Agentic RL for Controllable 3D Scene Generation

iARCS:用于可控3D场景生成的迭代智能体强化学习

Saugat Adhikari, Ashok Prasad Neupane, Pramish Paudel, Ajad Chhatkuli, Danda Pani Paudel

机构 * Tribhuvan University(特里布文大学) Pulchowk Campus, IOE, Tribhuvan University(特里布文大学工程学院普尔乔克校区) NAAMII(尼泊尔先进数学与信息学研究所) INSAIT, Sofia University “St. Kliment Ohridski”(索菲亚大学圣克莱门特奥赫里德斯基分校INSAIT)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.AI

AI总结 研究针对现有3D场景生成器无法满足任务约束的问题,提出iARCS迭代智能体强化学习框架,通过两阶段策略优化约束保真度,生成的数据可改进基础生成器,具实用价值。

Comments 15 pages, 9 figures, 4 tables. Includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12750 2026-08-14 cs.CL cs.AI cs.HC 新提交 73%

PatientAct: Theory-Grounded Mental Health Client Simulation

PatientAct:基于理论的心理健康来访者模拟

Sahand Sabour, TszYam NG, Yaqian Chen, Guanqun Bi, Jialu Zhao, Minlie Huang

机构 * Tsinghua University(清华大学) Beijing Normal University(北京师范大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 PatientAct是基于临床理论的来访者模拟框架,通过整合5Ps临床案例 formulation与带信任阈值的动态记忆层,生成高临床合理性的多样化来访者,在40种临床情境中较基线方法显著提升了抗拒质量与行为真实性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22699 2026-08-14 cs.AI cs.CL 版本更新 73%

Similarity All The Way Up: Multilingual Generalization in LLMs Relies on Language-Level Similarity Structures

一路相似:大语言模型中的多语言泛化依赖于语言层面的相似性结构

Supantho Rakshit, Adele Goldberg, Henry Conklin

机构 * Princeton University(普林斯顿大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型多语言泛化能力,通过借鉴认知科学,探究其对不同语言层次相似性结构的捕捉,发现潜在表示能恢复印欧语系语言家族树结构,且模型反映语言相似性程度与XNLI表现相关,扩展了相似性驱动泛化工作。

Comments Accepted for oral presentation at CogSci 2026 (48th Annual Meeting of the Cognitive Science Society), Rio de Janeiro. 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12574 2026-08-14 cs.AI cs.FL 新提交 70%

Trie Automata for Constrained Decoding over Large Finite Sets

用于大有限集上约束解码的Trie自动机

Xingzi Xu, Karim Bouyarmane

机构 * Amazon(亚马逊公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大型语言模型有限集约束解码的速度瓶颈,提出Trie自动机机制,通过预计算token掩码实现高效解码,在批量服务中吞吐量较XGrammar提升29倍,且编译与计算效率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13384 2026-08-14 cs.IR cs.DB 新提交 67%

Structure then Query: Enabling Precise Analytical Queries over Unstructured Documents

先结构后查询:支持对非结构化文档进行精确分析查询

Teng Lin, Yuyu Luo, Nan Tang

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 AnnoIndex通过注释索引与结构化查询引擎,解决非结构化文档精确分析查询难题,在三个数据集上平均F1达0.87,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12911 2026-08-14 cs.CV cs.CR cs.MM 新提交 67%

Beyond Visual Evidence: Revealing and Mitigating Relational Privacy Leakage in Document MLLMs

超越视觉证据:揭示并缓解文档多模态大语言模型中的关系隐私泄露

Beining Xu, Hairui Wang, Jiaxin Wang, Changsheng Chen, Anirban Chakraborty

机构 * Faculty of Engineering, Shenzhen MSU-BIT University(深圳北理莫斯科大学工程学院) Faculty of CMC, Shenzhen MSU-BIT University(深圳北理莫斯科大学计算机、数学与力学学院) Department of CDS, Indian Institute of Science(印度科学学院计算机与数据科学系)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本文针对文档理解MLLMs的KIE任务,揭示其在视觉证据不足时会通过记忆的字段关系泄露隐私,提出DRUF框架与DocPrivacyBench基准,实验显示DRUF可提升泄露抑制效果并维持KIE性能。

Comments ACM mm 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03946 2026-08-14 astro-ph.GA astro-ph.IM 版本更新 67%

A Model Context Protocol Server for Astrophysical RAG: Unified Access to HI, Dwarf, Globular Cluster, IntZ, and ALPINE Kinematic Corpora with FAISS Semantic Search

用于天体物理RAG的模型上下文协议服务器:通过FAISS语义搜索统一访问HI、矮星系、球状星团、IntZ和ALPINE运动学语料库

David C. Flynn

专题命中 预训练与数据 :LLM(abstract,abstract_cn)

AI总结 介绍EPS Research Astro-RAG MCP Server v2.3.0,可跨平台统一访问五个天体物理语料库。核心方法是用FAISS加速自然语言相似性搜索,贡献是提供多接口,实现多种功能且可公开部署、完全可重现。

Comments 10 Pages 3 Tables 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08235 2026-08-14 eess.AS 版本更新 50%

SraVaani 1.0: Scaling Inclusive Speech Recognition for Indic Languages

SraVaani 1.0:面向印度语言的包容性自动语音识别规模化模型

Sujith Pulikodan, Agneedh Basu, Pavan Kumar J, Pranav D Bhat, Suryansh Shukla, Nihar Desai, Prasanta Kumar Ghosh

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出SraVaani 1.0,一款基于FastConformer架构的多语言ASR模型,覆盖65种印度语言,经三阶段训练后在8个基准上表现优异,是唯一支持多种低资源及部落印度语言转录的开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏