arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-10 至 2026-08-10 共收录 19 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 19 篇

2608.06977 2026-08-10 cs.CL 新提交 90%

Confirming Our Biases? Evaluating the Capabilities, Risks, and Societal Impact of Large Language Models

确认我们的偏见?评估大型语言模型的能力、风险与社会影响

Mudar Adas, Polina Tsvilodub, Michael Franke, Martin V. Butz

机构 * University of Tübingen(蒂宾根大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本研究评估6个大型语言模型(LLMs)对160条跨10个主题的提示的响应,发现LLMs会系统调整响应以匹配提示框架,甚至在事实类情境中也如此,明确了其可被操纵的程度与界限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06589 2026-08-10 cs.CL cs.AI 新提交 90%

Beyond "AI Language": The case for the idiolectal nature of LLM output

超越“AI语言”:论大语言模型输出的个体方言本质

Karolina Rudnicka, Thomas Stephan Juzek

专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出LLM输出具有个体方言本质,通过分析两个LLM生成文本数据集,发现模型间存在独特语言特征,该视角对多领域研究有潜在价值。

Comments 33 pages, 6 figures, 6 tables. Submitted as a chapter to the post-workshop volume "Corpus Linguistics 2040" (Digital Linguistics series)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09717 2026-08-10 cs.LG cs.AI 版本更新 85%

Provable Training Data Identification for Large Language Models

大语言模型训练数据的可证明识别

Zhenlong Liu, Hao Zeng, Weiran Huang, Hongxin Wei

机构 * Department of Statistics and Data Science, Southern University of Science and Technology(统计与数据科学系,南方科技大学) Shanghai Innovation Institute(上海创新研究院) School of Computer Science, Shanghai Jiao Tong University(计算机科学学院,上海交通大学)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.AI、cs.LG

AI总结 本文提出PTDI方法,通过集级推断实现大语言模型训练数据识别的可证明误差控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06398 2026-08-10 cs.AI 新提交 84%

EntropyMoE: Entropy-Aware Sparse Expert Routing for Tokenizer-Free LLMs

EntropyMoE:面向无分词器大语言模型的熵感知稀疏专家路由

Bo Liu, Muxuab Yu, Yu Zhang, Pengfei Gao, Yongping Zhang

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 EntropyMoE针对无分词器字节级LLM的块计算局限性,提出基于块熵的稀疏专家路由MoE架构,在降低位每字节的同时保持下游准确率,扩展了MoE建模的应用范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06122 2026-08-10 cs.LG cs.AI 版本更新 84%

Is Self-Pretraining really useful to improve diagnosis in medical Time Series?

自预训练(SPT)真的有助于改进医疗时间序列的诊断吗?

Omar Coser, Antonio Orvieto, Paolo Soda, Loredana Zollo

机构 * Università Campus Bio-Medico di Roma(罗马生物医学大学校园大学) Umeå University(于默奥大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ELLIS Institute Tübingen(埃利斯研究所蒂宾根分所)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究探究自预训练(SPT)对Transformer在医疗时间序列诊断任务的影响,发现SPT可提升分类准确率0-6个百分点,是无需修改架构的通用有效策略。

Comments 21 pages, 7 figures,4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06659 2026-08-10 cs.AI 新提交 83%

CellWorld: From Gene-Level Reconstruction to Latent Cell Prediction in Spatial Transcriptomics Foundation Models

CellWorld:空间转录组学基础模型中从基因水平重建到潜在细胞预测

Haiping Liu, Qian Zhao, Lijing Lin, Jingyuan Sun, Hongpeng Zhou

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出CellWorld,将空间转录组学基础模型的预测目标从基因测量转向潜在细胞表示,在多基准测试中其性能优于现有基线,仅用5%语料库预训练的大型模型也表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07316 2026-08-10 cs.CL cs.AI cs.SI 新提交 82%

Natural Language Processing Psychometrics

自然语言处理心理测量学

Edoardo Sebastiano De Duro, Emma Franchino, Massimo Stella

机构 * University of Trento(特伦托大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 该研究将文本心理预测视为心理测量问题,用9种LLM角色完成问卷,结合多特征构建RF模型,解释了SWLS等的方差,还能区分角色、分类临床与对照参与者,明确了NLP心理测量的区分方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18904 2026-08-10 cs.SD cs.AI cs.CL 版本更新 82%

MetaSICL: Globalizing Auditory LLMs for Underserved Speakers and Languages via Meta Speech In-Context Learning

MetaSICL: 通过元语音上下文学习适应听觉大语言模型

Haolong Zheng, Siyin Wang, Zengrui Jin, Mark Hasegawa-Johnson

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出MetaSICL方法,利用高资源语音数据通过元学习增强听觉大语言模型的上下文学习能力,在低资源场景下优于直接微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05903 2026-08-10 cs.CV cs.RO 版本更新 82%

Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models

Robust-WAM:桥接生成式预训练与世界-动作模型中的语义前瞻

Haodong Yan, Junfeng Li, Junjie He, Zhide Zhong, MingMing Yu, Wenxuan Song, Jiaguan Zhu, Yangyang Zheng, Yuqiao Du, Jiadi You, Yingjie Cai, Xu Yan, Guanyi Zhao, Bingbing Liu, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beihang University(北京航空航天大学) Huawei Foundation Model Department(华为基础模型部门)

专题命中 预训练与数据 :pretraining(title,abstract);post-training(abstract)

AI总结 Robust-WAM是一种通用后训练方法,在保留VAE生成路径的同时添加语义前瞻对齐,可提升多个WAM基线在分布外条件下的动作预测成功率且不损失分布内性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06506 2026-08-10 cs.CL 新提交 79%

Measuring the Cross-Lingual Comprehension Gap: How the language of the evidence shapes what language models understand

测量跨语言理解差距:证据语言如何影响语言模型的理解能力

Rafael da Silva, Jeff Eicher

机构 * Eastern University(东方大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 该研究定义跨语言理解差距(CLCG),通过ParallelQA-18评估5种模型,发现英语能力无法同等迁移,低资源语言用户的模型质量可能被英语中心评估高估。

Comments 55 pages, 17 figures. Submitted to Computational Linguistics (MIT Press / ACL). Supplementary Material: 55 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06791 2026-08-10 cs.AR cs.AI 新提交 77%

HLSmith: An Expert-Guided Agentic Framework for C/C++-to-HLS Translation

HLSmith:专家引导的C/C++到HLS转换智能体框架

Yuebo Luo, Ahmad Sedigh Baroughi, Philip Stachura, Le Chen, Venkatram Vishwanath, Zhenman Fang, Caiwen Ding

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出HLSmith框架,结合HLS优化专业知识库、分阶段反馈驱动编排流程及模型适配流水线,在PolyBench上较ChatHLS实现4.24倍几何平均加速比,所有基准均生成正确设计,开放权重模型下最高加速比达138倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27435 2026-08-10 cs.CL cs.AI 版本更新 73%

Improving Attributed Long-form Question Answering with Intent Awareness

通过意图意识提升带有属性的长形式问答

Xinran Zhao, Aakanksha Naik, Jay DeYoung, Joseph Chee Chang, Jena D. Hwang, Tongshuang Wu, Varsha Kishore

机构 * Allen Institute for AI(艾伦人工智能研究所) Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过增强模型意图意识来提升长报告生成质量,通过结构化标签方案提取隐含意图,改进零样本生成能力并生成高质量合成数据,实验显示在科学报告生成任务中模型性能平均提升2.9和12.3个百分点。

Comments 39 pages, 7 figures

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05663 2026-08-10 cs.CV cs.SD 版本更新 67%

Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming

Vorch-Streamer:将人类音视频生扩展至实时长格式流式生成

Menglin Han, Yang Ding, Yulei Lu, Haoran Yu, Xin Ma, Junyi Chen, Zhangkai Ni, Lin Ma, Yaohui Wang

机构 * Vorch Team(Vorch团队) Tongji University(同济大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :language model(abstract);post-training(abstract)

AI总结 Vorch-Streamer是一款后训练框架,通过混合训练、自强制与DMD蒸馏等技术,实现了超24 FPS的实时长格式T2AV流式音视频生成,兼具音唇同步性与身份保留能力。

Comments Project page: https://vorch-project.github.io/Vorch-Streamer-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07323 2026-08-10 cs.LG 新提交 57%

Is SwiGLU's Open Positive Tail Necessary? Evidence from Closed-Tail Gating with MemGLU

SwiGLU的开放正尾是否必要?来自带MemGLU的闭尾门控的证据

Yuting Ge, Pengju Yang, Mingkai Nie

机构 * City University of Hong Kong(香港城市大学) Beihang University(北京航空航天大学) National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 该研究针对仅解码器的语言模型FFN,通过对比实验发现,源自忆阻分支几何的MemGLU在相近损失下无需SwiGLU的开放正尾即可表现良好,表明模型会适应预训练的门控几何。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07249 2026-08-10 cs.CL 新提交 57%

Stoicheia: Character-Level Masked Diffusion for Ancient Greek Textual Restoration, Parsing, and Metrical Scansion

Stoicheia:用于古希腊语文本恢复、句法分析与韵律扫描的字符级掩码扩散模型

Eric Cullhed, Albin Thörn Cleland

机构 * Uppsala University(乌普萨拉大学) Lund University(隆德大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL

AI总结 本研究提出4.05亿参数的Stoicheia字符级掩码扩散模型,通过多维度输入设计实现古希腊语文本恢复、句法分析等任务,在三项实验中均优于对照模型,且在Ithaca测试集上显著降低字符错误率、提升Top-1准确率。

Comments 12 pages, 7 tables. Models, datasets and code released: https://huggingface.co/collections/Ericu950/stoicheia-6a6fbf9800c82d93020a7ceb and https://github.com/ericu9500/stoicheia

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07222 2026-08-10 cs.CL 新提交 57%

Skaling: Chinchilla's Exponents Meet Kaplan's Coupling

Skaling:Chinchilla的指数与Kaplan的耦合

Mathurin Videau, Badr Youbi-Idrissi, David Lopez-Paz, Kartik Ahuja

机构 * FAIR at Meta(Meta FAIR实验室)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 针对神经缩放定律的独立假设缺陷,提出Skaling定律耦合模型容量与数据,可降低MAPE,用更少计算实现准确外推,为模型训练预算分配提供稳健框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18662 2026-08-10 cs.LG 版本更新 57%

Large Causal Models for Temporal Causal Discovery

大规模因果模型用于时间因果发现

Nikolaos Kougioulis, Nikolaos Gkorgkolis, MingXue Wang, Bora Caglayan, Dario Simionato, Andrea Tonon, Ioannis Tsamardinos

机构 * Institute of Applied & Computational Mathematics, FORTH(应用与计算数学研究所,希腊国家科研院) Computer Science Department, University of Crete(克里特大学计算机科学系) Huawei Ireland Research Centre(华为爱尔兰研究中心)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出大规模因果模型(LCMs),通过结合合成生成器与现实数据集,实现大规模时间因果发现,提升模型性能与泛化能力。

Comments Accepted at European Conference on Machine Learning and Knowledge Discovery in Databases (ECML PKDD) 2026. 33 pages (including Appendix), 11 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06769 2026-08-10 cs.CV cs.AI 57%

Stitch and Tell: A Structured Multimodal Data Augmentation Method for Spatial Understanding

拼接与讲述:一种结构化多模态数据增强方法用于空间理解

Hang Yin, Xiaomin He, PeiWen Yuan, Yiwei Li, Jiayi Shi, Wenxiao Fan, Shaoxiong Feng, Kan Li

机构 * School of Computer Science, Beijing Institute of Technology(北京理工大学计算机科学学院) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Xiaohongshu Inc(小红书公司)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI

AI总结 Stitch and Tell通过结构化空间监督提升视觉-语言模型的空间理解能力,有效缓解空间幻觉并提高相关任务性能。

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24485 2026-08-10 cs.RO 版本更新 50%

τ: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision

τ:从未来视觉监督中学习触觉增强的视觉-语言-动作模型

Ning Cheng, Jinan Xu, Wanlin Li, Yangzhi Chen, Jing Gao, Yiqun Wang, Kelan Peng, Wenjuan Han

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究旨在解决学习触觉表示并应用于VLA模型的挑战,提出τ框架从未来视觉监督学习动作条件时空触觉表示,结合视觉语言特征用于动作生成,引入TacAura数据集,实验证明其性能优于现有模型且能泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏