arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-23 至 2026-07-23 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 13 篇

2412.10924 2026-07-23 cs.CL cs.AI 91%

Tokens, the oft-overlooked appetizer: Large language models, the distributional hypothesis, and meaning

Tokens,常被忽视的开胃菜:大语言模型、分布假说和意义

Julia Witte Zimmerman, Denis Hudon, Kathryn Cramer, Alejandro J. Ruiz, Calla Beauregard, Ashley Fehr, Mikaela Irene Fudolig, Bradford Demarest, Yoshi Meke Bird, Milo Z. Trujillo, Christopher M. Danforth, Peter Sheridan Dodds

机构 * Computational Story Lab(计算故事实验室) Vermont Complex Systems Institute(佛蒙特复杂系统研究所) University of Vermont(佛蒙特大学) Department of Computer Science(计算机科学系) St. Michael’s College(圣米歇尔学院) Communication Media and Marginalization Lab(传播媒体与边缘化实验室) Northeastern University(东北大学) Department of Mathematics & Statistics(数学与统计学系)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 研究探讨大语言模型中令牌化对认知的影响,指出分布假说足以实现人类样语言性能,并提出改进令牌化技术以减少偏见和提升语义理解。

Comments Accepted at IC2S2 2026 and SLSA @ 4S 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19992 2026-07-23 cs.CL cs.AI cs.DL cs.HC 新提交 88%

TINY_SCHILLER: A Drop-In German Drama Corpus for Small Language Models

TINY_SCHILLER:用于小语言模型的即插即用德语戏剧语料库

Mark Schutera

机构 * Duale Hochschule Baden-Württemberg Ravensburg(巴登-符腾堡双元制应用技术大学 Ravensburg)

专题命中 预训练与数据 :language model(title,abstract);small language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对德语文学文本在小语言模型相关应用的空白,提出Tiny_schiller语料库,经特定处理,可通过单文件和一行代码让小语言模型接触德语文学文本,填补了相关研究和应用的空白。

Comments 5 pages. Dataset: https://huggingface.co/datasets/mrkschtr/tiny_schiller ; Code: https://github.com/schutera/tiny_schiller

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16900 2026-07-23 cs.AI 版本更新 86%

Environment-free Synthetic Data Generation for API-Calling Agents

用于 API 调用智能体的无环境合成数据生成

Seanie Lee, Sanjoy Chowdhury, Chao Jiang, Cheng-Yu Hsieh, Ting-Yao Hu, Alexander T Toshev, Oncel Tuzel, Raviteja Vemulapalli

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对训练 API 调用 LLM 智能体数据收集瓶颈问题,提出无环境合成数据生成方法,利用 LLMs 生成任务、响应等,经评判器过滤轨迹,在相关基准上评估,结果表明此方法可有效训练智能体,是实用可扩展方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20346 2026-07-23 cs.CE physics.flu-dyn 新提交 86%

IteraSim RAG: A Multi-Stage Retrieval-Augmented Agentic Back-End for OpenFOAM-Based Computational Fluid Dynamics

IteraSim RAG:基于OpenFOAM的计算流体动力学的多阶段检索增强智能后端

Pratyush Kumar

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对OpenFOAM配置CFD案例的难题,提出IteraSim RAG。通过LLM扩展查询、多种融合与重排策略及多智能体分工协作,结合规范知识层。在28个案例基准测试中表现良好,能完成配置、诊断修复问题,还公布相关内容以保障可重复性。

Comments 40 pages, 7 figures, 5 tables. Submitted to Computer Physics Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00462 2026-07-23 cs.CV cs.AI 版本更新 81%

LatentLens: Revealing Highly Interpretable Visual Tokens in LLMs

LatentLens: 揭示大语言模型中高度可解释的视觉标记

Benno Krojer, Shravan Nayak, Oscar Mañas, Vaibhav Adlakha, Desmond Elliott, Siva Reddy, Marius Mosbach

机构 * University of Cambridge(剑桥大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出 LatentLens 方法,通过将视觉标记与文本语料库中的上下文标记表示进行最近邻匹配,实现视觉标记的可解释性,发现大多数视觉标记在各层均具有可解释性。

Comments ICML 2026 (Camera Ready)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19524 2026-07-23 cs.LG cs.AI cs.DC 新提交 81%

SynPre-FL: Synthetic data-driven pretraining integrated Federated Learning training framework

SynPre-FL:合成数据驱动的预训练集成联邦学习训练框架

Akarsh K Nair, Muhammad Arifur Rahman, Nicholas Shopland, Andy Burton, Jun He, Yuan Shen, David Baldwin, Emma O'Dowd, Amna Burzic, Mufti Mahmud, David J. Brown

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对联邦学习在临床风险预测中面临的问题及局限,提出SynPre-FL框架,结合合成EHR生成与合成预训练联邦学习,通过潜在自动编码器扩散模型等技术,提升非IID条件下预测的稳健性、可扩展性与可解释性。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20251 2026-07-23 cs.CL 新提交 79%

Exposure is Optional: Learning Unlike Coordination in Language Models

曝光非必需:语言模型中学习不同类别的并列结构

Jiamu Luo, Shane Steinert-Threlkeld

机构 * University of Washington(华盛顿大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 研究语言模型中不同类并列结构习得是否需直接曝光,用过滤语料库训练GPT-2模型,发现无需直接曝光,模型能泛化处理,还揭示了模型处理方式及可从同类并列结构学习,助力理解语言模型结构表示。

Comments 13 pages, 6 tables, 2 figures, to submit to TACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20310 2026-07-23 q-bio.NC 新提交 75%

Capturing Inner Experience At Scale: An AI Interviewer Co-Developed with the Founder of a Landmark Phenomenological Method

大规模捕捉内心体验:与一种具有里程碑意义的现象学方法的创始人共同开发的人工智能访谈者

Jona Carmon, Clara Bersch, Charles Fernyhough, Russell T. Hurlburt, Simone Kühn

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究聚焦于主观体验研究中深度与规模的权衡问题,核心方法是将描述性经验抽样法转化为人工智能访谈者的推理架构,主要贡献是开发出首个基于既定方法研究内心体验的人工智能访谈者及相关平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19771 2026-07-23 cs.LG cs.AI 新提交 73%

An Isotropy-Preserving Spectral Cap for Muon: Theory and Three Case Studies

用于μ子的各向同性保持谱帽:理论与三个案例研究

Jiachun Li

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究μ子和相关矩阵符号优化器对权重矩阵的影响,提出基于尺度不变性假设的统一框架及轻量级“谱帽”,通过三个案例研究表明谱帽可增加各向同性并防止失败,验证损失基本不变,结果为初步的。

Comments Preliminary Report; Larger scale experiments ongoing; Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27396 2026-07-23 cs.SE cs.LG 版本更新 70%

Test-Input Generation for Tensor Programs: What Actually Finds Kernel Bugs

张量程序测试输入生成:什么真正发现内核错误

Dipankar Sarkar

机构 * Arizona State University(亚利桑那州立大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 通过GPU模拟器模糊测试,比较七种测试生成策略在26个操作上的效果,发现边界形状采样在错误召回率(78%)和假阳性率(0%)上表现最佳。

Comments 8 pages, 1 figure, LNCS format. Companion paper: arXiv:2606.20128

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10216 2026-07-23 cs.CL 版本更新 70%

The Impact of Editorial Intervention on Detecting Native Language Traces

编辑干预对检测母语痕迹的影响

Ahmet Yavuz Uluslu, Mark Gales, Kate Knill, Gerold Schneider

机构 * University of Cambridge(剑桥大学) University of Zurich(苏黎世大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了编辑干预对母语识别鲁棒性的影响,发现深层母语特征在轻微编辑中仍能保持,而流畅性编辑和改写会显著降低识别性能。

Comments KONVENS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19718 2026-07-23 cs.CL 新提交 57%

Lightweight Person-Place Relation Extraction from Historical Newspapers with Dependency Graphs and Proximity Features

利用依存图和邻近特征从历史报纸中进行轻量级人物-地点关系提取

Mlen-Too Wesley

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 研究从历史报纸中提取人物-地点关系,构建文档级图,提取实体对特征,用小型模型分类。在官方评估中取得一定成绩,发现最小字符距离重要,且文档分组交叉验证对避免数据泄漏、保证结果可靠至关重要。

Comments 19 pages, 4 figures. Accepted at CLEF 2026 HIPE Shared Task. To appear in CEUR Workshop Proceedings (CEUR-WS.org)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02402 2026-07-23 cs.CV 版本更新 50%

Show Me Examples: Inferring Visual Concepts from Image Sets

展示示例:从图像集合中推断视觉概念

Nick Stracke, Kolja Bauer, Stefan Andreas Baumann, Miguel Angel Bautista, Josh Susskind, Björn Ommer

机构 * Munich Center for Machine Learning(慕尼黑机器学习中心) Apple(苹果公司)

专题命中 预训练与数据 :language model(abstract)

AI总结 提出VICIS任务评估视觉语言模型从图像集合中推断共享概念的能力,并设计训练框架与架构,使模型能提取概念嵌入并生成与查询一致的新图像。

Comments for code, view https://github.com/CompVis/set-learner

详情

展开后加载摘要…

URL PDF HTML 收藏