arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-15 至 2026-07-15 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 7 篇

2602.16726 2026-07-15 cs.MA 版本更新 91%

Bridging Individual and Collective Realism in LLM-Based Human Mobility Simulation via Mobility Scaling-Law Guidance

通过共享数据中的移动度量引导基于LLM的人群移动模拟

Hua Yan, Heng Tan, Yu Yang

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 M2LSimu通过共享数据中的移动度量引导多提示调整,有效提升基于LLM的人群移动模拟的群体协调与真实性

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04029 2026-07-15 cs.DB cs.AI cs.LG 版本更新 84%

PluRel: Synthetic Data unlocks Scaling Laws for Relational Foundation Models

PluRel: 合成数据解锁关系基础模型的扩展定律

Vignesh Kothapalli, Rishabh Ranjan, Valter Hudovernik, Vijay Prakash Dwivedi, Johannes Hoffart, Carlos Guestrin, Jure Leskovec

机构 * Stanford University(斯坦福大学) SAP Labs LLC(SAP实验室)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 PluRel通过合成多表关系数据库,实现了关系基础模型在扩展定律上的突破,展示了合成数据在提升模型泛化能力方面的潜力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12831 2026-07-15 cs.CL 新提交 83%

Knowledgeless Language Models: Suppressing Parametric Recall for Evidence-Grounded Language Modeling

无知识语言模型:抑制参数化记忆以进行基于证据的语言建模

Roi Cohen, Yvan Carré, Nick Lechtenbörger, Hendrik Droste, Lucas Kerschke, Russa Biswas, Gerard de Melo, Jan Buys

机构 * HPI / University of Potsdam(波茨坦大学哈索·普拉特纳数字工程学院) African Institute for Mathematical Sciences(非洲数学科学研究所) Department of Computer Science Aalborg University(奥尔堡大学计算机科学系) Department of Computer Science University of Cape Town(开普敦大学计算机科学系) Polytechnique Montréal(蒙特利尔理工大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 研究修改预训练信号能否使语言模型从参数化记忆转向基于证据的推理,引入无知识语言模型(KLLMs),其在命名实体匿名化语料库上预训练,实验表明能降低闭卷事实记忆,在多任务基准上表现优,提升鲁棒性与校准,为语言模型训练提供新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11020 2026-07-15 cs.CL cs.LG 版本更新 81%

Can a Language Model Learn Facts Continually in Its Weights?

语言模型能否在其权重中持续学习事实?

Charles O'Neill

机构 * Baseten(巴斯滕)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究语言模型能否在权重中持续学习事实,通过追踪写入Qwen3模型的虚构事实及实验发现,训练数据广度决定知识类型,事实可行为遗忘但不擦除,广泛数据能创建可用知识,可靠通道是上下文而非权重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12524 2026-07-15 cs.CR cs.SE 新提交 67%

Open-Source Intelligence for Code Provenance and the Security Patterns that Separate Human and Large-Language-Model Implementations of Common Programming Tasks

用于代码溯源的开源情报以及区分人类和大语言模型对常见编程任务实现的安全模式

Mohammadreza Rashidi

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 研究开发者代码来源(人类答案和大语言模型输出)的差异,利用开源构建管道收集样本,训练分类器区分溯源,报告安全差异,通过案例研究发现修复情况及问题,管道数据驱动可添加新任务或语言。

Comments 25 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12360 2026-07-15 cs.LG 新提交 57%

Same Loss, Same Noise, Opposite Schedules: Noise Structure and Optimizer Normalization Jointly Determine Whether Learning-Rate Cooldown Helps

相同损失、相同噪声、相反调度:噪声结构和优化器归一化共同决定学习率冷却是否有帮助

Subham Singh, Ashutosh Mishra, Subha Raut

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 研究热身 - 稳定 - 衰减学习率调度中冷却阶段效果,发现其取决于梯度噪声结构和优化器更新归一化。通过理论分析和模拟,揭示不同情况下冷却的作用机制,还在真实分类任务中验证噪声 regime 诊断,解释冷却是否有帮助。

Comments 11 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12079 2026-07-15 cs.CL 新提交 57%

The Capacity of Thought: Benchmarking Llama 3.2 in Semantic fMRI Neural Language Decoding and Improving the Huth Encoding-Model Baseline

思维的能力:在语义功能磁共振成像神经语言解码中对Llama 3.2进行基准测试并改进Huth编码模型基线

Milos Suvakovic, Dom Marhoefer, Glenn Grant-Richards, Aidan Pinero

机构 * UC Santa Cruz(加州大学圣克鲁兹分校)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 研究从fMRI信号中解码连续语言的挑战,一方面改进Huth编码管道,另一方面引入fMRIFlamingo,发现高容量语言模型本身未提升fMRI解码能力,且无严格评估会掩盖失败,强调盲控评估的重要性。

Comments 7 pages, 2 tables, 2 figures. Preprint. NLP 244: Advanced Machine Learning for Natural Language Processing report, UC Santa Cruz

详情

展开后加载摘要…

URL PDF HTML 收藏