arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-02 至 2026-07-02 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 21 篇

2607.01006 2026-07-02 cs.CL 新提交 92%

Understanding Large Language Models

理解大型语言模型

Yannik Keller, Thomas Eisenmann

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文综述大型语言模型(LLM)的机制、涌现能力及与人类认知的关系,通过分析注意力机制、符号推理、心智理论等证据,探讨LLM是否真正理解语言,并反对过度简化的人机认知差异观点。

Comments 25 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22938 2026-07-02 cond-mat.mtrl-sci cs.CL cs.LG 版本更新 91%

Large language model-enabled automated data extraction for concrete materials informatics

基于大语言模型的混凝土材料信息学自动化数据提取

Zhanzhao Li, Kengran Yang, Qiyao He, Kai Gong

机构 * Department of Civil and Environmental Engineering, Rice University(Rice大学土木与环境工程系) Rice Advanced Materials Institute, Rice University(Rice大学先进材料研究所) Ken Kennedy Institute, Rice University(Rice大学肯尼迪研究所) Independent researcher(独立研究员)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出一种基于大语言模型的自动化数据提取方法,用于从非结构化科学文献中提取混凝土材料数据,构建了最大的开放实验室数据库,提升了材料信息学的数据基础设施发展。

Comments 21 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00018 2026-07-02 cs.CY 新提交 89%

The Limits of LLM Forecasting: Parametric Knowledge Gaps Across Conflict Zones

LLM预测的局限性:冲突区域间的参数化知识差距

Poli Nemkova

专题命中 预训练与数据 :LLM(title,title_cn)

AI总结 研究发现LLM在冲突预测中无法区分稳定与升级期,对低覆盖地区预测为总是升级,对高覆盖地区预测为从不升级,性能低于简单逻辑回归模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00274 2026-07-02 cs.CL cs.AI 新提交 89%

SEFORA: Student Essays with Feedback Corpus and LLM Feedback Evaluation Framework

SEFORA:学生论文反馈语料库及LLM反馈评估框架

Shayan Peyghambari Oskoui, Norah Almousa, Zhaoyi Joey Hou, Carolina Gustafson, Gayle Rogers, Raquel Coelho, Diane Litman, Xiang Lorraine Li

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 为解决大规模写作反馈中缺乏真实课堂反馈语料和评估方法的问题,构建了SEFORA语料库和UniMatch评估框架,实验表明LLM生成的反馈与教师反馈一致性低(F1≤0.4)。

Comments Under review for EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01104 2026-07-02 cs.LG cs.AI cs.CL 新提交 88%

CausalMix: Data Mixture as Causal Inference for Language Model Training

CausalMix: 数据混合作为语言模型训练的因果推断

Zinan Tang, Yukun Zhang, Shaomian Zheng, Zhuoshi Pan, Qizhi Pei, Dingnan Jin, Jun Zhou, Yujun Wang, Biqing Huang

机构 * Tsinghua University(清华大学) Ant Group(蚂蚁集团) Renmin University of China(中国人民大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出CausalMix框架,将数据混合优化视为因果推断问题,通过条件平均处理效应估计最优混合比例,在7B模型上提升多任务性能,并具备可解释性。

Comments 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00010 2026-07-02 cs.IR cs.AI cs.CL 新提交 87%

Prompt Optimization for User Simulation in Conversational Recommender Systems: A Multi-Objective Framework

对话推荐系统中用户模拟的提示优化:一个多目标框架

Nipun B Nair, Tongtong Wu, Weiqing Wang

机构 * Monash University(莫纳什大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出多目标框架自动优化LLM提示,以生成更真实、多样化的用户模拟行为,缓解对话推荐系统中的评估与数据获取难题。

Comments to be published in 2026 IEEE 42nd International Conference on Data Engineering Workshops (ICDEW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25198 2026-07-02 cs.AI 新提交 84%

Heuresis: Search Strategies for Autonomous AI Research Agents Across Quality, Diversity and Novelty

Heuresis: 自主AI研究智能体在质量、多样性和新颖性上的搜索策略

Antonis Antoniades, Deepak Nathani, Ritam Saha, Alfonso Amayuelas, Ivan Bercovich, Zhaotian Weng, Vignesh Baskaran, Kunal Bhatia, William Yang Wang

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Hexo AI

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出Heuresis框架,将研究流程抽象为通用原语,实现开放科学探索;在三个领域评估六种搜索策略,发现完全新颖的想法罕见且无法达到最高性能,揭示了当前策略无法扩展质量-新颖性前沿的挑战。

Comments 14 pages main text, 82 pages total including appendix; 38 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00293 2026-07-02 cs.CV cs.CL cs.LG 新提交 84%

Rosetta: Composable Native Multimodal Pretraining

Rosetta: 可组合的原生多模态预训练

Xiangyue Liu, Zijian Zhang, Miles Yang, Zhao Zhong, Liefeng Bo, Ping Tan

机构 * HKUST(香港科技大学) Tencent Hunyuan(腾讯混元)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.CL、cs.LG

AI总结 提出Rosetta框架,通过动量锚定正交投影(MAOP)实现无损模态扩展,解决多模态预训练中的灾难性遗忘和梯度冲突问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00208 2026-07-02 cs.CL cs.AI cs.LG 新提交 83%

SLIM-RL: Risk-Budgeted Random-Masking RL for Diffusion LLMs Without Trajectory Slicing

SLIM-RL: 无需轨迹切分的扩散LLM风险预算随机掩码强化学习

Ruikang Zhao, Zhenting Wang, Han Gao, Ligong Han

机构 * Technical University of Denmark(丹麦技术大学) MBZUAI Institute of Foundation Models(穆罕默德·本·扎耶德人工智能大学基础模型研究所) Iowa State University(爱荷华州立大学) Red Hat AI Innovation(红帽人工智能创新实验室) MIT–IBM Watson AI Lab(麻省理工学院-IBM沃森人工智能实验室)

专题命中 预训练与数据 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SLIM-RL方法,通过τ预算解码器控制每步提交风险,结合无迹随机掩码目标和自适应方差缩减技术,在不重构训练轨迹的情况下匹配或超越现有轨迹感知方法,在数学和代码任务上取得显著提升。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00784 2026-07-02 cs.CV cs.AI 新提交 83%

LeVLJEPA: End-to-End Vision-Language Pretraining Without Negatives

LeVLJEPA:无负样本的端到端视觉语言预训练

Lukas Kuhn, Giuseppe Serra, Randall Balestriero, Florian Buettner

机构 * German Cancer Research Center(德国癌症研究中心) German Cancer Consortium(德国癌症联盟) Goethe University Frankfurt(法兰克福大学) Brown University(布朗大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI

AI总结 提出首个完全非对比的端到端视觉语言预训练方法LeVLJEPA,通过跨模态预测与分布正则化学习,无需负样本、温度参数等,生成更强的密集语义特征,在下游任务中优于对比基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00510 2026-07-02 cs.LG stat.ML 新提交 83%

Prototype Language Models

原型语言模型

Dan Ley, Giang Nguyen, Himabindu Lakkaraju, Julius Adebayo

机构 * Harvard University(哈佛大学) Guide Labs Inc.(Guide Labs公司)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract_cn);分类 cs.LG

AI总结 提出原型语言模型架构PRISM,通过稀疏非负原型混合进行预测,在保持下游精度的同时实现快速训练数据归因和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00016 2026-07-02 cs.IR cs.AI 新提交 81%

Libra: Training the Environment for Agentic Information Retrieval

Libra: 为智能信息检索训练环境

Xuan Zhao, Andy Chiu, Gengyu Wang

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出Libra框架,通过引入可变目录和LLM驱动优化循环,自动改进代码仓库的索引结构,提升代码定位准确率,并实现跨模型和问题的零样本迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00890 2026-07-02 cs.CL 新提交 81%

MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages

MultiSynt/MT:跨36种语言翻译的万亿Token多平行预训练数据

Maximilian Idahl, Jörg Tiedemann, Sampo Pyysalo, David Salinas, Tomasz Galica, Shenbin Qian, Tudor Nicolae Mateiu, Zihao Li, Anna Lokrantz, Fedor Vitiugin, André F. T. Martins, Jenna Kanerva, Filip Ginter, Matthias Lindemann, Tim Isbister, Birger Moell, Jonas Lindh, Jan Hajič, Jenia Jitsev, Andrey Kutuzov, Stephan Oepen, Gema Ramírez-Sánchez

机构 * ellamind Leibniz University Hannover(莱布尼茨汉诺威大学) University of Helsinki(赫尔辛基大学) University of Turku(图尔库大学) ELLIS Institute Tübingen(ELLIS 图宾根研究所) Prior Labs University of Oslo(奥斯陆大学) Prompsit Language Engineering(Prompsit 语言工程公司) AI Sweden Instituto de Telecomunicações(电信研究所) Instituto Superior Técnico(高等技术学院) TransPerfect Charles University(查理大学) Ontocord LAION Juelich Supercomputing Center (JSC), Research Center Juelich (FZJ)(于利希超级计算中心 (JSC), 于利希研究中心 (FZJ))

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出MultiSynt/MT,一个覆盖36种欧洲语言、约4.8万亿token的合成平行语料库,通过翻译1000亿高质量token生成,使参考LLM在减少72%预训练token下达到原生数据基线性能,并发现标准基准测试的评估盲点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00174 2026-07-02 cs.CV cs.LG 新提交 79%

Steal the Patch Size: Adversarially Manipulate Vision-Language Models

窃取补丁大小:对抗性操纵视觉-语言模型

Kai Hu, Akash Bharadwaj, Weichen Yu, Matt Fredrikson

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 提出一种黑盒模型窃取攻击,通过任务级侧信道推断视觉语言模型的补丁大小和预处理流程,并利用泄露信息实现预处理感知的迁移攻击和模型定向对抗操纵。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00038 2026-07-02 cs.SE 新提交 78%

Stop Hand-Holding Your Coding Agent: Engineering the Loops that Replace Step-by-Step Prompting

停止手把手指导你的编码智能体:设计替代逐步提示的循环机制

Sandeco Macedo

专题命中 预训练与数据 :prompting(title,abstract)

AI总结 本文提出循环规范作为替代逐步提示的编码智能体新范式,定义其结构、分类与设计原则,并通过真实语料分析验证其成熟度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01218 2026-07-02 cs.CL cs.AI cs.LG 新提交 75%

The State-Prediction Separation Hypothesis

状态-预测分离假说

Giovanni Monea, Nathan Godey, Kianté Brantley, Yoav Artzi

机构 * Cornell University(康奈尔大学) Harvard University(哈佛大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出状态-预测分离假说,通过双流Transformer解耦状态存储与下一词预测,在预训练中提升数据与计算效率,下游任务平均提升2-3个百分点。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00249 2026-07-02 cs.LG eess.SP 新提交 70%

Device Passport: Enabling Spatio-Temporal Pretrained Models to Generalize Across Input Layouts

设备护照:使时空预训练模型能够跨输入布局泛化

Geeling Chau, Ran Liu, Juri Minxha, Wenhui Cui, Erdrin Azemi, Ellen L. Zippi, Behrooz Mahasseni, Christopher M. Sandino

机构 * California Institute of Technology(加州理工学院) Apple(苹果公司)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 针对新设备布局缺乏大规模数据集的问题,提出Device Passport通道嵌入技术,通过功能活动与元数据混合建模,实现跨布局迁移,在耳部脑电图等任务中优于基线。

Comments Workshop on Structured Data for Health, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23605 2026-07-02 cs.AI 版本更新 70%

SleepLM: Natural-Language Intelligence for Human Sleep

SleepLM:人类睡眠的自然语言智能

Zongzhe Xu, Zitao Shuai, Eideen Mozaffari, Ravi S. Aysola, Rajesh Kumar, Yuzhe Yang

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI

AI总结 提出SleepLM系列睡眠语言基础模型,通过多模态对齐实现自然语言驱动的睡眠解释与交互,在零样本/少样本学习、跨模态检索等任务上超越现有方法。

Comments spotlight presentation

Journal ref Proceedings of the 43st International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09399 2026-07-02 cs.CV cs.AI cs.LG 版本更新 62%

ForAug: Mitigating Biases in Image Classification via Controlled Image Compositions

ForAug: 通过受控图像组合缓解图像分类中的偏差

Tobias Christian Nauen, Brian Moser, Federico Raue, Stanislav Frolov, Andreas Dengel

机构 * RPTU University Kaiserslautern-Landau(凯泽斯劳滕-兰道大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出ForAug方法,通过将训练图像分解为前景和背景并重新组合,显式控制物体位置、尺度和背景,打破前景-背景相关性,在ImageNet上提升最高6%准确率,并减少捷径学习行为。

Comments v2: DeiT, ablation vs simple copy-paste, v4: more augmentation pipelines, robustness benchmarks, mask quality analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00310 2026-07-02 cs.CV cs.AI 新提交 57%

RetailSMV: Exocentric vs. Egocentric Adaptation of Foundation Video World Models in Retail

RetailSMV:零售场景中基础视频世界模型的外视角与内视角适应

Amirreza Rouhi, Rajat Aggarwal, Parikshit Sakurikar, Anoop M. Namboodiri, Sashi P. Reddi

机构 * DreamVu

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 研究零售场景下基础视频世界模型的外视角与内视角适应,发现仅用外视角数据训练的模型在多项指标上优于或等同于联合训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00223 2026-07-02 cs.CV 新提交 50%

Does Your ViT Still Need U-Net for Segmentation?

你的ViT做分割还需要U-Net吗?

Xin Li, Wenhui Zhu, Xuanzhao Dong, Xiwen Chen, Yanxi Chen, Yujian Xiong, Hao Wang, Oana M. Dumitrascu, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆森大学) Mayo Clinic(梅奥诊所)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文探究现代ViT骨干网络下医学图像分割是否仍需U-Net解码器,并提出基于查询的纯编码器分割框架EoSeg,在多个数据集上取得优异性能。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏