arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138237 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12353 篇

2310.12523 2023-10-20 cs.CR 88%

Privacy Preserving Large Language Models: ChatGPT Case Study Based Vision and Framework

Imdad Ullah, Najm Hassan, Sukhpal Singh Gill, Basem Suleiman, Tariq Ahamed Ahanger, Zawar Shah, Junaid Qadir, Salil S. Kanhere

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.04476 2023-09-04 cs.CV 88%

Towards Geospatial Foundation Models via Continual Pretraining

Matias Mendieta, Boran Han, Xingjian Shi, Yi Zhu, Chen Chen

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract)

Comments ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.15370 2023-07-31 cs.SE 88%

Private-Library-Oriented Code Generation with Large Language Models

Daoguang Zan, Bei Chen, Yongshun Gong, Junzhi Cao, Fengji Zhang, Bingchao Wu, Bei Guan, Yilong Yin, Yongji Wang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.19912 2023-06-01 cs.IR 88%

Structure-Aware Language Model Pretraining Improves Dense Retrieval on Structured Data

Xinze Li, Zhenghao Liu, Chenyan Xiong, Shi Yu, Yu Gu, Zhiyuan Liu, Ge Yu

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract)

Comments Accepted by Findings of ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.14038 2023-03-27 cs.CV 88%

Accelerating Vision-Language Pretraining with Free Language Modeling

Teng Wang, Yixiao Ge, Feng Zheng, Ran Cheng, Ying Shan, Xiaohu Qie, Ping Luo

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract)

Comments To appear in CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.14115 2023-03-22 cs.CV cs.AI cs.CL cs.LG 88%

Vid2Seq: Large-Scale Pretraining of a Visual Language Model for Dense Video Captioning

Antoine Yang, Arsha Nagrani, Paul Hongsuck Seo, Antoine Miech, Jordi Pont-Tuset, Ivan Laptev, Josef Sivic, Cordelia Schmid

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.AI、cs.LG

Comments CVPR 2023 Camera-Ready; Project Webpage: https://antoyang.github.io/vid2seq.html ; 18 pages; 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.13498 2023-02-28 cs.IR 88%

Pretraining De-Biased Language Model with Large-scale Click Logs for Document Ranking

Xiangsheng Li, Xiaoshu Chen, Kunliang Wei, Bin Hu, Lei Jiang, Zeqian Huang, Zhanhui Kang

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.04501 2022-12-09 cs.CV 88%

Learning Video Representations from Large Language Models

Yue Zhao, Ishan Misra, Philipp Krähenbühl, Rohit Girdhar

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract)

Comments Tech report. Project page: https://facebookresearch.github.io/LaViLa; Code is available at http://github.com/facebookresearch/LaViLa

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11656 2026-08-13 cs.LG 新提交 87%

Continuous-Latent Predictive Modeling with Semantic Alignment for EEG-Language Foundation Models

面向EEG-语言基础模型的语义对齐连续隐式预测建模

Myeong-Ju Cho, Hye-Bin Shin, Seo-Hyun Lee, Seong-Whan Lee

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出BLPM模型,通过CELP编码器与MQSD模块对齐EEG语义,解决EEG基础模型预训练的关键挑战,在多基准任务中实现良好泛化。

Comments 19 pages, 3 figures; supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03883 2026-08-05 cs.CL 新提交 87%

DS@GT-ARC at eRisk 2026 Task 3: Sparse, Semantic, and LLM Reranking for ADHD Symptom Sentences

佐治亚理工学院DS团队参加eRisk 2026任务3:针对ADHD症状句子的稀疏、语义及大语言模型重排序

David Guecha

专题命中 预训练与数据 :LLM(title,summary_cn);分类 cs.CL

AI总结 本文介绍佐治亚理工学院DS团队针对eRisk 2026任务3,采用分阶段检索结合稀疏BM25、语义及LLM重排序的方案,其中LLM重排序器取得官方最优成绩,分阶段重排序具发展前景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13304 2026-07-16 cs.IR cs.CL 新提交 87%

Where Does the Noise Come From? A Variance-Components Decomposition of Non-Determinism in LLM Brand Answers

噪声从何而来?大语言模型品牌答案中非确定性的方差成分分解

Dmitrij Żatuchin

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究大语言模型品牌答案中非确定性的来源,通过交叉随机效应分解将响应级品牌结果总方差分为提示内重采样等四个来源,应用于多语言多模型语料库,发现查询语言是最大方差来源,跨语言和模型能提升可靠性而非重复提示。

Comments 18 pages, 6 tables, 3 code listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22054 2026-07-07 cs.CV cs.AI 版本更新 87%

MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources

MetricAnything:利用噪声异构源扩展度量深度预训练

Baorui Ma, Jiahui Yang, Donglin Di, Xuancheng Zhang, Jianxun Cui, Hao Li, Yan Xie, Wei Chen

机构 * Li Auto Inc(李自动公司)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 研究针对度量深度估计扩展难题,提出MetricAnything框架,通过随机掩码创建稀疏度量提示解耦空间推理与偏差,用多样3D数据预训练,在多任务中表现出色,推动度量感知发展。

Comments Accepted to ECCV 2026. Project Page: https://metric-anything.github.io/metric-anything-io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29567 2026-06-30 cs.CR cs.CL 87%

SurrogateShield: Beyond Redaction for High-Utility, Privacy-Preserving LLM Interactions

SurrogateShield:超越脱敏的高效用隐私保护LLM交互

Sherwin Vishesh Jathanna

机构 * Arizona State University(亚利桑那州立大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL

AI总结 提出客户端代理SurrogateShield,用本地生成的类型一致替代值替换检测到的PII,在保护隐私的同时保持语义效用,在1124条查询语料上F1达98.87%,BERTScore提升13.26个百分点。

Comments 14 pages, 1 figure, 9 tables. Code and dataset: https://github.com/sherwinvishesh/SurrogateShield

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23591 2026-06-23 cs.LG 新提交 87%

Quantifying the Agreement Between Data-Influence and Data-Similarity to Understand LLM Behavior

量化数据影响与数据相似性之间的一致性以理解LLM行为

Christopher J. Anders, Henrique Da Silva Gameiro, Nico Daheim, Mohammad Emtiyaz Khan

机构 * RIKEN Center for Advanced Intelligence Project, Tokyo, Japan(日本东京理化学研究所先进智能项目中心) Section of Computer Science, EPFL Lausanne, Switzerland(瑞士洛桑联邦理工学院计算机科学系) Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, Technical University of Darmstadt(达姆施塔特工业大学计算机科学系泛在知识处理实验室) National Research Center for Applied Cybersecurity ATHENE, Germany(德国国家应用网络安全研究中心ATHENE) TU Darmstadt & Hessian Center for AI (hessian.AI), Darmstadt, Germany(达姆施塔特工业大学与黑森州人工智能中心)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.LG

AI总结 通过排序重叠量化数据相似性与数据影响在输出追踪中的一致性和不对称性,并利用不对称性实现成本-精度权衡。

Comments 37 pages, 35 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22503 2026-06-23 cs.CL cs.SD eess.AS 版本更新 87%

Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking

基于LLM的端到端口语对话状态跟踪的联合语音与文本训练

Katia Vendrame, Bolaji Yusuf, Santosh Kesiraju, Šimon Sedláček, Oldřich Plchot, Jan Černocký

机构 * Brno University of Technology(布拉格技术大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出联合训练口语DST数据和跨域文本DST数据的方法,解决口语数据稀缺和跨域泛化问题,无需目标域口语训练数据即可获得良好性能。

Comments accepted for Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18192 2026-06-18 cs.AI 新提交 87%

The Stanford EDGAR Filings Dataset: Reconstructing U.S. Corporate and Financial Disclosures into Layout-Faithful and Token-Efficient Pretraining Data

斯坦福EDGAR文件数据集:将美国公司及财务披露重建为布局忠实且令牌高效的预训练数据

Nick Bettencourt, Xiaowei Ding, Kay Giesecke

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Nanjing University(南京大学) Stanford University(斯坦福大学)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 为解决长上下文文档稀缺问题,提出SEFD数据集,将SEC文件重建为布局忠实的MultiMarkdown格式,用于金融语言建模与评估,具有令牌高效、与Common Crawl重叠率低于0.1%的特点。

Comments Preprint. Includes appendix, tables, and figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02834 2026-06-03 cs.CR cs.AI 87%

Large Byte Model: Teaching Language Models About Compiled Code

大型字节模型:教会语言模型关于编译代码的知识

Florian Störtz, Catalin-Andrei Stan, Alexandru Dinu, Sandra Servia-Rodríguez, Mihaela Gaman, Calin Miron, Edward Raff

机构 * CrowdStrike U.K.(CrowdStrike英国分公司) CrowdStrike Romania(CrowdStrike罗马尼亚分公司) CrowdStrike USA(CrowdStrike美国分公司)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI

AI总结 本文提出首个字节原生大语言模型,通过定制字节分词器扩展词汇表,使其能直接处理可执行文件原始字节并回答恶意软件分析问题,在家族分类和架构分类上分别达到69%和98%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00655 2026-06-02 cs.MA cs.AI cs.CY 87%

Scaling Behavior of Single LLM-Driven Multi-Agent Systems

单一LLM驱动的多智能体系统的扩展行为

Jialing Li, Zhouhong Gu, Yin Cai, Hongwei Feng

机构 * Fudan University(复旦大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI

AI总结 本文通过提出顺序迭代多智能体系统(SIMAS)框架,系统研究了同质多智能体系统性能随智能体数量变化的扩展规律,发现性能并非单调提升,而是受协作协同与协调开销之间的权衡支配,呈现收益递减模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00230 2026-06-02 cs.LG 87%

A Pre-Training Analogue of Grokking in Language Models: Tracing Delayed Grammatical Generalization

语言模型中预训练的Grokking类比:追踪延迟的语法泛化

Sherin Muckatira, Namrata Shivagunde, Vijeta Deshpande, Anna Rumshisky

机构 * University of Massachusetts Lowell(马萨诸塞大学洛文分校)

专题命中 预训练与数据 :LLM(summary_cn,abstract);language model(title);分类 cs.LG

AI总结 本文提出一个基于暴露的框架,在LLM预训练中研究类似grokking的延迟泛化现象,通过BLiMP最小对发现语法泛化延迟,并分析泛化前后语法概念向量的变化。

Comments 18 pages, 10 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31401 2026-06-02 cs.CL 87%

"Înţelegi Româneşte?'' A Recipe for Romanian Vision-Language Models

Înţelegi Româneşte?'' 罗马尼亚语视觉语言模型的构建配方

Mihai Masala, Marius Leordeanu, Mihai Dascalu, Traian Rebedea

机构 * National University of Science and Technology POLITEHNICA Bucharest(波兰技术大学布加勒斯特国家大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.CL

AI总结 本文系统研究了构建罗马尼亚语视觉语言模型(VLM)的完整流程,通过翻译英文语料、消融实验分析视觉骨干、语言骨干和OCR数据的影响,并构建文化本地化评估集HoraVQA,证明罗马尼亚语适配模型在性能上超越同尺寸甚至更大尺寸的模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18863 2026-06-02 cs.CV cs.CL 87%

Phoneme-Level Visual Speech Recognition via Point-Visual Fusion and Language Model Reconstruction

基于点视觉融合与语言模型重建的音素级视觉语音识别

Matthew Kit Khinn Teng, Haibo Zhang, Takeshi Saitoh

机构 * Kyushu Institute of Technology(九州工业大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);language model(title);分类 cs.CL

AI总结 提出一种两阶段音素级视觉语音识别框架,通过融合视觉和面部地标运动特征,并利用LLM模型重建单词,在LRS2和LRS3数据集上分别实现17.4%和21.0%的词错误率。

Comments Accepted at ICASSP 2026. This version corresponds to the camera-ready manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31156 2026-06-01 cs.LG 87%

TabCausal: Pretraining Across Causal Environments for Tabular Causal Discovery

TabCausal: 跨因果环境的表格因果发现预训练

Zi-Rong Li, Si-Yang Liu, Tian-Zuo Wang, Han-Jia Ye

机构 * Nanjing University(南京大学)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract,abstract_cn);foundation model(abstract);分类 cs.LG

AI总结 提出TabCausal,一种通过动态任务构建策略在多样化因果环境中进行大规模预训练的因果发现基础模型,在合成和语义基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29278 2026-05-29 cs.CL 87%

Accommodation Goes Both Ways: Studying Linguistic Convergence Between Humans and Language Models

适应是双向的:研究人类与语言模型之间的语言趋同

Terra Blevins

机构 * Khoury College of Computer Sciences(科里学院计算机科学学院)

专题命中 预训练与数据 :LLM(summary_cn,abstract);language model(title);分类 cs.CL

AI总结 通过大规模研究人类与LLM对话中的语言趋同现象,发现LLM在功能词和开放类特征上过度适应人类风格,而人类对LLM的适应程度与人类之间对话的基线一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19282 2026-05-20 cs.LG 87%

Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies for VLA and RLVR

重新思考Muon超越预训练:VLA和RLVR中的频谱失败及高频修复

Chongyu Fan, Gaowen Liu, Mingyi Hong, Ramana Rao Kompella, Sijia Liu

机构 * Michigan State University(密歇根州立大学) Cisco(思科) University of Minnesota(明尼苏达大学) IBM Research(IBM研究院)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract,abstract_cn);post-training(abstract);分类 cs.LG

AI总结 本文研究了Muon优化器在预训练之外的局限性,提出Pion通过高频NS迭代机制改进VLA和RLVR任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08986 2026-05-20 cs.CL cs.CE cs.CY 87%

CAPC-CG: A Large-Scale, Expert-Directed LLM-Annotated Corpus of Adaptive Policy Communication in China

CAPC-CG:一个大规模、专家指导的中国适应性政策沟通LLM注释语料库

Bolun Sun, Charles Chang, Yuen Yuen Ang, Ruotong Mu, Yuchen Xu, Zhengxin Zhang, Pingxu Hao

机构 * Johns Hopkins University(约翰霍普金斯大学) Northwestern University(西北大学) Duke Kunshan University(杜克-昆山大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文介绍了CAPC-CG语料库,该语料库是首个开放的中国政策指令注释语料库,基于Ang的适应性政策沟通理论,采用五色分类法对清晰和模糊语言类别进行标注,旨在支持下游任务和多语言NLP研究。

Comments Accepted for publication in the Proceedings of ACL Main 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11405 2026-05-14 cs.LG 87%

20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone

20/20 Vision Language Models: 通过数据整理单独提升VLMs的方案

DatologyAI, :, Siddharth Joshi, Haoli Yin, Rishabh Adiga, Haakon Mongstad, Alvin Deng, Aldo Carranza, Alex Fang, Amro Abbas, Anshuman Suri, Brett Larsen, Daniel Zayas, Darren Teh, David Schwab, Diego Kiner, Fan Pan, Jack Urbanek, Jason Lee, Jason Telanoff, Josh Wills, Kaleigh Mentzer, Luke Merrick, Maximilian Böther, Parth Doshi, Paul Burstein, Pratyush Maini, Ties Robroek, Tony Jiang, Vidhi Jain, Vineeth Dorna, Zhengping Wang, Bogdan Gaza, Ari Morcos, Matthew Leavitt

机构 * DatologyAI

专题命中 预训练与数据 :language model(title,title_cn);pretraining(abstract);分类 cs.LG

AI总结 本文通过数据整理提升VLMs性能,展示在20个公开基准和DatBench九个能力轴上均取得显著提升,同时提升可靠性、OOD泛化和推理效率。

Comments 33 pages, 15 figures. DatalogyAI website for more details: https://www.datologyai.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07938 2026-05-11 cs.LG 87%

Prototype Guided Post-pretraining for Single-Cell Representation Learning

原型引导的单细胞表示学习预训练

Sachini Weerasekara, Natasha Darras, Sagar Kamarthi, Colles Price, Jacqueline Isaacs

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出CellRefine方法,通过整合标记基因集作为先验指导单细胞预训练后的优化,提升下游任务性能,实验显示性能提升达15%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19783 2026-04-23 cs.CL 87%

How Much Does Persuasion Strategy Matter? LLM-Annotated Evidence from Charitable Donation Dialogues

说服策略有多重要?来自慈善捐赠对话的LLM注释证据

Tatiana Petrova, Stanislav Sokol, Radu State

机构 * Interdisciplinary Centre for Security, Reliability and Trust (SnT)(安全、可靠性与信任跨学科研究中心)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过分析10600个对话中的说服策略,发现仅 guilt induction 与较低的捐款率相关,而 reciprocity 是最强的正相关因素,表明单纯策略识别不足以解释说服效果。

Comments 8 pages, 2 figures, 5 tables. Interdisciplinary Centre for Security, Reliability and Trust (SnT), University of Luxembourg

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00726 2026-04-02 cs.LG 87%

Exploring Silent Data Corruption as a Reliability Challenge in LLM Training

探索在LLM训练中作为可靠性挑战的静默数据损坏

Anton Altenbernd, Philipp Wiesner, Odej Kao

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究静默数据损坏对LLM预训练的影响,通过GPU矩阵乘法指令注入故障,分析不同位位置、内核函数和执行阶段的敏感性,并提出轻量检测方法以缓解有害参数更新。

Comments 10 Pages, 4 Figures, CCGrid 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21138 2026-03-31 cs.SE cs.AI 87%

Multi-Sample Prompting and Actor-Critic Prompt Optimization for Diverse Synthetic Data Generation

多样本提示与演员-评论员提示优化用于多样化合成数据生成

Abdelkarim El-Hajjami, Camille Salinesi

机构 * Paris 1 Panthéon–Sorbonne University(巴黎第一大学)

专题命中 预训练与数据 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出多样本提示与演员-评论员提示优化方法,用于提升合成数据生成的多样性与下游任务表现,实验显示在需求工程分类任务中,F1分数提升达6至43.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏