arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-10 至 2026-04-10 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 18 篇

2604.07769 2026-04-10 cs.SE 91%

An Empirical Study on Influence-Based Pretraining Data Selection for Code Large Language Models

基于影响分数的代码大语言模型预训练数据选择实证研究

Chengli Xing, Zhengran Zeng, Gexiang Fang, Rui Xie, Wei Ye, Shikun Zhang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title);LLM(abstract)

AI总结 本文探讨了影响分数过滤技术在编程数据集中的有效性,通过大规模实验评估了该方法对模型性能的提升,并分析了有益训练数据在不同阶段和任务中的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07592 2026-04-10 cs.RO 89%

Spatio-Temporal Grounding of Large Language Models from Perception Streams

从感知流中对大语言模型进行时空 grounding

Jacob Anderson, Bardh Hoxha, Georgios Fainekos, Hideki Okamoto, Danil Prokhorov

机构 * Toyota Motor North America Research & Development(丰田北美研发中心)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出FESTS框架,通过将自然语言查询转化为SpRE,为大语言模型注入可验证的时空监督,提升时空推理能力,使30亿参数模型在27k数据上实现87.5%的帧级F1分数,接近GPT-4.1性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06829 2026-04-10 cs.CL cs.AI 88%

WRAP++: Web discoveRy Amplified Pretraining

WRAP++:增强式网络发现预训练

Jiang Zhou, Yunhao Wang, Xing Wu, Tinghao Yu, Feng Zhang

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 WRAP++通过发现跨文档关系增强事实关联上下文,生成跨文档问答数据,提升模型在SimpleQA上的表现。

Comments Work in progress. Correspondence to ucaswu@tencent.com or wuxing@iie.ac.cn

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08510 2026-04-10 cs.CL 85%

What do Language Models Learn and When? The Implicit Curriculum Hypothesis

语言模型学习了什么以及何时?隐式课程假说

Emmy Liu, Kaiser Sun, Millicent Li, Isabelle Lee, Lindia Tjuatja, Jen-tse Huang, Graham Neubig

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Department of Computer Science, Data Science and AI Institute, Johns Hopkins University(约翰霍普金斯大学计算机科学系、数据科学与人工智能研究所) Khoury College of Computer Science, Northeastern University(东北大学Khoury计算机科学学院) Department of Computer Science, University of Southern California(南加州大学计算机科学系)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 研究通过设计简单可组合任务,发现模型技能以可组合顺序出现,且在不同模型间一致,表明预训练过程具有结构性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06618 2026-04-10 cs.CR 85%

PoC-Adapt: Semantic-Aware Automated Vulnerability Reproduction with LLM Multi-Agents and Reinforcement Learning-Driven Adaptive Policy

PoC-Adapt: 基于语义的自动漏洞重现与LLM多智能体及强化学习驱动的自适应策略

Phan The Duy, Khoa Ngo-Khanh, Nguyen Huu Quyen, Van-Hau Pham

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出PoC-Adapt框架,通过语义运行时验证和自适应策略学习,提升漏洞重现的可靠性并降低生成成本,实验表明其在CWE-Bench-Java和PrimeVul基准上验证可靠性和效率提升显著。

Comments 16 pages, abstracted and meta updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08522 2026-04-10 cs.CV 82%

UniversalVTG: A Universal and Lightweight Foundation Model for Video Temporal Grounding

UniversalVTG: 一种通用且轻量的视频时间定位基础模型

Joungbin An, Agrim Jain, Kristen Grauman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 预训练与数据 :foundation model(title);language model(abstract);pretraining(abstract)

AI总结 本文提出UniversalVTG,一种通用轻量视频时间定位模型,通过大规模跨数据集预训练实现高效长视频定位,优于专用模型且比大语言模型更轻量。

Comments Project Page: https://vision.cs.utexas.edu/projects/universalvtg

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20524 2026-04-10 cs.CV 82%

AnomalyVFM -- Transforming Vision Foundation Models into Zero-Shot Anomaly Detectors

AnomalyVFM -- 将视觉基础模型转变为零样本异常检测器

Matic Fučka, Vitjan Zavrtanik, Danijel Skočaj

机构 * University of Ljubljana, Faculty of Computer and Information Science(卢布尔雅那大学计算机与信息科学学院)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract)

AI总结 本文提出AnomalyVFM框架,通过合成数据生成与参数高效适应机制,使视觉基础模型在零样本异常检测中表现更优,实测在9个数据集上达到94.1%的AUROC。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08519 2026-04-10 cs.CL stat.ML 77%

Cram Less to Fit More: Training Data Pruning Improves Memorization of Facts

少而精:训练数据剪枝提升事实记忆

Jiayuan Ye, Vitaly Feldman, Kunal Talwar

机构 * National University of Singapore(新加坡国立大学) Apple(苹果公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本文从信息论角度研究训练数据分布对事实准确性的影响,提出基于训练损失的数据选择方案,提升事实记忆能力,实验表明剪枝后模型可更高效记忆事实。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08423 2026-04-10 cs.CL cs.AI cs.LG stat.ML 75%

Synthetic Data for any Differentiable Target

为任何可微目标生成合成数据

Tristan Thrush, Sung Min Park, Herman Brunborg, Luke Bailey, Marcel Roed, Neil Band, Christopher Potts, Tatsunori Hashimoto

机构 * Stanford University(斯坦福大学)

专题命中 预训练与数据 :language model(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Dataset Policy Gradient方法,通过合成数据生成器优化生成针对性示例,使目标模型在可微度量上表现优异,展示了通过合成数据改变模型属性的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08021 2026-04-10 cs.DB 75%

SynQL: A Controllable and Scalable Rule-Based Framework for SQL Workload Synthesis for Performance Benchmarking

SynQL: 一种可控且可扩展的基于规则的SQL工作负载合成框架用于性能基准测试

Kahan Mehta, Amit Mankodi

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 SynQL通过遍历数据库外键图生成结构多样且可执行的SQL工作负载,解决现有合成工具在训练数据缺口上的不足,通过配置向量控制连接拓扑和分析强度,实验表明其合成数据能有效训练成本模型。

Comments 24 pages, 3 figures, Submitted to International Journal of Data Science and Analytics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08398 2026-04-10 cs.LG cs.AI 73%

ADAPTive Input Training for Many-to-One Pre-Training on Time-Series Classification

适应性输入训练用于时间序列分类的多对一预训练

Paul Quinlan, Qingguo Li, Xiaodan Zhu

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ADAPT方法,通过适应性输入训练提升时间序列多任务预训练效果,实现跨数据集的高效对齐与泛化,取得分类基准新高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08156 2026-04-10 cs.CL 70%

Training Data Size Sensitivity in Unsupervised Rhyme Recognition

无监督押韵识别中的训练数据敏感性

Petr Plecháč, Artjoms Šeļa, Silvie Cinková, Mirella De Sisto, Lara Nugues, Neža Kočnik, Antonina Martynenko, Ben Nagy, Luca Giovannini, Robert Kolár

机构 * Institute of Czech Literature, Czech Academy of Sciences(捷克科学院捷克文学研究所) University of Tartu(塔尔图大学) Charles University(查理大学) Tilburg University(蒂尔堡大学) University of Basel(巴塞尔大学) University of Ljubljana(卢布尔雅那大学) Institute of Polish Language, Polish Academy of Sciences(波兰科学院波兰语言研究所) University of Potsdam(波茨坦大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨了RhymeTagger在不同语言中识别押韵所需训练数据量,分析了语言差异和训练规模对准确率的影响,并对比了大型语言模型在缺乏音系表示时的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08124 2026-04-10 cs.AI 70%

Beyond Stochastic Exploration: What Makes Training Data Valuable for Agentic Search

超越随机探索:训练数据为何对代理搜索有价值

Chuzhan Hao, Wenfeng Feng, Guochao Jiang, Guofeng Quan, Guohua Liu, Yuewei Zhang

机构 * Alibaba Cloud Computing(阿里云)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Hierarchical Experience框架,通过对比分析和多级聚类机制将原始推理轨迹转化为层次经验知识,提升搜索代理的性能和训练稳定性,实现更高效的策略驱动搜索。

Comments 15 pages, ACL2026 Findings Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08115 2026-04-10 cs.AI 70%

Revise: A Framework for Revising OCRed text in Practical Information Systems with Data Contamination Strategy

修订:一种在实际信息系统中利用数据污染策略修订OCR文本的框架

Gyuho Shim, Seongtae Hong, Heuiseok Lim

机构 * Department of Computer Science and Engineering, Korea University(高丽大学计算机科学与工程系) Human-inspired AI Research(人类启发人工智能研究)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Revise框架,通过修正OCR文本的字符、词和结构层面错误,提升文档信息的结构化表示和管理能力,从而增强文档检索和问答任务的性能。

Comments Accepted to ACL 2025 Industry-Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07092 2026-04-10 cs.CV 67%

Location Is All You Need: Continuous Spatiotemporal Neural Representations of Earth Observation Data

位置即一切:连续时空神经表示法用于地球观测数据

Mojgan Madadikhaljan, Jonathan Prexl, Isabelle Wittmann, Conrad M Albrecht, Michael Schmitt

机构 * University of the Bundeswehr Munich(慕尼黑联邦国防军大学) IBM Research – Europe(IBM欧洲研究院) Columbia University(哥伦比亚大学) German Aerospace Center (DLR)(德国航空航天中心)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 本文提出LIANet,通过连续时空神经场建模多时相遥感数据,无需原始数据即可实现卫星影像重建,并在各种下游任务中取得与从头训练或使用现有GFMs相当的性能。

Comments Updated the affiliation of one of the authors, no changes to the technical content

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08637 2026-04-10 cs.CY cs.AI cs.CR 57%

How Do Data Owners Say No? A Case Study of Data Consent Mechanisms in Web-Scraped Vision-Language AI Training Datasets

数据所有者如何说不?Web抓取视觉-语言AI训练数据集中的数据同意机制案例研究

Chung Peng Lee, Rachel Hong, Harry H. Jiang, Aster Plotnik, William Agnew, Jamie Morgenstern

机构 * Princeton University(普林斯顿大学) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) University of Toronto(多伦多大学) Amazon AWS AI/ML(亚马逊AWS AI/ML)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI

AI总结 研究探讨了数据所有者在AI训练数据集中的同意表达方式,分析了DataComp数据集中样本层面和网络层面的信息,揭示了当前数据收集流程对数据同意的不尊重问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15960 2026-04-10 cs.CL 57%

Efficient PRM Training Data Synthesis via Formal Verification

通过形式验证高效PRM训练数据合成

Ryo Kamoi, Yusen Zhang, Nan Zhang, Sarkar Snigdha Sarathi Das, Ranran Haoran Zhang, Wenpeng Yin, Rui Zhang

机构 * Penn State University(宾夕法尼亚州立大学) Columbia University(哥伦比亚大学)

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL

AI总结 本文提出FoVer框架,利用形式验证工具生成PRM训练数据,提升LLM推理能力,实验显示其在数学逻辑和自然语言推理任务中均有效。

Comments ACL 2026 Findings. Datasets, models, and code are provided at https://github.com/psunlpgroup/FoVer. Please also refer to our project website at https://fover-prm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20231 2026-04-10 cs.RO cs.CV 50%

UniLACT: Depth-Aware RGB Latent Action Learning for Vision-Language-Action Models

UniLACT:基于深度的RGB潜在动作学习用于视觉-语言-动作模型

Manish Kumar Govind, Dominick Reilly, Pu Wang, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 UniLACT通过引入深度感知的潜在预训练,提升视觉-语言-动作模型的空间先验能力,实验表明其在模拟和现实任务中优于基于RGB的潜在动作方法。

Comments https://manishgovind.github.io/unilact-vla/

详情

展开后加载摘要…

URL PDF HTML 收藏