arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12393 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12393 篇

2501.05629 2025-01-13 cs.CL cs.AI 82%

The Impact of Model Scaling on Seen and Unseen Language Performance

Rhitabrat Pokharel, Sina Bagheri Nezhad, Ameeta Agrawal, Suresh Singh

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments Accepted at SEAS Workshop at AAAI25

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15282 2024-12-23 cs.CL cs.AI cs.IR 82%

A Systematic Examination of Preference Learning through the Lens of Instruction-Following

Joongwon Kim, Anirudh Goyal, Aston Zhang, Bo Xiong, Rui Hou, Melanie Kambadur, Dhruv Mahajan, Hannaneh Hajishirzi, Liang Tan

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18634 2024-11-19 cs.LG cs.CL stat.ML 82%

A Theoretical Understanding of Self-Correction through In-context Alignment

Yifei Wang, Yuyang Wu, Zeming Wei, Stefanie Jegelka, Yisen Wang

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

Comments Accepted at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12108 2024-10-10 cs.LG cs.CL cs.CR 82%

Private prediction for large-scale synthetic text generation

Kareem Amin, Alex Bie, Weiwei Kong, Alexey Kurakin, Natalia Ponomareva, Umar Syed, Andreas Terzis, Sergei Vassilvitskii

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 20 pages; updated figure + some new experiments from EMNLP 2024 findings camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02678 2024-10-04 cs.CL cs.AI 82%

Distilling an End-to-End Voice Assistant Without Instruction Training Data

William Held, Ella Li, Michael Ryan, Weiyan Shi, Yanzhe Zhang, Diyi Yang

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13022 2024-07-04 cs.CL cs.LG 82%

LLMs can learn self-restraint through iterative self-reflection

Alexandre Piché, Aristides Milios, Dzmitry Bahdanau, Chris Pal

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05800 2024-04-17 cs.IR cs.AI cs.CL 82%

Leveraging LLMs for Synthesizing Training Data Across Many Languages in Multilingual Dense Retrieval

Nandan Thakur, Jianmo Ni, Gustavo Hernández Ábrego, John Wieting, Jimmy Lin, Daniel Cer

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted at NAACL 2024. Data released at https://github.com/google-research-datasets/swim-ir

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08885 2024-04-16 cs.PL cs.CL cs.LG 82%

Is Next Token Prediction Sufficient for GPT? Exploration on Code Logic Comprehension

Mengnan Qi, Yufan Huang, Yongqiang Yao, Maoquan Wang, Bin Gu, Neel Sundaresan

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14327 2023-10-27 cs.CL cs.AI 82%

Dynosaur: A Dynamic Growth Paradigm for Instruction-Tuning Data Curation

Da Yin, Xiao Liu, Fan Yin, Ming Zhong, Hritik Bansal, Jiawei Han, Kai-Wei Chang

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

Comments EMNLP 2023. Code and data are available at https://github.com/WadeYin9712/Dynosaur

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14924 2026-08-18 cs.CV cs.AI 新提交 82%

PaSTel: Anchoring Histology in Spatial Transcriptomics via Multi-Scale Hierarchical Bio-Prior Contrastive Pretraining

PaSTel:通过多尺度层级生物先验对比预训练锚定空间转录组学中的组织学

Azim Dehghani Amirabad, Junchao Zhu, Pushpak Pati, Walid Abdelmoula, Tommaso Mansi, Rui Liao

机构 * Johnson & Johnson Innovative Medicine(强生创新医药)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI;large language model(comments);language model(comments)

AI总结 PaSTel是一种整合多尺度生物先验的层级多模态预训练框架,通过三层生物先验设计解决现有空间转录组学方法的局限,在多个下游任务中性能优于现有编码器。

Comments This paper was accepted to the 3rd ICML 2026 Workshop on Multi-modal Foundation Models and Large Language Models for Life Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00691 2026-08-21 cs.CV 版本更新 82%

Silhouette-based Gait Foundation Model

基于轮廓的步态基础模型

Dingqiang Ye, Chao Fan, Kartik Narayan, Bingzhe Wu, Chengwen Luo, Jianqiang Li, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学) Shenzhen University(深圳大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 FoundationGait是首个可扩展的自监督预训练框架,用于步态理解,通过大规模预训练在多个数据集上实现稳健的步态识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20817 2026-08-19 cs.CL cs.AI cs.LG 版本更新 82%

Convergent Evolution: How Different Language Models Learn Similar Number Representations

趋同进化:不同语言模型如何学习相似的数字表示

Deqing Fu, Tianyi Zhou, Mikhail Belkin, Vatsal Sharan, Robin Jia

机构 * University of Southern California(南加州大学) UC San Diego(圣地亚哥大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了不同语言模型如何通过不同训练信号学习相似的数字表示,揭示了特征学习中的趋同进化现象。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16718 2026-08-18 cs.CV 新提交 82%

CytoFormer: A Molecularly Supervised Cell Foundation Model for Histopathology Cell Classification

CytoFormer:用于组织病理学细胞分类的分子监督细胞基础模型

Jialu Yao, Songhao Li, Alina Yu, Zhi Huang

机构 * University of Pennsylvania(宾夕法尼亚大学) Germantown Friends School(日耳曼敦贵格会学校)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 CytoFormer利用配对H&E染色与空间转录组学数据训练细胞基础模型,在细胞分类、迁移学习及主动学习中表现优异,为常规组织学的细胞分析提供高效可复用表示。

Comments 20 pages, 5 figures, 2 extended data figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16614 2026-08-18 cs.CV 新提交 82%

Beyond Accuracy: Assessing Calibration of Geospatial Foundation Models and Their Sensitivity to Distribution Shifts

超越准确率:评估地理空间基础模型的校准度及其对分布偏移的敏感性

Nils Lehmann, Jakob Gawlikowski, Burak Ekim, Isaac Corley, Xiao Xiang Zhu

机构 * Technical University of Munich (TUM)(慕尼黑工业大学) German Aerospace Center (DLR)(德国航空航天中心) Massachusetts Institute of Technology (MIT)(麻省理工学院) Taylor Geospatial(泰勒地理空间公司)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 该研究指出GeoFMs仅用准确率排序的不足,分析其校准度与分布偏移敏感性,发现EO预训练模型更易过度自信,提出需多条件多指标评估以缩小实际部署差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13183 2026-08-14 cs.CV 新提交 82%

A Controlled Study of Self-Supervised Image and Video Pretraining under Limited Resources

有限资源下自监督图像与视频预训练的对照研究

Brunó B. Englert, Gijs Dubbelman

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract)

AI总结 该研究对照研究有限资源下的图像与视频自监督预训练,发现DINOv2式预训练性能最优,结合其与VideoMAE可提升图像任务性能但降低部分视频任务性能,为资源有限场景的视觉模型训练提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08994 2026-08-11 cs.IR cs.AI cs.CL cs.LG 新提交 82%

Guardian Crawler: Retrieval-First Knowledge Discovery with Bounded LLM Augmentation for Noisy Web Intelligence

Guardian Crawler:面向噪声网络智能的、结合受限大语言模型增强的检索优先型知识发现方法

Joshua Castillo, Santosh Nukavarapu, Ravi Mukkamala

专题命中 预训练与数据 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Guardian Crawler是面向噪声网络智能的检索优先型测试平台,结合BM25与风险感知重排序等技术,在合成语料库实验中取得较高检索分数,可用于知识发现与证据摘要生成。

Comments 8 pages, 2 figures. Accepted as a Short Paper at KDIR 2026 (International Conference on Knowledge Discovery and Information Retrieval)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07767 2026-08-11 cs.CV 新提交 82%

DINO-3DRA: Leveraging 2D Foundation Model Semantics for 3D Cerebral Aneurysm Segmentation

DINO-3DRA:利用二维基础模型语义实现三维颅内动脉瘤分割

Jiayang Lu, Fengming Lin, Alejandro F. Frangi, Ali Sarrami-Foroushani

机构 * University of Manchester(曼彻斯特大学) Christabel Pankhurst Institute, University of Manchester(曼彻斯特大学克里斯塔贝尔·潘克赫斯特研究所) NIHR Manchester Biomedical Research Centre(NIHR曼彻斯特生物医学研究中心) Manchester Academic Health Sciences Centre(曼彻斯特学术健康科学中心)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 DINO-3DRA是一种双路径框架,通过将冻结的DINOv3特征注入3D U-Net实现跨维度语义迁移,在多中心3DRA数据上以572万参数达到最优动脉瘤分割性能,且泛化能力强。

Comments Accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05903 2026-08-10 cs.CV cs.RO 版本更新 82%

Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models

Robust-WAM:桥接生成式预训练与世界-动作模型中的语义前瞻

Haodong Yan, Junfeng Li, Junjie He, Zhide Zhong, MingMing Yu, Wenxuan Song, Jiaguan Zhu, Yangyang Zheng, Yuqiao Du, Jiadi You, Yingjie Cai, Xu Yan, Guanyi Zhao, Bingbing Liu, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beihang University(北京航空航天大学) Huawei Foundation Model Department(华为基础模型部门)

专题命中 预训练与数据 :pretraining(title,abstract);post-training(abstract)

AI总结 Robust-WAM是一种通用后训练方法,在保留VAE生成路径的同时添加语义前瞻对齐,可提升多个WAM基线在分布外条件下的动作预测成功率且不损失分布内性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20254 2026-08-06 cs.CV 82%

MIRepNet: A Pipeline and Foundation Model for EEG-Based Motor Imagery Classification

Dingkun Liu, Zhu Chen, Jingwei Luo, Shijie Lian, Dongrui Wu

机构 * Ministry of Education Key Laboratory of Image Processing and Intelligent Control, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(教育部长图像处理与智能控制重点实验室,人工智能与自动化学院,华中科技大学) School of Computer Science and Technology, Huazhong University of Science and Technology(计算机科学与技术学院,华中科技大学) Zhongguancun Academy(中关村学院)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

Journal ref Knowledge-Based Systems (15 June 2026, vol. 343)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02573 2026-08-04 astro-ph.IM 新提交 82%

Foundation Models for Astrophysics

天体物理学领域的基础模型

Xiaosheng Zhao, Yuan-Sen Ting

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本章介绍面向天文领域的基础模型,阐述其核心是可迁移表示,指出当前天文领域此类模型的可迁移性验证案例较少,未来需进一步探索提升路径。

Comments Invited chapter for the edited book "Machine Learning Techniques for Astrophysics and Cosmology" (Eds. Cosimo Bambi, Vinay Kashyap, Swarnim Shashank, Naoki Yoshida, Springer Singapore, expected in 2026). Submitted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27372 2026-07-31 cs.LG cs.AI cs.CL cs.CV 新提交 82%

Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation

探索式建模:解锁第三大预训练轴与端到端生成

Alexi Gladstone, Heng Ji, Yilun Du

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) Harvard(哈佛大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出探索式建模(XMs),为生成式模型增添第三预训练轴,可提升多域性能与效率,还能实现端到端重构生成建模,推理步骤大幅减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08164 2026-07-28 cs.CV 版本更新 82%

How Much MRI Preprocessing Is Enough? A Cost-Utility Study for Brain MRI Foundation Models

MRI预处理需要多少才够?脑MRI基础模型的成本效用研究

Jiangshuan Pang, Wangyang Tang, Jing Yan, Zhixuan Cheng, Youzhe He, Yiting Deng, Zhenkun Zhuang, Shiping Liu

机构 * University of the Chinese Academy of Sciences(中国科学院大学) BGI Research(华大研究院)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本研究通过比较P0-P7预处理级别对自监督3D MRI预训练的影响,发现并非预处理越强越好,P2是最低成本可行级别,更强预处理仅在特定任务中带来有限提升,且下游可补偿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22204 2026-07-27 eess.SP 新提交 82%

A Foundation Model for Cross-Band CSI Reconstruction

跨频段 CSI 重建的基础模型

Hongpu Zhang, Shu Sun, Ruifeng Gao, Tongjia Zhang, Feng Yang

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 研究多频段低空无线系统中跨频段 CSI 重建问题,提出在公共频谱表示频段、用射频元数据辅助的基础模型,经特定训练,相比基线降低平均归一化均方误差,能转移到未见频段对且在导频有噪声时仍有效。

Comments 6 pages, 4 figures, accepted by 2026 IEEE/CIC International Conference on Communications in China (ICCC Workshops)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20832 2026-07-24 cs.LG cs.AI cs.CL cs.CR 新提交 82%

Beyond Heavy Log Curation: Perplexity-Based APT Detection via Unsupervised, Context-Augmented Language Models

超越繁重的日志整理:通过无监督、上下文增强语言模型进行基于困惑度的APT检测

Shoya Otsu, Kei Suzuki, Toshiaki Koike-Akino, Jing Liu, Ye Wang

机构 * Mitsubishi Electric Corporation(三菱电机公司) Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对APT检测难题,提出CAPTAIN方法,利用通用预训练语言模型,经最少领域无关预处理,通过编码历史、注入上下文令牌及应用平滑滤波器,实现稳健日志评分,在基准测试中表现良好,降低了日志预处理成本。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18821 2026-07-24 cs.PL 版本更新 82%

VirtualSet: Typed Ontology Worlds as an LLM Generation Target for Grounded Queries and Guarded Decisions

虚拟集:作为大语言模型生成目标的类型化本体世界,用于有根据的查询和有保障的决策

Qunhui Zhang

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract)

AI总结 针对大语言模型操作企业数据时SQL错误信号延迟的问题,提出VirtualSet,通过集合表达式、通用约束投影等技术实现有根据的查询和有保障的决策,在实验中展现出优势,在SQL基准测试中保持竞争力。

Comments 21 pages, 13 figures, 1 table; added a reference to the companion GCP paper (arXiv:2607.19693) and aligned GCP terminology; results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08639 2026-07-17 cs.RO cs.CV 版本更新 82%

Native Video-Action Pretraining for Generalizable Robot Control

用于可泛化机器人控制的原生视频动作预训练

Qihang Zhang, Lin Li, Luyao Zhang, Shuai Yang, Yiming Luo, Shuaiting Li, Ruilin Wang, Junke Wang, Jiahao Shao, Gangwei Xu, Jiaming Zhou, Yishu Shen, Yudong Jin, Fangyi Xu, Shuailei Ma, Jiaqi Liao, Guanxing Lu, Zifan Shi, Yongkun Wen, Yujie Zhao, Weixuan Tang, Xinyang Wang, Chaojian Li, Jiapeng Zhu, Ka Leong Cheng, Nan Xue, Xing Zhu, Yujun Shen, Yinghao Xu

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract)

AI总结 研究针对机器人控制中视频动作模型应用于物理环境的不足,提出LingBot-VA 2.0,通过语义视觉动作分词器等四个核心设计原则构建基础模型,经真实世界部署验证其在复杂操作任务中的少样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13678 2026-07-16 eess.SP 新提交 82%

M3F-UAV: A Missing-Modality Multimodal Foundation Model for Low-Altitude Wireless Sensing

M3F-UAV:一种用于低空无线传感的缺失模态多模态基础模型

Pengxuan Gao, Kai Ying, Botao Wu, Jianhua Mo, Qingsong Wen

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 针对复杂环境下单模态模型可靠性低的问题,提出M3F-UAV模型,通过特定模态预训练特征提取器、跨模态融合及缺失模态感知预训练,从多观测中学习统一表示,在LAMBDA数据集实验中性能优于单模态基线且在缺失模态下稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08949 2026-07-16 cs.CR cs.SE 版本更新 82%

SeedSmith: LLM-Driven Seed Synthesis for Directed Fuzzing

SeedSmith:用于定向模糊测试的基于大语言模型的种子合成

Junmin Zhu, Siyu Liu, Jie Hu, Fabio Gritti, Ati Priya Bajaj, Hulin Wang, Wenbo Guo, Tiffany Bao, Christopher Kruegel, Giovanni Vigna

专题命中 预训练与数据 :LLM(title,abstract);prompting(abstract)

AI总结 研究针对定向模糊测试常无法触发崩溃的问题,提出SeedSmith这一基于大语言模型的管道,通过复制分析师工作流程合成种子,提升模糊器性能,在Magma和ARVO上取得显著加速和发现新漏洞的成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19802 2026-07-16 cs.CV 版本更新 82%

Evaluating Vision Foundation Models for Pixel and Object Classification in Microscopy

评估显微镜中用于像素和物体分类的视觉基础模型

Carolin Teuber, Anwai Archit, Tobias Boothe, Peter Ditte, Jochen Rink, Constantin Pape

机构 * Georg-August-University Göttingen, Institute of Computer Science Department of Tissue Dynamics Regeneration, Max Planck Institute for Multidisciplinary Sciences, Göttingen Georg-August-University Göttingen, Faculty of Biology Psychology CAIMed - Lower Saxony Center for AI \& Causal Methods in Medicine, Göttingen Cluster of Excellence Multiscale Bioimaging (MBExC), Georg-August-University Göttingen

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文评估了视觉基础模型在显微镜像素和物体分类中的应用,探讨了其在提升分类性能方面的潜力,并建立了相关基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07675 2026-07-09 cs.CV 新提交 82%

Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence

用于具身智能的缩放专家混合视频预训练

Shuailei Ma, Jiaqi Liao, Xinyang Wang, Jingjing Wang, Chaoran Feng, Zijing Hu, Chong Bao, Zichen Xi, Yuqi Gan, Weisen Wang, Yanhong Zeng, Qin Zhao, Zifan Shi, Wei Wu, Hao Ouyang, Qiuyu Wang, Shangzhan Zhang, Jiahao Shao, Yipengjing Sun, Liangxiao Hu, Lunke Pan, Nan Xue, Kecheng Zheng, Yinghao Xu, Xing Zhu, Yujun Shen, Ka Leong Cheng

机构 * Robbyant(蚂蚁灵波)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract)

AI总结 针对视频生成模型领域不匹配问题,提出LingBot-Video,采用MoE架构、构建数据剖析引擎、开发多维奖励系统进行视频预训练,验证了其性能和效率,贡献了首个大规模开源MoE视频基础模型。

Comments Project page: https://technology.robbyant.com/lingbot-video

详情

展开后加载摘要…

URL PDF HTML 收藏