arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-27 至 2026-02-27 共收录 16 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 16 篇

2602.22760 2026-02-27 cs.DC cs.AI 89%

Distributed LLM Pretraining During Renewable Curtailment Windows: A Feasibility Study

分布式LLM预训练期间可再生能源削减窗口:可行性研究

Philipp Wiesner, Soeren Becker, Brett Cornick, Dominik Scheinert, Alexander Acker, Odej Kao

机构 * TU Berlin(柏林技术大学)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title);large language model(abstract);language model(abstract)

AI总结 本研究探讨在可再生能源削减窗口期间利用清洁廉价电力进行分布式LLM预训练的可行性,通过联邦学习框架实现跨地理分布集群的弹性训练,降低碳排放。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17562 2026-02-27 cs.CV 89%

Visual Instruction Pretraining for Domain-Specific Foundation Models

面向领域特定基础模型的视觉指令预训练

Yuxuan Li, Yicheng Zhang, Wenhao Tang, Yimian Dai, Ming-Ming Cheng, Xiang Li, Jian Yang

机构 * PCA Lab, VCIP, Computer Science, NKU, Tianjin, China(PCA实验室、VCIP、计算机科学、NKU、天津,中国) NKIARI, Futian, Shenzhen, China(NKIARI、福田、深圳,中国)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);language model(abstract)

AI总结 本文提出ViTP,通过视觉指令预训练提升领域特定基础模型的感知与推理能力,在多个遥感和医学影像任务中取得新的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22557 2026-02-27 cs.AI cs.LG 84%

CourtGuard: A Model-Agnostic Framework for Zero-Shot Policy Adaptation in LLM Safety

CourtGuard:一种用于大语言模型安全的模型无关框架,用于零样本策略适应

Umid Suleymanov, Rufiz Bayramov, Suad Gafarli, Seljan Musayeva, Taghi Mammadov, Aynur Akhundlu, Murat Kantarcioglu

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工大学计算机科学系) School of IT(信息技术学院) Engineering, ADA University(工程学院,ADA大学) School of Law, ADA University(法学院,ADA大学)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 CourtGuard通过证据辩论框架实现大语言模型的安全零样本适应,超越传统方法在多个安全基准测试中的表现,并具备跨领域泛化和自动数据审计能力。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22879 2026-02-27 cs.AI 83%

Towards LLM-Empowered Knowledge Tracing via LLM-Student Hierarchical Behavior Alignment in Hyperbolic Space

基于大语言模型的知识追踪:通过超几何空间中的LLM-学生层次行为对齐

Xingcheng Fu, Shengpeng Wang, Yisen Gao, Xianxian Li, Chunpei Li, Qingyun Sun, Dongran Yu

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出L-HAKT框架,通过超几何空间中的层次行为对齐,提升知识追踪对认知状态层次演化和个性化问题难度感知的建模能力。

Comments 9 pages, 6 figures, Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07452 2026-02-27 cs.CR cs.CL 79%

PATCH: Mitigating PII Leakage in Language Models with Privacy-Aware Targeted Circuit PatcHing

PATCH: 通过隐私意识的针对性电路修补缓解语言模型中的PII泄露

Anthony Hughes, Vasisht Duddu, N. Asokan, Nikolaos Aletras, Ning Ma

机构 * University of Sheffield(谢菲尔德大学) University of Waterloo(滑铁卢大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 PATCH通过针对性电路修补减少语言模型中的PII泄露,实现更好的隐私-实用性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06491 2026-02-27 cs.CV cs.RO 78%

PPT: Pretraining with Pseudo-Labeled Trajectories for Motion Forecasting

PPT:基于伪标签轨迹的运动预测预训练

Yihong Xu, Yuan Yin, Éloi Zablocki, Tuan-Hung Vu, Alexandre Boulch, Matthieu Cord

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 PPT通过利用伪标签轨迹进行预训练,提升运动预测的泛化能力和在低数据环境下的性能。

Comments 8 pages, 6 figures, accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23057 2026-02-27 cs.CL cs.AI 73%

Affine-Scaled Attention: Towards Flexible and Stable Transformer Attention

仿射缩放注意力:迈向灵活且稳定的Transformer注意力

Jeongin Bae, Baeseong Park, Gunho Park, Minsub Kim, Joonhyung Lee, Junhee Yoo, Sunghyeon Woo, Jiwon Ryu, Se Jung Kwon, Dongsoo Lee

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 仿射缩放注意力通过引入输入依赖的缩放和偏置项,提升Transformer模型的训练稳定性与注意力行为控制能力。

Comments Preprint. 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22223 2026-02-27 cs.IR cs.CL cs.LG 73%

SQaLe: A Large Text-to-SQL Corpus Grounded in Real Schemas

SQaLe:基于真实模式的大型文本到SQL语料库

Cornelius Wolff, Daniel Gomm, Madelon Hulsebos

机构 * Centrum Wiskunde & Informatica(荷兰数学与信息学研究中心) University of Amsterdam(阿姆斯特丹大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 SQaLe是一个基于真实数据库模式的大型半合成文本到SQL数据集,通过结合模式采样、问题合成和SQL构建,生成了高质量的(问题,模式,查询)三元组,用于提升文本到SQL模型的泛化能力。

Comments Accepted at the AI for Tabular Data workshop at EurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22765 2026-02-27 cs.CL 70%

Towards Better RL Training Data Utilization via Second-Order Rollout

通过二次回滚实现更好的RL训练数据利用

Zhe Yang, Yudong Wang, Rang Li, Zhifang Sui

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) ByteDance BandAI(字节跳动BandAI)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出通过二次回滚提升RL训练数据利用效率,联合训练生成与批判能力,实验表明在相同数据下性能更优,并揭示标签平衡与噪声问题的解决方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15210 2026-02-27 cs.LG 70%

ÜberWeb: Insights from Multilingual Curation for a 20-Trillion-Token Dataset

ÜberWeb: 多语言编纂对20万亿token数据集的洞察

DatologyAI, :, Aldo Gael Carranza, Kaleigh Mentzer, Ricardo Pio Monti, Alex Fang, Alvin Deng, Amro Abbas, Anshuman Suri, Brett Larsen, Cody Blakeney, Darren Teh, David Schwab, Diego Kiner, Fan Pan, Haakon Mongstad, Haoli Yin, Jack Urbanek, Jason Lee, Jason Telanoff, Josh Wills, Luke Merrick, Maximilian Böther, Parth Doshi, Paul Burstein, Pratyush Maini, Rishabh Adiga, Siddharth Joshi, Spandan Das, Tony Jiang, Vineeth Dorna, Zhengping Wang, Bogdan Gaza, Ari Morcos, Matthew Leavitt

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 通过多语言数据编纂优化20万亿token数据集,显著提升多语言模型性能并降低计算需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08683 2026-02-27 cs.CV 67%

OneVision-Encoder: Codec-Aligned Sparsity as a Foundational Principle for Multimodal Intelligence

OneVision-Encoder: 编码对齐的稀疏性作为多模态智能的基础原则

Feilong Tang, Xiang An, Yunyao Yan, Yin Xie, Bin Qin, Kaicheng Yang, Yifei Shen, Yuanhan Zhang, Chunyuan Li, Shikun Feng, Changrui Chen, Huajie Tan, Ming Hu, Manyuan Zhang, Bo Li, Ziyong Feng, Ziwei Liu, Zongyuan Ge, Jiankang Deng

机构 * Glint Lab(Glint实验室) AIM for Health Lab(健康人工智能实验室) MVP Lab(MVP实验室)

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract)

AI总结 OneVision-Encoder通过编码对齐的稀疏性原则,实现高效的多模态视觉理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27566 2026-02-27 cs.IR 67%

Interact-RAG: Reason and Interact with the Corpus, Beyond Black-Box Retrieval

Interact-RAG: 基于语义交互的检索增强生成,超越黑盒检索

Yulong Hui, Chao Chen, Zhihang Fu, Yihao Liu, Jieping Ye, Huanchen Zhang

专题命中 预训练与数据 :LLM(abstract);SFT(abstract)

AI总结 Interact-RAG通过引入语义交互引擎,使LLM代理能够主动操控检索过程,从而提升复杂信息检索任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22481 2026-02-27 cs.CL cs.AI 62%

Sydney Telling Fables on AI and Humans: A Corpus Tracing Memetic Transfer of Persona between LLMs

悉尼在AI与人类之间讲述寓言:LLM间人设的语料追溯膜传

Jiří Milička, Hana Bednářová

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文通过分析LLM生成的文本,探讨悉尼人设在AI与人类关系中的传播与影响,并构建了相关语料库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22865 2026-02-27 cs.CL 57%

Effective QA-driven Annotation of Predicate-Argument Relations Across Languages

跨语言有效的问题回答驱动的谓词-论元关系标注

Jonathan Davidov, Aviv Slobodkin, Shmuel Tomi Klein, Reut Tsarfaty, Ido Dagan, Ayal Klein

机构 * Bar-Ilan University(巴伊兰大学) Ariel University(阿里尔大学)

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL

AI总结 本文提出一种跨语言问题回答驱动的谓词-论元关系标注方法,通过重用英语QA-SRL解析器生成多语言高质量标注数据,提升语义解析效率。

Comments Accepted to EACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23292 2026-02-27 cs.CV 50%

PGVMS: A Prompt-Guided Unified Framework for Virtual Multiplex IHC Staining with Pathological Semantic Learning

PGVMS: 一种基于提示的统一框架用于虚拟多色IHC染色与病理语义学习

Fuqiang Chen, Ranran Zhang, Wanming Hu, Deboch Eyob Abera, Yue Peng, Boyun Zheng, Yiwen Sun, Jing Cai, Wenjian Qin

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences and University of Chinese Academy of Sciences, Beijing, China(深圳先进技术研究院,中国科学院和中国科学院大学,北京,中国) Department of Pathology, Sun Yat-sen University Cancer Center, State Key Laboratory of Oncology in South China, Guangzhou, China(中山大学肿瘤中心病理科,南方肿瘤临床研究中心,广州,中国) Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学,香港特别行政区,中国) Department of Electronic Engineering, The Chinese University of Hong Kong, Hong Kong SAR 999077, China(电子工程系,香港中文大学,香港特别行政区,中国) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China(深圳先进技术研究院,中国科学院,深圳,中国)

专题命中 预训练与数据 :language model(abstract)

AI总结 PGVMS提出了一种基于提示的统一框架,利用单染训练数据解决虚拟多色IHC染色中的语义指导、染色分布不一致和空间错位问题。

Comments Accepted by TMI

Journal ref IEEE Transactions on Medical Imaging, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22510 2026-02-27 cs.CV 50%

Pix2Key: Controllable Open-Vocabulary Retrieval with Semantic Decomposition and Self-Supervised Visual Dictionary Learning

Pix2Key: 通过语义分解和自监督视觉字典学习实现可控的开放词汇检索

Guoyizhe Wei, Yang Jiao, Nan Xi, Zhishen Huang, Jingjing Meng, Rama Chellappa, Yan Gao

机构 * Johns Hopkins University, Baltimore, US(约翰霍普金斯大学) Amazon.com, Seattle, US(亚马逊公司)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 Pix2Key通过语义分解和自监督视觉字典学习,实现可控的开放词汇检索,提升检索精度和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏