arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-17 至 2026-03-17 共收录 37 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 37 篇

2512.10793 2026-03-17 cs.CL cs.AI 91%

LabelFusion: Fusing Large Language Models with Transformer Encoders for Robust Financial News Classification

LabelFusion:融合大型语言模型与Transformer编码器以实现稳健的金融新闻分类

Michael Schlee, Christoph Weisser, Timo Kivimäki, Melchizedek Mashiku, Benjamin Saefken

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出LabelFusion架构,结合提示工程的LLM与微调的RoBERTa编码器,通过轻量MLP投票层提升金融新闻分类性能,在低数据环境下LLM单独使用表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13264 2026-03-17 cs.LG cs.IR 90%

Federated Personal Knowledge Graph Completion with Lightweight Large Language Models for Personalized Recommendations

联邦轻量级大语言模型用于个性化推荐的知识图谱补全

Fernando Spadea, Oshani Seneviratne

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出FedTREK-LM框架,结合轻量级大语言模型、演化个人知识图谱和联邦学习,实现可扩展的去中心化个性化推荐,实验显示其在电影和食谱推荐中F1分数提升超4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05400 2026-03-17 cs.CL 90%

Dynamic Noise Preference Optimization: Self-Improvement of Large Language Models with Self-Synthetic Data

动态噪声偏好优化:通过自合成数据提升大语言模型的自我改进

Haoyan Yang, Khiem Le, Ting Hua, Shangqian Gao, Binfeng Xu, Zheng Tang, Jie Xu, Nitesh V. Chawla, Hongxia Jin, Vijay Srinivasan

专题命中 预训练与数据 :preference optimization(title,abstract);large language model(title);language model(title);分类 cs.CL

AI总结 本文提出动态噪声偏好优化方法,通过动态样本标注和可控噪声注入提升大语言模型在自合成数据上的持续改进能力,实验表明其在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03864 2026-03-17 cs.DL 89%

Have Large Language Models Enhanced the Way Civil & Environmental Engineers Write? A Quantitative Analysis of Scholarly Communication over 25 Years

大语言模型是否增强了土木与环境工程师的写作方式?对25年学术交流的定量分析

Morgan D. Sanger, Brett W. Maurer

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文通过词汇频率分析方法,研究大语言模型对土木与环境工程领域学术写作的影响,发现自2022年起,LLM的使用显著改变了写作风格,使文章更复杂、自信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14563 2026-03-17 cs.CL 88%

Multilingual TinyStories: A Synthetic Combinatorial Corpus of Indic Children's Stories for Training Small Language Models

多语言TinyStories:一种印度儿童故事的合成组合语料库,用于训练小型语言模型

Deepon Halder, Angira Mukherjee

专题命中 预训练与数据 :language model(title,abstract);small language model(title,abstract);分类 cs.CL

AI总结 本文提出一个多语言TinyStories语料库,包含17种印度语言的儿童故事,用于训练和评估小型语言模型,通过混合编纂流程生成了132,942个故事和9390万词。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19554 2026-03-17 cs.CV 88%

Harvest Video Foundation Models via Efficient Post-Pretraining

通过高效后预训练收获视频基础模型

Yizhuo Li, Kunchang Li, Yinan He, Yi Wang, Yali Wang, Limin Wang, Yu Qiao, Ping Luo

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract)

AI总结 本文提出一种高效框架,通过随机丢弃视频片段和遮蔽文本来从图像基础模型中获取视频基础模型,提升了训练效率并强化了跨模态融合,实验表明其在多种视频-语言任务中达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14712 2026-03-17 cs.CL cs.LG 86%

Towards Next-Generation LLM Training: From the Data-Centric Perspective

迈向下一代大语言模型训练:从数据导向的视角

Hao Liang, Zhengyang Zhao, Zhaoyang Han, Meiyi Qiang, Xiaochen Ma, Bohan Zeng, Qifeng Cai, Zhiyu Li, Linpeng Tang, Weinan E, Wentao Zhang

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文从数据导向视角出发,探讨了大语言模型训练中的数据准备瓶颈问题,提出构建自动数据准备系统和统一的数据-模型交互训练系统,以提升数据利用效率和模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15341 2026-03-17 cs.AI cs.HC cs.MA 85%

Intelligent Co-Design: An Interactive LLM Framework for Interior Spatial Design via Multi-Modal Agents

智能协同设计:一种基于多模态代理的交互式LLM框架用于室内空间设计

Ren Jian Lim, Rushi Dai

机构 * Hong Kong Center for Construction Robotics(香港建设机器人中心)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于LLM的多模态多代理框架,通过自然语言描述和图像动态生成3D设计,提升用户参与度和设计效率。

Comments 25 pages, 20 figures; accepted for publication in the Proceedings of ACADIA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14430 2026-03-17 cs.CL 85%

Creative Convergence or Imitation? Genre-Specific Homogeneity in LLM-Generated Chinese Literature

创新融合还是模仿?LLM生成中文文学中的题材特异性同质性

Yuanchi Ma, Kaize Shi, Hui He, Zhihua Zhang, Zhongxiang Lei, Ziliang Qiu, Renfen Hu, Jiamou Liu

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过引入普罗普叙事学理论,分析LLM生成的中文网络文学叙事结构,揭示其同质化原因,定义34种现代网络叙事功能并构建标注语料库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13301 2026-03-17 cs.IR cs.AI cs.LG 84%

Not All Queries Need Rewriting: When Prompt-Only LLM Refinement Helps and Hurts Dense Retrieval

并非所有查询都需要重写:当仅提示的LLM细化在密集检索中帮助和损害时

Varun Kotte

机构 * Adobe(Adobe公司)

专题命中 预训练与数据 :LLM(title,abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了仅提示的LLM查询重写对密集检索的影响,发现其效果高度依赖领域,通过实验发现重写在不同数据集上产生不同效果,并指出领域适应性后训练比单纯重写更安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13272 2026-03-17 cs.LG cs.AI 84%

CAMEL-CLIP: Channel-aware Multimodal Electroencephalography-text Alignment for Generalizable Brain Foundation Models

CAMEL-CLIP:面向通用脑基础模型的通道感知多模态EEG-文本对齐

Hanseul Choi, Jinyeong Park, Seongwon Jin, Sungho Park, Jibum Kim

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Incheon National University(庆尚国立大学) Department of Artificial Intelligence(人工智能系) Inha University(Inha大学) Center for Brain-Machine Interface(脑机接口中心)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 CAMEL-CLIP通过通道属性位置编码、动态通道投影和双级对比学习,提升EEG-文本多模态基础模型在通道异质性下的鲁棒性,实验表明其在线性探测中表现最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15594 2026-03-17 cs.AI cs.CL 82%

OpenSeeker: Democratizing Frontier Search Agents by Fully Open-Sourcing Training Data

OpenSeeker:通过完全开源训练数据民主化前沿搜索代理

Yuwen Du, Rui Ye, Shuo Tang, Xinyu Zhu, Yijun Lu, Yuzhu Cai, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 OpenSeeker通过两项技术创新实现前沿性能,利用开源数据提升搜索代理能力,实验表明其在多个基准测试中表现优异,超越现有开源和工业竞争对手。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15259 2026-03-17 cs.LG cs.AI cs.CL cs.CR 82%

Directional Embedding Smoothing for Robust Vision Language Models

方向嵌入平滑用于鲁棒视觉语言模型

Ye Wang, Jing Liu, Toshiaki Koike-Akino

机构 * Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过方向嵌入平滑技术提升视觉语言模型的鲁棒性,针对多模态劫持攻击,验证了方向嵌入噪声在降低攻击成功率中的有效性。

Comments Accepted at ICLR 2026 Workshop on Agents in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01111 2026-03-17 cs.LG 81%

TsLLM: Augmenting LLMs for General Time Series Understanding and Prediction

TsLLM:增强大语言模型以实现通用时间序列理解和预测

Felix Parker, Nimeesha Chan, Chi Zhang, Kimia Ghobadi

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 TsLLM通过引入基于补丁的编码器-解码器架构,增强了大语言模型对时间序列数据的理解与预测能力,能够整合时间序列分析与自然语言处理,展现强大的零样本和少样本学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11894 2026-03-17 cs.CV cs.AI cs.LG 81%

3D-LFM: Lifting Foundation Model

3D-LFM:提升基础模型

Mosam Dabhi, Laszlo A. Jeni, Simon Lucey

机构 * Carnegie Mellon University(卡内基梅隆大学) The University of Adelaide(阿德莱德大学)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出3D-LFM,利用Transformer的排列等变性处理不同数量的3D点,提升3D结构和相机的重建能力,实现跨领域的高泛化性能。

Comments Visit the project page at https://3dlfm.github.io for links to additional media, code, and videos. The site also features a custom GPT tailored to address queries related to 3D-LFM. Accepted at CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13647 2026-03-17 cs.LG cs.NI 80%

PLUME: Building a Network-Native Foundation Model for Wireless Traces via Protocol-Aware Tokenization

PLUME:通过协议感知的分词构建无线痕迹的网络原生基础模型

Swadhin Pradhan, Shazal Irshad, Jerome Henry

机构 * Cisco Systems(思科系统)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 PLUME通过协议感知分词技术,为无线痕迹构建网络原生基础模型,实现更高效的序列生成与异常检测。

Comments 14-pages, 802.11 foundation model, matches frontier LLMs with 600x fewer params via protocol-aware tokenization, 5 figures, 12 tables, AUROC>=0.99 for zero-shot anomaly detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15005 2026-03-17 cs.CL 79%

Pretraining and Benchmarking Modern Encoders for Latvian

为拉脱维亚语预训练和基准测试现代编码器

Arturs Znotins

机构 * Institute of Mathematics and Computer Science, University of Latvia(拉脱维亚大学数学与计算机科学学院)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL

AI总结 本文通过预训练基于RoBERTa、DeBERTaV3和ModernBERT架构的拉脱维亚语专用编码器,评估其在拉脱维亚语诊断和语言基准测试中的表现,提出了一种性能优异的模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14420 2026-03-17 cs.AI 79%

Data Darwinism Part II: DataEvolve -- AI can Autonomously Evolve Pretraining Data Curation

数据达尔文主义 第二部分:DataEvolve -- AI可以自主进化预训练数据筛选

Tiantian Mi, Dongming Shan, Zhen Huang, Yiwei Qin, Muhang Xie, Yuxuan Qiao, Yixiu Liu, Chenyang Zhou, Pengfei Liu

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI

AI总结 本文提出DataEvolve框架,通过迭代优化而非手动设计实现预训练数据筛选策略的自动化进化,生成Darwin-CC数据集并在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12683 2026-03-17 cs.CL cs.AI 79%

Experimental evidence of progressive ChatGPT models self-convergence

渐进式ChatGPT模型自我收敛的实验证据

Konstantinos F. Xylogiannopoulos, Petros Xanthopoulos, Panagiotis Karampelas, Georgios A. Bakamitsos

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过文本相似性度量评估不同ChatGPT模型生成文本多样性,发现近期版本在显式提示下生成文本多样性下降,可能由于训练数据中合成数据量增加导致模型自我收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13434 2026-03-17 cs.LG cs.AI 79%

Modality-free Graph In-context Alignment

无模态图上下文对齐

Wei Zhuo, Siqiang Luo

机构 * Nanyang Technological University(南洋理工大学)

专题命中 预训练与数据 :LLM(abstract);foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MF-GIA框架,通过梯度指纹捕捉领域特征,实现跨异构域的无模态few-shot预测与泛化。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09823 2026-03-17 cs.SD cs.CL eess.AS 77%

Covo-Audio Technical Report

Covo-Audio技术报告

Wenfu Wang, Chenxing Li, Liqiang Zhang, Yiyang Zhao, Yuxiang Zou, Hanzhao Li, Mingyu Cui, Hao Zhang, Kun Wei, Le Xu, Zikang Huang, Jiajun Xu, Jiliang Hu, Xiang He, Zeyu Xie, Jiawen Kang, Youjun Chen, Meng Yu, Dong Yu, Rilin Chen, Linlin Di, Shulin Feng, Na Hu, Yang Liu, Bang Wang, Shan Yang

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);post-training(abstract);分类 cs.CL

AI总结 Covo-Audio是一款7B参数端到端LALM,通过大规模预训练和微调在多种任务中表现优异,包括语音文本建模、对话、语音理解等,并展示了其在实际对话助理中的应用潜力。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22947 2026-03-17 cs.CL cs.AI cs.LG 75%

Induction Signatures Are Not Enough: A Matched-Compute Study of Load-Bearing Structure in In-Context Learning

归纳签名不足:匹配计算下的上下文学习负载结构研究

Mohammed Sabry, Anya Belz

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过Bi-Induct研究上下文学习中归纳结构的负载能力,发现归纳头部活动增加但泛化能力未提升,揭示了归纳与反归纳的不对称性。

Comments Published as a paper at 3rd DATA-FM workshop @ ICLR 2026, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13308 2026-03-17 cs.LG cs.AI 73%

Task Expansion and Cross Refinement for Open-World Conditional Modeling

任务扩展与跨细化用于开放世界条件建模

Shreyas Bhat Brahmavar, Qiyang Liu, Yang Li, Junier Oliva

机构 * Department of Computer Science University of North Carolina at Chapel Hill(计算机科学系北卡罗来纳大学教堂山分校) Independent Researcher(独立研究者)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TEXR框架,通过结构化合成和细化语义数据上下文,扩展任务覆盖范围,提升开放世界条件建模的零样本、少样本和多样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14838 2026-03-17 cs.CL 70%

The Impact of Ideological Discourses in RAG: A Case Study with COVID-19 Treatments

检索增强生成中意识形态话语的影响:以新冠治疗方案为例

Elmira Salari, Maria Claudia Nunes Delfino, Hazem Amamou, José Victor de Souza, Shruti Kshirsagar, Alan Davoust, Anderson Avila

机构 * Wichita State University(威斯康星州立大学) Pontifícia Universidade Católica de São Paulo(圣保罗天主教大学) Institut national de la recherche scientifique(国家科学研究中心) Université du Québec en Outaouais(魁北克大学Outaouais)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究检索到的意识形态文本对大语言模型输出的影响,通过新冠治疗方案案例,探讨意识形态在RAG框架中的识别与影响,揭示意识形态偏见与潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14369 2026-03-17 cs.LG 70%

From Specification to Architecture: A Theory Compiler for Knowledge-Guided Machine Learning

从规范到架构:一种知识引导机器学习的理论编译器

Asela Hevapathige, Yu Xia, Sachith Seneviratne, Saman Halgamuge

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出理论编译器,通过形式化领域理论自动生成架构,确保函数空间与理论一致。解决三大开放问题:通用理论语言设计、编译算法构建、形式验证标准建立。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14126 2026-03-17 cs.AI 70%

The Institutional Scaling Law: Non-Monotonic Fitness, Capability-Trust Divergence, and Symbiogenetic Scaling in Generative AI

机构规模定律:非单调适应度、能力-信任分歧与共生式规模在生成AI中的体现

Mark Baciak, Thomas A. Cellucci

专题命中 预训练与数据 :post-training(abstract);RLHF(abstract);分类 cs.AI

AI总结 本文提出机构规模定律,揭示机构适应度非单调随模型规模变化,证明能力与信任在临界规模后正式分歧,并展示领域特定模型的协同系统在特定环境中优于前沿通用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03718 2026-03-17 cs.CL cs.AI 62%

Grounded Misunderstandings in Asymmetric Dialogue: A Perspectivist Annotation Scheme for MapTask

对话中的基础误解:一种面向MapTask的视角主义标注方案

Nan Li, Albert Gatt, Massimo Poesio

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种视角主义标注方案,用于分析MapTask中对话参与者对参照表达的 grounded 解释差异,揭示理解如何演变并修复,评估LLM对视角依赖性 grounding 的建模能力。

Comments 14 pages, 5 figures, 6 tables; Camera-ready Version; Accepted by LREC 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14664 2026-03-17 cs.AI cs.CL cs.CY 62%

Punctuated Equilibria in Artificial Intelligence: The Institutional Scaling Law and the Speciation of Sovereign AI

人工智能中的突变平衡:制度扩展定律与主权人工智能的物种分化

Mark Baciak, Thomas A. Cellucci, Deanna M. Falkowski

专题命中 预训练与数据 :post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文挑战人工智能发展连续进步的假设,提出基于生物进化突变平衡理论,揭示AI发展通过停滞期与快速转型交替的非单调模式,提出制度扩展定律及主权AI的物种分化概念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05980 2026-03-17 cs.LG cs.AI 62%

AMPED: Adaptive Multi-objective Projection for balancing Exploration and skill Diversification

AMPED: 自适应多目标投影用于平衡探索与技能多样化

Geonwoo Cho, Jaemoon Lee, Jaegyun Im, Subi Lee, Jihwan Lee, Sundong Kim

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AMPED方法,通过梯度手术投影平衡探索与多样性,在预训练和微调阶段均提升技能学习性能,实验表明其优于SBRL基线。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13518 2026-03-17 eess.AS cs.CL cs.HC cs.LG cs.SD 62%

VoXtream2: Full-stream TTS with dynamic speaking rate control

VoXtream2:全流文本到语音系统与动态说话速率控制

Nikita Torgashov, Gustav Eje Henter, Gabriel Skantze

机构 * Department of Speech, Music and Hearing, KTH Royal Institute of Technology, Sweden(语音、音乐与听觉系,皇家理工学院,瑞典)

专题命中 预训练与数据 :prompting(abstract);分类 cs.CL、cs.LG

AI总结 VoXtream2是一种全流文本到语音系统,通过动态控制说话速率实现低延迟和可控性,结合分布匹配机制和分类器自由引导提升合成质量,支持文本无关的音频提示。

Comments 10 pages, 9 figures, Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏