arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-01 至 2026-04-01 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 13 篇

2603.29661 2026-04-01 cs.CL cs.AI cs.IR 90%

Agenda-based Narrative Extraction: Steering Pathfinding Algorithms with Large Language Models

基于议程的叙述提取:用大语言模型引导路径查找算法

Brian Felipe Keith-Norambuena, Carolina Inés Rojas-Córdova, Claudio Juvenal Meneses-Villegas, Elizabeth Johanna Lam-Esquenazi, Angélica María Flores-Bustos, Ignacio Alejandro Molina-Villablanca, Joshua Emanuel Leyton-Vallejos

机构 * Department of Computing and Systems Engineering, Universidad Católica del Norte, Antofagasta, Chile(智利天主教大学北部校区计算与系统工程系,安托法加斯塔,智利) Department of Industrial Engineering, Universidad Católica del Norte, Antofagasta, Chile(智利天主教大学北部校区工业工程系,安托法加斯塔,智利) Department of Chemical and Environmental Engineering, Universidad Católica del Norte, Antofagasta, Chile(智利天主教大学北部校区化学与环境工程系,安托法加斯塔,智利)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于议程的叙述提取方法,通过整合大语言模型到路径查找过程中,引导叙述构建朝向用户指定视角,提升了叙述的连贯性和多视角支持。

Comments Text2Story Workshop 2026 at ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00022 2026-04-01 cs.CL cs.AI cs.LG 87%

Aleph-Alpha-GermanWeb: Improving German-language LLM pre-training with model-based data curation and synthetic data generation

Aleph-Alpha-GermanWeb:通过基于模型的数据筛选和合成数据生成改进德语LLM预训练

Thomas F Burns, Letitia Parcalabescu, Stephan Wäldchen, Michael Barlow, Gregor Ziegltrum, Volker Stampa, Bastian Harren, Björn Deiseroth

机构 * Aleph Alpha Research(Aleph Alpha 研究)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种结合启发式与模型筛选技术及合成数据生成的德语数据集筛选流程,构建了628B词的预训练数据集,通过在德语基准测试中显著优于FineWeb2,证明了基于模型的数据筛选和合成数据生成对LLM预训练的提升作用。

Comments 17 pages, 3 figures; published at EACL 2026

Journal ref EACL 2026, volume 1, pages 1267-1283

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29644 2026-04-01 cs.LG 79%

Disentangled Graph Prompting for Out-Of-Distribution Detection

解耦图提示用于分布外检测

Cheng Yang, Yu Hao, Qi Zhang, Chuan Shi

机构 * Beijing Key Lab of Intelligent Telecommunications Software and Multimedia, Beijing University of Posts and Telecommunications(北京邮电大学智能通信软件与多媒体北京市重点实验室) China Mobile Group Shaanxi Co., Ltd.(中国移动通信集团陕西有限公司)

专题命中 预训练与数据 :prompting(title,abstract);分类 cs.LG

AI总结 本文提出解耦图提示方法,通过预训练和提示机制捕捉细粒度分布内模式,提升图分布外检测性能,实验表明其在多个数据集上优于现有基线。

Comments Accepted for publication in IEEE Transactions on Knowledge and Data Engineering (TKDE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28773 2026-04-01 cs.IR cs.CL cs.LG 79%

UltRAG: a Universal Simple Scalable Recipe for Knowledge Graph RAG

UltRAG:一种通用简单可扩展的知识图谱RAG配方

Dobrik Georgiev, Kheeran Naidu, Alberto Cattaneo, Federico Monti, Carlo Luschi, Daniel Justus

机构 * Graphcore Research(Graphcore 研究院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出UltRAG框架,通过神经查询执行模块提升知识图谱问答性能,无需重新训练LLM,在大规模知识图谱上实现高效问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28336 2026-04-01 cs.AI cs.LG 79%

A Multi-Agent Rhizomatic Pipeline for Non-Linear Literature Analysis

一种多智能体根状管道用于非线性文献分析

Julio C. Serrano, Joonas Kevari, Rumy Narayan

机构 * University of Vaasa, School of Management, Vaasa, Finland(瓦萨大学管理学院) LUT University, School of Engineering, Lahti, Finland(拉彭兰塔-拉赫蒂理工大学工程学院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于德勒兹过程关系本体的多智能体系统,通过12个专用智能体实现非线性文献分析,自动检测跨学科交汇与研究空白。

Comments Research note paper, 12 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29034 2026-04-01 cs.CV eess.IV 78%

The Surprising Effectiveness of Noise Pretraining for Implicit Neural Representations

隐式神经表示中噪声预训练的意外有效性

Kushal Vyas, Alper Kayabasi, Daniel Kim, Vishwanath Saragadam, Ashok Veeraraghavan, Guha Balakrishnan

机构 * Rice University(莱斯大学) University of California, Riverside(加州大学河滨分校)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文通过噪声预训练探索隐式神经表示的特性,发现无结构噪声预训练显著提升信号拟合能力,但对去噪效果不佳,而经典自然图像频谱结构的噪声则在信号拟合与逆向成像间取得平衡。

Comments Accepted to CVPR 2026. Project page: https://kushalvyas.github.io/noisepretraining.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29974 2026-04-01 cs.LG 74%

Meteorology-Driven GPT4AP: A Multi-Task Forecasting LLM for Atmospheric Air Pollution in Data-Scarce Settings

气象驱动的GPT4AP:一种用于数据稀少环境的多任务预测LLM

Prasanjit Dey, Soumyabrata Dev, Bianca Schoen-Phelan

机构 * ADAPT SFI Research Centre, School of Computer Science, Technological University Dublin(ADAPT SFI研究中心,计算机科学学院,都柏林理工大学) ADAPT SFI Research Centre, School of Computer Science, University College Dublin(ADAPT SFI研究中心,计算机科学学院,都柏林大学学院) School of Computer Science, Technological University Dublin(计算机科学学院,都柏林理工大学)

专题命中 预训练与数据 :LLM(title);分类 cs.LG

AI总结 本文提出GPT4AP,一种基于预训练GPT-2和rsLoRA的高效多任务预测框架,用于数据稀少环境下的大气污染预测,展示了其在少样本、零样本和长期预测中的优越性能。

Comments This manuscript is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29221 2026-04-01 cs.CL 70%

SiPaKosa: A Comprehensive Corpus of Canonical and Classical Buddhist Texts in Sinhala and Pali

SiPaKosa:一篇全面的斯里兰卡语和巴利经典和古典佛教文本语料库

Ranidu Gurusinghe, Nevidu Jayatilleke

机构 * School of Computing, Informatics Institute of Technology, Sri Lanka(斯里兰卡信息理工学院计算学院)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 SiPaKosa语料库包含约786万词和786千句,结合16份历史佛教文献和完整的巴利三藏文本,通过高质量OCR和网络爬虫构建,评估了10种预训练模型的性能,显示专有模型在开放源代码模型上表现优异,支持领域适应语言模型的预训练,促进历史语言分析和佛教研究信息检索系统的发展。

Comments 17 pages, 5 figures, 5 tables, Accepted paper at the 2nd Workshop on Challenges in Processing South Asian Languages (CHiPSAL) @ LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29176 2026-04-01 q-bio.NC cs.AI cs.CE cs.CV 70%

Predicting Neuromodulation Outcome for Parkinson's Disease with Generative Virtual Brain Model

利用生成虚拟脑模型预测帕金森病的神经调制疗效

Siyuan Du, Siyi Li, Shuwei Bai, Ang Li, Haolin Li, Mingqing Xiao, Yang Pan, Dongsheng Li, Weidi Xie, Yanfeng Wang, Ya Zhang, Chencheng Zhang, Jiangchao Yao

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院) Microsoft Research Asia(微软亚洲研究院) Zhongnan Hospital of Wuhan University(武汉大学中南医院) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Institute of Artificial Intelligence for Medicine, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院人工智能医学研究所) Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(上海交通大学协同媒体创新中心)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出一种基于生成虚拟脑模型的预训练-微调框架,通过静息态fMRI预测帕金森病患者接受颞叶干扰和深部脑刺激的疗效,利用生成模型提高个体化虚拟脑的准确性,并通过反事实估计预测临床反应,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29522 2026-04-01 cs.CL cs.AI cs.LG 67%

Baby Scale: Investigating Models Trained on Individual Children's Language Input

Baby Scale:研究基于个体儿童语言输入训练的模型

Steven Y. Feng, Alvin W. M. Tan, Michael C. Frank

机构 * Stanford University(斯坦福大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究基于儿童语言输入训练的模型在不同数据规模下的表现,探讨模型性能与儿童语言发展之间的关系,发现儿童数据在语法任务上表现良好,但在语义和世界知识任务上不如合成数据。

Comments Code and data at https://github.com/styfeng/babyscale-LM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29640 2026-04-01 cs.AI 57%

ASI-Evolve: AI Accelerates AI

ASI-Evolve:人工智能加速人工智能

Weixian Xu, Tiantian Mi, Yixiu Liu, Yang Nan, Zhimeng Zhou, Lyumanshan Ye, Lin Zhang, Yu Qiao, Pengfei Liu

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 本文提出ASI-Evolve框架,通过学习-设计-实验-分析循环实现AI驱动的AI研究,展示了在数据、架构和算法三个核心领域中的突破性成果。

Comments 19 pages, 6 figures, 6 tables. Code available at https://github.com/GAIR-NLP/ASI-Evolve

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29026 2026-04-01 cs.CL 57%

On the limited utility of parallel data for learning shared multilingual representations

共享多语言表示在预训练中平行数据的有限效用

Julius Leino, Jörg Tiedemann

机构 * University of Helsinki(赫尔辛基大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL

AI总结 本文研究平行数据在预训练中对多语言表示对齐的影响,发现其效果有限,仅在预训练早期加速表示共享并减少语言特异性神经元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29796 2026-04-01 eess.SP 50%

JEPA-MSAC: A Joint-Embedding Predictive Architecture for Multimodal Sensing-Assisted Communications

JEPA-MSAC:一种联合嵌入预测架构用于多模态传感辅助通信

Can Zheng, Jiguang He, Guofa Cai, Nannan Li, Mehdi Bennis, Henk Wymeersch, Merouane Debbah

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出JEPA-MSAC框架,通过联合嵌入预测架构实现多模态传感辅助通信的自监督学习,支持多任务预测并降低适应成本。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏