arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-04 至 2026-03-04 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 14 篇

2603.00253 2026-03-04 cs.LG 88%

CoPeP: Benchmarking Continual Pretraining for Protein Language Models

CoPeP:蛋白质语言模型持续预训练基准测试

Darshan Patil, Pranshu Malviya, Mathieu Reymond, Quentin Fournier, Sarath Chandar

机构 * Mila - Quebec AI Institute(魁北克AI研究所) Polytechnique Montréal(蒙特利尔理工学院) Chandar Research Lab(昌达尔研究实验室) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.LG

AI总结 CoPeP基准测试通过评估持续学习方法在蛋白质语言模型中的表现,揭示了整合时间元信息对模型性能的提升效果。

Comments 29 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03276 2026-03-04 cs.CV 88%

Beyond Language Modeling: An Exploration of Multimodal Pretraining

超越语言模型:多模态预训练的探索

Shengbang Tong, David Fan, John Nguyen, Ellis Brown, Gaoyue Zhou, Shengyi Qian, Boyang Zheng, Théophane Vallaeys, Junlin Han, Rob Fergus, Naila Murray, Marjan Ghazvininejad, Mike Lewis, Nicolas Ballas, Amir Bar, Michael Rabbat, Jakob Verbeek, Luke Zettlemoyer, Koustuv Sinha, Yann LeCun, Saining Xie

机构 * FAIR, Meta(FAIR、Meta) New York University(纽约大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(title);foundation model(abstract)

AI总结 本文通过多模态预训练探索,揭示了视觉与语言数据的互补性及统一预训练对世界建模的促进作用,并提出MoE架构解决多模态扩展的不对称性问题。

Comments Project website at https://beyond-llms.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05684 2026-03-04 cs.AI cs.CV cs.RO 85%

D2E: Scaling Vision-Action Pretraining on Desktop Data for Transfer to Embodied AI

D2E:在桌面数据上扩展视觉-动作预训练以迁移到具身AI

Suhwan Choi, Jaeyoon Jung, Haebin Seong, Minchan Kim, Minyeong Kim, Yongjun Cho, Yoonshik Kim, Yubeen Park, Youngjae Yu, Yunsung Lee

机构 * Stanford University(斯坦福大学) Seoul National University(首尔国立大学)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 D2E通过桌面数据预训练,实现了具身AI任务的有效迁移,其框架包含三个组件,展示了在物理操作和导航任务中的高性能表现。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02840 2026-03-04 cs.LG stat.ML 83%

Adapting Time Series Foundation Models through Data Mixtures

通过数据混合适应时间序列基础模型

Thomas L. Lee, Edoardo M. Ponti, Amos Storkey

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 MixFT通过数据混合重新划分数据,以更好地适应不同子领域,提升时间序列基础模型的零样本预测性能。

Comments Preprint, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02711 2026-03-04 cs.AI 83%

A Natural Language Agentic Approach to Study Affective Polarization

一种自然语言代理方法研究情感极化

Stephanie Anneris Malvicini, Ewelina Gajewska, Arda Derbent, Katarzyna Budzynska, Jarosław A. Chudziak, Maria Vanina Martinez

机构 * Warsaw University of Technology (WUT)(华沙技术大学)

专题命中 预训练与数据 :language agent(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于自然语言代理的多代理模型,用于研究社交媒体中的情感极化现象,通过虚拟社区模拟和实验分析,提供新的研究视角和方法。

Comments Accepted at ICAART 2026 (18th International Conference on Agents and Artificial Intelligence). The final published version is available in the conference proceedings (SCITEPRESS)

Journal ref In Proceedings of the 18th International Conference on Agents and Artificial Intelligence (ICAART 2026), Vol. 1, pp. 339-346. SCITEPRESS, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23652 2026-03-04 cs.CV cs.AI 83%

3D Modality-Aware Pre-training for Vision-Language Model in MRI Multi-organ Abnormality Detection

面向MRI多器官异常检测的3D模态感知预训练

Haowen Zhu, Ning Yin, Xiaogen Zhou

机构 * School of Electronic, Electrical Engineering and Physics, Fujian University of Technology(福建工程学院电子电气工程学院) School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院) Department of Medical Imaging, Suzhou Traditional Chinese Medicine Hospital, China(苏州中医医院影像科)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出MedMAP框架,通过3D MRI的模态感知预训练提升多器官异常检测性能,实验表明其优于现有视觉-语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14744 2026-03-04 cs.CL 81%

Rethinking the Role of LLMs in Time Series Forecasting

重新思考LLMs在时间序列预测中的作用

Xin Qiu, Junlong Tong, Yirong Sun, Yunpu Ma, Wei Zhang, Xiaoyu Shen

机构 * Ningbo Key Laboratory of Spatial Intelligence(空间智能 Ningbo 关键实验室) Digital Derivative, Institute of Digital Twin, Eastern Institute of Technology, Ningbo(数字衍生,数字孪生研究所,东部技术研究所,Ningbo) Zhejiang University(浙江大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文研究了LLMs在时间序列预测中的作用,发现其在跨域泛化和复杂动态建模中表现优异,提供了有效模型设计的指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02333 2026-03-04 cs.CL 79%

Characterizing Memorization in Diffusion Language Models: Generalized Extraction and Sampling Effects

刻画扩散语言模型中的记忆化:通用提取与采样效应

Xiaoyu Luo, Wenrui Yu, Qiongxiu Li, Johannes Bjerva

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 本文研究了扩散语言模型的记忆化现象,提出通用概率提取框架并验证其理论,显示DLMs在记忆化信息泄露方面优于自回归模型。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02522 2026-03-04 cs.CV 78%

NeighborMAE: Exploiting Spatial Dependencies between Neighboring Earth Observation Images in Masked Autoencoders Pretraining

NeighborMAE: 利用邻近遥感图像间的空间依赖性在掩码自编码器预训练中进行建模

Liang Zeng, Valerio Marsocci, Wufan Zhao, Andrea Nascetti, Maarten Vergauwen

机构 * KU Leuven(卢森堡大学) ESA Φ \Phi -lab(欧洲航天局Φ实验室) HKUST(GZ)(香港科技大学(珠海)) KTH(皇家理工学院)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 NeighborMAE通过联合重建邻近遥感图像,利用空间依赖性提升掩码自编码器在遥感图像预训练中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14948 2026-03-04 cs.SE 75%

Learning to Solve and Verify: A Self-Play Framework for Code and Test Generation

学习解决与验证:一种用于代码和测试生成的自博弈框架

Zi Lin, Sheng Shen, Ilia Kulikov, Jingbo Shang, Jason Weston, Yixin Nie

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出Sol-Ver框架,通过自博弈方式提升代码和测试生成能力,无需人工标注或大模型,实现代码生成和测试生成的性能提升。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03241 2026-03-04 cs.CV cs.AI 70%

UniG2U-Bench: Do Unified Models Advance Multimodal Understanding?

UniG2U-Bench: 统一模型是否能提升多模态理解?

Zimo Wen, Boxiu Li, Wanbo Zhang, Junxiang Lei, Xiaoyu Chen, Yijia Fan, Qi Zhang, Yujiang Wang, Lili Qiu, Bo Li, Ziwei Liu, Caihua Shan, Yifan Yang, Yifei Shen

机构 * Microsoft Research Asia(微软亚洲研究院) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) University of Oxford(牛津大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 UniG2U-Bench通过系统评估生成到理解的任务,揭示统一模型在多模态理解中的局限性和改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02470 2026-03-04 cs.IT cs.LG cs.MM eess.IV math.IT 70%

Video TokenCom: Textual Intent-Guided Multi-Rate Video Token Communications with UEP-Based Adaptive Source-Channel Coding

视频令牌通信:基于UEP的自适应源信道编码的文本意图引导多速率视频令牌通信

Jingxuan Men, Mahdi Boloursaz Mashhadi, Ning Wang, Yi Ma, Mike Nilsson, Rahim Tafazolli

机构 * GIC & 6GIC, Institute for Communication Systems (ICS), University of Surrey(5GIC与6GIC,通信系统研究所(ICS),塞夫尔大学) Smart Internet Lab, University of Bristol(智能互联网实验室,布里斯托尔大学) British Telecom Research Lab, BT Group plc(英国电信研究实验室,BT集团)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于UEP的自适应源信道编码的视频令牌通信框架,通过文本意图引导的多速率视频通信提升语义保真度和传输效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02805 2026-03-04 cs.CV 50%

ScribeTokens: Fixed-Vocabulary Tokenization of Digital Ink

ScribeTokens: 数字墨迹的固定词汇分词

Douglass Wang

机构 * Independent Researcher(独立研究者)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 ScribeTokens通过固定词汇表的分词方法,有效提升了数字墨迹的生成和识别性能,尤其在无需预训练的情况下超越向量表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02590 2026-03-04 cs.CR 50%

Extending the Formalism and Theoretical Foundations of Cryptography to AI

扩展密码学形式化和理论基础以适应人工智能

Federico Villa, F. Betül Durak, Tadayoshi Kohno, Tapdig Maharramli, Franziska Roesner

专题命中 预训练与数据 :language model(abstract)

AI总结 本文提出了一种基于形式化方法的代理访问控制框架,通过统一保密性、完整性和可用性,解决了现有授权机制缺乏共享基础的问题,并证明了模块化分解在代理系统安全性中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏