arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-06 至 2026-04-06 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 11 篇

2507.19090 2026-04-06 cs.CL 89%

Debating Truth: Debate-driven Claim Verification with Multiple Large Language Model Agents

辩论真相:基于多个大语言模型代理的辩论驱动声明验证

Haorui He, Yupeng Li, Dacheng Wen, Yang Chen, Reynold Cheng, Donglong Chen, Francis C. M. Lau

机构 * Department of Interactive Media, Hong Kong Baptist University(香港浸会大学互动媒体系) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院) Shenzhen Institute of Advanced Technology(深圳先进技术研究院)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);post-training(abstract)

AI总结 本文提出DebateCV框架,通过多代理辩论和调解提升复杂声明验证的准确性与说服力。

Comments Accepted by the ACM Web Conference 2026 (WWW 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23032 2026-04-06 cs.CV cs.RO 88%

Generative Event Pretraining with Foundation Model Alignment

基于基础模型对齐的生成事件预训练

Jianwen Cao, Jiaxu Xing, Nico Messikommer, Davide Scaramuzza

机构 * Robotics and Perception Group, University of Zurich(苏黎世大学机器人感知组)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract)

AI总结 本文提出GEP框架,通过将互联网级图像数据集中的语义知识迁移到事件数据,并学习事件特有的时间动态,提升事件视觉基础模型在跨任务迁移学习中的性能。

Journal ref CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01833 2026-04-06 cs.CV cs.CL cs.LG 86%

Language-Pretraining-Induced Bias: A Strong Foundation for General Vision Tasks

语言预训练引入的偏差:一种强大的基础视觉任务通用性基础

Yaxin Luo, Zhiqiang Shen

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 预训练与数据 :pretraining(title);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出随机标签桥梁训练方法,通过模态适应学习有效对齐大语言模型参数与视觉任务,揭示部分桥梁训练在视觉任务中的优势。

Comments Main manuscript: 13 pages, 9 figures. Appendix: 8 pages, 5 figures. Accepted in Transactions on Machine Learning Research (TMLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22367 2026-04-06 cs.CL cs.AI cs.CY 86%

What Is The Political Content in LLMs' Pre- and Post-Training Data?

大语言模型预训练和后训练数据中的政治内容是什么?

Tanise Ceron, Dmitry Nikolaev, Dominik Stammbach, Debora Nozza

机构 * Bocconi University(博科尼大学) University of Manchester(曼彻斯特大学) Princeton University(普林斯顿大学)

专题命中 预训练与数据 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了大语言模型训练数据中的政治倾向,发现预训练数据偏向左翼内容,且政治立场与模型行为相关,强调数据组成对模型行为的关键作用。

Comments 10 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02719 2026-04-06 cs.CV cs.AI cs.LG 84%

MOMO: Mars Orbital Model Foundation Model for Mars Orbital Applications

MOMO:用于火星轨道应用的火星轨道基础模型

Mirali Purohit, Bimal Gajera, Irish Mehta, Bhanu Tokas, Jacob Adler, Steven Lu, Scott Dickenshied, Serina Diniega, Brian Bue, Umaa Rebbapragada, Hannah Kerner

机构 * Arizona State University(亚利桑那州立大学) Jet Propulsion Laboratory, California Institute of Technology(加州理工学院喷气推进实验室)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 MOMO是首个多传感器基础模型,通过模型融合整合来自HiRISE、CTX和THEMIS三种关键火星传感器的数据,提升多分辨率数据的稳定性和泛化能力。

Comments Accepted at CVPR 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03180 2026-04-06 cs.LG cs.CL cs.IR cs.SI 81%

PRISM: LLM-Guided Semantic Clustering for High-Precision Topics

PRISM:基于LLM的语义聚类用于高精度主题

Connor Douglas, Utkucan Balci, Joseph Aylett-Bullock

机构 * New York University(纽约大学) Binghamton University(宾汉姆顿大学)

专题命中 预训练与数据 :LLM(title,abstract);分类 cs.CL、cs.LG

AI总结 PRISM结合LLM的丰富表示与低成本可解释的潜在语义聚类方法,通过稀疏LLM标签微调句子编码模型,提升主题分离度,适用于多语料库的高精度主题发现。

Comments To appear in Proceedings of the ACM Web Conference 2026 (WWW 26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03231 2026-04-06 cs.CV 75%

CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning

CoME-VL:扩展互补多编码视觉语言学习

Ankan Deria, Komal Kumar, Xilin He, Imran Razzak, Hisham Cholakkal, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 预训练与数据 :LLM(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出CoME-VL框架,通过融合对比学习和自监督编码器提升视觉语言模型性能,实验显示在多个基准上优于单编码基线。

Comments 16 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02881 2026-04-06 cs.CL cs.AI 62%

One Model to Translate Them All? A Journey to Mount Doom for Multilingual Model Merging

一个模型来翻译它们全部?多语言模型融合的探索之旅

Baban Gain, Asif Ekbal, Trilok Nath Singh

机构 * Indian Institute of Technology Patna(印度理工学院巴特那分校)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了多语言机器翻译中权重空间模型融合的行为,发现融合会降低性能,尤其在目标语言差异时。通过分析内部表示发现语言特定神经元集中在嵌入层和上层Transformer块,而中间层在多语言间共享。细调使语言选择性重新分布,影响生成层的表示差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10510 2026-04-06 cs.LG cs.AI 62%

f-INE: A Hypothesis Testing Framework for Estimating Influence under Training Randomness

f-INE:一种用于在训练随机性下估计影响的假设检验框架

Subhodip Panda, Dhruv Tarsadiya, Shashwat Sourav, Prathosh A. P, Sai Praneeth Karimireddy

机构 * Indian Institute of Science(印度科学研究所) University of Southern California(南加州大学) Washington University(华盛顿大学)

专题命中 预训练与数据 :instruction tuning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出f-influence框架,通过假设检验解决训练随机性导致的影响估计不稳定问题,并设计高效算法f-INE实现单次训练运行内的影响估计,用于数据清理和模型行为归因。

Journal ref The Fourteenth International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02926 2026-04-06 cs.CL 57%

A Multi-head-based architecture for effective morphological tagging in Russian with open dictionary

一种基于多头的架构,用于俄语中有效的形态标注

K. Skibin, M. Pozhidaev, S. Suschenko

机构 * National Research Tomsk State University(国立研究型托木斯克国立大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL

AI总结 本文提出基于多头注意力的新型架构,用于俄语形态标注,通过子词分割和向量聚合支持开放式词典,实验显示在SinTagRus和Taiga数据集上达到98%-99%的准确率,且模型训练效率高。

Comments 8 pages, 1 figure, submitted to AINL-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15263 2026-04-06 cs.CV cs.LG 57%

gen2seg: Generative Models Enable Generalizable Instance Segmentation

gen2seg:生成模型实现可推广的实例分割

Om Khangaonkar, Hamed Pirsiavash

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文通过生成模型预训练合成图像,实现对实例分割的可推广方法,使用实例着色损失在特定物体类型上微调,展现零样本泛化能力,优于现有方法。

Comments ICLR 2026 camera ready. Website: https://reachomk.github.io/gen2seg/

详情

展开后加载摘要…

URL PDF HTML 收藏