arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-11 至 2026-03-11 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 17 篇

2603.09416 2026-03-11 cs.CL cs.AI 90%

Investigating Gender Stereotypes in Large Language Models via Social Determinants of Health

通过社会健康决定因素探讨大型语言模型中的性别刻板印象

Trung Hieu Ngo, Adrien Bazoge, Solen Quiniou, Pierre-Antoine Gourraud, Emmanuel Morin

机构 * Nantes Université, École Centrale Nantes, CNRS, LS2N, UMR 6004(南特大学,中央理工学院,国家科学研究中心,LS2N,UMR 6004) Nantes Université, CHU Nantes, Clinique des données, INSERM, CIC 1413(南特大学,南特大学医院,数据诊所,国家健康与医学研究院,CIC 1413)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过分析法语患者记录中的性别与社会健康决定因素的关系,揭示了LLM在性别决策中依赖嵌入刻板印象的现象,并提出评估SDoH因素相互作用以补充现有偏见评估方法。

Comments Accepted as Findings at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08220 2026-03-11 cs.CL 85%

Pretraining with Token-Level Adaptive Latent Chain-of-Thought

基于令牌级适应性潜在链式思维的预训练

Boyi Zeng, Yiqin Hao, He Li, Shixiang Song, Feichen Song, Zitong Wang, Siyuan Huang, Yi Xu, ZiWei He, Xinbing Wang, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai Al Laboratory(上海Al实验室) Sun Yat-sen University(中山大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出了一种基于令牌级适应性潜在链式思维的预训练方法,通过内部化潜在链式思维来提高模型性能,减少计算成本,并在语言建模和下游任务中取得显著改进。

Comments 15pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11648 2026-03-11 cs.LG cs.AI 84%

Lightweight Time Series Data Valuation on Time Series Foundation Models via In-Context Finetuning

基于上下文微调的轻量时间序列数据估值方法

Shunyu Wu, Tianyue Li, Yixuan Leng, Jingyi Suo, Jian Lou, Dan Li, See-Kiong Ng

机构 * Sun Yat-sen University State Key Laboratory of Internet Architecture(中山大学互联网架构国家重点实验室) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LTSV方法,通过上下文微调实现轻量时间序列数据估值,有效解决传统方法的计算瓶颈和时间依赖性问题。

Comments Accepted as a full paper at DASFAA 2026 (The 31st International Conference on Database Systems for Advanced Applications)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05698 2026-03-11 cs.CL 81%

Towards Robust Retrieval-Augmented Generation Based on Knowledge Graph: A Comparative Analysis

基于知识图谱的鲁棒检索增强生成:一种比较分析

Hazem Amamou, Stéphane Gagnon, Alan Davoust, Anderson R. Avila

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文基于知识图谱改进RAG系统,通过比较分析评估其在噪声、信息整合、负样本拒绝和反事实鲁棒性方面的性能提升。

Comments Accepted at IEEE SMC 2025 (International Conference on Systems, Man, and Cybernetics)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03930 2026-03-11 cs.CV 78%

N-gram Injection into Transformers for Dynamic Language Model Adaptation in Handwritten Text Recognition

基于N-gram注入的Transformer在手写文本识别中的动态语言模型适应

Florent Meyer, Laurent Guichard, Yann Soullard, Denis Coquenet, Guillaume Gravier, Bertrand Coüasnon

机构 * ANTAI, Rennes, France(ANTAI研究院,法国里昂) Univ Rennes, CNRS, IRISA - UMR 6074, Rennes, France(里昂大学,法国国家科学研究中心,IRISA-UMR 6074,法国里昂)

专题命中 预训练与数据 :language model(title,abstract)

AI总结 本文提出N-gram注入方法,用于在手写文本识别中动态调整Transformer的语言模型,以应对目标语料分布偏移问题,提升识别精度。

Comments Fix order of authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23553 2026-03-11 eess.AS cs.SD 78%

Human-CLAP: Human-perception-based contrastive language-audio pretraining

基于人类感知的对比语言-音频预训练:Human-CLAP

Taisei Takano, Yuki Okamoto, Yusuke Kanamori, Yuki Saito, Ryotaro Nagase, Hiroshi Saruwatari

机构 * The University of Tokyo, Japan(东京大学) Ritsumeikan University, Japan(立命馆大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 Human-CLAP通过引入人类主观评价分数提升CLAPScore与人类评价的相关性

Comments Submitted to APSIPA ASC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09101 2026-03-11 cs.CV 78%

MedKCO: Medical Vision-Language Pretraining via Knowledge-Driven Cognitive Orchestration

MedKCO:通过知识驱动的认知协调进行医学视觉-语言预训练

Chenran Zhang, Ruiqi Wu, Tao Zhou, Yi Zhou

机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Ministry of Education, China(教育部新一代人工智能技术及其交叉应用重点实验室) School of Computer Science and Engineering, Nanjing University of Science and Technology, China(南京理工大学计算机科学与工程学院)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 MedKCO通过知识驱动的认知协调优化医学视觉-语言预训练,提升模型在分布偏移下的泛化能力。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15304 2026-03-11 cs.CL cs.AI cs.LG 75%

ConLID: Supervised Contrastive Learning for Low-Resource Language Identification

ConLID:面向低资源语言识别的监督对比学习

Negar Foroutan, Jakhongir Saydaliev, Ye Eun Kim, Antoine Bosselut

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ConLID通过监督对比学习方法,提升低资源语言在领域外数据上的识别性能,同时保持高资源语言的识别效果。

Comments EACL 2026 - Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09627 2026-03-11 eess.AS 71%

Speech-Omni-Lite: Portable Speech Interfaces for Vision-Language Models

Speech-Omni-Lite: 用于视觉-语言模型的便携式语音接口

Dehua Tao, Xuan Luo, Daxin Tan, Kai Chen, Lanqing Hong, Jing Li, Ruifeng Xu, Xiao Chen

专题命中 预训练与数据 :language model(title)

AI总结 Speech-Omni-Lite通过轻量模块扩展视觉-语言模型,实现低成本语音理解和生成,同时保持原有性能,实验显示其在少量语音数据下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09185 2026-03-11 cs.CL 70%

DEO: Training-Free Direct Embedding Optimization for Negation-Aware Retrieval

DEO:无训练直接嵌入优化用于否定感知检索

Taegyeong Lee, Jiwon Park, Seunghyun Hwang, JooYoung Jang

机构 * Department of Industrial Engineering, Hanyang University(工业工程系,翰阳大学) Department of Applied Data Science, Sungkyunkwan University(应用数据科学系,成均馆大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DEO通过无训练的直接嵌入优化方法,提升了否定和排除感知检索的性能,尤其在多模态检索中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18722 2026-03-11 cs.AI 70%

VistaWise: Building Cost-Effective Agent with Cross-Modal Knowledge Graph for Minecraft

VistaWise: 构建低成本代理的跨模态知识图谱用于Minecraft

Honghao Fu, Junlong Ren, Qi Chai, Deheng Ye, Yujun Cai, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Queensland(昆士兰大学) Tencent(腾讯)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 VistaWise通过整合跨模态知识图谱和专用模型,实现低成本、高效率的Minecraft代理构建。

Comments Accepted by EMNLP 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08893 2026-03-11 cs.HC 67%

A Decentralized Frontier AI Architecture Based on Personal Instances, Synthetic Data, and Collective Context Synchronization

基于个人实例、合成数据和集体上下文同步的去中心化前沿AI架构

Jacek Małecki, Alexander Mathiesen-Ohman, Katarzyna Tworek

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本文提出基于个人实例、合成数据和集体上下文同步的去中心化AI架构,旨在实现隐私保护的集体学习和可持续的AI发展。

Comments 38 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09517 2026-03-11 cs.CL cs.LG 62%

You Didn't Have to Say It like That: Subliminal Learning from Faithful Paraphrases

你无需那样说:从忠实的同义词中学习的潜意识学习

Isaia Gisler, Zhonghao He, Tianyi Qiu

机构 * ETH Zürich(苏黎世联邦理工学院) University of Cambridge(剑桥大学) Peking University(北京大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究通过自然语言同义词的潜意识学习,发现即使内容与教师偏好矛盾,学生模型仍能继承偏好,揭示了训练数据中潜在影响的隐蔽性。

Comments Accepted for Spotlight presentation at EACL 2026 SRW. 5 pages, 2 figures, plus appendix. Equal supervision by Zhonghao He and Tianyi Qiu

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09616 2026-03-11 cs.CL 57%

Surgical Repair of Collapsed Attention Heads in ALiBi Transformers

在ALiBi变换器中修复塌陷的注意力头

Palmer Schallon

机构 * Independent researcher(独立研究者)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 在ALiBi变换器中,通过手术重新初始化修复塌陷的注意力头,恢复98.7%的操作能力,并发现预训练配置可能为次优局部极小值。

Comments 15 pages, 7 figures, 2 supplementary figures. Code: https://github.com/Palmerschallon/bloom-head-surgery Checkpoints: https://huggingface.co/TheNexus42/bloom-1b7-head-surgery

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09260 2026-03-11 cs.IR cs.CL 57%

ThinkQE: Query Expansion via an Evolving Thinking Process

ThinkQE: 通过演进的思考过程实现查询扩展

Yibin Lei, Tao Shen, Andrew Yates

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL

AI总结 ThinkQE通过演进的思考过程和语料库交互策略,在测试时实现更全面的查询扩展,优于传统密集检索器和重排序器。

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09566 2026-03-11 cs.CV 50%

GeoAlignCLIP: Enhancing Fine-Grained Vision-Language Alignment in Remote Sensing via Multi-Granular Consistency Learning

GeoAlignCLIP: 通过多粒度一致性学习增强遥感中的细粒度视觉-语言对齐

Xiao Yang, Ronghao Fu, Zhuoran Duan, Zhiwen Lin, Xueyan Liu, Bo Yang

机构 * College of Computer Science and Technology, Jilin University, Changchun 130012, China(吉林大学计算机科学与技术学院,长春130012,中国) Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education Jilin University(教育部符号计算与知识工程重点实验室,吉林大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 GeoAlignCLIP通过多粒度一致性学习提升遥感中细粒度视觉-语言对齐,构建RSFG-100k数据集并优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24417 2026-03-11 cs.CV 50%

EasyText: Controllable Diffusion Transformer for Multilingual Text Rendering

EasyText: 用于多语言文本渲染的可控扩散变换器

Runnan Lu, Yuxuan Zhang, Jiaming Liu, Haofan Wang, Yiren Song

专题命中 预训练与数据 :pretraining(abstract)

AI总结 EasyText提出了一种基于DiT的可控扩散变换器,用于多语言文本渲染,通过字符位置编码和插值技术实现精确生成,并利用大规模数据集提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏