arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-23 至 2026-04-23 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 17 篇

2508.18609 2026-04-23 cs.CL cs.AI cs.LG 92%

Task-Stratified Knowledge Scaling Laws for Post-Training Quantized Large Language Models

任务分层的知识扩展规律用于训练后量化的大语言模型

Chenxi Zhou, Pengfei Cao, Jiang Li, Bohan Yu, Jinyu Ye, Jun Zhao, Kang Liu

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所认知与决策智能复杂系统重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出任务分层的知识扩展规律,通过统一模型大小、位宽和细粒度因素,验证了293种不同的训练后量化配置,揭示了不同知识能力对精度、规模和校准的敏感性。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20168 2026-04-23 cs.CL 90%

Duluth at SemEval-2026 Task 6: DeBERTa with LLM-Augmented Data for Unmasking Political Question Evasions

德鲁特在SemEval-2026任务6:DeBERTa与LLM增强数据用于揭示政治问题回避

Shujauddin Syed, Ted Pedersen

机构 * Department of Computer Science(计算机科学系) University of Minnesota Duluth(明尼苏达大学杜鲁斯)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出德鲁特在SemEval-2026任务6上的方法,使用DeBERTa-V3-base结合焦点损失和布尔话语特征,通过LLM增强数据提升政治问题回避识别的宏F1值达0.76。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15861 2026-04-23 cs.CL cs.AI 89%

CAST: Achieving Stable LLM-based Text Analysis for Data Analytics

CAST:实现稳定的大语言模型文本分析用于数据分析

Jinxiang Xie, Zihao Li, Wei He, Rui Ding, Shi Han, Dongmei Zhang

机构 * Nanjing University(南京大学) Tsinghua University(清华大学) Peking University(北京大学) Microsoft Research(微软研究院)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 CAST通过算法提示和先思考后发言提升大语言模型在表格数据分析中的输出稳定性,实验表明其在多个基准上表现最佳,稳定性提升达16.2%。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19783 2026-04-23 cs.CL 87%

How Much Does Persuasion Strategy Matter? LLM-Annotated Evidence from Charitable Donation Dialogues

说服策略有多重要?来自慈善捐赠对话的LLM注释证据

Tatiana Petrova, Stanislav Sokol, Radu State

机构 * Interdisciplinary Centre for Security, Reliability and Trust (SnT)(安全、可靠性与信任跨学科研究中心)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过分析10600个对话中的说服策略,发现仅 guilt induction 与较低的捐款率相关,而 reciprocity 是最强的正相关因素,表明单纯策略识别不足以解释说服效果。

Comments 8 pages, 2 figures, 5 tables. Interdisciplinary Centre for Security, Reliability and Trust (SnT), University of Luxembourg

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20549 2026-04-23 cs.CL cs.AI 84%

Toward Cross-Lingual Quality Classifiers for Multilingual Pretraining Data Selection

迈向多语言预训练数据选择的跨语言质量分类器

Yassine Turki, Vinko Sabolčec, Bettina Messmer, Martin Jaggi

机构 * Machine Learning Optimization Lab(机器学习优化实验室) Ecole Polytechnique Fédérale de Lausanne(洛桑联邦理工学院)

专题命中 预训练与数据 :pretraining(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了通过跨语言迁移、第三四分位采样和保留率调整策略,提升多语言数据筛选效果,证明大规模多语言池化在稳定性与准确率上优于单语基线,尤其对低资源语言有显著提升。

Comments Accepted at the 3rd Workshop on Navigating and Addressing Data Problems for Foundation Models (DATA-FM @ ICLR 2026). 31 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12036 2026-04-23 cs.CL 84%

Composition-RL: Compose Your Verifiable Prompts for Reinforcement Learning of Large Language Models

Composition-RL:为大型语言模型的强化学习编纂可验证提示

Xin Xu, Clive Bai, Kai Yang, Tianhao Chen, Yangkun Chen, Weijie Liu, Hao Chen, Yang Wang, Saiyong Yang, Can Yang

机构 * The Hong Kong University of Science(香港科学与技术大学) HY, Tencent(HY,腾讯) The University of Hong Kong(香港大学)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL

AI总结 Composition-RL通过自动组合多个问题生成新可验证问题,提升有限提示的利用效率,实验表明其能提升推理能力并支持跨领域强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02132 2026-04-23 cs.CL cs.LG 84%

Model Internal Sleuthing: Finding Lexical Identity and Inflectional Features in Modern Language Models

模型内部侦探:在现代语言模型中寻找词汇身份和屈折特征

Michael Li, Nishant Subramani

机构 * Carnegie Mellon University - Language Technologies Institute(卡内基梅隆大学-语言技术研究所)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究通过分析25个模型的词汇身份和屈折特征,发现屈折特征在模型中线性可解,而词汇身份在早期显著但随深度减弱,揭示了transformer在层间保持屈折特征但牺牲词汇身份以获得紧凑预测表示的机制。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04950 2026-04-23 cs.CV cs.AI 83%

Location-Aware Pretraining for Medical Difference Visual Question Answering

面向位置的预训练方法用于医学差异视觉问答

Denis Musinguzi, Caren Han, Prasenjit Mitra

机构 * Department of Electrical and Computer Engineering, Carnegie Mellon University, Kigali, Rwanda(电气与计算机工程系,卡内基梅隆大学,刚果(金)基利齐) University of Melbourne, Melbourne, Australia(墨尔本大学,墨尔本,澳大利亚)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种面向位置的预训练框架,结合AREF、GCAP和CAREF任务,提升医学差异VQA中细粒度空间视觉表征能力,实现胸部X光图像中临床相关变化的准确识别与推理。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20012 2026-04-23 cs.CV cs.AI cs.CL 81%

EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training

EmbodiedMidtrain: 通过中训练弥合视觉语言模型与视觉语言动作模型之间的差距

Yiyang Du, Zhanqiu Guo, Xin Ye, Liu Ren, Chenyan Xiong

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Bosch Research North America & Bosch Center for Artificial Intelligence (BCAI)(博世北美研究部及博世人工智能中心(BCAI))

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出EmbodiedMidtrain方法,通过中训练弥合视觉语言模型与视觉语言动作模型之间的差距,实验表明中训练能提升不同VLM骨干网络的性能,且在初始化阶段对VLA微调有显著帮助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00414 2026-04-23 cs.AI cs.CL 81%

Cognitive Kernel-Pro: A Framework for Deep Research Agents and Agent Foundation Models Training

认知内核-Pro:深度研究代理及代理基础模型训练的框架

Tianqing Fang, Zhisong Zhang, Xiaoyang Wang, Rui Wang, Can Qin, Yuxuan Wan, Jun-Yu Ma, Ce Zhang, Jiaqi Chen, Xiyun Li, Yonglin Wang, Jingchen Ni, Tianshi Zheng, Chun Chen, Wenhao Yu, Zhenwen Liang, Hongming Zhang, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯人工智能实验室)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Cognitive Kernel-Pro框架,旨在通过开放源代码和免费资源促进高级AI代理的开发与评估,重点研究高质量训练数据的构建及代理测试时的反思与投票策略,实现了在GAIA上的领先性能。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06803 2026-04-23 cs.CL cs.AI cs.CE 79%

Text to model via SysML: Automated generation of dynamical system computational models from unstructured natural language text via enhanced System Modeling Language diagrams

通过SysML生成动态系统模型:从无结构自然语言文本自动生成动态系统计算模型

Matthew Anderson Hendricks, Alice Cicirello

机构 * Department of Engineering, University of Cambridge, Trumpington Street, Cambridge, UK(剑桥大学工程系,特鲁布里奇顿街,剑桥,英国)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用领域和专家知识,通过SysML图自动从相关文档和输入文档生成动态系统计算模型,提升工程动态系统设计和部署效率。

Comments v3 - typos and imprecisions corrected, and added clarifications

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20392 2026-04-23 cs.CV 78%

Self-supervised pretraining for an iterative image size agnostic vision transformer

面向迭代图像尺寸无关视觉变换器的自监督预训练

Nedyalko Prisadnikov, Danda Pani Paudel, Yuqian Fu, Luc Van Gool

机构 * INSAIT, Sofia University "St. Kliment Ohridski", Bulgaria(INSAIT,索菲亚大学"圣克莱门特·奥赫里迪斯",保加利亚)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出基于DINO自蒸馏目标的新型序列到全局自监督学习框架,通过高效积分图像补丁提取方法实现图像尺寸无关的视觉编码器大规模预训练,取得ImageNet-1K和下游分类任务的竞争力表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16879 2026-04-23 cs.CV 67%

Adaptive Forensic Feature Refinement via Intrinsic Importance Perception

通过内在重要性感知实现自适应的 forensic 特征细化

Jiazhen Yang, Junjun Zheng, Kejia Chen, Xiangheng Kong, Jie Lei, Zunlei Feng, Bingde Hu, Yang Gao

机构 * Zhejiang University(浙江大学) Alibaba Inc(阿里巴巴公司) Zhejiang University of Technology(浙江工业大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 本文提出I2P框架,通过自适应识别关键层表示并约束任务驱动的参数更新,提升SID任务的特定性同时保留预训练表示的可迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19328 2026-04-23 cs.LG 57%

Understanding the Staged Dynamics of Transformers in Learning Latent Structure

理解变换器在学习潜在结构中的分阶段动态

Rohan Saha, Farzane Aminmansour, Alona Fyshe

机构 * Department of Computing Science, University of Alberta, Edmonton, Canada(计算科学系,阿尔伯塔大学,爱德蒙顿,加拿大) Department of Psychology, University of Alberta, Edmonton, Canada(心理学系,阿尔伯塔大学,爱德蒙顿,加拿大)

专题命中 预训练与数据 :language model(abstract);分类 cs.LG

AI总结 本文通过Alchemy基准测试,研究了变换器在学习潜在结构中的分阶段动态,发现模型在不同任务中逐步学习不同结构组件,并揭示了层间可塑性窗口对训练过程的影响。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09283 2026-04-23 cs.CV 50%

From Ideal to Real: Stable Video Object Removal under Imperfect Conditions

从理想到现实:在不完美条件下实现稳定的视频对象移除

Jiagao Hu, Yuxuan Chen, Fuhao Li, Zepeng Wang, Fei Wang, Daiguo Zhou, Jian Luan

机构 * MiLM Plus(小米公司)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出SVOR框架,通过MUSE、DA-Seg和双阶段训练解决视频对象移除中的阴影、运动突变和掩码缺陷问题,实现更稳定的移除效果。

Comments Project Page: https://xiaomi-research.github.io/svor/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10171 2026-04-23 cs.CV cs.ET 50%

SynSpill: Improved Industrial Spill Detection With Synthetic Data

SynSpill:基于合成数据的改进工业泄漏检测

Aaditya Baranwal, Abdul Mueez, Jason Voelker, Guneet Bhatia, Shruti Vyas

机构 * University of Central Florida(佛罗里达中央大学) Siemens Energy(西门子能源)

专题命中 预训练与数据 :language model(abstract)

AI总结 针对工业泄漏检测中数据稀缺问题,提出基于高质量合成数据生成的框架,通过参数高效微调提升VLMs和检测器性能,实现安全关键领域的有效应用。

Comments Accepted at ICCV (VISION'25 Workshop) 2025

Journal ref 2025 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), pp. 1425-1434

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.14649 2026-04-23 cs.CV 50%

DetailCLIP: Injecting Image Details into CLIP's Feature Space

DetailCLIP: 将图像细节注入CLIP的特征空间

Zilun Zhang, Cuifeng Shen, Yuan Shen, Xinyu Zhou, Huixin Xiong, Tiancheng Zhao, Jianwei Yin

机构 * Zhejiang University(浙江大学) Peking University(北京大学) Megvii(科大讯飞) Om AI Research(Om人工智能研究院) Binjiang Research Institute of Zhejiang University(浙江大学滨江研究院)

专题命中 预训练与数据 :language model(abstract)

AI总结 本文提出DetailCLIP框架,通过生成高分辨率图像的单一特征表示,保留多尺度细节并共享CLIP的语义空间,提升遥感文本-图像检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏