arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-08 至 2026-04-08 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 18 篇

2604.05875 2026-04-08 cs.AI 93%

Joint Knowledge Base Completion and Question Answering by Combining Large Language Models and Small Language Models

通过结合大语言模型和小语言模型实现知识库补全与问答的联合处理

Yinan Liu, Dongying Lin, Sigang Luo, Xiaochun Yang, Bin Wang

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院,沈阳,中国) National Frontiers Science Center for Industrial Intelligence and Systems optimization, Northeastern University, Shenyang, China(东北大学工业智能与系统优化国家级前沿科学中心,沈阳,中国)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);small language model(title,abstract);LLM(abstract)

AI总结 本文提出JCQL框架,结合大语言模型与小语言模型,通过迭代增强知识库补全与问答任务,提升两者性能。

Comments 20 pages, 11 figures

Journal ref ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02320 2026-04-08 cs.CV cs.GR 87%

Large-scale Codec Avatars: The Unreasonable Effectiveness of Large-scale Avatar Pretraining

大规模编码者人像:大规模人像预训练的不理性有效性

Junxuan Li, Rawal Khirodkar, Chengan He, Zhongshi Jiang, Giljoo Nam, Lingchen Yang, Jihyun Lee, Egor Zakharov, Zhaoen Su, Rinat Abdrashitov, Yuan Dong, Julieta Martinez, Kai Li, Qingyang Tan, Takaaki Shiratori, Matthew Hu, Peihong Guo, Xuhua Huang, Ariyan Zarei, Marco Pesavento, Yichen Xu, He Wen, Teng Deng, Wyatt Borsos, Anjali Thakrar, Jean-Charles Bazin, Carsten Stoll, Ginés Hidalgo, James Booth, Lucy Wang, Xiaowen Ma, Yu Rong, Sairanjith Thalanki, Chen Cao, Christian Häne, Abhishek Kar, Sofien Bouaziz, Jason Saragih, Yaser Sheikh, Shunsuke Saito

机构 * Codec Avatars Lab, Meta(Meta编解码虚拟化身实验室)

专题命中 预训练与数据 :pretraining(title);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出大规模编码者人像模型,通过预训练和后训练相结合的方法,在大规模数据上实现高保真的人像生成,支持多样化的身份和精细表情控制,同时具备泛化能力和鲁棒性。

Comments Accepted in CVPR2026. Website: https://junxuan-li.github.io/lca

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05766 2026-04-08 cs.IR 87%

The LLM Effect on IR Benchmarks: A Meta-Analysis of Effectiveness, Baselines, and Contamination

大型语言模型对信息检索基准的影响:有效性、基线和污染的元分析

Moritz Staudinger, Wojciech Kusa, Allan Hanbury

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文通过分析143篇论文,探讨了LLM对TREC Robust04和DL20基准的有效性影响,发现LLM系统在DL20上提升nDCG@10达8.8%,但存在数据污染问题,影响效果判断。

Comments Accepted at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19894 2026-04-08 cs.SE cs.AI 85%

TransAgent: Enhancing LLM-Based Code Translation via Fine-Grained Execution Alignment

TransAgent:通过细粒度执行对齐增强基于LLM的代码翻译

Zhiqiang Yuan, Weitong Chen, Hanlin Wang, Xin Peng, Zhenpeng Chen, Yiling Lou

机构 * Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TransAgent通过细粒度执行对齐本地化错误代码块,提升LLM代码翻译的准确性与修复性能,优于现有方法33.3%和56.7%。

Comments Accepted by FSE'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05942 2026-04-08 cs.CL 81%

BOSCH: Black-Box Binary Optimization for Short-Context Attention-Head Selection in LLMs

BOSCH: 用于LLMs中短上下文注意力头选择的黑盒二进制优化

Abbas Ghaddar, Ivan Kobyzev, Boxing Chen, Yufei Cui

机构 * Huawei Noah’s Ark Lab, Montreal Research Center, Canada(华为诺亚方舟实验室蒙特利尔研究中心)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 BOSCH通过黑盒二进制优化方法,针对LLMs中的短上下文注意力头选择问题,提出了一种无需训练的解决方案,通过大规模邻域搜索分解为三个子问题,优于现有方法。

Comments ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04999 2026-04-08 cs.LG cs.AI 81%

PRIME: Prototype-Driven Multimodal Pretraining for Cancer Prognosis with Missing Modalities

PRIME:面向癌症预后分析的原型驱动多模态预训练方法,适用于缺失模态

Kai Yu, Shuang Zhou, Yiran Song, Zaifu Zhan, Jie Peng, Kaixiong Zhou, Tianlong Chen, Feng Xie, Meng Wang, Huazhu Fu, Mingquan Lin, Rui Zhang

机构 * University of Minnesota(明尼苏达大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) North Carolina State University(北卡罗来纳州立大学) National University of Singapore(新加坡国立大学) Institute of High Performance Computing, Agency for Science, Technology and Research(高性能计算研究所,新加坡科技研究局)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 PRIME通过原型记忆银行实现缺失模态下的多模态自监督预训练,提升在碎片化临床数据中的预测性能,实现结构对齐和鲁棒性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11013 2026-04-08 cs.CL 79%

PIAST: Rapid Prompting with In-context Augmentation for Scarce Training data

PIAST:基于上下文增强的快速提示生成以应对稀少训练数据

Pawel Batorski, Paul Swoboda

机构 * Heinrich Heine Universität Düsseldorf(海因里希·海涅大学杜塞尔多夫)

专题命中 预训练与数据 :prompting(title,abstract);分类 cs.CL

AI总结 PIAST通过生成少量示例快速构建提示,利用蒙特卡洛沙普利估计优化示例效用,实现在有限计算资源下提升文本简化、GSM8K和分类任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04638 2026-04-08 cs.AI cs.CL cs.IR 79%

Advancing AI Research Assistants with Expert-Involved Learning

通过专家参与学习推进AI研究助手

Tianyu Liu, Simeng Han, Hanchen Wang, Xiao Luo, Pan Lu, Biqing Zhu, Yuge Wang, Keyi Li, Jiapeng Chen, Rihao Qu, Yufeng Liu, Xinyue Cui, Aviv Yaish, Yuhang Chen, Minsheng Hao, Chuhan Li, Kexing Li, Yinsheng Lu, Xinyu Wei, Qinzhe Xing, Antonia Panescu, Mengbo Wang, Vibha Annaswamy, Alicia Sanchez, Jack Cloherty, Arman Cohan, Hua Xu, Mark Gerstein, James Zou, Hongyu Zhao

机构 * Yale University(耶鲁大学) Broad Institute of MIT and Harvard(麻省理工学院-哈佛大学博德研究所) Google DeepMind(谷歌DeepMind) Stanford University(斯坦福大学) Genentech(基因泰克) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Cornell University(康奈尔大学) Harvard University(哈佛大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ARIEL框架,通过专家验证任务评估大语言模型和多模态模型在生物医学领域的表现,发现提示工程和轻量级微调能提升文本覆盖,计算扩展策略增强视觉问答能力,构建了集成文本和视觉线索的AI助手,提出可检验的机理假设。

Comments 43 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06163 2026-04-08 cs.IR 78%

Data, Not Model: Explaining Bias toward LLM Texts in Neural Retrievers

数据,而非模型:解释神经检索器对LLM文本的偏见

Wei Huang, Keping Bi, Yinqiong Cai, Wei Chen, Jiafeng Guo, Xueqi Cheng

专题命中 预训练与数据 :LLM(title,abstract)

AI总结 研究指出神经检索器对LLM文本的偏见源于训练数据中的监督偏差,而非模型本身,通过减少数据偏差和调整向量投影降低偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17396 2026-04-08 cs.CV 78%

Gesture-Aware Pretraining and Token Fusion for 3D Hand Pose Estimation

手势感知预训练与标记融合用于3D手姿态估计

Rui Hong, Jana Kosecka

机构 * George Mason University(乔治梅森大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出基于手势语义的预训练方法,通过InterHand2.6M数据集的粗细标签学习信息嵌入空间,并结合Transformer进行关节回归,提升单手姿态估计精度。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05215 2026-04-08 cs.CV q-bio.NC 78%

Hierarchical Mesh Transformers with Topology-Guided Pretraining for Morphometric Analysis of Brain Structures

具有拓扑引导预训练的层次网格变换器用于脑结构形态学分析

Yujian Xiong, Mohammad Farazi, Yanxi Chen, Wenhui Zhu, Xuanzhao Dong, Natasha Lepore, Yi Su, Raza Mushtaq, Stephen Foldes, Andrew Yang, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学) Banner Health(班纳健康) Barrow Neurological Institute(巴罗神经学研究所)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出一种层次变压器框架,用于异构网格分析,通过自监督预训练实现跨模态和多尺度的高效注意力机制,用于脑结构形态学分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19940 2026-04-08 cs.LO cs.AI cs.PL 77%

Cobblestone: A Divide-and-Conquer Approach for Automating Formal Verification

Cobblestone:一种用于自动化形式验证的分而治之方法

Saketh Ram Kasibatla, Arpan Agarwal, Yuriy Brun, Sorin Lerner, Talia Ringer, Emily First

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Massachusetts(马萨诸塞大学) Cornell University(康奈尔大学) Rutgers University(罗格斯大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Cobblestone通过大语言模型生成证明并分解问题,有效提升形式验证自动化水平,证明更多定理且成本低。

Comments 11 pages, 13 figures, Appearing at ICSE '26, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08249 2026-04-08 cs.LG cs.AI 73%

Retrieval Augmented Time Series Forecasting

检索增强的时间序列预测

Kutay Tire, Ege Onur Taga, Muhammed Emrullah Ildiz, Samet Oymak

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 预训练与数据 :LLM(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出检索增强预测框架RAF,用于提升时间序列预测的准确性,尤其在大规模模型中效果更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06138 2026-04-08 cs.SD cs.AI 57%

Generating Synthetic Doctor-Patient Conversations for Long-form Audio Summarization

生成用于长文本音频摘要的合成医生-患者对话

Yanis Labrak, David Grünert, Séverin Baroudi, Jiyun Chun, Pawel Cyrta, Sergio Burdisso, Ahmed Hassoon, David Liu, Adam Rothschild, Reed Van Deusen, Petr Motlicek, Andrew Perrault, Ricard Marxer, Thomas Schaaf

机构 * Idiap Research Institute(Idiap 研究所) University of Zurich(苏黎世大学) The Ohio State University(俄亥俄州立大学) Université de Toulon, Aix Marseille Univ, LIS, CNRS(土伦大学,艾克斯-马赛大学,计算机与系统实验室,法国国家科学研究中心) Stenograf Johns Hopkins University Bloomberg School of Public Health(约翰·霍普金斯大学布隆伯格公共卫生学院) Colorado School of Mines(科罗拉多矿业学院) Allegheny Health Network(阿勒格尼健康网络) University of Pittsburgh Medical Center(匹兹堡大学医学中心) ILLS, CNRS(ILLS,法国国家科学研究中心) Solventum Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :LLM(abstract);分类 cs.AI

AI总结 本文提出生成合成医生-患者对话数据的方法,用于长文本音频摘要任务,通过多阶段流程生成包含音频和参考笔记的数据集,评估显示级联方法优于端到端模型。

Comments Submitted for review at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05904 2026-04-08 eess.SY cs.LG cs.SY 57%

Transfer Learning for Neural Parameter Estimation applied to Building RC Models

用于建筑RC模型的神经参数估计的迁移学习

Fabian Raisch, Timo Germann, J. Nathan Kutz, Christoph Goebel, Benjamin Tischler

机构 * Technical University of Applied Sciences Rosenheim(罗森海姆应用技术大学) Technical University of Munich(慕尼黑工业大学) Autodesk Research, London UK(欧特克研究(英国伦敦))

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出基于预训练-微调范式的迁移学习神经参数估计框架,用于建筑RC热模型,通过对比遗传算法和从零开始的神经基线,展示了在少量训练数据下显著提升的参数估计性能。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05899 2026-04-08 cs.CL 57%

FRENCH-YMCA: A FRENCH Corpus meeting the language needs of Youth, froM Children to Adolescents

FRENCH-YMCA:一个满足青少年语言需求的法语语料库,从儿童到青少年

Cherifa Ben Khelil, Jean-Yves Antoine, Anaïs Halftermeyer, Frédéric Rayar, Mathieu Thebaud

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 本文介绍FRENCH-YMCA语料库,旨在为儿童和青少年提供专门的语言资源,通过39,200个文本文件构建,涵盖22471898词,支持开放获取,用于训练理解青少年语言的模型,提升数字交互质量。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.01984 2026-04-08 cs.CV cs.CL 57%

Image Captioning via Compact Bidirectional Architecture

通过紧凑双向架构实现图像描述

Zijie Song, Yuanen Zhou, Zhenzhen Hu, Daqing Liu, Huixia Ben, Richang Hong, Meng Wang

机构 * School of Big Data and Statistics, Anhui University(安徽大学大数据与统计学院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Intelligent Interconnected Systems Laboratory of Anhui Province (Hefei University of Technology)(安徽省智能互联系统实验室(合肥工业大学)) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息学院) JD Explore Academy, JD.com Inc(京东探索研究院) State Key Laboratory of Digital Intelligent Technology for Unmanned Coal Mining, Anhui University of Science and Technology(安徽理工大学深部煤矿采动响应与灾害防控国家重点实验室)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL

AI总结 本文提出紧凑双向Transformer模型,通过并行解码器隐式和显式利用双向上下文,经消融研究发现其比显式交互机制更重要,结合词级融合进一步提升效果,并扩展至LSTM基座实现新SOTA结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09411 2026-04-08 cs.CV 50%

Towards Robust and Realistic Human Pose Estimation via WiFi Signals

通过WiFi信号实现鲁棒且逼真的人体姿态估计

Yang Chen, Jingcai Guo

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) Department of Land Surveying and Geo-Informatics, The Hong Kong Polytechnic University(香港理工大学土地测量及地理资讯学系)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出DT-Pose框架,通过领域一致表示学习和拓扑约束姿态解码,解决WiFi信号中姿态分布差异和骨骼拓扑失真问题,提升2D/3D人体姿态估计性能。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏