arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-31 至 2026-03-31 共收录 405 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 32 篇

2603.26786 2026-03-31 cs.LG cs.AI 92%

A Step Toward Federated Pretraining of Multimodal Large Language Models

迈向多模态大语言模型联邦预训练的一小步

Baochen Xiong, Yifan Xu, Xiaoshan Yang, Yaguang Song, Yaowei Wang, Changsheng Xu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室) King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Pengcheng Laboratory(鹏城实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title);LLM(abstract)

AI总结 本文提出Fed-MA任务,通过冻结视觉编码器和LLM,协同训练跨模态投影器,解决参数干扰和梯度震荡问题,提出Fed-CMP框架在联邦预训练中取得显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05523 2026-03-31 cs.CL 90%

Pretraining Language Models for Diachronic Linguistic Change Discovery

为历时语言变化发现预训练语言模型

Elisabeth Fittschen, Sabrina Li, Tom Lippincott, Leshem Choshen, Craig Messner

机构 * University of Hamburg(汉堡大学) Center for Digital Humanities, Johns Hopkins University(约翰霍普金斯大学数字人文中心) IBM Research, MIT(麻省理工学院IBM研究院)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);LLM(abstract);large language model(abstract)

AI总结 本文提出通过预训练语言模型发现历时语言变化,通过高效预训练技术处理大规模语料,发现预训练模型在训练速度和历史划分尊重方面优于微调基线,展示了在历时语言学中检测词汇变化等现象的能力。

Comments Accepted to Findings of the EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05675 2026-03-31 cs.AI cs.LG 90%

Synergizing Large Language Models and Task-specific Models for Time Series Anomaly Detection

融合大语言模型与任务特定模型用于时间序列异常检测

Feiyi Chen, Leilei Zhang, Guansong Pang, Roger Zimmermann, Shuiguang Deng

机构 * Zhejiang University(浙江大学) Department of Computer Science and Technology, Singapore Management University(新加坡管理大学计算机科学与技术系) Department of Computer Science and Technology, National University of Singapore(新加坡国立大学计算机科学与技术系)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CoLLaTe框架,通过融合大语言模型与任务特定模型,解决异常检测中的表达域不匹配和预测误差累积问题,提升检测性能。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20957 2026-03-31 cs.CL cs.AI cs.CY 90%

Alignment Whack-a-Mole : Finetuning Activates Verbatim Recall of Copyrighted Books in Large Language Models

对齐的打砖块:微调激活大型语言模型对版权书籍的原文回忆

Xinyue Liu, Niloofar Mireshghallah, Jane C. Ginsburg, Tuhin Chakrabarty

机构 * Stony Brook University(石溪大学) Carnegie Mellon University(卡内基梅隆大学) Columbia Law School(哥伦比亚法学院)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);pretraining(abstract)

AI总结 研究显示微调可绕过安全对齐策略,使GPT-4o等模型能回忆85-90%的版权书籍,揭示模型权重存储版权作品的漏洞。

Comments Preprint Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10932 2026-03-31 cs.CV cs.AI 89%

BabyVLM-V2: Toward Developmentally Grounded Pretraining and Benchmarking of Vision Foundation Models

BabyVLM-V2:迈向基于发展基础的视觉基础模型预训练与基准测试

Shengao Wang, Wenqi Wang, Zecheng Wang, Max Whitton, Michael Wakeham, Arjun Chandra, Joey Huang, Pengyue Zhu, Helen Chen, David Li, Jeffrey Li, Shawn Li, Andrew Zagula, Amy Zhao, Andrew Zhu, Sayaka Nakamura, Yuki Yamamoto, Jerry Jun Yokono, Aaron Mueller, Bryan A. Plummer, Kate Saenko, Venkatesh Saligrama, Boqing Gong

机构 * Boston University(波士顿大学) Sony Group Corporation(索尼集团公司)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);language model(abstract);分类 cs.AI

AI总结 BabyVLM-V2通过纵向多维预训练集、灵活模型和DevCV工具箱,提升婴儿启发式视觉语言模型性能,实验证明其在基准测试中表现优异。

Comments Accepted to CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27558 2026-03-31 cs.CV 88%

Learning to See through Illumination Extremes with Event Streaming in Multimodal Large Language Models

通过事件流学习在极端光照下视觉感知

Baoheng Zhang, Jiahui Liu, Gui Zhao, Weizhou Zhang, Yixuan Ma, Jun Jiang, Yingxian Chen, Wilton W. T. Fok, Xiaojuan Qi, Hayden Kwok-Hay So

机构 * The University of Hong Kong(香港大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出Event-MLLM,通过动态融合事件流与RGB帧进行全光视觉推理,引入光照指示器和光照校正损失,解决极端光照下多模态大语言模型的感知与推理问题。

Comments IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21138 2026-03-31 cs.SE cs.AI 87%

Multi-Sample Prompting and Actor-Critic Prompt Optimization for Diverse Synthetic Data Generation

多样本提示与演员-评论员提示优化用于多样化合成数据生成

Abdelkarim El-Hajjami, Camille Salinesi

机构 * Paris 1 Panthéon–Sorbonne University(巴黎第一大学)

专题命中 预训练与数据 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出多样本提示与演员-评论员提示优化方法,用于提升合成数据生成的多样性与下游任务表现,实验显示在需求工程分类任务中,F1分数提升达6至43.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10102 2026-03-31 cs.LG 85%

PANTHER: Generative Pretraining Beyond Language for Sequential User Behavior Modeling

PANTHER:超越语言的生成预训练用于序列用户行为建模

Guilin Li, Yun Zhang, Xiuyuan Chen, Chengqi Li, Bo Wang, Linghe Kong, Wenjia Wang, Weiran Huang, Matthias Hwai Yong Tan

机构 * Shanghai Jiao Tong University(上海交通大学) WeChat Pay, Tencent(微信支付,腾讯) Shanghai Innovation Institute(上海创新研究院) City University of Hong Kong(香港城市大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 PANTHER通过生成预训练方法,结合生成与判别模型,实现用户行为序列的高效建模,提升交易预测和欺诈检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03904 2026-03-31 cs.LG 85%

LLM as an Algorithmist: Enhancing Anomaly Detectors via Programmatic Synthesis

LLM作为算法家:通过程序合成增强异常检测器

Hangting Ye, Jinmeng Li, He Zhao, Mingchen Zhuge, Dandan Guo, Yi Chang, Hongyuan Zha

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) CUHK-Shenzhen(香港中文大学(深圳)) Department of DSAI, Monash University(莫纳什大学数据科学与人工智能系) KAUST(阿卜杜拉国王科技大学) International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动人机智能工程研究中心)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出LLM-DAS框架,将LLM从数据处理者转变为算法家,通过程序合成生成对抗性异常,提升检测器鲁棒性。

Comments Accepted by the Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02368 2026-03-31 cs.IR 85%

NextQuill: Causal Preference Modeling for Enhancing LLM Personalization

NextQuill: 基于因果偏好建模的增强大语言模型个性化

Xiaoyan Zhao, Juntao You, Yang Zhang, Wenjie Wang, Hong Cheng, Fuli Feng, See-Kiong Ng, Tat-Seng Chua

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 NextQuill通过因果偏好建模方法,改进大语言模型的个性化对齐,通过区分模型预测和训练数据中的真实偏好影响,提升个性化效果。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16739 2026-03-31 cs.LG cs.AI cs.HC 84%

SpecMoE: Spectral Mixture-of-Experts Foundation Model for Cross-Species EEG Decoding

SpecMoE:用于跨物种EEG解码的频谱混合专家基础模型

Davy Darankoum, Chloé Habermacher, Julien Volle, Sergei Grudinin

机构 * Univ. Grenoble Alpes, CNRS, Grenoble INP, LJK(格勒诺布尔-阿尔卑斯大学、法国国家科学研究中心、格勒诺布尔国立理工学院、让·库尔曼实验室) SynapCell SAS(SynapCell公司)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SpecMoE模型,通过改进的频谱掩码策略和混合专家框架,提升EEG信号解码性能,实现跨物种和跨受试者的高准确率。

Comments 34 pages (12 pages in the main text and 22 pages in Supplementary Information)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01277 2026-03-31 cs.SD cs.LG eess.AS q-bio.QM 83%

Foundation Models for Bioacoustics -- a Comparative Review

生物声学中的基础模型——比较综述

Raphael Schwinger, Paria Vali Zadeh, Lukas Rauch, Mats Kurz, Tom Hauschild, Sam Lapp, Sven Tomforde

机构 * Kiel University(基尔大学) University of Kassel(卡塞尔大学) University of Pittsburgh(匹兹堡大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文综述了大规模预训练生物声学基础模型,分析其在多种分类任务中的迁移能力,并通过实验验证不同模型的性能,为选择合适模型提供指导。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17209 2026-03-31 cs.CV 82%

Scaling Self-Supervised and Cross-Modal Pretraining for Volumetric CT Transformers

基于体素CT的自监督与跨模态预训练的扩展

Cris Claessens, Christiaan Viviers, Giacomo D'Amicantonio, Egor Bondarev, Fons van der Sommen

机构 * Eindhoven University of Technology(埃因霍温理工大学) ARIA Lab(ARIA实验室) AIMS Lab(AIMS实验室)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract)

AI总结 SPECTRE通过可扩展的3D视觉Transformer架构和现代自监督与视觉-语言预训练策略,学习通用CT表示,克服了体素CT的极端标记扩展、几何各向异性及临床监督弱的问题,实现了大规模3D注意力计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27950 2026-03-31 cs.LG 79%

Scaling Atomistic Protein Binder Design with Generative Pretraining and Test-Time Compute

基于生成预训练和测试时计算的原子级蛋白质结合物设计扩展

Kieran Didi, Zuobai Zhang, Guoqing Zhou, Danny Reidenbach, Zhonglin Cao, Sooyoung Cha, Tomas Geffner, Christian Dallago, Jian Tang, Michael M. Bronstein, Martin Steinegger, Emine Kucukbenli, Arash Vahdat, Karsten Kreis

机构 * NVIDIA(英伟达) University of Oxford(牛津大学) Mila - Québec AI Institute(米拉-魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) HEC Montréal(蒙特利尔高等商学院) CIFAR AI Chair(CIFAR人工智能主席) AITHYRA School of Biological Sciences, Seoul National University(首尔大学生物科学学院) Interdisciplinary Program in Bioinformatics, Seoul National University(首尔大学生物信息学跨学科项目) Institute of Molecular Biology and Genetics, Seoul National University(首尔大学分子生物学与遗传学研究所) Artificial Intelligence Institute, Seoul National University(首尔大学人工智能研究所)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 本文提出Proteina-Complexa方法,结合生成模型与结构预测,实现高精度蛋白质结合物设计,优于现有生成和幻觉方法,同时扩展至小分子和酶设计。

Comments ICLR 2026 Oral Presentation. Project page: https://research.nvidia.com/labs/genair/proteina-complexa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01342 2026-03-31 cs.CV 78%

InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision

InternVideo-Next:无需视频-文本监督的通用视频基础模型

Chenting Wang, Yuhan Zhu, Yicheng Xu, Jiange Yang, Lang Lin, Ziang Yan, Yali Wang, Yi Wang, Limin Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Shenzhen Institutes of Advanced Technology, China(中国科学院深圳先进技术研究院) Nanjing University(南京大学)

专题命中 预训练与数据 :foundation model(title);pretraining(abstract)

AI总结 本文提出InternVideo-Next,通过解耦传统编码器-解码器设计为Encoder-Predictor-Decoder框架,解决像素重建与语义冲突问题,构建语义一致且细节保留的潜在空间,提升视频基础模型的通用性。

Journal ref CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10195 2026-03-31 cs.CV 78%

Minimizing the Pretraining Gap: Domain-aligned Text-Based Person Retrieval

缩小预训练差距:领域对齐的基于文本的人检索

Shuyu Yang, Yaxiong Wang, Yongrui Li, Li Zhu, Zhedong Zheng

机构 * Xi’an Jiaotong University(西安交通大学) Hefei University of Technology(合肥工业大学) University of Macau(澳门大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出双层级策略,通过领域感知扩散和多粒度关系对齐,解决光照、颜色和视角变化导致的领域差距,提升CUHK-PEDES等数据集上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27527 2026-03-31 cs.LG 77%

Visualization of Machine Learning Models through Their Spatial and Temporal Listeners

通过空间和时间监听器可视化机器学习模型

Siyu Wu, Lei Shi, Lei Xia, Cenyang Wu, Zipeng Liu, Yingchaojie Feng, Liang Zhou, Wei Chen

机构 * School of Computer Science & Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Institute of Medical Technology, Peking University Health Science Center and National Institute of Health Data Science, Peking University(北京大学医学部医学技术研究院与北京大学健康数据科学国家研究所) School of Software, Beihang University(北京航空航天大学软件学院) National University of Singapore(新加坡国立大学) State Key Laboratory of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种以模型为中心的两阶段框架,通过抽象监听器捕捉模型的空间和时间行为,并将其连接到经典信息可视化流程,分析显示可视化模型结果、定量/名义数据类型和统计图表是主要关注点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07732 2026-03-31 cs.RO cs.AI cs.CL cs.CV cs.LG 75%

ViPRA: Video Prediction for Robot Actions

ViPRA:用于机器人动作的视频预测

Sandeep Routray, Hengkai Pan, Unnat Jain, Shikhar Bahl, Deepak Pathak

机构 * Carnegie Mellon University(卡内基梅隆大学) Skild AI University of California, Irvine(加州大学尔湾分校)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ViPRA通过预训练和微调框架,从无标注视频中学习连续机器人控制,利用视频语言模型预测视觉观察和运动中心潜在动作,支持跨机器人形态的泛化和高频率连续控制。

Comments In ICLR 2026. Website: https://vipra-project.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22419 2026-03-31 cs.CV 75%

CLIP Is Shortsighted: Paying Attention Beyond the First Sentence

CLIP存在短视:超越第一句话的注意力分配

Marc-Antoine Lavoie, Anas Mahmoud, Aldo Zaimi, Arsene Fansi Tchango, Steven L. Waslander

机构 * University of Toronto Robotics Institute(多伦多大学机器人研究所) Mila - Quebec AI Institute(Mila - 魁北克人工智能研究所)

专题命中 预训练与数据 :LLM(abstract);language model(abstract);pretraining(abstract)

AI总结 CLIP模型在大规模数据上通过图像-文本对比学习获取可迁移的多模态特征,但其预训练过程偏向于短描述,导致复杂场景对齐不足。本文提出DeBias-CLIP,通过去除摘要句和子采样提升对齐效果,实现更优的长文本检索和鲁棒性。

Comments 20 pages, 15 figures, to be published in the CVPR 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27399 2026-03-31 cs.HC 67%

The Decline of Online Knowledge Communities: Obstacles, Workarounds, and Sustainability

在线知识社区的衰落:障碍、应对方法与可持续性

Ching Christie Pang, Xuetong Wang, Yuk Hang Tsui, Pan Hui

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 研究探讨了生成式AI对在线知识社区的影响,发现用户虽依赖AI但仍需社区解决复杂问题,强调维持社会互动与信任对社区韧性的重要性。

Comments 25 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28123 2026-03-31 cs.CY cs.AI cs.CL 62%

Does Claude's Constitution Have a Culture?

克莱因的宪法有文化吗?

Parham Pourdavood

机构 * Independent Researcher(独立研究员)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究克莱因的宪法是否反映特定文化视角,通过评估其在跨文化调查中的表现,发现其价值观与北欧和盎格鲁国家相似,但多数项目超出所有被调查人群范围。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23562 2026-03-31 cs.LG cs.AI 62%

Synthetic Mixed Training: Scaling Parametric Knowledge Acquisition Beyond RAG

合成混合训练:在RAG之上扩展参数化知识获取

Seungju Han, Konwoo Kim, Chanwoo Park, Benjamin Newman, Suhas Kotha, Jaehun Jung, James Zou, Yejin Choi

机构 * Stanford University(斯坦福大学) MIT(麻省理工学院) University of Washington(华盛顿大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出合成混合训练方法,结合合成问答和文档,通过互补训练信号提升模型性能,在QuaLITY基准上实现4.4%的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22300 2026-03-31 cs.LG cs.AI 62%

Scaling Attention via Feature Sparsity

通过特征稀疏性扩展注意力机制

Yan Xie, Tiansheng Wen, Tangda Huang, Bo Chen, Chenyu You, Stefanie Jegelka, Yifei Wang

机构 * School of Electronic Engineering, Xidian University(西安电子科技大学电子工程学院) Stony Brook University(石溪大学) TUM(慕尼黑工业大学) MIT(麻省理工学院) Amazon AGI SF Lab(亚马逊AGI旧金山实验室)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Sparse Feature Attention (SFA),通过特征稀疏性降低注意力计算成本,提升处理超长上下文的能力,实验表明其在速度和资源消耗上优于现有方法。

Comments 26 pages, 11 figures; Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07554 2026-03-31 cs.CL cs.AI cs.SD 62%

Nwāchā Munā: A Devanagari Speech Corpus and Proximal Transfer Benchmark for Nepal Bhasha ASR

Nwāchā Munā:一个用于尼泊尔语语音识别的达兰萨拉语语音语料库和近邻转移基准

Rishikesh Kumar Sharma, Safal Narshing Shrestha, Jenny Poudel, Rupak Tiwari, Arju Shrestha, Rupak Raj Ghimire, Bal Krishna Bal

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文介绍了一个新的5.39小时手动转录的达兰萨拉语音语料库,并建立首个基于脚本保留的声学建模基准,探讨近邻跨语言转移在低资源ASR中的有效性。

Comments Accepted in CHiPSAL@LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03721 2026-03-31 cs.CV cs.CL cs.CY cs.LG 62%

Person-Centric Annotations of LAION-400M: Auditing Bias and Its Transfer to Models

针对LAION-400M的人为中心标注:审查偏见及其在模型中的转移

Leander Girrbach, Stephan Alaniz, Genevieve Smith, Trevor Darrell, Zeynep Akata

机构 * Technical University of Munich, Munich Center for Machine Learning (MCML), MDSI(慕尼黑工业大学,慕尼黑机器学习中心(MCML),MDSI) LTCI, Télécom Paris, Institut Polytechnique de Paris, France(法国巴黎理工学院,巴黎电信学院,LTCI) Helmholtz Munich(亥姆霍兹慕尼黑中心) University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过创建LAION-400M的人为中心标注,揭示了训练数据中存在的人口统计学偏见,并展示了这些偏见如何转移到视觉-语言模型中。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26821 2026-03-31 cs.LG cs.AI 62%

Epileptic Seizure Prediction Using Patient-Adaptive Transformer Networks

利用患者自适应变换器网络进行癫痫发作预测

Mohamed Mahdi, Asma Baghdadi

机构 * Communication Engineering Department National Engineering School of Tunis Tunis El Manar University REGIM-Lab, University of Sfax, National Engineering School of Sfax (ENIS), BP 1173, Sfax, 3038, Tunisia National Engineering School of Tunis Tunis El Manar University

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种患者自适应变换器框架,通过自监督预训练和患者特定微调实现短时间尺度癫痫发作预测,实验表明方法在TUH EEG数据集上验证准确率超过90%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28074 2026-03-31 cs.LG math.DS 57%

Koopman-based surrogate modeling for reinforcement-learning-control of Rayleigh-Benard convection

基于Koopman的代理建模用于强化学习控制雷诺-贝纳德对流

Tim Plotzki, Sebastian Peitz

机构 * TU Dortmund University \& Lamarr Institute for Machine Learning

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文研究了利用线性递归自动编码器网络加速强化学习控制二维雷诺-贝纳德对流的方法,通过预训练方案结合代理模型与DNS,提升了控制性能并减少了训练时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06162 2026-03-31 cs.LG 57%

TabPFN-Wide: Continued Pre-Training for Extreme Feature Counts

TabPFN-Wide:为极端特征数量继续预训练

Christopher Kolberg, Jules Kreuer, Jonas Huurdeman, Sofiane Ouaari, Katharina Eggensperger, Nico Pfeifer

机构 * Institute for Bioinformatics Medical Informatics , University of T\" u bingen , Maria-von-Linden-Str. 6 , 72076 , Baden-W\" u rttemberg , Germany AutoML for Science , University of T\" u bingen , Maria-von-Linden-Str. 6 , 72076 , Baden-W\" u rttemberg , Germany Lamarr Institute for Machine Learning

专题命中 预训练与数据 :foundation model(abstract);分类 cs.LG

AI总结 本文提出TabPFN-Wide模型,通过继续预训练合成数据提升对高维数据的处理能力,实现对超过3万特征的稳健建模,同时保持可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28763 2026-03-31 cs.CV 50%

PoseDreamer: Scalable and Photorealistic Human Data Generation Pipeline with Diffusion Models

PoseDreamer:基于扩散模型的可扩展且逼真的人体数据生成管道

Lorenza Prospero, Orest Kupyn, Ostap Viniavskyi, João F. Henriques, Christian Rupprecht

机构 * The Podium Institute for Sports Medicine and Technology, University of Oxford(牛津大学体育医学与技术讲台研究所) Visual Geometry Group, University of Oxford(牛津大学视觉几何组) Ukrainian Catholic University(乌克兰天主教大学)

专题命中 预训练与数据 :preference optimization(abstract)

AI总结 本文提出PoseDreamer,通过扩散模型生成大规模合成数据,结合可控图像生成与偏好优化,提升3D人体数据质量与多样性,实现比传统合成数据更高的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28628 2026-03-31 nucl-th 50%

From $α$ decay to cluster decay: an extreme case of transfer learning

从α衰变到簇衰变:迁移学习的一个极端案例

Yinu Zhang, Zhiyi Li, Kele Li, Jiaxuan Zhong, Cenxi Yuan

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文通过迁移学习解决小数据下的模型优化问题,利用预训练的α衰变半衰期数据初始化模型,从而准确预测簇衰变半衰期,并验证了初始化和样本选择对预测精度的影响。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏