arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138627 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12379 篇

2509.10406 2026-07-01 cs.LG 版本更新 83%

Multipole Semantic Attention: A Fast Approximation of Softmax Attention for Pretraining

多极语义注意力:一种用于预训练的Softmax注意力快速近似方法

Rupert Mitchell, Kristian Kersting

机构 * TU Darmstadt(达姆施塔特工业大学) Hessian Center for AI (hessian.AI)(黑森人工智能中心)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.LG

AI总结 提出多极语义注意力(MuSe),通过对查询和键分别聚类实现查询特定的摘要,在64k上下文预训练中加速36%且保持损失不变,无需架构修改,兼容现有预训练模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16757 2026-07-01 eess.AS cs.AI 版本更新 83%

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation

重新审视音频-语言预训练以学习通用音频表示

Wei-Cheng Tseng, Xuanru Zhou, Mingyue Huo, Yiwen Shao, Hao Zhang, Dong Yu

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Zhejiang University(浙江大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tencent AI Lab Seattle(腾讯AI实验室西雅图)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI

AI总结 本文通过构建大规模数据集CaptionStew并系统对比对比学习和字幕生成目标,揭示了音频-语言预训练在数据效率和可扩展性上的权衡,为通用音频表示学习提供了实证指导。

Comments ACL 2026 Main. Code available at https://github.com/AudenAI/Auden

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29586 2026-06-30 cs.CV cs.AI 83%

SonoCLIP: Mask-Guided Region-Aware Vision-Language Pretraining for Fetal Ultrasound Analysis

SonoCLIP: 面向胎儿超声分析的掩码引导区域感知视觉-语言预训练

Hang Su, Chao Sun, Zhaofan Li, Wei Hu, Juhua Liu, Bo Du

机构 * School of Computer Science, Wuhan University, Wuhan, China(武汉大学计算机学院,武汉,中国) Institute of Artificial Intelligence, Wuhan University, Wuhan, China(武汉大学人工智能研究院,武汉,中国) Department of Ultrasound, Renmin Hospital of Wuhan University, Wuhan, China(武汉大学仁民医院超声科,武汉,中国) National Engineering Research Center for Multimedia Software, Wuhan University, Wuhan, China(武汉大学多媒体软件国家工程研究中心,武汉,中国) Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, Wuhan, China(湖北省多媒体与网络通信工程重点实验室,武汉大学,武汉,中国)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 提出SonoCLIP,首个百万级区域可控胎儿超声视觉-语言基础模型,通过掩码引导的全局-局部对比学习,提升对临床关键局部结构的敏感性,在零样本迁移中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29241 2026-06-30 cs.LG 83%

Towards Evaluating Data Priors for Tabular Foundation Models

面向表格基础模型的数据先验评估

Zeynep Türkmen, Kürşat Kaya, Alexander Pfefferle, Frank Hutter

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 提出一种统一接口,比较不同表格基础模型的数据先验对下游分类任务的影响,发现先验偏好不同且数据相似性仅部分解释下游行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28105 2026-06-29 cond-mat.dis-nn cond-mat.stat-mech cs.CL 新提交 83%

Scaling limit of the Random Language Model

随机语言模型的标度极限

Eric De Giuli

机构 * Department of Physics, Toronto Metropolitan University(物理系,多伦多 Metropolitan 大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 研究随机语言模型在隐藏符号数趋于无穷、语法温度趋于零的标度极限下的相变行为,发现规则使用在临界值x_c=1/8处发生凝聚转变,并推导出熵等可观测量的标度律。

Comments 17 pages + 14 pages SI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07175 2026-06-29 cs.CL 版本更新 83%

Continual Memorization of Factoids in Language Models

语言模型中事实的持续记忆

Howard Chen, Jiayi Geng, Adithya Bhaskar, Dan Friedman, Danqi Chen

机构 * Princeton Language and Intelligence (PLI), Princeton University(普林斯顿大学普林斯顿语言与智能研究所)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 提出持续记忆任务,发现语言模型在后续微调中严重遗忘事实,并提出REMIX方法(混合随机词序列或预训练语料)缓解遗忘,优于回放等方法。

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22722 2026-06-23 cs.CL 新提交 83%

moBERTo: A Modern Encoder for Portuguese via Continued Pretraining of ModernBERT

moBERTo: 通过ModernBERT的持续预训练实现的现代葡萄牙语编码器

Thiago Laitz, Thales Sales Almeida, João Guilherme Alves Santos, Giovana Kerche Bonás

机构 * UNICAMP(坎皮纳斯州立大学) Tropic AI Maritaca AI

专题命中 预训练与数据 :pretraining(title,abstract);post-training(abstract);分类 cs.CL

AI总结 提出moBERTo,通过对ModernBERT-base在600亿token上持续预训练得到葡萄牙语编码器,在检索、分类、NER和NLU任务上表现优异,并揭示了持续预训练优于从头训练、分词器适配和长上下文后训练的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21395 2026-06-23 cs.LG cond-mat.mtrl-sci 新提交 83%

Atomistic Language Models Understand and Generate Materials

原子语言模型理解与生成材料

Sathya Edamadaka, Krithik Ramesh, Ju Li, Rafael Gómez-Bombarelli

机构 * Massachusetts Institute of Technology(麻省理工学院) Lyra Labs Lila Sciences

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 提出原子语言模型(ALMs),通过连续投影和分阶段训练统一原子编码器、大语言模型和去噪扩散模型,实现从自然语言生成和优化晶体结构,在晶体结构预测和从头生成上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17846 2026-06-18 cs.RO cs.CV cs.LG 新提交 83%

Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models

Qwen-RobotManip 技术报告:对齐解锁机器人操作基础模型的规模

Haoqi Yuan, Zhixuan Liang, Anzhe Chen, Ye Wang, Haoyang Li, Pei Lin, Yiyang Huang, Zixing Lei, Tong Zhang, Jiazhao Zhang, Jie Zhang, Jingyang Fan, Gengze Zhou, Qihang Peng, Chenxu Lv, Xiaoyue Chen, An Yang, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Chenfei Wu, Xiong-Hui Chen

机构 * Qwen Team(Qwen团队)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 提出 Qwen-RobotManip,通过统一的对齐框架(表示、运动和行为维度)实现多源异构操作数据的大规模协同训练,构建约38,100小时预训练语料,在零样本指令跟随、跨本体迁移等泛化能力上超越先前模型。

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15129 2026-06-16 cs.CV cs.AI 新提交 83%

EyeMVP: OCT-Informed Fundus Representation Learning via Paired CFP--OCT Pretraining

EyeMVP: 通过配对CFP-OCT预训练实现OCT启发的眼底表征学习

Zhuo Deng, Ruiheng Zhang, Ziheng Zhang, Weihao Gao, Yitong Li, Qian Wang, Lei Shao, Jiaoyue Dong, Zhixi Zeng, Lijian Fang, Haibo Wang, Xiaobin Lin, Tao Liu, Zhicheng Du, Zhengwei Zhang, Lin Yang, Zheng Gong, Xinyu Zhao, Zhenquan Wu, Fang Li, Zhiguang Zhou, Guoming Zhang, Sun Jing, Han Lv, Wenbin We, Lan Ma

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Beijing Tongren Eye Center, Beijing Tongren Hospital, Capital Medical University(首都医科大学附属北京同仁医院北京同仁眼科中心) Liangxiang Hospital of Beijing Fangshan District, Capital Medical University(首都医科大学北京市房山区良乡医院) The Third People's Hospital of Dalian(大连市第三人民医院) National Clinical Research Center for Endocrine and Metabolic Diseases, The Second Xiangya Hospital of Central South University(中南大学湘雅二医院国家内分泌代谢病临床医学研究中心) The Central Hospital of Baoji City(宝鸡市中心医院) Wuxi No.2 People's Hospital, Affiliated Wuxi Clinical College of Nantong University(南通大学附属无锡临床学院无锡市第二人民医院) Shenzhen Eye Hospital, Southern Medical University(南方医科大学深圳眼科医院) Beijing Friendship Hospital, Capital Medical University(首都医科大学附属北京友谊医院)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 提出跨模态视网膜基础模型EyeMVP,利用配对CFP-OCT预训练,通过跨模态掩码重建将OCT结构信息注入CFP表征,在16项下游任务中优于现有模型,尤其对黄斑疾病诊断有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14760 2026-06-16 cs.CV cs.AI 新提交 83%

GeoRoPE: Ground-Aware Rotary Adaptation for Remote Sensing Foundation Models

GeoRoPE: 面向遥感基础模型的地面感知旋转适配

Yu Luo, Kun Hu, Mengwei He, Xiaogang Zhu, Shan Zeng, Allen Benter, Wei Xiang, Patrick Filippi, Thomas Francis Bishop, Zhiyong Wang

机构 * The University of Sydney(悉尼大学) Edith Cowan University(埃迪斯科文大学) Adelaide University(阿德莱德大学) Wuhan Polytechnic University(武汉轻工大学) Climate, Orange Agricultural Institute(气候研究所,奥兰治农业研究所) La Trobe University(拉筹伯大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 提出GeoRoPE方法,通过地理坐标校准和频率校准解决遥感基础模型中的尺度失配问题,提升跨分辨率鲁棒性和尺度敏感表征学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14819 2026-06-16 cs.CL 83%

Testimole-Conversational: A 30-Billion-Word Italian Discussion Board Corpus (1996-2024) for Language Modeling and Sociolinguistic Research

Testimole-Conversational: 一个包含300亿词的意大利讨论板语料库(1996-2024)用于语言建模和社会语言学研究

Matteo Rinaldi, Rossella Varvara, Viviana Patti

机构 * University of Bologna(博洛尼亚大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 该语料库为意大利大语言模型预训练和语言社会学研究提供了丰富的讨论板文本资源,涵盖1996-2024年间超过300亿词的意大利语信息。

Journal ref Proceedings of the 12th Workshop on Challenges in the Management of Large Corpora (CMLC-12) @ LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12306 2026-06-16 cs.CL 版本更新 83%

A large-scale pipeline for LLM-assisted corpus annotation: variation and change in the English consider construction

基于大语言模型的大规模语料标注流水线:英语consider构式的变异与变化

Cameron Morin, Matti Marttinen Larsson

机构 * Université Paris-Cité(巴黎-城市大学) University of Gothenburg(哥德堡大学)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一种利用大语言模型自动标注大规模语料的四阶段流水线,在历史英语语料库中标注14万条consider构式,准确率超98%,揭示未记录的体裁特异性变化轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08306 2026-06-09 cs.LG cs.SI 新提交 83%

Towards Graph Foundation Models for Dynamics in Complex Networked Systems: Lessons from Super-Spreader Identification in Multilayer Networks

面向复杂网络系统中动力学的图基础模型:来自多层网络超级传播者识别的教训

Michał Czuba, Mateusz Stolarski, Adam Piróg, Piotr Bielak, Piotr Bródka

机构 * Department of Artificial Intelligence, Wroc{\l}aw University of Science and Technology, Wroc{\l}aw, Poland(人工智能系,沃斯拉夫科技大学,沃斯拉夫,波兰)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出图基础模型在动力学中需具备归纳跨网络泛化能力,通过仅基于合成多层网络训练的ts-net模型,在真实多层网络上实现零样本泛化,并优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07725 2026-06-09 physics.geo-ph cs.LG 新提交 83%

GNSS-FM: A Self-Supervised Foundation Model for Daily GNSS Displacement Time Series

GNSS-FM:用于日常GNSS位移时间序列的自监督基础模型

Nick Teutschmann, Laura Crocetti, Fanny Lehmann, Leonardo Trentini, Benedikt Soja

机构 * Institute of Geodesy and Photogrammetry, ETH Zurich(大地测量与摄影测量研究所,苏黎世联邦理工学院) ETH AI Center(ETH人工智能中心)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 提出GNSS-FM自监督基础模型,通过双流输入和掩码潜在预测预训练,在位移预测和地震阶跃定位任务上优于强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08920 2026-06-09 q-bio.BM cs.AI 版本更新 83%

AMix-1: A Pathway to Test-Time Scalable Protein Foundation Model

AMix-1: 迈向测试时可扩展的蛋白质基础模型

Changze Lv, Jiang Zhou, Siyu Long, Lihao Wang, Jiangtao Feng, Dongyu Xue, Yu Pei, Hao Wang, Zherui Zhang, Yuchen Cai, Zhiqiang Gao, Ziyuan Ma, Jiakai Hu, Chaochen Gao, Jingjing Gong, Yuxuan Song, Shuyi Zhang, Xiaoqing Zheng, Deyi Xiong, Lei Bai, Wanli Ouyang, Ya-Qin Zhang, Wei-Ying Ma, Bowen Zhou, Hao Zhou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Generative Symbolic Intelligence Lab (GenSI), Tsinghua University(生成符号智能实验室(GenSI),清华大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) Tsinghua University(清华大学) Fudan University(复旦大学) Tianjin University(天津大学) Georgia Institute of Technology(佐治亚理工学院) Beijing University of Posts and Telecommunications(北京邮电大学) University of Chinese Academy of Sciences(中国科学院大学) City University of Hong Kong(香港城市大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 提出基于贝叶斯流网络的蛋白质基础模型AMix-1,通过预训练缩放律、涌现能力分析、上下文学习机制和测试时缩放算法,实现1.7B参数模型,并设计出活性提高50倍的AmeR变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06892 2026-06-08 cs.LG 新提交 83%

GRASP: Geometry-aware Residual Alignment for Scalable Pretraining Data Attribution

GRASP:面向可扩展预训练数据归因的几何感知残差对齐

Yue Min, Ruining Chen, Yujun Li

机构 * Wizard Quant University of Science and Technology of China(中国科学技术大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.LG

AI总结 提出GRASP方法,通过二次几何惩罚建模子集交互,结合低维特征草图与有限置信度选择协议,实现可扩展的预训练数据归因,显著提升反事实子集保真度并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00541 2026-06-08 cs.LG 版本更新 83%

One Loss to Rule Them All: Marked Time-to-Event for Structured EHR Foundation Models

一个损失统治一切:结构化EHR基础模型的标记时间到事件

Zilin Jing, Vincent Jeanselme, Yuta Kobayashi, Simon A. Lee, Chao Pang, Aparajita Kashyap, Yanwei Li, Xinzhuo Jiang, Shalmali Joshi

机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系) Department of Biomedical Informatics, Columbia University(哥伦比亚大学生物医学信息学系) Department of Computational Medicine, UCLA(洛杉矶大学计算医学系) Formation Bio

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 提出ORA预训练目标,联合建模事件时间和关联测量,相比下一词预测和忽略连续测量的损失,在多个数据集和下游任务上产生更通用的表示,提升回归和时间到事件预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16023 2026-06-08 cs.LG cond-mat.mtrl-sci 版本更新 83%

A Conformation-Centric Generative Foundation Model for Linear Polymer Modeling and Design

面向线性聚合物建模与设计的构象中心生成式基础模型

Fanmeng Wang, Ruochao Wang, Shan Mei, Wentao Guo, Hongshuai Wang, Qi Ou, Zhifeng Gao, Hongteng Xu

机构 * Gaoling School of Artificial Intelligence(人工智能学院) Renmin University of China(中国人民大学) DP Technology(DP技术) SINOPEC Research Institute of Petroleum Processing Co., Ltd.(中石油加工研究院)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 提出PolyConFM基础模型,通过构象中心生成预训练(条件生成、掩码自回归建模和方向变换)来建模线性聚合物,在多种下游任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05257 2026-06-05 cs.LG cs.IR 83%

Scaling Laws for Behavioral Foundation Models over User Event Sequences

用户事件序列上行为基础模型的缩放定律

Rickard Brüel Gabrielsson

机构 * Unbox AI

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);分类 cs.LG

AI总结 研究行为基础模型在用户事件序列上的缩放定律,通过约600次实验发现小嵌入器参数最优,计算最优训练在低计算量时数据密集,且评估指标影响缩放定律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13548 2026-06-02 cs.RO cs.AI 83%

AttenA+: Rectifying Action Inequality in Robotic Foundation Models

AttenA+: 纠正机器人基础模型中的动作不平等性

Daojie Peng, Fulong Ma, Jiahang Cao, Qiang Zhang, Xupeng Xie, Jian Guo, Ping Luo, Andrew F. Luo, Boyu Zhou, Jun Ma

机构 * HKUST(GZ)(香港科技大学(广州)) HKU(香港大学) USTC(中国科学技术大学) IDEA Research(IDEA研究院) SUSTech(南方科技大学) X-Humaniod

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);分类 cs.AI

AI总结 针对机器人基础模型忽视动作物理重要性的问题,提出AttenA+框架,通过速度驱动的动作注意力重加权训练目标,提升复杂长程任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04958 2026-06-02 q-bio.QM cs.AI q-bio.NC 83%

CalM: A Self-Supervised Foundation Model for Population Dynamics in Calcium Imaging Data

CalM:一种用于钙成像数据中群体动力学的自监督基础模型

Xinhong Xu, Yimeng Zhang, Qichen Qian, Yuanlong Zhang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 提出自监督基础模型CalM,通过双轴自回归Transformer和高效分词器,在钙成像数据上预训练后,可迁移至神经群体动力学预测和行为解码等下游任务,并取得竞争性或更优性能。

Comments ICML accepted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02470 2026-06-02 cs.AI 83%

Breaking the Reversal Curse in Autoregressive Language Models via Identity Bridge

通过身份桥打破自回归语言模型中的逆转诅咒

Xutao Ma, Yixiao Huang, Hanlin Zhu, Somayeh Sojoudi

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 提出一种名为“身份桥”的简单数据正则化方法(形式为“A→A”),通过理论分析和实验证明该方法能有效缓解自回归语言模型中的逆转诅咒,使模型从事实记忆转向规则学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30561 2026-06-01 cs.CV cs.AI 83%

VLM3: Vision Language Models Are Native 3D Learners

VLM3:视觉语言模型是原生3D学习者

Zhipeng Cai, Zhuang Liu, Yunyang Xiong, Zechun Liu, Vikas Chandra, Yangyang Shi

机构 * Meta Princeton University(普林斯顿大学)

专题命中 预训练与数据 :language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出VLM3,通过焦距统一、文本像素参考和数据混合缩放,使标准视觉语言模型无需复杂架构或损失函数即可高效掌握多种3D任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29940 2026-05-29 cs.AI 83%

Make LLM Learn to Synthesize from Streaming Experiences through Feedback

使大语言模型通过反馈从流式经验中学习合成

Zhenlin Hu, Yan Wang, Zhen Bi, Zihao Xue, Bingyu Zhu, Longtao Huang, Xiongtao Zhang, Zeyu Yang, Zhixuan Chu, Jungang Lou

机构 * Huzhou Normal University(湖州师范学院) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Zhejiang Key Laboratory of Intelligent Education Technology and Application(浙江省智能教育技术与应用重点实验室)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出StreamSynth设置和SynLearner框架,使模型通过任务流积累经验并利用反馈提升合成数据生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28174 2026-05-28 cs.CV cs.AI 83%

FLORO: A Multimodal Geospatial Foundation Model for Ecological Remote Sensing Across Sensors and Scales

FLORO:面向跨传感器与尺度的生态遥感多模态地理空间基础模型

Jorge L. Rodriguez, Victor Angulo Morales, Areej Alwahas, Mariana Elias Lara, Fida Mohammad Thoker, Kasper Johansen, Bernard Ghanem, Fernando T. Maestre, Matthew F. McCabe

机构 * Biological and Environmental Science and Engineering Division, King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹科技大学生物与环境科学与工程 division) Computer, Electrical and Mathematical Science and Engineering Division, King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹科技大学计算机、电气与数学科学与工程 division)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 提出FLORO多模态地理空间基础模型,通过掩码自编码在异构遥感数据上预训练,利用可用性感知输入统一异构传感器配置,在PANGAEA基准上实现强迁移性能。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21835 2026-05-22 eess.IV cs.AI cs.CV physics.med-ph 83%

An Open Multi-Center Whole-Body FDG PET/CT Foundation Model for Tumor Segmentation

一种开放的多中心全身FDG PET/CT基础模型用于肿瘤分割

Xiaofeng Liu, Qianru Zhang, Thibault Marin, Menghua Xia, Chi Liu, Georges El Fakhri, Jinsong Ouyang

机构 * Department of Radiology and Biomedical Imaging, Yale Biomedical Imaging Institute, Yale University(放射学与生物医学成像系,耶鲁生物医学影像研究所,耶鲁大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出了一种开放的多中心全身FDG PET/CT基础模型,通过整合四个公开数据集中的4997份标准化扫描,利用层次UNet结构和早期通道拼接实现解剖和代谢特征的交互,提高了肿瘤分割的标签效率和跨模态表征学习能力。

Comments Code available at: https://github.com/liu-xiaofeng/Foundation-Model-for-PET-CT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21075 2026-05-21 cs.CV cs.LG 83%

SpectralEarth-FM: Bringing Hyperspectral Imagery into Multimodal Earth Observation Pretraining

SpectralEarth-FM: 将高光谱图像引入多模态地球观测预训练

Nassim Ait Ali Braham, Aaron Banze, Conrad M. Albrecht, Julien Mairal, Jocelyn Chanussot, Xiao Xiang Zhu

机构 * Chair of Data Science in Earth Observation(地球观测数据科学主任) Technical University of Munich(慕尼黑技术大学) Remote Sensing Technology Institute(遥感技术研究所) German Aerospace Center (DLR)(德国航空航天中心) Department of Aerospace Engineering(航空航天工程系) University of the Bundeswehr Munich(联邦国防军慕尼黑大学) LEAP Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Univ. Grenoble Alpes(格勒诺布尔阿尔卑斯大学) Inria(法国国家信息与自动化技术研究院) CNRS(法国国家科学研究中心) Grenoble INP(格勒诺布尔INP) LJK

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 本文提出SpectralEarth-FM,一种用于多传感器地球观测输入的分层变压器,旨在联合处理高光谱图像与低通道观测。通过构建SpectralEarth-MM数据集,采用JEPA风格的目标进行预训练,实现了在高光谱下游任务和标准EO基准上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19359 2026-05-20 cs.CV cs.LG 83%

MAM-CLIP: Vision-Language Pretraining on Mammography Atlases for BI-RADS Classification

MAM-CLIP:基于乳腺X线图集的视觉-语言预训练用于BI-RADS分类

Halil Ibrahim Gulluk, Olivier Gevaert

机构 * Department of Electrical Engineering(电气工程系) Biomedical Informatics Research (BMIR)(生物医学信息学研究(BMIR)) Stanford University(斯坦福大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.LG

AI总结 本文提出MAM-CLIP模型,通过预训练PubMedBERT和对比学习来提升乳腺X线图像的BI-RADS分类性能,实验表明在标注样本稀缺时,该方法能显著提高F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14907 2026-05-15 cs.AI 83%

KGPFN: Unlocking the Potential of Knowledge Graph Foundation Model via In-Context Learning

KGPFN:通过上下文学习解锁知识图谱基础模型的潜力

Yisen Gao, Jiaxin Bai, Haoyu Huang, Zhongwei Xie, Yufei Li, Hong Ting Tsang, Sirui Han, Yangqiu Song

机构 * Department of Computer Science and Engineering, HKUST, Hong Kong, China(香港科技大学计算机科学与工程系) Department of Computer Science and Engineering, HKBU, Hong Kong, China(香港城市大学计算机科学与工程系)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 KGPFN通过结合先验数据拟合网络与上下文学习,统一了可转移关系规律与推理时的上下文学习,有效提升知识图谱推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏