arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138627 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12379 篇

2604.12398 2026-04-15 eess.AS 82%

Contextual Biasing for ASR in Speech LLM with Common Word Cues and Bias Word Position Prediction

基于常见词提示和偏置词位置预测的语音LLM上下文偏置

Sashi Novitasari, Takashi Fukuda, Kurata Gakuto, George Saon

专题命中 预训练与数据 :LLM(title,title_cn)

AI总结 本文提出基于声音线索的上下文偏置方法,利用常见词发音相似性提升稀有词识别,通过多输出学习增强鲁棒性,实验显示在基准系统基础上错误率降低16.3%。

Comments Copyright 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12012 2026-04-15 cs.CV 82%

TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment

TIPSv2:通过增强的补丁-文本对齐推进视觉-语言预训练

Bingyi Cao, Koert Chen, Kevis-Kokitsi Maninis, Kaifeng Chen, Arjun Karpur, Ye Xia, Sahil Dua, Tanmaya Dabral, Guangxing Han, Bohyung Han, Joshua Ainslie, Alex Bewley, Mithun Jacob, René Wagner, Washington Ramos, Krzysztof Choromanski, Mojtaba Seyedhosseini, Howard Zhou, André Araujo

机构 * Google(谷歌) DeepMind(深度Mind)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract)

AI总结 本文提出TIPSv2,通过改进的预训练方法提升视觉-语言模型的补丁-文本对齐能力,实验表明其在多种任务和数据集上表现优异。

Comments CVPR2026 camera-ready + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11576 2026-04-14 cs.CV 82%

Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models

微调如你预训练:提升视觉语言模型零样本对抗鲁棒性

Songlong Xing, Weijie Wang, Zhengyu Zhao, Jindong Gu, Philip Torr, Nicu Sebe

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) Xi’an Jiaotong University(西安交通大学) University of Oxford(牛津大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract)

AI总结 本文提出AdvFLYP方法,通过遵循CLIP预训练过程的训练配方,利用网络上收集的图像-文本对生成对抗样本,并通过对比损失匹配文本,提升视觉语言模型的零样本对抗鲁棒性。

Comments Accepted to CVPR Findings Track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11082 2026-04-14 cs.CV 82%

RESP: Reference-guided Sequential Prompting for Visual Glitch Detection in Video Games

RESP:基于参考的顺序提示用于视频游戏中的视觉故障检测

Yakun Yu, Ashley Wiens, Adrián Barahona-Ríos, Benedict Wilkins, Saman Zadtootaghaj, Nabajeet Barman, Cor-Paul Bezemer

机构 * University of Alberta(阿尔伯塔大学) Sony Interactive Entertainment(索尼互动娱乐)

专题命中 预训练与数据 :prompting(title,abstract);language model(abstract)

AI总结 本文提出RESP框架,通过参考引导提示实现多帧视频游戏故障检测,利用VLMs在视频层面进行比较而非孤立分类,提升检测鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08522 2026-04-10 cs.CV 82%

UniversalVTG: A Universal and Lightweight Foundation Model for Video Temporal Grounding

UniversalVTG: 一种通用且轻量的视频时间定位基础模型

Joungbin An, Agrim Jain, Kristen Grauman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 预训练与数据 :foundation model(title);language model(abstract);pretraining(abstract)

AI总结 本文提出UniversalVTG,一种通用轻量视频时间定位模型,通过大规模跨数据集预训练实现高效长视频定位,优于专用模型且比大语言模型更轻量。

Comments Project Page: https://vision.cs.utexas.edu/projects/universalvtg

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20524 2026-04-10 cs.CV 82%

AnomalyVFM -- Transforming Vision Foundation Models into Zero-Shot Anomaly Detectors

AnomalyVFM -- 将视觉基础模型转变为零样本异常检测器

Matic Fučka, Vitjan Zavrtanik, Danijel Skočaj

机构 * University of Ljubljana, Faculty of Computer and Information Science(卢布尔雅那大学计算机与信息科学学院)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract)

AI总结 本文提出AnomalyVFM框架,通过合成数据生成与参数高效适应机制,使视觉基础模型在零样本异常检测中表现更优,实测在9个数据集上达到94.1%的AUROC。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01247 2026-04-03 cs.SD eess.AS 82%

Combining Masked Language Modeling and Cross-Modal Contrastive Learning for Prosody-Aware TTS

结合掩码语言建模与跨模态对比学习的语调感知语音合成

Kirill Borodin, Vasiliy Kudryavtsev, Maxim Maslov, Nikita Vasiliev, Mikhail Gorodnichev, Grach Mkrtchian

机构 * MTUCI(莫斯科电信与信息技术大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract)

AI总结 本文研究了基于扩散模型的语音合成中多阶段预训练对语调建模的影响,通过掩码语言建模与混合音素对比学习相结合,提升了生成质量与感知指标。

Comments This paper has been submitted to Interspeech 2026 for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01155 2026-04-02 cs.SD 82%

FineLAP: Taming Heterogeneous Supervision for Fine-grained Language-Audio Pretraining

FineLAP: 通过异质监督驯化细粒度语言-音频预训练

Xiquan Li, Xuenan Xu, Ziyang Ma, Wenxi Chen, Haolin He, Qiuqiang Kong, Xie Chen

机构 * X-LANCE Lab, Shanghai Jiao Tong University(上海交通大学X-LANCE实验室) SJTU Paris Elite Institute of Technology, Shanghai Jiao Tong University(上海交通大学巴黎卓越工程师学院) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract)

AI总结 本文提出FineLAP,一种新型预训练范式,通过异质数据提升CLAP在clip和frame级对齐能力,引入双流sigmoid损失和聚类采样策略,结合大规模合成SED数据集,实现多任务SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17209 2026-03-31 cs.CV 82%

Scaling Self-Supervised and Cross-Modal Pretraining for Volumetric CT Transformers

基于体素CT的自监督与跨模态预训练的扩展

Cris Claessens, Christiaan Viviers, Giacomo D'Amicantonio, Egor Bondarev, Fons van der Sommen

机构 * Eindhoven University of Technology(埃因霍温理工大学) ARIA Lab(ARIA实验室) AIMS Lab(AIMS实验室)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract)

AI总结 SPECTRE通过可扩展的3D视觉Transformer架构和现代自监督与视觉-语言预训练策略,学习通用CT表示,克服了体素CT的极端标记扩展、几何各向异性及临床监督弱的问题,实现了大规模3D注意力计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23533 2026-03-30 cs.CL cs.AI cs.IR cs.LG 82%

MDKeyChunker: Single-Call LLM Enrichment with Rolling Keys and Key-Based Restructuring for High-Accuracy RAG

MDKeyChunker: 基于滚动键和键驱动重构的单次调用LLM增强方法用于高精度RAG

Bhavik Mangla

机构 * Independent Research(独立研究)

专题命中 预训练与数据 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MDKeyChunker通过结构感知分块、单次LLM调用增强和键驱动重构提升RAG精度,实现单次调用提取七种元数据,消除多轮提取需求。

Comments 13 pages, 4 figures, 7 tables, 2 algorithms. Code: https://github.com/bhavik-mangla/MDKeyChunker

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23211 2026-03-27 physics.geo-ph 82%

The NCS-Model: A seismic foundation model trained on the Norwegian repository of public data

NCS模型:基于挪威公共数据仓库的地震基础模型

Alba Ordonez, Theodor Johannes Line Forgaard, David Wade, Aina Juell Bugge, Hakon Nese, Anders Ueland Waldeland

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文提出NCS模型,通过挪威大陆架的公开DISKOS数据库预训练,开发大规模地震基础模型,提供可扩展的3D训练方法,并量化盆地定向预训练和嵌入维度对下游解释性能的影响。

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22953 2026-03-25 cs.CV 82%

Cluster-Wise Spatio-Temporal Masking for Efficient Video-Language Pretraining

基于簇的时空掩码用于高效的视频-语言预训练

Weijun Zhuang, Yuqing Huang, Weikang Meng, Xin Li, Ming Liu, Xiaopeng Hong, Yaowei Wang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract)

AI总结 本文提出ClusterSTM策略,通过簇内掩码保留关键时空信息,提升视频-语言预训练效率,并在多任务上取得新状态。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22275 2026-03-24 cs.CV 82%

Repurposing Geometric Foundation Models for Multi-view Diffusion

将几何基础模型重新利用于多视图扩散

Wooseok Jang, Seonghu Jeon, Jisang Han, Jinhyeok Choi, Minkyung Kwon, Seungryong Kim, Saining Xie, Sainan Liu

机构 * KAIST AI(韩国科学技术院人工智能实验室) New York University(纽约大学) Intel Labs(英特尔实验室)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文提出Geometric Latent Diffusion框架,利用几何一致的特征空间作为多视图扩散的潜在空间,提升多视角生成的几何一致性和图像质量。

Comments project website: https://cvlab-kaist.github.io/GLD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20348 2026-03-24 cs.CV 82%

Toward a Multi-View Brain Network Foundation Model: Cross-View Consistency Learning Across Arbitrary Atlases

迈向多视角脑网络基础模型:跨视角一致性学习在任意脑图谱上的应用

Jiaxing Xu, Jingying Ma, Xin Lin, Yuxiao Liu, Kai He, Qika Lin, Yiping Ke, Yang Li, Dinggang Shen, Mengling Feng

机构 * Saw Swee Hock School of Public Health at National University of Singapore(国立新加坡大学 Saw Swee Hock 公共卫生学院) School of Biomedical Engineering & State Key Laboratory of Advanced Medical Materials and Devices, ShanghaiTech University(上海科技大学 生物医学工程学院及先进医学材料与设备国家重点实验室) College of Computing and Data Science, Nanyang Technological University(南洋理工大学 计算与数据科学学院) School of Automation Science and Electrical Engineering, Beihang University(北航自动化科学与电气工程学院) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北航虚拟现实技术与系统国家重点实验室) Shanghai United Imaging Intelligence(上海联合影像智能有限公司) Shanghai Clinical Research and Trial Center(上海临床研究与试验中心)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文提出MV-BrainFM多视角脑网络基础模型,通过跨视角一致性学习在任意脑图谱上学习通用且可扩展的表示,提升跨图谱的鲁棒性和一致性,实验表明其在20000+受试者数据集上优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15119 2026-03-19 cs.CV 82%

A Tutorial on ALOS2 SAR Utilization: Dataset Preparation, Self-Supervised Pretraining, and Semantic Segmentation

ALOS2 SAR利用教程:数据准备、自监督预训练与语义分割

Nevrez Imamoglu, Ali Caglayan, Toru Kouyama

机构 * National Institute of Advanced Industrial Science(国家先进工业科学促进机构)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract)

AI总结 本文介绍如何利用ALOS2 SAR数据进行预训练和语义分割,通过改进的预训练方法减少噪声影响,提升分割性能。

Comments 10 pages, 8 figures, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21637 2026-03-18 cs.CV 82%

CARE: A Molecular-Guided Foundation Model with Adaptive Region Modeling for Whole Slide Image Analysis

CARE:一种具有自适应区域建模的分子引导基础模型用于全切片图像分析

Di Zhang, Zhangpeng Gong, Xiaobo Pang, Jiashuai Liu, Junbo Lu, Hao Cui, Jiusong Ge, Zhi Zeng, Kai Yi, Yinghua Li, Si Liu, Tingsong Yu, Haoran Wang, Mireia Crispin-Ortuzar, Weimiao Yu, Chen Li, Zeyu Gao

机构 * Xi’an Jiaotong University(西安交通大学) University of Cambridge(剑桥大学) KingMed(康方生物) BGI Research(贝登基因研究院) A ⋆ STAR

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 CARE通过自适应区域建模和分子引导,提升全切片图像分析的性能,实现对病理区域的精准识别与分类,优于现有基础模型。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15259 2026-03-17 cs.LG cs.AI cs.CL cs.CR 82%

Directional Embedding Smoothing for Robust Vision Language Models

方向嵌入平滑用于鲁棒视觉语言模型

Ye Wang, Jing Liu, Toshiaki Koike-Akino

机构 * Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过方向嵌入平滑技术提升视觉语言模型的鲁棒性,针对多模态劫持攻击,验证了方向嵌入噪声在降低攻击成功率中的有效性。

Comments Accepted at ICLR 2026 Workshop on Agents in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07895 2026-03-10 cs.CV 82%

MINT: Molecularly Informed Training with Spatial Transcriptomics Supervision for Pathology Foundation Models

MINT: 通过空间转录组监督进行病理基础模型的分子引导训练

Minsoo Lee, Jonghyun Kim, Juseung Yun, Sunwoo Yu, Jongseong Jang

机构 * LG AI Research(LG人工智能研究)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 MINT通过整合空间转录组监督提升病理基础模型的分子信息捕捉能力,实现基因表达预测和病理任务的性能优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07463 2026-03-10 cs.CV 82%

SIGMAE: A Spectral-Index-Guided Foundation Model for Multispectral Remote Sensing

SIGMAE:一种用于多光谱遥感的基于频谱指数的基础模型

Xiaokang Zhang, Bo Li, Chufeng Zhou, Weikang Yu, Lefei Zhang

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) School of Artificial Intelligence and Automation, Wuhan University of Science and Technology(武汉科技大学人工智能与自动化学院) School of Electronic Information, Wuhan University of Science and Technology(武汉科技大学电子信息学院) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 SIGMAE通过引入频谱指数引导动态令牌遮蔽,提升多光谱遥感图像预训练效果,实现更优的空谱特征学习和复杂目标识别。

Comments 17pages,10figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02628 2026-03-10 eess.IV cs.CV 82%

DeepSparse: A Foundation Model for Sparse-View CBCT Reconstruction

DeepSparse: 一种用于稀疏视图CBCT重建的基础模型

Yiqun Lin, Jixiang Chen, Hualiang Wang, Jiewen Yang, Jiarong Guo, Yi Zhang, Xiaomeng Li

机构 * Department of Electronic and Computer Engineering, the Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学) School of Cyber Science and Engineering, Sichuan University(网络科学与工程学院,四川大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 DeepSparse是一种用于稀疏视图CBCT重建的基础模型,通过DiCE网络和HyViP框架提升重建质量与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07957 2026-03-05 astro-ph.IM astro-ph.HE 82%

In-Orbit GRB Identification Using LLM-based model for the CXPD CubeSat

利用基于大语言模型的模型进行轨道上伽马射线暴识别

Cunshi Wang, Zuke Feng, Difan Yi, Yuyang Li, Lirong Xie, Huanbo Feng, Yi Liu, Qian Liu, Yang Huang, Hongbang Liu, Xinyu Qi, Yangheng Zheng, Ali Luo, Guirong Xue, Jifeng Liu

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出基于大语言模型的轨道上伽马射线暴识别方法,通过模拟数据训练模型,实现高精度分类和光谱指数估计,为未来轨道上实时GRB检测提供技术基础。

Comments 16 pages, 8 figures, accepted by RAA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00479 2026-03-03 cs.CV 82%

U-VLM: Hierarchical Vision Language Modeling for Report Generation

U-VLM:用于报告生成的分层视觉语言模型

Pengcheng Shi, Minghui Zhang, Kehan Song, Jiaqi Liu, Yun Gu, Xinglin Zhang

机构 * Medical Image Insights Co. Ltd.(医疗影像洞察有限公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract)

AI总结 U-VLM通过分层视觉语言建模在CT-RATE和AbdomenAtlas 3.0上实现了最先进的报告生成性能,展示了精心设计的视觉编码器预训练的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11910 2026-02-26 cs.CV 82%

Seeing the Forest and the Trees: Query-Aware Tokenizer for Long-Video Multimodal Language Models

看清森林与树木:面向长视频多模态语言模型的查询感知分词器

Siyou Li, Huanan Wu, Juexi Shao, Yinghao Ma, Yujian Gan, Yihao Luo, Yuwei Wang, Dong Nie, Lu Wang, Wenqing Wu, Le Zhang, Massimo Poesio, Juntao Yu

机构 * Queen Mary University of London(伦敦女王学院) University of Sheffield(谢菲尔德大学) Imperial College London(伦敦帝国学院) Pengcheng Laboratory(鹏城实验室) Meta Inc(Meta公司) Meituan Inc(美团公司) Nanjing University of Science(南京理工大学) University of Birmingham(伯明翰大学) Utrecht University(乌得勒支大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract)

AI总结 QTSplus是一种轻量高效的视觉token选择模块,通过动态选择重要视觉证据提升长视频多模态语言模型的性能,显著降低计算成本并提高处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06657 2026-02-26 cs.CV cs.AI cs.CL cs.LG 82%

Renaissance: Investigating the Pretraining of Vision-Language Encoders

文艺复兴:探究视觉语言编码器的预训练

Clayton Fields, Casey Kennington

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 文艺复兴通过元分析探究视觉语言编码器预训练的最佳实践,展示冻结大部分模型可节省计算资源,同时探讨基于视觉或文本模型构建变压器的影响。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00168 2026-02-18 cs.CV 82%

SSL4EO-S12 v1.1: A Multimodal, Multiseasonal Dataset for Pretraining, Updated

SSL4EO-S12 v1.1:一种用于预训练的多模态、多季节数据集,更新版

Benedikt Blumenstiel, Nassim Ait Ali Braham, Conrad M Albrecht, Stefano Maurogiovanni, Paolo Fraccaro

机构 * IBM Research Europe(IBM欧洲研究中心) German Aerospace Center(德国航空航天中心) Julich Supercomputing Centre University of Iceland(朱利奇超级计算中心爱沙尼亚大学)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract)

AI总结 SSL4EO-S12 v1.1通过增加多模态数据和改进数据结构,为预训练大规模基础模型提供了更高效、更全面的地球观测数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00736 2026-02-16 cs.CV 82%

Unifying Multiple Foundation Models for Advanced Computational Pathology

统一多种基础模型以推进高级计算病理学

Wenhui Lei, Yusheng Tan, Anqi Li, Hanyu Chen, Hengrui Tian, Ruiying Li, Zhengqun Jiang, Fang Yan, Xiaofan Zhang, Shaoting Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Washington University in St. Louis(华盛顿大学) University of Science and Technology Beijing(北京科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Department of Surgical Oncology and General Surgery, Key Laboratory of Precision Diagnosis and Treatment of Gastrointestinal Tumours, Ministry of Education, The First Hospital of China Medical University(外科肿瘤科和普通外科,国家教育委员会胃肠道肿瘤精准诊断与治疗重点实验室,中国医科大学第一医院) Shanghai Innovation Institute(上海创新研究院) Sensetime Research(商汤科技研究院)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 Shazam通过在线整合多个预训练病理基础模型,实现高效且可扩展的计算病理学应用,优于单个模型性能。

Comments 50 pages, 5 main figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02603 2026-02-11 eess.IV cs.CV 82%

EchoJEPA: A Latent Predictive Foundation Model for Echocardiography

EchoJEPA:一种用于超声心动图的潜在预测基础模型

Alif Munim, Adibvafa Fallahpour, Teodora Szasz, Ahmadreza Attarpour, River Jiang, Brana Sooriyakanthan, Maala Sooriyakanthan, Heather Whitney, Jeremy Slivnick, Barry Rubin, Wendy Tsang, Bo Wang

机构 * University Health Network(大学健康网络) University of Toronto(多伦多大学) University of Chicago(芝加哥大学) University of California, San Francisco(加州大学旧金山分校) Vector Institute(向量研究所) Cohere Labs(Cohere实验室)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 EchoJEPA通过潜在预测方法在超声心动图中实现鲁棒且可推广的医学AI,显著提升心室功能和压力估计的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06973 2026-02-10 cs.CL cs.AI cs.LG 82%

Does Visual Rendering Bypass Tokenization? Investigating Script-Tokenizer Misalignment in Pixel-Based Language Models

视觉渲染能否绕过分词?探究基于像素的语言模型中脚本-分词器不一致问题

Lucky Susanto, Musa Izzanardi Wijanarko, Khumaisa Nur'aini, Farid Adilazuarda, Alham Fikri Aji, Derry Tanti Wijaya

机构 * Monash University Indonesia(墨尔本大学印尼分校) MBZUAI Boston University(波士顿大学) University of Edinburgh(爱丁堡大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨了基于像素的语言模型中视觉渲染是否能绕过分词约束,发现重新引入文本分词器加剧了分词不一致问题,自定义分词器在性能上表现更优。

Comments Submitted to ARR January

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03269 2026-02-04 q-bio.NC 82%

Systematic review of self-supervised foundation models for brain network representation using electroencephalography

基于脑网络表示的自监督基础模型系统综述:使用脑电图

Hannah Portmann, Yosuke Morishima

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文综述了基于脑电图的自监督基础模型,探讨了其预训练方法、模型架构及下游任务应用,指出需更多多样化数据和标准化评估以提升模型通用性。

Comments 19 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01954 2026-02-03 cs.CV 82%

Beyond Open Vocabulary: Multimodal Prompting for Object Detection in Remote Sensing Images

超越开放词汇:面向遥感图像的目标检测多模态提示

Shuai Yang, Ziyue Huang, Jiaxin Chen, Qingjie Liu, Yunhong Wang

机构 * School of Computer Science and Engineering, Beihang University, Beijing, China(计算机科学与工程学院,北京航空航天大学,中国)

专题命中 预训练与数据 :prompting(title,abstract);pretraining(abstract)

AI总结 RS-MPOD提出了一种多模态开放词汇检测框架,通过整合视觉和文本提示提升遥感图像中目标检测的稳定性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏