arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6878 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6878 篇

2605.01061 2026-05-05 cs.MM 79%

PRISM: Exposing and Resolving Spurious Isolation in Federated Multimodal Continual Learning

PRISM:揭示并解决联邦多模态持续学习中的虚假隔离

Beining Wu, Zihao Ding, Jun Huang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出PRISM方法,通过维护专家梯度子空间基底和重新解释MoE路由,解决联邦多模态持续学习中路由隔离失效、遗忘积累和梯度冲突问题,实验表明其在多个数据集上优于现有基线。

Comments submitted to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00973 2026-05-05 cs.LG cs.AI eess.SP 79%

Physiology-Aware Masked Cross-Modal Reconstruction for Biosignal Representation Learning

生理感知的跨模态掩码重建用于生物信号表示学习

Hao Zhou, Simon A. Lee, Cyrus Tanade, Keum San Chun, Juhyeon Lee, Migyeong Gwak, Megha Thukral, Justin Sung, Eugene Hwang, Mehrab Bin Morshed, Li Zhu, Viswam Nathan, Md Mahbubur Rahman, Subramaniam Venkatraman, Sharanya Arcot Desai

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Samsung Research America(三星美国研究院)

专题命中 多模态训练与对齐 :cross-modal(title);multimodal(abstract);分类 cs.AI

AI总结 本文提出xMAE框架,通过跨模态掩码重建捕捉生物信号的时序关系,提升表示学习效果,在15/19下游任务中优于基线模型。

Comments Proceedings of the 43rd International Conference on Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10554 2026-05-05 cs.CV 79%

Grounding Everything in Tokens for Multimodal Large Language Models

基于令牌的多模态大语言模型的 grounding

Xiangxuan Ren, Zhongdao Wang, Liping Hou, Pin Tang, Guoqing Wang, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence(人工智能混合专家模型关键实验室) AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院) Central Research Institute, Huawei(华为中央研究院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出GETok方法,通过整合可学习的令牌词汇提升多模态大语言模型在2D空间中的物体定位能力,实验显示其在多种指引用例任务中表现更优。

Comments 19 pages, 16 figures, 12 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10320 2026-05-05 cs.CV eess.IV 79%

Boosting Multimodal Remote Sensing Image Classification with Transformer-based Heterogeneously Salient Graph Representation

通过基于变换器的异质显著图表示提升多模态遥感图像分类

Jiaqi Yang, Bo Du, Rong Liu, Zhu Mao, Liangpei Zhang

机构 * Department of Forest Sciences, University of Helsinki(赫尔辛基大学森林科学系) School of Computer Science, National Engineering Research Center for Multimedia Software, Institute of Artificial Intelligence, and Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, Wuhan, China(武汉大学计算机学院、国家多媒体软件工程研究中心、人工智能研究院、湖北省多媒体与网络通信工程重点实验室,武汉,中国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出基于变换器的异质显著图表示方法,解决多模态遥感图像分类中特征表示不充分、长距离依赖建模复杂及过拟合问题,通过异质图编码器、多卷积调节器和均值前向策略提升分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04465 2026-05-04 cs.AI 79%

The Topology of Multimodal Fusion: Why Current Architectures Fail at Creative Cognition

多模态融合的拓扑学:为何当前架构在创造性认知上失败

Xiujiang Tan

机构 * Guangzhou Academy of Fine Arts(广州美术学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文指出当前多模态AI架构存在拓扑限制而非参数限制,通过哲学、认知科学和数学三个支柱提出多模态融合的拓扑学框架,提出UOO实现、ANALOGY-MM基准和META-TOP三阶基准,通过实验路线验证拓扑同构性。

Comments Expanded 11 technical improvements; 5 reference corrections; Appendix B pseudocode added. ~43 pages, 5 figures. Chinese philosophical terms romanized. Companion monograph available separately

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26067 2026-04-30 cs.CV 79%

RADIO-ViPE: Online Tightly Coupled Multi-Modal Fusion for Open-Vocabulary Semantic SLAM in Dynamic Environments

RADIO-ViPE:面向动态环境的在线紧密耦合多模态融合用于开放词汇语义SLAM

Zaid Nasser, Mikhail Iumanov, Tianhao Li, Maxim Popov, Jaafar Mahmoud, Sergey Kolyubin

机构 * Biomechatronics and Energy-Efficient Robotics (BE2R) Lab, ITMO University(生物机电学与高效能机器人实验室,ITMO大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 RADIO-ViPE通过在线多模态融合实现动态环境中开放词汇语义SLAM,无需校准RGB-D输入,结合视觉与语言嵌入提升地图一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12052 2026-04-29 cs.CV 79%

Task-Driven Prompt Learning: A Joint Framework for Multi-modal Cloud Removal and Segmentation

任务驱动的提示学习:多模态云去除与分割的联合框架

Zaiyan Zhang, Jie Li, Shaowei Shi, Qiangqiang Yuan

机构 * Wuhan University(武汉大学)

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出TDP-CR框架,通过任务驱动的多模态方法联合实现云去除与土地覆盖分割,解决云遮挡导致的语义不一致问题,提升分析级数据质量。

Comments Accepted by IGARSS 2026 Conference (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14245 2026-04-29 cs.LG cond-mat.mtrl-sci cs.AI cs.CE q-bio.BM 79%

Curriculum-guided multimodal representation learning enables generalizable prediction of nanomaterial-protein interactions

基于课程引导的多模态表示学习可实现纳米材料-蛋白质相互作用的通用预测

Hengjie Yu, Kenneth A. Dawson, Haiyun Yang, Shuya Liu, Yan Yan, Yaochu Jin

机构 * School of Engineering, Westlake University(西湖大学工程学院) Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖研究所在先进科技研究院) Centre for BioNano Interactions, School of Chemistry, University College Dublin(都柏林大学学院化学系生物纳米相互作用中心) School of Biomolecular and Biomedical Science, UCD Conway Institute of Biomolecular and Biomedical Research(都柏林大学学院生物分子与生物医学科学系,康沃利斯生物分子与生物医学研究学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出CuMMI模型,通过多阶段课程学习和大规模数据集,实现纳米材料-蛋白质相互作用的通用预测,验证了其在不同数据集上的鲁棒性和可迁移性。

Comments 36 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23753 2026-04-28 cs.AI cs.HC cs.LG 79%

Modeling Induced Pleasure through Cognitive Appraisal Prediction via Multimodal Fusion

通过多模态融合进行诱导愉悦的认知评估预测建模

Nastaran Dab, Raziyeh Zall, Mohammadreza Kangavari

机构 * Iran University of Science and Technology(伊朗科学技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种多模态融合模型,通过认知评估变量预测视频诱导的愉悦,解决标签噪声、语义鸿沟、数据稀缺和解释性不足等问题,实验验证了模型在检测视频诱导愉悦方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28717 2026-04-27 eess.AS 79%

Can Hierarchical Cross-Modal Fusion Predict Human Perception of AI Dubbed Content?

层次化跨模态融合能否预测人工智能 dubbed 内容的人类感知?

Ashwini Dasare, Nirmesh Shah, Ashishkumar Gudmalwar, Pankaj Wasnik

专题命中 多模态训练与对齐 :cross-modal(title);multimodal(abstract);分类 eess.AS

AI总结 本文提出层次化跨模态架构,整合音频、视频和文本信息,通过轻量LoRA适配器实现多模态高效微调,利用主动学习优化客观指标,实现对AI dubbed内容的可扩展自动评估。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14044 2026-04-23 cs.CV 79%

Weather-R1: Logically Consistent Reinforcement Fine-Tuning for Multimodal Reasoning in Meteorology

Weather-R1: 逻辑一致的强化微调用于气象中的多模态推理

Kaiyu Wu, Pucheng Han, Hualong Zhang, Naigeng Wu, Keze Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Meteorological Observatory(广东省气象局)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Weather-R1,首个具备逻辑忠实性的气象多模态推理VLM,通过逻辑一致性奖励解决强化微调中的自相矛盾推理问题,并在WeatherQA基准上提升9.8个百分点。

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Barcelona, Spain, 2026, pp. 4851-4855

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20755 2026-04-23 cs.AI cs.LG 79%

V-tableR1: Process-Supervised Multimodal Table Reasoning with Critic-Guided Policy Optimization

V-tableR1:基于过程监督的多模态表格推理与批评引导的策略优化

Yubo Jiang, Yitong An, Xin Yang, Abudukelimu Wuerkaixi, Xuxin Cheng, Fengying Xie, Zhiguo Jiang, Cao Liu, Ke Zeng, Haopeng Zhang

机构 * School of Astronautics Beihang University(北航航天学院) Longcat Interaction Team Meituan(美团长猫交互团队) Tianmushan Laboratory Beihang University(北航天门实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 V-tableR1通过过程监督强化学习框架,利用表格的确定性网格结构,提升多模态大语言模型的推理能力,通过批评引导策略优化方法,实现更严谨的逻辑推导,取得开放源代码模型在复杂表格基准上的最佳性能。

Comments 15 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19383 2026-04-22 cond-mat.mtrl-sci cs.AI 79%

Multimodal Transformer for Sample-Aware Prediction of Metal-Organic Framework Properties

多模态Transformer用于金属有机框架性质的样本感知预测

Seunghee Han, Jaewoong Lee, Jihan Kim

机构 * Department of Chemical and Biomolecular Engineering, Korea Advanced Institute of Science and Technology(化学与生物分子工程系,韩国科学技术院) Department of Materials Science and Engineering, Korea Advanced Institute of Science and Technology(材料科学与工程系,韩国科学技术院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出EXIT模型,结合MOFid与X射线衍射数据,通过预训练和微调提升对MOF表面面积和孔体积的预测性能,强调实验表征在多孔材料信息学中的价值。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19264 2026-04-22 cs.CV 79%

DR-MMSearchAgent: Deepening Reasoning in Multimodal Search Agents

DR-MMSearchAgent:多模态搜索代理中的深度推理

Shengqin Wang, Wentao Yan, Huichi Zhou, Yihang Chen, Kun Shao, Zhizhong Zhang, Yuan Xie

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) East China Normal University(东华大学) Shanghai Innovation Institute(上海创新研究院) University College London(伦敦大学学院) Independent Researcher(独立研究者) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出DR-MMSearchAgent框架,通过结构接近性从完整批处理轨迹中提取优势信号,提升不同长度轨迹的生成能力,并采用差异化高斯奖励动态校准交互容忍度,以提高信息可靠性并减少冗余。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17800 2026-04-21 cs.RO cs.CV 79%

ReFineVLA: Multimodal Reasoning-Aware Generalist Robotic Policies via Teacher-Guided Fine-Tuning

ReFineVLA: 通过教师引导微调实现多模态推理感知的通用机器人策略

Tuan Van Vo, Tan Q. Nguyen, Khang Nguyen, Nhat Xuan Tran, Duy H. M. Nguyen, An T. Le, Ngo Anh Vien, Minh Nhat Vu

机构 * VinRobotics University of Texas at Arlington(德克萨斯大学阿灵顿分校) Max Planck Research School for Intelligent Systems (IMPRS-IS)(智能系统Max Planck研究学校) Intelligent Autonomous Systems Lab(智能自主系统实验室) TU Darmstadt(德累斯顿技术大学) Automation & Control Institute(自动化与控制研究所) TU Wien(维也纳技术大学) Austrian Institute of Technology (AIT)(奥地利技术研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出ReFineVLA框架,通过教师引导的推理增强数据集微调机器人策略,提升多模态推理能力与泛化性能,在模拟任务中取得最佳表现。

Comments arXiv admin note: substantial text overlap with arXiv:2505.19080

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20249 2026-04-21 cs.LG cs.CV eess.IV 79%

Unified Multimodal Brain Decoding via Cross-Subject Soft-ROI Fusion

通过跨受体软ROI融合实现统一的多模态脑解码

Xuanyu Hu

机构 * The University of Manchester, Manchester, UK(曼彻斯特大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出BrainROI模型,通过软ROI融合和可解释提示优化,提升跨受体脑解码的泛化能力和描述质量,在NSD数据集上取得领先结果。

Comments 15 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17122 2026-04-21 cs.CV 79%

Multimodal Fusion of Histopathology Images and Electronic Health Records for Early Breast Cancer Diagnosis

多模态融合组织病理图像与电子健康记录用于早期乳腺癌诊断

Aditya Shribhagwan Khandelwal, Mohammad Samar Ansari, Asra Aslam

机构 * University of Sheffield(谢菲尔德大学) University of Chester(切斯特大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出整合BreCaHAD数据集的病理特征与MIMIC-IV的临床数据的多模态框架,通过训练单模态模型和中间融合模型提升乳腺癌早期诊断的准确性和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16615 2026-04-21 cs.LG cs.AI 79%

Beyond Feature Fusion: Contextual Bayesian PEFT for Multimodal Uncertainty Estimation

超越特征融合:基于上下文的贝叶斯PEFT用于多模态不确定性估计

Habibeh Naderi, Behrouz Haji Soleimani, Stan Matwin

机构 * Dalhousie University(达尔豪斯大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出CoCo-LoRA,一种结合音频上下文的多模态不确定性感知参数高效微调方法,通过在低秩空间中条件化上下文变分后验,实现对音频等外部因素的不确定性建模,提升语音应用的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22185 2026-04-17 cs.CV 79%

Beyond Augmentation: Cross-Modal Transformer Fusion with Bi-directional Attention for Low-Data Aneurysm Screening

超越增强:基于双向注意力的跨模态Transformer融合用于低数据动脉瘤筛查

Antara Titikhsha, Divyanshu Tak

机构 * Carnegie Mellon University(卡内基梅隆大学) Artificial Intelligence in Medicine (AIM) Program(医学人工智能(AIM)项目) Mass General Brigham(马萨诸塞总医院) Harvard Medical School(哈佛医学院) Department of Radiation Oncology(放射肿瘤科) Dana-Farber Cancer Institute(达纳-法伯癌症研究所) Brigham and Women’s Hospital(布里洛妇产科医院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出CMTF-Net,通过跨模态目标融合框架实现解剖结构化的动脉瘤筛查,采用14个血管区域独立监督,提升低数据场景下的检测精度与可解释性。

Comments We had major improvements in this second draft. Please refer to this version only

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08291 2026-04-15 cs.AI 79%

A Survey of Multimodal Mathematical Reasoning: From Perception, Alignment to Reasoning

多模态数学推理综述:从感知、对齐到推理

Tianyu Yang, Sihong Wu, Yilun Zhao, Zhenwen Liang, Lisen Dai, Chen Zhao, Minhao Cheng, Arman Cohan, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) Yale University(耶鲁大学) Columbia University(哥伦比亚大学) New York University(纽约大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文综述了多模态数学推理的研究进展,探讨了如何从多模态输入中提取信息、对齐文本与视觉信息、进行推理以及评估推理过程的正确性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11992 2026-04-15 cs.RO cs.CV 79%

ReefMapGS: Enabling Large-Scale Underwater Reconstruction by Closing the Loop Between Multimodal SLAM and Gaussian Splatting

ReefMapGS:通过多模态SLAM与高斯点云之间的闭环实现大规模水下重建

Daniel Yang, Jungseok Hong, John J. Leonard, Yogesh Girdhar

机构 * Massachusetts Institute of Technology(麻省理工学院) Woods Hole Oceanographic Institution(伍兹霍尔海洋研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出ReefMapGS框架,通过多模态传感器数据与高斯点云结合,实现水下复杂场景的增量重建与全局轨迹优化,展示无COLMAP的3D重建与高精度AUV轨迹估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11835 2026-04-15 cs.LG cs.AI 79%

Schema-Adaptive Tabular Representation Learning with LLMs for Generalizable Multimodal Clinical Reasoning

基于LLM的Schema自适应表格表示学习用于通用多模态临床推理

Hongxi Mao, Wei Zhou, Mengting Jia, Tao Fang, Huan Gao, Bin Zhang, Shangyang Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Boston University(波士顿大学) University of Southern California(南加州大学) GDIIST Renyixun Health Technology Co., Ltd.(仁心迅健康科技有限公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出基于LLM的Schema自适应表格表示学习方法,通过将结构化变量转换为语义自然语言并编码,实现零样本跨schema对齐,结合表格和MRI数据在多模态 dementia 诊断中取得优于临床基准的性能。

Comments 11 pages, 4 figures

Journal ref ACL 2026, Main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14543 2026-04-14 cs.CV 79%

Exploring Cross-Modal Flows for Few-Shot Learning

探索跨模态流用于少样本学习

Ziqi Jiang, Yanghao Wang, Long Chen

机构 * Department of CSE, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出跨模态流匹配对齐(FMA)方法,通过多步调整提升跨模态对齐精度与鲁棒性,在多种基准和模型上均取得显著性能提升。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09743 2026-04-14 eess.IV cs.CV 79%

Search-MIND: Training-Free Multi-Modal Medical Image Registration

Search-MIND: 无需训练的多模态医学图像配准

Boya Wang, Ruizhe Li, Chao Chen, Xin Chen

机构 * Lab for Uncertainty in Data and Decision Making (LUCID), Nottingham Biomedical Research Centre (BRC), School of Medicine, University of Nottingham, UK(英国诺丁汉大学医学院诺丁汉生物医学研究中心(BRC)数据与决策不确定性实验室(LUCID))

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出Search-MIND,一种无需训练的迭代优化框架,通过粗到细策略和两种新损失函数提升多模态医学图像配准的稳定性与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26641 2026-04-13 cs.CV 79%

All You Need for Object Detection: From Pixels, Points, and Prompts to Next-Gen Fusion and Multimodal LLMs/VLMs in Autonomous Vehicles

自动驾驶所需的所有内容:从像素、点和提示到下一代融合和多模态LLM/VLMs

Sayed Pedram Haeri Boroujeni, Niloufar Mehrabi, Hazim Alzorgan, Mahlagha Fazeli, Abolfazl Razi

机构 * Department One(第一部门) Department Two(第二部门)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文探讨自动驾驶中物体检测的最新进展,重点介绍多模态感知、视觉语言模型和大语言模型等新兴方法,分析传感器融合策略及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07141 2026-04-09 cs.CV 79%

USCNet: Transformer-Based Multimodal Fusion with Segmentation Guidance for Urolithiasis Classification

USCNet:基于Transformer的多模态融合与分割引导的尿路结石分类

Changmiao Wang, Songqi Zhang, Yongquan Zhang, Yifei Wang, Liya Liu, Nannan Li, Xingzhi Li, Jiexin Pan, Yi Jiang, Xiang Wan, Hai Wang, Ahmed Elazab

机构 * Shenzhen Research Institute of Big Data(深圳市大数据研究院) Zhejiang University of Finance and Economics(浙江财经大学) Anhui University of Finance and Economics(安徽财经大学) The Second Affiliated Hospital of Chinese University of Hong Kong (Longgang District People’s Hospital of Shenzhen)(香港中文大学第二附属医院(深圳市龙岗区人民医院))

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 USCNet通过融合CT图像与电子病历数据,利用Transformer架构实现尿路结石的预手术分类,提出动态损失函数平衡分割与分类任务,实验表明其分类效果优于现有方法。

Comments Accepted by IEEE Journal of Biomedical and Health Informatics. Early Access

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05748 2026-04-08 cs.CV 79%

SVC 2026: the Second Multimodal Deception Detection Challenge and the First Domain Generalized Remote Physiological Measurement Challenge

SVC 2026: 第二届多模态欺骗检测挑战赛及首个领域通用远程生理测量挑战

Dongliang Zhu, Zhiyi Niu, Bo Zhao, Jiajian Huang, Shuo Ye, Xun Lin, Hui Ma, Taorui Wang, Jiayu Zhang, Chunmei Zhu, Junzhe Cao, Yingjie Ma, Rencheng Song, Albert Clapés, Sergio Escalera, Dan Guo, Zitong Yu

机构 * Wuhan University(武汉大学) Great Bay University(大湾区大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Sun Yat-sen University(中山大学) Hefei University of Technology(合肥工业大学) University of Barcelona(巴塞罗那大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出SVC 2026挑战赛,旨在通过多模态欺骗检测和远程脉搏波测速估计任务,推动对细微视觉信号的鲁棒表示学习研究。

Comments Accepted by the SVC workshop @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05632 2026-04-08 cs.CV 79%

SGANet: Semantic and Geometric Alignment for Multimodal Multi-view Anomaly Detection

SGANet:语义与几何对齐用于多模态多视角异常检测

Letian Bai, Chengyu Tao, Juan Du

机构 * Smart Manufacturing Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)智能制造学域) College of Mechanical and Vehicle Engineering, Hunan University(湖南大学机械与运载工程学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 SGANet通过语义与几何对齐方法,提升多模态多视角异常检测的性能,实验表明其在SiM3D和Eyecandies数据集上达到最先进的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05629 2026-04-08 cs.CV 79%

A Unified Foundation Model for All-in-One Multi-Modal Remote Sensing Image Restoration and Fusion with Language Prompting

一种统一的多模态遥感图像修复与融合的全功能基础模型 with语言提示

Yongchuan Cui, Peng Liu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出LLaRS模型,通过最优传输和混合专家层实现多模态遥感图像修复与融合,结合大规模数据集提升模型性能与迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04999 2026-04-08 cs.LG cs.AI 79%

PRIME: Prototype-Driven Multimodal Pretraining for Cancer Prognosis with Missing Modalities

PRIME:面向癌症预后分析的原型驱动多模态预训练方法,适用于缺失模态

Kai Yu, Shuang Zhou, Yiran Song, Zaifu Zhan, Jie Peng, Kaixiong Zhou, Tianlong Chen, Feng Xie, Meng Wang, Huazhu Fu, Mingquan Lin, Rui Zhang

机构 * University of Minnesota(明尼苏达大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) North Carolina State University(北卡罗来纳州立大学) National University of Singapore(新加坡国立大学) Institute of High Performance Computing, Agency for Science, Technology and Research(高性能计算研究所,新加坡科技研究局)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 PRIME通过原型记忆银行实现缺失模态下的多模态自监督预训练,提升在碎片化临床数据中的预测性能,实现结构对齐和鲁棒性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏