arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-06 至 2026-03-06 共收录 72 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 12 篇

2602.09998 2026-03-06 math.AP 50%

Stability and bifurcation analysis in a mechanochemical model of pattern formation

机械化学模型中图案形成的稳定性与分岔分析

Szymon Cygan, Anna Marciniak-Czochra, Finn Münnich, Dietmar Oelz

专题命中 多模态生成 :multimodal(abstract)

AI总结 该研究通过机械化学反馈机制,在无需第二抑制剂的情况下,实现单峰模式的稳健形成。

Comments 32 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 16 篇

2603.05075 2026-03-06 cs.CV 89%

UniM: A Unified Any-to-Any Interleaved Multimodal Benchmark

UniM:一个统一的任意到任意交错多模态基准

Yanlin Li, Minghui Guo, Kaiwen Zhang, Shize Zhang, Yiran Zhao, Haodong Li, Congyue Zhou, Weijie Zheng, Yushen Yan, Shengqiong Wu, Wei Ji, Lei Cui, Furu Wei, Hao Fei, Mong-Li Lee, Wynne Hsu

机构 * NUS(新加坡国立大学) SCUT(上海交通大学) NTU(国立科技大学) NJU(南京大学) Microsoft Research(微软研究院)

专题命中 多模态评测 :multimodal(title,abstract);any-to-any(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 UniM基准通过统一的任意到任意交错多模态数据集和评估套件,评估多模态大语言模型在复杂交错生成任务中的能力与挑战。

Comments 70 pages, 63 figures, 30 tables, CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16333 2026-03-06 cs.CV cs.AI cs.CL 85%

Where is the multimodal goal post? On the Ability of Foundation Models to Recognize Contextually Important Moments

多模态目标时刻在哪里?关于基础模型识别情境重要时刻的能力

Aditya K Surikuchi, Raquel Fernández, Sandro Pezzelle

机构 * Institute for Logic, Language and Computation University of Amsterdam(逻辑、语言与计算研究所 阿姆斯特丹大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文研究了多模态基础模型识别足球比赛中重要时刻的能力,发现现有模型在识别重要子事件时表现欠佳,需改进架构与训练方法以提升跨模态协同能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04763 2026-03-06 cs.CV cs.AI cs.LG 81%

Evaluating GPT-5 as a Multimodal Clinical Reasoner: A Landscape Commentary

评估GPT-5作为多模态临床推理者的有效性:领域评论

Alexandru Florea, Shansong Wang, Mingzhe Hu, Qiang Li, Zach Eidex, Luke del Balzo, Mojtaba Safari, Xiaofeng Yang

机构 * Department of Radiation Oncology, Winship Cancer Institute, Emory University School of Medicine(放射肿瘤科,Winship癌症研究所,埃默里大学医学院) Department of Biomedical Engineering, Georgia Institute of Technology(生物医学工程系,佐治亚理工学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文评估GPT-5在多模态临床推理中的表现,发现其在文本推理和部分视觉问答任务中优于GPT-4o,但在神经放射学和乳腺摄影等专业领域仍显不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05484 2026-03-06 cs.CV 79%

Towards Multimodal Lifelong Understanding: A Dataset and Agentic Baseline

迈向多模态终身理解:一个数据集和代理基准

Guo Chen, Lidong Lu, Yicheng Liu, Liangrui Dong, Lidong Zou, Jixin Lv, Zhenquan Li, Xinyi Mao, Baoqi Pei, Shihao Wang, Zhiqi Li, Karan Sapra, Fuxiao Liu, Yin-Dong Zheng, Yifei Huang, Limin Wang, Zhiding Yu, Andrew Tao, Guilin Liu, Tong Lu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MM-Lifelong数据集和ReMA代理,解决多模态终身理解中的工作记忆瓶颈和全局定位崩溃问题,通过动态内存管理提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07080 2026-03-06 cs.CV 79%

FLAIR-HUB: Large-scale Multimodal Dataset for Land Cover and Crop Mapping

FLAIR-HUB:大规模多模态数据集用于土地覆盖和作物制图

Anatol Garioud, Sébastien Giordano, Nicolas David, Nicolas Gonthier

机构 * Institut national de l’information géographique et forestière (IGN), France(法国国家地理与森林信息研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 FLAIR-HUB是一个大规模多模态数据集,用于提升土地覆盖和作物制图的准确性,通过多模态融合和深度学习模型实现高精度分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03621 2026-03-06 cs.CV 79%

PhysLLM: Harnessing Large Language Models for Cross-Modal Remote Physiological Sensing

PhysLLM:利用大语言模型进行跨模态远程生理传感

Yiping Xie, Bo Zhao, Mingtong Dai, Jian-Ping Zhou, Yue Sun, Tao Tan, Weicheng Xie, Linlin Shen, Zitong Yu

机构 * Shenzhen University(深圳大学) Great Bay University(大鹏大学) National Engineering Laboratory for Big Data System Computing Technology(大数据系统计算技术国家工程实验室) Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息技术重点实验室) Guangdong Medical University(广东医科大学) Southern Medical University (Dongguan People’s Hospital)(南方医科大学(东莞人民医院)) Macao Polytechnic University(澳门理工学院)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV

AI总结 PhysLLM通过结合大语言模型与领域特定的rPPG组件,利用跨模态学习提升远程生理传感的准确性和鲁棒性。

Comments Accepted by International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04670 2026-03-06 cs.AI cs.CL cs.CV 67%

Using Vision + Language Models to Predict Item Difficulty

利用视觉与语言模型预测项目难度

Samin Khan

机构 * Stanford Graduate School of Education(斯坦福大学教育研究生院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 利用视觉与语言模型结合预测数据可视化测试项目难度,通过多模态方法实现更低的误差率,展示了LLMs在心理测量中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05058 2026-03-06 cs.CV cs.AI eess.IV 62%

A 360-degree Multi-camera System for Blue Emergency Light Detection Using Color Attention RT-DETR and the ABLDataset

一种360度多摄像头系统用于蓝色应急灯检测,采用颜色关注RT-DETR和ABLDataset

Francisco Vacalebri-Lloret, Lucas Banchero, Jose J. Lopez, Jose M. Mossi

机构 * Institute of Telecommunications and Multimedia Applications, Universitat Politècnica de València(电信与多媒体应用研究所,巴塞罗那理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种基于颜色关注RT-DETR和ABLDataset的360度多摄像头系统,用于检测应急车辆蓝色灯光,实现高准确率和召回率,提升ADAS和道路安全性能。

Comments 16 pages, 17 figures. Submitted to IEEE Transactions on Intelligent Vehicles

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04452 2026-03-06 cs.CL cs.AI 62%

A unified foundational framework for knowledge injection and evaluation of Large Language Models in Combustion Science

为燃烧科学中的大语言模型知识注入和评估构建统一的基础框架

Zonglin Yang, Runze Mao, Tianhao Wu, Han Li, QingGuo Zhou, Zhi X. Chen

机构 * School of Mechanics and Engineering Science, Peking University(力学与工程科学学院,北京大学) AI for Science Institute(人工智能科学研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出一个统一框架,用于开发燃烧科学专用的大语言模型,通过三阶段知识注入路径提升模型性能。

Comments 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16714 2026-03-06 cs.CV cs.AI 62%

SceneCOT: Eliciting Grounded Chain-of-Thought Reasoning in 3D Scenes

SceneCOT: 在3D场景中引导链式推理

Xiongkun Linghu, Jiangyong Huang, Ziyu Zhu, Baoxiong Jia, Siyuan Huang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SCENECOT框架,通过分解复杂任务并构建视觉线索,首次在3D场景中实现 grounded 链式推理,提升场景理解的推理能力。

Comments Accepted by ICLR 2026. Project page: https://scenecot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03160 2026-03-06 cs.CV cs.AI 62%

SpineBench: A Clinically Salient, Level-Aware Benchmark Powered by the SpineMed-450k Corpus

SpineBench:一种临床显著、层级感知的基准,由SpineMed-450k语料库驱动

Ming Zhao, Wenhui Dong, Yang Zhang, Xiang Zheng, Zhonghao Zhang, Zian Zhou, Yunzhi Guan, Liukun Xu, Wei Peng, Zhaoyang Gong, Zhicheng Zhang, Dachuan Li, Xiaosheng Ma, Yuli Ma, Jianing Ni, Changjiang Jiang, Lixia Tian, Qixin Chen, Kaishun Xia, Pingping Liu, Tongshun Zhang, Zhiqiang Liu, Zhongyan Bi, Chenyang Si, Tiansheng Sun, Caifeng Shan

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 SpineBench通过SpineMed-450k语料库驱动,针对脊柱疾病提供临床显著的层级感知基准,评估模型在多模态数据下的细粒度推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04477 2026-03-06 cs.LG cs.AI 57%

Activity Recognition from Smart Insole Sensor Data Using a Circular Dilated CNN

基于智能鞋垫传感器数据的活动识别使用圆形扩张卷积神经网络

Yanhua Zhao

机构 * Yanhua Zhao

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出了一种基于圆形扩张卷积神经网络的活动识别方法,利用多模态时间序列数据实现高准确率的活动分类。

Comments 4 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01832 2026-03-06 cs.NE cs.AI 57%

Yukthi Opus: A Multi-Chain Hybrid Metaheuristic for Large-Scale NP-Hard Optimization

Yukthi Opus:一种多链混合元启发式算法用于大规模NP难优化

SB Danush Vikraman, Hannah Abigail, Prasanna Kesavraj, Gajanan V Honnavar

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 Yukthi Opus通过结合MCMC、贪心局部搜索和模拟退火,提出了一种多链混合元启发式算法,用于解决大规模NP难优化问题,兼顾解的质量和稳定性。

Comments 22 pages, 9 figures, includes extensive ablation studies and benchmark comparisons

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14654 2026-03-06 cs.CV 57%

ViRC: Enhancing Visual Interleaved Mathematical CoT with Reason Chunking

ViRC: 通过推理分块增强视觉交错数学思维链

Lihong Wang, Liangqi Li, Weiwei Feng, Jiamin Wu, Changtao Miao, Tieru Wu, Rui Ma, Bo Zhang, Zhe Li

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 ViRC通过引入推理分块机制,提升多模态数学任务中的推理能力,实现18.8%的性能提升。

Comments Accepted to CVPR 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04772 2026-03-06 cs.RO cs.SY eess.SY 50%

TEMPO-VINE: A Multi-Temporal Sensor Fusion Dataset for Localization and Mapping in Vineyards

TEMPO-VINE:一个多时序传感器融合数据集用于葡萄园的定位与建图

Mauro Martini, Marco Ambrosio, Judith Vilella-Cantos, Alessandro Navone, Marcello Chiaberge

机构 * Department of Electronics and Communications, Politecnico di Torino(电子与通信系,politecnico di torino大学) University Institute for Engineering Research, Miguel Hernández University(工程研究大学学院,miguel hernández大学)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 TEMPO-VINE数据集通过多时序传感器融合数据,为葡萄园的定位与建图提供全面的基准测试资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00677 2026-03-06 cs.RO 50%

Walk Like Dogs: Learning Steerable Imitation Controllers for Legged Robots from Unlabeled Motion Data

像狗一样行走:从未标记的动作数据中学习可调节的模仿控制器用于四足机器人

Dongho Kang, Jin Cheng, Fatemeh Zargarbashi, Taerim Yoon, Sungjoon Choi, Stelian Coros

机构 * Computational Robotics Lab in the Department of Computer Science, ETH Zurich, Switzerland(计算机科学系计算机器人实验室,瑞士苏黎世联邦理工学院) Robot Intelligence Lab in the Department of Artificial Intelligence, Korea University, South Korea(人工智能系机器人智能实验室,韩国大学)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出了一种从未标记动作数据中学习可调节模仿控制器的方法,通过自动发现行为模式并生成风格一致的运动目标,实现四足机器人自主步态生成与转换。

Comments The supplementary video is available at https://youtu.be/DukyUGNYf5A

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 9 篇

2510.27173 2026-03-06 cs.CE cs.AI cs.LG math.DS 86%

FMint-SDE: A Multimodal Foundation Model for Accelerating Numerical Simulation of SDEs via Error Correction

FMint-SDE:一种多模态基础模型,通过误差校正加速微分方程的数值模拟

Jiaxin Yuan, Haizhao Yang, Maria Cameron

机构 * University of Maryland(马里兰大学)

专题命中 多模态Agent :multimodal(title);multimodal foundation model(title);multi-modal(abstract);分类 cs.AI

AI总结 FMint-SDE通过多模态学习实现误差校正,提升微分方程数值模拟的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14599 2026-03-06 cs.CV cs.AI 84%

CCSD: Cross-Modal Compositional Self-Distillation for Robust Brain Tumor Segmentation with Missing Modalities

CCSD:跨模态组合自蒸馏用于缺失模态的鲁棒脑肿瘤分割

Dongqing Xie, Yonghuang Wu, Zisheng Ai, Jun Min, Zhencun Jiang, Shaojin Geng, Lei Wang

机构 * Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(上海智能自主系统研究院,同济大学) College of Biomedical Engineering, Fudan University(生物医学工程学院,复旦大学) School of Medicine, Tongji University(医学院,同济大学) College of Information Engineering, China Jiliang University(信息工程学院,中国嘉兴大学)

专题命中 多模态Agent :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 CCSD通过跨模态组合自蒸馏方法,提升在缺失模态下的脑肿瘤分割鲁棒性与泛化能力。

Comments 29 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19255 2026-03-06 cs.LG cs.AI 83%

VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use

VTool-R1: 通过在多模态工具使用上的强化学习使VLMs学会通过图像思考

Mingyuan Wu, Jingcheng Yang, Jize Jiang, Meitang Li, Kaizhuo Yan, Hanchao Yu, Minjia Zhang, Chengxiang Zhai, Klara Nahrstedt

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan Ann Arbor(密歇根大学安娜堡分校) Independent Researcher(独立研究者)

专题命中 多模态Agent :multimodal(title,abstract);multi-modal(abstract);分类 cs.AI

AI总结 VTool-R1通过强化学习训练视觉语言模型生成多模态思考链,提升其通过图像进行推理的能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04819 2026-03-06 cs.RO cs.AI cs.LG 70%

On the Strengths and Weaknesses of Data for Open-set Embodied Assistance

关于数据在开放集具身助益中的优势与劣势

Pradyumna Tambwekar, Andrew Silva, Deepak Gopinath, Jonathan DeCastro, Xiongyi Cui, Guy Rosman

专题命中 多模态Agent :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 本文研究了多模态基础模型在开放集辅助任务中的泛化能力,通过合成数据集评估模型在新用户行为和新配置中的表现,揭示了辅助数据集设计对模型性能的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05487 2026-03-06 cs.RO 50%

Observing and Controlling Features in Vision-Language-Action Models

观察和控制视觉-语言-动作模型中的特征

Hugo Buurmeijer, Carmen Amo Alonso, Aiden Swann, Marco Pavone

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出通过特征可观察性和可控性研究,实现对视觉-语言-动作模型的在线适应与行为引导,提升其与用户需求的实时对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05019 2026-03-06 cs.HC 50%

Haptics in Cognition: Disruptor or Enabler of Memory?

触觉在认知中的作用:记忆的破坏者还是促进者?

Bibeg Limbu, Irene-Angelica Chounta

专题命中 多模态Agent :multimodal(abstract)

AI总结 本研究探讨触觉敏感度和运动强度对记忆的影响,发现增加书写压力略微降低即时回忆,但手套使用无明显影响,揭示了身体互动与认知表现之间的复杂关系。

Comments 22 Pages (including references), Book chapter

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04754 2026-03-06 cs.HC 50%

VizCrit: Exploring Strategies for Displaying Computational Feedback in a Visual Design Tool

VizCrit: 探索在视觉设计工具中展示计算反馈的策略

Mingyi Li, Mengyi Chen, Sarah Luo, Yining Cao, Haijun Xia, Maitraye Das, Steven P. Dow, Jane L. E

专题命中 多模态Agent :multi-modal(abstract)

AI总结 VizCrit通过算法问题检测和视觉注释生成,探索在视觉设计工具中实现可操作反馈的策略,发现以解决方案为中心的反馈能提升初学者的创造力感知和设计质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04705 2026-03-06 cs.RO cs.HC 50%

LEGS-POMDP: Language and Gesture-Guided Object Search in Partially Observable Environments

LEGS-POMDP:语言和手势引导的在部分可观测环境中的对象搜索

Ivy Xiao He, Stefanie Tellex, Jason Xinyu Liu

机构 * Brown University(布朗大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 LEGS-POMDP通过整合语言、手势和视觉信息,在部分可观测环境中实现高效的开放世界对象搜索,显著提升了多模态感知和不确定性处理能力。

Comments 10 pages, 8 figures, accepted at ACM/IEEE International Conference on Human-Robot Interaction (HRI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21161 2026-03-06 cs.RO 50%

MarketGen: A Scalable Simulation Platform with Auto-Generated Embodied Supermarket Environments

MarketGen: 一个可扩展的仿真平台,具有自动生成的具身超市环境

Xu Hu, Yiyang Feng, Junran Peng, Jiawei He, Liyi Chen, Wei Sui, Chuanchen Luo, Xucheng Yin, Qing Li, Zhaoxiang Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) University of Science and Technology Beijing(北京科技大学) NLPR, MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) XYZ Embodied AI(XYZ具身AI) Shandong University(山东大学) Linketic D-Robotics

专题命中 多模态Agent :multi-modal(abstract)

AI总结 MarketGen通过自动生成复杂超市环境,为评估超市代理提供了一个新的基准,加速了复杂商业应用中具身AI的研究。

Comments Project Page: https://xuhu0529.github.io/MarketGen

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态训练与对齐 10 篇

2603.04890 2026-03-06 cs.LG cs.AI cs.CV 84%

FedAFD: Multimodal Federated Learning via Adversarial Fusion and Distillation

FedAFD: 通过对抗融合与蒸馏实现多模态联邦学习

Min Tan, Junchao Ma, Yinfu Feng, Jiajun Ding, Wenwen Pan, Tingting Han, Qian Zheng, Zhenzhong Kuang, Zhou Yu

机构 * Zhejiang Key Laboratory of Space Information Sensing and Transmission, Hangzhou Dianzi University(浙江空间信息感知与传输重点实验室,杭州电子大学) Laboratory of Complex Systems Modeling and Simulation, School of Computer Science and Technology, Hangzhou Dianzi University(复杂系统建模与仿真实验室,计算机科学与技术学院,杭州电子大学) Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 FedAFD通过对抗融合与蒸馏方法,解决多模态联邦学习中的模态差异、任务差异和模型异质性问题,提升客户端与服务器的学习性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22695 2026-03-06 cs.DC 82%

Modality Inflation: Energy Characterization and Optimization Opportunities for MLLM Inference

模态膨胀:MLLM推理的能量特性与优化机会

Mona Moghadampanah, Adib Rezaei Shahmirzadi, Farhana Amin, Dimitrios S. Nikolopoulos

专题命中 多模态训练与对齐 :MLLM(title,abstract);multimodal(abstract)

AI总结 本文研究了多模态大语言模型推理中的能量特性与优化机会,发现模态膨胀导致额外能耗,并提出阶段级DVFS优化方法以提升能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04887 2026-03-06 cs.CV 79%

Federated Modality-specific Encoders and Partially Personalized Fusion Decoder for Multimodal Brain Tumor Segmentation

联邦模态特定编码器和部分个性化融合解码器用于多模态脑肿瘤分割

Hong Liu, Dong Wei, Qian Dai, Xian Wu, Yefeng Zheng, Liansheng Wang

机构 * National Institute for Data Science in Health and Medicine(国家医学数据科学研究院) Department of Computer Science at School of Informatics(信息学院计算机科学系) Jarvis Research Center(Jarvis研究中心) Medical Artificial Intelligence Lab(医学人工智能实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出FedMEPD框架,通过联邦模态特定编码器和部分个性化融合解码器,解决多模态医学图像分析中的模态间异质性和个性化需求问题。

Comments Medical Image Analysis 2025. arXiv admin note: substantial text overlap with arXiv:2403.11803

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04562 2026-03-06 cs.CV cs.LG 79%

Fusion and Grouping Strategies in Deep Learning for Local Climate Zone Classification of Multimodal Remote Sensing Data

深度学习中多模态遥感数据局部气候区分类的融合与分组策略

Ancymol Thomas, Jaya Sreevalsan-Nair

机构 * Graphics-Visualization-Computing Lab, International Institute of Information Technology Bangalore, Karnataka 560100, India(图形可视化计算实验室,国际信息学院班加罗尔,卡纳塔克邦560100,印度)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究提出了一种基于深度学习的多模态遥感数据局部气候区分类方法,通过融合与分组策略提升分类准确率,最终达到76.6%的整体准确率。

Comments 25 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏