arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3020 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 530 篇

2608.10316 2026-08-12 cs.CV cs.LG cs.MM 新提交 81%

UniMod: Enhancing Multi-Modal Medical Diagnosis through Cross-Modality and Within-Modality Alignment

UniMod:通过跨模态与模态内对齐增强多模态医学诊断

Zijian Gu, Weikai Lin, Shuang Zhou, Zihan Chen, Song Wang

机构 * University of Central Florida(中佛罗里达大学) University of Rochester(罗切斯特大学) Harvard Medical School(哈佛医学院) University of Virginia(弗吉尼亚大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.MM

AI总结 UniMod框架通过要求各模态独立预测诊断缓解多模态医学诊断的捷径学习,添加跨模态与模态内对齐,在两个数据集上优于基线方法,还可扩展至多标签5分类诊断。

Comments Accepted to ACM Multimedia 2026 (MM '26). 10 pages, 7 figures, 5 tables. Code: https://github.com/futurespyhi/UniMod

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08676 2026-08-11 cs.CV cs.AI 新提交 81%

UniSpace: Unified Visual Representation and Scalable Multimodal Modeling

UniSpace:统一视觉表示与可扩展多模态建模

Jinbo Yan, Limeng Qiao, Jie Qin, Junyan He, Feize Wu, Guanglu Wan

机构 * Meituan(美团)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出 UniSpace,通过 Patch Reparameterization 改进语义 ViT,构建 80 亿参数的 Transformer 专家混合模型,实现同一视觉空间内的理解、生成与编辑,提升重建效果,支持文本到图像生成和指令式图像编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02092 2026-08-04 cs.CV cs.MM 新提交 81%

Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion

基于空间掩码与通道融合的深度多模态融合检测

Guandi Wang, Ming Li, Yunsen Xing, Junle Liu

机构 * KTH Royal Institute of Technology(KTH皇家理工学院) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文针对现有多模态融合检测的过拟合问题,提出Attention-Driven Complementarity Resampling框架,通过语义掩码交换与可学习通道竞争实现跨模态目标检测的性能提升,在多数据集上取得了有竞争力的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28154 2026-07-31 cs.CV cs.AI 新提交 81%

OPLD: On-Policy Latent Distillation for Multimodal Reasoning

OPLD:用于多模态推理的在线策略隐层蒸馏

Shoutai Zhu, Tianyang Xu, Bin Sun, Mingyuan Xu, Yu Liu, Qinzhen Guo

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出OPLD框架,将多模态CoT的推理能力迁移至隐层表征,经多模态基准实验,其性能优于现有隐层推理方法,达到当前最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26743 2026-07-30 cs.CV cs.AI 新提交 81%

Multimodal fusion of visual and morphometric features for avian bone classification

用于鸟类骨骼分类的视觉与形态计量特征多模态融合

Nevio Dubbini, Lisa Yeomans, Marco Pavia, Ramazan Parmaksiz, Ayse Atas Hooglugt, Gabriele Gattiglia, Beatrice Demarchi

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出结合卷积神经网络图像分析与骨计量测量的多模态框架,用于鸟类骨骼分类,在骨骼类型分类准确率达86%,科级分类Top-1准确率51%、Top-3准确率75%,为AI辅助动物考古识别建立了方法学基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26596 2026-07-30 cs.CV cs.AI 新提交 81%

Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution

解耦视觉处理:通过模态特定Transformer替换实现高效多模态适配

Mingkuan Feng, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究针对多模态大语言模型视觉指令微调成本高的问题,提出解耦视觉处理框架,替换预训练大语言模型上层解码器为轻量Transformer块,仅训练该块即可在多个基准上实现竞争力性能,降低了计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24683 2026-07-28 cs.CV cs.AI cs.LG 新提交 81%

Co-Learning for Missing Arbitrary Modalities in Multi-modal Classification

多模态分类中用于缺失任意模态的协同学习

Francisco Mena, Dino Ienco, Roberto Interdonato, Cassio F. Dantas, Simon Besnard

机构 * GFZ Helmholtz Center for Geosciences(德国波茨坦地学研究中心亥姆霍兹中心) INRAE, UMR TETIS, University of Montpellier(法国蒙彼利埃大学农业环境与生态研究院、蒙彼利埃大学TETIS联合研究单位) INRIA, EVERGREEN, University of Montpellier(法国蒙彼利埃大学信息与自动化研究所、EVERGREEN实验室) CIRAD, UMR TETIS, University of Montpellier(法国蒙彼利埃大学国际农业研究磋商组织、蒙彼利埃大学TETIS联合研究单位)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对多模态分类中因操作约束导致训练和推理时模态可用性不一致、存在缺失任意模态的问题,提出多模态协同学习框架,引入特征和决策层面利用信息的两种方法,实验证明在不同缺失模态条件下有显著鲁棒性提升。

Comments Accepted at Discovery Science 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18336 2026-07-22 cs.MM cs.CL cs.LG 新提交 81%

EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation

EmoEUS:对话中多模态情感识别的不确定性监督

Zilong Huang, Kong Aik Lee, Junjie Li, Zhe Li, Man-Wai Mak

机构 * Dept. of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系) Speech, Language, and Cognition Laboratory, The University of Hong Kong(香港大学语音、语言与认知实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.MM

AI总结 研究对话中多模态情感识别,提出EmoEUS框架,通过动态加权模态执行不确定性感知多模态融合,并引入显式监督损失,实验证明该框架优于现有方法。

Comments Accept by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15380 2026-07-20 cs.CL cs.AI 新提交 81%

Large Language Models as Unified Multimodal Learners for Clinical Prediction

作为临床预测统一多模态学习者的大语言模型

Ajay Madhavan Ravichandran, Bilgin Osmandoja, Klemens Budde, Klaus Netter, Tobias Strapatsas, Aljoscha Burchardt, Sebastian Möller, Roland Roller

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Charité Universitätsmedizin Berlin(柏林夏里特大学医学中心) DNC Information Management GmbH(DNC信息管理有限公司) Klinik für Akut- und Notfallmedizin, Asklepios Klinikum Harburg(哈堡阿斯克勒庇俄斯医院急性与急诊医学科) Technical University Berlin(柏林工业大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究探讨利用大语言模型进行临床预测,提出将不同模态患者数据转为自然语言序列,端到端微调预训练语言模型的方法,经三个临床任务评估,该方法匹配或超越多模态基线,优于临床梯度提升系统,降低系统复杂性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11434 2026-07-14 cs.CL cs.CV 新提交 81%

Direct Image-to-Modern Vietnamese Translation of Han-Nom Manuscripts via Multimodal RLHF Preference Alignment

通过多模态基于人类反馈的强化学习偏好对齐实现汉喃手稿到现代越南语的直接图像翻译

Thi Kim Trang Vo, Nghia Hieu Nguyen, Ha Minh Tan

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 针对汉喃手稿到现代越南语翻译的挑战,提出多模态基于人类反馈的强化学习偏好对齐框架,结合四个流生成越南语,比较PPO、DPO和KTO,结果显示各有优劣,且多模态偏好优化能补充监督学习提升翻译质量。

Comments Accepted Paper at 2026 International Conference on Multimedia Analysis and Pattern Recognition (MAPR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03050 2026-07-07 cs.LG cs.AI cs.CV cs.SD 新提交 81%

OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

OmniFocus:用于全模态大语言模型的查询引导模态平衡令牌压缩

Shijie Cao, Qingyu Zhang, Boxi Yu, Yuzhong Zhang, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所中文信息处理实验室) University of Limerick(利默里克大学) CUHK, Shenzhen(香港中文大学(深圳))

专题命中 多模态训练与对齐 :omni-modal(title);audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 研究全模态大语言模型推理成本高的问题,提出无训练的查询引导令牌压缩方法OmniFocus,独立评估音视频重要性,实现模态对称压缩,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02909 2026-07-07 cs.CV cs.AI 新提交 81%

Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models

使用层次表示正则化学习大型多模态模型的分类树

Hulingxiao He, Zhi Tan, Yuxin Peng

机构 * PKU-ICST-MIPL(北京大学信息科学技术学院多媒体信息处理实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究大型多模态模型缺乏分类知识致层次视觉识别一致性低的问题,提出层次表示正则化方法,含语义感知视觉树构建框架,结合两个互补目标,有效捕捉分类结构。

Comments Published as a conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00514 2026-07-02 cs.CV cs.AI 新提交 81%

Cross4D-JEPA: Dense Cross-modal Correspondence Distillation for 4D Point Cloud Representation Learning

Cross4D-JEPA: 用于4D点云表示学习的密集跨模态对应蒸馏

Trung Thanh Nguyen, Hai Nguyen-Truong, Tu Vo, Hoang M. Truong, Tuan-Anh Vu

机构 * Nagoya University(名古屋大学) Northeastern University(东北大学) KC Machine Learning Lab(KC机器学习实验室) University of Science, Vietnam National University Ho Chi Minh City(胡志明市越南国立大学理科大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出Cross4D-JEPA,通过教师-学生框架将冻结的2D基础模型(如DINOv2或V-JEPA 2)的密集补丁特征蒸馏到4D点编码器,实现每点对应和潜在空间匹配,在四个基准上优于模态内和全局跨模态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31599 2026-07-01 cs.CV cs.AI 新提交 81%

Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning

通过双流强化学习实现令牌稀疏的医学多模态推理

Kaitao Chen, Weiqian Zhao, Jiamin Wu, Qihao Zheng, Shangquan Sun, Chunfeng Song, Xiaosong Wang, Mu Zhou, Mianxin Liu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出双流强化学习框架ViToS,通过主动视觉令牌剪枝实现令牌稀疏的医学多模态推理,在七个医学基准上减少77%令牌并提升性能。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30647 2026-07-01 cs.CV cs.AI 新提交 81%

Cross-Modal Hierarchical Fusion for from Multi-Sensor Ground Observation

跨模态分层融合用于多传感器地面观测

Xinze Zhang

机构 * University of Southern California(南加州大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出AtmoFuseNet框架,通过跨模态分层聚合、条件变分精化和相关运动估计,融合多视角天空相机、毫米波云雷达和云高仪数据,实现云微物理场和风场的4D重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23888 2026-06-24 eess.IV cs.AI cs.CV 新提交 81%

E-MRL: Cross-view Aligned Evidence-driven Multimodal Reinforcement Learning for Reliable 3D Tumor Analysis

E-MRL: 跨视图对齐的证据驱动多模态强化学习用于可靠的3D肿瘤分析

Sijing Li, Zhongwei Qiu, Zhuoya Wang, Boxiang Yun, Zhenyu Yi, Jianwei Xu, Wenqiao Zhang, Yingda Xia, Ling Zhang

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) Hupan Lab(华平实验室) Huazhong University of Science and Technology(华中科技大学) East China Normal University(华东师范大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出跨视图对齐的证据驱动多模态强化学习框架E-MRL,通过将生成过程建模为“诊断-定位-验证”的马尔可夫决策过程,并引入跨视图一致性奖励,减少视觉幻觉并提升3D CT肿瘤诊断准确性。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20738 2026-06-23 cs.CV cs.AI 新提交 81%

An approach with Visual and Tabular Mamba to multimodal medical data using Mixed Fusion

一种基于视觉和表格Mamba的混合融合多模态医疗数据方法

Matheus B. Rocha, Gustavo B. Dettogni, Renato A. Krohling

机构 * Labcin - Nature Inspired Computing Lab, Federal University of Esp\'irito Santo, Vit\'oria, Brazil PPGI - Graduate Program in Computer Science, Federal University of Esp\'irito Santo, Vit\'oria, Brazil

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出基于Mamba架构的混合融合方法,通过视觉和表格两种Mamba变体处理图像与临床数据,在癌症分类中实现可解释性,在NDB-UFES数据集上表现优于Transformer。

Comments 15 pages. accepted to 36th Brazilian Conference on Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18566 2026-06-18 cs.CV cs.AI cs.GR 新提交 81%

Multi-Modal Hyper-Graph Fusion for Low-Light Crowd Counting

多模态超图融合用于低光照人群计数

Hao-Yuan Ma, Li Zhang, Yushi Qiu, Jie Gao, Yan Zhang, Bangjun Wang

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对低光照环境下人群计数难题,构建三个新基准数据集,提出多模态超图融合模块和可变形矩形稀疏注意力模块,形成低光照计数网络LCNet,在三个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17950 2026-06-17 cs.CV cs.AI 新提交 81%

Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model

即插即适应:基于预训练对齐模型的首眼多模态指代消解

Jinghan Wu, Jing Li, Ivor W. Tsang, Xuetao Zhang

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi'an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能全国重点实验室) Centre for Frontier AI Research and Institute of High-Performance Computing, Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局前沿人工智能研究中心与高性能计算研究所)

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出即插即适应方法,利用预训练的细粒度对齐模型,通过证据理论融合视觉与类别线索,无需目标数据集训练或大型VLLM,在CIN基准上CoNLL F1比专用方法和流行VLLM分别提升5.31%和2.12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14782 2026-06-17 cs.CV cs.CL 新提交 81%

Last But Not Least: Boundary Attention CalibratiON for Multimodal KV Cache Compression

最后但同样重要:用于多模态KV缓存压缩的边界注意力校准

Tianhao Chen, Yuheng Wu, Kelu Yao, Xiaogang Xu, Xiaobin Hu, Dongman Lee

机构 * KAIST(韩国科学技术院) Zhejiang Laboratory(之江实验室) The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 针对多模态大语言模型长视觉上下文中KV缓存压缩导致关键证据丢失的问题,提出BACON方法,通过校准观察窗口注意力与最后查询注意力,并利用层内一致性和层间持久性抑制噪声,在激进压缩下平均提升7.5%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14752 2026-06-16 cs.CV cs.AI cs.LG cs.RO 新提交 81%

X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining

X-Tokenizer: 一种用于视觉-语言-动作预训练的多模态动作分词器

Miracle Kang, Lights Shi, Lucy Liang, Roy Gan, Dongxiu Liu, Pushi Zhang, Sylas Chen, Shawn Qin, Yinan Zheng, Jinliang Zheng, Hao Wang, Xianyuan Zhan, Hang Su

机构 * Square Robot City University of Hong Kong(香港城市大学) Tsinghua University(清华大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出X-Tokenizer,通过语义残差量化(SRQ)和掩码动作建模(MAM)将动作离散化为语义接口,在2.4M轨迹上预训练后提升VLA模型的多模态接地和长程任务性能。

Comments Project page: https://x-square-robot.github.io/X-Tokenizer_projectPage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11614 2026-06-11 cs.LG cs.AI cs.CV 新提交 81%

Information-Theoretic Decomposition for Multimodal Interaction Learning

多模态交互学习的信息论分解

Zequn Yang, Yake Wei, Haotian Ni, Zhihao Xu, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing(中国人民大学人工智能学院,北京) Beijing Key Laboratory of Research on Large Models(北京大模型研究关键实验室) Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索与推荐工程研究中心) Beihang University, Beijing(北航,北京) Gaotu Techedu Inc.(高图科技有限公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出基于信息论的多模态交互分解方法DMIL,通过变分分解架构和微调策略学习样本特定的冗余、独特和协同交互,提升多模态学习性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07635 2026-06-09 cs.CV cs.AI 新提交 81%

NeuroAlign: Hierarchical Multimodal Fusion of Dynamic and Structural Neuroimaging for MCI Analysis

NeuroAlign: 用于MCI分析的动态与结构性神经影像的分层多模态融合

Xiongri Shen, Zhenxi Song, Jiaqi wang, Yi Zhong, Leilei Zhao, Chenqi Xu, Linling Li, Yichen Wei, Lingyan Liang, Demao Deng, Luping Song, Ping Luan, Ahmed M. Anter, Shuqiang Wang, Baiying Lei, Zhiguo Zhang

机构 * Department of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) School of Intelligence Science and Engineering, College of Artificial Intelligence, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)人工智能学院智能科学与工程学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Guangdong Key Laboratory of Biomedical Measurements and Ultrasound Imaging, School of Biomedical Engineering, Shenzhen University Medical School, Shenzhen University(深圳大学医学部生物医学工程学院广东省生物医学测量与超声成像重点实验室) Department of Radiology, The People’s Hospital of Guangxi Zhuang Autonomous Region, Guangxi Academy of Medical Sciences(广西壮族自治区人民医院放射科,广西医学科学院) Shenzhen Sixth People’s Hospital (Nanshan Hospital), Huazhong University of Science and Technology Union Shenzhen Hospital(华中科技大学协和深圳医院(深圳市第六人民医院)) School of Basic Medical Sciences, Shenzhen University(深圳大学基础医学院) Egypt-Japan University of Science and Technology (E-JUST)(埃及日本科技大学) School of Biomedical Engineering, National-Regional Key Technology Engineering Laboratory for Medical Ultrasound, Guangdong Key Laboratory for Biomedical Measurements and Ultrasound Imaging, Shenzhen University Medical School(深圳大学医学部生物医学工程学院,国家地方联合医学超声关键技术工程实验室,广东省生物医学测量与超声成像重点实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出NeuroAlign框架,通过双模态分层对齐和双域分层交互融合fMRI与DTI特征,实现MCI/SCD检测,并设计无梯度归因方法SAM进行特征分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19063 2026-08-20 cs.CV 新提交 79%

When Two Tracers Disagree: An Investigation of Multimodal Fusion for Clinical PET/CT Segmentation

当两种示踪剂意见不合时:临床PET/CT分割的多模态融合研究

Jack A. Johnson, Bartłomiej W. Papież

机构 * University of Oxford(牛津大学) Nuffield Department of Medicine(纳菲尔德医学系) Department of Oncology(肿瘤学系) Big Data Institute(大数据研究所) Nuffield Department of Population Health(纳菲尔德人口健康系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对前列腺癌PSMA与FDG PET/CT的多模态融合分割,训练示踪剂特异性3D nnU-Net基线并对比多种融合策略,发现融合未始终优于单示踪剂模型,需更优架构保留示踪剂特异性表征

Comments 10 pages (8 pages main content and 2 pages of references), 2 figures, 2 tables, accepted to MICCAI 2026 Cancer Prevention, Detection, and IntervenTion (CaPTion) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18515 2026-08-20 cs.CV 新提交 79%

Cross-Modal MRI Ovary Segmentation in Endometriosis Using Unpaired TVUS Prototype Priors

基于未配对经阴道超声(TVUS)原型先验的子宫内膜异位症跨模态MRI卵巢分割

Xingjian Kang, Lina Felsner, Dominik Perrin, Daiqi Liu, Jasmin Arjomandi, Franziska Mathis-Ullrich, Alexandra Stoll, Katharina Breininger

机构 * Center for AI and Data Science (CAIDAS), Julius-Maximilians-Universität Würzburg(维尔茨堡大学人工智能与数据科学中心) Institute for Computational Imaging and AI in Medicine (CompAI), Technical University of Munich(慕尼黑工业大学计算成像与医学人工智能研究所) Pattern Recognition Lab, Friedrich-Alexander Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡大学模式识别实验室) Department Artificial Intelligence in Biomedical Engineering (AIBE), Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡大学生物医学工程人工智能系)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 针对子宫内膜异位症MRI卵巢分割难题,本研究提出结合TVUS原型库的双分支框架,适配MedSAM3对齐跨模态特征,在相关数据集上较SOTA方法提升超5个百分点,验证了原型库与热身预训练的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17328 2026-08-19 cs.CV 新提交 79%

MS-MFAD : Multimodal large language models for Face Anti-spoofing Detection

MS-MFAD:用于人脸活体检测的多模态大语言模型

Xiaoyong Yu, Rongzhen Li, Shuming Shi, Xinge You

机构 * Mashang Consumer Finance Co., Ltd.(马上消费金融股份有限公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 针对人脸活体检测的复合威胁与现有方法瓶颈,提出基于多模态大语言模型MFAD的可解释系统,通过细粒度像素-语义锚定机制与少量语义标注实现优异检测性能,鲁棒性与效率更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15104 2026-08-18 cs.CV 新提交 79%

ProjFormer: Point Cloud Completion via Geometric-Projective Transformer and Cross-Modal Semantic Constraints

ProjFormer:基于几何投影Transformer与跨模态语义约束的点云补全

Sheng Liu, Meng Wang, Ruihui Li, Huilong Pi, Zhuo Tang, Kenli Li

机构 * Hunan University(湖南大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 针对现有点云补全方法几何一致性与适应性不足的问题,提出ProjFormer跨模态框架,通过投影引导视图注意力模块与几何感知路由网络实现高效特征聚合与融合,在轻量级设计下取得了具竞争力的补全性能。

Comments Accepted by ACM Multimedia 2026. 10 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11691 2026-08-13 cs.LG cs.CL 新提交 79%

LEMUR: Latent Entropy-aware Multimodal Unlearning via Visual-anchored Reasoning Redirection

LEMUR:基于视觉锚定推理重定向的潜在熵感知多模态遗忘

Xinhao Zhong, Yuxia Qiao, Junhao Li, Hao Fang, Yi Sun, Bin Chen

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 针对原生RL训练多模态模型的隐私泄漏问题,提出基于熵动态的无训练推理时遗忘框架LEMUR,可更有效地抑制敏感信息在推理轨迹和答案中的泄漏,同时保留模型非敏感效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11263 2026-08-13 cs.CV 新提交 79%

GeoUniPR: A Geometry-Consistent Unified Framework for Cross-Modal Place Recognition

GeoUniPR:用于跨模态地点识别的几何一致性统一框架

Wonbong Kim, Jiatong Xiao, Rui Li, Xufei Wang, Qiwen Gu, Junqiao Zhao, Chen Ye, Guang Chen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Shanghai Research Institute for Intelligent Autonomous System, Tongji University(同济大学上海智能自主系统研究院) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 本研究提出GeoUniPR框架,通过构建几何一致性深度图像视图并引入SC-InfoNCE损失,在无需复杂对齐模块的情况下,实现了跨模态地点识别的最优性能与良好泛化能力。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09986 2026-08-12 cs.AI cs.LG 新提交 79%

MIDAS: Mutual Information Disentanglement with Uncertainty-Aware Fusion for Incomplete Multimodal Sentiment Analysis

MIDAS:面向不完整多模态情感分析的基于不确定性感知融合的互信息解缠方法

Yuhua Wen, Yingying Zhou, Qifei Li, Yingming Gao, Zhengqi Wen, Jianhua Tao, Ya Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Zhongguancun Academy(中关村学院) Tsinghua University(清华大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究针对多模态情感分析中模态不完整的问题,提出MIDAS框架,通过互信息解缠与不确定性感知融合实现鲁棒的多模态表示,在多个数据集上取得优于基线的性能。

Comments Accepted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏