arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

共收录 4740 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 516 篇

2604.00086 2026-08-04 cs.CV cs.AI cs.CL cs.LG 版本更新 57%

Hierarchical Pre-Training of Vision Encoders with Large Language Model

基于大语言模型的视觉编码器分层预训练

Eugene Lee, Ting-Yu Chang, Jui-Huang Tsai, Jiajie Diao, Chen-Yi Lee

机构 * University of Cincinnati(辛辛那提大学) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 通用Image Fusion :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出HIVE框架,通过引入视觉编码器与大语言模型间的分层交叉注意力机制,提升视觉语言对齐,改进特征融合与表征学习,实验表明其在图像分类和多模态任务中表现优异。

Comments 17 pages, 14 figures, accepted to Computer Vision and Pattern Recognition Conference (CVPR) Workshops 2026. 5th MMFM Workshop: What is Next in Multimodal Foundation Models?

Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (pp. 7415-7424) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09351 2026-07-13 cs.CV 新提交 57%

Simon-SR: Spatially Adaptive Modulation and Visual Prompt Adaptation for Text-Reinforced Super-Resolution

Simon-SR:用于文本增强超分辨率的空间自适应调制和视觉提示适配

Haotong Cheng, Yuxuan Li, Zijie Cui, Rongling Tan, Chenyuan Wang

机构 * College of Electronic Science and Engineering, Jilin University(吉林大学电子科学与工程学院)

专题命中 通用Image Fusion :image fusion(abstract);分类 cs.CV

AI总结 针对单图像超分辨率问题,提出Simon-SR框架,利用可学习提示进行语义挖掘和文本-图像融合,结合对比提示学习与空间自适应细化,实验证明该方法超越现有技术,在多项指标上有明显提升。

Comments Multi-modal Single Image Super-Resolution

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00595 2026-07-03 cs.CV 新提交 57%

GADA: Geometry-Aware Deformable Aggregation for Image-Based Gaussian Splatting

GADA: 基于图像的高斯泼溅的几何感知可变形聚合

Siwoo Lim, Sunjae Yoon, Gwanhyeong Koo, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Chung-Ang University(中央大学)

专题命中 通用Image Fusion :image fusion(abstract);分类 cs.CV

AI总结 提出几何感知可变形聚合(GADA),通过可变形偏移迭代校正空间错位,并引入隐式置信加权机制抑制不可靠证据,在保持高频细节的同时实现2.13倍FPS提升。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30437 2026-06-11 cs.CV 版本更新 57%

Mitigating Content Shift and Hallucination in GenAI Image Editing via Structural Refinement

通过结构细化减轻生成式AI图像编辑中的内容偏移和幻觉

Luxi Zhao, Michael S. Brown

机构 * Department of Electrical Engineering & Computer Science(电气工程与计算机科学系)

专题命中 通用Image Fusion :image fusion(abstract);分类 cs.CV

AI总结 提出一种后处理框架,通过建立粗空间和光度对应关系并融合输入图像与GenAI增强图像,在保留感知增强的同时抑制幻觉内容,从而解决黑盒GenAI图像编辑中的结构保持问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07651 2026-06-09 cs.LG cs.CV 新提交 57%

KITE: A Tri-Modal Transformer Integrating Text, Images, and Knowledge Graphs for Fake News Detection

KITE:一种融合文本、图像和知识图谱的三模态假新闻检测Transformer

Kevin Patel, Shashi Bhushan Jha

机构 * Department of Computer Science, University of West Florida(威斯福大学计算机科学系)

专题命中 通用Image Fusion :image fusion(abstract);分类 cs.CV

AI总结 提出三模态假新闻检测框架KITE,联合建模文本、视觉和知识表示,利用跨模态注意力整合特征,在基准数据集上显著优于单双模态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02941 2026-06-02 cs.CV 57%

MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion

MMTalker: 多分辨率3D说话头合成与多模态特征融合

Bin Liu, Zhixiang Xiong, Zhifen He, Bo Li

机构 * IEEE Publication Technology Group(IEEE出版技术组) Piscataway, NJ(新泽西州皮萨卡威)

专题命中 通用Image Fusion :multimodal fusion(abstract);分类 cs.CV

AI总结 提出一种基于多分辨率表示和多模态特征融合的3D语音驱动面部动画合成方法MMTalker,通过网格参数化、非均匀可微采样、残差图卷积网络和双交叉注意力机制,实现高唇同步精度和逼真面部表情。

Comments This article presents only the preliminary research results, which are not yet complete and lack necessary supplementary experiments. The author has decided to withdraw it to improve the research work, and will submit a more complete version in the future

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22903 2026-04-28 cs.CV cs.AI 57%

On the Complementarity of Quantum and Classical Features: Adaptive Hybrid Quantum-Classical Feature Fusion for Breast Cancer Classification

量子与经典特征的互补性:面向乳腺癌分类的自适应混合量子-经典特征融合

Yasmin Rodrigues Sobrinho, João Renato Ribeiro Manesco, João Paulo Papa

机构 * Department of Computing, São Paulo State University(圣保罗州大学计算机系)

专题命中 通用Image Fusion :hybrid fusion(abstract);分类 cs.CV

AI总结 本文提出一种混合量子-经典架构,通过双分支特征提取管道融合经典模型和量子电路的互补表示,引入三种特征融合策略提升乳腺癌分类性能。

Comments 41 pages, 16 figures. This manuscript is a preprint under review at Artificial Intelligence in Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20128 2026-04-23 cs.CV 57%

Semi-Supervised Flow Matching for Mosaiced and Panchromatic Fusion Imaging

半监督流匹配用于拼接与全色融合成像

Peiming Luo, Nan Wang, Litong Liu, Jiahan Huang, Chenxu Wu, Renwei Dian, Junming Hou

机构 * Southeast University(东南大学) Hunan University(湖南大学)

专题命中 通用Image Fusion :image fusion(abstract);分类 cs.CV

AI总结 本文提出半监督流匹配框架,用于拼接超光谱图像与全色图像融合,通过两阶段训练提升生成效率与鲁棒性,实验表明其在多个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02396 2026-04-06 cs.CV cs.AI 57%

Environment-Aware Channel Prediction for Vehicular Communications: A Multimodal Visual Feature Fusion Framework

面向环境的车用通信信道预测:一种多模态视觉特征融合框架

Xuejian Zhang, Ruisi He, Minseok Kim, Inocent Calist, Mi Yang, Ziyi Qi

机构 * Graduate School of Science and Technology, Niigata University(新潟大学研究生院科学与技术系)

专题命中 通用Image Fusion :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出一种多模态视觉特征融合框架,利用GPS数据、车辆全景RGB图像及语义分割和深度估计提取语义、深度和位置特征,通过三分支架构和 squeeze-excitation 注意力门控模块实现自适应多模态融合,实现路径损耗、时延扩展、到达方位扩展、离开方位扩展和角功率谱的联合预测。

Comments 13 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08240 2026-03-10 cs.CV 57%

SiMO: Single-Modality-Operable Multimodal Collaborative Perception

SiMO: 单模态可操作的多模态协作感知

Jiageng Wen, Shengjie Zhao, Bing Li, Jiafeng Huang, Kenan Ye, Hao Deng

机构 * Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(同济大学智能自主系统上海研究院) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) School of Mechatronic Engineering and Automation, Shanghai University(上海大学机械电子工程与自动化学院)

专题命中 通用Image Fusion :multi-modal fusion(abstract);分类 cs.CV

AI总结 SiMO通过单模态可操作的多模态协作感知方法,解决多模态特征融合中的语义不匹配问题,提升协作感知性能。

Comments Accepted to ICLR 2026. This arXiv version includes an additional appendix (Appendix 15) containing further philosophical discussion not included in the official ICLR peer-reviewed version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01947 2026-03-03 cs.CV cs.AI 57%

physfusion: A Transformer-based Dual-Stream Radar and Vision Fusion Framework for Open Water Surface Object Detection

physfusion: 一种基于Transformer的双流雷达与视觉融合框架用于开放水域表面目标检测

Yuting Wan, Liguo Sun, Jiuwu Hao, Zao Zhang, Pin LV

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 通用Image Fusion :image fusion(abstract);分类 cs.CV

AI总结 PhysFusion通过物理引导雷达编码器和Transformer融合模块,实现开放水域表面目标的高效检测,取得高精度检测结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11946 2026-01-28 cs.CV 57%

R-Meshfusion: Reinforcement Learning Powered Sparse-View Mesh Reconstruction with Diffusion Priors

R-Meshfusion:基于强化学习的扩散先验的稀疏视图网格重建

Haoyang Wang, Liming Liu, Peiheng Wang, Junlin Hao, Jiangkai Wu, Xinggong Zhang

专题命中 通用Image Fusion :image fusion(abstract);分类 cs.CV

AI总结 R-Meshfusion通过扩散模型与强化学习结合,提升稀疏视图下网格重建的几何与渲染质量。

Comments needs to be revised and updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06883 2026-01-13 cs.CV cs.AI 57%

MixRI: Mixing Features of Reference Images for Novel Object Pose Estimation

MixRI:用于新颖物体姿态估计的参考图像特征混合

Xinhang Liu, Jiawei Shi, Zheng Dang, Yuchao Dai

机构 * School of Electronics and Information, Northwestern Polytechnical University(电子与信息学院,西北工业大学) Shaanxi Key Laboratory of Information Acquisition and Processing(陕西省信息获取与处理重点实验室) CVLab, EPFL, Switzerland(EPFL瑞士计算机视觉实验室)

专题命中 通用Image Fusion :image fusion(abstract);分类 cs.CV

AI总结 MixRI通过轻量级网络和参考图像融合策略,实现新颖物体姿态估计,减少计算和存储需求,同时保持与传统方法相当的性能。

Comments Accepted by ICCV 2025

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (2025) 9024--9035

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02415 2026-01-07 cs.CV cs.AI 57%

Multimodal Sentiment Analysis based on Multi-channel and Symmetric Mutual Promotion Feature Fusion

基于多通道和对称互促特征融合的多模态情感分析

Wangyuan Zhu, Jun Yu

专题命中 通用Image Fusion :information fusion(abstract);分类 cs.CV

AI总结 本文提出基于多通道和对称互促特征融合的多模态情感分析方法,通过增强模态内特征表示和促进模态间信息交互,提升情感识别的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21861 2025-12-29 cs.CV cs.AI cs.LG 57%

Balancing Accuracy and Efficiency: CNN Fusion Models for Diabetic Retinopathy Screening

在准确性和效率之间平衡:用于糖尿病视网膜病变筛查的CNN融合模型

Md Rafid Islam, Rafsan Jany, Akib Ahmed, Mohammad Ashrafuzzaman Khan

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) North South University(北南大学) Digital Health Research Division(数字健康研究部) Korea Institute of Oriental Medicine(韩国东方医学研究院) Department of Computer Science(计算机科学系) American International University--Bangladesh(美国国际大学-孟加拉国)

专题命中 通用Image Fusion :feature-level fusion(abstract);分类 cs.CV

AI总结 本研究提出通过特征级融合提升糖尿病视网膜病变筛查的准确性和效率,采用EfficientNet-B0和DenseNet121的融合模型在准确率和延迟之间取得良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21641 2025-12-29 cs.CV cs.AI 57%

TrackTeller: Temporal Multimodal 3D Grounding for Behavior-Dependent Object References

TrackTeller: 基于时间的多模态3D定位用于行为依赖的对象引用

Jiahong Yu, Ziqi Wang, Hailiang Zhao, Wei Zhai, Xueqiang Yan, Shuiguang Deng

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 通用Image Fusion :image fusion(abstract);分类 cs.CV

AI总结 TrackTeller通过融合LiDAR图像、语言条件解码和时间推理,提升动态3D场景中基于语言的物体定位与跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24247 2025-12-10 cs.CV 57%

50 Years of Automated Face Recognition

50年自动人脸识别技术的发展

Minchul Kim, Anil Jain, Xiaoming Liu

机构 * Department of Computer Science and Engineering, Michigan State University(计算机科学与工程系,密歇根州立大学)

专题命中 通用Image Fusion :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文综述了自动人脸识别技术的发展历程,分析了关键创新和挑战,并探讨了未来的研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10471 2025-11-25 cs.CV cs.LG 57%

DAGLFNet: Deep Feature Attention Guided Global and Local Feature Fusion for Pseudo-Image Point Cloud Segmentation

DAGLFNet:基于伪图像的深度特征注意力引导的全局和局部特征融合用于伪图像点云分割

Chuang Chen, Yi Lin, Bo Wang, Jing Hu, Xi Wu, Wenyi Ge

机构 * College of Computer Science, Chengdu University of Information Technology(成都信息科技大学计算机学院) College of Computer Science, Sichuan University(四川大学计算机学院) Publications Department, Optica Publishing Group(Optica出版社出版部) Department of Electronic Journals, Optica Publishing Group(Optica出版社电子期刊部)

专题命中 通用Image Fusion :information fusion(abstract);分类 cs.CV

AI总结 DAGLFNet通过深度特征注意力引导的全局和局部特征融合,提升伪图像点云分割的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27208 2025-11-03 cs.CV cs.AI 57%

Multi-Modal Feature Fusion for Spatial Morphology Analysis of Traditional Villages via Hierarchical Graph Neural Networks

Jiaxin Zhang, Zehong Zhu, Junye Deng, Yunqin Li, and Bowen Wang

机构 * Architecture and Design College, Nanchang University(南昌大学建筑与设计学院) SANKEN, The University of Osaka(大阪大学)

专题命中 通用Image Fusion :multimodal fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21396 2025-10-27 cs.CV 57%

Depth-Supervised Fusion Network for Seamless-Free Image Stitching

Zhiying Jiang, Ruhao Yan, Zengxi Zhang, Bowei Zhang, Jinyuan Liu

机构 * College of Information Science and Technology, Dalian Maritime University(大连海事大学信息科学与技术学院) School of Software Technology, Dalian University of Technology(大连理工大学软件学院)

专题命中 通用Image Fusion :image fusion(abstract);分类 cs.CV

Comments Accepted to Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20438 2025-10-24 cs.CV cs.AI 57%

Dynamic Weight Adjustment for Knowledge Distillation: Leveraging Vision Transformer for High-Accuracy Lung Cancer Detection and Real-Time Deployment

Saif Ur Rehman Khan, Muhammad Nabeel Asim, Sebastian Vollmer, Andreas Dengel

机构 * German Research Center for Artificial Intelligence(德国人工智能研究中心) Intelligentx GmbH

专题命中 通用Image Fusion :image fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05914 2025-10-22 cs.CV 57%

Learning Collaborative Knowledge with Multimodal Representation for Polyp Re-Identification

Suncheng Xiang, Jiale Guan, Shilun Cai, Jiacheng Ruan, Dahong Qian

机构 * Shanghai Jiao Tong University(上海交通大学) Zhongshan Hospital of Fudan University(复旦大学中山医院)

专题命中 通用Image Fusion :multimodal fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14714 2025-10-20 cs.CV cs.AI cs.CL 57%

KGAlign: Joint Semantic-Structural Knowledge Encoding for Multimodal Fake News Detection

Tuan-Vinh La, Minh-Hieu Nguyen, Minh-Son Dao

专题命中 通用Image Fusion :multi-modal fusion(abstract);分类 cs.CV

Comments Withdrawn by the authors due to lack of explicit agreement from all co-authors to post this version publicly on arXiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23815 2025-09-30 cs.CV cs.AI cs.LG 57%

A Multi-Camera Vision-Based Approach for Fine-Grained Assembly Quality Control

Ali Nazeri, Shashank Mishra, Achim Wagner, Martin Ruskowski, Didier Stricker, Jason Rambach

专题命中 通用Image Fusion :image fusion(abstract);分类 cs.CV

Comments 6 pages, 3 figures. Accepted for presentation at EUSIPCO 2025 (European Signal Processing Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18237 2025-09-24 cs.CV 57%

DATA: Domain-And-Time Alignment for High-Quality Feature Fusion in Collaborative Perception

Chengchang Tian, Jianwei Ma, Yan Huang, Zhanye Chen, Honghao Wei, Hui Zhang, Wei Hong

机构 * Southeast University(东南大学) Washington State University(华盛顿州立大学)

专题命中 通用Image Fusion :feature-level fusion(abstract);分类 cs.CV

Comments ICCV 2025, accepted as poster. 22 pages including supplementary materials

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05953 2025-09-09 cs.CV 57%

Dual Interaction Network with Cross-Image Attention for Medical Image Segmentation

Jeonghyun Noh, Wangsu Jeon, Jinsun Park

机构 * Department of Information Convergence Engineering, Pusan National University(convergence工程系,釜山国立大学) School of Computer Engineering, Kyungnam University(计算机工程学院,庆尚大学) School of Computer Science and Engineering, Pusan National University(计算机科学与工程学院,釜山国立大学)

专题命中 通用Image Fusion :image fusion(abstract);分类 cs.CV

Comments 16pages

Journal ref Pattern Recognition Letters 197C (2025) pp. 332-338

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03066 2025-09-04 eess.SP cs.AI cs.LG 57%

S2M2ECG: Spatio-temporal bi-directional State Space Model Enabled Multi-branch Mamba for ECG

Huaicheng Zhang, Ruoxin Wang, Chenlian Zhou, Jiguang Shi, Yue Ge, Zhoutong Li, Sheng Chang, Hao Wang, Jin He, Qijun Huang

机构 * School of Physics and Technology(物理与技术学院) Wuhan University(武汉大学) Pratt School of Engineering(工程学院) Duke University(杜克大学) Faculty of Artificial Intelligence in Education(教育人工智能学院) Central China Normal University(中部师范大学) Huangpu Branch of Shanghai Ninth People’s Hospital(上海第九人民医院黄浦分院)

专题命中 通用Image Fusion :information fusion(abstract);分类 eess.SP

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17037 2025-08-26 cs.CV 57%

F4-ITS: Fine-grained Feature Fusion for Food Image-Text Search

Raghul Asokan

机构 * HyperVerge

专题命中 通用Image Fusion :multi-modal fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.19160 2025-08-18 cs.CV 57%

Effective Message Hiding with Order-Preserving Mechanisms

Gao Yu, Qiu Xuchong, Ye Zihan

机构 * Bosch Corporate Research(博世企业研究)

专题命中 通用Image Fusion :image fusion(abstract);分类 cs.CV

Comments BMVC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03277 2025-08-06 cs.CV 57%

Efficient Multi-Slide Visual-Language Feature Fusion for Placental Disease Classification

Hang Guo, Qing Zhang, Zixuan Gao, Siyuan Yang, Shulin Peng, Xiang Tao, Ting Yu, Yan Wang, Qingli Li

专题命中 通用Image Fusion :multimodal fusion(abstract);分类 cs.CV

Comments Accepted by ACMMM'25

详情

展开后加载摘要…

URL PDF HTML 收藏