arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-07-01 至 2026-07-01 共收录 7 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 红外-可见光融合 1 篇

2511.22768 2026-07-01 cs.CV 74%

Fusion or Confusion? Assessing the impact of visible-thermal image fusion for automated wildlife detection

融合还是混淆?评估可见光-热成像融合对自动化野生动物检测的影响

Camille Dionne-Pierre, Samuel Foucher, Jérôme Théau, Jérôme Lemaître, Patrick Charbonneau, Maxime Brousseau, Mathieu Varin

机构 * Department of Applied Geomatics, Université de Sherbrooke(舍布鲁克大学应用地理信息学系) Quebec Centre for Biodiversity Science, McGill University(麦吉尔大学魁北克生物多样性科学中心) Ministère de l’Environnement, de la Lutte contre les Changements Climatiques, de la Faune et des Parcs (MELCCFP)(魁北克省环境、气候变化、野生动物和公园部) Centre d'enseignement et de recherche en foresterie de Sainte-Foy(圣福瓦林业教学与研究中心)

专题命中 红外-可见光融合 :image fusion(title);分类 cs.CV

AI总结 本文通过大蓝鹭案例研究,评估了可见光与热红外图像融合对自动化野生动物检测的效果,发现融合方法提升了F1分数,但受限于热成像视角和对齐约束。

Comments 19 pages, 9 figures, submitted to Remote Sensing in Ecology and Conservation

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多聚焦/多曝光融合 2 篇

2606.31242 2026-07-01 cs.CV 新提交 88%

UHD-MFF: Shattering Barriers in Multi-Focus Ultra-High-Definition Image Fusion via Learnable Lookup Tables

UHD-MFF:通过可学习查找表打破多焦点超高清图像融合的障碍

Yibing Zhang, Xunpeng Yi, Qinglong Yan, Yeda Wang, Han Xu, Jiayi Ma

机构 * Electronic Information School, Wuhan University(武汉大学电子信息学院) School of Robotics, Wuhan University(武汉大学机器人学院) School of Automation, Southeast University(东南大学自动化学院)

专题命中 多聚焦/多曝光融合 :image fusion(title,abstract);multi-focus(title,abstract);分类 cs.CV

AI总结 针对超高清多焦点图像融合中的数据、模型和部署三大障碍,提出首个大规模超高清数据集UHD-MFF和基于可学习查找表的UMF-LUT框架,实现实时4K融合。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04390 2026-07-01 cs.CV cs.AI 版本更新 57%

FMA-Net++: Motion- and Exposure-Aware Joint Video Super-Resolution and Deblurring

FMA-Net++:运动与曝光感知的联合视频超分辨率与去模糊

Geunhyuk Youk, Jihyong Oh, Munchurl Kim

机构 * KAIST(韩国科学技术院) CMLab, Chung-Ang University(中央大学CMLab)

专题命中 多聚焦/多曝光融合 :multi-exposure(abstract);分类 cs.CV

AI总结 提出非循环序列级框架FMA-Net++,通过层次细化双向聚合块实现并行处理与长时域建模,引入曝光时间感知调制层处理曝光依赖模糊,在合成数据上训练达到SOTA性能。

Comments Accepted to ECCV 2026. Project Page: https://kaist-viclab.github.io/fmanetpp_site/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 音视频/视觉语言融合 2 篇

2606.30675 2026-07-01 eess.AS cs.AI cs.LG q-bio.QM 新提交 50%

Listening Between the Lines: Joint Learning of ASR Embeddings and LLM-Augmented Linguistics for Dementia Detection

弦外之音:ASR嵌入与LLM增强语言学联合学习用于痴呆检测

Olivier Jiyoun Jung, Jonghyeon Park, Myungwoo Oh

机构 * Division of Communication and Media, Ewha Womans University, South Korea(韩国梨花女子大学传播与媒体学院) NAVER Cloud, South Korea(韩国NAVER Cloud)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 提出多模态框架,结合Whisper的声学表示与LLM提取的语言特征,通过门控融合网络实现痴呆检测,在ADReSS和ADReSSo上F1分别达89.47%和90.14%。

Comments Accepted at INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30646 2026-07-01 cs.SD cs.AI cs.CL eess.AS 新提交 50%

ASR-Agnostic Multimodal Spectrotemporal Modeling for Early Dementia Detection

ASR无关的多模态谱时建模用于早期痴呆检测

Chukwuemeka Ugwu, Oluwafemi Richard Oyeleke

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 提出一种不依赖语音识别的框架,直接从梅尔频谱图中提取谱时位移场作为数字生物标志物,结合CNN-ConvGRU声学嵌入和交叉注意力融合,在三种语言语料库上验证了多模态融合的语料依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 融合架构与评测 2 篇

2606.31895 2026-07-01 cs.CV 新提交 57%

RESOLVE: A Multi-Resolution and Multi-Modal Dataset for Roadside Cooperative Perception

RESOLVE:用于路边协同感知的多分辨率多模态数据集

Shaozu Ding, Linan Song, Marco De Vincenzi, Dajiang Suo

机构 * The Polytechnic School, Arizona State University(亚利桑那州立大学理工学院) Department of Computer Science and Engineering, New York University(纽约大学计算机科学与工程系)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 提出RESOLVE数据集,包含多分辨率LiDAR和相机-LiDAR同步数据,用于评估路边3D检测与跟踪中的单模态与融合架构,揭示多模态融合如何补偿LiDAR点稀疏性。

Comments Accepted to ECCV 2026. Including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31332 2026-07-01 cs.AI 新提交 50%

CryoACE: An Atom-centric Framework for Accurate and Automated Model Building in Cryo-EM

CryoACE: 面向冷冻电镜中精确自动模型构建的原子中心框架

Minzhang Li, Mingrui Li, Weichen Qin, Qihe Chen, Sixian Shen, Yuan Pei, Jiakai Zhang, Jingyi Yu

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 提出CryoACE框架,通过原子中心重建范式和无需训练的引导机制,实现冷冻电镜密度图中均质与异质结构的精确原子模型构建,显著优于现有方法。

Journal ref ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏