arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-05-22 至 2026-05-22 共收录 5 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 1 篇

2602.01760 2026-05-22 cs.CV 83%

MagicFuse: Single Image Fusion for Visual and Semantic Reinforcement

MagicFuse: 单图像融合用于视觉与语义增强

Hao Zhang, Yanping Zha, Zizhuo Li, Meiqi Gong, Jiayi Ma

机构 * Electronic Information School, Wuhan University, China(武汉大学电子信息学院) Suzhou Institute of Wuhan University, China(武汉大学苏州研究院) School of Automation, Wuhan University, China(武汉大学自动化学院)

专题命中 通用Image Fusion :image fusion(title,abstract);multi-modal image fusion(abstract);分类 cs.CV

AI总结 本文提出MagicFuse单图像融合框架,通过扩散模型生成跨光谱场景表示,实现视觉与语义的双重约束,实验表明其性能优于多模态融合方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 红外-可见光融合 1 篇

2605.22273 2026-05-22 cs.CV 79%

Exposing Vulnerabilities in Visible-Infrared VLMs: A Unified Geometric Adversarial Framework with Cross-Task Transferability

揭示可见-红外VLMs中的漏洞:一种具有跨任务迁移性的统一几何对抗框架

Xiang Chen, Yuxian Dong, Chao Li, Chengyin Hu, Jiaju Han, Fengyu Zhang, Yiwei Wei, Jiahuan Long, Jiujiang Guo

专题命中 红外-可见光融合 :visible-infrared(title,abstract);分类 cs.CV

AI总结 本文针对可见-红外视觉语言模型在多模态任务中的对抗鲁棒性不足问题,提出了一种基于分形几何的对抗框架CFGPatch,通过引入曲边分形元素和Fraser螺旋渲染机制,有效攻击VLMs并展示出跨任务迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 自动驾驶多传感器融合 1 篇

2605.22550 2026-05-22 cs.CV 57%

MOTOR: A Multimodal Dataset for Two-Wheeler Rider Behavior Understanding

MOTOR: 两轮车骑行行为理解的多模态数据集

Varun A. Paturkar, Shankar Gangisetty, C. V. Jawahar

机构 * CVIT, IIIT-Hyderabad(IIIT-海得拉巴学院计算机视觉研究所)

专题命中 自动驾驶多传感器融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出MOTOR数据集,用于研究两轮车在密集无结构交通中的骑行行为,通过多视角、多模态数据融合,为自动驾驶辅助系统提供新的研究基础。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 融合架构与评测 2 篇

2605.16923 2026-05-22 cs.CV 57%

Neuroscience-inspired Staged Representation Learning with Disentangled Coarse- and Fine-Grained Semantics for EEG Visual Decoding

受神经科学启发的分阶段表征学习:解纠缠的粗粒度和细粒度语义用于EEG视觉解码

Xiang Gao, Hui Tian, Yanming Zhu, Xuefei Yin, Alan Wee-Chung Liew

机构 * School of Information and Communication Technology, Griffith University(信息与通信技术学院,格里菲斯大学)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.CV

AI总结 本文提出了一种受神经科学启发的分阶段表征学习框架,通过解纠缠的粗粒度和细粒度语义来改进EEG视觉解码,解决了现有方法在人类视觉处理分阶段和层次特性方面的不足。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22090 2026-05-22 cs.AI 50%

A Camera-Cooperative ISAC Framework for Multimodal Non-Cooperative UAVs Sensing

一种用于多模非合作无人机感知的相机协作ISAC框架

Wenfeng Wu, Luping Xiang, Kun Yang

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Institute of Intelligent Networks and Communications (NINE)(智能网络与通信研究院) School of Intelligent Software and Engineering, Nanjing University (Suzhou Campus)(南京大学智能软件与工程学院(苏州校区))

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 本文提出了一种相机协作ISAC框架,通过多模感知实现高效的无人机波束定向和跟踪,提升了感知精度和资源效率。

详情

展开后加载摘要…

URL PDF HTML 收藏