arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-04-01 至 2026-04-01 共收录 3 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 融合架构与评测 3 篇

2603.29291 2026-04-01 cs.CV cs.AI 57%

MELT: Improve Composed Image Retrieval via the Modification Frequentation-Rarity Balance Network

MELT:通过修改频繁性-稀有性平衡网络改进组合图像检索

Guozhi Qiu, Zhiwei Chen, Zixu Li, Qinlei Huang, Zhiheng Fu, Xuemeng Song, Yupeng Hu

机构 * School of Software, Shandong University(山东大学软件学院) Southern University of Science and Technology(南方科技大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 MELT通过解决罕见语义定位不对称和硬负样本下的鲁棒相似性估计问题,改进组合图像检索的性能。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29029 2026-04-01 cs.CV cs.AI 57%

MMFace-DiT: A Dual-Stream Diffusion Transformer for High-Fidelity Multimodal Face Generation

MMFace-DiT:一种双流扩散变换器用于高保真多模态人脸生成

Bharath Krishnamurthy, Ajita Rattani

机构 * University of North Texas(北德克萨斯大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 MMFace-DiT通过双流Transformer实现多模态人脸生成,融合空间和语义信息,提升生成质量与控制能力,相比现有方法提升40%的视觉保真度和提示对齐度。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026. 22 pages (Main Text + Supplementary), 14 figures, 5 tables, 4 algorithms. Project page: https://vcbsl.github.io/MMFace-DiT/ and Code Repository: https://github.com/Bharath-K3/MMFace-DiT

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02350 2026-04-01 cs.HC 50%

FIRMED: A Peak-Centered Multimodal Dataset with Fine-Grained Annotation for Emotion Recognition

FIRMED:一种以峰值为中心的多模态数据集,用于情感识别的细粒度标注

Hao Tang, Songyun Xie, Xinzhou Xie, Can Liao, Bohan Li, Zhongyu Tian, Dalu Zheng

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 FIRMED通过即时回忆标注方法,提供同步的EEG、ECG、GSR、PPG和面部记录,以峰值为中心的标注减少了动态情感识别中的时间标签噪声,实验表明其在八种EEG分类器上平均提升3.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏