arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-06-02 至 2026-06-02 共收录 12 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 1 篇

2604.02941 2026-06-02 cs.CV 57%

MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion

MMTalker: 多分辨率3D说话头合成与多模态特征融合

Bin Liu, Zhixiang Xiong, Zhifen He, Bo Li

机构 * IEEE Publication Technology Group(IEEE出版技术组) Piscataway, NJ(新泽西州皮萨卡威)

专题命中 通用Image Fusion :multimodal fusion(abstract);分类 cs.CV

AI总结 提出一种基于多分辨率表示和多模态特征融合的3D语音驱动面部动画合成方法MMTalker,通过网格参数化、非均匀可微采样、残差图卷积网络和双交叉注意力机制,实现高唇同步精度和逼真面部表情。

Comments This article presents only the preliminary research results, which are not yet complete and lack necessary supplementary experiments. The author has decided to withdraw it to improve the research work, and will submit a more complete version in the future

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 红外-可见光融合 2 篇

2606.01836 2026-06-02 eess.IV 79%

Face Liveness Detection Using RGB and Thermal Image Fusion

使用RGB和热成像融合的人脸活体检测

Merve Erşan, Melike Girgin, Tayfun Akgül

专题命中 红外-可见光融合 :image fusion(title);multimodal fusion(abstract);分类 eess.IV

AI总结 提出一种融合RGB图像边缘信息与热成像的方法,利用自定义ARISTOF数据集和YOLOv8-Face模型,有效提升人脸活体检测的鲁棒性。

Comments Published in ELECO 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.00967 2026-06-02 cs.CV 79%

Counterfactual Intervention Feature Transfer for Visible-Infrared Person Re-identification

反事实干预特征迁移用于可见光-红外行人重识别

Xulin Li, Yan Lu, Bin Liu, Yating Liu, Guojun Yin, Qi Chu, Jinyang Huang, Feng Zhu, Rui Zhao, Nenghai Yu

机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) Key Laboratory of Electromagnetic Space Information, Chinese Academy of Science(电磁空间信息重点实验室,中国科学院) School of Data Science, University of Science and Technology of China(数据科学学院,中国科学技术大学) SenseTime Research(商汤科技研究院) Qing Yuan Research Institute, Shanghai Jiao Tong University(青元研究院,上海交通大学)

专题命中 红外-可见光融合 :visible-infrared(title,abstract);分类 cs.CV

AI总结 针对可见光-红外行人重识别中图模型泛化性差的问题,提出反事实干预特征迁移方法,通过同质与异质特征迁移减少模态不平衡,并利用反事实关系干预增强图拓扑结构的可靠性。

Comments Accepted by ECCV 2022

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 遥感融合与全色锐化 1 篇

2510.13774 2026-06-02 cs.LG cs.CV 79%

UrbanFusion: Stochastic Multimodal Fusion for Contrastive Learning of Robust Spatial Representations

UrbanFusion: 用于鲁棒空间表示对比学习的随机多模态融合

Dominik J. Mühlematter, Lin Che, Ye Hong, Martin Raubal, Nina Wiedemann

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 遥感融合与全色锐化 :multimodal fusion(title,abstract);分类 cs.CV

AI总结 提出UrbanFusion模型,通过随机多模态融合(SMF)和Transformer模块整合街景、遥感、地图和POI数据,在56个城市41项任务中优于现有GeoAI模型。

Journal ref International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 自动驾驶多传感器融合 1 篇

2512.00470 2026-06-02 cs.RO 57%

LAP: Fast LAtent Diffusion Planner for Autonomous Driving

LAP:面向自动驾驶的快速潜在扩散规划器

Jinhao Zhang, Wenlong Xia, Zhexuan Zhou, Haoming Song, Youmin Gong, Jie Mei

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 自动驾驶多传感器融合 :information fusion(abstract);分类 cs.RO

AI总结 提出LAP框架,在VAE学习的潜在空间中进行规划,通过单步去噪实现高质量规划,在nuPlan基准上达到学习型规划方法的最优闭环性能,推理速度提升高达10倍。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人多传感器融合 3 篇

2606.01277 2026-06-02 cs.RO cs.AI cs.CV cs.SY eess.IV eess.SY 78%

DeepIPCv3: Event-Aware Multi-Modal Sensor Fusion for Sudden Pedestrian Crossing Avoidance

DeepIPCv3: 面向突发行人穿越避让的事件感知多模态传感器融合

Oskar Natan, Andi Dharmawan, Aufaclav Zatu Kusuma Frisky, Jazi Eko Istiyanto, Jun Miura

机构 * Department of Computer Science and Electronics, Universitas Gadjah Mada(计算机科学与电子系,加雅马达大学) Department of Computer Science and Engineering, Toyohashi University of Technology(计算机科学与工程系,东福士大学)

专题命中 机器人多传感器融合 :sensor fusion(title);分类 cs.CV、eess.IV、cs.RO

AI总结 提出DeepIPCv3框架,通过Transformer交叉模态注意力融合LiDAR点云与DVS事件流,实现突发行人穿越场景下的高反应性避让,在自定义多模态数据集上达到最优轨迹与控制精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12645 2026-06-02 eess.SP cs.AI cs.LG 70%

A Novel Data Augmentation Strategy for Robust Deep Learning Classification of Biomedical Time-Series Data: Application to ECG and EEG Analysis

一种用于生物医学时间序列数据鲁棒深度学习分类的新型数据增强策略:在ECG和EEG分析中的应用

Mohammed Guhdar, Ramadhan J. Mstafa, Abdulhakeem O. Mohammed

机构 * Computer Science Department, College of Science, University of Zakho(扎赫大学科学学院计算机科学系) Department of Computer Science and Information Technology, The American University of Kurdistan(库尔德斯坦美国大学计算机科学与信息技术系) PRIME Lab, Scientific Research Center, University of Zakho(扎赫大学科学研究中心PRIME实验室)

专题命中 机器人多传感器融合 :sensor fusion(abstract);multi-sensor fusion(abstract);分类 eess.SP

AI总结 提出一种结合ResNet-CNN与注意力机制的统一深度学习框架,通过时域拼接多个增强变体的新型数据增强策略和Focal Loss处理类别不平衡,在ECG和EEG数据集上达到99.96%-100%的准确率,且内存需求低、推理速度快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23694 2026-06-02 cs.RO cs.AI 57%

Interpretable Multimodal Gesture Recognition for Drone and Mobile Robot Teleoperation via Log-Likelihood Ratio Fusion

基于对数似然比融合的可解释多模态手势识别用于无人机和移动机器人遥操作

Seungyeol Baek, Jaspreet Singh, Lala Shakti Swarup Ray, Hymalai Bello, Paul Lukowicz, Sungho Suh

机构 * Department of Artificial Intelligence, Korea University(人工智能系,韩国大学) Department of Computer Science, RPTU Kaiserslautern-Landau(计算机科学系,RPTU凯撒斯劳滕-兰道) Embedded Intelligence, German Research Center for Artificial Intelligence (DFKI)(嵌入式智能,德国人工智能研究中心(DFKI))

专题命中 机器人多传感器融合 :multimodal fusion(abstract);分类 cs.RO

AI总结 提出一种融合腕戴式Apple Watch惯性数据和定制手套电容传感信号的多模态手势识别框架,利用对数似然比后期融合策略提升性能并提供可解释性,在降低计算成本的同时达到与视觉基线相当的识别效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 音视频/视觉语言融合 2 篇

2606.01207 2026-06-02 cs.CV cs.LG 57%

Feature Alignment Determines Fusion Strategy: A Comparative Study of Cross-Attention and Concatenation in Multimodal Learning

特征对齐决定融合策略:多模态学习中交叉注意力与拼接的比较研究

Zhiqiang Zhou, Xuezhen Xie

机构 * Hunan Chemical Industry Vocational and Technical College(湖南化学工业职业技术学院)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 通过实验和理论分析,证明特征对齐质量而非数据规模是决定多模态融合策略优劣的关键因素,当特征预对齐时拼接优于交叉注意力。

Comments 8 pages,6 figures,4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00125 2026-06-02 cs.IR cs.AI cs.LG cs.MM 57%

Multimodal Music Recommendation System using LLMs

使用LLMs的多模态音乐推荐系统

Srikar Prabhas Kandagatla, Sreehitha R. Narayana, Chandana Magapu, Swetha Mohan, Shamanth Kuthpadi, Hongjie Chen, Ryan A. Rossi, Franck Dernoncourt, Nesreen Ahmed

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Dolby Laboratories(Dolby实验室) Adobe Research(Adobe研究) Cisco Research(Cisco研究)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.MM

AI总结 提出一个多模态框架,通过融合音频、歌词、LLM生成的语义元数据和收听完成率,在基于会话的音乐推荐中显著提升Recall和NDCG。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 融合架构与评测 2 篇

2606.01615 2026-06-02 cs.CV cs.MM 81%

Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval

图灵模式用于多媒体:反应-扩散多模态融合用于语言引导的视频时刻检索

Xiang Fang, Wanlong Fang, Wei Ji, Tat-Seng Chua

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

专题命中 融合架构与评测 :multi-modal fusion(title);multimodal fusion(abstract);分类 cs.CV、cs.MM

AI总结 提出基于反应-扩散过程的多模态融合框架RDMF,通过模拟生物模式形成机制实现视频与文本的动态对齐,用于视频时刻检索与高亮检测。

Comments Published in ACM MM 2025. Address some typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00991 2026-06-02 cs.AI 50%

Large Language Models in Transportation Systems Management and Operations: From Text Reasoning to Multi-modal Decision Support

交通系统管理与运营中的大语言模型:从文本推理到多模态决策支持

Siyan Li, Zehao Wang, Jiachen Li, Kanok Boriboonsomsin, Matthew J. Barth, Guoyuan Wu

机构 * Bourns College of Engineering, Center for Environmental Research and Technology, University of California at Riverside, CA, USA(伯恩斯工程学院,环境研究与技术中心,加州大学河滨分校,美国,加利福尼亚州河滨)

专题命中 融合架构与评测 :multi-modal fusion(abstract)

AI总结 本文综述了大语言模型(LLM)和多模态大语言模型(MM-LLM)在交通系统管理与运营(TSMO)中的应用,涵盖运营与服务、移动性与车队服务、数据建模与决策支持三大领域,并指出了数据异构性、实时推理、可解释性等挑战及未来方向。

Comments Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏