arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-05-12 至 2026-05-12 共收录 10 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 1 篇

2605.09455 2026-05-12 cs.CV 79%

Adaptive 3D Convolution for Remote Sensing Image Fusion

自适应3D卷积用于遥感图像融合

Siran Peng, Xiangyu Zhu, Shang-Qi Deng, Liang-Jian Deng, Zhen Lei

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Mathematical Sciences/Multi-Hazard Early Warning Key Laboratory of Sichuan Province, University of Electronic Science and Technology of China(数学科学学院/四川省多灾种早期预警重点实验室,电子科技大学) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences(人工智能与机器人中心,香港科学院,中国科学院)

专题命中 通用Image Fusion :image fusion(title,abstract);分类 cs.CV

AI总结 本文提出自适应3D卷积方法,通过生成内容感知的3D卷积核,有效整合空间和光谱信息,提升遥感图像融合的精度与效率。

Comments Accepted by IEEE Transactions on Image Processing (TIP), Early Access, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 红外-可见光融合 1 篇

2605.06969 2026-05-12 cs.CV 79%

Bringing Multimodal Large Language Models to Infrared-Visible Image Fusion Quality Assessment

将多模态大语言模型引入红外-可见图像融合质量评估

Yuchen Guo, Junli Gong, Yao Lu, Xintong Xu, Yiuming Cheung, Weifeng Su

机构 * Northwestern University(西北大学) Northeastern University(东北大学) University of Washington(华盛顿大学) Hong Kong Baptist University(香港 Baptist大学) Beijing Normal - Hong Kong Baptist University(北京师范大学-香港 Baptist大学)

专题命中 红外-可见光融合 :image fusion(title,abstract);分类 cs.CV

AI总结 本文提出FuScore,利用多模态大语言模型生成连续质量评分,以更精确区分质量相近的融合图像,并结合多维子维度一致性和三重目标函数提升评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 遥感融合与全色锐化 1 篇

2605.10769 2026-05-12 cs.CV cs.AI 57%

MPerS: Dynamic MLLM MixExperts Perception-Guided Remote Sensing Scene Segmentation

MPerS: 动态多模态大语言模型混合专家感知引导的遥感场景分割

Ziyi Wang, Xianping Ma, Ziyao Wang, Hongyang Zhang, Man On Pun

机构 * The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Southwest Jiaotong University(西南交通大学)

专题命中 遥感融合与全色锐化 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出MPerS方法,通过设计多提示生成高质量遥感描述,结合DINOv3提取视觉特征,利用动态混合专家模块和语言查询引导注意力实现精准分割。

Comments Accepted to CVPR 2026 Findings. 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 自动驾驶多传感器融合 1 篇

2605.10177 2026-05-12 cs.CV cs.AI cs.RO 62%

MTA-RL: Robust Urban Driving via Multi-modal Transformer-based 3D Affordances and Reinforcement Learning

MTA-RL:通过多模态Transformer-based 3D affordances和强化学习实现鲁棒的城市驾驶

Guangli Chen, Dianzhao Li, Wenjian Zhong, Bangquan Xie, Ostap Okhrin

机构 * Dongguan Key Laboratory of Intelligent Equipment and Smart Industry, School of Advanced Engineering, Great Bay University(东莞智能装备与智能制造重点实验室,先进工程学院,大湾大学) Chair of Applied Statistics, Technische Universität Dresden(应用统计学教授职位,德累斯顿技术大学) Center for Scalable Data Analytics and Artificial Intelligence (ScaDS.AI)(可扩展数据解析与人工智能中心(ScaDS.AI)) College of Automation, Guangdong University of Technology(自动化学院,广东技术大学)

专题命中 自动驾驶多传感器融合 :multi-modal fusion(abstract);分类 cs.CV、cs.RO

AI总结 本文提出MTA-RL框架,通过多模态Transformer-based 3D affordances和强化学习实现可靠的城市自动驾驶,提升样本效率和稳定性,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人多传感器融合 3 篇

2605.02743 2026-05-12 cs.AI cs.CV cs.HC 77%

Triple Spectral Fusion for Sensor-based Human Activity Recognition

三频谱融合用于基于传感器的人体活动识别

Ye Zhang, Longguang Wang, Qing Gao, Chaocan Xiang, Mohammed Bennamoun, Yulan Guo

机构 * School of Electronics and Communication Engineering, the Shenzhen Campus of Sun Yat-sen University(南方科技大学深圳校区电子与通信工程学院) Aviation University of Air Force(空军航空大学) College of Computer Science, Chongqing University(重庆大学计算机学院) Department of Computer Science and Software Engineering, the University of Western Australia(西澳大学计算机科学与软件工程系)

专题命中 机器人多传感器融合 :information fusion(abstract);sensor fusion(abstract);multi-sensor fusion(abstract);分类 cs.CV

AI总结 本文提出三频谱融合框架,通过自适应滤波和图傅里叶变换提升传感器数据融合与长期上下文关联性,实验表明其在多个基准数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10087 2026-05-12 cs.CV 57%

Initiation of Interaction Detection Framework using a Nonverbal Cue for Human-Robot Interaction

基于非语言线索的人机交互启动检测框架的初始化

Guhnoo Yun, Juhan Yoo, Kijung Kim, Dong Hwan Kim

机构 * Korea Institute of Science and Technology(韩国科学技术院) Department of Computer Science, Semyung University(Semyoung大学计算机科学系)

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.CV

AI总结 本文提出一种基于音频和视觉传感器融合的非关键词人机交互启动检测框架,通过声源定位和人类跟踪实现交互启动检测,结合机器人自身传感器和外部视觉传感器进行稳定的人体检测与跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08246 2026-05-12 cs.CV cs.CR cs.LG 57%

Smart Railway Obstruction Detection System using IoT and Computer Vision

基于物联网和计算机视觉的智能铁路障碍检测系统

Pravin Kumar, Mritunjay Shall Peelam, Ramakant Kumar, Sanjay Kumar, Vinay Chamola

机构 * School of Computer Science, University of Petroleum and Energy Studies (UPES)(石油与能源研究大学计算机科学学院) Department of Computer Science, Galgotias College of Engineering & Technology(工程与技术学院计算机科学系) Department of Computer Science, NIT Jamshedpur(jamshedpur国立理工学院计算机科学系) Department of Electrical and Electronics Engineering, BITS-Pilani, Pilani Campus(比什努尔理工学院电气与电子工程系) APPCAIR, BITS-Pilani, Pilani campus(比什努尔理工学院帕兰ी校区APPCAIR)

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.CV

AI总结 本文提出NETRA系统,利用边缘计算平台实现低成本、低功耗的铁路入侵检测,通过概率传感器融合和边缘AI分类,提高检测准确率并降低部署成本。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 音视频/视觉语言融合 2 篇

2605.08723 2026-05-12 cs.CV cs.MM 73%

EAR: Enhancing Uni-Modal Representations for Weakly Supervised Audio-Visual Video Parsing

EAR:增强单模表示以实现弱监督音频视觉视频解析

Huilai Li, Xiaomeng Di, Ying Xing, Yonghao Dang, Yiming Wang, Jianqin Yin

机构 * School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications(智能工程与自动化学院,北京邮电大学) State Grid Corporation of China(国家电网公司) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(人工智能学院,北京邮电大学)

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);audio-visual fusion(abstract);分类 cs.CV、cs.MM

AI总结 本文提出EAR框架,通过增强伪标签生成器和AVVP模型的单模表示,提升视频解析的时序定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20213 2026-05-12 cs.LG cs.CY 50%

Mixture of Experts for Recognizing Depression from Interview and Reading Tasks

专家混合模型用于从访谈和阅读任务中识别抑郁症

Loukas Ilias, Dimitris Askounis

机构 * DSS Laboratory, School of ECE, National Technical University of Athens, Greece(国家技术大学雅典分校电子工程系DSS实验室)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 本文提出利用多模态融合和专家混合模型,从访谈和阅读任务的语音中识别抑郁症,实现87%的准确率和86.66%的F1分数。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 融合架构与评测 1 篇

2605.10498 2026-05-12 cs.CV cs.AI stat.ML 74%

Simultaneous Long-tailed Recognition and Multi-modal Fusion for Highly Imbalanced Multi-modal Data

多模态数据中长尾识别与多模态融合的联合处理

Heegeon Yoon, Heeyoung Kim

机构 * Department of Industrial and Systems Engineering, Korea Advanced Institute of Science and Technology (KAIST)(工业与系统工程系,韩国科学技术院(KAIST))

专题命中 融合架构与评测 :multi-modal fusion(title);分类 cs.CV

AI总结 本文提出一种处理长尾分布多模态数据的新框架,通过融合异质数据并利用模态特定网络增强信息,提升在长尾类不平衡场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏