arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-03-17 至 2026-03-17 共收录 17 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 2 篇

2603.14214 2026-03-17 cs.CV cs.AI 85%

UniFusion: A Unified Image Fusion Framework with Robust Representation and Source-Aware Preservation

UniFusion:一种具有鲁棒表示和源感知保留的统一图像融合框架

Xingyuan Li, Songcheng Du, Yang Zou, HaoYuan Xu, Zhiying Jiang, Jinyuan Liu

专题命中 通用Image Fusion :image fusion(title,abstract);multi-focus(abstract);multi-exposure(abstract);分类 cs.CV

AI总结 UniFusion通过统一框架实现跨任务泛化,利用DINOv3提取模态一致特征,引入重建对齐损失保持源信息一致性,并采用双层优化策略平衡重建与融合目标,提升融合质量与泛化能力。

Comments 11 pages, 8 figures, published to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02090 2026-03-17 cs.CV 79%

All-weather Multi-Modality Image Fusion: Unified Framework and 100k Benchmark

全天候多模态图像融合:统一框架与10万基准

Xilai Li, Wuyang Liu, Xiaosong Li, Fuqiang Zhou, Huafeng Li, Feiping Nie

机构 * Guangdong-HongKong-Macao Joint Laboratory for Intelligent MicroNano Optoelectronic Technology(粤港澳联合智能微纳光电子技术实验室) School of Physics and Optoelectronic Engineering, Foshan University(佛山大学物理与光电工程学院) Guangdong Provincial Key Laboratory of Industrial Intelligent Inspection Technology(广东省工业智能检测技术重点实验室) School of Instrumentation and Optoelectronic Engineering, Beihang University(北京航空航天大学仪器与光电工程学院) School of Information Engineering and Automation, Kunming University of Science and Technology(昆明理工大学信息工程与自动化学院) School of Artificial Intelligence, Optics and Electronics (i0PEN), School of Computer Science, Northwestern Polytechnical University(人工智能、光学与电子学院(i0PEN),西北工业大学计算机学院)

专题命中 通用Image Fusion :image fusion(title,abstract);分类 cs.CV

AI总结 本文提出统一的全天候多模态图像融合框架,通过联合特征融合与恢复提升关键场景信息表征,构建10万张图像对的多模态数据集,实验证明在真实和合成场景中图像融合及下游任务表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 红外-可见光融合 1 篇

2603.14243 2026-03-17 cs.CV 79%

BIT: Matching-based Bi-directional Interaction Transformation Network for Visible-Infrared Person Re-Identification

BIT:基于匹配的双向交互转换网络用于可见-红外人重识别

Haoxuan Xu, Guanglin Niu

专题命中 红外-可见光融合 :visible-infrared(title,abstract);分类 cs.CV

AI总结 本文提出BIT网络,通过显式建模可见与红外图像对的交互,解决VI-ReID中模态差异大和分布偏移的问题,实验表明其在重识别任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 遥感融合与全色锐化 2 篇

2603.15109 2026-03-17 cs.CV 79%

PAKAN: Pixel Adaptive Kolmogorov-Arnold Network Modules for Pansharpening

PAKAN:用于全色增强的像素自适应Kolmogorov-Arnold网络模块

Haoyu Zhang, Haojing Chen, Zhen Zhong, Liangjian Deng

机构 * University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 遥感融合与全色锐化 :pansharpening(title,abstract);分类 cs.CV

AI总结 本文提出PAKAN框架,通过2D和1D自适应KAN模块提升全色增强性能,实验表明像素自适应激活在空间-光谱融合中有效。

Comments 16 pages,5 figures,4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14952 2026-03-17 cs.CV 79%

Pansharpening for Thin-Cloud Contaminated Remote Sensing Images: A Unified Framework and Benchmark Dataset

针对薄云污染的遥感图像全色增强:一个统一框架和基准数据集

Songcheng Du, Yang Zou, Jiaxin Li, Mingxuan Liu, Ying Li, Changjing Shang, Qiang Shen

专题命中 遥感融合与全色锐化 :pansharpening(title,abstract);分类 cs.CV

AI总结 本文提出统一全色增强模型与薄云去除框架,通过频率解耦恢复模块和交互频域一致性模块提升图像恢复性能,并构建首个真实世界薄云污染数据集,验证了方法在实际大气退化下的优越性。

Comments 11 pages,5 figures,published in AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人多传感器融合 4 篇

2603.14457 2026-03-17 cs.RO 74%

Towards Versatile Opti-Acoustic Sensor Fusion and Volumetric Mapping

迈向多功能光学-声学传感器融合与体积分层映射

Ivana Collado-Gonzalez, John McConnell, Brendan Englot

专题命中 机器人多传感器融合 :sensor fusion(title);分类 cs.RO

AI总结 本文提出融合立体声纳与单目相机的体积分层映射框架,以应对不同能见度条件下的安全导航问题,通过解决声纳视场重叠带来的垂直模糊问题,生成可靠的3D点云。

Comments To appear at ICRA 2026 in Vienna, Austria

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14940 2026-03-17 eess.SY cs.LG cs.RO cs.SY 70%

Intelligent Control of Differential Drive Robots Subject to Unmodeled Dynamics with EKF-based State Estimation

具有未建模动态的差分驱动机器人智能控制与状态估计

Amos Alwala, Yuchen Hu, Gabriel da Silva Lima, Wallace Moreira Bessa

机构 * With the Smart Systems , Department of Mechanical and Materials Engineering, Faculty of Technology, University of Turku(智能系统,机械与材料工程系,技术学院,图尔库大学)

专题命中 机器人多传感器融合 :sensor fusion(abstract);multi-sensor fusion(abstract);分类 cs.RO

AI总结 本文提出结合Lyapunov非线性控制器与自适应神经网络及EKF多传感器融合的统一控制与状态估计框架,通过在线适应方案改进RBF权重,实现未知非线性建模,并通过Lyapunov分析保证闭环稳定性,实验显示在速度跟踪性能上有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14242 2026-03-17 cs.DB 67%

Wheel Dynamic Load Estimation Method Based on Gas Pressure of Hydro-pneumatic Suspension

基于液压气悬架气体压力的车轮动态载荷估计方法

Qijun Liao, Jue Yang, Subhash Rakheja, Yiting Kang, Yumeng Yao, Yuming Yin

专题命中 机器人多传感器融合 :sensor fusion(abstract);multi-sensor fusion(abstract)

AI总结 本文提出一种基于液压气悬架气体压力的车轮动态载荷估计方法,通过非线性耦合模型整合悬架动态与非线性刚度特性,利用单个压力传感器迭代算法实现载荷估计,降低硬件冗余和测量误差传播。

Comments 41 pages, 51 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14104 2026-03-17 cs.RO 57%

GelSphere: An Omnidirectional Rolling Vision-Based Tactile Sensor for Online 3D Reconstruction and Normal Force Estimation

GelSphere:一种基于全方位滚动视觉的触觉传感器,用于在线3D重建和法向力估计

Seoyeon Lee, Mohammad Amin Mirzaee, Wenzhen Yuan

专题命中 机器人多传感器融合 :image fusion(abstract);分类 cs.RO

AI总结 本文提出GelSphere,一种基于视觉的触觉传感器,用于实时连续表面扫描。通过内部钢球形成轴承层,实现全方位滚动,提升3D重建和法向力估计的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 音视频/视觉语言融合 2 篇

2603.14361 2026-03-17 cs.CV 57%

BROTHER: Behavioral Recognition Optimized Through Heterogeneous Ensemble Regularization for Ambivalence and Hesitancy

BROTHER: 通过异质性集成正则化优化行为识别以应对矛盾与犹豫

Alexandre Pereira, Bruno Fernandes, Pablo Barros

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出BROTHER框架,通过异质集成正则化方法,结合视觉、音频和语言数据,提升对矛盾与犹豫等复杂行为状态的识别能力,采用PSO硬投票集成策略,实现宏F1分数达0.7465。

Comments 5 pages, 2 figures, 3 tables, Ambivalence/Hesitancy (AH) Video Recognition Challenge, ABAW10th, CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13719 2026-03-17 cs.CV 57%

Sparse-Dense Mixture of Experts Adapter for Multi-Modal Tracking

稀疏-密集专家混合适配器用于多模态跟踪

Yabin Zhu, Jianqi Li, Chenglong Li, Jiaxiang Wang, Chengjie Gu, Jin Tang

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出稀疏-密集专家混合适配器框架,通过稀疏MoE和密集共享MoE有效建模多模态特征,结合Gram基于语义对齐超图融合模块,提升多模态跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 融合架构与评测 6 篇

2603.15004 2026-03-17 cs.SE 78%

TriFusion-LLM: Prior-Guided Multimodal Fusion with LLM Arbitration for Fine-grained Code Clone Detection

TriFusion-LLM:基于LLM仲裁的先验引导多模态融合用于细粒度代码克隆检测

Mengdi Li, Yuming Liu, He Wang, Zifeng Xu, Yuqing Zhang

专题命中 融合架构与评测 :multimodal fusion(title,abstract)

AI总结 本文提出TriFusion-LLM框架,结合传统机器学习的启发式相似性先验、AST结构信号和CodeBERT语义嵌入,提升细粒度代码克隆检测的分类性能,实验表明其在BigCloneBench上将Macro-F1提升至0.875。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14956 2026-03-17 cs.LG 78%

SFedHIFI: Fire Rate-Based Heterogeneous Information Fusion for Spiking Federated Learning

SFedHIFI:基于发火率的异构信息融合用于脉冲联邦学习

Ran Tao, Qiugang Zhan, Shantian Yang, Xiurui Xie, Qi Tian, Guisong Liu

专题命中 融合架构与评测 :information fusion(title,abstract)

AI总结 本文提出SFedHIFI框架,通过基于发火率的异构信息融合实现异构联邦学习,提升资源受限客户端的模型部署效率和性能。

Comments 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12192 2026-03-17 physics.optics 78%

Multimodal Fusion Network for Micro-displacement Measurement via Michelson Interferometer

用于迈克尔逊干涉仪的多模融合网络微位移测量

Zixing Jia, Jiawei Li, Ziping Chen, Xin Li

专题命中 融合架构与评测 :multimodal fusion(title,abstract)

AI总结 本文提出一种多模融合网络用于高精度微位移测量,通过引入双头学习机制解决半波位移模糊问题,实现高精度位移和整数干涉阶分类,具备实时性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14976 2026-03-17 cs.MM cs.CV 76%

Anchoring Emotions in Text: Robust Multimodal Fusion for Mimicry Intensity Estimation

在文本中锚定情绪:用于模仿强度估计的鲁棒多模态融合

Lingsi Zhu, Yuefeng Zou, Yunxiang Zhang, Naixiang Zheng, Guoyuan Wang, Jun Yu, Jiaen Liang, Wei Huang, Shengping Liu, Ximin Zheng

机构 * University of Science and Technology of China(中国科学技术大学) Unisound AI Technology Co., Ltd.(Unisound人工智能科技有限公司) Pingan Technology Co., Ltd.(平安科技有限公司)

专题命中 融合架构与评测 :multimodal fusion(title);分类 cs.CV、cs.MM

AI总结 本文提出TAEMI框架,通过文本锚定机制融合多模态数据,提升在噪声和缺失数据下的情绪模仿强度估计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18652 2026-03-17 cs.CL 50%

PolyFrame at MWE-2026 AdMIRe 2: When Words Are Not Enough: Multimodal Idiom Disambiguation

PolyFrame在MWE-2026 AdMIRe 2:当词语不够时:多模态成语消歧

Nina Hosseini-Kivanani

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 本文提出PolyFrame系统,通过统一管道处理图像+文本排名和纯文本描述排名任务,利用轻量模块提升多语言成语消歧性能,无需微调大模型。

Comments Accepted at AdMIRe 2 shared task (Advancing Multimodal Idiomaticity Representation) colocated with 22nd Workshop on Multiword Expressions (MWE 2026) @EACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13760 2026-03-17 cs.AI cs.SD 50%

Multimodal Emotion Regression with Multi-Objective Optimization and VAD-Aware Audio Modeling for the 10th ABAW EMI Track

多模态情感回归:基于多目标优化和VAD感知音频建模的第10届ABAW EMI任务

Jiawen Huang, Chenxi Huang, Zhuofan Wen, Hailiang Yao, Shun Chen, Longjiang Yang, Cong Yu, Fengyu Zhang, Ran Liu, Bin Liu

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 本文提出多目标优化和VAD感知音频建模方法,用于改进Hume-Vidmimic2数据集上的情感模仿强度估计任务,通过多模态融合和共享回归头提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏