arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-03-30 至 2026-03-30 共收录 5 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 遥感融合与全色锐化 1 篇

2405.12944 2026-03-30 cs.CV 74%

AMFD: Distillation via Adaptive Multimodal Fusion for Multispectral Pedestrian Detection

AMFD:基于自适应多模态融合的多光谱行人检测知识蒸馏

Zizhao Chen, Yeqiang Qian, Xiaoxiao Yang, Chunxiang Wang, Ming Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Key Laboratory of System Control and Information Processing, Ministry of Education of China(系统控制与信息处理教育部重点实验室)

专题命中 遥感融合与全色锐化 :multimodal fusion(title);分类 cs.CV

AI总结 本文提出AMFD框架,通过自适应多模态融合模块有效利用教师网络的原始模态特征,提升学生网络性能,实验表明其在减少漏检率和提升平均精度方面优于现有方法。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人多传感器融合 1 篇

2509.15219 2026-03-30 cs.CV cs.LG cs.MA cs.MM cs.RO 78%

Out-of-Sight Embodied Agents: Multimodal Tracking, Sensor Fusion, and Trajectory Forecasting

视线外的具身智能体:多模态跟踪、传感器融合与轨迹预测

Haichao Zhang, Yi Xu, Yun Fu

机构 * Department of Electrical and Computer Engineering, Northeastern University(东北大学电气与计算机工程系) Khoury College of Computer Sciences, Northeastern University(东北大学库里计算机科学学院)

专题命中 机器人多传感器融合 :sensor fusion(title);分类 cs.CV、cs.RO、cs.MM

AI总结 本文提出改进的视线外轨迹预测方法,通过视觉定位去噪模块提升轨迹预测性能,实验表明在Vi-Fi和JRDB数据集上达到最优效果,为自动驾驶、机器人和监控提供新方向。

Comments Published in IEEE Transactions on Pattern Analysis and Machine Intelligence (Early Access), pp. 1-14, March 23, 2026

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 音视频/视觉语言融合 1 篇

2603.25752 2026-03-30 cs.CL cs.SD eess.AS 50%

Relational graph-driven differential denoising and diffusion attention fusion for multimodal conversation emotion recognition

关系图驱动的微分去噪和扩散注意力融合用于多模态对话情感识别

Ying Liu, Yuntao Shou, Wei Ai, Tao Meng, Keqin Li

机构 * College of Computer and Mathematics, Central South University of Forestry and Technology(中南林业科技大学计算机与数学学院) Department of Computer Science, State University of New York, New Paltz(纽约州立大学新帕尔茨分校计算机科学系)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 本文提出关系感知去噪和扩散注意力融合模型,通过微分Transformer去噪、构建模态关系子图和文本引导跨模态扩散机制,提升多模态对话情感识别性能。

Comments 19 pages

Journal ref neurocomputing2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 融合架构与评测 2 篇

2603.25799 2026-03-30 eess.SP 57%

Occlusion-Aware Multimodal Beam Prediction and Pose Estimation for mmWave V2I

面向毫米波V2I的遮挡感知多模态波束预测与姿态估计

Abidemi Orimogunje, Hyunwoo Park, Kyeong-Ju Cha, Igbafe Orikumhi, Sunwoo Kim, Dejan Vukobratovic

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 eess.SP

AI总结 本文提出一种受SLAM启发的多模态学习框架,用于动态遮挡下的毫米波V2I波束管理,通过融合RGB图像、LiDAR点云、雷达范围-角度图、GNSS和短时毫米波功率历史,实现波束索引、遮挡概率和2D位置的联合预测,验证了感知与通信结合在6G V2I系统中的价值。

Comments IEEE VTC

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26483 2026-03-30 cs.LG 50%

EcoFair: Trustworthy and Energy-Aware Routing for Privacy-Preserving Vertically Partitioned Medical Inference

EcoFair:面向隐私保护垂直分区医疗推断的可信且节能路由

Mostafa Anoosha, Dhavalkumar Thakker, Kuniko Paxton, Koorosh Aslansefat, Bhupesh Kumar Mishra, Baseer Ahmad, Rameez Raja Kureshi

机构 * School of Digital and Physical Science, University of Hull(赫尔大学数字与物理科学学院)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 EcoFair通过轻量级优先路由机制,在保持数据本地化的同时,减少边缘侧推断能耗,同时保持分类性能,提升高危病例的敏感性。

Comments 16 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏