arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-08-21 至 2026-08-21 共收录 7 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 多聚焦/多曝光融合 1 篇

2606.02419 2026-08-21 physics.chem-ph cond-mat.mtrl-sci physics.comp-ph 版本更新 50%

DPA4: Pushing the Accuracy-Cost Frontier of Interatomic Potentials with EMFA SO(2) Convolution

DPA4: 利用EMFA SO(2)卷积推动原子间势的精度-成本前沿

Tiancheng Li, Wentao Li, Anyang Peng, Jianming Xue, Linfeng Zhang, Duo Zhang, Han Wang

专题命中 多聚焦/多曝光融合 :multi-focus(abstract)

AI总结 本文提出DPA4架构,通过EMFA SO(2)等变卷积和编译器友好的训练路径,在降低参数和训练成本的同时,在Matbench Discovery等基准上达到最优精度-成本平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人多传感器融合 1 篇

2401.07468 2026-08-21 cs.LG cs.AI 版本更新 67%

Learning-Based Speed Estimation from Accelerometer-Only Inertial Sensing

CarSpeedNet: 基于学习的仅使用加速度计的车速估计

Barak Or

机构 * CEO Office, MetaOr Artificial Intelligence(MetaOr人工智能首席执行办公室) Google(谷歌) Reichman Tech School, Reichman University(Reichman大学技术学院)

专题命中 机器人多传感器融合 :sensor fusion(abstract);multi-sensor fusion(abstract)

AI总结 CarSpeedNet通过仅使用加速度计实现车速估计,无需陀螺仪或其他传感器,提升低资源环境下的导航精度。

Comments 6 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 音视频/视觉语言融合 1 篇

2608.19710 2026-08-21 cs.CV cs.AI 新提交 57%

Robust Cross-Modal Foundation Model Perception for Underwater Robots under Degraded Visual Conditions

退化视觉条件下水下机器人的鲁棒跨模态基础模型感知

Mohammad Arif Ul Alam

机构 * College of Science and Technology, North Carolina A & T State University(北卡罗来纳农工州立大学科学技术学院)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 该研究针对水下机器人视觉退化问题,提出感知退化的视觉-声纳门控融合方法,在极端退化下使平衡准确率较 DINOv2 基线提升 33.5%,实现鲁棒跨模态感知。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 融合架构与评测 4 篇

2608.02092 2026-08-21 cs.CV cs.MM 版本更新 84%

Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion

基于空间掩码与通道融合的深度多模态融合检测

Guandi Wang, Ming Li, Yunsen Xing, Junle Liu

机构 * KTH Royal Institute of Technology(KTH皇家理工学院) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 融合架构与评测 :multimodal fusion(title,abstract);feature-level fusion(abstract);分类 cs.CV、cs.MM

AI总结 本文针对现有多模态融合检测的过拟合问题,提出Attention-Driven Complementarity Resampling框架,通过语义掩码交换与可学习通道竞争实现跨模态目标检测的性能提升,在多数据集上取得了有竞争力的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19788 2026-08-21 eess.IV cs.CV 新提交 62%

MOSAIC: Modality-agnostic Spectral Alignment for Federated Image-level Weakly Supervised Tumor Segmentation under Client-specific Missing Modalities

MOSAIC:面向客户端特定缺失模态的联邦图像级弱监督肿瘤分割的模态无关频谱对齐方法

Tarun Kumar Garg, Vaanathi Sundaresan

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV、eess.IV

AI总结 本研究针对客户端特定缺失模态的联邦图像级弱监督肿瘤分割问题,提出MOSAIC框架,通过模态对齐模块、频谱原型对齐损失及联邦优化网络,在三个脑肿瘤基准上取得显著优于基线的性能,仅用图像级标签接近全监督精度,且支持动态客户端加入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23078 2026-08-21 eess.IV 版本更新 57%

A Systematic Survey on Event Camera Representation Learning

事件相机表示学习系统综述

Hongwei Ren, Youxin Jiang, Tuopusen Huang, Lei Yu, Xiao Wang, Min Liu, Lin Wang, Xiangqian Wu

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 eess.IV

AI总结 综述从原始事件流转换为可学习表示的角度,分类梳理了基于密集和稀疏表示的方法,分析其在结构规则性、时间保真度、稀疏保持和架构兼容性上的权衡,并总结基准与未来方向。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16106 2026-08-21 cs.CL 版本更新 50%

Explainable Multimodal Depression Recognition in Clinical Interviews via PHQ-Aligned Symptom Summarization

基于PHQ对齐症状总结的临床访谈中可解释多模态抑郁识别

Wenjie Zheng, Qiming Xie, Jianfei Yu, Yang Wang, Lei Cao, Fei Wang, Shijin Wang, Rui Xia, Chengqing Zong

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 该研究针对临床访谈多模态抑郁识别的可解释性不足问题,提出Explain-MDRC框架,构建含PHQ-8对齐注释的Explain-DAIC数据集,开发PhqCML模型,提升识别性能并提供可解释中间证据。

详情

展开后加载摘要…

URL PDF HTML 收藏