arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-06-23 至 2026-06-23 共收录 13 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 1 篇

2606.20689 2026-06-23 cs.CV cs.LG 新提交 70%

NeoJaundice-AI: Smartphone-Based Neonatal Jaundice Detection Using Dual-Input Deep Learning and Synthetic Augmentation

NeoJaundice-AI: 基于智能手机的新生儿黄疸检测,采用双输入深度学习与合成增强

Rahul Patel, Nirjala Jarpula

机构 * Indian Institute of Information Technology Surat(印度信息技术学院苏拉特分校)

专题命中 通用Image Fusion :image fusion(abstract);multimodal image fusion(abstract);分类 cs.CV

AI总结 提出NeoJaundice-AI系统,通过双分支EfficientNet-B0处理皮肤和巩膜图像,融合手工YCbCr颜色特征,实现四类严重度分类和胆红素回归,采用合成黄疸生成和肤色归一化,在印度新生儿数据集上达到91.8%准确率。

Comments 7 pages, 10 figures, 8 tables. IEEE conference format

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 医学影像融合 1 篇

2606.22487 2026-06-23 cs.CV 新提交 57%

FetSelect: Task-Specific Architectures and Self-Supervised Learning for Automated Fetal Ultrasound Frame Selection

FetSelect: 面向自动化胎儿超声帧选择的任务特定架构与自监督学习

Mahmood Alzubaidi, Raden Muaz, Uzair Shah, Mohammed Ammar, Khalid Alyafei, Mowafa Househ, Marco Agus

机构 * College of Science and Engineering, Hamad Bin Khalifa University(哈马德·本·哈利法大学科学与工程学院) LIST Laboratory Department of Electrical Systems Engineering, University of Boumerdes(布迈德斯大学电气系统工程系LIST实验室) Sidra Medicine(锡德拉医学)

专题命中 医学影像融合 :hybrid fusion(abstract);分类 cs.CV

AI总结 提出FetSelect框架,结合冻结视觉基础骨干与混合多头设计(任务门控分类头+检测派生质量头),通过BYOL自监督预训练,在四个胎儿测量目标上实现高AUROC与质量相关性。

Comments Accepted in 30th Conference on Medical Image Understanding and Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 自动驾驶多传感器融合 1 篇

2606.23058 2026-06-23 cs.CV 新提交 57%

Three-Step Hierarchical Transformer for Multi-Pedestrian Trajectory Prediction

三步层次Transformer用于多人轨迹预测

Raphaël Delécluse, Hazem Wannous, Laurent Grisoni, Laurent Guimas

机构 * IMT Nord Europe, University of Lille, CNRS UMR 9189 - CRIStAL(IMT 北欧洲、里尔大学、法国国家科学研究中心 UMR 9189 - CRIStAL) University of Lille, CNRS UMR 9189 - CRIStAL(里尔大学、法国国家科学研究中心 UMR 9189 - CRIStAL) Explain

专题命中 自动驾驶多传感器融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 提出三步层次Transformer,通过分离时间编码、多模态融合和场景交互推理,在JRDB和城市数据集上达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人多传感器融合 2 篇

2606.21223 2026-06-23 cs.RO 新提交 88%

Ultra-Fusion: A Resilient Tightly-Coupled Multi-Sensor Fusion SLAM Framework under Sensor Degradation and Spatiotemporal Perturbation for Intelligent Transportation Systems

Ultra-Fusion:面向传感器退化与时空扰动下智能交通系统的鲁棒紧耦合多传感器融合SLAM框架

Yihong Tian, Junjie Zhang, Liuyang Li, Deteng Zhang, Yunfei Zuo, Jie Yin

机构 * Beijing Institute of Technology(北京理工大学) Chongqing University(重庆大学) Sichuan University(四川大学) Northwestern Polytechnical University(西北工业大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人多传感器融合 :sensor fusion(title,abstract);multi-sensor fusion(title,abstract);分类 cs.RO

AI总结 提出Ultra-Fusion紧耦合多传感器融合SLAM框架,通过可观测性感知初始化、因子级可靠性调度和在线LiDAR-IMU时空标定,在传感器退化与时空扰动下实现鲁棒定位,在多种平台和基准上验证了高精度与可用性。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21669 2026-06-23 cs.RO 新提交 70%

Online Learning of Robust Legged Odometry with Minimal Exteroceptive Supervision

最小外感受监督下的鲁棒腿式里程计在线学习

Abhijeet M. Kulkarni, Yuze Du, Guoquan Huang

机构 * University of Delaware(德克萨斯大学)

专题命中 机器人多传感器融合 :sensor fusion(abstract);multi-sensor fusion(abstract);分类 cs.RO

AI总结 提出一种即插即用的鲁棒腿式里程计系统,利用外感受运动管线作为监督信号在线学习速度神经网络,并结合不变扩展卡尔曼滤波器融合数据,无需传感器标定或运动学建模,在不同四足平台上验证了其适应性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 融合架构与评测 8 篇

2606.21258 2026-06-23 cs.RO cs.CV 新提交 62%

Spectral GS-SLAM: Observability-Aware, Degeneracy-Robust Tracking for Real-Time 3D Gaussian Splatting SLAM

Spectral GS-SLAM:面向实时3D高斯泼溅SLAM的可观测性感知与退化鲁棒跟踪

Edward Beng Wai Tan, Siew-Kei Lam, Dongshuo Zhang

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.CV、cs.RO

AI总结 提出Spectral GS-SLAM,通过自适应补偿退化场景中的欠约束方向,结合ICP与特征约束实现鲁棒跟踪,并利用高斯感知平面性加权机制融合几何信息,在无结构/纹理环境中保持实时性能(40.14 FPS)。

Comments This work has been accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23078 2026-06-23 eess.IV 新提交 57%

A Systematic Survey on Event Camera Representation Learning

事件相机表示学习系统综述

Hongwei Ren, Youxin Jiang, Tuopusen Huang, Xiangqian Wu

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 eess.IV

AI总结 综述从原始事件流转换为可学习表示的角度,分类梳理了基于密集和稀疏表示的方法,分析其在结构规则性、时间保真度、稀疏保持和架构兼容性上的权衡,并总结基准与未来方向。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21174 2026-06-23 cs.CV q-bio.GN 新提交 57%

HERO: Hypothesis-Driven Evidence Retrieval from Omics for Multi-Task Breast Cancer Analysis

HERO:基于假设驱动的组学证据检索用于多任务乳腺癌分析

Xiangyu Li, Ran Su

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 提出HERO框架,将组学数据作为形态学假设进行显式检索,通过稀疏通路先验和TF-IDF检索实现可审计的多模态乳腺癌分析,在TCGA-BRCA上取得多项预测任务的最优结果。

Comments 11 pages, 3 figures, Early accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20738 2026-06-23 cs.CV cs.AI 新提交 57%

An approach with Visual and Tabular Mamba to multimodal medical data using Mixed Fusion

一种基于视觉和表格Mamba的混合融合多模态医疗数据方法

Matheus B. Rocha, Gustavo B. Dettogni, Renato A. Krohling

机构 * Labcin - Nature Inspired Computing Lab, Federal University of Esp\'irito Santo, Vit\'oria, Brazil PPGI - Graduate Program in Computer Science, Federal University of Esp\'irito Santo, Vit\'oria, Brazil

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 提出基于Mamba架构的混合融合方法,通过视觉和表格两种Mamba变体处理图像与临床数据,在癌症分类中实现可解释性,在NDB-UFES数据集上表现优于Transformer。

Comments 15 pages. accepted to 36th Brazilian Conference on Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23213 2026-06-23 cs.LG 新提交 50%

Deep learning-based detection of cessation of breathing in pre-term infants

基于深度学习的早产儿呼吸停止检测

Dineo Serame, Lionel Tarassenko, Mauricio Villarroel

机构 * Institute of Biomedical Engineering, Department of Engineering Science, University of Oxford(牛津大学工程科学系生物医学工程研究所)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 本研究利用深度学习模型,基于阻抗呼吸描记、心电图和光电容积描记信号,检测早产儿呼吸暂停相关呼吸停止事件,发现信号模态比架构复杂度更重要,单模态IP模型性能最优。

Comments 14 pages main text, 8 figures. Submitted to IEEE Journal of Biomedical and Health Informatics (JBHI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22171 2026-06-23 cs.LG 新提交 50%

Beyond Time Series: Spatial Reasoning for Epidemic Forecasting via Multimodal Learning

超越时间序列:基于多模态学习的空间推理用于流行病预测

Diana Guadalupe Gomez, Chenwei Wu, Zhiyi Wang, Liyue Shen, Alexander Rodríguez

机构 * University of Michigan(密歇根大学)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 提出M-SPICE框架,通过注意力机制融合区域级时序数据与空间辅助信号,在COVID-19、流感和ILI预测任务上超越现有基线。

Comments To appear in the Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026), AI for Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21066 2026-06-23 cs.CL 新提交 50%

Demographic Metadata as Construct-Irrelevant Noise in DistilBERT-Based Automated Essay Scoring

人口统计元数据作为基于DistilBERT的自动作文评分中的构念无关噪声

Teik Peng Ch'ng, Hui Na Chua

机构 * Sunway University(Sunway大学) Faculty of Engineering and Technology(工程与技术学院)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 研究通过ASAP 2.0数据集,发现将人口统计元数据与文本简单拼接会显著降低DistilBERT评分模型的预测准确性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20603 2026-06-23 cs.CY 新提交 50%

A Survey of Large Language Models for Perception and Measurement of Human Psychology

大型语言模型在人类心理感知与测量中的综述

Yudong Li, Xiaoyi Chen, Jiawei Cai, Zehao Zhong, Haoyang Yang, Huajin Tang, Linlin Shen

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 本文系统综述了大型语言模型(LLMs)作为人类心理测量工具的应用,从理论可行性、测量方法和应用效果三个维度构建分析框架,探讨其在人格评估和心理健康评价中的有效性及局限。

Comments Accepted by IEEE Transactions on Cognitive and Developmental Systems

详情

展开后加载摘要…

URL PDF HTML 收藏