arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-07-08 至 2026-07-08 共收录 4 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 自动驾驶多传感器融合 1 篇

2606.24805 2026-07-08 cs.CV 新提交 57%

DDStereo: Efficient Dual Decoder Transformers for Stereo 3D Road Anomaly Detection

DDStereo: 用于立体3D道路异常检测的高效双解码器Transformer

Shiyi Mu, Zichong Gu, Zhiqi Ai, Yilin Gao, Shugong Xu

机构 * Shanghai University(上海大学) Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 自动驾驶多传感器融合 :feature-level fusion(abstract);分类 cs.CV

AI总结 提出DDStereo,一种双解码器立体Transformer,通过轻量级解码器分支和紧凑视差特征提取器,实现实时开放集3D目标检测,在封闭和开放集协议下均达到最先进精度。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人多传感器融合 1 篇

2607.05669 2026-07-08 cs.RO cs.LG 新提交 70%

Uncertainty-Aware Velocity Correction for Proprioceptive Vehicle Localization using Evidential Mamba

使用证据曼巴进行本体感知车辆定位的不确定性感知速度校正

Abinav Kalyanasundaram, Karthikeyan Chandra Sekaran, Wolfgang Utschick, Michael Botsch

机构 * AImotion Bavaria, Technische Hochschule Ingolstadt(巴伐利亚AImotion公司,英戈尔施塔特技术应用大学) Technische Universität München(慕尼黑工业大学)

专题命中 机器人多传感器融合 :sensor fusion(abstract);multi-sensor fusion(abstract);分类 cs.RO

AI总结 针对智能车辆在GNSS信号缺失时定位难题,提出EVC-Mamba架构,利用车载传感器数据转化为虚拟速度传感器校正IMU漂移,经曼巴模型捕捉动态、证据深度学习量化不确定性,实现高精度定位且支持实时车载部署。

Comments Accepted at the 2026 International Conference on Indoor Positioning and Indoor Navigation (IPIN 2026), Rome, Italy. 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 音视频/视觉语言融合 1 篇

2607.03018 2026-07-08 cs.CV cs.SD 新提交 57%

$C^3$ASD: Multi-Level Consistency-Driven Representation Learning

$C^3$ASD:多层次一致性驱动的表示学习

Jin Hong, Jisoo Park, Junseok Kwon

机构 * Chung-Ang University(中央大学)

专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);分类 cs.CV

AI总结 研究视频中活跃说话者检测问题,提出$C^3$ASD框架,含嵌入级、序列级和预测级一致性约束,提升跨模态表示鲁棒性,在多种损坏下有显著改进。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 融合架构与评测 1 篇

2607.06222 2026-07-08 cs.RO 新提交 70%

APVI-SLAM: Real-Time Acoustic-Pressure-Visual-Inertial Localization and Photorealistic Mapping System in Complex Underwater Environment

APVI-SLAM:复杂水下环境中的实时声压视觉惯性定位与真实感映射系统

Hanwen Zhang, Yipeng Zhu, Xiaopeng Guo, Huajian Huang, Sai-Kit Yeung

机构 * Hong Kong University of Science and Technology(香港科技大学) Beijing Institute of Technology(北京理工大学)

专题命中 融合架构与评测 :sensor fusion(abstract);multi-sensor fusion(abstract);分类 cs.RO

AI总结 针对水下视觉惯性SLAM在极端环境中的问题,提出APVI-SLAM系统,通过可靠性感知定位框架和滑动窗口冻结策略增强鲁棒性,用四叉树引导映射模块助力重建,还贡献数据集,实验证明其实现了实时领先的定位与重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏