arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-07-30 至 2026-07-30 共收录 3 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 机器人多传感器融合 1 篇

2607.26921 2026-07-30 cs.CV 新提交 57%

From Keypoints to Predictive Distributions: Post-Hoc Uncertainty for YOLO-Pose Models

从关键点到预测分布:YOLO-Pose模型的事后不确定性

Alexej Klushyn, Juan Rivero Sesma, Florian Seligmann, Richard Kurle, Kinh Tieu, Jayant Sen Gupta

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.CV

AI总结 本研究针对YOLO-Pose模型未量化空间不确定性的问题,提出轻量级事后概率扩展方法,结合校准诊断与AKP的评估协议,经COCO实验验证其在关键点可靠性排序等任务中有效,并在飞机着陆场景得到应用。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音视频/视觉语言融合 1 篇

2607.26395 2026-07-30 cs.CV 新提交 57%

Registration-Grounded Spectral Fusion for Unregistered WLI/NBI Endoscopic Lesion Segmentation

基于配准的光谱融合用于未配准的WLI/NBI内镜病灶分割

Pengyu Jie, Wanquan Liu, Rui He, Pengcheng Li, Weiping Wen, Deyu Meng, Junwei Han, Chenqiang Gao

机构 * The First Affiliated Hospital of Sun Yat-sen University(中山大学附属第一医院) School of Computer Science and Technology, Hainan University(海南大学计算机科学与技术学院) School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学院) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对未配准的WLI/NBI内镜病灶分割问题,提出可靠性感知复域融合框架,通过拓扑正则化特征对应与可靠性引导的选择性融合,提升病灶分割性能。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 融合架构与评测 1 篇

2607.26743 2026-07-30 cs.CV cs.AI 新提交 74%

Multimodal fusion of visual and morphometric features for avian bone classification

用于鸟类骨骼分类的视觉与形态计量特征多模态融合

Nevio Dubbini, Lisa Yeomans, Marco Pavia, Ramazan Parmaksiz, Ayse Atas Hooglugt, Gabriele Gattiglia, Beatrice Demarchi

专题命中 融合架构与评测 :multimodal fusion(title);分类 cs.CV

AI总结 本研究提出结合卷积神经网络图像分析与骨计量测量的多模态框架,用于鸟类骨骼分类,在骨骼类型分类准确率达86%,科级分类Top-1准确率51%、Top-3准确率75%,为AI辅助动物考古识别建立了方法学基线。

详情

展开后加载摘要…

URL PDF HTML 收藏