arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-07-30 至 2026-07-30 共收录 6 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 红外-可见光融合 1 篇

2605.02258 2026-07-30 cs.CV 版本更新 57%

SpectraDINO: Modality-Conditioned Adaptation of RGB Vision Foundation Models Across Infrared Bands

SpectraDINO:跨红外波段的RGB视觉基础模型的模态条件适配

Yagiz Nalcakan, Hyeongjin Ju, Incheol Park, Sanghyeop Yeo, Youngwan Jin, Shiho Kim

专题命中 红外-可见光融合 :visible-infrared(abstract);分类 cs.CV

AI总结 SpectraDINO是适配RGB视觉基础模型的跨红外波段统一骨干网络,通过分阶段蒸馏与微调技术,在7个检测和分割基准上性能优于或媲美特定模态方法。

Comments Updated with the revised model results

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人多传感器融合 2 篇

2510.12346 2026-07-30 cs.RO 版本更新 70%

PolygMap: A Perceptive Locomotion Framework for Humanoid Robot Stair Climbing

PolygMap:用于人形机器人爬楼梯的感知式运动框架

Bingquan Li, Ning Wang, Zhicheng He, Yucong Wu, Tianwei Zhang

机构 * The Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳人工智能与机器人社会研究院) Electronic science and technology, Guangdong University of Technology(广东技术大学电子科学与技术学院) Leju robotics(乐居机器人)

专题命中 机器人多传感器融合 :sensor fusion(abstract);multi-sensor fusion(abstract);分类 cs.RO

AI总结 本文提出PolygMap框架,通过多传感器融合构建多边形楼梯平面语义地图,在NVIDIA Orin上实现20-30Hz全身运动规划,经真实场景实验验证可高效鲁棒地完成人形机器人爬楼梯任务。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26921 2026-07-30 cs.CV 新提交 57%

From Keypoints to Predictive Distributions: Post-Hoc Uncertainty for YOLO-Pose Models

从关键点到预测分布:YOLO-Pose模型的事后不确定性

Alexej Klushyn, Juan Rivero Sesma, Florian Seligmann, Richard Kurle, Kinh Tieu, Jayant Sen Gupta

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.CV

AI总结 本研究针对YOLO-Pose模型未量化空间不确定性的问题,提出轻量级事后概率扩展方法,结合校准诊断与AKP的评估协议,经COCO实验验证其在关键点可靠性排序等任务中有效,并在飞机着陆场景得到应用。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 音视频/视觉语言融合 1 篇

2607.26395 2026-07-30 cs.CV 新提交 57%

Registration-Grounded Spectral Fusion for Unregistered WLI/NBI Endoscopic Lesion Segmentation

基于配准的光谱融合用于未配准的WLI/NBI内镜病灶分割

Pengyu Jie, Wanquan Liu, Rui He, Pengcheng Li, Weiping Wen, Deyu Meng, Junwei Han, Chenqiang Gao

机构 * The First Affiliated Hospital of Sun Yat-sen University(中山大学附属第一医院) School of Computer Science and Technology, Hainan University(海南大学计算机科学与技术学院) School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学院) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对未配准的WLI/NBI内镜病灶分割问题,提出可靠性感知复域融合框架,通过拓扑正则化特征对应与可靠性引导的选择性融合,提升病灶分割性能。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 融合架构与评测 2 篇

2607.26743 2026-07-30 cs.CV cs.AI 新提交 74%

Multimodal fusion of visual and morphometric features for avian bone classification

用于鸟类骨骼分类的视觉与形态计量特征多模态融合

Nevio Dubbini, Lisa Yeomans, Marco Pavia, Ramazan Parmaksiz, Ayse Atas Hooglugt, Gabriele Gattiglia, Beatrice Demarchi

专题命中 融合架构与评测 :multimodal fusion(title);分类 cs.CV

AI总结 本研究提出结合卷积神经网络图像分析与骨计量测量的多模态框架,用于鸟类骨骼分类,在骨骼类型分类准确率达86%,科级分类Top-1准确率51%、Top-3准确率75%,为AI辅助动物考古识别建立了方法学基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03273 2026-07-30 cs.CV cs.AI cs.CL 版本更新 57%

VistaHop: Benchmarking Long-Horizon Visual DeepSearch

VistaHop: 视觉深度搜索的多跳视觉推理基准

Hang He, Chuhuai Yue, Chengqi Dong, Chengcheng Wan, Ting Su, Haiying Sun, Jiajun Chai, Xiaohan Wang, Guojun Yin

机构 * East China Normal University(东华大学) Meituan(美团) Shanghai Innovation Institute(上海创新研究院)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.CV

AI总结 提出VistaHop基准,通过多跳问答任务评估多模态大推理模型在视觉深度搜索中的迭代图像检查、视觉锚点定位和跨证据链推理能力,实验表明现有模型表现有限。

详情

展开后加载摘要…

URL PDF HTML 收藏