arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-05-01 至 2026-05-01 共收录 6 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 红外-可见光融合 1 篇

2604.27712 2026-05-01 cs.CV cs.CL 79%

Linguistically Informed Multimodal Fusion for Vietnamese Scene-Text Image Captioning: Dataset, Graph Framework, and Phonological Attention

具有语言信息的多模态融合用于越南语场景文本图像描述:数据集、图框架和语音注意力

Nhi Ngoc-Yen Nguyen, Anh-Duc Nguyen, Nghia Hieu Nguyen, Kiet Van Nguyen, Ngan Luu-Thuy Nguyen

机构 * Faculty of Information Science and Engineering(信息科学与工程学院) University of Information Technology(信息技术大学) Vietnam National University(越南国家大学)

专题命中 红外-可见光融合 :multimodal fusion(title,abstract);分类 cs.CV

AI总结 本文提出HSTFG和PhonoSTFG框架,通过图拓扑分析发现跨模态边对场景文本融合有害,并构建首个大规模越南语场景文本描述数据集ViTextCaps,揭示52.8%词汇存在声调符号冲突风险。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 医学影像融合 1 篇

2604.27217 2026-05-01 cs.AI 50%

Toward Personalized Digital Twins for Cognitive Decline Assessment: A Multimodal, Uncertainty-Aware Framework

迈向认知下降评估的个性化数字孪生:一种多模态、不确定性感知的框架

Bulent Soykan, Gulsah Hancerliogullari Koksalmis, Hsin-Hsiung Huang, Laura J. Brattain

机构 * Department of Mechanical, Industrial \& Manufac. Eng. The University of Toledo Toledo, OH, USA Department of Industrial Eng. Mngt. Systems University of Central Florida Orlando, FL, USA Department of Statistics Data Science University of Central Florida Orlando, FL, USA Department of Internal Medicine University of Central Florida Orlando, FL, USA

专题命中 医学影像融合 :multimodal fusion(abstract)

AI总结 本文提出了一种多模态、不确定性感知的框架,用于从稀疏、噪声和不规则的纵向数据中建模患者特定的疾病轨迹,通过结合潜在状态空间模型、多模态融合和不确定性感知验证,实现对认知下降的个性化评估。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人多传感器融合 2 篇

2501.07451 2026-05-01 cs.CV 79%

A Survey on Dynamic Neural Networks: from Computer Vision to Multi-modal Sensor Fusion

动态神经网络综述:从计算机视觉到多模态传感器融合

Fabio Montello, Ronja Güldenring, Simone Scardapane, Lazaros Nalpantidis

机构 * DTU Electrical and Photonics Engineering, Technical University of Denmark(丹麦技术大学电气与光子工程系) DIET Department, Sapienza University of Rome(罗马萨皮恩扎大学DIET系)

专题命中 机器人多传感器融合 :sensor fusion(title,abstract);分类 cs.CV

AI总结 本文综述了动态神经网络在计算机视觉中的应用,探讨了其在多模态传感器融合中的优势,提出了一种基于网络组件适应性的分类方法,并提供了相关研究的资源库。

Comments Under review at Image and Vision Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27825 2026-05-01 cs.SE 50%

Requirements Debt in AI-Enabled Perception Systems Development: An Industrial RE4AI Perspective

人工智能赋能感知系统开发中的需求债务:一种工业RE4AI视角

Hina Saeeda, Soniya Abraham

专题命中 机器人多传感器融合 :sensor fusion(abstract)

AI总结 本文从工业RE4AI视角探讨AI赋能感知系统开发中的需求债务问题,分析功能和非功能需求演变如何产生并传播需求债务,揭示其对系统审计性、可靠性及认证准备性的负面影响。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 融合架构与评测 2 篇

2604.27259 2026-05-01 cs.CV cs.LG 57%

VTBench: A Multimodal Framework for Time-Series Classification with Chart-Based Representations

VTBench: 一种基于图表表示的多模态时间序列分类框架

Madhumitha Venkatesan, Xuyang Chen, Dongyu Liu

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出VTBench,通过融合原始序列和图表可视化,系统评估了时间序列分类中图表类型、视觉编码和数据集的影响,展示了图表模型在特定领域的竞争力及多模态融合的优势。

Comments 8 pages main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12022 2026-05-01 cs.AI 50%

AI Models for Depressive Disorder Detection and Diagnosis: A Review

用于抑郁症检测和诊断的AI模型:综述

Dorsa Macky Aleagha, Payam Zohari, Mostafa Haghir Chehreghani

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 本文综述了55项研究中的最新AI方法,提出层次分类体系,揭示图神经网络、大语言模型和多模态融合三大趋势,提供数据集和评估指标,为计算精神病学未来创新提供路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏