arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

共收录 209 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 融合架构与评测 70 篇

2607.13573 2026-07-16 cs.RO cs.AI 新提交 74%

IMMNet: Hybrid Fusion of Model-based and Data-driven Approaches for Maneuvering Target Tracking

IMMNet:基于模型与数据驱动方法的混合融合用于机动目标跟踪

Yixuan Zhao, Chaoqun Yang, Lin Gao, Yongxiao Tian, Ting Yuan

机构 * School of Automation, Southeast University(东南大学自动化学院) School of ICE, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院) Faculty of Artificial Intelligence, Shanghai University of Electric Power(上海电力大学人工智能学院) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院)

专题命中 融合架构与评测 :hybrid fusion(title);分类 cs.RO

AI总结 针对三维空间机动目标跟踪难题,提出IMMNet算法,融合IMM算法可解释结构与神经组件,能保留贝叶斯推理机制并从数据学习,实验证明该算法在多场景下优于现有算法,是机动目标跟踪的有效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10700 2026-08-12 cs.IR 新提交 71%

Deciding When to Rely on Visual Information: Gated Multimodal Fusion in Sequential Recommendation

何时依赖视觉信息:序列推荐中的门控多模态融合

Natalija Glisovic, Danica Kragic, Martin Tegner

专题命中 融合架构与评测 :multimodal fusion(title)

AI总结 该研究提出VisGate框架,基于物品和用户上下文自适应融合多模态信号,揭示视觉效用随物品、交互稀疏性变化的规律,实现更精准的序列推荐并可解释视觉信息的作用。

Comments 8 pages, 6 figures, Accepted at CARS @ RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23370 2026-07-28 cs.LG cs.CE econ.EM stat.CO 新提交 71%

Bitcoin Price Direction Prediction via Regime-Aware Multi-Modal Fusion of Social Sentiment and Technical Features

通过社会情绪与技术特征的状态感知多模态融合预测比特币价格走势

Muhammad Abdullah Haroon

机构 * FAST National University of Computer and Emerging Sciences (FAST-NUCES)(快速国立计算机与新兴科学大学)

专题命中 融合架构与评测 :multi-modal fusion(title)

AI总结 研究比特币亚日价格预测难题,提出状态感知多模态学习(RAML)方法,依据市场状态动态融合社会情绪与技术特征,实验表明该方法在预测中表现良好,确立状态条件自适应融合为多模态金融预测的必要原则。

Comments 19 pages, 15 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04786 2026-07-07 cs.SE cs.AI cs.MA 新提交 71%

An Exploration of Agentic Information Fusion for Test Maintenance Prediction

用于测试维护预测的智能信息融合探索

Jingxiong Liu, Nasser Mohammadiha, Gregory Gay

机构 * Chalmers University of Technology and University of Gothenburg(楚德斯技术大学和戈特堡大学) Ericsson AB(爱立信有限公司) University of Gothenburg(戈特堡大学)

专题命中 融合架构与评测 :information fusion(title)

AI总结 研究针对测试维护预测问题,提出多智能体框架MAST,通过智能融合多种分析方法及后检查程序,在实际场景中评估,提升了测试维护预测水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26473 2026-06-26 cs.LG eess.AS 新提交 71%

When Does Quality-Aware Multimodal Fusion Matter? A Leakage-Safe Diagnostic for Decision-Level Dependence

质量感知多模态融合何时重要?一种针对决策级依赖的泄漏安全诊断方法

Jaden Moon, Arvind Pillai, Andrew Campbell

机构 * Dartmouth College(达特茅斯学院)

专题命中 融合架构与评测 :multimodal fusion(title)

AI总结 提出一种诊断方法,通过置换测试检验多模态融合中可靠性分数是否真正影响决策,实验表明仅当可靠性信号能预测单模态正确性时才有效。

Comments Accepted to INTERSPEECH 2026. 5 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16154 2026-07-20 cs.CV cs.SY eess.SY 新提交 70%

CLIFE: Camera-LiDAR Fusion Framework for Edge-Deployable Roadside VRU Perception

CLIFE:用于边缘可部署路边VRU感知的相机-激光雷达融合框架

Tam Bang, Hoang H. Nguyen, Lei Cheng, Lihao Guo, Siyang Cao, Hussam Abubakr, Tianya Zhang, Austin Harris, Mina Sartipi

专题命中 融合架构与评测 :sensor fusion(abstract);multi-sensor fusion(abstract);分类 cs.CV

AI总结 针对路边VRU感知难题,提出CLIFE框架,集成无目标在线校准与轻量级后期融合跟踪于单嵌入式设备,无需云卸载。经实验验证,该框架提升了传感器感知能力与鲁棒性,核心运行高效,为下游安全应用提供基础并减少相关开销。

Comments Accepted for publication at the 2026 IEEE 29th International Conference on Intelligent Transportation Systems (ITSC 2026). 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14821 2026-07-17 cs.CV 新提交 70%

Blurring Modal Boundaries: A Unified Survey from Single- to Multi-Modal Person Re-ldentification

模糊模态边界:从单模态到多模态行人重识别的统一综述

Xiao Wang, Bing Wang, Bin Yang, Cuiqun Chen, Xin Xu, Mang Ye

机构 * Wuhan University of Science and Technology(武汉科技大学) Hubei Province Key Laboratory of Intelligent Information Processing and Real-time Industrial System(湖北省智能信息处理与实时工业系统重点实验室) Wuhan University(武汉大学) Anhui University(安徽大学)

专题命中 融合架构与评测 :multi-modal fusion(abstract);visible-infrared(abstract);分类 cs.CV

AI总结 综述行人重识别领域从单模态向多模态发展的转变,系统回顾关键跨模态任务,研究多模态融合ReID,提出基于Transformer的可见光-红外ReID基线框架,并概述未来研究方向。

Comments 61 pages, 6 figures, journal

Journal ref International Journal of Computer Vision.2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06222 2026-07-08 cs.RO 新提交 70%

APVI-SLAM: Real-Time Acoustic-Pressure-Visual-Inertial Localization and Photorealistic Mapping System in Complex Underwater Environment

APVI-SLAM:复杂水下环境中的实时声压视觉惯性定位与真实感映射系统

Hanwen Zhang, Yipeng Zhu, Xiaopeng Guo, Huajian Huang, Sai-Kit Yeung

机构 * Hong Kong University of Science and Technology(香港科技大学) Beijing Institute of Technology(北京理工大学)

专题命中 融合架构与评测 :sensor fusion(abstract);multi-sensor fusion(abstract);分类 cs.RO

AI总结 针对水下视觉惯性SLAM在极端环境中的问题,提出APVI-SLAM系统,通过可靠性感知定位框架和滑动窗口冻结策略增强鲁棒性,用四叉树引导映射模块助力重建,还贡献数据集,实验证明其实现了实时领先的定位与重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27886 2026-06-29 cs.LG 新提交 67%

A Comparison of Fusion Techniques for Multi-Modal Human Activity Recognition on the HARMES Dataset

HARMES数据集上多模态人类活动识别融合技术的比较

Ahmed Mohamady, Robin Burchard, Kristof Van Laerhoven

机构 * University of Siegen(锡根大学)

专题命中 融合架构与评测 :multi-modal fusion(abstract);sensor fusion(abstract)

AI总结 系统比较七种传感器融合方法在HARMES多模态数据集上的性能,发现门控多模态融合在留一参与者评估中宏F1分数达0.82,优于拼接式后期融合基线(0.76)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07574 2026-08-11 cs.CV cs.RO 新提交 62%

Multimodal Skin Lesion Classification with Swin Transformer and Clinical Metadata Fusion

基于Swin Transformer与临床元数据融合的多模态皮肤病变分类

Nethmi Pathirana, Isuru Munasinghe, Dileeka Alwis

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV、cs.RO

AI总结 该研究针对皮肤病变分类的自动化挑战,提出结合Swin Transformer图像特征与临床元数据的多模态框架,在公开数据集上实现92.55%测试准确率,兼具强少数类性能与预测可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22773 2026-07-28 eess.IV cs.CV physics.med-ph 新提交 62%

Metric Surface Reconstruction of Neurosurgical Scenes from Monocular Operating Microscope Images and Microscope Pose

从单目手术显微镜图像和显微镜位姿重建神经外科场景的度量曲面

Thomas Bucher, Didier Neuenschwander, Thomas Petutschnigg, Michael Murek, David Bervini, Andreas Raabe, Manuela Eugster

专题命中 融合架构与评测 :image fusion(abstract);分类 cs.CV、eess.IV

AI总结 研究能否从单目手术显微镜图像和位姿数据重建神经外科场景的三维几何度量,利用预训练模型估计深度、泊松曲面重建点云成网格,结果显示该方法在模型设置中有技术可行性,支持相关手术技术进一步发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21258 2026-06-23 cs.RO cs.CV 新提交 62%

Spectral GS-SLAM: Observability-Aware, Degeneracy-Robust Tracking for Real-Time 3D Gaussian Splatting SLAM

Spectral GS-SLAM:面向实时3D高斯泼溅SLAM的可观测性感知与退化鲁棒跟踪

Edward Beng Wai Tan, Siew-Kei Lam, Dongshuo Zhang

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.CV、cs.RO

AI总结 提出Spectral GS-SLAM,通过自适应补偿退化场景中的欠约束方向,结合ICP与特征约束实现鲁棒跟踪,并利用高斯感知平面性加权机制融合几何信息,在无结构/纹理环境中保持实时性能(40.14 FPS)。

Comments This work has been accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12294 2026-06-11 cs.CV eess.IV 新提交 62%

Bridging the Modality Gap in Forensic Image Retrieval

弥合法医图像检索中的模态差距

Ricardo González-Gazapo, Annette Morales-González, Yoanna Martínez-Díaz, Heydi Méndez-Vázquez, Milton García-Borroto

机构 * Advanced Technologies Application Center (CENATAV)(先进技术应用中心(CENATAV)) Centro de Sistemas Complejos, Facultad de Física, Universidad de La Habana(哈瓦那大学物理学院复杂系统中心)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV、eess.IV

AI总结 提出统一检索框架,利用多模态大语言模型生成文本描述并结合视觉与文本特征融合,提升纹身、人脸素描等法医任务的检索精度与鲁棒性。

Comments 23 pages, 5 figures, paper submitted to Elsevier journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13102 2026-08-14 cs.CV 新提交 57%

RbFT-Net: Rectify-Before-Fuse Temporal Radar Anchors for 4D Radar-Camera Depth Completion

RbFT-Net:用于4D雷达-相机深度补全的融合前校正时间雷达锚点

Wentao Zhao, Shouxuan Wu, Yongtao Cen, Tianchen Deng, Yuyang Zhang, Jingchuan Wang

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出RbFT-Net框架,通过图像条件校正模块校正雷达锚点并选择性传播,解决雷达测量的稀疏与干扰问题,在相关数据集上的深度补全性能优于对比方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12570 2026-08-14 cs.CV cs.IR 新提交 57%

Attribute-Conditioned Multimodal Slot Factorization for Controllable Fashion Retrieval

用于可控时尚检索的属性条件多模态槽分解

Najmeh Forouzandehmehr, Topojoy Biswas, Evren Korpeoglu, Kannan Achan

机构 * Walmart Global Tech(沃尔玛全球科技)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本研究提出MM-slotgate多模态槽编码器,将Fashion-CLIP嵌入分解为属性槽,在H&M数据集上实现可控时尚检索,颜色等属性性能提升显著,优于多模态融合与仅文本检索方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09550 2026-08-11 cs.CV 新提交 57%

PressureMesh: 3D Human Mesh Estimation from Multi-Device Pressure Images

PressureMesh:基于多设备压力图像的3D人体网格估计

Changhai Ma, Ziyu Wu, Yunkang Zhang, Fangting Xie, Mengting Niu, Heyu Ding, Quan Wan, Jiayue Yuan, Boyan Liu, Yi Ke, Xiaohui Cai

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对单设备压力监测范围有限的问题,提出端到端网络MDP-Net,结合MoE框架的多模态融合机制,构建MDP数据集,实现跨设备压力数据的3D人体网格估计,关节位置误差为12.6cm。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08307 2026-08-11 cs.CV cs.AI 新提交 57%

Frequency-Domain Dual-Branch Fusion for Medical Visual Question Answering

用于医学视觉问答的频域双分支融合

Yusra Tariq, Rakesh Chandra Joshi

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 提出频域双分支融合模块,结合BiomedCLIP与BioBART,在PMC-VQA预训练后于VQA-RAD、SLAKE微调,提升医学VQA性能且架构轻量高效。

Comments 7 Pages, 4 figures, under review at AAAI 27

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01807 2026-08-04 cs.CV 新提交 57%

Parameter-Dynamic Adaptive Fusion and Calibration Network for RGBT Tracking

用于RGBT跟踪的参数动态自适应融合与校准网络

Zhaoding Ding, Chenglong Li, Jiandong Jin, Kewei Ying, Wentao Wu

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对现有RGBT跟踪器融合参数无法适配目标状态变化的问题,提出PAFCNet,通过TA-HyperNet生成目标条件参数,实现动态融合与时序校准,在多RGBT跟踪基准上取得竞争力性能。

Comments 9 pages,4 figures; Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24683 2026-07-28 cs.CV cs.AI cs.LG 新提交 57%

Co-Learning for Missing Arbitrary Modalities in Multi-modal Classification

多模态分类中用于缺失任意模态的协同学习

Francisco Mena, Dino Ienco, Roberto Interdonato, Cassio F. Dantas, Simon Besnard

机构 * GFZ Helmholtz Center for Geosciences(德国波茨坦地学研究中心亥姆霍兹中心) INRAE, UMR TETIS, University of Montpellier(法国蒙彼利埃大学农业环境与生态研究院、蒙彼利埃大学TETIS联合研究单位) INRIA, EVERGREEN, University of Montpellier(法国蒙彼利埃大学信息与自动化研究所、EVERGREEN实验室) CIRAD, UMR TETIS, University of Montpellier(法国蒙彼利埃大学国际农业研究磋商组织、蒙彼利埃大学TETIS联合研究单位)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 针对多模态分类中因操作约束导致训练和推理时模态可用性不一致、存在缺失任意模态的问题,提出多模态协同学习框架,引入特征和决策层面利用信息的两种方法,实验证明在不同缺失模态条件下有显著鲁棒性提升。

Comments Accepted at Discovery Science 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23576 2026-07-28 cs.CV 新提交 57%

Neuromorphic Object Detection: An In-Depth Study and Future Directions

神经形态目标检测:深入研究与未来方向

Jianing Li, Dianze Li, Arren Glover, Xiaopeng Fan, Guoqi Li, Chiara Bartolozzi, Ryad B. Benosman, Yonghong Tian

机构 * Peking University(北京大学) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology(哈尔滨工业大学) Chinese Academy of Sciences(中国科学院) Italian Institute of Technology(意大利理工学院) Carnegie Mellon University(卡内基梅隆大学) University of Pittsburgh(匹兹堡大学) Sorbonne Université(索邦大学) INSERM(法国国家健康与医学研究院) CNRS(法国国家科学研究中心) Institut de la Vision(视觉研究所)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对传统相机在特定条件下目标检测的挑战,本文对神经形态目标检测算法进行全面调查和基准测试,从多视角探索现有方法,评估多种模型并分析结果,讨论未解决问题,为该领域研究提供资源与方向。

Comments Accepted by Proceedings of the IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20897 2026-07-24 cs.CV 新提交 57%

MAGE-Vein: Multi-Instance Age and Gender Estimation from Finger Vein Images

MAGE-Vein:从手指静脉图像进行多实例年龄和性别估计

Katsuki Tanaka, Koichi Ito, Takafumi Aoki, Masakazu Fujio, Yosuke Kaga, Kanade Oshima, Kenta Takahashi

机构 * Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院) Hitachi, Ltd.(日立有限公司)

专题命中 融合架构与评测 :feature-level fusion(abstract);分类 cs.CV

AI总结 针对手指静脉图像年龄估计难题,提出MAGE-Vein多实例多任务学习框架,通过混合特征级融合提取衰老特征并抑制噪声,结合性别分类优化消除血管差异,在平衡数据集上取得良好效果,推翻传统认知。

Comments accepted to IJCB2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20790 2026-07-24 cs.CV 新提交 57%

Ocular Verification for Virtual Reality

虚拟现实中的眼部验证

Husanpreet Singh, Robert Tran, Ayushree Kharel, Sudipta Banerjee

机构 * University of Wyoming(怀俄明大学) San Diego State University(圣地亚哥州立大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 研究虚拟现实中眼部验证,评估虹膜质量指标局限性,用生成模型应对数据挑战,进行单模态与多模态识别及融合,发现部分指标在VR数据上失效,图像调整利于眼周识别,多模态融合降低错误接受率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18336 2026-07-22 cs.MM cs.CL cs.LG 新提交 57%

EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation

EmoEUS:对话中多模态情感识别的不确定性监督

Zilong Huang, Kong Aik Lee, Junjie Li, Zhe Li, Man-Wai Mak

机构 * Dept. of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系) Speech, Language, and Cognition Laboratory, The University of Hong Kong(香港大学语音、语言与认知实验室)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.MM

AI总结 研究对话中多模态情感识别,提出EmoEUS框架,通过动态加权模态执行不确定性感知多模态融合,并引入显式监督损失,实验证明该框架优于现有方法。

Comments Accept by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17182 2026-07-21 cs.CV 新提交 57%

BanClickThumb: A Multimodal Dataset and Transformer Fusion Benchmarks for Clickbait Detection in Bengali YouTube Videos

BanClickThumb:用于孟加拉语YouTube视频中标题党检测的多模态数据集和Transformer融合基准测试

Md. Ariful Islam, Md Tanvirul Islam, Md. Maruf Hossain Miru, Md Khalid Syfullah

机构 * Department of Computer Science and Engineering, Bangladesh Army University of Science and Technology(孟加拉国陆军科技大学计算机科学与工程系)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对孟加拉语YouTube视频标题党检测,公开多模态数据集BanClickThumb,用其对单模态和多模态方法进行基准测试,提出多模态模型BanClickFusionFormer,结合ViT和XLM - RoBERTa,证明多模态融合有效性,提供基准支持低资源多模态内容分析研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13905 2026-07-16 cs.CV cs.LG 新提交 57%

The 2nd International StepUP Competition for Biometric Footstep Recognition: From Steps to Strides

第二届生物特征足迹识别国际StepUP竞赛:从单步到跨步

Robyn Larracy, Anant Gupta, Gourav Gupta, Ethan Eddy, Maxime Devanne, Cyril Meyer, Jin-Chern Chiou, Yueh-Shan Lee, Zong-Han Lu, Aaron Tabor, Erik Scheme

机构 * University of New Brunswick(新不伦瑞克大学) ArogyaPandit Private Limited(阿罗吉亚潘迪特私人有限公司) Institute of Electrical and Control Engineering, National Yang Ming Chiao Tung University(国立阳明交通大学电气与控制工程研究所)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.CV

AI总结 第二届生物特征足迹识别国际StepUP竞赛利用大规模数据集应对三项关键挑战,吸引26个注册者。ArogyaPandit研究团队用时空卷积神经网络结合集成评分策略获8.00%最佳等错误率,顶级方案展示相关策略价值,不过识别未知个人鞋类用户仍具挑战。

Comments Accepted to the 2026 IEEE International Joint Conference on Biometrics (IJCB)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12774 2026-07-15 cs.CV cs.AI 新提交 57%

HSEmotion Team at the 11th ABAW Challenge: Multi-Task Learning and Ambivalence/Hesitancy Video Recognition

第11届ABAW挑战赛中的HSEmotion团队:多任务学习与矛盾/犹豫视频识别

Aleksei Bakin, Andrey V. Savchenko

机构 * Central University(中央大学) Sber AI Lab(Sber人工智能实验室) HSE University(俄罗斯高等经济研究大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 在第11届ABAW挑战赛中,团队用冻结轻量级面部提取器等方法进行多任务学习,在s - Aff - Wild2数据集上超ConvNeXt基线;扩展视听管道用于矛盾/犹豫视频识别,在BAH数据集上提升性能,无需微调重型骨干,展示了轻量级融合的优势。

Comments to be submitted to ABAW-11 workshop of ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09730 2026-07-14 eess.SP 新提交 57%

Multimodal EEG-IMU Fusion for Motor Assessment: Leveraging Task-Dependent Complementarity for Robustness

用于运动评估的多模态脑电-惯性测量单元融合:利用任务相关互补性提高鲁棒性

Zhenan Yin, Lalitha Pranathi Pulavarthy, Saptarshi Purkayastha

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 eess.SP

AI总结 研究针对运动障碍评估中多传感模式整合不足问题,通过同步记录脑电-惯性测量单元数据,评估特定任务模态性能和多模态融合。结果表明脑电和惯性测量单元各有优势,后期融合可利用互补性提高评估可靠性,为大规模临床验证提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03111 2026-07-07 eess.SP 新提交 57%

Edge-Assisted Multimodal UAV Localization with Resource-Efficient Compression and Robust Fusion

基于资源高效压缩和鲁棒融合的边缘辅助多模态无人机定位

Zhong Ye, Yinghui He, Guanding Yu, Pavel Loskot

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 eess.SP

AI总结 设计多模态无人机定位框架,利用相机、LiDAR和雷达传感模态。通过信息瓶颈压缩等模块应对传感节点资源有限、数据差异大及模态数据退化缺失等挑战,实验表明该框架能准确可靠定位无人机。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03934 2026-07-07 cs.CV 新提交 57%

EgoInertia-MI: A Multimodal Egocentric Vision and IMU Benchmark for Motor Impairment Assessment

EgoInertia-MI:用于运动障碍评估的多模态自我中心视觉与惯性测量单元基准测试

Fatemah Alhamdoosh, Pietro Pala, Abduallah Mohamed, DK Arvind

机构 * University of Florence(佛罗伦萨大学) Meta Reality Labs(元现实实验室) University of Edinburgh(爱丁堡大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 研究针对运动障碍评估,结合自我中心视觉与惯性测量单元信号创建EgoInertia-MI数据集,设动作识别等任务并评估基线,发现多模态融合性能最佳,凸显两者结合用于运动评估的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31895 2026-07-01 cs.CV 新提交 57%

RESOLVE: A Multi-Resolution and Multi-Modal Dataset for Roadside Cooperative Perception

RESOLVE:用于路边协同感知的多分辨率多模态数据集

Shaozu Ding, Linan Song, Marco De Vincenzi, Dajiang Suo

机构 * The Polytechnic School, Arizona State University(亚利桑那州立大学理工学院) Department of Computer Science and Engineering, New York University(纽约大学计算机科学与工程系)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 提出RESOLVE数据集,包含多分辨率LiDAR和相机-LiDAR同步数据,用于评估路边3D检测与跟踪中的单模态与融合架构,揭示多模态融合如何补偿LiDAR点稀疏性。

Comments Accepted to ECCV 2026. Including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏