arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

共收录 209 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 机器人多传感器融合 36 篇

2608.04319 2026-08-06 eess.SP cs.SY eess.SY 新提交 57%

Dual IMU System for Accurate Gastrointestinal Motility Tracking

用于精确胃肠道动力跟踪的双IMU系统

Ziyao Zhou, Boyan Li, Chenyang Ren, Tiancheng Cao, Dawei Wang, Hen-Wei Huang

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 eess.SP

AI总结 该研究针对单IMU系统易受伪影干扰的问题,提出双IMU系统,结合传感器融合算法可有效区分胃肠道动力与身体运动,实现精确胃肠道动力跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26921 2026-07-30 cs.CV 新提交 57%

From Keypoints to Predictive Distributions: Post-Hoc Uncertainty for YOLO-Pose Models

从关键点到预测分布:YOLO-Pose模型的事后不确定性

Alexej Klushyn, Juan Rivero Sesma, Florian Seligmann, Richard Kurle, Kinh Tieu, Jayant Sen Gupta

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.CV

AI总结 本研究针对YOLO-Pose模型未量化空间不确定性的问题,提出轻量级事后概率扩展方法,结合校准诊断与AKP的评估协议,经COCO实验验证其在关键点可靠性排序等任务中有效,并在飞机着陆场景得到应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16366 2026-07-21 cs.RO cs.AI 新提交 57%

PRISM: Multimodal Terrain Mapping for Rover Navigation in Unstructured Environments

PRISM:非结构化环境中用于漫游车导航的多模态地形映射

Raul Castilla-Arquillo, Carlos Perez-del-Pulgar, Levin Gerdes, Alfonso Garcia-Cerezo, Miguel A. Olivares-Mendez

机构 * SnT, University of Luxembourg(卢森堡大学安全、可靠性和信任跨学科中心) Department of Automation and Systems Engineering, Universidad de Málaga, Andalucía Tech(马拉加大学自动化与系统工程系,安达卢西亚技术大学)

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.RO

AI总结 研究针对非结构化环境中漫游车导航问题,提出PRISM多模态感知系统,利用定制传感器套件和OmniUnet网络,经新数据集验证及现场实验,可在资源受限设备上高效生成可通行性地图,实现漫游车自主导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12518 2026-07-15 eess.SP 新提交 57%

Cellular Signal Constructed Convolutional Vision Transformer for High Accuracy Positioning

用于高精度定位的蜂窝信号构建卷积视觉Transformer

Junshi Chen, Xuhong Li, Russ Whiton, Fredrik Tufvesson

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 eess.SP

AI总结 针对复杂蜂窝环境中定位难题,提出混合卷积视觉Transformer(ConViT)架构,整合CNNs局部感受野与Transformer全局注意力,评估多种信号融合策略,经实验验证其性能显著优于基准模型,且有较低参数数量和计算复杂度,还具备可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09883 2026-07-14 cs.CV cs.CR 新提交 57%

A Dual-Stream Challenge-Response Protocol for Ocular Liveness Verification

一种用于眼部活体检测的双流挑战-响应协议

Ismail Kably

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.CV

AI总结 针对眼部生物识别面临的复杂呈现攻击,提出时空亮度传感器融合协议,构建同步矩阵评估相关生物延迟,通过蒙特卡罗模拟证明理论可分离性及多轮挑战设计的优势,为眼部和虹膜生物识别动态欺骗防御提供理论框架。

Comments 6 pages, 2 figures. Simulation-based theoretical framework; human-subject validation identified as future work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03338 2026-07-07 cs.RO cs.SY eess.SY 新提交 57%

Closed-loop vs. Open-loop Kalman Filter Architectures in Airborne Aided Inertial Navigation

机载辅助惯性导航中的闭环与开环卡尔曼滤波器架构

Antonia Hager, Torleiv H. Bryne

机构 * Airbus Central Research and Technology(空客中央研究与技术中心) Department of Engineering Cybernetics, Norwegian University of Science and Technology(挪威科技大学工程 cybernetics 系)

专题命中 机器人多传感器融合 :information fusion(abstract);分类 cs.RO

AI总结 研究闭环与开环卡尔曼滤波器架构在机载辅助惯性导航中的性能影响,用标准惯性机制和直接位置辅助评估,通过模拟展示不同传感器误差下两种架构的权衡。

Comments 6 pages, 6 figures, submission to IEEE Navicon

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00024 2026-07-02 cs.RO cs.MA cs.SY eess.SY 新提交 57%

Decentralized Geometric Control for Cable-Suspended Payload Transport with Adaptive Mass Estimation

基于自适应质量估计的缆绳悬挂载荷运输的分散几何控制

Hadi Hajieghrary, Benedikt Walter, Paul Schmitt, Miguel Hurtado

机构 * MassRobotics

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.RO

AI总结 提出GPAC四层分层架构,通过隐式协调实现多四旋翼无中心协调运输缆绳悬挂载荷,结合几何控制、自适应质量估计和CBF安全滤波,仿真显示低计算成本下平均跟踪误差33.8厘米。

Comments Accepted to be presented at IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25796 2026-06-25 cs.RO 新提交 57%

MIL-LC: A Robust Magnetometer-Inertial-LiDAR Fusion Multimodal Localization Framework

MIL-LC:一种鲁棒的磁力计-惯性-LiDAR融合多模态定位框架

Qiyang Lyu, Zhenyu Wu, Wei Wang, Hongming Shen, Danwei Wang

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) Centre for Advanced Robotics Technology Innovation (CARTIN)(先进机器人技术创新中心)

专题命中 机器人多传感器融合 :multimodal fusion(abstract);分类 cs.RO

AI总结 提出MIL-LC框架,融合磁力计、惯性和LiDAR,解决GNSS缺失、几何重复或无纹理环境下的定位问题,通过磁地图与LiDAR退化检测实现鲁棒定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25360 2026-06-25 cs.RO 新提交 57%

Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning

解耦语义与几何基础:面向语言条件模仿学习的空间视觉提示

Yanzhe Tang, Xinyu Shao, Yuxuan Hu, Siyu Chen, Bowen Yang, Yajun Gao, Tongtong Cao, Xiu Li, Long Zeng

机构 * Tsinghua University(清华大学) Huawei Technologies Co., Ltd.(华为技术有限公司) National University of Singapore(新加坡国立大学)

专题命中 机器人多传感器融合 :feature-level fusion(abstract);分类 cs.RO

AI总结 提出SVP-IL解耦架构,通过视觉语言基础模型将指令解析为零样本几何掩码,生成空间视觉提示并注入连续动作生成器,在低数据条件下显著提升语言条件模仿学习的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19154 2026-06-18 cs.RO 新提交 57%

Viking Hill Dataset: A Lidar-Radar-Camera Dataset for Detection and Segmentation in Forest Scenes

Viking Hill数据集:用于森林场景检测与分割的激光雷达-雷达-相机数据集

Vladimír Kubelka, Oleksandr Kotlyar, Unal Artan, Martin Magnusson

机构 * Örebro University(奥雷布罗大学) AASS research centre(AASS研究中心) Robot Navigation and Perception Lab(机器人导航与感知实验室)

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.RO

AI总结 提出首个包含4D成像雷达的森林多传感器数据集,通过MinkowskiUNet实现雷达与激光雷达点云的语义分割,并评估树干分割质量与树木尺寸的关系。

Comments 33 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14981 2026-06-16 cs.RO cs.AI cs.LG 新提交 57%

Inference-time Policy Steering via Vision and Touch

通过视觉和触觉进行推理时策略引导

Yilin Wu, Zilin Si, Zeynep Temel, Oliver Kroemer, Andrea Bajcsy

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人多传感器融合 :multimodal fusion(abstract);分类 cs.RO

AI总结 提出ViTaL框架,通过视觉采样验证和触觉引导扩散编辑的双层优化,在推理时引导机器人策略,显著提升接触丰富操作任务的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13970 2026-06-15 cs.RO cs.LG 新提交 57%

An Attention-based Model for Robust Forecasting with Missing Modality

基于注意力的缺失模态鲁棒预测模型

Zhitian Zhang, Wenjie Zi, Yunduz Rakhmangulova, Saghar Irandoust, Hossein Hajimirsadeghi, Thibaut Durand

机构 * Simon Fraser University(西蒙菲莎大学) RBC Borealis

专题命中 机器人多传感器融合 :multimodal fusion(abstract);分类 cs.RO

AI总结 提出一种基于条件变分自编码器和Transformer的多模态模型,通过注意力机制学习统一固定维度的表示,在训练和推理中处理缺失模态,在人类轨迹预测和机器人操作预测任务上优于现有方法。

Comments Work originally done in 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10156 2026-08-12 astro-ph.IM 新提交 50%

The eXtreme Wavefront Control Toolkit: High-Contrast Imaging Instrument Control for Ground and Space-Based Coronagraphs

极端波前控制工具包(XWCTk):地基与空间日冕仪的高对比度成像仪器控制

Jared R. Males, Joseph D. Long, Sebastiaan Y. Haffert, Kyle Van Gorkom, Parker Johnson, Rico Landman, Eden McEwen, Olivier Guyon, Vincent Deo, Miles Lucas, Irina Stefan, Katie Twitchell, Jay Kueny, Joshua Liberman, Adam K. Taras, Adam Schilperoort, Matthijs Mars, Ewan S. Douglas, Laird M. Close

专题命中 机器人多传感器融合 :sensor fusion(abstract)

AI总结 本文介绍专为MagAO-X ExAO仪器开发的XWCTk软件,基于低延迟工具链,可实现仪器控制、数据保存与压缩,适配地基及未来空间高对比度成像仪器,支持远程操作与自动化开发。

Comments Presented at SPIE Astronomical Telescopes + Instrumentation 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25612 2026-07-29 cs.AI 新提交 50%

Multi-Sensor Alignment for Weather Simulations

用于天气模拟的多传感器对齐

Samsad Alam, Devyani Lambhate, Aditya Mohan, Vishal Kumar, Vaibhav Katewa

机构 * Indian Institute of Science(印度科学研究所)

专题命中 机器人多传感器融合 :sensor fusion(abstract)

AI总结 研究针对自动驾驶车辆在恶劣天气下的感知问题,提出参考数据集对齐方法和统一天气编辑方法进行多传感器对齐,经实验验证方法有效,能提升3D目标检测模型在不同天气下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23220 2026-07-28 eess.SY cs.SY 新提交 50%

Embedded Firmware Development for Flight Control, Telemetry, and Video Streaming for DIY UAV Research

用于DIY无人机研究的飞行控制、遥测和视频流的嵌入式固件开发

Ad-Deen Mahbub, Indroneel Roy, Mohammad Kamruzzaman Khan Prince

专题命中 机器人多传感器融合 :sensor fusion(abstract)

AI总结 针对低成本无人机,基于双核ESP32-S3微控制器设计优化固件,利用内核任务分配、零拷贝缓冲区等技术,实现飞行控制、遥测和视频传输,经实验评估能提供精确稳定支持,助力DIY项目和研究。

Comments 6 pages, 12 figures, Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15026 2026-06-16 cs.CL 新提交 50%

Deep Temporal Modeling and Ensemble Fusion for Multimodal Emotion Recognition from Physiological Signals

基于生理信号的深度时间建模与集成融合多模态情感识别

Desta Haileselassie Hagos, Saurav Keshari Aryal, Patrick Ymele-Leki, Anietie Andy, Legand L. Burge

机构 * Howard University(霍华德大学)

专题命中 机器人多传感器融合 :sensor fusion(abstract)

AI总结 本研究评估LSTM、TCN和Transformer在WESAD数据集上的多模态情感识别性能,通过消融实验和传感器级早期融合,并采用晚期融合集成策略,最终集成方法达到98.91%准确率和98.56%宏F1分数。

Comments Accepted for publication in the 17th ACM International Conference on Bioinformatics, Computational Biology and Health Informatics (ACM BCB 2026). DOI: https://doi.org/10.1145/3807503.3819363

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音视频/视觉语言融合 33 篇

2607.19086 2026-07-22 cs.CV 新提交 79%

Advancing Multimodal Fusion on Heterogeneous Medical Data with Hybrid Geometry Attention

利用混合几何注意力推进异构医学数据上的多模态融合

Joy Dhar, Manish Kumar Pandey, Nayyar Zaidi, Chen Chen, Maryam Haghighat, Ferdous Sohel, Puneet Goyal

机构 * Indian Institute of Technology Ropar(印度理工学院罗帕尔分校) RoentGen Health(伦琴健康公司) Deakin University(迪肯大学) University of Central Florida(中佛罗里达大学) Queensland University of Technology(昆士兰科技大学) Murdoch University(莫道克大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract);分类 cs.CV

AI总结 针对异构医学数据多模态融合难题,提出CURE框架,通过HyFuse层及相关模块逐步整合模态,有效捕捉跨模态交互,降低计算成本,在多数据集上评估显示其性能显著提升,优于领先方法。

Comments ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07438 2026-07-09 cs.CV 新提交 79%

Two-Stage Multi-Modal Fusion with Adaptive Alignment for Action Quality Assessment

用于动作质量评估的具有自适应对齐的两阶段多模态融合

Kanglei Zhou, Ruizhi Cai, Xinning Wang, Yijian Zheng, Liyuan Wang, Jianguo Li, Xiaohui Liang

机构 * Tsinghua University(清华大学) Beihang University(北京航空航天大学) Children’s Hospital, Capital Institute of Pediatrics(首都儿科研究所附属儿童医院) Zhongguancun Laboratory(中关村实验室)

专题命中 音视频/视觉语言融合 :multi-modal fusion(title,abstract);分类 cs.CV

AI总结 研究动作质量评估问题,提出两阶段多模态融合框架DualAlign,通过自适应对齐解决跨模态错位等挑战,引入MM-JDM数据集,实验表明该框架在多模态评估中表现出色,相比现有方法有显著提升且在特定条件下稳健。

Comments Accepted to IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09202 2026-08-11 cs.AI 新提交 78%

CRUISE: Vision-Language Model-Guided Uncertainty-Aware Cross-Modal Sensor Fusion for Robust Autonomous Driving

CRUISE:面向鲁棒自动驾驶的视觉语言模型引导的不确定性感知跨模态传感器融合

Junyao Wang, Yulin Xu, Yu Li, Pramod Khargonekar, Mohammad Abdullah Al Faruque

机构 * University of California, Irvine(加利福尼亚大学欧文分校)

专题命中 音视频/视觉语言融合 :sensor fusion(title,abstract)

AI总结 针对现有不确定性感知融合方法泛化性差的问题,提出CRUISE框架,结合VLM引导的UQ模块与动态自适应机制,实现鲁棒的自动驾驶跨模态传感器融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27289 2026-07-31 cs.LG 新提交 78%

TIER-MoE: Trust-Informed Expert Routing via Conditional Modality Risk for Multimodal Fusion in Biomedical Classification

TIER-MoE:用于生物医学分类多模态融合的、基于条件模态风险的信任感知专家路由

Yu Chang, Anzhe Cheng, Chenwei Wu, Zhuoran Wang, Jiahao Chen, Tamoghna Chattopadhyay, Sophia I. Thomopoulos, Paul M. Thompson, Liyue Shen, Paul Bogdan

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)

AI总结 该研究提出TIER-MoE风险引导子空间混合专家模型,用于生物医学分类多模态融合,可提升预测性能与概率校准,在多数据集上优于现有最优方法且具备强零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12686 2026-07-15 cs.CL 新提交 78%

Segregate, Refine, Integrate: Decomposing Multimodal Fusion for Sentiment Analysis

分离、细化、整合:用于情感分析的多模态融合分解

Alexios Filippakopoulos, Elias Kallioras, Nikolaos Xiros, Efthymios Georgiou, Alexandros Potamianos

机构 * National Technical University of Athens(雅典国立技术大学) Athena Research Center(雅典娜研究中心) University of Bern(伯尔尼大学) Archimedes AI(阿基米德人工智能公司) Synaptic Bloom PBC(突触绽放有限责任公司)

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)

AI总结 研究情感分析中的多模态融合问题,提出SeRIn方案,通过分离特定模态与跨模态路径,各自细化演变,将跨模态交互推迟到预测步骤,在CH - SIMS和CMU - MOSEI上取得领先成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19682 2026-06-19 cs.CV 新提交 74%

Vortex: Multi-Modal Fusion System for Intelligent Video Retrieval

Vortex: 面向智能视频检索的多模态融合系统

Duc-Tho Nguyen, Hieu-Hoc Tran-Minh, Khanh-Hoa Lam, Hoang-Nhut Ly, Huu-Phuc Huynh, Thanh-Tien Tran, Trung-Nghia Le

机构 * University of Science, VNU-HCM(越南国立大学胡志明市理科大学) Vietnam National University, Ho Chi Minh City(越南国立大学胡志明市)

专题命中 音视频/视觉语言融合 :multi-modal fusion(title);分类 cs.CV

AI总结 提出Vortex系统,融合自适应关键帧提取、多模态元数据生成及混合检索策略(CLIP与SigLIP2的倒数秩融合),结合Rocchio反馈和多阶段时序搜索,在比赛中取得优异成绩。

Comments SOICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25543 2026-07-29 cs.CV cs.AI 新提交 70%

Less is More: Modality-Decoupling for General AIGC Audio-Video Detection

少即是多:通用AIGC音频-视频检测的模态解耦

Jielun Peng, Yabin Wang, Yaqi Li, Jincheng Liu, Xiaopeng Hong, Athanasios V. Vasilakos

机构 * Harbin Institute of Technology(哈尔滨工业大学) University of Agder(阿格德大学)

专题命中 音视频/视觉语言融合 :feature-level fusion(abstract);decision-level fusion(abstract);分类 cs.CV

AI总结 针对通用AIGC音频-视频检测,现有方法假设不总成立,本文提出DAV-Det系统,通过决策级融合独立建模各模态取证证据,视觉和音频检测器分别利用多粒度表示及门控双分支架构,在挑战赛中排名第一。

Comments First place in the General AIGC Audio-Video Detection Challenge at the IJCAI-ECAI 2026 DDL 2.0 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16327 2026-07-21 cs.CV 新提交 70%

Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation

用于文本引导医学图像分割的定位注入视觉语言语义融合

Songyue Han, Mingye Zou, Shuchang Ye, Lei Bi, Mingyuan Meng

机构 * Air Force Engineering University(空军工程大学) Harbin Institute of Technology(哈尔滨工业大学) University of Sydney(悉尼大学) Institute of Translational Medicine, Shanghai Jiao Tong University(上海交通大学转化医学研究院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

专题命中 音视频/视觉语言融合 :information fusion(abstract);feature-level fusion(abstract);分类 cs.CV

AI总结 研究针对文本引导医学图像分割,提出LoG框架,通过联合执行多尺度目标定位任务,实现三级定位注入语义融合,在三个基准数据集实验中表现出色,优于现有医学图像分割方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06943 2026-08-10 cs.CV 新提交 57%

Dual-Space Modality Consistency Learning for Universal Cross-Modal Re-Identification

用于通用跨模态行人重识别的双空间模态一致性学习

Yujian Zhao, Yukang Zhao, Hankun Liu, Haoxuan Xu, Bo Li, Hanzi Wan, Guanglin Niu

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) School of Humanities and Social Sciences, Beihang University(北京航空航天大学人文与社会科学高等研究院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) School of Informatics, Xiamen University(厦门大学信息学院)

专题命中 音视频/视觉语言融合 :visible-infrared(abstract);分类 cs.CV

AI总结 提出DSMCL即插即用框架,联合建模空间与频域一致性,在5个数据集的17项协议上提升跨模态ReID基线性能,适配多样化异构模态场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03475 2026-08-05 cs.MM cs.AI cs.CL 新提交 57%

Adaptive Modality Reliability Diagnosis and Restoration for Robust Multimodal Intent Recognition

用于鲁棒多模态意图识别的自适应模态可靠性诊断与恢复

Suraj Kumar, Mohnish Raj, Soumi Chattopadhayay, Chandranath Adak, Ayan Dutta

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.MM

AI总结 提出PRIME闭环可靠性引导框架,通过诊断恢复多模态意图识别的不可靠模态,在保持干净数据性能的同时提升了多模态数据各类退化场景下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00043 2026-08-04 eess.SP cs.AI 新提交 57%

Multimodal Wearable-Based Olfactory-Induced Emotion Recognition in Arousal-Valence Dimensions

基于多模态可穿戴设备的嗅觉诱导唤醒-效价维度情感识别

Chen-Yang Xu, Lan Zhang, Fei-Yi Fan, Bin Hu, Qing-Hao Meng

专题命中 音视频/视觉语言融合 :hybrid fusion(abstract);分类 eess.SP

AI总结 针对现有嗅觉情感研究的维度失衡与多模态数据不足问题,构建多模态嗅觉情感数据集,提出STF-HFNet模型,在两个数据集上取得最优情感识别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00986 2026-08-04 cs.CV 新提交 57%

Understanding and Overcoming Cross-modal Fusion Bias in Multimodal Anomaly Detection From A Fisher Information Perspective

从费舍尔信息视角理解和克服多模态异常检测中的跨模态融合偏差

Kaifang Long, Lianbo Ma, Liming Liu, Guoyang Xie

机构 * Northeastern University(东北大学) CATL(宁德时代)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 该研究针对多模态异常检测中被忽视的跨模态融合偏差问题,提出即插即用框架UCFB,经实验验证在多种设置下均实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28375 2026-07-31 cs.AI cs.MM 新提交 57%

HyperClaim: Fine-Grained Cross-Modal Hypergraph Reasoning for Video Misinformation Detection

HyperClaim:用于视频虚假信息检测的细粒度跨模态超图推理

Xiangbo Wang, Jiasheng Zhang, Xingtong Yu, Luoqiang Lei, Delvin Ce Zhang

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.MM

AI总结 HyperClaim是一种用于视频虚假信息检测的判别式时间超图框架,通过细粒度跨模态超图推理,在FactGuard协议下的三个数据集上准确率优于基线方法。

Comments 13 pages, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26395 2026-07-30 cs.CV 新提交 57%

Registration-Grounded Spectral Fusion for Unregistered WLI/NBI Endoscopic Lesion Segmentation

基于配准的光谱融合用于未配准的WLI/NBI内镜病灶分割

Pengyu Jie, Wanquan Liu, Rui He, Pengcheng Li, Weiping Wen, Deyu Meng, Junwei Han, Chenqiang Gao

机构 * The First Affiliated Hospital of Sun Yat-sen University(中山大学附属第一医院) School of Computer Science and Technology, Hainan University(海南大学计算机科学与技术学院) School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学院) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对未配准的WLI/NBI内镜病灶分割问题,提出可靠性感知复域融合框架,通过拓扑正则化特征对应与可靠性引导的选择性融合,提升病灶分割性能。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏