arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

共收录 1406 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 融合架构与评测 1406 篇

0806.2008 2009-12-01 cs.CV cs.AI 61%

Generalized proportional conflict redistribution rule applied to Sonar imagery and Radar targets classification

Arnaud Martin, Christophe Osswald

专题命中 融合架构与评测 :information fusion(abstract,journal_ref);分类 cs.CV

Journal ref Advances and Applications of DSmT for Information Fusion, Florentin Smarandache & Jean Dezert (Ed.) (2006) 289-304

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11393 2025-11-24 cs.SE cs.AI cs.CR cs.MA 60%

LLM-Agent-UMF: LLM-based Agent Unified Modeling Framework for Seamless Design of Multi Active/Passive Core-Agent Architectures

LLM-Agent-UMF: 基于大语言模型的代理统一建模框架,用于无缝设计多主动/被动核心代理架构

Amine Ben Hassouna, Hana Chaari, Ines Belhaj

机构 * Mediterranean Institute of Technology(地中海技术研究所) South Mediterranean University(南地中海大学) National School of Computer Science(国家计算机科学学校) University of Manouba(曼努巴大学)

专题命中 融合架构与评测 :information fusion(abstract,comments)

AI总结 LLM-Agent-UMF提出了一种基于大语言模型的代理统一建模框架,用于设计多主动/被动核心代理架构,解决了现有架构的模块化和术语不一致问题。

Comments 39 pages, 19 figures, 3 tables. Published in Information Fusion, Volume 127, March 2026, 103865. Part of the special issue "Data Fusion Approaches in Data-Centric AI for Developing Trustworthy AI Systems"

Journal ref Information Fusion 127 (2026) 103865

详情

展开后加载摘要…

URL PDF HTML 收藏
1505.07751 2015-06-01 cs.AI 60%

Pignistic Probability Transforms for Mixes of Low- and High-Probability Events

John J. Sudano

专题命中 融合架构与评测 :information fusion(abstract,comments)

Comments 7 pages, International Society of Information Fusion Conference Proceedings Fusion 2001 at Montreal, Quebec, Canada

Journal ref Fourth International Conference on Information Fusion, August 2001, Montreal. Pages TPUB3 23-27

详情

展开后加载摘要…

URL PDF HTML 收藏
math/0309431 2009-12-01 math.GM 60%

On the Generation of Hyper-powersets for the DSmT

Jean Dezert, Florentin Smarandache

专题命中 融合架构与评测 :information fusion(abstract,comments)

Comments 11 pages, 2 tables, one graph, one computer program. Presented to The Sixth International Conference on Information Fusion, Cairns, Queensland, Australia, 1118-1125, 8-11 July 2003

Journal ref Published in the Proceedings of the Sixth International Conference on Information Fusion, International Society for Information Fusion, Cairns, Queensland, Australia, 1118-1125, 8-11 July 2003

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13102 2026-08-14 cs.CV 新提交 57%

RbFT-Net: Rectify-Before-Fuse Temporal Radar Anchors for 4D Radar-Camera Depth Completion

RbFT-Net:用于4D雷达-相机深度补全的融合前校正时间雷达锚点

Wentao Zhao, Shouxuan Wu, Yongtao Cen, Tianchen Deng, Yuyang Zhang, Jingchuan Wang

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出RbFT-Net框架,通过图像条件校正模块校正雷达锚点并选择性传播,解决雷达测量的稀疏与干扰问题,在相关数据集上的深度补全性能优于对比方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12570 2026-08-14 cs.CV cs.IR 新提交 57%

Attribute-Conditioned Multimodal Slot Factorization for Controllable Fashion Retrieval

用于可控时尚检索的属性条件多模态槽分解

Najmeh Forouzandehmehr, Topojoy Biswas, Evren Korpeoglu, Kannan Achan

机构 * Walmart Global Tech(沃尔玛全球科技)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本研究提出MM-slotgate多模态槽编码器,将Fashion-CLIP嵌入分解为属性槽,在H&M数据集上实现可控时尚检索,颜色等属性性能提升显著,优于多模态融合与仅文本检索方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09550 2026-08-11 cs.CV 新提交 57%

PressureMesh: 3D Human Mesh Estimation from Multi-Device Pressure Images

PressureMesh:基于多设备压力图像的3D人体网格估计

Changhai Ma, Ziyu Wu, Yunkang Zhang, Fangting Xie, Mengting Niu, Heyu Ding, Quan Wan, Jiayue Yuan, Boyan Liu, Yi Ke, Xiaohui Cai

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对单设备压力监测范围有限的问题,提出端到端网络MDP-Net,结合MoE框架的多模态融合机制,构建MDP数据集,实现跨设备压力数据的3D人体网格估计,关节位置误差为12.6cm。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08307 2026-08-11 cs.CV cs.AI 新提交 57%

Frequency-Domain Dual-Branch Fusion for Medical Visual Question Answering

用于医学视觉问答的频域双分支融合

Yusra Tariq, Rakesh Chandra Joshi

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 提出频域双分支融合模块,结合BiomedCLIP与BioBART,在PMC-VQA预训练后于VQA-RAD、SLAKE微调,提升医学VQA性能且架构轻量高效。

Comments 7 Pages, 4 figures, under review at AAAI 27

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25699 2026-08-07 cs.RO 版本更新 57%

SA-LIVO: Efficient LiDAR-Inertial-Visual Odometry with Subspace-Aware Degeneracy Handling

SA-LIVO: 基于子空间感知退化处理的轻量级LiDAR-惯性-视觉里程计

Yinong Cao, Xin He, Shouzheng Zhu, Senyuan Wang, Changhui Jiang, Chenyang Zhang, Pingfeng He, Tingwei Wang, Yuwei Chen, Shijie Liu, Chunlai Li, Genghua Huang, Jianyu Wang

机构 * Key Laboratory of Space Active Opto-Electronics Technology, Shanghai Institute of Technical Physics, Chinese Academy of Sciences(中国科学院上海技术物理研究所空间主动光电技术重点实验室) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.RO

AI总结 提出SA-LIVO系统,通过子空间感知信息融合(SAIF)框架对联合信息矩阵进行特征分解,在方向级别选择性融合LiDAR和视觉测量,解决LiDAR退化与视觉失效问题,实现高精度、低内存的实时里程计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01807 2026-08-04 cs.CV 新提交 57%

Parameter-Dynamic Adaptive Fusion and Calibration Network for RGBT Tracking

用于RGBT跟踪的参数动态自适应融合与校准网络

Zhaoding Ding, Chenglong Li, Jiandong Jin, Kewei Ying, Wentao Wu

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对现有RGBT跟踪器融合参数无法适配目标状态变化的问题,提出PAFCNet,通过TA-HyperNet生成目标条件参数,实现动态融合与时序校准,在多RGBT跟踪基准上取得竞争力性能。

Comments 9 pages,4 figures; Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03273 2026-07-30 cs.CV cs.AI cs.CL 版本更新 57%

VistaHop: Benchmarking Long-Horizon Visual DeepSearch

VistaHop: 视觉深度搜索的多跳视觉推理基准

Hang He, Chuhuai Yue, Chengqi Dong, Chengcheng Wan, Ting Su, Haiying Sun, Jiajun Chai, Xiaohan Wang, Guojun Yin

机构 * East China Normal University(东华大学) Meituan(美团) Shanghai Innovation Institute(上海创新研究院)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.CV

AI总结 提出VistaHop基准,通过多跳问答任务评估多模态大推理模型在视觉深度搜索中的迭代图像检查、视觉锚点定位和跨证据链推理能力,实验表明现有模型表现有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24683 2026-07-28 cs.CV cs.AI cs.LG 新提交 57%

Co-Learning for Missing Arbitrary Modalities in Multi-modal Classification

多模态分类中用于缺失任意模态的协同学习

Francisco Mena, Dino Ienco, Roberto Interdonato, Cassio F. Dantas, Simon Besnard

机构 * GFZ Helmholtz Center for Geosciences(德国波茨坦地学研究中心亥姆霍兹中心) INRAE, UMR TETIS, University of Montpellier(法国蒙彼利埃大学农业环境与生态研究院、蒙彼利埃大学TETIS联合研究单位) INRIA, EVERGREEN, University of Montpellier(法国蒙彼利埃大学信息与自动化研究所、EVERGREEN实验室) CIRAD, UMR TETIS, University of Montpellier(法国蒙彼利埃大学国际农业研究磋商组织、蒙彼利埃大学TETIS联合研究单位)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 针对多模态分类中因操作约束导致训练和推理时模态可用性不一致、存在缺失任意模态的问题,提出多模态协同学习框架,引入特征和决策层面利用信息的两种方法,实验证明在不同缺失模态条件下有显著鲁棒性提升。

Comments Accepted at Discovery Science 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23576 2026-07-28 cs.CV 新提交 57%

Neuromorphic Object Detection: An In-Depth Study and Future Directions

神经形态目标检测:深入研究与未来方向

Jianing Li, Dianze Li, Arren Glover, Xiaopeng Fan, Guoqi Li, Chiara Bartolozzi, Ryad B. Benosman, Yonghong Tian

机构 * Peking University(北京大学) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology(哈尔滨工业大学) Chinese Academy of Sciences(中国科学院) Italian Institute of Technology(意大利理工学院) Carnegie Mellon University(卡内基梅隆大学) University of Pittsburgh(匹兹堡大学) Sorbonne Université(索邦大学) INSERM(法国国家健康与医学研究院) CNRS(法国国家科学研究中心) Institut de la Vision(视觉研究所)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对传统相机在特定条件下目标检测的挑战,本文对神经形态目标检测算法进行全面调查和基准测试,从多视角探索现有方法,评估多种模型并分析结果,讨论未解决问题,为该领域研究提供资源与方向。

Comments Accepted by Proceedings of the IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20897 2026-07-24 cs.CV 新提交 57%

MAGE-Vein: Multi-Instance Age and Gender Estimation from Finger Vein Images

MAGE-Vein:从手指静脉图像进行多实例年龄和性别估计

Katsuki Tanaka, Koichi Ito, Takafumi Aoki, Masakazu Fujio, Yosuke Kaga, Kanade Oshima, Kenta Takahashi

机构 * Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院) Hitachi, Ltd.(日立有限公司)

专题命中 融合架构与评测 :feature-level fusion(abstract);分类 cs.CV

AI总结 针对手指静脉图像年龄估计难题,提出MAGE-Vein多实例多任务学习框架,通过混合特征级融合提取衰老特征并抑制噪声,结合性别分类优化消除血管差异,在平衡数据集上取得良好效果,推翻传统认知。

Comments accepted to IJCB2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20790 2026-07-24 cs.CV 新提交 57%

Ocular Verification for Virtual Reality

虚拟现实中的眼部验证

Husanpreet Singh, Robert Tran, Ayushree Kharel, Sudipta Banerjee

机构 * University of Wyoming(怀俄明大学) San Diego State University(圣地亚哥州立大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 研究虚拟现实中眼部验证,评估虹膜质量指标局限性,用生成模型应对数据挑战,进行单模态与多模态识别及融合,发现部分指标在VR数据上失效,图像调整利于眼周识别,多模态融合降低错误接受率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18336 2026-07-22 cs.MM cs.CL cs.LG 新提交 57%

EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation

EmoEUS:对话中多模态情感识别的不确定性监督

Zilong Huang, Kong Aik Lee, Junjie Li, Zhe Li, Man-Wai Mak

机构 * Dept. of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系) Speech, Language, and Cognition Laboratory, The University of Hong Kong(香港大学语音、语言与认知实验室)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.MM

AI总结 研究对话中多模态情感识别,提出EmoEUS框架,通过动态加权模态执行不确定性感知多模态融合,并引入显式监督损失,实验证明该框架优于现有方法。

Comments Accept by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14702 2026-07-22 cs.CV cs.AI 版本更新 57%

Team RAS in 11th ABAW Competition: Multimodal Ambivalence Recognition Approach

第十一届ABAW竞赛中的团队RAS:多模态矛盾情绪识别方法

Elena Ryumina, Maxim Markitantov, Alexandr Axyonov, Fedor Shchetinin, Timur Abdulkadirov, Dmitry Ryumin, Alexey Karpov

机构 * St. Petersburg Federal Research Center of the Russian Academy of Sciences (SPC RAS)(俄罗斯科学院圣彼得堡联邦研究中心) HSE University(圣彼得堡高等经济学院) ITMO University(圣彼得堡国立信息技术机械与光学大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对第十一届ABAW竞赛的视频级矛盾情绪和犹豫情绪识别,提出以文本为中心的多模态方法,用文本残差融合模型结合多种特征,实验表明该方法能有效提高识别性能,无需大型模型集成。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17182 2026-07-21 cs.CV 新提交 57%

BanClickThumb: A Multimodal Dataset and Transformer Fusion Benchmarks for Clickbait Detection in Bengali YouTube Videos

BanClickThumb:用于孟加拉语YouTube视频中标题党检测的多模态数据集和Transformer融合基准测试

Md. Ariful Islam, Md Tanvirul Islam, Md. Maruf Hossain Miru, Md Khalid Syfullah

机构 * Department of Computer Science and Engineering, Bangladesh Army University of Science and Technology(孟加拉国陆军科技大学计算机科学与工程系)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对孟加拉语YouTube视频标题党检测,公开多模态数据集BanClickThumb,用其对单模态和多模态方法进行基准测试,提出多模态模型BanClickFusionFormer,结合ViT和XLM - RoBERTa,证明多模态融合有效性,提供基准支持低资源多模态内容分析研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24679 2026-07-21 cs.AI eess.SP 版本更新 57%

Multi-modal cross-domain mixed fusion model with dual disentanglement for fault diagnosis under unseen working conditions

用于未知工况下故障诊断的具有双重解缠的多模态跨域混合融合模型

Pengcheng Xia, Yixiang Huang, Chengjin Qin, Chengliang Liu

机构 * State Key Laboratory of Mechanical System and Vibration(机械系统与振动国家重点实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 eess.SP

AI总结 针对未知工况下故障诊断问题,提出具有双重解缠的多模态跨域混合融合模型,通过双重解缠框架、跨域混合融合策略和三模态融合机制,实现多模态表示学习与域泛化,实验验证该方法优于先进方法及各组件有效性。

Comments Accepted for publication in Mechanical Systems and Signal Processing

Journal ref Mechanical Systems and Signal Processing, Volume 258, 2026, 114693

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09118 2026-07-17 cs.CV 版本更新 57%

LPCAN: Lightweight Pyramid Cross-Attention Network for Rail Surface Defect Detection Using RGB-D Data

LPCAN:用于使用RGB-D数据进行铁路表面缺陷检测的轻量级金字塔交叉注意力网络

Jackie Alex, Guoqiang Huan

机构 * St. Petersburg College(斯波伯学院)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对铁路表面缺陷检测方法局限,提出LPCANet,利用RGB-D数据,集成MobileNetv2等模块,经多模态融合与结构分析提升性能。在多数据集上评估效果显著,消融研究验证关键模块作用,为工业缺陷检测提供实用框架,未来将聚焦模型压缩。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13905 2026-07-16 cs.CV cs.LG 新提交 57%

The 2nd International StepUP Competition for Biometric Footstep Recognition: From Steps to Strides

第二届生物特征足迹识别国际StepUP竞赛:从单步到跨步

Robyn Larracy, Anant Gupta, Gourav Gupta, Ethan Eddy, Maxime Devanne, Cyril Meyer, Jin-Chern Chiou, Yueh-Shan Lee, Zong-Han Lu, Aaron Tabor, Erik Scheme

机构 * University of New Brunswick(新不伦瑞克大学) ArogyaPandit Private Limited(阿罗吉亚潘迪特私人有限公司) Institute of Electrical and Control Engineering, National Yang Ming Chiao Tung University(国立阳明交通大学电气与控制工程研究所)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.CV

AI总结 第二届生物特征足迹识别国际StepUP竞赛利用大规模数据集应对三项关键挑战,吸引26个注册者。ArogyaPandit研究团队用时空卷积神经网络结合集成评分策略获8.00%最佳等错误率,顶级方案展示相关策略价值,不过识别未知个人鞋类用户仍具挑战。

Comments Accepted to the 2026 IEEE International Joint Conference on Biometrics (IJCB)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12774 2026-07-15 cs.CV cs.AI 新提交 57%

HSEmotion Team at the 11th ABAW Challenge: Multi-Task Learning and Ambivalence/Hesitancy Video Recognition

第11届ABAW挑战赛中的HSEmotion团队:多任务学习与矛盾/犹豫视频识别

Aleksei Bakin, Andrey V. Savchenko

机构 * Central University(中央大学) Sber AI Lab(Sber人工智能实验室) HSE University(俄罗斯高等经济研究大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 在第11届ABAW挑战赛中,团队用冻结轻量级面部提取器等方法进行多任务学习,在s - Aff - Wild2数据集上超ConvNeXt基线;扩展视听管道用于矛盾/犹豫视频识别,在BAH数据集上提升性能,无需微调重型骨干,展示了轻量级融合的优势。

Comments to be submitted to ABAW-11 workshop of ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20101 2026-07-15 cs.SD cs.AI cs.MM 版本更新 57%

RFM-Editing 2: Text-Guided Audio Editing with Rectified Flow Matching and Coarse-to-Fine Diffusion Transformers

基于整流流的混合扩散变压器用于指令引导音频编辑

Liting Gao, Yonggang Zhu, Yaru Chen, Dongyu Wang, Shubin Zhang, Zhenbo Li, Jean-Yves Guillemaut, Wenwu Wang

机构 * Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey(萨里大学视觉、语音与信号处理中心) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Fisheries College, Ocean University of China(中国海洋大学水产学院) College of Information and Electrical Engineering, China Agricultural University(中国农业大学信息与电气工程学院)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.MM

AI总结 提出混合两阶段扩散变压器架构,通过粗到细策略平衡全局语义对齐与局部细节编辑,在重叠音频事件和复杂指令任务上提升性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09730 2026-07-14 eess.SP 新提交 57%

Multimodal EEG-IMU Fusion for Motor Assessment: Leveraging Task-Dependent Complementarity for Robustness

用于运动评估的多模态脑电-惯性测量单元融合:利用任务相关互补性提高鲁棒性

Zhenan Yin, Lalitha Pranathi Pulavarthy, Saptarshi Purkayastha

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 eess.SP

AI总结 研究针对运动障碍评估中多传感模式整合不足问题,通过同步记录脑电-惯性测量单元数据,评估特定任务模态性能和多模态融合。结果表明脑电和惯性测量单元各有优势,后期融合可利用互补性提高评估可靠性,为大规模临床验证提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03111 2026-07-07 eess.SP 新提交 57%

Edge-Assisted Multimodal UAV Localization with Resource-Efficient Compression and Robust Fusion

基于资源高效压缩和鲁棒融合的边缘辅助多模态无人机定位

Zhong Ye, Yinghui He, Guanding Yu, Pavel Loskot

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 eess.SP

AI总结 设计多模态无人机定位框架,利用相机、LiDAR和雷达传感模态。通过信息瓶颈压缩等模块应对传感节点资源有限、数据差异大及模态数据退化缺失等挑战,实验表明该框架能准确可靠定位无人机。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03934 2026-07-07 cs.CV 新提交 57%

EgoInertia-MI: A Multimodal Egocentric Vision and IMU Benchmark for Motor Impairment Assessment

EgoInertia-MI:用于运动障碍评估的多模态自我中心视觉与惯性测量单元基准测试

Fatemah Alhamdoosh, Pietro Pala, Abduallah Mohamed, DK Arvind

机构 * University of Florence(佛罗伦萨大学) Meta Reality Labs(元现实实验室) University of Edinburgh(爱丁堡大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 研究针对运动障碍评估,结合自我中心视觉与惯性测量单元信号创建EgoInertia-MI数据集,设动作识别等任务并评估基线,发现多模态融合性能最佳,凸显两者结合用于运动评估的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11730 2026-07-07 cs.CV cs.HC cs.LG 版本更新 57%

Multimodal Ambivalence/Hesitancy Recognition in Videos for Personalized Digital Health Interventions

视频中矛盾/犹豫识别用于个性化数字健康干预

Manuela González-González, Soufiane Belharbi, Muhammad Osama Zeeshan, Masoumeh Sharafi, Muhammad Haseeb Aslam, Lorenzo Sia, Nicolas Richet, Marco Pedersoli, Alessandro Lameiras Koerich, Simon L Bacon, Eric Granger

机构 * LIVIA, Dept. of Systems Engineering, ETS Montreal, Canada(ETS蒙特利尔大学系统工程系LIVIA实验室) LIVIA, Dept. of Software and IT Engineering, ETS Montreal, Canada(ETS蒙特利尔大学软件与信息工程系LIVIA实验室) Dept. of Health, Kinesiology, & Applied Physiology, Concordia University, Montreal, Canada(康科迪亚大学健康、运动科学与应用生理学系) Montreal Behavioural Medicine Centre, CIUSSS Nord-de-l’Ile-de-Montréal, Canada(蒙特利尔行为医学中心,蒙特利尔北岛卫生与社会服务局)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文研究了通过深度学习模型在视频中进行矛盾/犹豫识别,以提升数字健康干预的个性化和成本效益,实验基于新的BAH视频数据集,发现需改进多模态模型以准确识别矛盾/犹豫。

Comments 11 pages, 4 figures, ACII 2026. arXiv admin note: substantial text overlap with arXiv:2505.19328

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04277 2026-07-03 cs.CV 版本更新 57%

Event-based vision sensing and its application to pedestrian detection for intelligent transportation and surveillance

基于事件的视觉感知及其在智能交通与监控中行人检测的应用

Han Wang, Juntao Wu, Jingyuan Bao, Min Liu, Yaoxiong Wang, Saiao Zhou, Yuman Nie, Yun Li

机构 * Han Wang, Juntao Wu, Jingyuan Bao, Min Liu, Yaoxiong Wang, Saiao Zhou, Yuman Nie, Yun Li(未知)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 综述事件视觉感知原理及其在行人检测中的应用,比较事件驱动与传统帧方法的优劣,分析现有方法并讨论开放挑战与未来方向。

Comments Published in Advanced Engineering Informatics, Vol. 76, Part B, 104989 (2026). Received 31 December 2025; Revised 3 June 2026; Accepted 18 June 2026; Available online 23 June 2026. DOI: 10.1016/j.aei.2026.104989

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31895 2026-07-01 cs.CV 新提交 57%

RESOLVE: A Multi-Resolution and Multi-Modal Dataset for Roadside Cooperative Perception

RESOLVE:用于路边协同感知的多分辨率多模态数据集

Shaozu Ding, Linan Song, Marco De Vincenzi, Dajiang Suo

机构 * The Polytechnic School, Arizona State University(亚利桑那州立大学理工学院) Department of Computer Science and Engineering, New York University(纽约大学计算机科学与工程系)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 提出RESOLVE数据集,包含多分辨率LiDAR和相机-LiDAR同步数据,用于评估路边3D检测与跟踪中的单模态与融合架构,揭示多模态融合如何补偿LiDAR点稀疏性。

Comments Accepted to ECCV 2026. Including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26455 2026-06-26 cs.CV cs.AI cs.LG 新提交 57%

Active Adversarial Perturbation-driven Associative Memory Retrieval for RGB-Event Visual Object Tracking

主动对抗扰动驱动的关联记忆检索用于RGB-事件视觉目标跟踪

Xiao Wang, Xufeng Lou, Zikang Yan, Lan Chen, Sibao Chen, Yaowei Wang, Yonghong Tian, Jin Tang

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) School of Electronic and Information Engineering, Anhui University(安徽大学电子信息工程学院) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) School of Computer Science, Peking University(北京大学计算机学院) School of Electronic and Computer Engineering, Shenzhen Graduate School, Peking University(北京大学深圳研究生院电子与计算机工程学院)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 提出APRTrack框架,通过分层对抗扰动模拟模态退化与局部缺失,并设计足迹引导的通道校准Hopfield检索实现鲁棒的历史信息补偿,在多个数据集上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏