arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-04-28 至 2026-04-28 共收录 6 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 1 篇

2604.22903 2026-04-28 cs.CV cs.AI 57%

On the Complementarity of Quantum and Classical Features: Adaptive Hybrid Quantum-Classical Feature Fusion for Breast Cancer Classification

量子与经典特征的互补性:面向乳腺癌分类的自适应混合量子-经典特征融合

Yasmin Rodrigues Sobrinho, João Renato Ribeiro Manesco, João Paulo Papa

机构 * Department of Computing, São Paulo State University(圣保罗州大学计算机系)

专题命中 通用Image Fusion :hybrid fusion(abstract);分类 cs.CV

AI总结 本文提出一种混合量子-经典架构,通过双分支特征提取管道融合经典模型和量子电路的互补表示,引入三种特征融合策略提升乳腺癌分类性能。

Comments 41 pages, 16 figures. This manuscript is a preprint under review at Artificial Intelligence in Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 自动驾驶多传感器融合 1 篇

2604.22835 2026-04-28 cs.CV cs.AI 57%

ParkingScenes: A Structured Dataset for End-to-End Autonomous Parking in Simulation Scenes

ParkingScenes: 一个用于模拟场景中端到端自动驾驶泊车的结构化数据集

Haonan Chen, Kaiwen Xiao, Bin Tian, Jun Fu

机构 * Institute of Automation(自动化研究所) Chinese Academy of Sciences(中国科学院) School of Art and Design(艺术与设计学院)

专题命中 自动驾驶多传感器融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出ParkingScenes数据集,通过结构化轨迹生成提升泊车性能,展示结构化监督对自主泊车政策学习的有效性。

Comments Accepted by CAC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 融合架构与评测 4 篇

2604.23753 2026-04-28 cs.AI cs.HC cs.LG 71%

Modeling Induced Pleasure through Cognitive Appraisal Prediction via Multimodal Fusion

通过多模态融合进行诱导愉悦的认知评估预测建模

Nastaran Dab, Raziyeh Zall, Mohammadreza Kangavari

机构 * Iran University of Science and Technology(伊朗科学技术大学)

专题命中 融合架构与评测 :multimodal fusion(title)

AI总结 本文提出一种多模态融合模型,通过认知评估变量预测视频诱导的愉悦,解决标签噪声、语义鸿沟、数据稀缺和解释性不足等问题,实验验证了模型在检测视频诱导愉悦方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23325 2026-04-28 cs.CV cs.AI eess.IV 62%

EAD-Net: Emotion-Aware Talking Head Generation with Spatial Refinement and Temporal Coherence

EAD-Net:具有空间细化和时间一致性的情感感知说话头生成

Yahui Li, Yinfeng Yu, Liejun Wang, Shengjie Shen

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV、eess.IV

AI总结 EAD-Net通过引入同步网络监督和时空方向注意力机制,提升情感感知说话头生成的唇同步精度和时间一致性,同时利用大语言模型增强情感语义控制。

Comments Main paper (10 pages). Accepted for publication by ICMR(International Conference on Multimedia Retrieval) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23532 2026-04-28 cs.CV cs.AI 57%

Emotion-Conditioned Short-Horizon Human Pose Forecasting with a Lightweight Predictive World Model

基于轻量预测世界模型的情感条件短周期人体姿态预测

Jingni Huang, Peter Bloodsworth

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文研究了情感嵌入对短周期姿态预测的辅助作用,提出轻量级自回归预测世界模型,结合姿态关键点与情感嵌入,提升情感驱动动作序列的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22757 2026-04-28 cs.IR cs.AI 50%

StratRAG: A Multi-Hop Retrieval Evaluation Dataset for Retrieval-Augmented Generation Systems

StratRAG:用于检索增强生成系统的多跳检索评估数据集

Aryan Patodiya

机构 * Department of Computer Science(计算机科学系) California State University, Fresno(加州州立大学,弗雷斯诺分校)

专题命中 融合架构与评测 :hybrid fusion(abstract)

AI总结 本文提出StratRAG数据集,用于评估检索增强生成系统在多跳推理任务中的表现,通过三种检索策略对比,发现混合检索效果最佳,但桥接问题仍较难。

Comments 6 Pages, 3 Table

详情

展开后加载摘要…

URL PDF HTML 收藏