arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-03-18 至 2026-03-18 共收录 10 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 红外-可见光融合 2 篇

2603.16165 2026-03-18 cs.CV cs.AI 79%

Homogeneous and Heterogeneous Consistency progressive Re-ranking for Visible-Infrared Person Re-identification

同质与异质一致性渐进重排序用于可见-红外人重识别

Yiming Wang

专题命中 红外-可见光融合 :visible-infrared(title,abstract);分类 cs.CV

AI总结 本文提出HHCR方法,通过同质和异质一致性重排序解决跨模态人重识别中的模态差异问题,实验表明其方法具有泛化能力并达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16699 2026-03-18 physics.optics 50%

Efficient generation of entangled photons in the telecommunications range using nonlinear metasurfaces integrated with ScAlN/GaN heterostructures

在电信波段高效生成纠缠光子的非线性超材料与ScAlN/GaN异质结构集成

Jaeyeon Yu, Jewel Mohajan, Mikhail Tokman, Jackson Stewart, Anthony Rice, Sadhvikas Addamane, Oana Malis, Alejandro W. Rodriguez, Igal Brener, Raktim Sarma, Alexey Belyanin

专题命中 红外-可见光融合 :infrared and visible(abstract)

AI总结 本文提出利用ScAlN/GaN量子阱与介电超材料集成的新方法,通过非线性效应实现高效参量下转换,生成电信波段纠缠光子,提升量子通信与计算性能。

Comments 31 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 遥感融合与全色锐化 1 篇

2512.06330 2026-03-18 cs.CV 79%

S2WMamba: A Wavelet-Assisted Mamba-Based Dual-Branch Network For Pansharpening

S2WMamba:一种基于小波的Mamba双分支网络用于全色合成

Haoyu Zhang, Junhan Luo, Yugang Cao, Jie Huang, Liangjian-Deng

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 遥感融合与全色锐化 :pansharpening(title,abstract);分类 cs.CV

AI总结 本文提出S2WMamba网络,通过小波变换分离模态特定频率信息,改进全色合成中的空间细节与光谱保真度的处理,实验表明其在PSNR和HQNR指标上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人多传感器融合 1 篇

2603.16178 2026-03-18 q-bio.NC 50%

Early Pre-Stroke Detection via Wearable IMU-Based Gait Variability and Postural Drift Analysis

通过可穿戴IMU的步态变异性与体位漂移分析实现早期中风风险检测

Chanakan Chaipan, Aueaphum Aueawatthanaphisut

专题命中 机器人多传感器融合 :sensor fusion(abstract)

AI总结 本文提出基于可穿戴传感器的框架,利用单个IMU捕捉骨盆运动,通过步态变异性与体位漂移分析早期中风风险,验证了低成本非侵入式筛查方法的可行性。

Comments 6 pages, 5 figures, 20 equations

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 音视频/视觉语言融合 1 篇

2603.15818 2026-03-18 cs.CV 74%

Conflict-Aware Multimodal Fusion for Ambivalence and Hesitancy Recognition

具有冲突意识的多模态融合用于矛盾与犹豫识别

Salah Eddine Bekhouche, Hichem Telli, Azeddine Benlamoudi, Salah Eddine Herrouz, Abdelmalik Taleb-Ahmed, Abdenour Hadid

机构 * University of the Basque Country UPV/EHU(巴斯克大学UPV/EHU) Laboratory of LESIA, University of Biskra(贝斯克拉大学LESIA实验室) Lab. de Génie Electrique (LAGE), University Kasdi Merbah Ouargla(奥尔加拉大学LAGE实验室) Institute of Electronics, Microelectronics and Nanotechnology (IEMN), Polytechnic University of Hauts-de-France, University of Lille(电子、微电子与纳米技术研究所(IEMN),法国 Hauts-de-France 工业大学,里尔大学) Sorbonne Center for Artificial Intelligence, Sorbonne University Abu Dhabi, UAE(索邦人工智能中心,索邦大学阿布扎比校区,阿联酋)

专题命中 音视频/视觉语言融合 :multimodal fusion(title);分类 cs.CV

AI总结 本文提出ConflictAwareAH框架,通过多模态融合识别矛盾与犹豫状态,提升F1指标,采用冲突特征作为双向线索,改进模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 融合架构与评测 5 篇

2603.16671 2026-03-18 cs.CV 57%

$x^2$-Fusion: Cross-Modality and Cross-Dimension Flow Estimation in Event Edge Space

$x^2$-Fusion:事件边缘空间中的跨模态和跨维度流估计

Ruishan Guo, Ciyu Ruan, Haoyang Wang, Zihang Gong, Jingao Xu, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology(哈尔滨工业大学) The University of Hong Kong(香港大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出$x^2$-Fusion方法,通过事件边缘空间实现跨模态和跨维度流的统一表示,提升动态场景理解的准确性和鲁棒性。

Comments This version is the camera-ready version accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13000 2026-03-18 cs.CV 57%

Omni Survey for Multimodality Analysis in Visual Object Tracking

多模态分析在视觉目标跟踪中的全方位调研

Zhangyong Tang, Tianyang Xu, Xuefeng Zhu, Hui Li, Shaochuan Zhao, Tao Zhou, Chunyang Cheng, Xiaojun Wu, Josef Kittler

机构 * School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) School of Computer Science and Technology, China University of Mining and Technology(中国矿业大学计算机科学与技术学院) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) Centre for Vision, Speech and Signal Processing, University of Surrey(Surrey 大学视觉、语音与信号处理中心)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.CV

AI总结 本文从多模态分析角度调研了多模态视觉目标跟踪(MMVOT)的关键问题,涵盖数据收集、模态对齐、标注、模型设计与评估,分析了现有方法的分类及挑战,并首次探讨了多模态跟踪的适用性及数据集中的类别分布。

Comments The first comprehensive survey for multi-modal visual object tracking; 6 multi-modal tasks; 338 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15939 2026-03-18 cs.LG cs.AI 50%

Data-Local Autonomous LLM-Guided Neural Architecture Search for Multiclass Multimodal Time-Series Classification

数据本地自主LLM引导的神经架构搜索用于多类多模态时间序列分类

Emil Hardarson, Luka Biedebach, Ómar Bessi Ómarsson, Teitur Hrólfsson, Anna Sigridur Islind, María Óskarsdóttir

机构 * University of Southampton(南安普顿大学)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 本文提出一种数据本地的LLM引导神经架构搜索框架,用于多类多模态时间序列分类,通过轻量级融合MLP和专家架构联合搜索提升模型性能,减少人工干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21524 2026-03-18 cs.AI cs.IT math.IT 50%

Large Language Models for Wireless Communications: From Adaptation to Autonomy

大语言模型在无线通信中的应用:从适应到自主

Le Liang, Hao Ye, Yucheng Sheng, Ouya Wang, Jiacheng Wang, Shi Jin, Geoffrey Ye Li

机构 * Southeast University(东南大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Imperial College London(伦敦帝国理工学院)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 本文探讨大语言模型在无线通信中的应用,包括适应预训练模型、开发专用基础模型以及实现自主推理的代理模型,总结其优势与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15623 2026-03-18 cs.IR cs.AI 50%

Finder: A Multimodal AI-Powered Search Framework for Pharmaceutical Data Retrieval

Finder:一种多模态AI驱动的制药数据检索框架

Suyash Mishra, Srikanth Patil, Satyanarayan Pati, Sagar Sahu, Baddu Narendra

机构 * Researcher, Global Product Strategy F. Hoffmann-La Roche Ltd. Basel, Switzerland(全球产品战略研究员 罗氏有限公司 巴塞尔,瑞士) Associate Vice President (Gen AI) Involead Services Pvt Ltd. Pune, India(高级副总裁(生成式人工智能) Involead服务私人有限公司 普纳,印度) Lead Data Scientist Involead Services Pvt Ltd. Delhi, India(首席数据科学家 Involead服务私人有限公司 德里,印度) Data Scientist Involead Services Pvt Ltd. Bhubaneswar, India(数据科学家 Involead服务私人有限公司 奇塔拉,印度)

专题命中 融合架构与评测 :hybrid fusion(abstract)

AI总结 Finder利用混合向量搜索统一文本、图像、音频和视频的检索,通过稀疏词汇和密集语义模型提升多模态内容处理能力,支持自然语言推理搜索,已处理超过29万文档、3.1万视频和1192音频文件。

详情

展开后加载摘要…

URL PDF HTML 收藏