arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-08-12 至 2026-08-12 共收录 8 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 1 篇

2512.22525 2026-08-12 cs.CV 版本更新 57%

DreamOmni3: Scribble-based Editing and Generation

DreamOmni3:基于涂鸦的编辑与生成

Bin Xia, Bohao Peng, Jiyang Liu, Sitong Wu, Jingyao Li, Junjia Huang, Xu Zhao, Yitong Wang, Ruihang Chu, Bei Yu, Jiaya Jia

机构 * CUHK(香港中文大学) ByteDance Inc(字节跳动公司) HKUST(香港科技大学)

专题命中 通用Image Fusion :image fusion(abstract);分类 cs.CV

AI总结 DreamOmni3通过结合文本、图像和自由手绘涂鸦,实现更灵活的图形用户界面编辑与生成,解决了复杂编辑任务中的数据创建和框架设计问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 红外-可见光融合 1 篇

2608.10680 2026-08-12 cs.CV 新提交 79%

Bridging Severe Cross-Modal Misalignment: End-to-End Visible-Infrared Object Detection via Explicit Feature-Domain Affine Registration

缓解严重跨模态错位:通过显式特征域仿射配准实现端到端可见光-红外目标检测

Qi Ming, Yuyang Wang, Mingjing Zhao, Yifan Xiao, Zhixin Guo, Zhiqiang Zhou, Peng Sun, Juan Fang, Fuqiang Yang, Xudong Zhao

机构 * Beijing University of Technology(北京工业大学) Central South University(中南大学) Beijing Electronics Science & Technology Institute(北京电子科学技术研究所) China Aerospace Science & Industry Corporation(中国航天科技集团) Beijing Institute of Technology(北京理工大学) Information Support Force Engineering University(信息支援部队工程大学) Trunk Technology (Beijing) Co., Ltd.(trunk技术(北京)有限公司)

专题命中 红外-可见光融合 :visible-infrared(title,abstract);分类 cs.CV

AI总结 针对可见光-红外目标检测的严重跨模态错位问题,提出JFRDet网络,含CMAA、IGCF、AQCG模块,构建DVMA基准,在该基准上达到69.7% mAP₅₀的SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人多传感器融合 3 篇

2602.16108 2026-08-12 eess.SP 版本更新 79%

Advancing Industry 4.0: Multimodal Sensor Fusion for AI-Based Fault Detection in 3D Printing

推进工业4.0:面向基于3D打印的AI故障检测的多模态传感器融合

Muhammad Fasih Waheed, Shonda Bernadin, Ali Hassan

专题命中 机器人多传感器融合 :sensor fusion(title,abstract);分类 eess.SP

AI总结 本研究提出了一种低成本、便携的多模态传感器融合AI系统,用于实时监测FDM 3D打印过程中的故障,提升制造可靠性和可持续性。

Comments International Journal of Engineering Research and Innovation | v17, n2, Fall/Winter 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10205 2026-08-12 astro-ph.IM 新提交 71%

Sensor fusion on MagAO-X: real time vibration control using accelerometers

MagAO-X上的传感器融合:利用加速度计实现实时振动控制

Parker T. Johnson, Jared R. Males, Povilas Palunas, Olivier Guyon, Sebastiaan Haffert, Joseph Long, Vincent Deo, Julien Lozi, Laird M. Close, Maggie Kautz, Jay Kueny, Jialin Li, Joshua Liberman, Miles Lucas, Matthijs Mars, Eden McEwen, Tiffany Nguyen, Elena Tonucci, Katie Twitchell

专题命中 机器人多传感器融合 :sensor fusion(title)

AI总结 针对MagAO-X极端AO仪器,设计低成本模块化加速度计遥测系统,识别望远镜振动源并分析其与WFE的相关性,为AO系统预测控制提供基础。

Comments 13 pages, 9 figures, proceeding of SPIE Astronomical Telescopes + Instrumentation 2026 (Paper No. 14150-87)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10156 2026-08-12 astro-ph.IM 新提交 50%

The eXtreme Wavefront Control Toolkit: High-Contrast Imaging Instrument Control for Ground and Space-Based Coronagraphs

极端波前控制工具包(XWCTk):地基与空间日冕仪的高对比度成像仪器控制

Jared R. Males, Joseph D. Long, Sebastiaan Y. Haffert, Kyle Van Gorkom, Parker Johnson, Rico Landman, Eden McEwen, Olivier Guyon, Vincent Deo, Miles Lucas, Irina Stefan, Katie Twitchell, Jay Kueny, Joshua Liberman, Adam K. Taras, Adam Schilperoort, Matthijs Mars, Ewan S. Douglas, Laird M. Close

专题命中 机器人多传感器融合 :sensor fusion(abstract)

AI总结 本文介绍专为MagAO-X ExAO仪器开发的XWCTk软件,基于低延迟工具链,可实现仪器控制、数据保存与压缩,适配地基及未来空间高对比度成像仪器,支持远程操作与自动化开发。

Comments Presented at SPIE Astronomical Telescopes + Instrumentation 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 音视频/视觉语言融合 2 篇

2607.15779 2026-08-12 cs.CV 版本更新 57%

Multimodal Ambivalence and Hesitancy Recognition via Cross-Attention and Gated Fusion

通过交叉注意力和门控融合进行多模态矛盾与犹豫识别

Oussama Berhili, Yassine Ouzar, Larbi Boubchir

机构 * University of Paris 8(巴黎第八大学) LIASD Laboratory(LIASD实验室)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 为ECCV 2026的ABAW11挑战赛开发多模态框架,用预训练编码器提取多模态特征,建立单模态基线,在此基础上提出含交叉注意力和门控融合的多模态架构,验证集宏F1达0.7394,提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03921 2026-08-12 eess.AS 版本更新 50%

Cyclostationarity Analysis as a Complement to Self-Supervised Representations for Speech Deepfake Detection

循环平稳性分析作为语音深度伪造检测中自监督表示的补充

Cemal Hanilçi, Md Sahidullah, Tomi Kinnunen

专题命中 音视频/视觉语言融合 :hybrid fusion(abstract)

AI总结 本文提出基于循环平稳性分析的声学特征提取框架,用于提升语音深度伪造检测的性能。

Comments accepted for publication in IEEE Transactions on Audio, Speech and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 融合架构与评测 1 篇

2608.10700 2026-08-12 cs.IR 新提交 71%

Deciding When to Rely on Visual Information: Gated Multimodal Fusion in Sequential Recommendation

何时依赖视觉信息:序列推荐中的门控多模态融合

Natalija Glisovic, Danica Kragic, Martin Tegner

专题命中 融合架构与评测 :multimodal fusion(title)

AI总结 该研究提出VisGate框架,基于物品和用户上下文自适应融合多模态信号,揭示视觉效用随物品、交互稀疏性变化的规律,实现更精准的序列推荐并可解释视觉信息的作用。

Comments 8 pages, 6 figures, Accepted at CARS @ RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏