arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-07-29 至 2026-07-29 共收录 8 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 1 篇

2607.25338 2026-07-29 cs.AI 新提交 78%

Dual-Domain Manifold Modeling for Hyperspectral Image Fusion

用于高光谱图像融合的双域流形建模

Chengxin Xie, Qiya Song, Yangbangyan Jiang, Renwei Dian, Xudong Kang

机构 * College of Information Science and Engineering, Hunan Normal University(湖南师范大学信息科学与工程学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院)

专题命中 通用Image Fusion :image fusion(title,abstract)

AI总结 针对高光谱图像融合中几何约束建模难题,提出双域流形建模框架,通过拓扑感知Transformer和频率解耦的空间 - 光谱协同融合模块,有效整合光谱与空间信息,在多数据集实验中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 遥感融合与全色锐化 1 篇

2603.03831 2026-07-29 cs.CV 版本更新 83%

Universal Pansharpening Model

通用全分辨率融合基础模型

Hebaixu Wang, Jing Zhang, Haonan Guo, Di Wang, Jiayi Ma, Bo Du, Liangpei Zhang

机构 * School of Electronic Information, Wuhan University(武汉大学电子信息学院) School of Computer Science, Wuhan University(武汉大学计算机学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) Zhongguancun Academy(中关村学院)

专题命中 遥感融合与全色锐化 :pansharpening(title,abstract);information fusion(abstract);分类 cs.CV

AI总结 FoundPS是一种通用全分辨率融合基础模型,通过模态交错Transformer和潜在扩散桥梁模型实现跨传感器和场景的稳健融合,提升全分辨率融合的泛化能力和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 自动驾驶多传感器融合 1 篇

2512.21831 2026-07-29 cs.CV 版本更新 79%

End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration

端到端3D时空感知与多模态融合及V2X协作

Zhenwei Yang, Yibo Ai, Weidong Zhang

机构 * National Center for Materials Service Safety(材料服务安全国家中心) University of Science and Technology Beijing(北京科技大学)

专题命中 自动驾驶多传感器融合 :multimodal fusion(title,abstract);分类 cs.CV

AI总结 XET-V2X通过多模态融合与V2X协作,实现端到端3D时空感知,提升复杂交通场景下的检测与跟踪性能。

Comments 21 pages, 10 figures

Journal ref IEEE Internet of Things Journal, vol. 13, no. 15, pp. 33456-33475, 1 Aug.1, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人多传感器融合 1 篇

2607.25612 2026-07-29 cs.AI 新提交 50%

Multi-Sensor Alignment for Weather Simulations

用于天气模拟的多传感器对齐

Samsad Alam, Devyani Lambhate, Aditya Mohan, Vishal Kumar, Vaibhav Katewa

机构 * Indian Institute of Science(印度科学研究所)

专题命中 机器人多传感器融合 :sensor fusion(abstract)

AI总结 研究针对自动驾驶车辆在恶劣天气下的感知问题,提出参考数据集对齐方法和统一天气编辑方法进行多传感器对齐,经实验验证方法有效,能提升3D目标检测模型在不同天气下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 音视频/视觉语言融合 2 篇

2607.25543 2026-07-29 cs.CV cs.AI 新提交 70%

Less is More: Modality-Decoupling for General AIGC Audio-Video Detection

少即是多:通用AIGC音频-视频检测的模态解耦

Jielun Peng, Yabin Wang, Yaqi Li, Jincheng Liu, Xiaopeng Hong, Athanasios V. Vasilakos

机构 * Harbin Institute of Technology(哈尔滨工业大学) University of Agder(阿格德大学)

专题命中 音视频/视觉语言融合 :feature-level fusion(abstract);decision-level fusion(abstract);分类 cs.CV

AI总结 针对通用AIGC音频-视频检测,现有方法假设不总成立,本文提出DAV-Det系统,通过决策级融合独立建模各模态取证证据,视觉和音频检测器分别利用多粒度表示及门控双分支架构,在挑战赛中排名第一。

Comments First place in the General AIGC Audio-Video Detection Challenge at the IJCAI-ECAI 2026 DDL 2.0 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25794 2026-07-29 cs.CV 新提交 57%

Fine-Grained Food Image Understanding via Target-Aware Data Alignment

通过目标感知数据对齐实现细粒度食品图像理解

Jui-Feng Chi, Wei-Lun Chu, Bruce Coburn, Jinge Ma, Fengqing Zhu

专题命中 音视频/视觉语言融合 :decision-level fusion(abstract);分类 cs.CV

AI总结 研究针对细粒度食品图像理解,提出以数据为中心的多模态对齐方法,先选视觉相关训练子集,再细化字幕,训练互补检索专家并融合决策,提升了检索性能,完整方法检索分数超纯VLM检索两倍且更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 融合架构与评测 2 篇

2607.25820 2026-07-29 cs.CV 新提交 74%

Food Image Segmentation with LLM-Derived Ingredient Labels and Multimodal Fusion

基于大语言模型衍生成分标签和多模态融合的食品图像分割

Jui-Feng Chi, Wei-Ta Chu, Sheng-Long Lin

机构 * National Cheng Kung University(国立成功大学)

专题命中 融合架构与评测 :multimodal fusion(title);分类 cs.CV

AI总结 针对现有食品图像分割模型在相似成分和罕见类别上表现不佳的问题,提出两个多模态模块LIM-F和LIM-Q,利用大语言模型衍生标签提升分割性能,在FoodSeg103基准测试中取得领先,且内存消耗增加适度,为细粒度食品理解提供实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25679 2026-07-29 cs.LG cs.AI cs.MM 新提交 74%

DynaBridge: Dynamic Summary-Guided Cross-Task Multimodal Fusion for DASS-Structured Mental Health Assessment

DynaBridge:用于DASS结构心理健康评估的动态摘要引导跨任务多模态融合

Shiyu Teng, Haichen Yu, Jiaqing Liu, Hao Sun, Yu Song, Shurong Chai, Ruibo Hou, Lanfen Lin, Yen-Wei Chen

专题命中 融合架构与评测 :multimodal fusion(title);分类 cs.MM

AI总结 研究针对心理健康评估中通用融合模型忽略问卷标签心理测量结构的问题,提出DynaBridge框架,通过编码多模态线索并结合语义摘要进行评估,在官方验证分割上优于基线和其他方法,展现了多模态融合与心理测量结构结合的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏