arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-08-11 至 2026-08-11 共收录 7 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 音视频/视觉语言融合 7 篇

2608.09202 2026-08-11 cs.AI 新提交 78%

CRUISE: Vision-Language Model-Guided Uncertainty-Aware Cross-Modal Sensor Fusion for Robust Autonomous Driving

CRUISE:面向鲁棒自动驾驶的视觉语言模型引导的不确定性感知跨模态传感器融合

Junyao Wang, Yulin Xu, Yu Li, Pramod Khargonekar, Mohammad Abdullah Al Faruque

机构 * University of California, Irvine(加利福尼亚大学欧文分校)

专题命中 音视频/视觉语言融合 :sensor fusion(title,abstract)

AI总结 针对现有不确定性感知融合方法泛化性差的问题,提出CRUISE框架,结合VLM引导的UQ模块与动态自适应机制,实现鲁棒的自动驾驶跨模态传感器融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07565 2026-08-11 cs.CL cs.AI 版本更新 78%

Expert-Guided Multimodal Fusion for Unified Emotion and Sentiment Analysis

通过专家引导的多模态融合与大语言模型的统一框架实现情绪识别与情感分析

Jiaqi Qiao, Xinran Li, Yifan Lyu, Xiujuan Xu, Liu Yu

机构 * School of Software, Dalian University of Technology, China(软件学院,大连理工大学,中国)

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)

AI总结 本文提出EGMF框架,通过专家引导的多模态融合与大语言模型结合,实现情绪识别与情感分析的统一处理,提升跨语言鲁棒性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23755 2026-08-11 cs.CV cs.RO 交叉投稿 76%

DAP-Pose: Deep Temporal Alignment and Physics-aware Cross-modal Sensor Fusion for Robust Pose Estimation

DAP-Pose:用于鲁棒姿态估计的深度时间对齐和物理感知跨模态传感器融合

Jianhan Lin, Yuchu Qin, Jiateng Yuan, Wenbo Zhang, Shuai Gao

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) International Research Center of Big Data for Sustainable Development Goals(可持续发展大数据国际研究中心) University of Chinese Academy of Sciences(中国科学院大学) The University of Adelaide(阿德莱德大学)

专题命中 音视频/视觉语言融合 :sensor fusion(title);分类 cs.CV、cs.RO

AI总结 针对复杂环境下多模态传感器的姿态估计问题,提出DAP-Pose模型,通过双级跨模态融合模块捕捉线索,深度时间对齐模块处理异步流,结合物理感知约束,在KITTI数据集上达最优性能,平均平移误差1.31%,旋转误差0.46°,严重错位下也能准确估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23957 2026-08-11 cs.CV 版本更新 57%

LAVA: Layered Audio-Visual Anti-tampering Watermarking for Robust Deepfake Detection and Localization

LAVA:分层音频视觉抗篡改水印用于鲁棒深度伪造检测与定位

Bokang Zeng, Zheng Gao, Xiaoyu Li, Xiaoyan Feng, Jiaojiao Jiang

机构 * School of Computer Science and Engineering(计算机科学与工程学院) UNSW Sydney(新南威尔士大学悉尼分校) School of Information and Communication Technology(信息与通信技术学院) Griffith University(格里菲斯大学)

专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);分类 cs.CV

AI总结 LAVA通过跨模态水印融合与校准感知对齐,提升深度伪造篡改检测与定位的鲁棒性,实验表明其检测性能接近完美,抗压缩与多模态错位能力强。

Comments Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16609 2026-08-11 cs.CV 版本更新 57%

Describe-to-Score: A text-guided framework for image complexity assessment

描述到评分:一种用于图像复杂度评估的文本引导框架

Shipeng Liu, Liang Zhao, Dengfeng Chen, Zhonglin Zhang

机构 * Xi’an University of Architecture and Technology(西安建筑科技大学)

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 该研究针对现有图像复杂度评估方法无法捕捉高级语义的问题,提出文本引导框架D2S,仅训练阶段引入描述语义正则化,在IC9600基准达SOTA,跨任务也具竞争力。

Comments Accepted by Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08915 2026-08-11 cs.CL 新提交 50%

Investigating Multimodal Informativity under Different Partner Visibility Conditions in Video-Mediated Dialogue

视频介导对话中不同伙伴可见性条件下的多模态信息性研究

Esam Ghaleb, Hugh Mee Wong, Kristina Kobrock

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 本研究针对视频介导对话,构建基于语音、手势或两者的模型识别指称对象,发现手势可单独预测指称,融合模型在转录模型不确定时效果最佳,还揭示了伙伴可见性对互动的语用效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00959 2026-08-11 cs.AI 版本更新 50%

Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition

通过部分信息分解理解多模态语言模型中的模态交互

Wanlong Fang, Tianle Zhang, Wen Tao, Alvin Chan

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract)

AI总结 引入部分信息分解(PID)框架,分离感官和语言输入的独特、冗余和协同贡献,揭示多模态大模型中的模态使用模式,并扩展至三模态系统。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏