arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

共收录 495 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 音视频/视觉语言融合 495 篇

2511.22103 2025-12-01 cs.CV 57%

MoE3D: Mixture of Experts meets Multi-Modal 3D Understanding

MoE3D:专家混合方法与多模态3D理解

Yu Li, Yuenan Hou, Yingmei Wei, Xinge Zhu, Yuexin Ma, Wenqi Shao, Yanming Guo

机构 * National University of Defense Technology(国防科技大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) ShanghaiTech University(上海科技大学)

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 MoE3D通过整合专家混合方法,提升多模态3D理解的性能,尤其在Multi3DRefer任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21780 2025-12-01 cs.MM cs.SD 57%

3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation

3MDiT:用于文本驱动同步音频视频生成的统一三模态扩散变换器

Yaoru Li, Heyu Si, Federico Landi, Pilar Oplustil Gallegos, Ioannis Koutsoumpas, O. Ricardo Cortez Vazquez, Ruiju Fu, Qi Guo, Xin Jin, Shunyu Liu, Mingli Song

机构 * Zhejiang University(浙江大学) Huawei(华为) Nanyang Technological University(南洋理工大学)

专题命中 音视频/视觉语言融合 :feature-level fusion(abstract);分类 cs.MM

AI总结 3MDiT提出了一种统一三模态扩散变换器,通过联合演变流实现文本驱动的同步音频视频生成,提升多模态对齐与同步性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20167 2025-11-26 cs.MM 57%

FINE: Factorized multimodal sentiment analysis via mutual INformation Estimation

FINE: 通过互信息估计进行因子化多模态情感分析

Yadong Liu, Shangfei Wang

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.MM

AI总结 本文提出了一种基于互信息估计的因子化多模态情感分析框架,通过分解模态为共享和独特表示,抑制噪声并提升情感表示质量,从而在多个数据集上优于现有方法。

Comments 15 pages, 9 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20000 2025-11-26 eess.SP 57%

Cross-Modal Semantic Communication for Heterogeneous Collaborative Perception

跨模态语义通信用于异构协同感知

Mingyi Lu, Guowei Liu, Le Liang, Chongtao Guo, Hao Ye, Shi Jin

专题命中 音视频/视觉语言融合 :information fusion(abstract);分类 eess.SP

AI总结 本文提出跨模态语义通信框架,通过统一语义空间实现异构传感器车辆间的高效协同感知,提升低信噪比环境下的感知性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17585 2025-11-26 cs.LG cs.AI cs.CV 57%

PaSE: Prototype-aligned Calibration and Shapley-based Equilibrium for Multimodal Sentiment Analysis

PaSE:原型对齐校准与基于Shapley的均衡用于多模态情感分析

Kang He, Boyu Chen, Yuzhe Ding, Fei Li, Chong Teng, Donghong Ji

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 PaSE通过原型对齐校准和基于Shapley的均衡框架,有效缓解多模态情感分析中的模态竞争问题,提升模型性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17681 2025-11-25 cs.CV 57%

Vision-Motion-Reference Alignment for Referring Multi-Object Tracking via Multi-Modal Large Language Models

基于多模态大语言模型的视觉-运动-参考对齐的指称多目标跟踪

Weiyi Lv, Ning Zhang, Hanyang Sun, Haoran Jiang, Kai Zhao, Jing Xiao, Dan Zeng

机构 * Shanghai University(上海大学) PAII Inc.(PAII公司)

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 VMRMOT通过多模态大语言模型实现视觉-运动-参考对齐,提升指称多目标跟踪的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19390 2025-11-21 eess.SP 57%

Depression diagnosis from patient interviews using multimodal machine learning

基于多模态机器学习的抑郁症诊断

Jana Weber, Marcel Weber, Juan Miguel Lopez Alcaraz

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 eess.SP

AI总结 本研究通过多模态机器学习整合语音、语言和临床信息,提升抑郁症诊断的准确性与临床实用性。

Comments Accepted by Frontiers in Psychiatry, 19 pages, 5 figures, source code under https://github.com/UOLMDA2025/Depression

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14766 2025-11-20 cs.IR cs.MM 57%

OTCR: Optimal Transmission, Compression and Representation for Multimodal Information Extraction

Yang Li, Yajiao Wang, Wenhao Hu, Zhixiong Zhang, Mengting Zhang

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.MM

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11126 2025-11-17 cs.CL cs.CV 57%

Enhancing Meme Emotion Understanding with Multi-Level Modality Enhancement and Dual-Stage Modal Fusion

Yi Shi, Wenlong Meng, Zhenyuan Guo, Chengkun Wei, Wenzhi Chen

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10560 2025-11-17 cs.CV 57%

OmniVGGT: Omni-Modality Driven Visual Geometry Grounded Transformer

Haosong Peng, Hao Li, Yalun Dai, Yushi Lan, Yihang Luo, Tianyu Qi, Zhengshen Zhang, Yufeng Zhan, Junfei Zhang, Wenchao Xu, Ziwei Liu

机构 * HKUST(香港科技大学) NTU(国立台湾大学) SYSU(南方科技大学) NUS(国立新加坡大学) Alibaba Group(阿里巴巴集团)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

Comments Project Page: https://livioni.github.io/OmniVGGT-official/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25070 2025-10-30 cs.CV 57%

Vision-Language Integration for Zero-Shot Scene Understanding in Real-World Environments

Manjunath Prasad Holenarasipura Rajiv, B. M. Vidyavathi

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

Comments Preprint under review at IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07326 2025-10-10 cs.MM cs.SD 57%

Audio-Visual Separation with Hierarchical Fusion and Representation Alignment

Han Hu, Dongheng Lin, Qiming Huang, Yuqi Hou, Hyung Jin Chang, Jianbo Jiao

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01677 2025-10-03 cs.LG cs.CV 57%

Beyond Simple Fusion: Adaptive Gated Fusion for Robust Multimodal Sentiment Analysis

Han Wu, Yanming Sun, Yunhe Yang, Derek F. Wong

专题命中 音视频/视觉语言融合 :information fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24505 2025-09-30 cs.CV 57%

Robust Multimodal Semantic Segmentation with Balanced Modality Contributions

Jiaqi Tan, Xu Zheng, Fangyu Li, Yang Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) HKUST(GZ)(香港科技大学(广州)) INSAIT

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21377 2025-09-29 cs.CV cs.AI 57%

Dynamic Multi-Target Fusion for Efficient Audio-Visual Navigation

Yinfeng Yu, Hailong Zhang, Meiling Zhu

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) No. 59 Middle School of Urumqi(乌鲁木齐市第五十九中学)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

Comments Main paper (8 pages). Accepted for publication by ECAI( European Conference on Artificial Intelligence) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21245 2025-09-26 cs.CV cs.AI 57%

Hunyuan3D-Omni: A Unified Framework for Controllable Generation of 3D Assets

Team Hunyuan3D, :, Bowen Zhang, Chunchao Guo, Haolin Liu, Hongyu Yan, Huiwen Shi, Jingwei Huang, Junlin Yu, Kunhong Li, Linus, Penghao Wang, Qingxiang Lin, Sicong Liu, Xianghui Yang, Yixuan Tang, Yunfei Zhao, Zeqiang Lai, Zhihao Liang, Zibo Zhao

机构 * Tencent(腾讯)

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

Comments Technical Report; 3D Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18816 2025-09-24 cs.SD cs.CL cs.MM eess.AS 57%

Pay More Attention To Audio: Mitigating Imbalance of Cross-Modal Attention in Large Audio Language Models

Junyu Wang, Ziyang Ma, Zhengding Luo, Tianrui Wang, Meng Ge, Xiaobao Wang, Longbiao Wang

机构 * 1Laboratory of Cognitive Computing Application, College of Intelligence Computing, Tianjin University, Tianjin, China 2School of Computer Science, Shanghai Jiao Tong University, Shanghai, China 3School of Electrical \& Electronic Engineering, Nanyang Technological University, Singapore 4Huiyan Technology (Tianjin) Co., Ltd, Tianjin, China

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.MM

Comments Submitted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16618 2025-09-23 cs.CV cs.AI 57%

Surgical-MambaLLM: Mamba2-enhanced Multimodal Large Language Model for VQLA in Robotic Surgery

Pengfei Hao, Hongqiu Wang, Shuaibo Li, Zhaohu Xing, Guang Yang, Kaishun Wu, Lei Zhu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Imperial College London(帝国理工学院伦敦分校) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

Comments Early accepted by MICCAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07879 2025-09-15 cs.IR cs.AI cs.CV 57%

OMGM: Orchestrate Multiple Granularities and Modalities for Efficient Multimodal Retrieval

Wei Yang, Jingjing Fu, Rui Wang, Jinyu Wang, Lei Song, Jiang Bian

机构 * Microsoft Research Asia(微软亚洲研究院)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

Comments Accepted to ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08570 2025-09-11 cs.CV 57%

Vision-Language Semantic Aggregation Leveraging Foundation Model for Generalizable Medical Image Segmentation

Wenjun Yu, Yinchen Zhou, Jia-Xuan Jiang, Shubin Zeng, Yuee Li, Zhong Wang

机构 * organization= School of Information Science \& Engineering, Lanzhou University , addressline= , city= Lanzhou , postcode= 730000 , country= China

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

Comments 29 pages and 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22483 2025-08-18 cs.LG cs.AI cs.CV 57%

A Closer Look at Multimodal Representation Collapse

Abhra Chaudhuri, Anjan Dutta, Tu Bui, Serban Georgescu

机构 * Fujitsu Research of Europe(富士通欧洲研究)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

Comments International Conference on Machine Learning (ICML) 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04058 2025-08-18 cs.CV 57%

LSVG: Language-Guided Scene Graphs with 2D-Assisted Multi-Modal Encoding for 3D Visual Grounding

Feng Xiao, Hongbin Xu, Guocan Zhao, Wenxiong Kang

机构 * School of Automation Science and Engineering, South China University of Technology(自动化科学与工程学院,华南理工大学) School of Future Technology, South China University of Technology(未来技术学院,华南理工大学)

专题命中 音视频/视觉语言融合 :information fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07023 2025-08-12 cs.CV 57%

MV-CoRe: Multimodal Visual-Conceptual Reasoning for Complex Visual Question Answering

Jingwei Peng, Jiehao Chen, Mateo Alejandro Rojas, Meilin Zhang

机构 * Shaanxi University of Technology(陕西理工大学) Technological University of Peru(秘鲁技术大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00391 2025-08-04 cs.CV eess.AS 57%

Cued-Agent: A Collaborative Multi-Agent System for Automatic Cued Speech Recognition

Guanjie Huang, Danny H. K. Tsang, Shan Yang, Guangzhi Lei, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tencent AI Lab(腾讯AI实验室)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08204 2025-07-30 cs.CV 57%

One-stage Modality Distillation for Incomplete Multimodal Learning

Shicai Wei, Yang Luo, Chunbo Luo

机构 * School of Information and Communication Engineering University of Electronic Science and Technology of China(信息与通信工程学院 电子科学与技术大学)

专题命中 音视频/视觉语言融合 :information fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03283 2025-07-08 cs.CV 57%

MolVision: Molecular Property Prediction with Vision Language Models

Deepan Adak, Yogesh Singh Rawat, Shruti Vyas

机构 * NIT Kurukshetra(尼特学院) University of Central Florida(中央佛罗里达大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18943 2025-06-25 cs.CV 57%

From Pixels and Words to Waves: A Unified Framework for Spectral Dictionary vLLMs

Andrew Kiruluta, Priscilla Burity

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16385 2025-06-23 cs.CV cs.AI cs.LG 57%

CLIP-MG: Guiding Semantic Attention with Skeletal Pose Features and RGB Data for Micro-Gesture Recognition on the iMiGUE Dataset

Santosh Patapati, Trisanth Srinivasan, Amith Adiraju

机构 * Cyrion Labs, Texas, United States(Cyrion实验室,德克萨斯州,美国)

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07950 2025-06-17 cs.CV 57%

Decoupled Cross-Modal Alignment Network for Text-RGBT Person Retrieval and A High-Quality Benchmark

Yifei Deng, Chenglong Li, Zhenyu Chen, Zihen Xu, Jin Tang

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) National Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology(光电信息采集与防护技术国家重点实验室) Anhui Provincial Key Laboratory of Multimodal Cognitive Computation(安徽省多模态认知计算重点实验室)

专题命中 音视频/视觉语言融合 :information fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09999 2025-06-13 cs.LG cs.MM cs.SD eess.AS 57%

Leveraging Pre-Trained Models for Multimodal Class-Incremental Learning under Adaptive Fusion

Yukun Chen, Zihuan Qiu, Fanman Meng, Hongliang Li, Linfeng Xu, Qingbo Wu

机构 * University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏