arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

共收录 495 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 音视频/视觉语言融合 495 篇

2310.04991 2023-10-12 cs.CV 57%

Video-Teller: Enhancing Cross-Modal Generation with Fusion and Decoupling

Haogeng Liu, Qihang Fan, Tingkai Liu, Linjie Yang, Yunzhe Tao, Huaibo Huang, Ran He, Hongxia Yang

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16308 2023-09-29 cs.MM cs.SD eess.AS 57%

Audio Visual Speaker Localization from EgoCentric Views

Jinzheng Zhao, Yong Xu, Xinyuan Qian, Wenwu Wang

专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15494 2023-09-28 cs.CV cs.CL 57%

VideoAdviser: Video Knowledge Distillation for Multimodal Transfer Learning

Yanan Wang, Donghuo Zeng, Shinya Wada, Satoshi Kurihara

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

Comments Accepted by IEEE Access

Journal ref in IEEE Access, vol. 11, pp. 51229-51240, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.13340 2023-08-28 cs.CV 57%

TriGait: Aligning and Fusing Skeleton and Silhouette Gait Data via a Tri-Branch Network

Yan Sun, Xueling Feng, Liyan Ma, Long Hu, Mark Nixon

专题命中 音视频/视觉语言融合 :hybrid fusion(abstract);分类 cs.CV

Comments Accepted by IJCB 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.13592 2023-08-22 cs.MM cs.LG cs.SD eess.AS 57%

TACOformer:Token-channel compounded Cross Attention for Multimodal Emotion Recognition

Xinda Li

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.MM

Comments Accepted by IJCAI 2023- AI4TS workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09369 2023-08-21 cs.CV 57%

Single Frame Semantic Segmentation Using Multi-Modal Spherical Images

Suresh Guttikonda, Jason Rambach

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

Comments Accepted at WACV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04352 2023-08-09 cs.CV 57%

3D-VisTA: Pre-trained Transformer for 3D Vision and Text Alignment

Ziyu Zhu, Xiaojian Ma, Yixin Chen, Zhidong Deng, Siyuan Huang, Qing Li

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.12745 2023-08-07 cs.CV cs.AI 57%

Audio-Visual Deception Detection: DOLOS Dataset and Parameter-Efficient Crossmodal Learning

Xiaobao Guo, Nithish Muthuchamy Selvaraj, Zitong Yu, Adams Wai-Kin Kong, Bingquan Shen, Alex Kot

专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);分类 cs.CV

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13659 2023-07-20 cs.CV 57%

Flare-Aware Cross-modal Enhancement Network for Multi-spectral Vehicle Re-identification

Aihua Zheng, Zhiqi Ma, Zi Wang, Chenglong Li

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02050 2023-06-07 cs.LG cs.CV 57%

Provable Dynamic Fusion for Low-Quality Multimodal Data

Qingyang Zhang, Haitao Wu, Changqing Zhang, Qinghua Hu, Huazhu Fu, Joey Tianyi Zhou, Xi Peng

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

Comments Accepted by ICML 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11172 2023-05-19 cs.CV cs.CL cs.SD eess.AS 57%

ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities

Peng Wang, Shijie Wang, Junyang Lin, Shuai Bai, Xiaohuan Zhou, Jingren Zhou, Xinggang Wang, Chang Zhou

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

Comments 30 pages, 9 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03277 2023-05-08 cs.CV 57%

FM-ViT: Flexible Modal Vision Transformers for Face Anti-Spoofing

Ajian Liu, Zichang Tan, Zitong Yu, Chenxu Zhao, Jun Wan, Yanyan Liang, Zhen Lei, Du Zhang, Stan Z. Li, Guodong Guo

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.05699 2023-04-13 cs.IR cs.MM 57%

Multimodal Matching-aware Co-attention Networks with Mutual Knowledge Distillation for Fake News Detection

Linmei Hu, Ziwang Zhao, Weijian Qi, Xuemeng Song, Liqiang Nie

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.15182 2023-04-12 cs.HC cs.RO 57%

Husformer: A Multi-Modal Transformer for Multi-Modal Human State Recognition

Ruiqi Wang, Wonse Jo, Dezhong Zhao, Weizheng Wang, Baijian Yang, Guohua Chen, Byung-Cheol Min

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.13386 2023-03-21 cs.CV 57%

Self-supervised Contrastive Learning for Audio-Visual Action Recognition

Yang Liu, Ying Tan, Haoyuan Lan

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.05338 2023-03-14 cs.SD cs.MM eess.AS 57%

MMCosine: Multi-Modal Cosine Loss Towards Balanced Audio-Visual Fine-Grained Learning

Ruize Xu, Ruoxuan Feng, Shi-Xiong Zhang, Di Hu

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.01480 2023-03-03 cs.CV 57%

Delivering Arbitrary-Modal Semantic Segmentation

Jiaming Zhang, Ruiping Liu, Hao Shi, Kailun Yang, Simon Reiß, Kunyu Peng, Haodong Fu, Kaiwei Wang, Rainer Stiefelhagen

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

Comments Accepted by CVPR 2023. Dataset and our code are at: https://jamycheung.github.io/DELIVER.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.09817 2023-02-24 cs.LG cs.CV 57%

Explainable Human-centered Traits from Head Motion and Facial Expression Dynamics

Surbhi Madan, Monika Gahalawat, Tanaya Guha, Roland Goecke, Ramanathan Subramanian

专题命中 音视频/视觉语言融合 :feature-level fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.08706 2023-02-21 cs.CV 57%

Fine-grained Cross-modal Fusion based Refinement for Text-to-Image Synthesis

Haoran Sun, Yang Wang, Haipeng Liu, Biao Qian

专题命中 音视频/视觉语言融合 :image fusion(abstract);分类 cs.CV

Comments 13 pages, 8 figures, accepted by Chinese Journal of Electronics

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.05727 2023-02-14 cs.CV 57%

Flexible-modal Deception Detection with Audio-Visual Adapter

Zhaoxu Li, Zitong Yu, Nithish Muthuchamy Selvaraj, Xiaobao Guo, Bingquan Shen, Adams Wai-Kin Kong, Alex Kot

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.15824 2023-01-31 cs.MM cs.AI 57%

Improving the Modality Representation with Multi-View Contrastive Learning for Multimodal Sentiment Analysis

Peipei Liu, Xin Zheng, Hong Li, Jie Liu, Yimo Ren, Hongsong Zhu, Limin Sun

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.14777 2022-12-02 cs.CV cs.CL 57%

Alignment-Enriched Tuning for Patch-Level Pre-trained Document Image Models

Lei Wang, Jiabang He, Xing Xu, Ning Liu, Hui Liu

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

Comments Accepted by AAAI 2023. Code is available at https://github.com/MAEHCM/AET

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.14419 2022-11-29 cs.CV 57%

Panoramic Video Salient Object Detection with Ambisonic Audio Guidance

Xiang Li, Haoyuan Cao, Shijie Zhao, Junlin Li, Li Zhang, Bhiksha Raj

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.07643 2022-11-21 cs.CV cs.CL cs.LG 57%

Coarse-to-Fine Vision-Language Pre-training with Fusion in the Backbone

Zi-Yi Dou, Aishwarya Kamath, Zhe Gan, Pengchuan Zhang, Jianfeng Wang, Linjie Li, Zicheng Liu, Ce Liu, Yann LeCun, Nanyun Peng, Jianfeng Gao, Lijuan Wang

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

Comments NeurIPS 2022. Project Website: https://ashkamath.github.io/FIBER_page

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.13954 2022-08-31 cs.CV cs.SD eess.AS 57%

Video-based Cross-modal Auxiliary Network for Multimodal Sentiment Analysis

Rongfei Chen, Wenju Zhou, Yang Li, Huiyu Zhou

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.10457 2022-08-22 cs.CV cs.AI 57%

Language Guided Networks for Cross-modal Moment Retrieval

Kun Liu, Huadong Ma, Chuang Gan

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.10412 2022-08-16 cs.CV 57%

Comprehensive Multi-Modal Interactions for Referring Image Segmentation

Kanishk Jain, Vineet Gandhi

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

Comments Findings of ACL 2022

Journal ref 2022.findings-acl.270

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.13390 2022-06-28 cs.CV cs.LG cs.SD eess.AS 57%

A Comprehensive Survey on Video Saliency Detection with Auditory Information: the Audio-visual Consistency Perceptual is the Key!

Chenglizhao Chen, Mengke Song, Wenfeng Song, Li Guo, Muwei Jian

专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.06619 2022-06-15 cs.CV 57%

TransVG++: End-to-End Visual Grounding with Language Conditioned Vision Transformer

Jiajun Deng, Zhengyuan Yang, Daqing Liu, Tianlang Chen, Wengang Zhou, Yanyong Zhang, Houqiang Li, Wanli Ouyang

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2104.08541

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.01818 2022-05-06 cs.LG cs.AI cs.CL cs.CV eess.AS 57%

i-Code: An Integrative and Composable Multimodal Learning Framework

Ziyi Yang, Yuwei Fang, Chenguang Zhu, Reid Pryzant, Dongdong Chen, Yu Shi, Yichong Xu, Yao Qian, Mei Gao, Yi-Ling Chen, Liyang Lu, Yujia Xie, Robert Gmyr, Noel Codella, Naoyuki Kanda, Bin Xiao, Lu Yuan, Takuya Yoshioka, Michael Zeng, Xuedong Huang

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏