TAViS: Text-bridged Audio-Visual Segmentation with Foundation Models
TAViS: 基于文本的音频视觉分割与基础模型
Ziyang Luo, Nian Liu, Xuguang Yang, Salman Khan, Rao Muhammad Anwer, Hisham Cholakkal, Fahad Shahbaz Khan, Junwei Han
机构
*
Northwestern Polytechnical University(西北工业大学)
;
Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
;
Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院)
专题命中
音频语音多模态
:audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract)
FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units
Jian Wang, Baoyuan Wu, Li Liu, Qingshan Liu
机构
*
School of Computer Science, Nanjing University of Posts and Telecommunications(南京邮电大学计算机科学学院)
;
School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
Bridging Ears and Eyes: Analyzing Audio and Visual Large Language Models to Humans in Visible Sound Recognition and Reducing Their Sensory Gap via Cross-Modal Distillation
Xilin Jiang, Junkai Wu, Vishal Choudhari, Nima Mesgarani
机构
*
College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
;
Innovation Center of Yangtze River Delta, Zhejiang University(浙江大学长三角创新中心)
Comments13 pages, accepted by IEEE JSTSP Special Issue on Deep Learning for Multi-modal Intelligence across Speech, Language, Vision, and Heterogeneous Signals
TANDEM: Temporal-Aware Neural Detection for Multimodal Hate Speech
TANDEM: 面向多模态仇恨言论的时间感知神经检测
Girish A. Koushik, Helen Treharne, Diptesh Kanojia
机构
*
Nature-Inspired Computing & Engineering, University of Surrey(Surrey大学自然启发计算与工程系)
;
Surrey Centre for Cyber Security, University of Surrey(Surrey大学网络安全中心)
Sahibzada Adil Shahzad, Ammarah Hashmi, Junichi Yamagishi, Yusuke Yasuda, Yu Tsao, Chia-Wen Lin, Yan-Tsung Peng, Hsin-Min Wang
机构
*
Social Networks and Human-Centered Computing Program, Taiwan International Graduate Program, Institute of Information Science, Academia Sinica(中央研究院资讯科学研究所台湾国际研究生计划社交网络与人本计算项目)
;
Department of Computer Science, National Chengchi University(国立政治大学资讯科学系)
;
Institute of Information Systems and Applications, National Tsing Hua University(国立清华大学资讯系统与应用研究所)
;
National Institute of Informatics(国立情报学研究所)
;
Department of Electrical Engineering and the Institute of Communications Engineering, National Tsing Hua University(国立清华大学电机工程学系与通讯工程研究所)
;
Research Center for Information Technology Innovation, Academia Sinica(中央研究院资讯科技创新研究中心)
;
Institute of Information Science, Academia Sinica(中央研究院资讯科学研究所)
Multimodal Spatial Language Maps for Robot Navigation and Manipulation
Chenguang Huang, Oier Mees, Andy Zeng, Wolfram Burgard
机构
*
University of Technology Nuremberg(图恩堡技术大学)
;
UC Berkeley(伯克利大学)
;
Google Research(谷歌研究)
专题命中
音频语音多模态
:multimodal(title,abstract);audio-visual(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI、eess.AS
Commentsaccepted to International Journal of Robotics Research (IJRR). 24 pages, 18 figures. The paper contains texts from VLMaps(arXiv:2210.05714) and AVLMaps(arXiv:2303.07522). The project page is https://mslmaps.github.io/