arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

共收录 1944
2409.05076 2024-09-10 cs.CV cs.AI

PIP: Detecting Adversarial Examples in Large Vision-Language Models via Attention Patterns of Irrelevant Probe Questions

Yudong Zhang, Ruobing Xie, Jiansheng Chen, Xingwu Sun, Yu Wang

Comments Accepted by ACM Multimedia 2024 BNI track (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04999 2024-09-10 cs.CV cs.MM

Visual Grounding with Multi-modal Conditional Adaptation

Ruilin Yao, Shengwu Xiong, Yichen Zhao, Yi Rong

Comments Accepted by ACM MM 2024 [Oral]

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09481 2024-09-10 cs.CL cs.AI

PanoSent: A Panoptic Sextuple Extraction Benchmark for Multimodal Conversational Aspect-based Sentiment Analysis

Meng Luo, Hao Fei, Bobo Li, Shengqiong Wu, Qian Liu, Soujanya Poria, Erik Cambria, Mong-Li Lee, Wynne Hsu

Comments Accepted by ACM MM 2024 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.11500 2024-09-10 cs.SD cs.CV cs.MM eess.AS

Auto-ACD: A Large-scale Dataset for Audio-Language Representation Learning

Luoyi Sun, Xuenan Xu, Mengyue Wu, Weidi Xie

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04714 2024-09-10 cs.CV

Unleashing the Power of Generic Segmentation Models: A Simple Baseline for Infrared Small Target Detection

Mingjin Zhang, Chi Zhang, Qiming Zhang, Yunsong Li, Xinbo Gao, Jing Zhang

Comments ACM MM'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04447 2024-09-10 cs.SD cs.AI eess.AS

Leveraging Contrastive Learning and Self-Training for Multimodal Emotion Recognition with Limited Labeled Samples

Qi Fan, Yutong Li, Yi Xin, Xinyu Cheng, Guanglai Gao, Miao Ma

Comments Accepted by ACM MM Workshop 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13400 2024-09-06 cs.CV

HiVG: Hierarchical Multimodal Fine-grained Modulation for Visual Grounding

Linhui Xiao, Xiaoshan Yang, Fang Peng, Yaowei Wang, Changsheng Xu

Comments Accepted by ACM MM 2024. The project page: https://github.com/linhuixiao/HiVG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08150 2024-09-06 cs.CV

Hypergraph Multi-modal Large Language Model: Exploiting EEG and Eye-tracking Modalities to Evaluate Heterogeneous Responses for Video Understanding

Minghui Wu, Chenxu Zhao, Anyang Su, Donglin Di, Tianyu Fu, Da An, Min He, Ya Gao, Meng Ma, Kun Yan, Ping Wang

Comments Accepted by ACM MULTIMEDIA 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13993 2024-09-06 cs.MM cs.CV

Zero-Shot Character Identification and Speaker Prediction in Comics via Iterative Multimodal Fusion

Yingxuan Li, Ryota Hinami, Kiyoharu Aizawa, Yusuke Matsui

Comments Accepted to ACM Multimedia 2024. Project page: https://liyingxuan1012.github.io/zeroshot-speaker-prediction ; Github repo: https://github.com/liyingxuan1012/zeroshot-speaker-prediction

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04274 2024-09-05 eess.IV cs.CV

Group-aware Parameter-efficient Updating for Content-Adaptive Neural Video Compression

Zhenghao Chen, Luping Zhou, Zhihao Hu, Dong Xu

Comments Accepted by ACM MM 2024, Melbourne, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.02427 2024-09-05 cs.AI

Multi-Modal Experience Inspired AI Creation

Qian Cao, Xu Chen, Ruihua Song, Hao Jiang, Guang Yang, Zhao Cao

Comments Accepted by ACM Multimedia 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00851 2024-09-04 cs.IR cs.LG cs.SD eess.AS

Dissecting Temporal Understanding in Text-to-Audio Retrieval

Andreea-Maria Oncescu, João F. Henriques, A. Sophia Koepke

Comments 9 pages, 5 figures, ACM Multimedia 2024, https://www.robots.ox.ac.uk/~vgg/research/audio-retrieval/dtu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00636 2024-09-04 cs.IR cs.MA

A Learnable Agent Collaboration Network Framework for Personalized Multimodal AI Search Engine

Yunxiao Shi, Min Xu, Haimin Zhang, Xing Zi, Qiang Wu

Comments ACMMM 2024 MMGR WORKSHOP

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05677 2024-09-04 cs.CV

Evolution-aware VAriance (EVA) Coreset Selection for Medical Image Classification

Yuxin Hong, Xiao Zhang, Xin Zhang, Joey Tianyi Zhou

Comments Accepted by ACM Multimedia 2024 (oral), see: https://openreview.net/forum?id=m1qrB9KSYD

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08340 2024-09-04 cs.CR cs.CV

Achieving Resolution-Agnostic DNN-based Image Watermarking: A Novel Perspective of Implicit Neural Representation

Yuchen Wang, Xingyu Zhu, Guanhui Ye, Shiyao Zhang, Xuetao Wei

Comments Accepted by ACM MM'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14966 2024-09-04 cs.CV cs.AI cs.LG

Mamba3D: Enhancing Local Features for 3D Point Cloud Analysis via State Space Model

Xu Han, Yuan Tang, Zhaoxuan Wang, Xianzhi Li

Comments ACM MM 2024. Code and weights are available at https://github.com/xhanxu/Mamba3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17296 2024-09-04 cs.CV

Learning Exposure Correction in Dynamic Scenes

Jin Liu, Bo Wang, Chuanming Wang, Huiyuan Fu, Huadong Ma

Comments To be published at ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16809 2024-09-02 cs.CV cs.CL cs.MM

See or Guess: Counterfactually Regularized Image Captioning

Qian Cao, Xu Chen, Ruihua Song, Xiting Wang, Xinting Huang, Yuchen Ren

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16314 2024-08-30 cs.CV

ResVG: Enhancing Relation and Semantic Understanding in Multiple Instances for Visual Grounding

Minghang Zheng, Jiahua Zhang, Qingchao Chen, Yuxin Peng, Yang Liu

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13744 2024-08-30 cs.CV

Enhancing Adaptive Deep Networks for Image Classification via Uncertainty-aware Decision Fusion

Xu Zhang, Zhipeng Xie, Haiyang Yu, Qitong Wang, Peng Wang, Wei Wang

Comments 13 pages, 27 figures. In ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18520 2024-08-30 cs.CV

Text-Region Matching for Multi-Label Image Recognition with Missing Labels

Leilei Ma, Hongxing Xie, Lei Wang, Yanping Fu, Dengdi Sun, Haifeng Zhao

Comments Accepted to ACM International Conference on Multimedia (ACM MM) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00650 2024-08-30 cs.CV

Deep Instruction Tuning for Segment Anything Model

Xiaorui Huang, Gen Luo, Chaoyang Zhu, Bo Tong, Yiyi Zhou, Xiaoshuai Sun, Rongrong Ji

Journal ref ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15676 2024-08-29 cs.SD eess.AS

VoxInstruct: Expressive Human Instruction-to-Speech Generation with Unified Multilingual Codec Language Modelling

Yixuan Zhou, Xiaoyu Qin, Zeyu Jin, Shuoyi Zhou, Shun Lei, Songtao Zhou, Zhiyong Wu, Jia Jia

Comments Accepted by ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15641 2024-08-29 cs.CV

MMDRFuse: Distilled Mini-Model with Dynamic Refresh for Multi-Modality Image Fusion

Yanglin Deng, Tianyang Xu, Chunyang Cheng, Xiao-Jun Wu, Josef Kittler

Comments 10 pages, 8 figures, accpeted by ACM International Conference on Multimedia 2024(Oral)

Journal ref 10 pages, 8 figures, accpeted by ACM International Conference on Multimedia 2024(Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19976 2024-08-29 cs.HC cs.MM

MambaGesture: Enhancing Co-Speech Gesture Generation with Mamba and Disentangled Multi-Modality Fusion

Chencan Fu, Yabiao Wang, Jiangning Zhang, Zhengkai Jiang, Xiaofeng Mao, Jiafu Wu, Weijian Cao, Chengjie Wang, Yanhao Ge, Yong Liu

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13608 2024-08-28 cs.MM cs.CL

SpeechCraft: A Fine-grained Expressive Speech Dataset with Natural Language Description

Zeyu Jin, Jia Jia, Qixin Wang, Kehan Li, Shuoyi Zhou, Songtao Zhou, Xiaoyu Qin, Zhiyong Wu

Comments Accepted by ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10662 2024-08-28 cs.CV cs.CR

Private Gradient Estimation is Useful for Generative Modeling

Bochao Liu, Pengju Wang, Weijia Guo, Yong Li, Liansheng Zhuang, Weiping Wang, Shiming Ge

Comments accepted by ACM MM 2024 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.09667 2024-08-28 cs.HC cs.AI cs.SD eess.AS

Human Perception of Audio Deepfakes

Nicolas M. Müller, Karla Pizzi, Jennifer Williams

Comments Published at ACM Multimedia 2022 Workshop DDAM First International Workshop on Deepfake Detection for Audio Multimedia at ACM Multimedia 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13385 2024-08-27 cs.CV

MICM: Rethinking Unsupervised Pretraining for Enhanced Few-shot Learning

Zhenyu Zhang, Guangyao Chen, Yixiong Zou, Zhimeng Huang, Yuhua Li, Ruixuan Li

Comments ACMMM 2024 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13373 2024-08-27 cs.CV

Learning Unknowns from Unknowns: Diversified Negative Prototypes Generator for Few-Shot Open-Set Recognition

Zhenyu Zhang, Guangyao Chen, Yixiong Zou, Yuhua Li, Ruixuan Li

Comments ACMMM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏