arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

共收录 1966
2312.12826 2024-07-30 cs.CV

JoReS-Diff: Joint Retinex and Semantic Priors in Diffusion Model for Low-light Image Enhancement

Yuhui Wu, Guoqing Wang, Zhiwen Wang, Yang Yang, Tianyu Li, Malu Zhang, Chongyi Li, Heng Tao Shen

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15308 2024-07-30 cs.CV

AV-Deepfake1M: A Large-Scale LLM-Driven Audio-Visual Deepfake Dataset

Zhixi Cai, Shreya Ghosh, Aman Pankaj Adatia, Munawar Hayat, Abhinav Dhall, Tom Gedeon, Kalin Stefanov

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16977 2024-07-29 cs.CV cs.MM

Selective Vision-Language Subspace Projection for Few-shot CLIP

Xingyu Zhu, Beier Zhu, Yi Tan, Shuo Wang, Yanbin Hao, Hanwang Zhang

Comments Accepted as an Oral Paper at ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09554 2024-07-29 cs.CV

Embodied Laser Attack:Leveraging Scene Priors to Achieve Agent-based Robust Non-contact Attacks

Yitong Sun, Yao Huang, Xingxing Wei

Comments 9 pages, 7 figures, Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18656 2024-07-29 cs.CV

Auto DragGAN: Editing the Generative Image Manifold in an Autoregressive Manner

Pengxiang Cai, Zhiwei Liu, Guibo Zhu, Yunfang Niu, Jinqiao Wang

Comments This paper has been accepted as a poster paper for ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18244 2024-07-26 cs.CV

RefMask3D: Language-Guided Transformer for 3D Referring Segmentation

Shuting He, Henghui Ding

Comments ACM MM 2024, Code: https://github.com/heshuting555/RefMask3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17911 2024-07-26 cs.MM cs.AI cs.CV

ReCorD: Reasoning and Correcting Diffusion for HOI Generation

Jian-Yu Jiang-Lin, Kang-Yang Huang, Ling Lo, Yi-Ning Huang, Terence Lin, Jhih-Ciang Wu, Hong-Han Shuai, Wen-Huang Cheng

Comments Accepted by ACM MM 2024. Project website: https://alberthkyhky.github.io/ReCorD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17854 2024-07-26 cs.AI cs.CL cs.MM

Shapley Value-based Contrastive Alignment for Multimodal Information Extraction

Wen Luo, Yu Xia, Shen Tianshu, Sujian Li

Comments Accepted at ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17689 2024-07-26 cs.CV

SAM-MIL: A Spatial Contextual Aware Multiple Instance Learning Approach for Whole Slide Image Classification

Heng Fang, Sheng Huang, Wenhao Tang, Luwen Huangfu, Bo Liu

Comments accepted by ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05989 2024-07-26 cs.CV

QE-BEV: Query Evolution for Bird's Eye View Object Detection in Varied Contexts

Jiawei Yao, Yingxin Lai, Hongrui Kou, Tong Wu, Ruixi Liu

Comments Accepted by ACM MM 2024, project page: https://github.com/Jiawei-Yao0812/QE-BEV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05483 2024-07-26 cs.CV

HarmonicNeRF: Geometry-Informed Synthetic View Augmentation for 3D Scene Reconstruction in Driving Scenarios

Xiaochao Pan, Jiawei Yao, Hongrui Kou, Tong Wu, Canran Xiao

Comments Accepted by ACM MM 2024, project page: https://github.com/Jiawei-Yao0812/HarmonicNeRF

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17035 2024-07-25 cs.CV

Q-Ground: Image Quality Grounding with Large Multi-modality Models

Chaofeng Chen, Sensen Yang, Haoning Wu, Liang Liao, Zicheng Zhang, Annan Wang, Wenxiu Sun, Qiong Yan, Weisi Lin

Comments ACM Multimedia 2024 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16863 2024-07-25 cs.LG cs.AI cs.SI

Balanced Multi-Relational Graph Clustering

Zhixiang Shen, Haolan He, Zhao Kang

Comments Accepted by ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16670 2024-07-24 cs.CV cs.CY cs.MM

FakingRecipe: Detecting Fake News on Short Video Platforms from the Perspective of Creative Process

Yuyan Bu, Qiang Sheng, Juan Cao, Peng Qi, Danding Wang, Jintao Li

Comments Will appear at ACM Multimedia 2024 (MM 2024), 13 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16638 2024-07-24 cs.CV

Unveiling and Mitigating Bias in Audio Visual Segmentation

Peiwen Sun, Honggang Zhang, Di Hu

Comments Accepted by ACM MM 24 (ORAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16554 2024-07-24 cs.MM cs.CV cs.SD eess.AS

Coarse-to-Fine Proposal Refinement Framework for Audio Temporal Forgery Detection and Localization

Junyan Wu, Wei Lu, Xiangyang Luo, Rui Yang, Qian Wang, Xiaochun Cao

Comments 9pages, 3figures. This paper has been accepted for ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16394 2024-07-24 cs.CV

SEDS: Semantically Enhanced Dual-Stream Encoder for Sign Language Retrieval

Longtao Jiang, Min Wang, Zecheng Li, Yao Fang, Wengang Zhou, Houqiang Li

Comments Accepted to ACM International Conference on Multimedia (MM) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16244 2024-07-24 cs.CV cs.AI cs.MM

HSVLT: Hierarchical Scale-Aware Vision-Language Transformer for Multi-Label Image Classification

Shuyi Ouyang, Hongyi Wang, Ziwei Niu, Zhenjia Bai, Shiao Xie, Yingying Xu, Ruofeng Tong, Yen-Wei Chen, Lanfen Lin

Comments 10 pages, 6 figures

Journal ref Proceedings of the 31st ACM International Conference on Multimedia. 2023: 4768-4777

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15613 2024-07-24 cs.CV

Visual-Semantic Decomposition and Partial Alignment for Document-based Zero-Shot Learning

Xiangyan Qu, Jing Yu, Keke Gai, Jiamin Zhuang, Yuanmin Tang, Gang Xiong, Gaopeng Gou, Qi Wu

Comments Accepted to ACM International Conference on Multimedia (MM) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09640 2024-07-24 cs.CV

CREST: Cross-modal Resonance through Evidential Deep Learning for Enhanced Zero-Shot Learning

Haojian Huang, Xiaozhen Qiao, Zhuo Chen, Haodong Chen, Bingyu Li, Zhe Sun, Mulin Chen, Xuelong Li

Comments Accepted by ACM MM 2024; 10 pages, 2 Tables, 9 Figures; Repo is available at: https://github.com/JethroJames/CREST

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11469 2024-07-24 cs.CV cs.GR

Generative Motion Stylization of Cross-structure Characters within Canonical Motion Space

Jiaxu Zhang, Xin Chen, Gang Yu, Zhigang Tu

Comments ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10711 2024-07-24 cs.CV cs.AI cs.CL

Weakly Supervised Gaussian Contrastive Grounding with Large Multimodal Models for Video Question Answering

Haibo Wang, Chenghang Lai, Yixuan Sun, Weifeng Ge

Comments accepted by ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17955 2024-07-24 cs.CV

PEAN: A Diffusion-Based Prior-Enhanced Attention Network for Scene Text Image Super-Resolution

Zuoyan Zhao, Hui Xue, Pengfei Fang, Shipeng Zhu

Comments Accepted by ACMMM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15155 2024-07-23 cs.CV cs.AI cs.MM

Distilling Vision-Language Foundation Models: A Data-Free Approach via Prompt Diversification

Yunyi Xuan, Weijie Chen, Shicai Yang, Di Xie, Luojun Lin, Yueting Zhuang

Comments Accepted by ACMMM 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15050 2024-07-23 cs.LG cs.AI cs.CR cs.MM

Arondight: Red Teaming Large Vision Language Models with Auto-generated Multi-modal Jailbreak Prompts

Yi Liu, Chengjun Cai, Xiaoli Zhang, Xingliang Yuan, Cong Wang

Comments To be published in ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14796 2024-07-23 cs.CV cs.AI

PASSION: Towards Effective Incomplete Multi-Modal Medical Image Segmentation with Imbalanced Missing Rates

Junjie Shi, Caozhi Shang, Zhaobin Sun, Li Yu, Xin Yang, Zengqiang Yan

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13768 2024-07-23 cs.CV cs.AI

Addressing Imbalance for Class Incremental Learning in Medical Image Classification

Xuze Hao, Wenqian Ni, Xuhao Jiang, Weimin Tan, Bo Yan

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12876 2024-07-23 cs.SI cs.AI cs.CL

Exploring the Use of Abusive Generative AI Models on Civitai

Yiluo Wei, Yiming Zhu, Pan Hui, Gareth Tyson

Comments Accepted to ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09342 2024-07-23 cs.CV cs.SD eess.AS

Face-voice Association in Multilingual Environments (FAME) Challenge 2024 Evaluation Plan

Muhammad Saad Saeed, Shah Nawaz, Muhammad Salman Tahir, Rohan Kumar Das, Muhammad Zaigham Zaheer, Marta Moscati, Markus Schedl, Muhammad Haris Khan, Karthik Nandakumar, Muhammad Haroon Yousaf

Comments ACM Multimedia Conference - Grand Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13976 2024-07-22 cs.CV

PlacidDreamer: Advancing Harmony in Text-to-3D Generation

Shuo Huang, Shikun Sun, Zixuan Wang, Xiaoyu Qin, Yanmin Xiong, Yuan Zhang, Pengfei Wan, Di Zhang, Jia Jia

Comments Accepted by ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏