arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

共收录 1944
2309.11091 2025-05-20 cs.CV cs.AI cs.MM

Learning Segment Similarity and Alignment in Large-Scale Content Based Video Retrieval

Chen Jiang, Kaiming Huang, Sifeng He, Xudong Yang, Wei Zhang, Xiaobo Zhang, Yuan Cheng, Lei Yang, Qing Wang, Furong Xu, Tan Pan, Wei Chu

Comments Accepted by ACM MM 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08747 2025-05-14 cs.CV cs.AI

Advancing Food Nutrition Estimation via Visual-Ingredient Feature Fusion

Huiyan Qi, Bin Zhu, Chong-Wah Ngo, Jingjing Chen, Ee-Peng Lim

机构 * Singapore Management University(新加坡管理大学) Fudan University(复旦大学)

Comments Accepted for publication in ACM International Conference on Multimedia Retrieval 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20835 2025-04-30 cs.SD eess.AS

Enhancing Non-Core Language Instruction-Following in Speech LLMs via Semi-Implicit Cross-Lingual CoT Reasoning

Hongfei Xue, Yufeng Tang, Hexin Liu, Jun Zhang, Xuelong Geng, Lei Xie

机构 * Northwestern Polytechnical University(西北工业大学) ByteDance Inc.(字节跳动公司) Nanyang Technological University(南洋理工大学)

Comments 10 pages, 6 figures, Submitted to ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20332 2025-04-29 eess.IV cs.CV

Devil is in Details: Locality-Aware 3D Abdominal CT Volume Generation for Self-Supervised Organ Segmentation

Yuran Wang, Zhijing Wan, Yansheng Qiu, Zheng Wang

机构 * National Engineering Research Center for Multimedia Software(多媒体软件国家工程研究中心) Hubei Key Laboratory of Multimedia and Network Communication Engineering(湖北省多媒体与网络通信工程重点实验室) Institute of Artificial Intelligence(人工智能研究院) School of Computer Science(计算机科学学院)

Comments ACM MM 2024. Code is available at https://github.com/Ryann-Ran/Lad

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16516 2025-04-28 cs.CV cs.AI

Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation

Junrong Yue, Yifan Zhang, Chuan Qin, Bo Li, Xiaomin Lie, Xinlei Yu, Wenxin Zhang, Zhendong Zhao

机构 * City University of Hong Kong, Dongguan Campus(香港城市大学东莞校区) The University of Melbourne(墨尔本大学) Tsinghua University(清华大学) Baidu Inc.(百度公司) University of Chinese Academy of Science(中国科学院大学) National University of Singapore(新加坡国立大学)

Comments 11 pages, 4 figures, Submitted to ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15232 2025-04-22 cs.CV

Shape-Guided Clothing Warping for Virtual Try-On

Xiaoyu Han, Shunyuan Zheng, Zonglin Li, Chenyang Wang, Xin Sun, Quanling Meng

机构 * Harbin Institute of Technology(哈尔滨工业大学)

Comments Accepted by ACM MM 2024. The code is available at https://github.com/xyhanHIT/SCW-VTON

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14240 2025-04-22 cs.CV cs.MM

ROI-Guided Point Cloud Geometry Compression Towards Human and Machine Vision

Xie Liang, Gao Wei, Zhenghui Ming, Li Ge

机构 * Peking University Shenzhen Graduate School and Peng Cheng Laboratory(北京大学深圳研究生院和鹏城实验室)

Comments 10 pages, 5 figures

Journal ref ACM International Conference on Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.07184 2025-04-22 cs.CV

TVPR: Text-to-Video Person Retrieval and a New Benchmark

Xu Zhang, Fan Ni, Guan-Nan Dong, Aichun Zhu, Jianhui Wu, Mingcheng Ni, Hui Liu

机构 * Nanjing Tech University(南京理工大学)

Comments 9 pages, 8 figures, Proceedings of the 32nd ACM International Conference on Multimedia

Journal ref The 32nd ACM International Conference on Multimedia. 2024: 10105-10113

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17550 2025-04-08 cs.CV cs.MM

DAE-Talker: High Fidelity Speech-Driven Talking Face Generation with Diffusion Autoencoder

Chenpeng Du, Qi Chen, Tianyu He, Xu Tan, Xie Chen, Kai Yu, Sheng Zhao, Jiang Bian

Comments Accepted to ACM Multimedia 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23933 2025-04-01 eess.IV

PupiNet: Seamless OCT-OCTA Interconversion Through Wavelet-Driven and Multi-Scale Attention Mechanisms

Renzhi Tian, Jinjie Wang, Wei Yang, Weizhen Li, Haoran Chen, Yiran Zhu, Chengchang Pan, Honggang Qi

Comments 8 pages,4 figures,5 tables,submitted to the 33rd ACM International Conference on Multimedia(ACM MM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20436 2025-03-27 cs.CV

Siformer: Feature-isolated Transformer for Efficient Skeleton-based Sign Language Recognition

Muxin Pu, Mei Kuan Lim, Chun Yong Chong

Comments 10 pages, ACM Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14225 2025-03-25 cs.CL cs.AI

Few-Shot Joint Multimodal Entity-Relation Extraction via Knowledge-Enhanced Cross-modal Prompt Model

Li Yuan, Yi Cai, Junsheng Huang

Comments accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12588 2025-03-18 cs.CV

Progressive Limb-Aware Virtual Try-On

Xiaoyu Han, Shengping Zhang, Qinglin Liu, Zonglin Li, Chenyang Wang

Comments Accepted by ACM MM 2022. The code is available at https://github.com/xyhanHIT/PL-VTON

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09652 2025-03-14 eess.IV

4D-ACFNet: A 4D Attention Mechanism-Based Prognostic Framework for Colorectal Cancer Liver Metastasis Integrating Multimodal Spatiotemporal Features

Zesheng Li, Wei Yang, Yan Su, Yiran Zhu, Yuhan Tang, Haoran Chen, Chengchang Pan, Honggang Qi

Comments 8 pages,6 figures,2 tables,submitted to the 33rd ACM International Conference on Multimedia(ACM MM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04107 2025-03-07 cs.CV

Fractional Correspondence Framework in Detection Transformer

Masoumeh Zareapoor, Pourya Shamsolmoali, Huiyu Zhou, Yue Lu, Salvador García

Journal ref ACMMM-2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07216 2025-02-12 cs.CV cs.AI

SparseFormer: Detecting Objects in HRW Shots via Sparse Vision Transformer

Wenxi Li, Yuchen Guo, Jilai Zheng, Haozhe Lin, Chao Ma, Lu Fang, Xiaokang Yang

Comments This paper is accepted to ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13672 2025-02-11 cs.CV

Q-SNNs: Quantized Spiking Neural Networks

Wenjie Wei, Yu Liang, Ammar Belatreche, Yichen Xiao, Honglin Cao, Zhenbang Ren, Guoqing Wang, Malu Zhang, Yang Yang

Comments 8 pages, 5 figures

Journal ref Proceedings of the 32nd ACM International Conference on Multimedia, 2024, 8441-8450

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17754 2025-02-06 cs.LG cs.DC

DualFed: Enjoying both Generalization and Personalization in Federated Learning via Hierachical Representations

Guogang Zhu, Xuefeng Liu, Jianwei Niu, Shaojie Tang, Xinghao Wu, Jiayuan Zhang

Comments Accepted by ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00992 2025-02-04 cs.CV cs.MM

FCBoost-Net: A Generative Network for Synthesizing Multiple Collocated Outfits via Fashion Compatibility Boosting

Dongliang Zhou, Haijun Zhang, Jianghong Ma, Jicong Fan, Zhao Zhang

Comments This paper has been accepted for presentation at ACM Multimedia 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04766 2025-01-24 cs.CV cs.LG

Cross-Dataset Gaze Estimation by Evidential Inter-intra Fusion

Shijing Wang, Yaping Huang, Jun Xie, Yi Tian, Feng Chen, Zhepeng Wang

Comments This paper was previously submitted to ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09050 2025-01-17 cs.CV cs.AI

Generating Realistic Synthetic Head Rotation Data for Extended Reality using Deep Learning

Jakob Struye, Filip Lemic, Jeroen Famaey

Comments Published and presented at International Conference on Multimedia 2022 (ACMMM), Workshop on Interactive eXtended Reality (IXR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02993 2025-01-07 cs.CV

DreamLCM: Towards High-Quality Text-to-3D Generation via Latent Consistency Model

Yiming Zhong, Xiaolin Zhang, Yao Zhao, Yunchao Wei

Comments 15 pages, 9 figures, ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16493 2024-12-24 cs.CV

Cross-View Consistency Regularisation for Knowledge Distillation

Weijia Zhang, Dongnan Liu, Weidong Cai, Chao Ma

Comments Accepted by ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13709 2024-12-19 cs.CV

Physics-Based Adversarial Attack on Near-Infrared Human Detector for Nighttime Surveillance Camera Systems

Muyao Niu, Zhuoxiao Li, Yifan Zhan, Huy H. Nguyen, Isao Echizen, Yinqiang Zheng

Comments Appeared in ACM MM 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07679 2024-12-17 cs.CV

Relational Diffusion Distillation for Efficient Image Generation

Weilun Feng, Chuanguang Yang, Zhulin An, Libo Huang, Boyu Diao, Fei Wang, Yongjun Xu

Comments Accepted by ACM MM 2024 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09126 2024-12-13 cs.MM cs.AI cs.LG

Enhancing Modality Representation and Alignment for Multimodal Cold-start Active Learning

Meng Shen, Yake Wei, Jianxiong Yin, Deepu Rajan, Di Hu, Simon See

Comments 11 pages, ACMMM Asia 2024, Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07801 2024-12-12 cs.CV cs.AI cs.CL

Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor

Jiali Chen, Xusen Hei, Yuqi Xue, Yuancheng Wei, Jiayuan Xie, Yi Cai, Qing Li

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05821 2024-12-11 cs.CL cs.AI

An Entailment Tree Generation Approach for Multimodal Multi-Hop Question Answering with Mixture-of-Experts and Iterative Feedback Mechanism

Qing Zhang, Haocheng Lv, Jie Liu, Zhiyun Chen, Jianyong Duan, Hao Wang, Li He, Mingying Xv

Comments Erratum: We identified an error in the calculation of the F1 score in table 4 reported in a previous version of this work. The performance of the new result is better than the previous one. The corrected values are included in this updated version of the paper. These changes do not alter the primary conclusions of our research

Journal ref MM '2024: Proceedings of the 32nd ACM International Conference on Multimedia, Pages 4814 - 4822

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.00574 2024-12-11 cs.CV

PVG: Progressive Vision Graph for Vision Recognition

Jiafu Wu, Jian Li, Jiangning Zhang, Boshen Zhang, Mingmin Chi, Yabiao Wang, Chengjie Wang

Comments Accepted by ACM MM 2023

Journal ref ACM International Conference on Multimedia 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06642 2024-12-10 cs.CV

Class Balance Matters to Active Class-Incremental Learning

Zitong Huang, Ze Chen, Yuanze Li, Bowen Dong, Erjin Zhou, Yong Liu, Rick Siow Mong Goh, Chun-Mei Feng, Wangmeng Zuo

Comments ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏