arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

共收录 1944
2601.07315 2026-03-25 cs.MA cs.AI cs.AR

VLM-CAD: VLM-Optimized Collaborative Agent Design Workflow for Analog Circuit Sizing

VLM-CAD:面向模拟电路尺寸设计的VLM优化协作代理设计流程

Guanyuan Pan, Shuai Wang, Yugui Lin, Tiansheng Zhou, Pietro Liò, Zhenxin Zhao, Yaqi Wang

机构 * Hangzhou Dianzi University(杭州电子科技大学) SCBC, Guangdong University of Foreign Studies(广东外语外贸大学) University of Cambridge(剑桥大学)

AI总结 本文提出VLM-CAD流程,通过神经符号结构解析模块和ExTuRBO方法提升多模态推理的鲁棒性和可解释性,实验表明其在模拟电路设计中具有高准确性和低功耗。

Comments submitted to the 34th ACM International Conference on Multimedia (ACMMM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16344 2026-03-25 cs.CV cs.AI

SOAP: Enhancing Spatio-Temporal Relation and Motion Information Capturing for Few-Shot Action Recognition

SOAP:增强少样本动作识别中的时空关系和运动信息捕捉

Wenbo Huang, Jinghui Zhang, Xuwei Qian, Zhen Wu, Meng Wang, Lei Zhang

机构 * Southeast University(东南大学) Tongji University(同济大学) Nanjing Normal University(南京师范大学)

AI总结 本文提出SOAP架构,通过融合时空特征与多帧帧元组提升少样本动作识别性能,实现更全面的运动信息捕捉,优于传统方法。

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24133 2026-03-17 cs.CV

FocusTrack: One-Stage Focus-and-Suppress Framework for 3D Point Cloud Object Tracking

FocusTrack: 一种用于3D点云目标跟踪的一阶段聚焦与抑制框架

Sifan Zhou, Jiahao Nie, Ziyu Zhao, Yichao Cao, Xiaobo Lu

AI总结 FocusTrack通过IMM和Focus-and-Suppress Attention实现运动-语义联合建模,以一阶段框架在KITTI等基准上达到SOTA性能并实现105 FPS高帧率。

Comments Acceptted in ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00782 2026-03-17 cs.GR cs.AI cs.CV cs.MM cs.SD eess.AS

SpA2V: Harnessing Spatial Auditory Cues for Audio-driven Spatially-aware Video Generation

SpA2V: 利用空间听觉线索进行音频驱动的空间感知视频生成

Kien T. Pham, Yingqing He, Yazhou Xing, Qifeng Chen, Long Chen

AI总结 SpA2V通过利用空间听觉线索生成与输入音频在语义和空间上一致的视频,改进了现有方法对语义信息的依赖,提出两阶段框架实现视频场景布局生成与生成。

Comments The 33rd ACM Multimedia Conference (MM '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14878 2026-03-10 cs.HC

InterMind: Doctor-Patient-Family Interactive Depression Assessment Empowered by Large Language Models

InterMind:由大型语言模型赋能的医生-患者-家庭交互式抑郁症评估系统

Zhiyuan Zhou, Jilong Liu, Sanwang Wang, Shijie Hao, Yanrong Guo, Richang Hong

AI总结 InterMind利用大型语言模型,通过医生、患者和家庭的互动提升抑郁症评估的精确性和效率。

Comments Accepted at ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12760 2026-03-10 cs.CV cs.AI

Unified Medical Image Segmentation with State Space Modeling Snake

基于状态空间建模的统一医学图像分割蛇

Ruicheng Zhang, Haowei Guo, Kanghui Tian, Jun Zhou, Mingliang Yan, Zeyu Zhang, Shen Zhao

机构 * Sun Yat-sen University(中山大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Beijing University of Posts and Telecommunications(北京邮电大学) The Australian National University(澳大利亚国立大学)

AI总结 基于状态空间建模的Mamba Snake框架通过改进的蛇模型实现统一医学图像分割,有效处理多尺度结构异质性,提升分割精度。

Comments This paper has been accepted by ACM MM 2025

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (ACM MM 2025), Pages 7825-7834

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19509 2026-03-09 cs.CV cs.LG cs.SD eess.AS

Ditto: Motion-Space Diffusion for Controllable Realtime Talking Head Synthesis

Ditto:用于可控实时说话头合成的运动空间扩散

Tianqi Li, Ruobing Zheng, Minghui Yang, Jingdong Chen, Ming Yang

机构 * Ant Group(蚂蚁集团)

AI总结 Ditto通过运动空间扩散模型实现可控实时说话头合成,优化架构与训练策略以提升生成质量与实时性能。

Comments Project Page: https://digital-avatar.github.io/ai/Ditto/

Journal ref ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09864 2026-03-09 cs.CV

AuthFace: Towards Authentic Blind Face Restoration with Face-oriented Generative Diffusion Prior

AuthFace: 向真实盲脸修复迈进的面向面部生成扩散先验

Guoqiang Liang, Qingnan Fan, Bingtao Fu, Jinwei Chen, Hong Gu, Lin Wang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) Nanyang Technological University(南洋理工大学)

AI总结 AuthFace通过面向面部的生成扩散先验和摄影引导标注,实现高质量盲脸修复,提升面部细节还原和减少关键区域伪影。

Comments ACM MM 25, Codes and datasets are available at https://github.com/EthanLiang99/AuthFace

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18991 2026-03-06 cs.CV cs.CL cs.MM

EasyAnimate: High-Performance Video Generation Framework with Hybrid Windows Attention and Reward Backpropagation

EasyAnimate:基于混合窗口注意力和奖励反向传播的高性能视频生成框架

Jiaqi Xu, Kunzhe Huang, Xinyi Zou, Yunkuo Chen, Bo Liu, MengLi Cheng, Jun Huang, Xing Shi

机构 * Alibaba Cloud(阿里云)

AI总结 EasyAnimate通过混合窗口注意力和奖励反向传播提升视频生成效率与质量,实现高性能视频生成。

Comments 10 pages, 8 figures, ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13671 2026-03-03 cs.CV cs.LG

FiLo: Zero-Shot Anomaly Detection by Fine-Grained Description and High-Quality Localization

FiLo:通过细粒度描述和高质量定位实现零样本异常检测

Zhaopeng Gu, Bingke Zhu, Guibo Zhu, Yingying Chen, Hao Li, Ming Tang, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所基础模型研究中心) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) Objecteye Inc., Beijing, China(Objecteye公司) Central South University, Hunan, China(中南大学)

AI总结 FiLo通过细粒度描述和高质量定位实现零样本异常检测,提升检测和定位性能。

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14206 2026-02-26 eess.SP cs.AI cs.LG stat.ML

A Comprehensive Benchmark for Electrocardiogram Time-Series

一种用于心电图时间序列的全面基准

Zhijiang Tang, Jiaxin Qi, Yuhua Zheng, Jianqiang Huang

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州先进研究所) Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心)

AI总结 本文提出了一种全面的ECG时间序列基准,涵盖四个评估任务、新指标和新架构,验证了其有效性。

Comments ACM MM 2025

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19319 2026-02-24 cs.MM cs.AI cs.CR cs.DB cs.DC

Health+: Empowering Individuals via Unifying Health Data

Health+: 通过统一健康数据赋能个体

Sujaya Maiyya, Shantanu Sharma, Avinash Kumar

机构 * University of Waterloo(滑铁卢大学) New Jersey Institute of Technology(新泽西理工学院) Independent Researcher(独立研究者)

AI总结 Health+ 是一个以用户为中心的多模态健康数据管理系统,通过统一数据和智能推荐,提升个体对健康信息的控制与管理能力。

Comments This paper has been accepted in ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08179 2026-02-20 cs.CV cs.MM

PP-Motion: Physical-Perceptual Fidelity Evaluation for Human Motion Generation

PP-Motion: 人类运动生成的物理-感知保真度评估

Sihan Zhao, Zixuan Wang, Tianyu Luan, Jia Jia, Wentao Zhu, Jiebo Luo, Junsong Yuan, Nan Xi

机构 * Tsinghua University(清华大学) University at Buffalo(布法罗大学) BNRist, Tsinghua University(清华大学BNRist研究所) Key Laboratory of Pervasive Computing, Ministry of Education(教育部 pervasive 计算重点实验室) Eastern Institute of Technology, Ningbo(宁波东部技术研究所) University of Rochester(罗切斯特大学)

AI总结 PP-Motion是一种新的数据驱动度量,通过物理和感知保真度评估提升人类运动生成的准确性与真实性。

Comments Accepted by ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20630 2026-02-17 eess.AS cs.MM cs.SD

ISDrama: Immersive Spatial Drama Generation through Multimodal Prompting

ISDrama: 通过多模态提示生成沉浸式空间戏剧

Yu Zhang, Wenxiang Guo, Changhao Pan, Zhiyuan Zhu, Tao Jin, Zhou Zhao

机构 * Zhejiang University, Shanghai AI Lab(浙江大学上海人工智能实验室) Zhejiang University(浙江大学)

AI总结 ISDrama通过多模态提示生成沉浸式空间戏剧,首次结合多模态数据建模和戏剧语调生成。

Comments Accepted by ACM Multimedia 2025

Journal ref MM '2025: Proceedings of the 33rd ACM International Conference on Multimedia Pages 9618 - 9627

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10546 2026-02-12 cs.CV cs.AI

RealHD: A High-Quality Dataset for Robust Detection of State-of-the-Art AI-Generated Images

RealHD:一个高质量数据集,用于鲁棒检测最新AI生成图像

Hanzhe Yu, Yun Ye, Jintao Rong, Qi Xuan, Chen Ma

机构 * Institute of Cyberspace Security, Zhejiang University of Technology(网络安全研究院,浙江工业大学) Intel Corporation(英特尔公司) College of Information Engineering, Zhejiang University of Technology(信息工程学院,浙江工业大学) Binjiang Institute of Artificial Intelligence, ZJUT(滨江人工智能研究所,浙江工业大学)

AI总结 RealHD数据集通过高质量图像和先进生成方法,提升AI生成图像检测的鲁棒性和泛化能力,并提出基于噪声熵的轻量级检测方法。

Comments Published in the Proceedings of the 33rd ACM International Conference on Multimedia (ACM MM 2025)

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (ACM MM 2025), 2025, pp. 11394--11403

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.04195 2026-02-10 cs.CV cs.CL

Cross-Modal Retrieval for Motion and Text via DropTriple Loss

通过DropTriple损失实现动与文本的跨模态检索

Sheng Yan, Yang Liu, Haoqiang Wang, Xin Du, Mengyuan Liu, Hong Liu

机构 * School of Artificial Intelligence, Chongqing University of Technology, China(重庆理工大学人工智能学院) College of Computer Science, Sichuan University, China(四川大学计算机学院) Key Laboratory of Machine Perception, Shenzhen Graduate School, Peking University, China(北京大学深圳研究生院机器感知重点实验室)

AI总结 本文提出DropTriple损失,用于提升人类动作与文本之间的跨模态检索性能,实验表明在HumanML3D数据集上实现了较高的检索准确率。

Comments This paper has been accepted by ACM MM Asia 2023 (Best Paper Candidate)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00734 2026-02-09 eess.SP cs.AI cs.LG

EEG-MACS: Manifold Attention and Confidence Stratification for EEG-based Cross-Center Brain Disease Diagnosis under Unreliable Annotations

EEG-MACS: 用于基于EEG的跨中心脑部疾病诊断的流形注意力与置信度分层

Zhenxi Song, Ruihan Qin, Huixia Ren, Zhen Liang, Yi Guo, Min Zhang, Zhiguo Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen People's Hospital(深圳人民医院) Shenzhen University(深圳大学) Shenzhen Bay Laboratory(深圳湾实验室)

AI总结 EEG-MACS通过流形注意力与置信度分层技术,提升跨中心脑部疾病诊断的准确性与鲁棒性。

Comments 15 pages, 9 figures. Oral presentation at ACM MM 2024

Journal ref In Proceedings of the 32nd ACM International Conference on Multimedia (ACM MM '24), pp. 340-349, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13745 2026-02-04 cs.CV cs.DC

FedVSR: Towards Model-Agnostic Federated Learning in Video Super-Resolution

FedVSR:迈向视频超分辨率中模型无关的联邦学习

Ali Mollaahmadi Dehaghi, Hossein KhademSohi, Reza Razavi, Steve Drew, Mohammad Moshirpour

机构 * University of Calgary(卡尔加里大学) Userful Corporation(Userful公司) University of California, Irvine(加州大学尔湾分校)

AI总结 FedVSR是一种专为视频超分辨率设计的模型无关联邦学习框架,通过轻量级损失函数和损失感知聚合策略提升视频质量,实现高效隐私保护的低级视觉任务解决方案。

Comments Final version. Accepted at ACM Multimedia Systems (MMSys) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20042 2026-02-03 cs.CV cs.AI

Beyond Vision: Contextually Enriched Image Captioning with Multi-Modal Retrieval

超越视觉:基于多模态检索的上下文丰富图像描述

Nguyen Lam Phu Quy, Pham Phu Hoa, Tran Chi Nguyen, Dao Sy Duy Minh, Nguyen Hoang Minh Ngoc, Huynh Trung Kiet

机构 * University of Science - VNUHCM(越南胡志明市大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出一种多模态检索方法,通过整合外部文本知识生成更丰富的上下文图像描述,提升视觉-文本理解能力。

Comments 7 pages, 5 figures. System description for the EVENTA Grand Challenge (Track 1) at ACM MM'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00484 2026-02-03 cs.CV cs.MM

GTATrack: Winner Solution to SoccerTrack 2025 with Deep-EIoU and Global Tracklet Association

GTATrack: 2025 SoccerTrack 挑战赛中采用深度EIoU和全局轨迹关联的胜出方案

Rong-Lin Jian, Ming-Chi Luo, Chen-Wei Huang, Chia-Ming Lee, Yu-Fan Lin, Chih-Chung Hsu

机构 * Institute of Intelligent Systems\ of AI, National Yang Ming Chiao Tung University Tainan Taiwan Department of Computer Science , National Yang Ming Chiao Tung University Hsinchu Taiwan Technology National Central University Taoyuan Taiwan Institute of Data Science\ Cheng Kung University Tainan Taiwan Miin Wu School of Computing\ Cheng Kung University Tainan Taiwan Institute of Intelligent Systems\ of AI, National Yang Ming Chiao Tung University Department of Computer Science , National Yang Ming Chiao Tung University Technology National Central University Institute of Data Science\ Cheng Kung University Miin Wu School of Computing\ Cheng Kung University

AI总结 GTATrack通过深度EIoU和全局轨迹关联技术,在2025 SoccerTrack挑战赛中以高HOTA得分和低假阳性率实现足球跟踪的最优性能。

Comments Winner Solution of SoccerTrack in ACM Multimedia 2025 Workshop MMSports

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11030 2026-01-19 cs.CV cs.AI

IDDR-NGP: Incorporating Detectors for Distractor Removal with Instant Neural Radiance Field

IDDR-NGP: 结合检测器去除干扰物的瞬时神经辐射场

Xianliang Huang, Jiajie Gou, Shuhang Chen, Zhizhou Zhong, Jihong Guan, Shuigeng Zhou

机构 * Fudan University(复旦大学) Tongji University(同济大学)

AI总结 IDDR-NGP通过结合检测器与隐式3D表示,实现对多种干扰物的高效去除,具有端到端训练和高鲁棒性。

Comments 8 pages, 7 figures, accepted by ACM-MM23

Journal ref Proceedings of the 31st ACM International Conference on Multimedia. 2023: 1343-1351

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17116 2026-01-16 cs.MM cs.AI cs.CV cs.IR

The CASTLE 2024 Dataset: Advancing the Art of Multimodal Understanding

CASTLE 2024数据集:推动多模态理解艺术的发展

Luca Rossetto, Werner Bailer, Duc-Tien Dang-Nguyen, Graham Healy, Björn Þór Jónsson, Onanong Kongmeesub, Hoang-Bao Le, Stevan Rudinac, Klaus Schöffmann, Florian Spiess, Allie Tran, Minh-Triet Tran, Quang-Linh Tran, Cathal Gurrin

机构 * Dublin City University(都柏林城市大学) JOANNEUM RESEARCH(JOANNEUM研究机构) University of Bergen(卑尔根大学) Reykjavik University(雷克雅未克大学) University of Amsterdam(阿姆斯特丹大学) Klagenfurt University(克雷克夫特大学) University of Basel(巴塞尔大学) VNU Ho Chi Minh University of Science(越南胡志明国家科学大学)

AI总结 CASTLE 2024数据集通过提供多视角视频和音频数据,推动多模态理解技术的发展。

Comments 7 pages, 6 figures, dataset available via https://castle-dataset.github.io/

Journal ref 2025 MM'25: Proceedings of the 33rd ACM International Conference on Multimedia (pp. 12629-12635)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11013 2026-01-09 cs.CV cs.MM

Towards Robust and Controllable Text-to-Motion via Masked Autoregressive Diffusion

面向鲁棒且可控的文本到运动的掩码自回归扩散

Zongye Zhang, Bohan Kong, Qingjie Liu, Yunhong Wang

机构 * State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室) Hangzhou Innovation Institute(杭州创新院) Beihang University(北京航空航天大学)

AI总结 MoMADiff通过结合掩码建模与扩散过程,实现鲁棒且可控的文本到运动生成,优于现有方法。

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02107 2026-01-06 cs.CV

MagicFight: Personalized Martial Arts Combat Video Generation

MagicFight: 个性化武术战斗视频生成

Jiancheng Huang, Mingfu Yan, Songyan Chen, Yi Huang, Shifeng Chen

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院) China Telecom Cloud Technology Co., Ltd.(中国电信云技术有限公司) Shenzhen University of Advanced Technology(深圳大学)

AI总结 MagicFight通过定制数据集和优化模型,解决两人武术战斗视频生成中的身份混淆和动作不匹配问题,生成高保真的战斗视频。

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14921 2026-01-05 cs.CV

Stereo-GS: Multi-View Stereo Vision Model for Generalizable 3D Gaussian Splatting Reconstruction

Stereo-GS:用于通用3D高斯点云重建的多视角立体视觉模型

Xiufeng Huang, Ka Chun Cheung, Runmin Cong, Simon See, Renjie Wan

机构 * Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) NVIDIA AI Technology Center, NVIDIA(NVIDIA 人工智能技术中心) School of Control Science and Engineering, Shandong University(控制科学与工程学院,山东大学)

AI总结 Stereo-GS通过立体视觉和解耦框架实现高效通用3D高斯点云重建,无需依赖相机参数,提升鲁棒性和实用性。

Comments ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24645 2026-01-01 cs.SD

AudioFab: Building A General and Intelligent Audio Factory through Tool Learning

通过工具学习构建通用且智能的音频工厂

Cheng Zhu, Jing Han, Qianshuai Xue, Kehan Wang, Huan Zhao, Zixing Zhang

机构 * Hunan University(湖南大学) University of Cambridge(剑桥大学)

AI总结 AudioFab通过工具学习构建通用智能音频处理框架,提供模块化设计和自然语言接口,提升音频任务的效率和准确性。

Journal ref ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22603 2025-12-30 cs.CL

Structured Prompting and LLM Ensembling for Multimodal Conversational Aspect-based Sentiment Analysis

结构化提示与大语言模型集成用于多模态对话基于方面的情感分析

Zhiqiang Gao, Shihao Gao, Zixing Zhang, Yihao Guo, Hongyu Chen, Jing Han

机构 * Hunan University(湖南大学) University of Cambridge(剑桥大学)

AI总结 本文提出结构化提示与大语言模型集成方法,用于多模态对话基于方面的情感分析,有效提升情感识别与翻转检测的准确性。

Journal ref ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22602 2025-12-30 cs.CV

PTalker: Personalized Speech-Driven 3D Talking Head Animation via Style Disentanglement and Modality Alignment

PTalker: 通过风格解耦和模态对齐实现个性化语音驱动的3D对话头动画

Bin Wang, Yang Xu, Huan Zhao, Hao Zhang, Zixing Zhang

机构 * College of Computer Science and Electronic Engineering(计算机科学与电子工程学院) Hunan University(湖南大学) School of Electronic Information(电子信息学院) Central South University(中南大学)

AI总结 PTalker通过风格解耦和模态对齐实现个性化语音驱动的3D对话头动画,提升唇同步精度与真实感。

Journal ref ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22601 2025-12-30 cs.AI

Tyee: A Unified, Modular, and Fully-Integrated Configurable Toolkit for Intelligent Physiological Health Care

Tyee:面向智能生理健康护理的统一、模块化和完全集成的可配置工具包

Tao Zhou, Lingyu Shu, Zixing Zhang, Jing Han

机构 * Hunan University(湖南大学) University of Cambridge(剑桥大学)

AI总结 Tyee提出了一种统一、模块化且可配置的工具包,用于提升智能生理健康护理中深度学习的实用性与可重现性。

Journal ref ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11781 2025-12-29 cs.CV cs.AI cs.LG

ACMamba: Fast Unsupervised Anomaly Detection via An Asymmetrical Consensus State Space Model

ACMamba: 通过非对称共识状态空间模型实现快速无监督异常检测

Guanchun Wang, Xiangrong Zhang, Yifei Zhang, Zelin Peng, Tianyang Zhang, Xu Tang, Licheng Jiao

机构 * School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院) MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院)

AI总结 ACMamba通过非对称共识状态空间模型实现快速无监督异常检测,利用区域级实例替代密集像素样本,降低计算成本并提升性能。

Comments 15 pages, 9 figures

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia, ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏