arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

2026-08-18 至 2026-08-18 共收录 6
2608.02474 2026-08-18 cs.CV 版本更新

EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation

EchoCache:面向高效音频驱动视频生成的能量引导跨模态缓存

Jiayu Chen, Xiaoyu Wu, Rongshan Gao, Maoliang Li, Zihao Zheng, Xinhao Sun, Hailong Zou, Guojie Luo, Xiang Chen

机构 * Peking University(北京大学) Taiyuan University of Technology(太原理工大学)

AI总结 EchoCache是一种能量引导跨模态缓存框架,通过利用音频时频能量锚点与动态缓存机制,在保持音频驱动视频生成质量的同时,实现了2.46倍的推理加速,优化了延迟-质量权衡。

Comments EchoCache is honored to be accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21127 2026-08-18 cs.SD 版本更新

Toward Interpretable Speech Deepfake Detection using Artifact-Specific Experts and Calibrated Detection Scores

使用特定伪迹专家和校准检测分数进行可解释的语音深度伪造检测

Viola Negroni, Xin Wang, Wanying Ge, Paolo Bestagini, Junichi Yamagishi, Stefano Tubaro

机构 * DEIB, Politecnico di Milano(米兰理工大学 电子、信息与生物工程系) National Institute of Informatics(国立情报学研究所)

AI总结 该研究针对语音深度伪造检测提出基于特定伪迹专家模型的框架,各专家检测特定伪迹并输出校准分数,经集成进行真假分类,保持可解释性,能捕捉合成语音可解释信号。

Comments Accepted @ DFF-Workshop, ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19942 2026-08-18 cs.CV cs.AI 版本更新

G-MAD: A Game-Based Data Generation Framework for Multi-View RGB-T Aerial Object Detection

G-MAD:用于多视图RGB-T航空目标检测的基于游戏的数据生成框架

Yechan Kim, JongHyun Park, Dongho Yoon, Namhoon Jung, Moongu Jeon

机构 * LIG Defense&Aerospace(LIG国防与航空航天公司) GIST(韩国科学技术院)

AI总结 研究针对航空目标检测中数据集构建的问题,提出基于游戏的G-MAD数据生成框架,可解决视点控制、数据对齐及标注成本等问题,支持多视图相机放置等功能,还构建并发布了AMOD基准。

Comments ACM Multimedia 2026 (Supplementary Material Included)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11415 2026-08-18 cs.CV 版本更新

Observe Less, Understand More: Cost-aware Cross-scale Observation for Remote Sensing Understanding

观察更少,理解更多:面向遥感理解的低成本跨尺度观测

Zhenghao Xie, Jing Xiao, Zhenqi Wang, Kexin Ma, Liang Liao, Gui-song Xia, Mi Wang

机构 * Wuhan University(武汉大学) Xi'an University of Electronic Science and Technology(西安电子科技大学)

AI总结 本文提出一种低成本跨尺度观测方法,通过结合细粒度高分辨率采样与跨图块表示预测,提升遥感任务性能。同时引入GL-10M大规模基准,系统评估预算约束下的跨尺度推理效果。

Comments 14 pages, 7 figures, and 5 tables. Accepted to ACM MM 2026. Updated to the camera-ready version and added supplementary material. Code: this https URL (https://github.com/xzhacc/CrossSO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18005 2026-08-18 cs.CV 版本更新

UrbanWorld2.0: A Multimodal Agentic Framework for Reality-Aligned 3D World Generation at City-Scale

RAISECity: 一种用于城市级现实对齐3D世界生成的多模态代理框架

Shengyuan Wang, Zhiheng Zheng, Yu Shang, Lixuan He, Yangcheng Yu, Fan Hangyu, Jie Feng, Qingmin Liao, Yong Li

机构 * College of AI, Tsinghua University(人工智能学院,清华大学) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系,北京研究院,清华大学)

AI总结 RAISECity通过多模态代理框架实现城市级3D世界生成,提升现实对齐、精度和性能,适用于沉浸媒体和具身智能应用。

Comments Accepted by ACM MM 2026, the code is available at: this https URL (https://github.com/tsinghua-fib-lab/UrbanWorld2.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09209 2026-08-18 cs.GR cs.CV cs.SD 版本更新

EchoMask: Speech-Queried Attention-based Mask Modeling for Holistic Co-Speech Motion Generation

EchoMask:用于整体同步语音动作生成的基于语音查询注意力的掩码建模

Xiangyue Zhang, Jianfang Li, Jiaxu Zhang, Jianqiang Ren, Liefeng Bo, Zhigang Tu

机构 * Wuhan University(武汉大学) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

AI总结 本研究提出EchoMask框架,通过MAM和SQA实现动作对齐的语音特征引导的掩码建模,生成高质量同步语音动作,性能优于现有最先进方法。

Comments 10 pages, 12 figures. Accepted to ACM Multimedia 2025. Project page: this https URL (https://xiangyuezhang.com/EchoMask/;) code and pretrained models: this https URL (https://github.com/Xiangyue-Zhang/EchoMask)

详情

展开后加载摘要…

URL PDF HTML 收藏