arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

2026-08-18 至 2026-08-18 共收录 18
2608.15734 2026-08-18 eess.AS cs.MM cs.SD 新提交

CineDub: Scaling End-to-End Video Dubbing to Multi-Speaker Dialogues with Coherent Sound Effects

CineDub:将端到端视频配音扩展至带连贯音效的多说话人对话场景

Yusheng Dai, Kangdi Wang, Baolong Gao, Yuxuan Jiang, Weiqiang Wang, Qiuhong Ke, Jianfei Cai

AI总结 本研究提出基于扩散模型的统一架构CineDub,无需人脸裁剪或说话人分割即可实现精准多说话人对话配音,还引入两项训练策略并发布两个野外基准,在相关任务中取得最优性能。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16765 2026-08-18 cs.CV cs.AI 新提交

TRACE-Bench: Decomposing and Diagnosing Multi-Reference Image Generation

TRACE-Bench:多参考图像生成的分解与诊断

Haoran Wang, Chaofan Ma, Ran Yi, Lizhuang Ma

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 研究针对多参考图像生成基准的缺陷,构建TRACE-Bench基准,采用算子分解方法评估9个主流模型,发现解耦与属性绑定是核心瓶颈,最优模型属性保真度仅0.74

Comments Accepted to ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16628 2026-08-18 cs.AI 新提交

Hypergraph-based Multimodal Retrieval-Augmented Generation with Incremental Refinement

基于超图的多模态检索增强生成与增量优化

Shenao Chen, Yidan Xu, Xiangmin Han, Rundong Xue, Duanpo Wu, Yuhan Gao, Chenggang Yan, Yue Gao

机构 * Hangzhou Dianzi University(杭州电子科技大学) Beijing University of Technology(北京工业大学) Tsinghua University(清华大学)

AI总结 该研究针对现有多模态检索增强生成系统的二元连接局限与优化冗余问题,提出Hyper-M2RAG框架,通过多模态超图建模与锚点驱动的增量优化机制,在多模态基准数据集上实现优于现有方法的性能。

Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16259 2026-08-18 cs.CV cs.AI 新提交

Defake-o3: From Speculative Rationales to Verifiable Evidence for Explainable AIGI Detection

Defake-o3:从推测性理由到可验证证据的可解释AIGI检测

Bowen Deng, Jiahui Zhan, Yikun Ji, Haozhen Yan, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

AI总结 Defake-o3是结合交互式视觉搜索与证据验证器的可解释AIGI检测器,构建了GroundFake数据集和FakeFrontier基准,在多基准上同时提升了AIGI检测准确率与解释质量。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16154 2026-08-18 cs.CV cs.GR cs.MM 新提交

KeyID: Decoupled Drafting and Keyframe Editing for Identity-Preserving Video Generation

KeyID:用于身份保留视频生成的解耦草稿生成与关键帧编辑

Jianjie Luo, Yiming Zhong, Haoming Shen, Yupeng Xiao, Zhenguo Yang

机构 * Guangdong University of Technology(广东工业大学)

AI总结 KeyID是无需训练的IPVG框架,通过解耦视频动态合成与身份注入,解决身份一致性问题,在ACM MM 2026 IPVG挑战赛获亚军,可扩展至多主体参考及复杂序列动作生成。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15863 2026-08-18 cs.RO cs.AI cs.CL cs.CV cs.MM 新提交

Scaling Manual-Grounded Appliance Manipulation with Data Synthesis and Unified Planning

通过数据合成与统一规划扩展基于手册的家电操作规模

Yuxing Long, Lei Kang, Ziyan Yu, Yuzheng Gao, Bin Cheng, Jiyao Zhang, Xiaoqi Li, Haolin Yang, Dongjiang Li, Hui Shen, Hao Dong

机构 * Center on Frontiers of Computing Studies, School of Computer Science, Peking University(北京大学计算机学院计算前沿研究中心) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Jingdong Technology Information Technology Co., Ltd(京东科技信息技术有限公司)

AI总结 针对现有大模型缺乏支持基于手册的家电操作规划的数据集的问题,提出MAGE数据合成流水线构建UseAppliance数据集,开发AppliancePlan模型,在RealAppliance-Bench和真实机器人实验中表现优异,推进通用家用机器人发展。

Comments Accepted by ACM MM 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15802 2026-08-18 cs.CV cs.LG 新提交

PWLR: Pairwise Witness Local Rejection for Boundary-Aware Out-of-Distribution Detection

PWLR:用于边界感知分布外检测的成对见证局部拒绝

Chengyao Jia, Ruixuan Wang

机构 * Guangdong Provincial Key Laboratory of Stomatology(广东省口腔医学重点实验室) Key Laboratory of Machine Intelligence and Advanced Computing, MOE(教育部机器智能与先进计算重点实验室)

AI总结 针对视觉语言检测器极少用语言作为混淆ID类别边界证据的问题,提出PWLR方法,结合MLLM生成的局部线索与全局类别得分,在多基准上改进了视觉语言基线的OOD检测性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15310 2026-08-18 cs.CR cs.LG 新提交

FedADB: Class Anchor-Driven Dual-Branch Federated Learning for Mitigating Forgetting

FedADB:用于缓解遗忘的类别锚驱动双分支联邦学习

Zhenyan Liu, Hua Zhang, Haoran Gao, Qi Li, Hongliang Zhu, Huiyu Zhou, Zongliang Shen, Yanxin Xu, Jiahui Wang

AI总结 针对联邦学习中跨客户端数据异质性导致的全局知识遗忘问题,提出FedADB框架,通过类别锚与双分支机制平衡全局一致性与本地优化,在多数据集上提升了准确率与收敛速度。

Comments Accepted to appear in Proceedings of the 34th ACM International Conference on Multimedia (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15284 2026-08-18 cs.RO cs.AI cs.CL cs.CV cs.MM 新提交

VTInstructor: Visual Trajectory Prompting for Navigation Instruction Generation in Continuous Environments

VTInstructor:面向连续环境中导航指令生成的视觉轨迹提示

Haolin Yang, Yuxing Long, Zihan Yang, Hao Dong

机构 * Peking University(北京大学) PrimeBot

AI总结 本研究提出首个面向连续环境的VLN指令生成框架VTInstructor,通过视觉轨迹提示技术生成导航指令,在基准测试中刷新最优性能,提升跟随器成功率并为下游任务带来数据增强增益。

Comments accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15260 2026-08-18 cs.CV cs.AI 新提交

VGGT-Align: Bridging Local Reconstruction and Global Consistency for Long-Sequence 3D Reconstruction

VGGT-Align:为长序列三维重建连接局部重建与全局一致性

Wei Zhang, Yihang Wu, Songhua Li, Qi Wang

机构 * Northwestern Polytechnical University(西北工业大学)

AI总结 该研究针对长序列三维重建的尺度漂移问题,提出VGGT-Align框架,通过SGIA和测试时适配策略,在多基准上实现顶尖性能,降低绝对轨迹误差最多32%

Comments 10 pages, 6 figures, 6 tables. ACM Multimedia 2026 (MM '26). Code: this https URL (https://github.com/WZ-CS/VGGT-Align)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15104 2026-08-18 cs.CV 新提交

ProjFormer: Point Cloud Completion via Geometric-Projective Transformer and Cross-Modal Semantic Constraints

ProjFormer:基于几何投影Transformer与跨模态语义约束的点云补全

Sheng Liu, Meng Wang, Ruihui Li, Huilong Pi, Zhuo Tang, Kenli Li

机构 * Hunan University(湖南大学)

AI总结 针对现有点云补全方法几何一致性与适应性不足的问题,提出ProjFormer跨模态框架,通过投影引导视图注意力模块与几何感知路由网络实现高效特征聚合与融合,在轻量级设计下取得了具竞争力的补全性能。

Comments Accepted by ACM Multimedia 2026. 10 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14854 2026-08-18 cs.CV 新提交

Zero-MELO: Test-Time Evidence Calibration with Multimodal LLMs for Zero-Shot Micro-Gesture Recognition

Zero-MELO:基于多模态大语言模型的测试时证据校准用于零样本微手势识别

Chengyan Wang, Hanliang Xie, Yueyi Yang, Haoyu Chen

机构 * University of Oulu(奥卢大学) Peking University(北京大学)

AI总结 该研究针对多模态大语言模型在微手势识别中局部证据不足、分数偏差的瓶颈,提出Zero-MELO框架,结合树搜索、测试时校准与多线索融合,在iMiGUE和MA-52数据集上显著优于Qwen2.5-VL基线。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02474 2026-08-18 cs.CV 版本更新

EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation

EchoCache:面向高效音频驱动视频生成的能量引导跨模态缓存

Jiayu Chen, Xiaoyu Wu, Rongshan Gao, Maoliang Li, Zihao Zheng, Xinhao Sun, Hailong Zou, Guojie Luo, Xiang Chen

机构 * Peking University(北京大学) Taiyuan University of Technology(太原理工大学)

AI总结 EchoCache是一种能量引导跨模态缓存框架,通过利用音频时频能量锚点与动态缓存机制,在保持音频驱动视频生成质量的同时,实现了2.46倍的推理加速,优化了延迟-质量权衡。

Comments EchoCache is honored to be accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21127 2026-08-18 cs.SD 版本更新

Toward Interpretable Speech Deepfake Detection using Artifact-Specific Experts and Calibrated Detection Scores

使用特定伪迹专家和校准检测分数进行可解释的语音深度伪造检测

Viola Negroni, Xin Wang, Wanying Ge, Paolo Bestagini, Junichi Yamagishi, Stefano Tubaro

机构 * DEIB, Politecnico di Milano(米兰理工大学 电子、信息与生物工程系) National Institute of Informatics(国立情报学研究所)

AI总结 该研究针对语音深度伪造检测提出基于特定伪迹专家模型的框架,各专家检测特定伪迹并输出校准分数,经集成进行真假分类,保持可解释性,能捕捉合成语音可解释信号。

Comments Accepted @ DFF-Workshop, ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19942 2026-08-18 cs.CV cs.AI 版本更新

G-MAD: A Game-Based Data Generation Framework for Multi-View RGB-T Aerial Object Detection

G-MAD:用于多视图RGB-T航空目标检测的基于游戏的数据生成框架

Yechan Kim, JongHyun Park, Dongho Yoon, Namhoon Jung, Moongu Jeon

机构 * LIG Defense&Aerospace(LIG国防与航空航天公司) GIST(韩国科学技术院)

AI总结 研究针对航空目标检测中数据集构建的问题,提出基于游戏的G-MAD数据生成框架,可解决视点控制、数据对齐及标注成本等问题,支持多视图相机放置等功能,还构建并发布了AMOD基准。

Comments ACM Multimedia 2026 (Supplementary Material Included)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11415 2026-08-18 cs.CV 版本更新

Observe Less, Understand More: Cost-aware Cross-scale Observation for Remote Sensing Understanding

观察更少,理解更多:面向遥感理解的低成本跨尺度观测

Zhenghao Xie, Jing Xiao, Zhenqi Wang, Kexin Ma, Liang Liao, Gui-song Xia, Mi Wang

机构 * Wuhan University(武汉大学) Xi'an University of Electronic Science and Technology(西安电子科技大学)

AI总结 本文提出一种低成本跨尺度观测方法,通过结合细粒度高分辨率采样与跨图块表示预测,提升遥感任务性能。同时引入GL-10M大规模基准,系统评估预算约束下的跨尺度推理效果。

Comments 14 pages, 7 figures, and 5 tables. Accepted to ACM MM 2026. Updated to the camera-ready version and added supplementary material. Code: this https URL (https://github.com/xzhacc/CrossSO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18005 2026-08-18 cs.CV 版本更新

UrbanWorld2.0: A Multimodal Agentic Framework for Reality-Aligned 3D World Generation at City-Scale

RAISECity: 一种用于城市级现实对齐3D世界生成的多模态代理框架

Shengyuan Wang, Zhiheng Zheng, Yu Shang, Lixuan He, Yangcheng Yu, Fan Hangyu, Jie Feng, Qingmin Liao, Yong Li

机构 * College of AI, Tsinghua University(人工智能学院,清华大学) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系,北京研究院,清华大学)

AI总结 RAISECity通过多模态代理框架实现城市级3D世界生成,提升现实对齐、精度和性能,适用于沉浸媒体和具身智能应用。

Comments Accepted by ACM MM 2026, the code is available at: this https URL (https://github.com/tsinghua-fib-lab/UrbanWorld2.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09209 2026-08-18 cs.GR cs.CV cs.SD 版本更新

EchoMask: Speech-Queried Attention-based Mask Modeling for Holistic Co-Speech Motion Generation

EchoMask:用于整体同步语音动作生成的基于语音查询注意力的掩码建模

Xiangyue Zhang, Jianfang Li, Jiaxu Zhang, Jianqiang Ren, Liefeng Bo, Zhigang Tu

机构 * Wuhan University(武汉大学) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

AI总结 本研究提出EchoMask框架,通过MAM和SQA实现动作对齐的语音特征引导的掩码建模,生成高质量同步语音动作,性能优于现有最先进方法。

Comments 10 pages, 12 figures. Accepted to ACM Multimedia 2025. Project page: this https URL (https://xiangyuezhang.com/EchoMask/;) code and pretrained models: this https URL (https://github.com/Xiangyue-Zhang/EchoMask)

详情

展开后加载摘要…

URL PDF HTML 收藏