arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

共收录 136
2608.07340 2026-08-10 cs.CV cs.AI 新提交

H2AL: Hyperbolic Hierarchy-aware Aggregative Learning for Registration-based Few-shot Medical Image Segmentation

H2AL:用于基于配准的小样本医学图像分割的双曲层次感知聚合学习

Jia Wang, Jiaming Cai, Zunying Hu, Zhanjie Wu, Jinyuan Liu, Hua Cheng, Yun Peng

机构 * Dalian University of Technology(大连理工大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

AI总结 针对基于配准的小样本医学图像分割忽视解剖结构层次的问题,提出H2AL框架,通过H2I模块与梯度聚合算法提升配准和分割性能,实验验证其有效性。

Comments 10 pages, 9 figures. Accepted at ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06981 2026-08-10 cs.CV 新提交

Local Epistemic Uncertainty Guided Active Sampling for Plug-and-play Diffusive Image Restoration

面向即插即用扩散式图像复原的局部认知不确定性引导主动采样

Jiaqi Zhang, Zheng Pang, Rongrong Gao, Qiyuan Zhang, Yang Yang

机构 * Jiangsu University(江苏大学)

AI总结 该研究针对现有DMIR方法忽略生成过程动态性的局限,提出LEADer框架,通过空间域逐像素不确定性调节与时间域自适应轨迹剪枝,提升图像复原性能并减少采样时间,且可即插即用集成至多种DMIR基线。

Comments 12 Pages, 7 Figures, 5 Tables. Accepted to ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06732 2026-08-10 cs.AI cs.CV cs.MM 新提交

From Cheap Fakes to Pure Synthesis: Addressing the New Era of T2V Fake News Videos

从廉价伪造到纯合成:应对文本生成视频(T2V)假新闻视频的新时代

Yifeng Luo, Yupeng Li, Liang Lan, Tian Wang

机构 * Hong Kong Baptist University(香港浸会大学) Beijing Normal University(北京师范大学)

AI总结 该研究针对纯合成T2V假新闻视频带来的新威胁,构建了首个纯合成假新闻视频数据集,提出R-T2V框架,在10种主流基准上取得最优检测性能。

Comments Accepted at ACM Multimedia (ACM MM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06236 2026-08-07 cs.CV cs.AI 新提交

Depth-Guided Video Object Counting in Crowded Scenes

拥挤场景中基于深度引导的视频目标计数

Yuanjing Xu, Xinyan Liu, Weidong Chen, Zixuan Zou, Linhao Zhang, Zhuangzhe Meng, Antoni B. Chan, Weigang Zhang

AI总结 该研究针对拥挤场景视频目标计数的局限性,提出DG-Det与后处理流水线、去重框架,发布新数据集,使MAE降62.01%且RMSE提升。

Comments Accepted at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06102 2026-08-07 cs.NI cs.MM 新提交

MultiMoQ: Multi-Access Media-Over-QUIC for Robust Immersive Video Streaming

MultiMoQ:面向鲁棒沉浸式视频流的多接入媒体传输 QUIC

Yitong Li, Xinjiao Li, Ruonan Chai, Dirk Kutscher

AI总结 本文提出基于MoQ的多接入分块流框架MultiMoQ,通过重新设计传输机制提升沉浸式视频流的鲁棒性,经仿真验证其在吞吐量、延迟及播放连续性上优于DASH和标准MoQ。

Comments 9 pages, 15 figures. Accepted for publication in the Proceedings of the 34th ACM International Conference on Multimedia (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05848 2026-08-07 cs.CV 新提交

DTRNet: Dual Text-Radical Decoding for Handwritten Chinese Text Recognition with Faked Character Detection

DTRNet:用于手写中文文本识别及伪造字符检测的双文本-偏旁解码框架

Runrui Li, Lin Zhu, Hua Huang

AI总结 针对教育场景中手写中文文本识别需检测伪造字符的需求,本文提出DTRNet框架,通过解耦文本识别与结构验证,实现高效且可解释的伪造字符检测,效果显著。

Comments Accepted by ACM MM 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05769 2026-08-07 cs.CV 新提交

Flow-Map Distillation on Relation Manifolds for Image Restoration

面向图像复原的关系流形上的流图蒸馏

Zihao He, Songhua Liu

AI总结 本文提出FoRM方法,将关系知识迁移转化为关系流形上的流图映射问题,通过安全半群一致性约束等优化,在5项图像复原任务上降低训练方差约50%,性能优于现有蒸馏基线。

Comments 9 pages, 7 figures. Accepted to ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05673 2026-08-07 cs.AI cs.CV cs.LG 新提交

A Unified Framework for Trajectory Prediction with Explicit Planning and Reaction Decomposition

显式规划与反应分解的轨迹预测统一框架

Jiaheng Chen, Jiaxing Li, Tinghe Zhang, Chaopeng Guo

机构 * Software College, Northeastern University(东北大学软件学院)

AI总结 针对现有轨迹预测方法未充分区分社会影响功能角色的问题,提出INTraJ框架,将社会影响分解为规划与反应两阶段,在四个基准上实现性能提升,验证了阶段性社会建模的重要性。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05671 2026-08-07 cs.CV 新提交

URNet: A Unified Reparameterized Network for Efficient RGB-D Semantic Segmentation

URNet:用于高效RGB-D语义分割的统一重参数化网络

Guoan Xu, Zhengxue Wang, Yang Xiao, Ligeng Chen, Guangwei Gao, Dongchen Zhu

机构 * University of Technology Sydney(悉尼科技大学) Nanjing University of Science and Technology(南京理工大学) Honor Device Co., Ltd.(荣耀终端有限公司) Shanghai Institute of Microsystem and Information Technology, CAS(中国科学院上海微系统与信息技术研究所)

AI总结 针对现有RGB-D语义分割方法的不足,提出URNet,通过单编码器实现多模态特征提取与跨模态融合,采用RepBlock、LGA和PMD,在多基准上达到最优性能且高效。

Comments ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05634 2026-08-07 cs.MM 新提交

MEC-Patch: Visible-Infrared Cross-Modal Adversarial Attack Driven by Intrinsic Material Emissivity Laws

MEC-Patch:基于本征材料发射率定律的可见-红外跨模态对抗攻击

Zhixiang Huang, Xinbo Nie, Wenxuan Wang, Lu Yang, Xin Li, Xuelin Qian, Peng Wang

AI总结 本文提出基于斯特藩-玻尔兹曼定律的MEC-Patch跨模态对抗攻击框架,结合NSGA-II与DAR策略,可欺骗多模态检测器并提升环境鲁棒性,为多模态感知系统安全评估提供新思路。

Comments Accepted by the 34th ACM International Conference on Multimedia (MM '26). Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05218 2026-08-07 cs.AI cs.SD 新提交

PD-GS: Phoneme-Driven 3DGS for Audio-Driven Talking Heads

PD-GS:音素驱动的3DGS用于音频驱动的说话头生成

Ao Fu, Yi Zhou

机构 * Southeast University(东南大学) School of Computer Science and Engineering(计算机科学与工程学院)

AI总结 针对3DGS说话头渲染的漏嘴伪影问题,提出PD-GS模型,通过LFM融合音频与音素信息,在HDTF数据集上实现最优嘴唇几何,提升神经化身的语言忠实度。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04891 2026-08-06 eess.SP 新提交

GVC-RT: Towards Real-Time Generative Video Compression at Ultra-Low Bitrates

GVC-RT:面向超低码率下的实时生成视频压缩

Tianjian Dang, Sixian Wang, Lei Luo, Guo Lu, Jincheng Dai

AI总结 本文针对现有生成视频编解码器实时性不足的问题,提出GVC-RT,通过重新设计生成式隐编码框架,在超低码率下实现了优于SOTA模型的压缩性能与实时编码解码速度。

Comments Accepted to appear in the Proceedings of the 34th ACM International Conference on Multimedia (MM '26). 10 pages, 9 figures, and 2 tables. Code: https://github.com/semcomm/GVC-RT

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05126 2026-08-06 cs.CL cs.MM 新提交

Spoken Function Calling: A New Perspective on Spoken Language Understanding for Large Audio Language Models

语音函数调用:面向大型音频语言模型的语音理解新视角

Yuezhang Peng, Yuxin Liu, Changfeng Gao, Zhifu Gao, Xiangang Li, Xie Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Token Foundry, Alibaba Group(阿里巴巴集团Token Foundry) Shanghai Innovation Institute(上海创新研究院)

AI总结 该研究提出语音函数调用(SFC)这一新型语义理解视角,构建SFC-Bench数据集并评估LLMs与LALMs性能,经后训练提升LALMs的SFC能力,实验显示SFC优于传统SLU,可大幅提升语义提取准确率。

Comments ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05101 2026-08-06 cs.CV cs.MM 新提交

HexMIL: Hierarchical Attention MIL for Ante-Hoc Explainable Detection of AI-Manipulated CT Volumes

HexMIL:用于AI篡改CT体积事前可解释检测的分层注意力多实例学习

Orazio Pontorno, Luca Guarnera, Zahid Akhtar, Sebastiano Battiato

机构 * University of Catania(卡塔尼亚大学) State University of New York Polytechnic Institute(纽约州立大学理工学院)

AI总结 HexMIL是一种无掩码的医疗深度伪造检测器,采用分层注意力多实例学习,利用二元体积级监督实现AI篡改CT体积的事前可解释检测,在跨生成器泛化任务中性能优于基线。

Comments Accepted at ACM Multimedia 2026 (MM '26)

Journal ref Proceedings of the 34th ACM International Conference on Multimedia (MM '26), November 10--14, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04750 2026-08-06 cs.CV cs.CL cs.MM 新提交

Simile Understanding in Text-to-Image Models: An Evaluation Framework

文本到图像模型中的明喻理解:一个评估框架

Luecheng Wang, Shintaro Ozaki, Hidetaka Kamigaito, Katsuhiko Hayashi, Jingun Kwon, Manabu Okumura, Taro Watanabe

机构 * The University of Tokyo(东京大学) Nara Institute of Science and Technology(奈良科学技术研究所) Chungnam National University(忠南国立大学) Institute of Science Tokyo(东京科学大学)

AI总结 针对文本到图像模型常混淆明喻喻体与本体的问题,提出含受控数据集、YOLO指标及Diffusion Lens分析的评估框架,实验发现模型存在字面化失败模式并讨论了缓解策略。

Comments Accepted as a full paper at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04655 2026-08-06 cs.CV cs.AI 新提交

CSGen: A Multi-Domain Curvilinear Structure Generation Model via Hierarchical Multimodal Diffusion

CSGen:一种基于分层多模态扩散的多领域曲线结构生成模型

Zhe Shan, Ziming Yang, Lei Zhou, Wenwen Zhang, Cong Lin, Xia Xie

机构 * Hainan University(海南大学) Guangdong Ocean University(广东海洋大学)

AI总结 该研究针对可控曲线结构图像生成的挑战,提出CSGen模型,通过构建多领域数据集、分层渐进控制策略与稀疏感知损失机制,提升生成图像的结构精度与下游分割性能,为曲线结构分析提供新范式。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04610 2026-08-06 cs.CV 新提交

HiSC: Hierarchical Spatial Clustering Token Compression for Efficient 3D Scene Understanding

HiSC:用于高效3D场景理解的分层空间聚类令牌压缩

Jiuhe Qu, Yingping Liang, Ying Fu

机构 * Beijing Institute of Technology(北京理工大学)

AI总结 本文提出无训练框架HiSC,通过SGraM策略和SCluP范式实现3D VLMs的分层空间聚类令牌压缩,在高剪枝率下实现超90%令牌减少且性能下降极小,验证了其有效性。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04581 2026-08-06 cs.CV 新提交

ACA-GS: Adaptive-Capacity Anchored Gaussian Splatting for Compact Dynamic Radiance Fields

ACA-GS:用于紧凑动态辐射场的自适应容量锚定高斯溅射

Seunghyeon Song, Joo Chan Lee, Chanung Park, Jun Young Jeong, Minseo Lee, Eunbyung Park, Jong Hwan Ko

机构 * Sungkyunkwan University(成均馆大学) Electronics and Telecommunications Research Institute(电子通信研究院) Yonsei University(延世大学)

AI总结 针对4D高斯溅射中运动表达与存储效率的权衡,提出自适应容量锚定高斯溅射框架,通过调整锚点的神经高斯数量和特征通道实现紧凑动态辐射场,在多数据集上显著压缩存储且不降低质量。

Comments 9 pages, 8 figures. Accepted to ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04385 2026-08-06 cs.CV 新提交

ReGround: Restoring Visual Grounding in Multi-Step Reasoning through Self-Diagnosis and Visual Re-Examination

ReGround:通过自诊断与视觉重检验恢复多步推理中的视觉接地

Lei Peng, Shuai Lv, Wei Hu

机构 * University of Science and Technology of China(中国科学技术大学) School of Artificial Intelligence and Data Science(人工智能与数据科学学院) State Key Laboratory of Precision and Intelligent Chemistry(精准与智能化学国家重点实验室)

AI总结 ReGround是无需架构修改或外部工具的两阶段框架,通过自诊断与视觉重检验解决VLMs多步推理中的视觉接地丢失问题,在八个基准上获一致增益且推理开销适度。

Comments Accepted to ACM Multimedia 2026 (MM '26). 8 pages main text, 4 figures, plus appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03559 2026-08-05 cs.CV 新提交

Compass: Degradation-Simulated Reciprocal Learning with Lightweight Needle RWKV for Multimodal Crack Segmentation under Missing Modalities

Compass:面向缺失模态场景下多模态裂缝分割的退化模拟互学习与轻量型Needle RWKV

Hui Liu, Chen Jia, Fan Shi, Xu Cheng, Mianzhao Wang, Shengyong Chen

AI总结 Compass是面向缺失模态场景的多模态裂缝分割轻量型网络,通过DSD、Needle Block与ETPF实现鲁棒分割,在90%深度模态缺失时仍达SOTA性能,仅需258万参数。

Comments This paper has been accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03450 2026-08-05 cs.MM cs.AI cs.CL cs.CV 新提交

Balancing Efficiency and Efficacy: Training-Free Attention-Guided Switching Between Explicit and Latent Thoughts for MLLMs

平衡效率与效能:面向多模态大语言模型(MLLM)的无训练注意力引导式显式与隐式思维切换

Haoqian Kang, Liupeng Li, Kuofeng Gao, Jinpeng Wang, Zhenyu Lu, Bin Chen, Ke Chen, Yaowei Wang

AI总结 针对MLLM推理中感知与逻辑混淆的问题,提出无训练的注意力引导式切换框架,通过视觉-文本注意力比率自适应切换显式与隐式推理,实现性能与效率的双重提升。

Comments Accepted by ACM MM 2026. 10 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03264 2026-08-05 cs.MM cs.CV cs.SD 新提交

Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation

听而能视:面向视听实例分割的状态感知聆听

Leiye Liu, Miao Zhang, Jiahong Jiang, Jingjing Li, Jialong Zhong, Kai Peng, Tingwei Liu, Wei Ji, Yongri Piao, Huchuan Lu

AI总结 本文提出 Hear to See(H2S)模型,通过 ASP 和 ADM 机制解决视听实例分割中重叠声源匹配与异步动态跟踪问题,在 AVISeg 数据集上实现 SOTA 性能,mAP 达 48.54,较此前方法提升 7.8%。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03225 2026-08-05 cs.CV 新提交

Open-Linguistic Concept Unified Learning for Cross-Site Interpretable Dermatology Image Diagnosis

面向跨站点可解释皮肤病图像诊断的开放语言概念统一学习

Chengyu Wu, Junpeng Tan, Wanxiang Luo, Yaqi Wang, Yandong Wen, Yefeng Zheng

AI总结 针对现有概念模型跨站点泛化差、适配FVLMs成本高的问题,提出开放语言概念统一学习框架UniCon,通过共享语义空间等三项创新实现多模态可解释皮肤病诊断,获顶级准确率且具备跨站点干预能力。

Comments accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03151 2026-08-05 cs.CR cs.HC 新提交

AirKey: Multimodal Acoustic-Assisted WiFi Sensing for Zero-Training Robust PIN Inference

AirKey:用于零训练鲁棒PIN推断的多模态声学辅助WiFi感知

BaiChuan Wu, Bin Liu, Xiang Zhang, Zhi Liu, Jie Zhang, Chao Liu, Huan Yan, Meng Li, Fusang Zhang

AI总结 AirKey是一种多模态感知框架,通过利用IEEE 802.11机制和声学信号辅助WiFi感知,实现零训练鲁棒PIN推断,准确率超现有单模态方案4倍,可在6次尝试内恢复设备解锁PIN,凸显智能界面的隐私漏洞。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03120 2026-08-05 cs.CV 新提交

SeCo-SBIR: Semantically Consistent Prompt Learning for Zero-Shot Sketch-Based Image Retrieval

SeCo-SBIR:用于零样本草图-图像检索的语义一致提示学习

Long Hoang Dang, Tuan Nguyen Huu, Nguyen Minh Hieu, Tu Minh Phuong

AI总结 SeCo-SBIR是解决CLIP适配ZS-SBIR时域适配与泛化矛盾的语义一致提示学习框架,结合多模态提示、一致性约束与多目标损失,在三类ZS-SBIR基准上达最优性能。

Comments ACMMM 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03083 2026-08-05 cs.CV cs.CL 新提交

GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models

GSTEP:面向高效视频大语言模型的全局时空密度驱动视觉令牌剪枝

Mengjie Zhang, Qihui Zhu, Tao Zhang, Shuangwu Chen, Huihuang Qin, Yu Guo, Shenghao Ye, Zijian Wen, Yunpeng Hou, Dong Jin, Xiaobin Tan, Huasen He, Jian Yang

AI总结 本文提出即插即用的GSTEP剪枝框架,解决现有视频令牌剪枝方法的局部剪枝缺陷,在多个VideoLLMs上实现良好的准确率-效率权衡,在LLaVA-OneVision-7B上剪去75%视觉令牌,保留100.2%原始性能并获1.17倍端到端加速。

Comments 4 figures, accepted to ACM MM 26'

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03047 2026-08-05 cs.CV cs.MM 新提交

AIDE: Automated Instruction via Distilled Expertise for Reference-Free Motor Skill Coaching

AIDE:基于提炼专业知识的自动化指令,用于无参考的运动技能指导

Yoshiki Ito

AI总结 研究针对运动技能指导中专业教练稀缺的问题,提出AIDE框架,仅训练阶段用专业参考、推理阶段仅用学习者姿态生成反馈,在ExpertAF数据集上性能优于无参考基线,与需双阶段专业演示的方法相当。

Comments Accepted to ACM Multimedia 2026. 12 pages (including supplementary material), 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02258 2026-08-04 cs.CV cs.AI 新提交

Open-Set Visual Text Forensics via Sparse-Constraint Rectified Flow

基于稀疏约束修正流的开放集视觉文本取证

Jiangling Zhang, Shuxuan Gao, Zeyu Chen, Yichao Liu, Yu Zhou

AI总结 针对生成式AI视觉文本篡改的开放集取证问题,提出基于SC-RF的生成式检测器,在三基准上F1、IoU优于亚军,零样本性能强,还可用于漏洞分析。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02236 2026-08-04 cs.CV 新提交

GenPrior: Unleashing Text-to-Motion Generative Priors for Zero-Shot Skeleton-based Action Recognition

GenPrior:释放文本到动作生成先验用于零样本骨骼-based动作识别

Jidong Kuang, Hongsong Wang, Jie Gui

机构 * School of Cyber Science and Engineering, Southeast University(东南大学网络空间安全学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Purple Mountain Laboratories(紫金山实验室)

AI总结 GenPrior是首个利用预训练T2M模型生成先验的ZSAR框架,通过分散门控特征融合和生成原型细化,在NTU-60等数据集上实现零样本及广义零样本动作识别的SOTA性能。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02216 2026-08-04 cs.CV 新提交

Local Margin Restoration for Test-Time Adaptation of Vision-Language Models

用于视觉-语言模型测试时适应的局部间隔恢复

Yan Huang, Guowei Wang, Xu Wang, Kangjun Liu, Xin Lin

机构 * Guangzhou University(广州大学) The Second Affiliated Hospital of Guangzhou University of Chinese Medicine(广州中医药大学第二附属医院) Jinan University(暨南大学) Pengcheng Laboratory(鹏城实验室)

AI总结 针对视觉-语言模型测试时分布偏移导致的性能下降问题,提出局部间隔恢复框架,通过样本级受保护间隔恢复与流级双阶段稳定机制,在多数据集上实现优于现有基线的性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏