arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

共收录 1940
2608.05673 2026-08-07 cs.AI cs.CV cs.LG 新提交

A Unified Framework for Trajectory Prediction with Explicit Planning and Reaction Decomposition

显式规划与反应分解的轨迹预测统一框架

Jiaheng Chen, Jiaxing Li, Tinghe Zhang, Chaopeng Guo

机构 * Software College, Northeastern University(东北大学软件学院)

AI总结 针对现有轨迹预测方法未充分区分社会影响功能角色的问题,提出INTraJ框架,将社会影响分解为规划与反应两阶段,在四个基准上实现性能提升,验证了阶段性社会建模的重要性。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05671 2026-08-07 cs.CV 新提交

URNet: A Unified Reparameterized Network for Efficient RGB-D Semantic Segmentation

URNet:用于高效RGB-D语义分割的统一重参数化网络

Guoan Xu, Zhengxue Wang, Yang Xiao, Ligeng Chen, Guangwei Gao, Dongchen Zhu

机构 * University of Technology Sydney(悉尼科技大学) Nanjing University of Science and Technology(南京理工大学) Honor Device Co., Ltd.(荣耀终端有限公司) Shanghai Institute of Microsystem and Information Technology, CAS(中国科学院上海微系统与信息技术研究所)

AI总结 针对现有RGB-D语义分割方法的不足,提出URNet,通过单编码器实现多模态特征提取与跨模态融合,采用RepBlock、LGA和PMD,在多基准上达到最优性能且高效。

Comments ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05634 2026-08-07 cs.MM 新提交

MEC-Patch: Visible-Infrared Cross-Modal Adversarial Attack Driven by Intrinsic Material Emissivity Laws

MEC-Patch:基于本征材料发射率定律的可见-红外跨模态对抗攻击

Zhixiang Huang, Xinbo Nie, Wenxuan Wang, Lu Yang, Xin Li, Xuelin Qian, Peng Wang

AI总结 本文提出基于斯特藩-玻尔兹曼定律的MEC-Patch跨模态对抗攻击框架,结合NSGA-II与DAR策略,可欺骗多模态检测器并提升环境鲁棒性,为多模态感知系统安全评估提供新思路。

Comments Accepted by the 34th ACM International Conference on Multimedia (MM '26). Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05218 2026-08-07 cs.AI cs.SD 新提交

PD-GS: Phoneme-Driven 3DGS for Audio-Driven Talking Heads

PD-GS:音素驱动的3DGS用于音频驱动的说话头生成

Ao Fu, Yi Zhou

机构 * Southeast University(东南大学) School of Computer Science and Engineering(计算机科学与工程学院)

AI总结 针对3DGS说话头渲染的漏嘴伪影问题,提出PD-GS模型,通过LFM融合音频与音素信息,在HDTF数据集上实现最优嘴唇几何,提升神经化身的语言忠实度。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23070 2026-08-07 cs.CV 版本更新

DishSeg24k: A Large-Scale Benchmark for Food Segmentation with Stochastic Expert Decoding

DishSeg24k:用于食物分割的大规模基准测试及随机专家解码

Yilin Wang, Haochen Shi, Guanyu Chen, Weiqing Min, Jinkai Zheng, Chenggang Yan, Shuqiang Jiang

机构 * Institute of Computing Technology, CAS(中国科学院计算技术研究所) Hangzhou Dianzi University(杭州电子科技大学) North China Electric Power University(华北电力大学) Lishui Institute of Hangzhou Dianzi University(杭州电子科技大学丽水学院)

AI总结 针对现有食物分割基准测试无法捕捉现实用餐场景复杂性的问题,提出DishSeg24k基准测试,并基于此设计FEAST方法,通过将查询解码视为马尔可夫决策过程及重新设计解码器,提升分割性能,在多个指标上优于此前方法。

Comments 9 pages, 8 figures. This paper has been accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16284 2026-08-07 cs.CV cs.MM 版本更新

MAC 2026: Advancing Micro-Action Analysis Towards Fine-Grained Understanding

MAC 2026:推动微动作分析迈向细粒度理解

Kun Li, Dan Guo, Jihao Gu, Pengyu Liu, Xiaobai Li, Haoyu Chen, Yanbin Hao, Guoying Zhao, Meng Wang

机构 * United Arab Emirates University(阿联酋大学) Hefei University of Technology(合肥工业大学) University College London(伦敦大学学院) Zhejiang University(浙江大学) University of Oulu(奥卢大学) CMVS, University of Oulu(奥卢大学计算机视觉与媒体研究中心)

AI总结 本文介绍第三届MAC 2026,以从识别到细粒度微动作理解为主题,扩大挑战范围,引入新任务并借助多模态大语言模型评估,总结了相关数据集、设置、结果等,还探讨了微动作分析未来方向及在视频理解中的作用。

Comments Challenge Summary Paper of the 3rd Micro-Action Analysis Grand Challenge (MAC 2026) at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02183 2026-08-07 cs.AI 版本更新

TRU: Targeted Reverse Update for Efficient Multimodal Recommendation Unlearning

TRU:面向高效多模态推荐去学习的定向反向更新

Zhanting Zhou, KaHou Tam, Ziqiang Zheng, Zeyu Ma, Yang Yang

机构 * University of Electronic Science and Technology of China(电子科技大学) University of Macau(澳门大学)

AI总结 针对多模态推荐系统中数据删除影响不均匀的问题,提出TRU框架,通过层级化干预实现更高效的去学习,提升保留与遗忘的平衡。

Comments Author Accepted Manuscript. Accepted for publication in the Proceedings of the 34th ACM International Conference on Multimedia (ACM MM '26). This author-created manuscript is not the ACM Version of Record

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08894 2026-08-07 cs.NE cs.AI cs.CV 版本更新

Ge$^\text{2}$mS-T: Multi-Dimensional Grouping for Ultra-High Energy Efficiency in Spiking Transformer

Ge$^\text{2}$mS-T:多维分组以实现脉冲变换器中超高能效

Zecheng Hao, Shenghao Xie, Kang Chen, Wenxuan Liu, Zhaofei Yu, Tiejun Huang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) State Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) Academy for Advanced Interdisciplinary Studies, Peking University(北京大学前沿交叉学科研究院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

AI总结 本文提出Ge$^\text{2}$mS-T架构,通过多维分组计算提升Spiking Vision Transformers的能效,解决内存、精度与能耗的平衡问题。

Comments Accepted to ACM MM 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25406 2026-08-07 cs.RO 版本更新

MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation

MMaDA-VLA: 基于统一多模态指令与生成的大型扩散视觉-语言-动作模型

Yang Liu, Pengxiang Ding, Tengyue Jiang, Xudong Wang, Wenxuan Song, Minghui Lin, Han Zhao, Hongyin Zhang, Zifeng Zhuang, Wei Zhao, Siteng Huang, Jinkui Shi, Donglin Wang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) East China University of Science and Technology(华东理工大学) Huawei Celia Team(华为Celia团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) OpenHelix Robotics

AI总结 本文提出MMaDA-VLA模型,通过统一多模态理解与生成框架,解决机器人操控中的时序不一致和长周期误差累积问题,实现高效视觉-语言-动作生成。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11183 2026-08-07 cs.CV 版本更新

Versatile Video Representation via Feed-Forward 2D Gaussian Splatting Tokenization

基于前馈二维高斯溅射标记化的通用视频表示

Zhenghao Chen, Zicong Chen, Lei Liu, Yiming Wu, Dong Xu

AI总结 本研究提出基于前馈2DGS标记化的GVT框架,通过STGE与GSP策略实现通用视频表示,在四项视频任务的多数据集评估中,其重建、压缩性能达先进水平,动作识别提升,生成性能可与MAGVIT-v2媲美。

Comments Accepted by ACM MM 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04891 2026-08-06 eess.SP 新提交

GVC-RT: Towards Real-Time Generative Video Compression at Ultra-Low Bitrates

GVC-RT:面向超低码率下的实时生成视频压缩

Tianjian Dang, Sixian Wang, Lei Luo, Guo Lu, Jincheng Dai

AI总结 本文针对现有生成视频编解码器实时性不足的问题,提出GVC-RT,通过重新设计生成式隐编码框架,在超低码率下实现了优于SOTA模型的压缩性能与实时编码解码速度。

Comments Accepted to appear in the Proceedings of the 34th ACM International Conference on Multimedia (MM '26). 10 pages, 9 figures, and 2 tables. Code: https://github.com/semcomm/GVC-RT

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05126 2026-08-06 cs.CL cs.MM 新提交

Spoken Function Calling: A New Perspective on Spoken Language Understanding for Large Audio Language Models

语音函数调用:面向大型音频语言模型的语音理解新视角

Yuezhang Peng, Yuxin Liu, Changfeng Gao, Zhifu Gao, Xiangang Li, Xie Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Token Foundry, Alibaba Group(阿里巴巴集团Token Foundry) Shanghai Innovation Institute(上海创新研究院)

AI总结 该研究提出语音函数调用(SFC)这一新型语义理解视角,构建SFC-Bench数据集并评估LLMs与LALMs性能,经后训练提升LALMs的SFC能力,实验显示SFC优于传统SLU,可大幅提升语义提取准确率。

Comments ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05101 2026-08-06 cs.CV cs.MM 新提交

HexMIL: Hierarchical Attention MIL for Ante-Hoc Explainable Detection of AI-Manipulated CT Volumes

HexMIL:用于AI篡改CT体积事前可解释检测的分层注意力多实例学习

Orazio Pontorno, Luca Guarnera, Zahid Akhtar, Sebastiano Battiato

机构 * University of Catania(卡塔尼亚大学) State University of New York Polytechnic Institute(纽约州立大学理工学院)

AI总结 HexMIL是一种无掩码的医疗深度伪造检测器,采用分层注意力多实例学习,利用二元体积级监督实现AI篡改CT体积的事前可解释检测,在跨生成器泛化任务中性能优于基线。

Comments Accepted at ACM Multimedia 2026 (MM '26)

Journal ref Proceedings of the 34th ACM International Conference on Multimedia (MM '26), November 10--14, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04750 2026-08-06 cs.CV cs.CL cs.MM 新提交

Simile Understanding in Text-to-Image Models: An Evaluation Framework

文本到图像模型中的明喻理解:一个评估框架

Luecheng Wang, Shintaro Ozaki, Hidetaka Kamigaito, Katsuhiko Hayashi, Jingun Kwon, Manabu Okumura, Taro Watanabe

机构 * The University of Tokyo(东京大学) Nara Institute of Science and Technology(奈良科学技术研究所) Chungnam National University(忠南国立大学) Institute of Science Tokyo(东京科学大学)

AI总结 针对文本到图像模型常混淆明喻喻体与本体的问题,提出含受控数据集、YOLO指标及Diffusion Lens分析的评估框架,实验发现模型存在字面化失败模式并讨论了缓解策略。

Comments Accepted as a full paper at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04655 2026-08-06 cs.CV cs.AI 新提交

CSGen: A Multi-Domain Curvilinear Structure Generation Model via Hierarchical Multimodal Diffusion

CSGen:一种基于分层多模态扩散的多领域曲线结构生成模型

Zhe Shan, Ziming Yang, Lei Zhou, Wenwen Zhang, Cong Lin, Xia Xie

机构 * Hainan University(海南大学) Guangdong Ocean University(广东海洋大学)

AI总结 该研究针对可控曲线结构图像生成的挑战,提出CSGen模型,通过构建多领域数据集、分层渐进控制策略与稀疏感知损失机制,提升生成图像的结构精度与下游分割性能,为曲线结构分析提供新范式。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04610 2026-08-06 cs.CV 新提交

HiSC: Hierarchical Spatial Clustering Token Compression for Efficient 3D Scene Understanding

HiSC:用于高效3D场景理解的分层空间聚类令牌压缩

Jiuhe Qu, Yingping Liang, Ying Fu

机构 * Beijing Institute of Technology(北京理工大学)

AI总结 本文提出无训练框架HiSC,通过SGraM策略和SCluP范式实现3D VLMs的分层空间聚类令牌压缩,在高剪枝率下实现超90%令牌减少且性能下降极小,验证了其有效性。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04581 2026-08-06 cs.CV 新提交

ACA-GS: Adaptive-Capacity Anchored Gaussian Splatting for Compact Dynamic Radiance Fields

ACA-GS:用于紧凑动态辐射场的自适应容量锚定高斯溅射

Seunghyeon Song, Joo Chan Lee, Chanung Park, Jun Young Jeong, Minseo Lee, Eunbyung Park, Jong Hwan Ko

机构 * Sungkyunkwan University(成均馆大学) Electronics and Telecommunications Research Institute(电子通信研究院) Yonsei University(延世大学)

AI总结 针对4D高斯溅射中运动表达与存储效率的权衡,提出自适应容量锚定高斯溅射框架,通过调整锚点的神经高斯数量和特征通道实现紧凑动态辐射场,在多数据集上显著压缩存储且不降低质量。

Comments 9 pages, 8 figures. Accepted to ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04385 2026-08-06 cs.CV 新提交

ReGround: Restoring Visual Grounding in Multi-Step Reasoning through Self-Diagnosis and Visual Re-Examination

ReGround:通过自诊断与视觉重检验恢复多步推理中的视觉接地

Lei Peng, Shuai Lv, Wei Hu

机构 * University of Science and Technology of China(中国科学技术大学) School of Artificial Intelligence and Data Science(人工智能与数据科学学院) State Key Laboratory of Precision and Intelligent Chemistry(精准与智能化学国家重点实验室)

AI总结 ReGround是无需架构修改或外部工具的两阶段框架,通过自诊断与视觉重检验解决VLMs多步推理中的视觉接地丢失问题,在八个基准上获一致增益且推理开销适度。

Comments Accepted to ACM Multimedia 2026 (MM '26). 8 pages main text, 4 figures, plus appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01147 2026-08-06 cs.IR cs.CL cs.CV 版本更新

UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering

UniHEAR:面向基于知识的视觉问答的统一异构源注意力检索

Ganzhong Luo, Yang Ren, Hanyong Wang, Shuyu Zheng, Menglong Yang

AI总结 针对KB-VQA现有系统的单源检索瓶颈与检索源盲重排序问题,提出UniHEAR框架,在E-VQA和InfoSeek数据集上实现最优检索与VQA性能,提升Recall@1达6.7和1.2个点。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21105 2026-08-06 cs.CV 版本更新

HalluScope: Fine-grained Hallucination Diagnosis for Multimodal Large Language Models

HalluScope:多模态大语言模型的细粒度幻觉诊断

Weilin Jin, Mingyu Wang, Wenbo Li, Haoyang Huang, Yifan Wu, Ying Li, Gang Huang, Zhonghai Wu

机构 * Peking University(北京大学) Joy Future Academy(京东探索研究院)

AI总结 研究针对多模态大语言模型的幻觉问题,提出细粒度幻觉诊断任务,开发数据集并设计奖励函数,训练HalluScope-4B和HalluScope-8B模型,在多个基准测试中达最优,其诊断解释能有效指导目标模型纠正幻觉。

Comments Accepted to ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15890 2026-08-06 cs.CV 版本更新

Exo2EgoPose: Leveraging Exocentric Demonstrations for Vision-Language guided Egocentric 3D Hand Pose Forecasting

Exo2EgoPose:利用外心演示进行视觉语言引导的自我中心3D手部姿态预测

Zhaofeng Shi, Heqian Qiu, Lanxiao Wang, Xiang Li, Hongliang Li

机构 * University of Electronic Science and Technology of China(电子科技大学)

AI总结 研究视觉语言引导的自我中心3D手部姿态预测任务,提出Exo2EgoPose框架,利用外心演示补偿自我中心视角线索不足,含双层外心重建模块和全局到局部调制模块,实验显示该方法优于现有技术,具备人机转移能力且有改进。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10082 2026-08-06 cs.CV cs.MM cs.RO eess.IV 版本更新

Label-Free Target-Domain Adaptation for Unconstrained Event-Image Feature Matching via Dual-Stage Distillation

通过双阶段蒸馏实现无约束事件-图像特征匹配的无标签目标域适应

Zhonghua Yi, Hao Shi, Qi Jiang, Yufan Zhang, Kailun Yang, Kaiwei Wang

机构 * Zhejiang University(浙江大学) Hunan University(湖南大学) National University of Defense Technology(国防科技大学) Ant Group(蚂蚁集团)

AI总结 研究针对无约束事件-图像特征匹配问题,提出双阶段训练范式,先进行无标签蒸馏预训练,再引入极线引导自蒸馏框架,在新的跨模态评估基准上实验,取得领先的姿态估计性能。

Comments Accepted to ACM MM 2026. The source code and benchmark will be made publicly available at https://github.com/ZhonghuaYi/nexus2-official

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21343 2026-08-06 cs.CV 版本更新

Latent Denoising Improves Visual Alignment in Large Multimodal Models

潜在去噪提升大多模态模型的视觉对齐

Dhruv Parikh, Jacob Fein-Ashley, Rajgopal Kannan, Viktor Prasanna

机构 * University of Southern California(南加州大学) DEVCOM ARL Army Research Office(DEVCOM ARL陆军研究办公室)

AI总结 本文提出通过潜在去噪框架改进大多模态模型的内部视觉特征对齐和多模态理解,采用掩码和高斯噪声混合腐蚀视觉token,并利用解码器恢复教师特征,提升模型在分布偏移下的鲁棒性。

Comments ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12735 2026-08-06 cs.CV 版本更新

AffectAgent: Collaborative Multi-Agent Reasoning for Retrieval-Augmented Multimodal Emotion Recognition

AffectAgent:协同多智能体推理用于检索增强的多模态情感识别

Zeheng Wang, Zitong Yu, Yijie Zhu, Bo Zhao, Haochen Liang, Taorui Wang, Wei Xia, Jiayu Zhang, Zhishu Liu, Hui Ma, Fei Ma, Qi Tian

机构 * Great Bay University(大湾大学) Guangming Laboratory(光明实验室)

AI总结 本文提出AffectAgent,通过协同多智能体推理框架,解决多模态情感识别中的模态模糊和复杂情感依赖问题,引入MB-MoE和RAAF提升表现。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02778 2026-08-06 cs.CL 版本更新

When Modalities Remember: Continual Learning for Multimodal Knowledge Graphs

当模态记住:多模态知识图谱的持续学习

Linyu Li, Zhi Jin, Yichi Zhang, Dongming Jin, Yuanpeng He, Haoran Duan, Gadeng Luosang, Nyima Tashi

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Computer Science, Zhejiang University(浙江大学计算机科学学院) School of Cyber Science and Engineering, Wuhan University(武汉大学网络科学与工程学院) School of Information Science and Technology, Tibet University(西藏大学信息科学与技术学院)

AI总结 本文提出MRCKG模型,通过多模态-结构协同课程和跨模态知识保存机制,解决多模态知识图谱的持续学习问题,提升新知识学习能力。

Comments Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00513 2026-08-06 cs.LG cs.AI cs.CV cs.IR 版本更新

MOON3.0: Reasoning-aware Multimodal Representation Learning for E-commerce Product Understanding

MOON3.0: 基于推理的多模态表示学习用于电商产品理解

Junxian Wu, Chenghan Fu, Zhanheng Nie, Daoze Zhang, Bowen Wan, Wanxian Guan, Chuan Yu, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

AI总结 MOON3.0通过多头模态融合、联合对比与强化学习框架及细粒度残差增强模块,提升电商产品细粒度属性建模能力,并在大规模多模态电商基准MBe3.0上实现零样本最优性能。

Comments Accepted by the 34th ACM International Conference on Multimedia (ACM MM), 2026. 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01407 2026-08-06 cs.CV cs.AI 版本更新

ZoomV: Temporal Zoom-in for Efficient Long Video Understanding

TimeSearch: 基于聚光灯和反射的层次视频搜索用于类人长视频理解

Yuan Zhang, Junwen Pan, Rui Zhang, Xin Wan, Qizhe Zhang, Ming Lu, Qi She, Shanghang Zhang

机构 * ByteDance(字节跳动) School of Computer Science, Peking University(北京大学计算机科学学院)

AI总结 TimeSearch通过Spotlight和Reflection机制,提升长视频理解的准确性和效率

Comments ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12265 2026-08-06 cs.LG cs.AI cs.CR cs.CV math.OC 版本更新

Stabilizing Multi-Attack Adversarial Training via Bandit Optimization

通过老虎机优化稳定多攻击对抗训练

Rui Wang, Zeming Wei, Xiyue Zhang, Meng Sun

机构 * Peking University(北京大学) University of Bristol(布里斯托大学)

AI总结 针对多攻击对抗训练的高开销或参数漂移问题,提出校准对抗采样(CAS)框架,将其转化为多臂老虎机优化,降低成本并提升鲁棒性。

Comments ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03559 2026-08-05 cs.CV 新提交

Compass: Degradation-Simulated Reciprocal Learning with Lightweight Needle RWKV for Multimodal Crack Segmentation under Missing Modalities

Compass:面向缺失模态场景下多模态裂缝分割的退化模拟互学习与轻量型Needle RWKV

Hui Liu, Chen Jia, Fan Shi, Xu Cheng, Mianzhao Wang, Shengyong Chen

AI总结 Compass是面向缺失模态场景的多模态裂缝分割轻量型网络,通过DSD、Needle Block与ETPF实现鲁棒分割,在90%深度模态缺失时仍达SOTA性能,仅需258万参数。

Comments This paper has been accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03450 2026-08-05 cs.MM cs.AI cs.CL cs.CV 新提交

Balancing Efficiency and Efficacy: Training-Free Attention-Guided Switching Between Explicit and Latent Thoughts for MLLMs

平衡效率与效能:面向多模态大语言模型(MLLM)的无训练注意力引导式显式与隐式思维切换

Haoqian Kang, Liupeng Li, Kuofeng Gao, Jinpeng Wang, Zhenyu Lu, Bin Chen, Ke Chen, Yaowei Wang

AI总结 针对MLLM推理中感知与逻辑混淆的问题,提出无训练的注意力引导式切换框架,通过视觉-文本注意力比率自适应切换显式与隐式推理,实现性能与效率的双重提升。

Comments Accepted by ACM MM 2026. 10 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏