A Multimodal Framework for Video Ads Understanding
专题命中 视频多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV
Comments 4 pages; 2 figures; ACM MM 2021 workshop; Tencent Advertising Algorithm Competition ACM Multimedia 2021 Grand Challenge
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 视频多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV
Comments 4 pages; 2 figures; ACM MM 2021 workshop; Tencent Advertising Algorithm Competition ACM Multimedia 2021 Grand Challenge
专题命中 视频多模态 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV
Comments Accepted in ICCV'21
专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments This paper is accepted by ACM International Conference on Multimedia Retrieval (ICMR), 2021
专题命中 视频多模态 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV
Comments Accepted to NeurIPS 2020 (spotlight presentation)
专题命中 视频多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV
Comments ECCV 2020 (spotlight paper)
专题命中 视频多模态 :multi-modal(title,abstract);audio-visual(abstract);分类 cs.CV
Journal ref ICCV2019
专题命中 视频多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV
Comments under review for Pattern Recognition Letters
专题命中 视频多模态 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV
Comments ECCV YouTube-8M workshop general paper
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted for ECCV 2018
专题命中 视频多模态 :cross-modal(title);multi-modal(abstract);audio-visual(abstract);分类 cs.CV
Comments 16 pages
推理,再推理:跨视角重访提升空间推理
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 视频多模态 :MLLM(summary_cn,abstract);分类 cs.CV、cs.AI
AI总结 提出ReRe框架,通过生成互补新视角视频让MLLM先推理再验证,无需训练即可显著提升空间推理性能。
Comments ICML 2026
CoVEBench: 视频编辑模型能处理复杂指令吗?
机构 * Nanjing University(南京大学) ; Kuaishou Technology(快手科技)
专题命中 视频多模态 :MLLM(summary_cn,abstract);分类 cs.CV、cs.AI
AI总结 提出CoVEBench基准,包含416个源视频和626条多点编辑指令,通过MLLM评估指令遵循度和保真度,揭示当前模型在组合编辑中常遗漏编辑或破坏保留约束。
Comments 34 pages, 11 figures, 9 tables
MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues
机构 * Hong Kong University of Science and Technology(香港理工大学) ; Xi’an Jiaotong University(西安交通大学) ; Tencent(腾讯)
专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文研究了多模态大语言模型(MLLMs)在视频时间定位中的感知与生成之间的差距,提出了一种推理阶段的读取-再生成框架,通过利用注意力线索来提高时间定位的准确性,从而在三个视频时间定位基准上提升了MiMo-VL-7B、Qwen3-VL-8B和TimeLens-8B的性能。
Comments Project Website: https://ddz16.github.io/mllmsknowwhen.github.io/
VisPhyWorld: 通过代码驱动的视频重建探测物理推理
机构 * University of Waterloo(滑铁卢大学) ; Autodesk AI Lab(Autodesk人工智能实验室) ; Independent Researcher(独立研究者)
专题命中 视频多模态 :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出VisPhyWorld框架,通过要求模型从视觉观察生成可执行的模拟器代码来评估物理推理能力,引入VisPhyBench基准测试集,验证模型在重建外观和模拟物理运动方面的能力,发现最先进的MLLM在准确推断物理参数和模拟一致的物理动态方面存在困难。
OpenRC:一种用于多模态数据采集和自主性研究的开源机器人结肠镜框架
机构 * Walker Department of Mechanical Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校沃克机械工程系) ; Department of Surgical Oncology, Division of Surgery, The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心外科肿瘤学系) ; School of Medicine and Health, Technical University of Munich(慕尼黑工业大学医学与健康学院)
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract)
AI总结 OpenRC框架通过整合开源硬件和多模态数据集,为机器人结肠镜和手术自主性研究提供了可重复的基础,支持同时记录视频、操作指令、执行状态和末端位置,并验证了运动一致性和跨模态延迟。
Comments Abstract: Added repository and contribution statement
MoCA:用于数字健康测量的多模态交叉掩码自编码器
机构 * Herbert Wertheim School of Public Health and Human Longevity Science, University of California, San Diego, San Diego, CA, USA(赫伯特·韦瑟姆公共卫生与人类长寿科学学院,加州大学圣地亚哥分校) ; Halıcıoğlu Data Science Institute, University of California San Diego, San Diego, CA, USA(哈利奇奥卢数据科学研究所,加州大学圣地亚哥分校) ; Department of Computer Science and Engineering, University of California San Diego, San Diego, CA, USA(计算机科学与工程系,加州大学圣地亚哥分校) ; Division of Public Health Sciences, Fred Hutchinson Cancer Center, Seattle, WA, USA(公共卫生科学部,Fred Hutchinson癌症中心)
专题命中 视频多模态 :multi-modal(title,abstract);cross-modal(abstract)
AI总结 提出MoCA自监督学习框架,结合Transformer与MAE,通过跨模态掩码提升多模态可穿戴数据的重构与分类性能,兼具理论保障,可处理缺失模态并应用于数字健康领域。
AirKey:用于零训练鲁棒PIN推断的多模态声学辅助WiFi感知
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract)
AI总结 AirKey是一种多模态感知框架,通过利用IEEE 802.11机制和声学信号辅助WiFi感知,实现零训练鲁棒PIN推断,准确率超现有单模态方案4倍,可在6次尝试内恢复设备解锁PIN,凸显智能界面的隐私漏洞。
Comments Accepted by ACM MM 2026
MultiToP:学习修补视觉令牌以减轻视频大型多模态模型中的幻觉
机构 * Zhejiang University(浙江大学) ; Sun Yat-sen University(中山大学) ; East China Normal University(华东师范大学)
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 提出MultiToP框架,通过轻量级视觉令牌修补器动态替换不可靠视觉令牌,结合信息引导排名校准和稀疏正则化,在不修改原模型情况下减少视频多模态模型幻觉,显著提升F1分数和问答准确率。
Comments Preprint
EgoBabyVLM:基于自然主义第一人称视频数据的跨模态学习基准测试
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; Stanford University(斯坦福大学) ; Meta Reality Labs(Meta现实实验室) ; The University of Tokyo(东京大学)
专题命中 视频多模态 :cross-modal(title);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 研究探讨了儿童如何从有限的视觉-语言输入中获得语言 grounding 的鲁棒性,提出了 EgoBabyVLM 挑战,推动模型在自然主义数据中实现 grounded language learning。
UTOPYA:一种用于物理信息异常检测和时间序列预测的多模态深度学习框架
机构 * Department of Chemical Engineering, Norwegian University of Science and Technology (NTNU)(化学工程系,挪威科学与技术大学) ; Department of Computing, Imperial College London(计算系,帝国理工学院伦敦分校)
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract)
AI总结 本文提出UTOPYA框架,通过融合八种数据模态,利用FiLM条件交叉模态注意力和门控融合,共同解决批次蒸馏中的异常检测、时间序列预测和相分类问题,并通过物理信息正则化方案和课程学习方法提升性能。
COMODO:跨模态视频到IMU知识蒸馏用于高效的第一人称人类活动识别
机构 * The University of New South Wales(新南威尔士大学) ; King Mongkut's University of Technology North Bangkok(科技技术北巴吞蓬大学) ; The Hong Kong University of Science(香港科学大学)
专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 本文提出COMODO框架,通过跨模态自监督蒸馏将视频语义知识转移到IMU,提升第一人称人类活动识别的效率与泛化能力。
Comments IMWUT/UbiComp 2026
多模态同步机制:来自基于解码器的视频-文本到语音合成的洞察
机构 * Apple(苹果公司)
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM、eess.AS
AI总结 本文通过视频-文本到语音合成研究多模态同步机制,探讨了解码器如何整合不同模态信息,以及模态顺序对性能和迁移的影响,提出了TimeSync指标用于细粒度分析。
Comments 30 pages, Decoder-only model, Speech Synthesis
CGCMA:基于事件条件的异步融合条件门控跨模态注意力
机构 * Independent Researcher(独立研究者)
专题命中 视频多模态 :cross-modal(title,abstract);multimodal(abstract)
AI总结 本文提出CGCMA,用于异步融合场景中事件条件下的跨模态注意力,通过分离文本条件接地与滞后感知信任控制,提升异步多模态融合性能。
TeamLLM: 探索LLMs在多模态群体交互预测中的能力
专题命中 视频多模态 :multimodal(title,abstract);multimodal foundation model(abstract)
AI总结 本文研究LLMs在多模态传感器数据中预测群体协调模式的能力,发现LLMs在语言基础行为上比LSTM基线提升3.2倍,细调准确率达96%。同时揭示了文本模型在多模态交互中的局限性及模拟模式的脆弱性。
具有自适应偏好优化的多模态大语言模型用于序列推荐
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract)
AI总结 本文提出HaNoRec框架,通过自适应偏好优化解决多模态序列推荐中的样本不平衡和跨模态语义偏差问题,提升推荐性能。
Comments Accepted by SIGIR 2026 (Full Paper)
WorldMM: 动态多模态记忆代理用于长视频推理
机构 * KAIST(韩国科学技术院) ; NTU Singapore(新加坡南洋理工大学)
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 WorldMM通过构建和检索多种互补记忆,提升长视频推理能力,实现8.4%的性能提升。
Comments CVPR 2026. Project page : https://worldmm.github.io
MedM2T:一种用于电子健康记录和心电图数据的时间感知多模态框架
机构 * Computational Health Informatics Program, Boston Children’s Hospital(儿童医院计算健康信息学项目,波士顿儿童医院)
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract)
AI总结 MedM2T通过整合稀疏时间序列编码器、层次时间感知融合和双模态注意力机制,有效处理医疗数据的多模态和异构时间结构,实现对慢性及急性疾病动态的预测,展现优于现有方法的性能。
Comments This preprint version of the manuscript has been submitted to the IEEE Journal of Biomedical and Health Informatics (JBHI) for review. The implementation of MedM2T is available at https://github.com/DHLab-TSENG/MedM2T
通过跨模态注意力可区分性理解视频-语言模型中的时间逻辑一致性
机构 * School of Computer Science and Technology, Beijing Institute of Technology, Beijing, China(北京理工大学计算机科学与技术学院,北京,中国) ; Beijing Engineering Research Center of High Volume Language Information Processing and Cloud Computing Applications, Beijing Institute of Technology, Beijing, China(高性能语言信息处理与云计算应用北京工程研究中心,北京理工大学,北京,中国)
专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 研究探讨视频-语言模型在时间逻辑一致性问题上的核心原因,提出TCAS方法提升跨模态注意力的时序分辨能力,实验验证了方法对时间逻辑一致性的提升效果。
Comments Accepted by CVPR 2026
基于多模态大语言模型的波束预测
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract)
AI总结 本文提出基于多模态大语言模型的波束预测框架,通过融合RGB图像和LiDAR点云等异构数据,提升动态环境下波束预测精度与通信性能,实验表明其在波束准确性和通信性能上优于现有方法。
多模态深度学习用于ICU中患者恶化的早期预测:整合时间序列电子健康记录数据与临床笔记
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract)
AI总结 本文提出一种多模态深度学习方法,结合结构化时间序列数据和非结构化临床笔记,用于预测ICU患者恶化。模型在MIMIC-IV数据库上训练,测试集AUROC达0.7857,临床笔记提升AUROC2.5个百分点。