Auto-X3D: Ultra-Efficient Video Understanding via Finer-Grained Neural Architecture Search
专题命中 视频理解 :video understanding(title);分类 cs.CV
Comments Accepted by WACV'2022
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频理解 :video understanding(title);分类 cs.CV
Comments Accepted by WACV'2022
专题命中 视频理解 :video understanding(title);分类 cs.CV
Comments Accepted to ICML 2021
专题命中 视频理解 :video understanding(title);分类 cs.CV
Comments Accepted to CVPR 2021(Oral). Project page: http://www.robots.ox.ac.uk/~vgg/research/tqn/
专题命中 视频理解 :video understanding(title);分类 cs.CV
Comments ECCV 2020, European Conference on Computer Vision
专题命中 视频理解 :video understanding(title);分类 cs.CV
专题命中 视频理解 :video understanding(title);分类 cs.CV
Comments Code and models are available at https://github.com/facebookresearch/video-long-term-feature-banks
专题命中 视频理解 :video understanding(title);分类 cs.CV
Comments under review
专题命中 视频理解 :video understanding(title);分类 cs.CV
Comments CVPR 2018 spotlight. The first two authors contributed equally to this paper
专题命中 视频理解 :video understanding(title);分类 cs.CV
Comments 6 pages, 5 figures, 3 tables
专题命中 视频理解 :video understanding(title);分类 cs.CV
Comments (20/03/2012)
Journal ref 9th IEEE International Conference on Advanced Video and Signal-Based Surveillance (AVSS 2012) (2012) 136 -142
机构 * Department of Computer Science, Temple University(Temple大学计算机科学系) ; Munich Center for Machine Learning(慕尼黑机器学习中心)
专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV、cs.MM
Comments Accepted to TMLR 2025 - Project page: https://amir-aghdam.github.io/act-align/
专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV、cs.MM
专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV、cs.MM
Comments Accepted at the 30th International Conference on Multimedia Modeling (MMM 2024)
专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV、cs.MM
Comments To appear in CVPR 2022
专题命中 视频理解 :video understanding(abstract,comments);long video(abstract);分类 cs.CV
Comments Accepted to EMNLP-23 TL;DR: Video understanding lags far behind NLP; LLMs excel in zero-shot. Our approach utilizes LLMs to verbalize videos, creating stories for zero-shot video understanding. This yields state-of-the-art results across five datasets, covering fifteen tasks
DualFact+: 一种用于过程视频理解的多模态事实验证框架
机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) ; Saarland Informatics Campus(萨尔兰信息学校区)
专题命中 视频理解 :video understanding(title)
AI总结 DualFact+通过双层多模事实验证框架,针对过程视频描述中的概念事实和上下文事实进行评估,揭示了多模态事实 grounding 的挑战。
Comments ACL 2026 Findings
专题命中 视频理解 :long video(title)
用于抑制视觉语言模型幻觉的维纳表示滤波
机构 * Tel Aviv University(特拉维夫大学)
专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV
AI总结 该研究提出一种无需训练的事后维纳表示滤波技术,通过离线校准校正视觉语言模型深层前馈输出投影,可在保持运行速度的同时降低其对象幻觉,在多类模型及基准上均验证了有效性与通用性。
GSTEP:面向高效视频大语言模型的全局时空密度驱动视觉令牌剪枝
专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV
AI总结 本文提出即插即用的GSTEP剪枝框架,解决现有视频令牌剪枝方法的局部剪枝缺陷,在多个VideoLLMs上实现良好的准确率-效率权衡,在LLaVA-OneVision-7B上剪去75%视觉令牌,保留100.2%原始性能并获1.17倍端到端加速。
Comments 4 figures, accepted to ACM MM 26'
WaveZip:用于视频令牌压缩的小波驱动时空解耦
机构 * Media Analytics and Computing Lab, Xiamen University(厦门大学媒体分析与计算实验室) ; Department of Computer Science, University of Rochester(罗切斯特大学计算机科学系)
专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV
AI总结 针对长视频理解中视觉令牌计算成本高的问题,提出WaveZip框架,利用离散小波变换分离时空信号,无需特定任务训练,能集成到LVLMs提升推理效率,在长视频理解基准测试中表现优异。
Comments 13 pages, 10 figures
HAS:用于多模态大语言模型视频摘要的高亮引导注意力转向
机构 * Tufts University(塔夫茨大学)
专题命中 视频理解 :video generation(abstract);video understanding(abstract);分类 cs.CV
AI总结 针对视频摘要,提出HAS方法,通过全局找连续帧级高亮分布并作为注意力转向向量,让多模态大语言模型在推理时更关注高亮帧,避免丢失信息,在多种基准测试中性能出色。
跟踪并描述任何运动:通过轨迹条件生成实现开放词汇时空字幕
机构 * Northeastern University(东北大学)
专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV
AI总结 研究提出TCAM框架,无需文本查询和区域提示,通过字幕感知重采样器在点粒度结合跟踪与语言,用现有分割注释训练,能描述视频中运动、定位时间及轨迹,优于密集视频字幕基线,匹配相关方法,为运动驱动视频理解提供新途径。
CASHEW: 通过迭代轨迹聚合稳定多模态推理
机构 * Arizona State University(亚利桑那州立大学) ; NewsBreak
专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV
AI总结 提出CASHEW框架,通过迭代聚合多候选推理轨迹并利用视觉验证过滤幻觉步骤,以及其强化学习变体CASHEW-RL,显著提升多模态推理的稳定性和准确性。
VideoSearch-R1: 通过软查询细化实现迭代视频检索与推理
机构 * KAIST(韩国科学技术院) ; Korea University(高丽大学)
专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV
AI总结 提出VideoSearch-R1框架,通过软查询细化(SQR)在连续潜空间优化搜索查询,结合GRPO训练,实现大规模视频库的迭代检索与精确时序定位,性能达SOTA。
Comments Accepted to ECCV 2026
无处可藏:基于背景控制对的视频幻觉基准测试
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Knowin AI(考恩人工智能) ; The Hong Kong Polytechnic University(香港理工大学) ; National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学) ; Huazhong University of Science and Technology(华中科技大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 视频理解 :video generation(abstract);video understanding(abstract);分类 cs.CV
AI总结 提出VidPair-Halluc基准,通过背景相似但前景语义不同的视频对,精确评估大型视频模型中的视频幻觉,包含1K对抗视频对和11K时空问答对。
Comments ECCV 2026
无训练不确定性引导的复杂视觉任务多模态大语言模型
机构 * Technical University of Munich(慕尼黑技术大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; Helmholtz Munich(海德堡-慕尼黑亥姆霍兹研究中心) ; Google(谷歌) ; LTCI, Télécom Paris, Institut Polytechnique de Paris(巴黎理工大学 LTCI 实验室)
专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV
AI总结 提出无需训练的框架,利用MLLM内在不确定性主动引导,通过响应不确定性评分候选视觉输入,使模型自主聚焦关键信息,在视觉搜索、长视频理解等任务中达到与微调系统相当的性能。
CARE: 面向视频多模态大语言模型的自适应推理长度的能力感知奖励塑形
机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) ; School of Medical Technology, Beijing Institute of Technology(北京理工大学医学技术学院) ; School of Computing, National University of Singapore(新加坡国立大学计算机学院)
专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV
AI总结 提出CARE框架,通过能力感知奖励塑形自适应优化推理长度,利用指数移动平均估计能力并分阶段调整奖励偏好,结合批次归一化和后验放大器提升效率与准确性。
VidMsg:短视频中隐含信息推断的基准测试
机构 * OriginAI, Israel(OriginAI以色列)
专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV
AI总结 提出VidMsg基准,通过消息优先构建流程和双向检索任务,评估视频理解模型对短视频中隐含信息的推断能力。
Comments Project page: https://iyttor.github.io/VidMsg
SRL-CLIP: 通过结构化语义角色标签实现高效的CLIP视频适配
机构 * CVIT, IIIT Hyderabad(IIIT海得拉巴计算机视觉研究所) ; Inria, École normale supérieure, CNRS, PSL Research University(法国国家信息与自动化研究所、巴黎综合理工学院、国家科学研究中心、巴黎高等研究大学)
专题命中 视频理解 :video understanding(abstract);text-to-video(abstract);分类 cs.CV
AI总结 本文提出SRL-CLIP,利用结构化语义角色标签(SRL)生成规则化字幕,仅用23k视频-字幕对进行对比微调,即可高效适配CLIP用于通用视频理解,在零样本文本-视频检索上性能优于参数多4-8倍、数据多6000倍的模型。
Comments Accepted to the CV4Smalls Workshop at CVPR 2026
EvoVid: 以时间为中心的自我进化用于视频大语言模型
机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) ; ByteDance(字节跳动)
专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV
AI总结 本文提出EvoVid,一种以时间为中心的自我进化框架,使视频大语言模型能够直接从未经标注的视频中改进。通过引入两个互补的时间感知奖励,即时间感知的问题生成奖励和时间基础的求解奖励,EvoVid在四个基础模型和六个基准测试中实现了优于基线模型和现有自我进化基线的改进,展示了时间为中心的自我进化在视频理解和推理中的有效性。
Comments Project page: https://huangshiqi128.github.io/EvoVid.io/