Multi-granularity Correspondence Learning from Long-term Noisy Videos
专题命中 视频理解 :video understanding(abstract);video-language(abstract);long video(abstract);分类 cs.CV
Comments Accepted by ICLR 2024 (oral)
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频理解 :video understanding(abstract);video-language(abstract);long video(abstract);分类 cs.CV
Comments Accepted by ICLR 2024 (oral)
HFS: 为高效视频推理的全局查询感知帧选择
机构 * The Hong Kong Polytechnic University(香港理工大学)
专题命中 视频理解 :video understanding(title);分类 cs.CV、cs.MM
AI总结 HFS提出一种端到端可训练的帧选择框架,通过任务自适应方法提升视频推理效率。
Comments Accepted to the Main Track of ACM Multimedia 2026 (ACM MM '26)
专题命中 视频理解 :video generation(title);分类 cs.CV、cs.MM
Comments This paper has been accepted for presentation at ICASSP 2025
专题命中 视频理解 :video understanding(title);分类 cs.CV、eess.IV
机构 * University of Georgia(佐治亚大学)
专题命中 视频理解 :video understanding(title,comments);分类 cs.CV
Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: 7th International Workshop on Large Scale Holistic Video Understanding: Toward Video Foundation Models
Journal ref Neural Information Processing Systems (NeurIPS 2025)
帧间解读:社交媒体视频中隐含与非字面意义的理解
机构 * University of Manchester(曼彻斯特大学) ; Durham University(杜伦大学) ; University of Sheffield(谢菲尔德大学) ; University of Exeter(埃克塞特大学)
专题命中 视频理解 :video understanding(abstract);text-to-video(abstract);video-language(abstract)
AI总结 本文提出DrivelHub+基准,评估视频-语言模型推断社交媒体视频隐含意义的能力,从解释和表征两方面开展实验,衡量模型多模态感知与语用理解的差距。
OmniRefine: 一种面向对齐的协作压缩方法以提高多模态大语言模型的效率
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ; Pengcheng Laboratory(鹏城实验室)
专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);long video(abstract)
AI总结 本文提出OmniRefine,一种无需训练的两阶段框架,通过跨模态对齐和协作压缩提升多模态大语言模型的推理效率与性能稳定性。
专题命中 视频理解 :video understanding(abstract);video-language(abstract);long video(abstract)
ViSAGE:为长视频理解构建自修正记忆
机构 * Zhejiang University(浙江大学) ; Xidian University(西安电子科技大学)
专题命中 视频理解 :video understanding(title);分类 cs.CV
AI总结 ViSAGE是一种多模态智能体记忆框架,通过跨模态绑定、双向记忆精调及多智能体交叉验证解决长视频理解中的实体混淆等问题,较最强基线准确率提升5.9%。
Comments Accept by ACMMM 2026
EgoPolice:用于高风险警察随身摄像机视频中自我中心视频理解的基准
机构 * Princeton University(普林斯顿大学) ; University of Pennsylvania(宾夕法尼亚大学)
专题命中 视频理解 :video understanding(title);分类 cs.CV
AI总结 研究旨在为高风险警察随身摄像机视频中的自我中心视频理解创建基准EgoPolice,通过精心挑选标注数据,设置分类和问答任务,对模型测试发现即使优秀模型预测高风险行动也有困难,该基准为开发相关模型及下游人工审查奠定基础。
MAVIS: 通过结构化视频理解实现多智能体视频检索
机构 * School of Computing and Information Technology, Great Bay University(大湾区大学计算机与信息技术学院) ; College of Computer Science, Nankai University(南开大学计算机学院) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院)
专题命中 视频理解 :video understanding(title);分类 cs.CV
AI总结 提出多智能体框架MAVIS,通过结构化语义库解析视频,利用逻辑感知辩论机制协作推理,无需全库扫描和微调即可实现高效视频检索。
Hier-EgoPack:具有多样任务视角的层次化眼动视频理解
机构 * Department of Control and Computer Engineering(控制与计算机工程系)
专题命中 视频理解 :video understanding(title);分类 cs.CV
AI总结 本文提出Hier-EgoPack,通过引入层次化架构和GNN层,扩展了EgoPack在多粒度时间推理上的能力,有效解决了多种下游任务中的视频理解问题。
Comments Project webpage at https://sapeirone.github.io/hier-egopack
APB-V: 通过序列并行感知的近似注意力加速长视频理解
机构 * NLP Group, DCST, IAI, BNRIST, Tsinghua University, Beijing, China(清华大学北京校区自然语言处理组、国防科技大学、人工智能研究院、北京理工大学、清华大学) ; Department of CS&T, Central South University, Changsha, China(中南大学计算机与技术系,长沙,中国) ; BUPT, Beijing, China(北京邮电大学,北京,中国) ; Pattern Recognition Center, WeChat AI, Tencent Inc.(腾讯公司微信人工智能研究院)
专题命中 视频理解 :video understanding(title);分类 cs.CV
AI总结 提出APB-V,一种序列并行框架,通过分布式近似注意力在多GPU上加速长视频推理,显著提升速度且不损失性能。
Comments ACL 2026 main
DynFrame: 自适应推理驱动的多模态框架与动态帧增强用于复杂视频理解
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
专题命中 视频理解 :video understanding(title);分类 cs.CV
AI总结 提出DynFrame框架,通过将时间窗口和采样密度作为原生token进行单步检索,并引入分段解耦GRPO优化,解决了视频多模态大模型中采样密度不可学习及检索与回答优化耦合的问题。
稀疏到密集:一种无损加速视频理解的LLM免费午餐
机构 * Singapore Management University(新加坡国立管理学院) ; Sea AI Lab(Sea AI实验室) ; National University of Singapore(国立新加坡大学)
专题命中 视频理解 :video understanding(title);分类 cs.CV
AI总结 本文提出了一种名为Sparse-to-Dense(StD)的解码策略,通过结合稀疏top-K注意力和密集全注意力模块,实现视频大语言模型(Video-LLMs)的无损加速,从而在处理长视频序列时显著提高处理速度。
Comments Accepted by ACL 2025
MMVIAD:多视角多任务视频理解用于工业异常检测
机构 * ShanghaiTech University(上海科技大学) ; Tsinghua University(清华大学) ; Meituan Inc.(美团公司) ; Peking University(北京大学)
专题命中 视频理解 :video understanding(title);分类 cs.CV
AI总结 本文提出MMVIAD,首个工业异常检测连续多视角视频数据集及多任务评估基准,通过两阶段训练流程提升模型泛化能力,在四个任务中取得优于GPT-5.4的性能。
FaVChat: 基于数据高效GRPO的层次提示-查询引导的面部视频理解
机构 * State Key Laboratory of Networking and Switching Technology, BUPT(北京邮电大学网络与交换技术国家重点实验室) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳)) ; Institute of automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Zhongguancun Academy(中关村学院) ; Central South University(中南大学) ; Zhejiang University(浙江大学) ; College of communication Engineering, Hangzhou Dianzi University(杭州电子科技大学通信工程学院)
专题命中 视频理解 :video understanding(title);分类 cs.CV
AI总结 FaVChat通过层次化提示引导框架提取面部动态细节信息,结合数据高效GRPO策略提升学习效率,实现在面部视频理解任务中的优越性能。
AdaSpark: 为高效长视频理解设计的自适应稀疏性
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) ; Future Living Lab of Alibaba(阿里巴巴未来生活实验室)
专题命中 视频理解 :video understanding(title);分类 cs.CV
AI总结 AdaSpark通过自适应稀疏框架减少计算负载达57% FLOPs,保持性能并保留细粒度长程依赖,适用于小时级视频基准测试。
Comments 8 pages, CVPR2026 Accept (Highlight)
Journal ref Proceedings of the IEEE/CVF Computer Vision and Pattern Recognition (CVPR), 2026
探索第一人称视频理解中的音频幻觉
机构 * Meta ; University Of Maryland, College Park(马里兰大学学院公园分校)
专题命中 视频理解 :video understanding(title);分类 cs.CV
AI总结 本文研究了第一人称视频中音频幻觉问题,提出自动评估框架和分类体系,发现先进AV-LLMs在回答声音相关问题时存在较高幻觉率。
Comments Accepted to ICASSP 2026
STS-Mixer:用于4D点云视频理解的时空频混合器
机构 * Nanyang Technological University(南洋理工大学) ; Alibaba Group(阿里巴巴集团) ; Zhejiang University of Technology(浙江工业大学) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 视频理解 :video understanding(title);分类 cs.CV
AI总结 本文提出STS-Mixer框架,通过将4D点云视频转换为图谱信号,结合时空与频域信息,提升对4D点云视频的几何结构和时间动态的理解。
Comments Accepted by CVPR 2026, Open Sourced
TennisExpert: 向专家级分析体育视频理解迈进
机构 * National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学) ; Griffith University(格里菲斯大学)
专题命中 视频理解 :video understanding(title);分类 cs.CV
AI总结 本文提出TennisExpert框架,通过整合视频语义解析器和基于Qwen3-VL-8B的记忆增强模型,实现高效多模态网球理解,提升战术分析和比赛动态捕捉能力。
手术视频理解与标签插值
专题命中 视频理解 :video understanding(title);分类 cs.CV
AI总结 本文提出结合光流分割标签插值与多任务学习的框架,解决手术视频中时间空间不平衡问题,提升手术场景理解的准确性和效率。
Comments Accepted to ICRA 2026. Video: https://youtu.be/24LlhqvgFBU | Dataset: https://huggingface.co/datasets/KIST-HARILAB/MISAW-Seg
解耦感知与推理以实现抗幻觉的视频理解
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 视频理解 :video understanding(title);分类 cs.CV
AI总结 本文提出DPL模型,通过解耦感知与推理以提升视频理解的抗幻觉能力,引入感知奖励和FAE评估器,有效提高训练后性能和数据效率。
Comments 17 pages, 8 figures
Frame2Freq: 用于细粒度视频理解的频谱适配器
机构 * Institute for Artificial Intelligence, University of Stuttgart(斯图加特大学人工智能研究所) ; University Hospital Heidelberg, Diagnostic and Interventional Radiology(海德堡大学医院放射诊断与介入科) ; Intelligent Assistive Systems Lab, University of Hildesheim(希尔德斯海姆大学智能辅助系统实验室)
专题命中 视频理解 :video understanding(title);分类 cs.CV
AI总结 Frame2Freq通过频谱编码提升细粒度视频理解,利用FFT和频率带嵌入改进动作识别性能。
Comments Accepted to CVPR 2026 (Main Track)
让我们拆分:用于细粒度视频理解的零样本分类器编辑
机构 * Leiden University(莱顿大学)
专题命中 视频理解 :video understanding(title);分类 cs.CV
AI总结 本文提出零样本分类器编辑方法,通过细粒度视频理解提升分类精度,优于视觉-语言基线。
Comments ICLR 2026
双信号自适应KV缓存优化用于视觉-语言模型中长形式视频理解
机构 * International Institute of Information Technology(国际信息研究所)
专题命中 视频理解 :video understanding(title);分类 cs.CV
AI总结 Sali-Cache通过双信号自适应缓存优化,提升视觉-语言模型处理长形式视频的内存效率与准确性。
AD-MIR:通过结构化推理弥合从感知到说服的广告视频理解鸿沟
机构 * Peking University, Beijing, China(北京大学) ; Tsinghua University, Beijing, China(清华大学) ; Xi'an Jiaotong University, Xi'an, China(西安交通大学) ; South China University of Technology, Guangzhou, China(华南理工大学)
专题命中 视频理解 :video understanding(title);分类 cs.CV
AI总结 AD-MIR通过结构化推理框架,结合语义检索与精确关键词匹配,有效解码广告意图,提升广告视频理解的准确性与说服策略分析能力。
边缘优化的多模态学习用于无人机视频理解 via BLIP-2
专题命中 视频理解 :video understanding(title);分类 cs.CV
AI总结 本文提出基于BLIP-2的轻量级多模态学习平台,通过集成YOLO模型实现无人机视频理解的高效处理与多任务适应。
Comments The Tenth International Conference on Data Mining and Big Data (DMBD'2025)
最短片段,最大显著性:通过关键时刻提取实现长视频摘要
专题命中 视频理解 :long video(title);分类 cs.CV
AI总结 本文提出了一种通过关键时刻提取实现长视频多模态摘要的方法,利用轻量级模型和大型语言模型实现高效摘要生成。
机构 * Northwestern University(西北大学) ; Boston University(波士顿大学)
专题命中 视频理解 :video understanding(title);分类 cs.CV
Comments ICCV2025