arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6 信号源:cs.CV, eess.IV, cs.MM

1. 视频问答 6 篇

2509.24563 2026-07-16 cs.CV cs.CL 版本更新 79%

NeMo: Needle in a Montage for Video-Language Understanding

NeMo:视频语言理解中的蒙太奇之针

Zi-Yuan Hu, Shuo Liang, Duo Zheng, Yanyang Li, Yeyao Tao, Shijia Huang, Wei Feng, Jia Qin, Jianguang Yu, Jing Huang, Meng Fang, Yin Li, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Phoenix TV(凤凰电视台) Stanford University(斯坦福大学) University of Liverpool(利物浦大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视频问答 :video-language(title,abstract);分类 cs.CV

AI总结 为评估视频大语言模型时间理解能力,提出蒙太奇之针(NeMo)任务,开发自动数据生成管道并构建NeMoBench基准,能生成高质量数据,评估了20个模型,展现其能力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18558 2026-06-29 cs.CV cs.AI 版本更新 74%

HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering

HiMu: 面向长视频问答的分层多模态帧选择

Dan Ben-Ami, Gabriele Serussi, Kobi Cohen, Chaim Baskin

机构 * INSIGHT Lab, Ben-Gurion University of the Negev, Israel(本-古里安内盖夫大学INSIGHT实验室,以色列) Ben-Gurion University of the Negev, Israel(本-古里安内盖夫大学,以色列)

专题命中 视频问答 :long video(title);分类 cs.CV

AI总结 提出HiMu框架,通过文本LLM将查询分解为层次逻辑树,由视觉和音频专家处理原子谓词,经模糊逻辑算子组合生成连续帧满意度曲线,在16帧预算下达到帧选择方法的最优精度,并作为即插即用模块提升多种MLLM性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21010 2026-07-07 cs.CV cs.AI cs.CL cs.HC cs.LG 版本更新 57%

ChainReaction: Causal Chain-Guided Reasoning for Modular and Explainable Causal-Why Video Question Answering

ChainReaction:用于模块化和可解释因果关系视频问答的因果链引导推理

Paritosh Parmar, Eric Peh, Basura Fernando

机构 * Institute of High Performance Computing, Agency for Science, Technology and Research, Singapore(新加坡高性能计算研究所,科技研究局) Centre for Frontier AI Research, Agency for Science, Technology and Research, Singapore(科技研究局前沿人工智能研究中心,新加坡) College of Computing and Data Science, Nanyang Technological University, Singapore(新加坡南洋理工大学计算与数据科学学院)

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

AI总结 针对现有因果关系视频问答模型的问题,提出新的模块化范式,将因果推理与答案生成解耦,引入自然语言因果链,介绍两阶段架构及生成因果链方法,新指标,实验证明该方法性能优越。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23216 2026-07-03 cs.CV 版本更新 57%

CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering

CaST-Bench:面向视频问答的因果链时空推理基准

Mingfang Zhang, Jingjing Pan, Ashutosh Kumar, Rajat Saini, Mustafa Erdogan, Hsuan-Kung Yang, Caixin Kang, Yifei Huang, Yoichi Sato, Quan Kong

机构 * Woven by Toyota(丰田公司) The University of Tokyo(东京大学)

专题命中 视频问答 :video reasoning(abstract);分类 cs.CV

AI总结 提出CaST-Bench基准,通过构建包含因果链时空标注的数据集和评估指标,系统评测视觉语言模型在视频因果推理中的细粒度证据定位能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05663 2026-06-29 cs.CV 版本更新 57%

Keeping the Evidence Chain: Semantic Evidence Allocation for Training-Free Token Pruning in Video Temporal Grounding

保持证据链:面向视频时序定位的无训练令牌剪枝的语义证据分配

Jiaqi Li, Shuntian Zheng, Yixian Shen, Jia-Hong Huang, Xiaoman Lu, Minzhe Ni, Yu Guan

机构 * University of Warwick(沃里克大学) University of Amsterdam(阿姆斯特丹大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 视频问答 :video-language(abstract);分类 cs.CV

AI总结 提出SemVID无训练剪枝框架,通过证据保留和连接强度原则选择对象、运动和上下文令牌,在仅保留12.5%视觉令牌时保持95.4% mIoU,实现5.8倍预填充加速。

Comments Project at https://jiaqili404.github.io/SemVID

Journal ref The 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01274 2026-06-12 cs.CV cs.AI 版本更新 57%

ReFoCUS: Reinforcement-guided Frame Optimization for Contextual Understanding

ReFoCUS: 用于上下文理解的强化引导帧优化

Hosu Lee, Junho Kim, Hyunjun Kim, Yong Man Ro

机构 * Korea Advanced Institute of Science & Technology(韩国科学技术院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

AI总结 提出ReFoCUS框架,首次将在线策略梯度强化学习集成到视频大语言模型的帧级优化中,通过自回归和查询条件选择架构学习帧选择策略,无需显式帧级监督,提升视频问答推理准确性。

Comments Project page: https://interlive-team.github.io/ReFoCUS/

详情

展开后加载摘要…

URL PDF HTML 收藏