arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 210 信号源:cs.CV, eess.IV, cs.MM

1. 视频问答 210 篇

2508.03039 2025-08-06 cs.CV cs.MM 73%

VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering

Yiran Meng, Junhong Ye, Wei Zhou, Guanghui Yue, Xudong Mao, Ruomei Wang, Baoquan Zhao

机构 * Sun Yat-Sen University(中山大学) Cardiff University(卡地夫大学) Shenzhen University(深圳大学)

专题命中 视频问答 :video understanding(abstract);video reasoning(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21862 2025-06-30 cs.CV cs.AI cs.HC cs.MM 73%

LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs

Boyuan Sun, Jiaxing Zhao, Xihan Wei, Qibin Hou

机构 * VCIP, School of Computer Science, Nankai University(南开大学计算机学院) Tongyi Lab, Alibaba Group(阿里巴巴集团 Tongyi 实验室)

专题命中 视频问答 :video understanding(abstract);long video(abstract);分类 cs.CV、cs.MM

Comments 21 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01737 2026-07-03 cs.CV 新提交 70%

ReQuest: Rethinking-based Question-Aware Frame Selection for Long-Form Video QA

ReQuest:基于重新思考的问题感知帧选择用于长视频问答

Minkuk Kim, Suyong Yun, Young Tae Kim, Jinyoung Moon, Jinwoo Choi, Seong Tae Kim

专题命中 视频问答 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 提出ReQuest,一种不确定性驱动的、问题自适应的关键帧选择方法,通过轻量级选择器、重新思考路由和不确定性引导的NMS,在固定token预算下提升长视频问答准确率。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15325 2026-05-18 cs.CV 70%

COPRA: Conditional Parameter Adaptation with Reinforcement Learning for Video Anomaly Detection

COPRA:基于强化学习的条件参数适应用于视频异常检测

Darryl Cherian Jacob, Xinyu Liu, Kai Wang, Pan He

机构 * Auburn University(奥本大学) Tencent Hunyuan(腾讯文元)

专题命中 视频问答 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 COPRA通过生成输入特定的参数更新,动态适应冻结的VLM,提升视频异常检测的适应性和泛化能力,同时拓展到多选视频问答和密集标注等任务。

Comments Manuscript currently under review for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23145 2026-04-28 cs.CV cs.AI 70%

UpstreamQA: A Modular Framework for Explicit Reasoning on Video Question Answering Tasks

UpstreamQA:一个用于视频问答任务显式推理的模块化框架

Jason Nguyen, Ameet Rao, Alexander Chang, Ishaan Kumar, Erin Tan

机构 * Lincoln North Star High School(林肯北星高中) The Charter School of Wilmington(威尔明顿 charter 学校) Greenwich High School(格林威治高中) Santa Susana High School(圣塔苏娜高中) UC Berkeley(伯克利大学)

专题命中 视频问答 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

AI总结 本文提出UpstreamQA框架,通过显式推理模块分离和评估视频推理核心组件,提升视频问答任务的性能和可解释性,但可能在基线性能高时导致性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21094 2026-04-28 cs.CV 70%

EMCompress: Video-LLMs with Endomorphic Multimodal Compression

EMCompress: 具有端态多模态压缩的视频大语言模型

Zheyu Fan, Jiateng Liu, Yuji Zhang, Zihan Wang, Yi R. Fung, Manling Li, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Northwestern University(西北大学)

专题命中 视频问答 :video reasoning(abstract);video-language(abstract);分类 cs.CV

AI总结 本文提出端态多模态压缩(EMC)作为视频问答的结构约束充分统计问题,通过端态变换保持答案不变性,提升视频语言理解的训练和推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03034 2026-03-10 cs.CV 70%

MAViD: A Multimodal Framework for Audio-Visual Dialogue Understanding and Generation

MAViD:一种多模态框架用于音频-视觉对话理解和生成

Youxin Pang, Jiajun Liu, Lingfeng Tan, Yong Zhang, Feng Gao, Xiang Deng, Zhuoliang Kang, Xiaoming Wei, Yebin Liu

机构 * Tsinghua University(清华大学) Meituan(美团)

专题命中 视频问答 :video generation(abstract);long video(abstract);分类 cs.CV

AI总结 MAViD提出了一种多模态框架,通过Conductor-Creator架构实现音频-视觉对话的理解与生成,结合自回归和扩散模型提升长时多模态内容生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06958 2025-11-12 cs.CV 70%

VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning

Xinhao Li, Ziang Yan, Desen Meng, Lu Dong, Xiangyu Zeng, Yinan He, Yali Wang, Yu Qiao, Yi Wang, Limin Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)

专题命中 视频问答 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21403 2025-09-16 cs.CV 70%

Static or Dynamic: Towards Query-Adaptive Token Selection for Video Question Answering

Yumeng Shi, Quanyu Long, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 视频问答 :video language model(abstract);long video(abstract);分类 cs.CV

Comments Accepted to EMNLP 2025 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19599 2025-07-29 cs.CV 70%

Object-centric Video Question Answering with Visual Grounding and Referring

Haochen Wang, Qirui Chen, Cilin Yan, Jiayin Cai, Xiaolong Jiang, Yao Hu, Weidi Xie, Stratis Gavves

机构 * University of Amsterdam(阿姆斯特丹大学) SAI, Shanghai Jiao Tong University(上海交通大学SAI研究所) Xiaohongshu Inc(小红书公司)

专题命中 视频问答 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04223 2025-06-17 cs.CV cs.AI 70%

VideoQA in the Era of LLMs: An Empirical Study

Junbin Xiao, Nanxin Huang, Hangyu Qin, Dongyang Li, Yicong Li, Fengbin Zhu, Zhulin Tao, Jianxing Yu, Liang Lin, Tat-Seng Chua, Angela Yao

机构 * National University of Singapore(新加坡国立大学) Communication University of China(中国传媒大学) Sun Yat-Sen University(中山大学)

专题命中 视频问答 :video understanding(abstract);video-language(abstract);分类 cs.CV

Comments IJCV'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09987 2025-06-12 cs.CV cs.LG 70%

A Shortcut-aware Video-QA Benchmark for Physical Understanding via Minimal Video Pairs

Benno Krojer, Mojtaba Komeili, Candace Ross, Quentin Garrido, Koustuv Sinha, Nicolas Ballas, Mahmoud Assran

机构 * FAIR at Meta(Meta旗下的FAIR) McGill University(麦吉尔大学)

专题命中 视频问答 :video language model(abstract);video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06820 2025-03-11 cs.CV cs.AI cs.LG 70%

Towards Fine-Grained Video Question Answering

Wei Dai, Alan Luo, Zane Durante, Debadutta Dash, Arnold Milstein, Kevin Schulman, Ehsan Adeli, Li Fei-Fei

专题命中 视频问答 :video understanding(abstract);video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16511 2024-10-29 cs.CV 70%

GPT4Video: A Unified Multimodal Large Language Model for lnstruction-Followed Understanding and Safety-Aware Generation

Zhanyu Wang, Longyue Wang, Zhen Zhao, Minghao Wu, Chenyang Lyu, Huayang Li, Deng Cai, Luping Zhou, Shuming Shi, Zhaopeng Tu

专题命中 视频问答 :video generation(abstract);video understanding(abstract);分类 cs.CV

Comments ACM MM 2024, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10818 2024-10-16 cs.CV cs.AI cs.CL cs.LG 70%

TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models

Mu Cai, Reuben Tan, Jianrui Zhang, Bocheng Zou, Kai Zhang, Feng Yao, Fangrui Zhu, Jing Gu, Yiwu Zhong, Yuzhang Shang, Yao Dou, Jaden Park, Jianfeng Gao, Yong Jae Lee, Jianwei Yang

专题命中 视频问答 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments Project Page: https://temporalbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.02136 2023-03-07 cs.CV 70%

Efficient End-to-End Video Question Answering with Pyramidal Multimodal Transformer

Min Peng, Chongyang Wang, Yu Shi, Xiang-Dong Zhou

专题命中 视频问答 :text-to-video(abstract);video-language(abstract);分类 cs.CV

Comments Accepted by AAAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.00285 2021-04-14 cs.CV 70%

CUPID: Adaptive Curation of Pre-training Data for Video-and-Language Representation Learning

Luowei Zhou, Jingjing Liu, Yu Cheng, Zhe Gan, Lei Zhang

专题命中 视频问答 :text-to-video(abstract);video-language(abstract);分类 cs.CV

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14870 2026-04-03 cs.CV eess.IV 62%

HERBench: A Benchmark for Multi-Evidence Integration in Video Question Answering

HERBench:视频问答中多证据整合的基准

Dan Ben-Ami, Gabriele Serussi, Kobi Cohen, Chaim Baskin

机构 * INSIGHT Lab, Ben-Gurion University of the Negev(本-古里安大学 INSIGHT 实验室) Ben-Gurion University of the Negev(本-古里安大学)

专题命中 视频问答 :video understanding(abstract);分类 cs.CV、eess.IV

AI总结 HERBench通过要求至少三个非重叠视频片段线索,推动视频问答中多证据整合的研究,评估13种最新视频大语言模型,发现其准确率仅31-42%,揭示检索与融合两大瓶颈。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16891 2025-12-19 cs.CV cs.AI cs.IR cs.LG cs.MM 62%

LinkedOut: Linking World Knowledge Representation Out of Video LLM for Next-Generation Video Recommendation

LinkedOut: 从视频大语言模型中提取世界知识表示以实现下一代视频推荐

Haichao Zhang, Yao Lu, Lichen Wang, Yunzhe Li, Daiwei Chen, Yunpeng Xu, Yun Fu

机构 * Northeastern University(东北大学) LinkedIn(领英) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 视频问答 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 LinkedOut通过从视频中提取世界知识表示,实现低延迟、多视频输入的视频推荐,无需人工标注,取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20285 2025-12-02 cs.CV cs.MM 62%

DMC$^3$: Dual-Modal Counterfactual Contrastive Construction for Egocentric Video Question Answering

DMC$^3$:双模态反事实对比构建用于第一人称视频问答

Jiayi Zou, Chaofan Chen, Bing-Kun Bao, Changsheng Xu

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peng Cheng Laboratory(鹏城实验室) MAIS, Institute of Automation, Chinese Academy of Sciences(自动化所MAIS)

专题命中 视频问答 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 DMC$^3$通过双模态反事实对比构建方法提升第一人称视频问答性能,实现SOTA效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01327 2024-04-02 cs.CV cs.AI cs.MM 62%

Can I Trust Your Answer? Visually Grounded Video Question Answering

Junbin Xiao, Angela Yao, Yicong Li, Tat Seng Chua

专题命中 视频问答 :video-language(abstract);分类 cs.CV、cs.MM

Comments Accepted to CVPR'24. (Compared with preprint version, we mainly improve the presentation, discuss more related works, and extend experiments in Appendix.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.13668 2023-07-12 cs.CV cs.MM 62%

Contrastive Video Question Answering via Video Graph Transformer

Junbin Xiao, Pan Zhou, Angela Yao, Yicong Li, Richang Hong, Shuicheng Yan, Tat-Seng Chua

专题命中 视频问答 :video reasoning(abstract);分类 cs.CV、cs.MM

Comments Accepted by IEEE T-PAMI'23

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.00402 2023-05-12 cs.CV cs.CL cs.MM 62%

mPLUG-2: A Modularized Multi-modal Foundation Model Across Text, Image and Video

Haiyang Xu, Qinghao Ye, Ming Yan, Yaya Shi, Jiabo Ye, Yuanhong Xu, Chenliang Li, Bin Bi, Qi Qian, Wei Wang, Guohai Xu, Ji Zhang, Songfang Huang, Fei Huang, Jingren Zhou

专题命中 视频问答 :video-language(abstract);分类 cs.CV、cs.MM

Journal ref ICML2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.14369 2023-03-28 cs.CV cs.MM 62%

Video-Text as Game Players: Hierarchical Banzhaf Interaction for Cross-Modal Representation Learning

Peng Jin, Jinfa Huang, Pengfei Xiong, Shangxuan Tian, Chang Liu, Xiangyang Ji, Li Yuan, Jie Chen

专题命中 视频问答 :video-language(abstract);分类 cs.CV、cs.MM

Comments CVPR 2023 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.03609 2022-09-09 cs.CV cs.MM 62%

Frame-Subtitle Self-Supervision for Multi-Modal Video Question Answering

Jiong Wang, Zhou Zhao, Weike Jin

专题命中 视频问答 :video-language(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.08276 2021-05-25 cs.CV cs.AI 61%

NExT-QA:Next Phase of Question-Answering to Explaining Temporal Actions

Junbin Xiao, Xindi Shang, Angela Yao, Tat-Seng Chua

专题命中 视频问答 :video understanding(abstract,comments);分类 cs.CV

Comments To appear at CVPR2021.(Receive one 'Strong Accept'. Review comments: The benchmark will be beneficial for an important video understanding problem. The analysis is comprehensive and provides meaningful insights.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08612 2026-08-11 cs.CV cs.AI 新提交 57%

REVEAL: A Rubric-Guided Agent for Explicit Evidence Sufficiency Verificationin Long-Video Question Answering

REVEAL:用于长视频问答的基于 rubric(评分标准)的显式证据充分性验证智能体

Caijun Yan, Yang Zhou, Meixing Shi, Haoran Sun, Yichen Li, Yuxiang Cai, Yankai Jiang

专题命中 视频问答 :video reasoning(abstract);分类 cs.CV

AI总结 该研究针对长视频问答中现有方法割裂事件、忽略证据充分性的问题,提出REVEAL框架,通过自适应分块的结构化记忆与rubric引导的证据验证,实现更可靠的推理且性能优于现有SOTA方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04589 2026-08-06 cs.CV cs.AI 新提交 57%

The First EgoCross Challenge at EgoVis 2026: Cross-Domain Egocentric Video Question Answering

2026年EgoVis首届EgoCross挑战赛:跨域自我中心视频问答

Yuqian Fu, Tianwen Qian, Yanjun Li, Yu Li, Kunyu Peng, Xu Zheng, Yongqin Xian, Alessio Tonioni, Yanwei Fu, Xiaoling Wang, Danda Paudel, Federico Tombari, Luc Van Gool, Leyi Wu, Yifan Zhao, Jinjie Zhang, Yinchuan Li, Yingcong Chen, Zixu Li, Zhiwei Chen, Zhiheng Fu, Wenbo Wang, Yupeng Hu, Weili Guan, Liqiang Nie, Takuya Murakawa, Toru Tamaki, Yi Wen, Zhenglin Du, Zhengyang Li, Lingling Li, Licheng Jiao, Wenping Ma

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

AI总结 本文介绍2026年EgoVis研讨会举办的首届EgoCross跨域自我中心视频问答挑战赛,含两个赛道,共获1500余份提交,公布结果与获胜方案,资源公开以推进相关研究。

Comments 1st EgoCross challenge @ EgoVis workshop, CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13681 2026-07-16 cs.CV 新提交 57%

Towards Spatial Supersensing in the Wild

迈向野外空间超感知

Tianjun Gu, Tianyu Xin, Kuan Zhang, Bowen Yang, Kok-Chung Chua, Peize Li, Xinran Zhang, Yupeng Chen, Qiyue Zhao, Qinlei Xie, Jianhang Liu, Yucheng Lu, Yinan Han, Marco Pavone, Yiming Li

机构 * Tsinghua University(清华大学) NVIDIA(英伟达) Stanford University(斯坦福大学)

专题命中 视频问答 :long video(abstract);分类 cs.CV

AI总结 研究针对空间超感知中多模态模型基准测试局限于合成视频和家庭场景的问题,引入VSI-Super-Wild基准,受人类认知启发探究世界状态三元组,通过大量真实视频问答对测试发现模型不足及失败模式,为空间超感知发展指明方向。

Comments Accepted to ECCV 2026. Project page: https://vsi-super-wild.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11862 2026-07-14 cs.CV cs.AI 新提交 57%

Evidence-Backed Video Question Answering

有证据支持的视频问答

Shijie Wang, Honglu Zhou, Ziyang Wang, Ran Xu, Caiming Xiong, Silvio Savarese, Chen Sun, Juan Carlos Niebles

机构 * Salesforce, Palo Alto, CA, USA(Salesforce公司) Brown University, Providence, RI, USA(布朗大学)

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

AI总结 研究视频问答中模型缺乏可视化依据的问题,提出E-VQA任务及ST-Evidence基准,开发数据集ST-Evidence-Instruct,通过微调提高模型表现,为可解释的视频理解建立基线。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏