arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 210 信号源:cs.CV, eess.IV, cs.MM

1. 视频问答 210 篇

2509.18041 2025-11-17 cs.CV 79%

NeuS-QA: Grounding Long-Form Video Understanding in Temporal Logic and Neuro-Symbolic Reasoning

Sahil Shah, S P Sharan, Harsh Goel, Minkyu Choi, Mustafa Munir, Manvik Pasula, Radu Marculescu, Sandeep Chinchali

专题命中 视频问答 :video understanding(title);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23652 2025-10-02 cs.CV cs.AI 79%

ReWatch-R1: Boosting Complex Video Reasoning in Large Vision-Language Models through Agentic Data Synthesis

Congzhi Zhang, Zhibin Wang, Yinchao Ma, Jiawei Peng, Yihan Wang, Qiang Zhou, Jun Song, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视频问答 :video reasoning(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11796 2025-09-16 cs.CV 79%

FineQuest: Adaptive Knowledge-Assisted Sports Video Understanding via Agent-of-Thoughts Reasoning

Haodong Chen, Haojian Huang, XinXiang Yin, Dian Shao

机构 * School of Automation, Northwestern Polytechnical University(自动化学院,西北工业大学) The University of Hong Kong(香港大学) School of Software, Northwestern Polytechnical University(软件学院,西北工业大学) Unmanned System Research Institute, Northwestern Polytechnical University(无人系统研究院,西北工业大学)

专题命中 视频问答 :video understanding(title,abstract);分类 cs.CV

Comments ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24718 2025-06-10 cs.CV 79%

Reinforcing Video Reasoning with Focused Thinking

Jisheng Dang, Jingze Wu, Teng Wang, Xuanhui Lin, Nannan Zhu, Hongbo Chen, Wei-Shi Zheng, Meng Wang, Tat-Seng Chua

机构 * Sun Yat-sen University(中山大学) Lanzhou University(兰州大学) University of Hong Kong(香港大学) Hefei University of Technology(合肥工业大学) National University of Singapore(新加坡国立大学)

专题命中 视频问答 :video reasoning(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02768 2025-05-07 cs.CV cs.AI 79%

Uncertainty-Guided Self-Questioning and Answering for Video-Language Alignment

Jin Chen, Kaijing Ma, Haojian Huang, Han Fang, Hao Sun, Mehdi Hosseinzadeh, Zhe Liu

机构 * School of Computer Science, Duy Tan University(计算机科学学院,杜益坦大学) School of Computer Sciences, Universiti Sains Malaysia(计算机科学学院,马来亚大学)

专题命中 视频问答 :video-language(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18609 2025-03-28 cs.CV 79%

Video-Panda: Parameter-efficient Alignment for Encoder-free Video-Language Models

Jinhui Yi, Syed Talal Wasim, Yanan Luo, Muzammal Naseer, Juergen Gall

专题命中 视频问答 :video-language(title,abstract);分类 cs.CV

Comments CVPR 2025 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19680 2025-03-28 cs.CV cs.AI 79%

M-LLM Based Video Frame Selection for Efficient Video Understanding

Kai Hu, Feng Gao, Xiaohan Nie, Peng Zhou, Son Tran, Tal Neiman, Lingyun Wang, Mubarak Shah, Raffay Hamid, Bing Yin, Trishul Chilimbi

专题命中 视频问答 :video understanding(title);video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03663 2025-03-07 cs.CV 79%

LION-FS: Fast & Slow Video-Language Thinker as Online Video Assistant

Wei Li, Bing Hu, Rui Shao, Leyang Shen, Liqiang Nie

专题命中 视频问答 :video-language(title,abstract);分类 cs.CV

Comments Accept to CVPR 2025, Project page: https://github.com/JiuTian-VL/LION-FS

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08870 2025-03-04 cs.CV 79%

Vista-LLaMA: Reducing Hallucination in Video Language Models via Equal Distance to Visual Tokens

Fan Ma, Xiaojie Jin, Heng Wang, Yuchen Xian, Jiashi Feng, Yi Yang

专题命中 视频问答 :video language model(title);video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02449 2025-02-05 cs.CV 79%

TUMTraffic-VideoQA: A Benchmark for Unified Spatio-Temporal Video Understanding in Traffic Scenes

Xingcheng Zhou, Konstantinos Larintzakis, Hao Guo, Walter Zimmer, Mingyu Liu, Hu Cao, Jiajie Zhang, Venkatnarayanan Lakshminarasimhan, Leah Strand, Alois C. Knoll

专题命中 视频问答 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03788 2024-10-11 cs.CV cs.CL 79%

MAMA: Meta-optimized Angular Margin Contrastive Framework for Video-Language Representation Learning

Thong Nguyen, Yi Bin, Xiaobao Wu, Xinshuai Dong, Zhiyuan Hu, Khoi Le, Cong-Duy Nguyen, See-Kiong Ng, Luu Anh Tuan

专题命中 视频问答 :video-language(title,abstract);分类 cs.CV

Comments Accepted to ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08367 2024-10-02 cs.CV 79%

ViLA: Efficient Video-Language Alignment for Video Question Answering

Xijun Wang, Junbang Liang, Chun-Kai Wang, Kenan Deng, Yu Lou, Ming Lin, Shan Yang

专题命中 视频问答 :video-language(title,abstract);分类 cs.CV

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11677 2024-07-25 cs.CV 79%

Video-Language Alignment via Spatio-Temporal Graph Transformer

Shi-Xue Zhang, Hongfa Wang, Xiaobin Zhu, Weibo Gu, Tianjin Zhang, Chun Yang, Wei Liu, Xu-Cheng Yin

专题命中 视频问答 :video-language(title,abstract);分类 cs.CV

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01233 2023-11-03 cs.CV cs.AI 79%

Long Story Short: a Summarize-then-Search Method for Long Video Question Answering

Jiwan Chung, Youngjae Yu

专题命中 视频问答 :long video(title,abstract);分类 cs.CV

Comments Published in BMVC 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19060 2023-10-31 cs.CV cs.AI cs.CL 79%

TESTA: Temporal-Spatial Token Aggregation for Long-form Video-Language Understanding

Shuhuai Ren, Sishuo Chen, Shicheng Li, Xu Sun, Lu Hou

专题命中 视频问答 :video-language(title,abstract);分类 cs.CV

Comments 16 pages, 9 figures, code is available at https://github.com/RenShuhuai-Andy/TESTA

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.11929 2022-10-24 cs.CV cs.CL 79%

LiteVL: Efficient Video-Language Learning with Enhanced Spatial-Temporal Modeling

Dongsheng Chen, Chaofan Tao, Lu Hou, Lifeng Shang, Xin Jiang, Qun Liu

专题命中 视频问答 :video-language(title,abstract);分类 cs.CV

Comments 13 pages, 6 figures, accepted by EMNLP 2022 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.07303 2022-03-15 cs.CV 79%

All in One: Exploring Unified Video-Language Pre-training

Alex Jinpeng Wang, Yixiao Ge, Rui Yan, Yuying Ge, Xudong Lin, Guanyu Cai, Jianping Wu, Ying Shan, Xiaohu Qie, Mike Zheng Shou

专题命中 视频问答 :video-language(title,abstract);分类 cs.CV

Comments 18 pages. 11 figures. Code: https://github.com/showlab/all-in-one

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.08344 2021-08-20 cs.CV cs.AI 79%

The Multi-Modal Video Reasoning and Analyzing Competition

Haoran Peng, He Huang, Li Xu, Tianjiao Li, Jun Liu, Hossein Rahmani, Qiuhong Ke, Zhicheng Guo, Cong Wu, Rongchang Li, Mang Ye, Jiahao Wang, Jiaxu Zhang, Yuanzhong Liu, Tao He, Fuwei Zhang, Xianbin Liu, Tao Lin

专题命中 视频问答 :video reasoning(title,abstract);分类 cs.CV

Comments Accepted to ICCV 2021 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.15538 2021-07-07 cs.CV 79%

SUTD-TrafficQA: A Question Answering Benchmark and an Efficient Network for Video Reasoning over Traffic Events

Li Xu, He Huang, Jun Liu

专题命中 视频问答 :video reasoning(title,abstract);分类 cs.CV

Comments Accepted by CVPR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14248 2025-06-02 cs.CL 78%

Addressing Blind Guessing: Calibration of Selection Bias in Multiple-Choice Question Answering by Video Language Models

Olga Loginova, Oleksandr Bezrukov, Ravi Shekhar, Alexey Kravets

机构 * University of Trento(特伦托大学) Gran Sasso Science Institute(格兰萨索科学研究所) University of Essex(埃塞克斯大学) University of Bath(巴斯大学)

专题命中 视频问答 :video language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25842 2026-07-03 cs.CV 新提交 77%

Graph it first! Enabling Reasoning on Long-form Egocentric Videos through Scene Graphs

先构建图!通过场景图实现长视频第一人称视频推理

Agnese Taluzzi, Riccardo Santambrogio, Simone Mentasti, Chiara Plizzari, Matteo Matteucci

机构 * Politecnico di Milano(米兰理工大学) Bocconi University(博科尼大学)

专题命中 视频问答 :video understanding(abstract);video reasoning(abstract);long video(abstract);分类 cs.CV

AI总结 提出利用第一人称场景图(EgoSGs)将长视频压缩为紧凑文本表示,在保持语义丰富性的同时大幅减少输入长度,使多模态大模型能在令牌预算内高效推理,在HD-EPIC VQA上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04124 2026-08-06 cs.CV cs.AI 新提交 74%

Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering

推理前的感知:面向视频理解与问答的动态隐式推理

Haotian Xia, Zilin Xiao, Junbo Zou, Vicente Ordonez, Hanjie Chen

机构 * Rice University(莱斯大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视频问答 :video understanding(title);分类 cs.CV

AI总结 该研究针对视频问答现有方法依赖长文本思维链的问题,提出DyLaR模型,通过动态调整感知与推理隐式变量的使用,在9个视频基准上提升准确率且缩短响应长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18558 2026-06-29 cs.CV cs.AI 版本更新 74%

HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering

HiMu: 面向长视频问答的分层多模态帧选择

Dan Ben-Ami, Gabriele Serussi, Kobi Cohen, Chaim Baskin

机构 * INSIGHT Lab, Ben-Gurion University of the Negev, Israel(本-古里安内盖夫大学INSIGHT实验室,以色列) Ben-Gurion University of the Negev, Israel(本-古里安内盖夫大学,以色列)

专题命中 视频问答 :long video(title);分类 cs.CV

AI总结 提出HiMu框架,通过文本LLM将查询分解为层次逻辑树,由视觉和音频专家处理原子谓词,经模糊逻辑算子组合生成连续帧满意度曲线,在16帧预算下达到帧选择方法的最优精度,并作为即插即用模块提升多种MLLM性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24726 2026-06-24 cs.CV 新提交 74%

SER: Learning to Ground Video Reasoning with Semantic Evidence Rewards

SER: 用语义证据奖励学习视频推理定位

Sheng Xia, Zhengqin Lai, Tianxiang Jiang, Kanghui Tian, Shoujun Zhou, Bin Li, Yi Wang

机构 * Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Shenzhen Institutes of Advanced Technology(深圳先进技术研究院)

专题命中 视频问答 :video reasoning(title);分类 cs.CV

AI总结 提出语义证据奖励(SER),通过将时空证据定位重构为约束验证任务,利用裁判VLM评估证据的相关性和定位质量,在V-STAR基准上提升3.0点mLGM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16256 2026-03-18 cs.CV 74%

When Thinking Hurts: Mitigating Visual Forgetting in Video Reasoning via Frame Repetition

当思考带来痛苦:通过帧重复缓解视频推理中的视觉遗忘

Xiaokun Sun, Yubo Wang, Haoyu Cao, Linli Xu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 视频问答 :video reasoning(title);分类 cs.CV

AI总结 本文提出FrameRepeat框架,通过轻量级重复评分模块和Add-One-In策略,有效增强视频推理中的视觉线索,提升模型性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06662 2026-03-17 cs.CV cs.LG 74%

HyperTokens: Controlling Token Dynamics for Continual Video-Language Understanding

HyperTokens: 通过控制令牌动态实现连续视频-语言理解

Toan Nguyen, Yang Liu, Celso De Melo, Flora D. Salim

专题命中 视频问答 :video-language(title);分类 cs.CV

AI总结 本文提出HyperTokens,通过按需生成微调令牌,控制提示更新并保持内存固定,通过元启发式正则化抑制遗忘,提升连续视频问答任务的准确率与保留率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05591 2026-03-09 cs.CV 74%

Thinking with Spatial Code for Physical-World Video Reasoning

基于空间代码的物理世界视频推理

Jieneng Chen, Wenxin Ma, Ruisheng Yuan, Yunzhi Zhang, Jiajun Wu, Alan Yuille

专题命中 视频问答 :video reasoning(title);分类 cs.CV

AI总结 基于空间代码的物理世界视频推理方法,通过空间编码器生成3D表示并提升大语言模型的推理能力。

Comments Code at https://github.com/Beckschen/spatialcode

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04022 2025-10-09 cs.CV 74%

Video-in-the-Loop: Span-Grounded Long Video QA with Interleaved Reasoning

Chendong Wang, Donglin Bai, Yifan Yang, Xiao Jin, Anlan Zhang, Rui Wang, Shiqi Jiang, Yuqing Yang, Hao Wu, Qi Dai, Chong Luo, Ting Cao, Lili Qiu, Suman Banerjee

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院) Columbia University(哥伦比亚大学) University of Southern California(南加州大学) Fudan University(复旦大学)

专题命中 视频问答 :long video(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07454 2025-08-06 cs.CV 74%

How Can Objects Help Video-Language Understanding?

Zitian Tang, Shijie Wang, Junho Cho, Jaewook Yoo, Chen Sun

机构 * Brown University(布朗大学) Samsung Electronics(三星电子)

专题命中 视频问答 :video-language(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01569 2026-04-03 cs.CV cs.MM 73%

VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification

VideoZeroBench: 通过时空证据验证探测视频多模态大语言模型的极限

Jiahao Meng, Tan Yue, Qi Xu, Haochen Wang, Zhongwei Ren, Weisong Liu, Yuhao Wang, Renrui Zhang, Yunhai Tong, Haodong Duan

机构 * PKU(北京大学) WHU(武汉大学) CASIA(中国科学院自动化研究所) BJTU(北京交通大学) CUHK(香港中文大学)

专题命中 视频问答 :video understanding(abstract);video reasoning(abstract);分类 cs.CV、cs.MM

AI总结 VideoZeroBench通过严格验证时空证据,揭示视频多模态大语言模型在长视频问答中的不足,发现即使在标准设置下,模型正确率也低于17%,且在严格约束下性能显著下降,凸显了基于证据的视频理解仍是瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏