arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 210 信号源:cs.CV, eess.IV, cs.MM

1. 视频问答 210 篇

2408.02687 2025-05-27 cs.CV 57%

Compositional Physical Reasoning of Objects and Events from Videos

Zhenfang Chen, Shilong Dong, Kexin Yi, Yunzhu Li, Mingyu Ding, Antonio Torralba, Joshua B. Tenenbaum, Chuang Gan

机构 * MIT-IBM Watson AI lab(MIT-IBM沃森人工智能实验室) New York University(纽约大学) Harvard University(哈佛大学) UIUC(伊利诺伊大学) UC Berkeley(加州大学伯克利分校) MIT(麻省理工学院) UMass Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 视频问答 :video reasoning(abstract);分类 cs.CV

Comments Accepted by TPAMI 2025. arXiv admin note: text overlap with arXiv:2205.01089

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15928 2025-05-23 cs.CV cs.CL 57%

ViQAgent: Zero-Shot Video Question Answering via Agent with Open-Vocabulary Grounding Validation

Tony Montes, Fernando Lozano

机构 * The Department of Electrical and Electronics Engineering(电气与电子工程系) Universidad de los Andes(亚利桑德大学)

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06557 2025-05-13 cs.CV 57%

Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining

Lu Dong, Haiyu Zhang, Hongjie Zhang, Yifei Huang, Zhen-Hua Ling, Yu Qiao, Limin Wang, Yali Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学) State Key Laboratory for Novel Software Technology(国家软件创新科技重点实验室) Nanjing University(南京大学) Shenzhen Key Laboratory of Computer Vision and Pattern Recognition(深圳计算机视觉与模式识别重点实验室) Shenzhen Institute of Advanced Technology(深圳先进技术研究院) Chinese Academy of Sciences(中国科学院)

专题命中 视频问答 :video-language(abstract);分类 cs.CV

Comments TCSVT 2025, doi at https://ieeexplore.ieee.org/document/10970001

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20091 2025-05-01 cs.CV cs.MA 57%

VideoMultiAgents: A Multi-Agent Framework for Video Question Answering

Noriyuki Kugo, Xiang Li, Zixin Li, Ashish Gupta, Arpandeep Khatua, Nidhish Jain, Chaitanya Patel, Yuta Kyuragi, Yasunori Ishii, Masamoto Tanabiki, Kazuki Kozuka, Ehsan Adeli

机构 * Panasonic Connect Co., Ltd.(松下电器(中国)有限公司) Stanford University(斯坦福大学) Panasonic R&D Company of America(松下美国研发公司) Panasonic Holdings Corporation(松下控股公司)

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00622 2025-04-24 cs.CV cs.AI 57%

Compositional 4D Dynamic Scenes Understanding with Physics Priors for Video Question Answering

Xingrui Wang, Wufei Ma, Angtian Wang, Shuo Chen, Adam Kortylewski, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学) Tsinghua University(清华大学) Max Planck Institute for Informatics(马克斯·普朗克研究所(信息学)) University of Freiburg(弗赖堡大学)

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

Comments ICLR 2025 accepted paper. Project url: https://xingruiwang.github.io/projects/DynSuperCLEVR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07177 2025-04-15 cs.CV cs.AI cs.LG 57%

MM-Ego: Towards Building Egocentric Multimodal LLMs for Video QA

Hanrong Ye, Haotian Zhang, Erik Daxberger, Lin Chen, Zongyu Lin, Yanghao Li, Bowen Zhang, Haoxuan You, Dan Xu, Zhe Gan, Jiasen Lu, Yinfei Yang

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03226 2025-03-31 cs.CV cs.CL 57%

Frame-Voyager: Learning to Query Frames for Video Large Language Models

Sicheng Yu, Chengkai Jin, Huanyu Wang, Zhenghao Chen, Sheng Jin, Zhongrong Zuo, Xiaolei Xu, Zhenbang Sun, Bingni Zhang, Jiawei Wu, Hao Zhang, Qianru Sun

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

Comments ICLR 2025, Camera-ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05069 2025-03-26 cs.CV cs.AI 57%

Commonsense Video Question Answering through Video-Grounded Entailment Tree Reasoning

Huabin Liu, Filip Ilievski, Cees G. M. Snoek

专题命中 视频问答 :video-language(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16032 2025-03-21 cs.CV 57%

Agentic Keyframe Search for Video Question Answering

Sunqi Fan, Meng-Hao Guo, Shuojin Yang

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15887 2025-03-21 cs.CV 57%

DocVideoQA: Towards Comprehensive Understanding of Document-Centric Videos through Question Answering

Haochen Wang, Kai Hu, Liangcai Gao

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12855 2025-03-18 cs.CV cs.AI cs.CL 57%

VITED: Video Temporal Evidence Distillation

Yujie Lu, Yale Song, William Wang, Lorenzo Torresani, Tushar Nagarajan

专题命中 视频问答 :long video(abstract);分类 cs.CV

Journal ref CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12447 2025-03-18 cs.CV cs.AI 57%

Causality Model for Semantic Understanding on Videos

Li Yicong

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

Comments PhD Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09590 2025-03-14 cs.CV 57%

BIMBA: Selective-Scan Compression for Long-Range Video Question Answering

Md Mohaiminul Islam, Tushar Nagarajan, Huiyu Wang, Gedas Bertasius, Lorenzo Torresani

专题命中 视频问答 :long video(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01201 2025-03-04 cs.CV 57%

Parameter-free Video Segmentation for Vision and Language Understanding

Louis Mahon, Mirella Lapata

专题命中 视频问答 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00540 2025-03-04 cs.CV 57%

Streaming Video Question-Answering with In-context Video KV-Cache Retrieval

Shangzhe Di, Zhelun Yu, Guanghao Zhang, Haoyuan Li, Tao Zhong, Hao Cheng, Bolin Li, Wanggui He, Fangxun Shu, Hao Jiang

专题命中 视频问答 :long video(abstract);分类 cs.CV

Comments Accepted to ICLR 2025. Code: https://github.com/Becomebright/ReKV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01694 2025-02-14 cs.CV 57%

Enhancing Video-LLM Reasoning via Agent-of-Thoughts Distillation

Yudi Shi, Shangzhe Di, Qirui Chen, Weidi Xie

专题命中 视频问答 :video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20725 2024-12-31 cs.CV 57%

Dialogue Director: Bridging the Gap in Dialogue Visualization for Multimodal Storytelling

Min Zhang, Zilin Wang, Liyan Chen, Kunhong Liu, Juncong Lin

专题命中 视频问答 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19304 2024-12-30 cs.CV 57%

Perceive, Query & Reason: Enhancing Video QA with Question-Guided Temporal Queries

Roberto Amoroso, Gengyuan Zhang, Rajat Koner, Lorenzo Baraldi, Rita Cucchiara, Volker Tresp

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

Comments WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12502 2024-12-18 cs.CV 57%

Track the Answer: Extending TextVQA from Image to Video with Spatio-Temporal Clues

Yan Zhang, Gangyan Zeng, Huawen Shen, Daiqing Wu, Yu Zhou, Can Ma

专题命中 视频问答 :video-language(abstract);分类 cs.CV

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11056 2024-12-17 cs.CV 57%

Overview of TREC 2024 Medical Video Question Answering (MedVidQA) Track

Deepak Gupta, Dina Demner-Fushman

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.20092 2024-11-19 cs.CV 57%

Efficient Large Multi-modal Models via Visual Context Compression

Jieneng Chen, Luoxin Ye, Ju He, Zhao-Yang Wang, Daniel Khashabi, Alan Yuille

专题命中 视频问答 :video-language(abstract);分类 cs.CV

Comments NeurIPS 2024 Camera Ready; Code is available at https://github.com/Beckschen/LLaVolta

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09379 2024-10-15 cs.CV cs.AI 57%

Multi-granularity Contrastive Cross-modal Collaborative Generation for End-to-End Long-term Video Question Answering

Ting Yu, Kunhao Fu, Jian Zhang, Qingming Huang, Jun Yu

专题命中 视频问答 :video-language(abstract);分类 cs.CV

Comments Transactions on Image Processing

Journal ref Transactions on Image Processing, vol. 33, pp. 3115-3129, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19723 2024-10-08 cs.CV cs.AI 57%

Encoding and Controlling Global Semantics for Long-form Video Question Answering

Thong Thanh Nguyen, Zhiyuan Hu, Xiaobao Wu, Cong-Duy T Nguyen, See-Kiong Ng, Anh Tuan Luu

专题命中 视频问答 :long video(abstract);分类 cs.CV

Comments Accepted to the main EMNLP 2024 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13538 2024-09-23 cs.CV cs.AI cs.LG 57%

First Place Solution to the Multiple-choice Video QA Track of The Second Perception Test Challenge

Yingzhe Peng, Yixiao Yuan, Zitian Ao, Huapeng Zhou, Kangqi Wang, Qipeng Zhu, Xu Yang

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01823 2024-05-07 cs.CV 57%

Detours for Navigating Instructional Videos

Kumar Ashutosh, Zihui Xue, Tushar Nagarajan, Kristen Grauman

专题命中 视频问答 :video-language(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08755 2024-04-24 cs.CV cs.AI cs.CL cs.LG 57%

DAM: Dynamic Adapter Merging for Continual Video QA Learning

Feng Cheng, Ziyang Wang, Yi-Lin Sung, Yan-Bo Lin, Mohit Bansal, Gedas Bertasius

专题命中 视频问答 :video-language(abstract);分类 cs.CV

Comments The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18406 2024-03-28 cs.CV cs.AI cs.CL cs.LG 57%

An Image Grid Can Be Worth a Video: Zero-shot Video Question Answering Using a VLM

Wonkyun Kim, Changin Choi, Wonseok Lee, Wonjong Rhee

专题命中 视频问答 :video language model(abstract);分类 cs.CV

Comments Our code is available at https://github.com/imagegridworth/IG-VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17343 2024-02-01 cs.CV cs.AI 57%

YTCommentQA: Video Question Answerability in Instructional Videos

Saelyne Yang, Sunghyun Park, Yunseok Jang, Moontae Lee

专题命中 视频问答 :video reasoning(abstract);分类 cs.CV

Comments AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00937 2023-12-05 cs.CV 57%

Zero-Shot Video Question Answering with Procedural Programs

Rohan Choudhury, Koichiro Niinuma, Kris M. Kitani, László A. Jeni

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.06988 2023-12-01 cs.CV cs.AI cs.CL cs.LG 57%

Self-Chained Image-Language Model for Video Localization and Question Answering

Shoubin Yu, Jaemin Cho, Prateek Yadav, Mohit Bansal

专题命中 视频问答 :video-language(abstract);分类 cs.CV

Comments NeurIPS 2023; Our code and checkpoints are available at: https://github.com/Yui010206/SeViLA

详情

展开后加载摘要…

URL PDF HTML 收藏