arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 210 信号源:cs.CV, eess.IV, cs.MM

1. 视频问答 210 篇

2308.08414 2023-08-17 cs.CV 57%

Tem-adapter: Adapting Image-Text Pretraining for Video Question Answer

Guangyi Chen, Xiao Liu, Guangrun Wang, Kun Zhang, Philip H. S. Torr, Xiao-Ping Zhang, Yansong Tang

专题命中 视频问答 :video-language(abstract);分类 cs.CV

Comments ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.16839 2023-08-10 cs.CV cs.CL cs.LG 57%

MaMMUT: A Simple Architecture for Joint Learning for MultiModal Tasks

Weicheng Kuo, AJ Piergiovanni, Dahun Kim, Xiyang Luo, Ben Caine, Wei Li, Abhijit Ogale, Luowei Zhou, Andrew Dai, Zhifeng Chen, Claire Cui, Anelia Angelova

专题命中 视频问答 :video-language(abstract);分类 cs.CV

Comments Published in Transactions on Machine Learning Research ( https://jmlr.org/tmlr/ ). 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.08914 2023-08-08 cs.LG cs.CL cs.CV 57%

$C^3$: Compositional Counterfactual Contrastive Learning for Video-grounded Dialogues

Hung Le, Nancy F. Chen, Steven C. H. Hoi

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

Comments 24th Meeting of the Special Interest Group on Discourse and Dialogue (SIGDIAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.12058 2023-07-25 cs.CV 57%

Discovering Spatio-Temporal Rationales for Video Question Answering

Yicong Li, Junbin Xiao, Chun Feng, Xiang Wang, Tat-Seng Chua

专题命中 视频问答 :long video(abstract);分类 cs.CV

Comments Accepted to ICCV2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.09636 2023-07-20 cs.CV cs.AI 57%

Traffic-Domain Video Question Answering with Automatic Captioning

Ehsan Qasemi, Jonathan M. Francis, Alessandro Oltramari

专题命中 视频问答 :video-language(abstract);分类 cs.CV

Comments Accepted in ITSC2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13009 2023-03-24 cs.CV 57%

MELTR: Meta Loss Transformer for Learning to Fine-tune Video Foundation Models

Dohwan Ko, Joonmyung Choi, Hyeong Kyu Choi, Kyoung-Woon On, Byungseok Roh, Hyunwoo J. Kim

专题命中 视频问答 :text-to-video(abstract);分类 cs.CV

Comments Accepted paper at CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.03105 2023-03-08 cs.MM 57%

Confidence-based Event-centric Online Video Question Answering on a Newly Constructed ATBS Dataset

Weikai Kong, Shuhong Ye, Chenglin Yao, Jianfeng Ren

专题命中 视频问答 :long video(abstract);分类 cs.MM

Comments Accepted for publication at the 2023 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.10938 2023-02-28 cs.CV cs.CL cs.LG 57%

A Multi-level Alignment Training Scheme for Video-and-Language Grounding

Yubo Zhang, Feiyang Niu, Qing Ping, Govind Thattai

专题命中 视频问答 :video-language(abstract);分类 cs.CV

Comments Accepted at ICDM 2022 FOMO-VL workshop

Journal ref 2022 IEEE International Conference on Data Mining Workshops (ICDMW), Orlando, FL, USA, 2022, pp. 958-966

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.10300 2022-10-20 cs.CV 57%

Dense but Efficient VideoQA for Intricate Compositional Reasoning

Jihyeon Lee, Wooyoung Kang, Eun-Sol Kim

专题命中 视频问答 :long video(abstract);分类 cs.CV

Comments Accepted to WACV'23

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.03941 2022-10-11 cs.CV cs.CL 57%

Learning Fine-Grained Visual Understanding for Video Question Answering via Decoupling Spatial-Temporal Modeling

Hsin-Ying Lee, Hung-Ting Su, Bing-Chen Tsai, Tsung-Han Wu, Jia-Fong Yeh, Winston H. Hsu

专题命中 视频问答 :video-language(abstract);分类 cs.CV

Comments BMVC 2022. Code is available at https://github.com/shinying/dest

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.09019 2022-09-20 cs.CV cs.CL cs.LG 57%

LAVIS: A Library for Language-Vision Intelligence

Dongxu Li, Junnan Li, Hung Le, Guangsen Wang, Silvio Savarese, Steven C. H. Hoi

专题命中 视频问答 :video-language(abstract);分类 cs.CV

Comments Preprint of LAVIS technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.06650 2022-09-15 cs.CV cs.CL 57%

WildQA: In-the-Wild Video Question Answering

Santiago Castro, Naihao Deng, Pingxuan Huang, Mihai Burzo, Rada Mihalcea

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

Comments *: Equal contribution; COLING 2022 oral; project webpage: https://lit.eecs.umich.edu/wildqa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.07898 2022-06-17 cs.AI cs.CL cs.CV cs.LG 57%

Multimodal Dialogue State Tracking

Hung Le, Nancy F. Chen, Steven C. H. Hoi

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

Comments Accepted at NAACL 2022 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.03428 2022-06-08 cs.CV cs.AI cs.CL 57%

Revealing Single Frame Bias for Video-and-Language Learning

Jie Lei, Tamara L. Berg, Mohit Bansal

专题命中 视频问答 :text-to-video(abstract);分类 cs.CV

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.14547 2021-12-01 cs.CV 57%

LiVLR: A Lightweight Visual-Linguistic Reasoning Framework for Video Question Answering

Jingjing Jiang, Ziyi Liu, Nanning Zheng

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

Comments 11 pages, 5 figures, Code: https://github.com/jingjing12110/LiVLR-VideoQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.05166 2021-07-12 cs.CV 57%

Object-Centric Representation Learning for Video Question Answering

Long Hoang Dang, Thao Minh Le, Vuong Le, Truyen Tran

专题命中 视频问答 :video reasoning(abstract);分类 cs.CV

Comments Accepted by IJCNN 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.06160 2021-05-17 cs.CV cs.AI 57%

Relation-aware Hierarchical Attention Framework for Video Question Answering

Fangtao Li, Ting Bai, Chenyu Cao, Zihe Liu, Chenghao Yan, Bin Wu

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

Comments 9 pages, This paper is accepted by ICMR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.13558 2021-03-03 cs.CL cs.CV 57%

Natural Language Video Localization: A Revisit in Span-based Question Answering Framework

Hao Zhang, Aixin Sun, Wei Jing, Liangli Zhen, Joey Tianyi Zhou, Rick Siow Mong Goh

专题命中 视频问答 :long video(abstract);分类 cs.CV

Comments 15 pages, 18 figures, and 10 tables. Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). arXiv admin note: substantial text overlap with arXiv:2004.13931

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.06183 2021-02-12 cs.CV cs.CL 57%

Less is More: ClipBERT for Video-and-Language Learning via Sparse Sampling

Jie Lei, Linjie Li, Luowei Zhou, Zhe Gan, Tamara L. Berg, Mohit Bansal, Jingjing Liu

专题命中 视频问答 :text-to-video(abstract);分类 cs.CV

Comments 12 pages, 5 figures, 11 tables. - Happy Chinese New Year!

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.03356 2020-12-18 cs.CL cs.AI cs.CV 57%

DramaQA: Character-Centered Video Story Understanding with Hierarchical QA

Seongho Choi, Kyoung-Woon On, Yu-Jung Heo, Ahjeong Seo, Youwon Jang, Minsu Lee, Byoung-Tak Zhang

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

Comments 15 pages, 11 figures, accepted to AAAI 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.03186 2020-12-11 cs.CV 57%

Noise Estimation Using Density Estimation for Self-Supervised Multimodal Learning

Elad Amrani, Rami Ben-Ari, Daniel Rotman, Alex Bronstein

专题命中 视频问答 :text-to-video(abstract);分类 cs.CV

Comments Accepted to AAAI 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.08814 2020-07-22 cs.CV 57%

Visual Relation Grounding in Videos

Junbin Xiao, Xindi Shang, Xun Yang, Sheng Tang, Tat-Seng Chua

专题命中 视频问答 :video-language(abstract);分类 cs.CV

Comments ECCV2020 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.08385 2020-04-21 cs.CV cs.CL 57%

Knowledge-Based Visual Question Answering in Videos

Noa Garcia, Mayu Otani, Chenhui Chu, Yuta Nakashima

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

Comments arXiv admin note: substantial text overlap with arXiv:1910.10706

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.10706 2019-12-25 cs.CV cs.CL 57%

KnowIT VQA: Answering Knowledge-Based Questions about Videos

Noa Garcia, Mayu Otani, Chenhui Chu, Yuta Nakashima

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.02467 2019-06-07 cs.CV 57%

ActivityNet-QA: A Dataset for Understanding Complex Web Videos via Question Answering

Zhou Yu, Dejing Xu, Jun Yu, Ting Yu, Zhou Zhao, Yueting Zhuang, Dacheng Tao

专题命中 视频问答 :long video(abstract);分类 cs.CV

Comments Accepted at AAAI 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.02559 2018-08-09 cs.CV 57%

A Joint Sequence Fusion Model for Video Question Answering and Retrieval

Youngjae Yu, Jongseok Kim, Gunhee Kim

专题命中 视频问答 :video-language(abstract);分类 cs.CV

Comments To appear in ECCV 2018. 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03707 2026-03-31 cs.CL 50%

OmniRAG-Agent: Agentic Omnimodal Reasoning for Low-Resource Long Audio-Video Question Answering

OmniRAG-Agent:面向低资源长音频视频的代理多模态推理

Yifan Zhu, Xinyu Mu, Tao Feng, Zhonghong Ou, Yuning Gong, Haoran Luo

专题命中 视频问答 :video reasoning(abstract)

AI总结 本文提出OmniRAG-Agent,通过构建图像音频检索增强生成模块和代理循环,解决低资源长音频视频问答中的高成本编码、弱细粒度检索等问题,实验表明其在低资源环境下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12299 2025-10-15 cs.IR 50%

An Empirical Study for Representations of Videos in Video Question Answering via MLLMs

Zhi Li, Yanan Wang, Hao Niu, Julio Vizcarra, Masato Taya

专题命中 视频问答 :long video(abstract)

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14877 2024-06-24 cs.CL 50%

Sports Intelligence: Assessing the Sports Understanding Capabilities of Language Models through Question Answering from Text to Video

Zhengbang Yang, Haotian Xia, Jingxi Li, Zezhi Chen, Zhuangdi Zhu, Weining Shen

专题命中 视频问答 :video language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.11291 2019-09-26 cs.CL 50%

Question Answering is a Format; When is it Useful?

Matt Gardner, Jonathan Berant, Hannaneh Hajishirzi, Alon Talmor, Sewon Min

专题命中 视频问答 :video understanding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏