Everything Can Be Described in Words: A Simple Unified Multi-Modal Framework with Semantic and Temporal Alignment
机构 * Northwestern University(西北大学) ; IEEE Member(IEEE会员)
专题命中 视频问答 :long video(abstract);分类 cs.CV
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
机构 * Northwestern University(西北大学) ; IEEE Member(IEEE会员)
专题命中 视频问答 :long video(abstract);分类 cs.CV
机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) ; National University of Singapore(新加坡国立大学) ; Zhejiang University(浙江大学) ; Yale University(耶鲁大学)
专题命中 视频问答 :video generation(abstract);分类 cs.CV
Comments ACL 2025 Main
机构 * MIT-IBM Watson AI lab(MIT-IBM沃森人工智能实验室) ; New York University(纽约大学) ; Harvard University(哈佛大学) ; UIUC(伊利诺伊大学) ; UC Berkeley(加州大学伯克利分校) ; MIT(麻省理工学院) ; UMass Amherst(马萨诸塞大学阿姆赫斯特分校)
专题命中 视频问答 :video reasoning(abstract);分类 cs.CV
Comments Accepted by TPAMI 2025. arXiv admin note: text overlap with arXiv:2205.01089
机构 * The Department of Electrical and Electronics Engineering(电气与电子工程系) ; Universidad de los Andes(亚利桑德大学)
专题命中 视频问答 :video understanding(abstract);分类 cs.CV
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Beihang University(北京航空航天大学) ; State Key Laboratory for Novel Software Technology(国家软件创新科技重点实验室) ; Nanjing University(南京大学) ; Shenzhen Key Laboratory of Computer Vision and Pattern Recognition(深圳计算机视觉与模式识别重点实验室) ; Shenzhen Institute of Advanced Technology(深圳先进技术研究院) ; Chinese Academy of Sciences(中国科学院)
专题命中 视频问答 :video-language(abstract);分类 cs.CV
Comments TCSVT 2025, doi at https://ieeexplore.ieee.org/document/10970001
机构 * Panasonic Connect Co., Ltd.(松下电器(中国)有限公司) ; Stanford University(斯坦福大学) ; Panasonic R&D Company of America(松下美国研发公司) ; Panasonic Holdings Corporation(松下控股公司)
专题命中 视频问答 :video understanding(abstract);分类 cs.CV
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Tsinghua University(清华大学) ; Max Planck Institute for Informatics(马克斯·普朗克研究所(信息学)) ; University of Freiburg(弗赖堡大学)
专题命中 视频问答 :video understanding(abstract);分类 cs.CV
Comments ICLR 2025 accepted paper. Project url: https://xingruiwang.github.io/projects/DynSuperCLEVR/
专题命中 视频问答 :video understanding(abstract);分类 cs.CV
Comments Accepted by ICLR 2025
专题命中 视频问答 :video understanding(abstract);分类 cs.CV
Comments ICLR 2025, Camera-ready Version
专题命中 视频问答 :video-language(abstract);分类 cs.CV
Comments Accepted by CVPR 2025
专题命中 视频问答 :video understanding(abstract);分类 cs.CV
专题命中 视频问答 :video understanding(abstract);分类 cs.CV
专题命中 视频问答 :long video(abstract);分类 cs.CV
Journal ref CVPR 2025
专题命中 视频问答 :video understanding(abstract);分类 cs.CV
Comments PhD Thesis
专题命中 视频问答 :long video(abstract);分类 cs.CV
Comments Accepted by CVPR 2025
专题命中 视频问答 :long video(abstract);分类 cs.CV
专题命中 视频问答 :long video(abstract);分类 cs.CV
Comments Accepted to ICLR 2025. Code: https://github.com/Becomebright/ReKV
专题命中 视频问答 :video-language(abstract);分类 cs.CV
专题命中 视频问答 :video generation(abstract);分类 cs.CV
专题命中 视频问答 :video understanding(abstract);分类 cs.CV
Comments WACV 2025
专题命中 视频问答 :video-language(abstract);分类 cs.CV
Comments Accepted by AAAI 2025
专题命中 视频问答 :video understanding(abstract);分类 cs.CV
专题命中 视频问答 :video-language(abstract);分类 cs.CV
Comments NeurIPS 2024 Camera Ready; Code is available at https://github.com/Beckschen/LLaVolta
专题命中 视频问答 :video-language(abstract);分类 cs.CV
Comments Transactions on Image Processing
Journal ref Transactions on Image Processing, vol. 33, pp. 3115-3129, 2024
专题命中 视频问答 :long video(abstract);分类 cs.CV
Comments Accepted to the main EMNLP 2024 conference
专题命中 视频问答 :video understanding(abstract);分类 cs.CV
专题命中 视频问答 :video-language(abstract);分类 cs.CV
Comments CVPR 2024
专题命中 视频问答 :video-language(abstract);分类 cs.CV
Comments The first two authors contribute equally
专题命中 视频问答 :video language model(abstract);分类 cs.CV
Comments Our code is available at https://github.com/imagegridworth/IG-VLM
专题命中 视频问答 :video reasoning(abstract);分类 cs.CV
Comments AAAI 2024