Enhancing Long Video Question Answering with Scene-Localized Frame Grouping
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI
机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室) ; Coastal Carolina University(海岸卡罗来纳大学) ; Ohio State University(俄亥俄州立大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI、cs.LG
机构 * BAAI FlagEval Team(BAAI 评测团队)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments Accepted by ACL 2025 Demo
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG
Comments 10 pages, 10 figures
机构 * NCIT(尼泊尔信息技术研究所) ; Fusemachine(Fusemachine公司) ; Logictronix Technologies(Logictronix Technologies公司)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments accepted to ImageCLEF 2025, to be published in the lab proceedings
机构 * Vector Institute for AI(向量人工智能研究所)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments Accepted at ASONAM'25
机构 * The University of Queensland(昆士兰大学)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * Department of Radiation Oncology, Winship Cancer Institute, Emory University School of Medicine(放射肿瘤科,Winship癌症研究所,埃默里大学医学院) ; Department of Biomedical Engineering, College of Engineering, Georgia Institute of Technology(生物医学工程系,工程学院,佐治亚理工学院) ; Department of Computer Science and Mathematics, Laney Graduate School, Emory University(计算机科学与数学系,兰尼研究生院,埃默里大学) ; School of Electrical and Computer Engineering, College of Engineering, Georgia Institute of Technology(电气与计算机工程系,工程学院,佐治亚理工学院)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; School of Computer Science, Fudan University(复旦大学计算机学院) ; National Biomedical Imaging Center, College of Future Technology, Peking University(北京大学未来技术学院生物医学成像中心) ; Ruijin Hospital, Shanghai Jiaotong University School of Medicine(上海交通大学医学院瑞金医院) ; Department of Pathology, State Key Laboratory of Cancer Biology, Xijing Hospital(西京医院病理科,癌症生物学国家重点实验室) ; Department of Computer Science, Rutgers University(罗格斯大学计算机科学系)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * EPFL(苏黎世联邦理工学院) ; Google DeepMind(谷歌DeepMind) ; Universidad Nacional de Córdoba(国家科隆大学)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.AI、cs.LG
Comments ACL 2025 (Findings)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG
机构 * National University of Singapore(新加坡国立大学) ; Communication University of China(中国传媒大学) ; Sun Yat-Sen University(中山大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI
Comments IJCV'25
专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI、cs.LG
机构 * Huawei Cloud Computing(华为云计算)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
机构 * Simula Metropolitan Center for Digital Engineering (SimulaMet)(Simula Metropolitan Center for Digital Engineering) ; Oslo Metropolitan University (OsloMet)(Oslo Metropolitan University) ; Simula Research Laboratory
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Technical University of Munich(慕尼黑技术大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
机构 * Jožef Stefan Institute(乔泽夫·斯塔芬研究所)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG
Comments To-appear as a book chapter
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Our Code can be found at https://github.com/adityavavre/VidEgoVLM
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Illinois Fire Service Institute(伊利诺伊州消防服务研究所)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments 20 pages, 9 figures, 6 tables
机构 * University of Helsinki(赫尔辛基大学) ; Computer Vision Center, Universitat Autònoma de Barcelona(巴塞罗那自治大学计算机视觉中心) ; CISPA Helmholtz Center for Information Security(信息安全赫尔姆霍茨中心) ; INRIA(法国国家信息与自动化技术研究所) ; Yooz ; Carnegie Mellon University(卡内基梅隆大学) ; NTT(日本NTT公司) ; Institute of Science Tokyo(东京科学研究所) ; Department of Computer Science(计算机科学系) ; Mphasis AI & Applied Tech Lab at Ashoka, Ashoka University(阿什oka大学人工智能与应用技术实验室) ; Koita Centre for Digital Health - Ashoka (KCDH-A)(阿什oka数字健康中心(KCDH-A)) ; Trivedi School of Biosciences, Ashoka University(阿什oka大学Trivedi生物科学学院)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG
Comments 33 pages, 7 figures; published in TMLR 06/2025 https://openreview.net/forum?id=3HKNwejEEq
Journal ref Transactions on Machine Learning Research, ISSN 2835-8856, 2025
机构 * Boston University(波士顿大学) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments Accepted at CVPR 2025 workshops (AI4CC (oral) & GMCV (poster))
机构 * ByteDance(字节跳动) ; Nanyang Technological University(南洋理工大学) ; Southwest Jiaotong University(西南交通大学) ; Great Bay University(大湾大学) ; Shenzhen University(深圳大学)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments Accepted to ICME 2025
机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院) ; School of Computer Science and Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学) ; School of Engineering, Westlake University(工程学院,西湖大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI
Comments 12 pages, 5 figures, 4 tables
机构 * School of Intelligence Science and Technology, Peking University(北京理工大学智能科学与技术学院) ; College of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) ; State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence(一般人工智能国家重点实验室) ; Yuanpei College, Peking University(北京大学元培学院) ; Tsinghua University(清华大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * University of Copenhagen(哥本哈根大学) ; Sony AI(索尼人工智能) ; University of Zaragoza(阿拉维萨大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Tsinghua University(清华大学) ; Max Planck Institute for Informatics(马克斯·普朗克研究所(信息学)) ; University of Freiburg(弗赖堡大学)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments ICLR 2025 accepted paper. Project url: https://xingruiwang.github.io/projects/DynSuperCLEVR/
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI、cs.LG
Comments Spotlight, Machine Learning for Genomics Explorations @ ICLR 2025
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.LG
Comments CVPR 2025 Camera Ready Version. Project Page: https://videochat-online.github.io
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG
Comments The first two listed authors contributed equally to this work