SplatTalk: 3D VQA with Gaussian Splatting
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Google DeepMind(谷歌DeepMind)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments Accepted at ICCV 2025
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Google DeepMind(谷歌DeepMind)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments Accepted at ICCV 2025
机构 * TIB – Leibniz Information Centre for Science and Technology(莱比锡信息科学与技术研究中心) ; Amazon, Germany(亚马逊公司)
专题命中 视觉问答 :LLaVA(abstract);grounding(abstract);分类 cs.AI
机构 * The Hong Kong University of Sciences and Technology, Guangzhou(香港科学与技术大学(广州)) ; Beihang University(北航大学) ; Shandong University(山东大学) ; Hubei University(湖北大学) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) ; Australian National University(澳大利亚国立大学)
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
机构 * Department of Computer Vision, MBZUAI(视觉计算系,MBZUAI) ; Department of Computer Science, Aalto University(计算机科学系,阿alto大学)
专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments ACM Multimedia 2025
机构 * University of Verona(威尼斯大学) ; Polytechnic University of Turin(都灵理工大学) ; Fondazione Bruno Kessler(布鲁诺·科塞勒基金会)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments Accepted to ICIAP25. Project page: site [https://intelligolabs.github.io/L-VQAScore/\
机构 * Department of Electrical and Computer Engineering, Seoul National University(电气与计算机工程系,首尔国立大学) ; Interdisciplinary Program in Artificial Intelligence, Seoul National University(人工智能交叉学科项目,首尔国立大学) ; Adobe Research(Adobe研究)
专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments ICML 2025
机构 * Google DeepMind(谷歌DeepMind)
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.LG
机构 * Wuhan University(武汉大学)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
机构 * School of Mathematical Sciences, Zhejiang University(浙江大学数学科学学院)
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.AI
机构 * Shi Liu ; Weijie Su ; Xizhou Zhu ; Wenhai Wang ; Jifeng Dai
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments ICML 2025
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室)
专题命中 视觉问答 :visual question answering(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI
Journal ref International Journal of Web Research, vol.8, no.2,pp.11-24, 2025,
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Kuaishou Technology(快手科技) ; Xi’an Jiaotong University(西安交通大学)
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV
机构 * Department of Electrical and Computer Engineering, University of Southern California(电气与计算机工程系,南加州大学) ; Department of Radiology and Imaging Sciences, University of Utah(放射学与影像科学系,犹他大学)
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
Comments 24 Pages, 9 figures, The Thirteenth International Conference on Learning Representations (ICLR) 2025
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI
机构 * Institute of Science and Engineering, Kanazawa University(金泽大学科学与工程研究所) ; Department of Electrical and Electronic Engineering, University of Hong Kong(香港大学电子与电气工程系) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);分类 cs.AI
机构 * Vanderbilt University(范德比大学) ; Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) ; University of Utah(犹他大学)
专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments 10 pages, 3 figures
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV
Comments CVPR 2025
专题命中 视觉问答 :visual question answering(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.LG
Comments ICLR 2025
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI
专题命中 视觉问答 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
Comments Accepted by CVPR 2025
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV
专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
Comments 7 pages
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.AI
Comments 20 pages, 6 figures
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
Comments Our dataset can be found at \url{https://huggingface.co/datasets/fazliimam/temporal-vqa}
专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);分类 cs.LG
Comments International Conference on Learning Representations (ICLR 2025)