EfficientEQA: An Efficient Approach to Open-Vocabulary Embodied Question Answering
机构 * Purdue University(普渡大学) ; University of Central Florida(中央佛罗里达大学)
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments IROS 2025 Oral
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Purdue University(普渡大学) ; University of Central Florida(中央佛罗里达大学)
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments IROS 2025 Oral
机构 * Department of General Psychology and Department of Mathematics University of Padova(帕多瓦大学心理学系和数学系) ; Department of General Psychology University of Padova(帕多瓦大学心理学系) ; Department of General Psychology and Padova Neuroscience Center University of Padova(帕多瓦大学心理学系和帕多瓦神经科学中心) ; IRCSS San Camillo Hospital, Venice-Lido(威尼斯利多医院IRCSS桑卡莫医院)
专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(中国香港中文大学计算机科学与工程系) ; School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院) ; School of Integrated Circuits, Peking University(北京大学集成电路学院) ; School of Intergrated Circuits, Southeast University(东南大学集成电路学院) ; School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) ; Department of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术系) ; National Center of Technology Innovation for EDA(EDA技术创新国家中心)
专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG
Comments 10 pages, 1 figure, 5 tables. To appear in ICCAD 2025
机构 * AITRICS Seoul(AITRICS首尔) ; Chung-Ang University(Chung-ang 大学)
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments ICCV 2025 Workshop on Curated Data for Efficient Learning (CDEL)
机构 * University of Maryland(马里兰大学) ; Apple(苹果公司)
专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG
Comments Website: see https://vatsalag99.github.io/mustafar/
机构 * The University of Hong Kong(香港大学) ; Beijing University of Technology(北京工业大学)
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments 27 pages, 9 figures. arXiv admin note: text overlap with arXiv:2410.14200 by other authors
机构 * SRI ; Johns Hopkins University(约翰霍普金斯大学) ; United States Military Academy(美国军事学院) ; University of Colorado Boulder(科罗拉多大学博尔德分校)
专题命中 视觉问答 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
机构 * ByteDance Inc.(字节跳动公司) ; East China Normal University(东华大学) ; Huazhong University of Science and Technology(华中科技大学) ; University of Minnesota(明尼苏达大学) ; Cornell University(康奈尔大学)
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG
机构 * Monash University(蒙纳士大学) ; MBZUAI ; XJTLU(西安交通大学) ; Shanghai Jiaotong University(上海交通大学) ; Fudan University(复旦大学) ; University of Minnesota(明尼苏达大学) ; Cornell University(康奈尔大学)
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG
Comments Clarification note for the CVPR 2025 paper (FarSight). Prepared by a subset of the original authors; remaining co-authors are acknowledged in the text
机构 * R&D Center, Talan(Talan 研发中心)
专题命中 视觉问答 :VLM(abstract);visual language model(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
机构 * National University of Singapore(新加坡国立大学)
专题命中 视觉问答 :grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments Accepted to SIGIR'25
机构 * College of Computing and Informatics, Drexel University(计算与信息学院,德雷塞尔大学)
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
Comments 4 pages, accepted by ToM@AAAI25
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
Comments Accepted by CVPR 2025; project page: https://vdocrag.github.io
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
Comments This project is available at https://www.med-vqa.com/GEMeX
专题命中 视觉问答 :visual language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
Comments A pre-print. 26 pages. Link to Code + Data: https://huggingface.co/datasets/Artificio/robusto-1
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments NAACL 2025 Main Conference
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI
Comments Accepted by AAAI 2025
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.AI、cs.LG
专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG
Comments EMNLP 2024 Main conference
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI、cs.LG
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG
Comments Paper published at AAAI 2024 Spring Symposium Series
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG
Comments ICML 2024