FIHA: Autonomous Hallucination Evaluation in Vision-Language Models with Davidson Scene Graphs
机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校)
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV
Comments Accepted by Findings of ACL 2025
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校)
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV
Comments Accepted by Findings of ACL 2025
机构 * Fudan University(复旦大学) ; Northwestern Polytechnical University(西北工业大学)
专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.CV
机构 * The Hong Kong University of Science & Technology (Guangzhou)(香港科技大学(广州)) ; The Hong Kong University of Science & Technology(香港科技大学) ; Zhejiang University(浙江大学) ; Lappeenranta-Lahti University of Technology(拉佩兰塔-拉赫蒂技术大学)
专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV
Comments Accepted by CVPR 2025
机构 * ARC Lab, Tencent PCG(腾讯PCG广告实验室) ; City University of Hong Kong(香港城市大学)
专题命中 视觉推理 :MLLM(title);grounding(abstract);分类 cs.CV
Comments Homepage: https://github.com/TencentARC/Video-Holmes
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德·本·扎耶德人工智能大学) ; ByteDance(字节跳动) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; The Australia National University(澳大利亚国立大学) ; Renmin University of China(中国人民大学) ; Wuhan University(武汉大学)
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV
Comments 14pages
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV
Comments ICML 2025
机构 * Xidian University(西安电子科技大学) ; Westlake University(西湖大学)
专题命中 视觉推理 :vision-language model(title);multimodal large language model(abstract);分类 cs.LG
机构 * Department of Computer Science Univ. of Applied Science Hamm-Lippstadt(计算机科学系应用科学大学哈姆-利普施塔特) ; Carl von Ossietzky University of Oldenburg(卡尔·冯·奥西埃茨基旧恩堡大学)
专题命中 视觉推理 :LLaVA(title,abstract);分类 cs.CV
Comments 10 pages, 6 figures
机构 * ByteDance(字节跳动) ; FuDan University(复旦大学)
专题命中 视觉推理 :MLLM(title);multimodal large language model(abstract);分类 cs.AI
机构 * Harvard Medical School(哈佛医学院) ; Uppsala University(乌普萨拉大学) ; University of London(伦敦大学) ; Vietnam Military Medical University(越南军医大学) ; University of Technical Education Ho Chi Minh City(胡志明市技术大学) ; Knovel Engineering Lab(Knovel工程实验室) ; University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV
Comments IQ Test for Multimodal Models
机构 * Nanyang Technological University(南洋理工大学)
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV
机构 * University of Bristol(布里斯托大学) ; X-Intelligence Labs(X-智能实验室) ; Meta
专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV
机构 * Fudan University(复旦大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiaotong University(上海交通大学) ; Nankai University(南开大学) ; Shanghai University(上海大学) ; Nanyang Technological University(南洋理工大学) ; Hong Kong Polytechnic University(香港理工大学) ; Tongji University(同济大学) ; Nanjing University(南京大学) ; University of California, Merced(加州大学梅德福分校) ; Chinese University of Hong Kong(香港中文大学)
专题命中 视觉推理 :VLM(title);vision-language model(abstract);分类 cs.CV
Comments 16 pages, 11 figures
专题命中 视觉推理 :multimodal large language model(title);vision-language model(abstract);分类 cs.AI
Comments Accepted at CVPR Workshop NEXD 2025. 21 pages, Project: https://github.com/Lum1104/EIBench
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV
Comments Accepted to ICLR 2025 (Oral) | Project page: https://spatial-comfort.github.io/
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV
专题命中 视觉推理 :MLLM(title);multimodal large language model(abstract);分类 cs.CV
Comments Accepted to SCIA 2025
专题命中 视觉推理 :MLLM(title,abstract);分类 cs.CV
Comments Accepted at CVPR 2025
专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV
Comments 8 pages; Project page: https://yufan-ren.com/subpage/VGRP-Bench/
专题命中 视觉推理 :VLM(title);vision language model(abstract);分类 cs.AI
Comments Published as a conference paper at ICLR 2025
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV
Comments 10 pages of main text and 8 pages appendices
Journal ref The Thirteenth International Conference on Learning Representations (ICLR) 2025
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV
Comments Accepted by CVPR2025. Code and Dataset: https://github.com/LuFan31/CompreCap
专题命中 视觉推理 :visual language model(title);vision-language model(abstract);分类 cs.AI
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV
专题命中 视觉推理 :vision-language model(title);VLM(abstract);分类 cs.CV
Comments Code and model are available at http://github.com/hustvl/MaTVLM
专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV
Comments 19 pages, 10 figures, accepted by CVPR 2025
专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV