Modality Bias in LVLMs: Analyzing and Mitigating Object Hallucination via Attention Lens
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
机构 * The University of Queensland(昆士兰大学) ; University of California, Merced(加州大学默塞德分校)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments Work in progress
机构 * FAIR, Meta(FAIR与Meta公司) ; MIT(麻省理工学院) ; Princeton University(普林斯顿大学) ; New York University(纽约大学)
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments 10 pages
机构 * School of Biomedical Engineering and Imaging Sciences, King’s College London, London, UK(生物医学工程与成像科学学院,伦敦国王学院,伦敦,英国) ; deepc GMBH, Munich, Germany(deepc 德国慕尼黑分公司)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
机构 * Beijing Digital Native Digital City Research Center(北京数字原生数字城市研究中心) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments Accepted by ICME2025
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
机构 * Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理关键实验室,复旦大学计算机学院) ; Shanghai Collaborative Innovation Center on Intelligent Visual Computing(上海智能视觉计算协同创新中心) ; Singapore Management University(新加坡管理大学)
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments ICCV 2025
机构 * McGill University(麦吉尔大学) ; Tsinghua University(清华大学) ; Xiaomi Corporation(小米公司) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; University of Minnesota–Twin Cities(明尼苏达大学双城分校) ; State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(智能绿色车辆与移动国家重点实验室,清华大学)
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
机构 * University of Electronic Science and Technology of China(电子科技大学) ; University of Technology Sydney(技术学院) ; Tongji University(同济大学)
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
机构 * Department of Radiation Oncology, Winship Cancer Institute, Emory University School of Medicine(放射肿瘤科,Winship癌症研究所,埃默里大学医学院) ; Department of Biomedical Engineering, College of Engineering, Georgia Institute of Technology(生物医学工程系,工程学院,佐治亚理工学院) ; Department of Computer Science and Mathematics, Laney Graduate School, Emory University(计算机科学与数学系,兰尼研究生院,埃默里大学) ; School of Electrical and Computer Engineering, College of Engineering, Georgia Institute of Technology(电气与计算机工程系,工程学院,佐治亚理工学院)
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CL、cs.AI
机构 * Google DeepMind(谷歌DeepMind) ; Google Research(谷歌研究) ; University of Cambridge(剑桥大学)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI
机构 * University of Notre Dame(诺丁汉大学) ; Tencent AI Seattle Lab(腾讯AI西雅图实验室) ; UIUC(伊利诺伊大学香槟分校)
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL
Comments Our code is available at https://github.com/tencent-ailab/Leopard
机构 * Australian Artificial Intelligence Institute(澳大利亚人工智能研究所)
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CL、cs.AI
机构 * First Author Affiliation(第一作者机构) ; Second Author Affiliation(第二作者机构)
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments Accepted at ICML 2025
机构 * Tencent(腾讯)
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI
Comments Accepted by ICIPCA 2025
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments Accepted to CVPR 2025; Code: https://github.com/yshinya6/clip-refine
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments Accepted CVPR 2025 Workshop on Distillation of Foundation Models for Autonomous Driving
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments Technical Report
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments Under review
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments 11 pages, 8 figures, 3 tables