Grounded Language-Image Pre-training
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments CVPR 2022; updated visualizations; fixed hyper-parameters in Appendix C.1
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments CVPR 2022; updated visualizations; fixed hyper-parameters in Appendix C.1
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments CVPR 2022; Code is publicly available at: https://github.com/YehLi/xmodaler/tree/master/configs/image_caption/cosnet
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV
Comments Accepted by NeurIPS 2021
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments This paper is a longer version of "Deep Context-Encoding Network for Retinal Image Captioning" which is accepted by IEEE International Conference on Image Processing (ICIP), 2021
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV
Comments Accepted by CVPR2021 oral
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CL
Comments 10 pages, 4 figures
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CL
Comments Accepted to workshop "The How2 Challenge: New Tasks for Vision & Language" of International Conference on Machine Learning 2019
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CL
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments COLING 2018
机构 * University of California, Riverside(加州大学河滨分校)
专题命中 图文多模态 :multimodal(abstract,comments);分类 cs.CV、cs.CL、cs.AI
Comments To be presented as a poster at the Workshop on Safe and Trustworthy Multimodal AI Systems (SafeMM-AI), 2025
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI;multi-modal(comments)
Comments Accepted at The First Workshop of Evaluation of Multi-Modal Generation (EvalMG) in 31st International Conference on Computational Linguistics (COLING), 2025. 8 pages + references + 6 pages of Appendix
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI;multi-modal(comments)
Comments Accepted at "Multi-Modal Deep Learning: Challenges and Applications" (MMDLCA), International Conference on Pattern Recognition (ICPR)-2020, Milano, Italia
Journal ref Springer LNCS, volume 12666, 2021
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI;multimodal(comments);multimodal foundation model(comments)
Comments Accepted to CVPRW 2024 on 'What is Next in Multimodal Foundation Models?'. Code: https://github.com/ytaek-oh/vl_compo
CityRiSE:基于强化学习的大视觉语言模型城市社会经济地位推理框架
机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) ; Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本研究提出CityRiSE框架,结合强化学习与大视觉语言模型,提升城市社会经济感知的预测准确性与泛化能力,尤其在未见城市和指标上表现优异。
Comments Accepted by ACM MM 2026, https://github.com/tsinghua-fib-lab/CityRiSE
推理动态与监控模态依赖性的局限性
机构 * University of Copenhagen, Department of Computer Science(哥本哈根大学计算机科学系) ; University of Sheffield, School of Computer Science(谢菲尔德大学计算机科学学院)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 研究分析18种VLM的推理动态,发现模型易受早期预测影响,推理训练模型在模态条件下表现出更强的纠正行为,但其效果依赖于模态条件,且CoT的可检测性因模型而异。
Comments Accepted for publication in COLM 2026
从文本到视觉的可迁移性:视觉语言模型(VLM)的能力缩放定律与迁移动态
机构 * Meituan(美团) ; Tsinghua University(清华大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 该研究提出首个跨家族的能力驱动多模态缩放定律,可通过LLM文本能力预测VLM性能,将主干选择从经验搜索转为定量决策,还揭示了LLM作为VLM主干的相关见解。
裁决式字幕生成:用于严格零样本图像字幕生成的多智能体对齐评分与共识蒸馏束仲裁
机构 * AI Platform OneNexus, OneMount(OneMount AI平台OneNexus) ; School of Electronic Engineering, Soongsil University(崇实大学电子工程学院) ; MoAdata(MoAdata公司) ; University of Economics Ho Chi Minh City (UEH)(胡志明市经济大学)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 该研究提出裁决式字幕生成多智能体框架,通过多阶段对齐评分与共识蒸馏重排序,在不微调IFCap的情况下,显著提升COCO等数据集的零样本图像字幕生成性能,且可跨数据集迁移。
MinerU-Popo:结构化文档解析的通用后处理模型
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 提出MinerU-Popo轻量级通用后处理框架,通过分解为文本/表格截断恢复、标题层级重建和图文关联四个子任务,并利用动态分块和重叠同步将OCR页面级结果重构为文档级逻辑结构,显著提升标题层级TEDS和RAG准确性。
Comments The code is available at https://github.com/opendatalab/MinerU-Popo
用基于树图解析支持的加权班扎夫交互解释生物医学CLIP
机构 * University of Warsaw(华沙大学) ; Centre for Credible AI, Warsaw University of Technology(华沙理工大学可信人工智能中心)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 研究针对视觉语言模型在医学任务中解释难的问题,引入ParseFIxLIP方法,将树图解析融入班扎夫交互博弈,通过smart_depth分组策略减轻概念碎片化,提升跨模态交互可解释性,为VLM决策提供医学领域相关见解。
Comments 12 pages, 13 figures. Accepted at EXPLIMED 2026 (Third Workshop on Explainable Artificial Intelligence for the medical domain), IJCAI-ECAI 2026
自我监督比临床监督更能推动医学基础模型中的表征趋同
机构 * RWTH Aachen University(亚琛工业大学) ; University Hospital RWTH Aachen(亚琛工业大学附属医院) ; Technical University of Munich(慕尼黑工业大学) ; Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡弗里德里希-亚历山大大学) ; Technical University Dresden(德累斯顿工业大学) ; University Hospital Dresden(德累斯顿大学附属医院) ; University Hospital Heidelberg(海德堡大学附属医院)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 研究探讨医学基础模型中表征趋同问题,通过对多个编码器剖析发现自我监督比临床监督更能驱动收敛,虽收敛有限但线性分类器可跨编码器转移,表明医学成像收敛由预训练目标决定,为互操作性设计与验证提供依据。
通过真实照片生成面部-only反事实来衡量视觉语言模型中的社会偏见
机构 * School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) ; School of Information Science and Engineering, Ningbo University(宁波大学信息科学与工程学院) ; School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出通过真实照片生成面部-only反事实来评估视觉语言模型中的社会偏见,构建了FOCUS数据集和REFLECT基准,发现严格视觉控制下仍存在种族性别差异,强调了反事实审计和任务设计的重要性。
Comments 18 pages, 18 figures, and 3 tables
Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 39963-39987, 2026
穿越幻象:一种双路径代理框架用于鲁棒的误导图表问答
机构 * The Hong Kong University of Science and Technology(香港科技大学)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 本文提出ChartCynics双路径框架,通过分离感知与验证,利用诊断视觉路径和OCR驱动数据路径解决图表误导问题,提升模型鲁棒性。
Comments 10pages, 4 figures
XR-1:通过学习统一的视觉-运动表示实现多功能的视觉-语言-动作模型
机构 * Beijing Innovation Center of Humanoid Robotics, Beijing, China(北京人形机器人创新中心,北京,中国) ; School of Mechanical Engineering and Automation, Beihang University, Beijing, China(北京航空航天大学机械工程及自动化学院,北京,中国) ; State Key Laboratory of Virtual Reality Technology and Systems, SCSE, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,SCSE,北京航空航天大学,北京,中国) ; State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(多媒体信息处理国家重点实验室,计算机科学学院,北京大学,北京,中国)
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract)
AI总结 XR-1通过学习统一的视觉-运动表示,解决视觉-语言-动作模型在低级动作生成和跨数据源领域差距的挑战,提出三阶段训练方法并验证了其在多种机器人和任务上的优越性能。
Comments Accepted to ICML2026 as Oral
可解释的嵌入表示与距离解释器
机构 * Netherlands eScience Center(荷兰eScience中心) ; Center for Information Technology(信息科技中心) ; University of Groningen(格罗宁根大学)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出Distance Explainer,通过选择性遮蔽和距离排序的遮蔽过滤生成嵌入空间的局部后验解释,验证了其在跨模态嵌入中的有效性,提升了深度学习应用的透明度和可信度。
Comments 21 pages, 12 figures. Accepted to the 4th World Conference on eXplainable Artificial Intelligence. Method implementation: https://research-software-directory.org/software/distance-explainer
MEDLAYXPLAIN: 医学视觉语言模型中的专家-外行差距基准测试
机构 * Seoul National University(首尔大学) ; Seoul National University Hospital(首尔大学医院) ; Seoul National University College of Medicine(首尔大学医学院) ; Sungkyunkwan University School of Medicine(成均馆大学医学院)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 提出首个大规模医学外行语言生成基准MedLayXPlain,包含12万+区域级样本和三层UMLS本体,通过HOVER管道构建外行描述,并引入轻量级评估器MedLayEval,揭示当前医学VLM在外行可读性与临床精度间的系统性差距。
Comments 40 pages (10 pages main text, 30 pages appendix), 4 main figures, 33 vision-language models benchmarked
胸部X光片的视觉-语言模型并不总是需要图像
机构 * Pattern Recognition Lab, Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃尔朗根-纽伦堡大学模式识别实验室) ; Department of Diagnostic and Interventional Radiology, TUM University Clinic, School of Medicine and Health, Klinikum rechts der Isar, Technical University of Munich(慕尼黑工业大学医学院与健康学院伊萨尔河右岸医院诊断与介入放射学系) ; Lab for AI in Medicine, RWTH Aachen University(亚琛工业大学医学人工智能实验室) ; Department of Diagnostic and Interventional Radiology, University Hospital RWTH Aachen(亚琛工业大学医院诊断与介入放射学系)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文通过因果审计方法,发现许多医学视觉-语言模型在胸部X光片任务中依赖文本先验而非图像,纯文本模型与多模态模型性能接近,并提出了基于图像依赖性的评估框架。