MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments Findings of EMNLP 2023 (Long paper)
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments Accepted to the Thirty-seventh Conference on Neural Information Processing Systems (NeurIPS 2023)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments NeurIPS 2023 Camera Ready
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV
Comments Accepted to ICCVW 2023
专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
Comments 18 pages,
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments Accepted as oral at ACM MultiMedia 2023 (Brave New Ideas track)
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
Journal ref EMNLP2022
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.LG
Comments Carnegie Mellon University Senior Thesis. arXiv admin note: substantial text overlap with arXiv:2212.10549
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments Technical report in WSDM Cup 2023
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments 12 pages, 7 figures
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments CIKM2022 camera ready version
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments 10 pages, 5 figures
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV
Comments Accepted by NeurIPS 2021
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments 9 pages
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.LG
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments Accepted by NeurIPS 2019
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments Published at ICCV'2019
Journal ref The IEEE International Conference on Computer Vision (ICCV) 2019
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments EMNLP 2019
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments ICCV 2019 accepted paper
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments 11 pages, 7 figures
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
答案保留型攻击下的模型置信度:信息性-可操纵性前沿
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract)
AI总结 该研究针对答案保留型攻击,发现视觉-语言系统的置信度信号不具备固有鲁棒性,四类防御均无效,协调攻击可大幅降低置信度门控下的接受准确率。
基于大语言模型的视觉编码器分层预训练
机构 * University of Cincinnati(辛辛那提大学) ; National Yang Ming Chiao Tung University(国立阳明交通大学)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出HIVE框架,通过引入视觉编码器与大语言模型间的分层交叉注意力机制,提升视觉语言对齐,改进特征融合与表征学习,实验表明其在图像分类和多模态任务中表现优异。
Comments 17 pages, 14 figures, accepted to Computer Vision and Pattern Recognition Conference (CVPR) Workshops 2026. 5th MMFM Workshop: What is Next in Multimodal Foundation Models?
Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (pp. 7415-7424) 2026
K12-KGraph:一种对齐课程的图谱用于基准测试和训练教育大语言模型
机构 * Peking University(北京大学) ; Institute for Advanced Algorithms Research(先进算法研究所) ; OriginHub Technology(OriginHub技术) ; Zhongguancun Academy(中关村学院)
专题命中 视觉问答 :vision-language model(abstract);grounding(abstract)
AI总结 本文提出K12-KGraph,基于中小学教材构建的课程对齐知识图谱,用于构建多选基准测试K12-Bench和训练数据集K12-Train,验证课程结构监督在教育模型训练中的高效性。