arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3115 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3115 篇

2607.07179 2026-07-09 cs.CV cs.LG 新提交 84%

Comparative Study of Domain-adapted VLMs for General Document Visual Question Answering

用于通用文档视觉问答的领域适应视觉语言模型的比较研究

Miguel Lopez-Duran, Elena Marrero, Julian Fierrez, Marta Robledo-Moreno, Ruben Vera-Rodriguez, Daniel DeAlcala, Aythami Morales, Ruben Tolosana, Oscar Delgado, Alvaro Ortigosa, Javier Ortega-Garcia

机构 * Universidad Autónoma de Madrid (UAM)(马德里自治大学) BiometricsAI(生物识别人工智能)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 研究对8个开源预训练VLMs在三种文档领域的DocVQA进行全面评估,通过多种评估方式发现其在不同布局性能有差异,参数缩放影响性能,视觉理解是瓶颈,还表明少样本微调能让模型快速适应目标域文档。

Comments 17 pages, 4 figures, accepted at the Automatically Domain-Adapted and Personalized Document Analysis workshop of the ICDAR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14926 2026-07-07 cs.CL cs.AI cs.LG 版本更新 84%

Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models

罗马尼亚视觉语言模型的参数高效多模态指令微调

George-Andrei Dima, Răzvan-Alexandru Smădu, Dumitru-Clementin Cercel

机构 * National University of Science and Technology(科学技术大学)

专题命中 视觉问答 :vision language model(title);LLaVA(abstract);visual question answering(abstract);分类 cs.AI、cs.LG

AI总结 针对罗马尼亚语这种低资源语言,通过翻译并扩展Flickr30K数据集,采用参数高效的LoRA方法微调开源视觉语言模型来降低多模态NLP资源差距,模型在视觉问答等任务中能力提升且语法错误减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01591 2026-06-02 cs.CV cs.LG 84%

TLG: Temporal-Logic Grounding for Video Question Answering via Source-Annotation Reconstruction and Category-Targeted Reasoning

TLG: 通过源标注重建和类别目标推理实现视频问答的时间逻辑基础

Ali Alavi

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 视觉问答 :grounding(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 提出TLG三阶段系统,通过重建动作时间线、解析问题为时间逻辑程序并确定性执行,结合强视觉语言模型和前沿推理模型,将视频问答准确率从46.9%提升至71.37%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24792 2026-05-26 cs.CV cs.AI 84%

Parameter-Efficient VLMs for Gastrointestinal Endoscopy: Medical Image Generation and Clinical Visual Question Answering

用于胃肠内窥镜的参数高效视觉语言模型:医学图像生成与临床视觉问答

Ojonugwa Oluwafemi Ejiga Peter, Frederick Akor Ejiga, Fahmi Khalifa, Md Mahmudur Rahman

机构 * Computer Science Department, Morgan State University(莫尔甘州大学计算机科学系) International Organization for Migration (IOM)(国际移民组织) Electrical & Computer Engineering Department, Morgan State University(莫尔甘州大学电气与计算机工程系)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出双流水线参数高效微调模型,结合Florence-2和LoRA Stable Diffusion,分别解决临床视觉问答和隐私保护合成数据生成问题,在Kvasir-VQA数据集上取得高ROUGE和BLEU分数,并显著降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21479 2026-05-21 cs.CV cs.AI 84%

WikiVQABench: A Knowledge-Grounded Visual Question Answering Benchmark from Wikipedia and Wikidata

WikiVQABench: 一个基于维基百科和维基数据的知识引导视觉问答基准

Basel Shbita, Pengyuan Li, Anna Lisa Gentile

机构 * IBM Research San Jose(IBM桑 Jose研究实验室)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出WikiVQABench,一个结合维基百科图片、文章描述和维基数据结构化知识的知识引导视觉问答基准,通过大规模语言模型生成候选多选题,并由人工审核确保事实正确性和视觉-文本一致性,评估多种视觉-语言模型在知识密集型推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17140 2026-05-21 cs.CV cs.AI cs.CL 84%

UCSF-PDGM-VQA: Visual Question Answering dataset for brain tumor MRI interpretation

UCSF-PDGM-VQA: 用于脑肿瘤MRI解读的视觉问答数据集

Shiv Ghosh, Junayd Lateef, Chih-Hua Liu, Yannan Yu, Andreas M. Rauschecker, Madhumita Sushil

机构 * Fung Institute for Engineering Leadership(工程领导力基金会) University of California, Berkeley(加州大学伯克利分校) Department of Radiology(放射科) University of California, San Francisco(加州大学旧金山分校) Division of Clinical Informatics and Digital Transformation(临床信息学与数字转型部) Department of Neurological Surgery(神经外科部)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一个临床相关的视觉问答基准数据集UCSF-PDGM-VQA,包含2387个问题-答案对,用于评估视觉语言模型在处理多序列3D MRI扫描中的能力,发现现有模型在多模态处理上存在缺陷。

Comments 10 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06058 2026-05-08 cs.LG cs.CV 84%

Towards Self-Explainable Document Visual Question Answering with Chain-of-Explanation Predictions

迈向具有解释链预测的自解释文档视觉问答

Kjetil Indrehus, Adrian Duric, Changkyu Choi, Ali Ramezani-Kebrya

机构 * Department of Informatics, University of Oslo(奥斯陆大学信息学院) Integreat – Norwegian Centre for Knowledge-driven Machine Learning(挪威知识驱动机器学习中心) TRUST – The Norwegian Centre for Trustworthy AI(挪威可信人工智能中心)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出CoExVQA框架,通过解释链设计实现文档视觉问答的自解释,通过证据识别、答案定位和基于证据解码三步流程提升可解释性,实验显示在PFL-DocVQA上取得SotA性能,ANLS提升12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25122 2026-04-29 cs.CV cs.AI 84%

M$^3$-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering

M$^3$-VQA:多模态、多实体、多跳视觉问答的基准测试

Jiatong Ma, Longteng Guo, Yuchen Liu, Zijia Zhao, Dongze Hao, Xuanxu Lin, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 M$^3$-VQA引入了多实体问题,要求模型在多个文档间进行顺序和并行多跳推理,揭示了多模态大语言模型在知识获取和推理方面的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00798 2026-04-23 cs.CV cs.AI 84%

Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering

逐步多模态搜索与推理用于知识密集型视觉问答

Changin Choi, Wonseok Lee, Jungmin Ko, Wonjong Rhee

机构 * Interdisciplinary Program in Artificial Intelligence(人工智能交叉学科项目) Department of Intelligence and Information(智能与信息系) Samsung Advanced Institute of Technology(三星先进技术研究院)

专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PMSR框架,通过逐步构建结构化推理轨迹提升知识获取与综合能力,实验显示在六个基准测试中提升了检索召回率和端到端回答准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24942 2026-04-21 cs.LG cs.AI cs.CL 84%

Finding Culture-Sensitive Neurons in Vision-Language Models

在视觉-语言模型中寻找文化敏感神经元

Xiutian Zhao, Rochelle Choenni, Rohit Saxena, Ivan Titov

机构 * University of Edinburgh(爱丁堡大学) University of Amsterdam(阿姆斯特丹大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.AI、cs.LG

AI总结 研究视觉-语言模型处理文化相关信息的神经元特性,通过CVQA基准验证文化敏感神经元的存在及其分布,提出ConAct方法提升识别效果。

Comments Accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14866 2026-04-17 cs.CV cs.AI 84%

MetaDent: Labeling Clinical Images for Vision-Language Models in Dentistry

MetaDent: 临床图像标注用于牙科领域视觉-语言模型

Meng-Xun Li, Wen-Hui Deng, Zhi-Xing Wu, Chun-Xiao Jin, Jia-Min Wu, Yue Han, James Kit Hon Tsoi, Gui-Song Xia, Cui Huang

机构 * School of Computer Science, Wuhan University, Wuhan, Hubei, China(计算机科学学院,武汉大学,武汉,湖北,中国)

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MetaDent,通过大规模牙科图像数据集、半结构化标注框架和综合基准测试,解决牙科内窥镜图像分析中缺乏细粒度标注的问题,验证了VLMs在临床图像理解中的性能局限。

Comments Project website: https://menxli.github.io/metadent

Journal ref Journal of Dental Research, p.00220345261424242 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22683 2026-04-10 cs.CV cs.AI 84%

SUPERGLASSES: Benchmarking Vision Language Models as Intelligent Agents for AI Smart Glasses

SUPERGLASSES:基于智能眼镜的视觉语言模型智能体基准测试

Zhuohang Jiang, Xu Yuan, Haohao Qu, Shanru Lin, Kanglong Liu, Wenqi Fan, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉问答 :vision language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SUPERGLASSES基准,通过真实世界数据评估智能眼镜的多模态交互能力,提出SUPERLENS模型在VQA任务中超越GPT-4o,揭示了任务特定解决方案的重要性。

Journal ref 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition- FINDINGS Track (CVPRF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01966 2026-04-03 cs.CV cs.AI cs.RO 84%

Ego-Grounding for Personalized Question-Answering in Egocentric Videos

面向第一视角视频的个性化问答中的自我定位

Junbin Xiao, Shenglang Zhang, Pengxiang Zhu, Angela Yao

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 视觉问答 :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MyEgo数据集,用于评估多模态大语言模型在需要自我定位的个性化问答中的能力,发现现有模型在自我记忆和推理方面存在显著不足。

Comments To appear at CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27942 2026-04-01 cs.CV cs.AI 84%

JaWildText: A Benchmark for Vision-Language Models on Japanese Scene Text Understanding

JaWildText:面向日文场景文本理解的视觉-语言模型基准测试

Koki Maeda, Naoaki Okazaki

机构 * Institute of Science Tokyo, Tokyo, Japan(东京科学大学,日本东京) Research and Development Center for Large Language Models, National Institute of Informatics, Tokyo, Japan(国立信息学研究所大型语言模型研发中心,日本东京)

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出JaWildText基准测试,针对日文场景文本理解中的多脚本、垂直书写和字符多样性问题,包含3241个实例和112万字符标注,涵盖STVQA、KIE和手写OCR三个任务,评估14种VLM模型,发现最佳模型在三个任务上的平均得分为0.64。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22715 2026-04-01 cs.CV cs.AI cs.CL cs.MM 84%

ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering

ReAG:基于推理的生成用于基于知识的视觉问答

Alberto Compagnoni, Marco Morini, Sara Sarto, Federico Cocchi, Davide Caffagni, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳大学和雷焦艾米利亚大学) University of Pisa(比萨大学)

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 ReAG通过结合粗粒度和细粒度检索及批评模型过滤无关信息,提升知识密集型视觉问答的准确性和可解释性。

Comments CVPR 2026 - Project page: https://aimagelab.github.io/ReAG/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15695 2026-04-01 cs.CV cs.LG 84%

ORIC: Benchmarking Object Recognition under Contextual Incongruity in Large Vision-Language Models

ORIC:在大视觉-语言模型中基于情境不一致性的物体识别基准测试

Zhaoyang Li, Zhan Ling, Yuchen Zhou, Litian Gong, Erdem Bıyık, Hao Su

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校) University of California, Riverside(加利福尼亚大学河滨分校) University of Southern California(南加利福尼亚大学)

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.LG

AI总结 研究探讨了大视觉-语言模型在非典型场景中识别物体的困难,提出ORIC框架通过两种策略生成不一致的物体-情境对,并验证了情境不一致是不确定性的重要来源。

Comments We request withdrawal of this paper because one of the listed institutional affiliations was included without proper authorization. This issue cannot be resolved through a simple revision, and we therefore request withdrawal to prevent dissemination of incorrect or unauthorized affiliation information

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17396 2026-03-31 cs.CV cs.AI cs.CL 84%

RadImageNet-VQA: A Large-Scale CT and MRI Dataset for Radiologic Visual Question Answering

RadImageNet-VQA:一个大规模的CT和MRI数据集用于放射学视觉问答

Léo Butsanets, Charles Corbière, Julien Khlaut, Pierre Manceron, Corentin Dancette

机构 * Raidium Université de Paris Cité, Hôpital Européen Georges Pompidou, AP-HP(巴黎西岱大学,乔治·蓬皮杜欧洲医院,AP-HP) Department of Vascular and Oncological Interventional Radiology, INSERM(血管与肿瘤介入放射学系,法国国家健康与医学研究院)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出RadImageNet-VQA数据集,包含750万张图像和750万个问题-答案对,涵盖异常检测、解剖识别和病理识别三大任务,验证了视觉语言模型在细粒度病理识别上的局限性。

Comments Preprint, 33 pages, 15 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25155 2026-03-27 cs.CV cs.AI 84%

Photon: Speedup Volume Understanding with Efficient Multimodal Large Language Models

Photon:通过高效多模态大语言模型加速体积理解

Chengyu Fang, Heng Guo, Zheng Jiang, Chunming He, Xiu Li, Minfeng Xu

机构 * Tsinghua University(清华大学) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) Hupan Lab(湖畔实验室) Duke University(杜克大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 Photon通过高效多模态大语言模型实现3D医学影像的体积理解,采用自适应令牌调度和梯度传播技术降低计算成本,提升模型可靠性与效率。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21701 2026-03-24 cs.CV cs.AI 84%

Rethinking Token Reduction for Large Vision-Language Models

重新思考大型视觉-语言模型中的标记缩减

Yi Wang, Haofei Zhang, Qihan Huang, Anda Cao, Gongfan Fang, Wei Wang, Xuan Jin, Jie Song, Mingli Song, Xinchao Wang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院) School of Software Technology, Zhejiang University(浙江大学软件学院) National University of Singapore(新加坡国立大学) Alibaba Group(阿里巴巴集团)

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MetaCompress,一种基于学习的无提示方法,解决多轮视觉问答中标记缩减的挑战,通过统一压缩映射提升效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05197 2026-03-17 cs.AI cs.CL cs.CV 84%

QA-Dragon: Query-Aware Dynamic RAG System for Knowledge-Intensive Visual Question Answering

QA-Dragon:面向知识密集型视觉问答的查询感知动态RAG系统

Zhuohang Jiang, Pangjing Wu, Xu Yuan, Wenqi Fan, Qing Li

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 QA-Dragon通过引入领域路由器和搜索路由器,实现多模态、多轮和多跳推理,提升复杂视觉问答任务的推理性能,实验显示其在单源、多源和多轮任务中均优于基线模型。

Comments The source code for our system is released in https://github.com/jzzzzh/QA-Dragon

Journal ref 2025 KDD Cup Workshop for Multimodal Retrieval Augmented Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13878 2026-03-17 cs.CV cs.AI cs.CL 84%

Step-CoT: Stepwise Visual Chain-of-Thought for Medical Visual Question Answering

步级推理:面向医学视觉问答的逐步视觉推理

Lin Fan, Yafei Ou, Zhipeng Deng, Pengyu Dai, Hou Chongxian, Jiale Yan, Yaqian Li, Kaiwen Long, Xun Gong, Masayuki Ikebe, Yefeng Zheng

专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Step-CoT,通过结构化多步推理提升医学视觉问答的准确性和可解释性,引入专家 curated 的医疗诊断流程对齐的推理数据集和动态图结构聚焦机制。

Comments Accepted by CVPR 2026 Finding Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09689 2026-03-12 cs.CV cs.AI 84%

AutoViVQA: A Large-Scale Automatically Constructed Dataset for Vietnamese Visual Question Answering

AutoViVQA:一个大规模自动构建的数据集用于越南语视觉问答

Nguyen Anh Tuong, Phan Ba Duc, Nguyen Trung Quoc, Tran Dac Thinh, Dang Duy Lan, Nguyen Quoc Thinh, Tung Le

机构 * Faculty of Information Technology, University of Science, VNU-HCM(越南国家大学胡志明市分校信息科技学院) Vietnam National University, Ho Chi Minh City(越南国家大学胡志明市分校)

专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AutoViVQA数据集,利用变压器架构进行越南语视觉问答,结合文本和视觉预训练,并在多语言环境下系统比较自动评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07868 2026-03-10 cs.AI cs.LG 84%

Hospitality-VQA: Decision-Oriented Informativeness Evaluation for Vision-Language Models

Hospitality-VQA: 为视觉-语言模型的决策导向信息评估

Jeongwoo Lee, Baek Duhyeong, Eungyeol Han, Soyeon Shin, Gukin han, Seungduk Kim, Jaehyun Jeon, Taewoo Jeong

机构 * Yonsei University(延世大学) Yanolja NEXT

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出Hospitality-VQA,通过构建专门针对旅游业的VQA数据集,评估视觉-语言模型在决策导向场景中的信息评估能力,并发现需通过领域微调提升其决策意识。

Comments Accepted at EACL 2026 SRW. 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25541 2026-03-05 cs.CV cs.AI 84%

Vision-Zero: Scalable VLM Self-Improvement via Strategic Gamified Self-Play

Vision-Zero: 通过战略化游戏化自play实现可扩展的VLM自改进

Qinsi Wang, Bo Liu, Tianyi Zhou, Jing Shi, Yueqian Lin, Yiran Chen, Hai Helen Li, Kun Wan, Wentian Zhao

专题命中 视觉问答 :VLM(title);vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Vision-Zero通过战略化游戏化自play框架,实现无标注数据下的多模态模型自改进,提升推理与跨领域任务性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21864 2026-02-26 cs.CV cs.AI cs.CL cs.GR 84%

DynamicGTR: Leveraging Graph Topology Representation Preferences to Boost VLM Capabilities on Graph QAs

DynamicGTR: 利用图拓扑表示偏好提升视觉语言模型在图问答中的能力

Yanbin Wei, Jiangyue Yan, Chun Kang, Yang Chen, Hua Liu, James Kwok, Yu Zhang

机构 * Southern University of Science and Technology(南方科技大学) Hong Kong University of Science and Technology(香港理工大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Beihang University(北京航空航天大学)

专题命中 视觉问答 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 DynamicGTR通过动态选择最优图拓扑表示,提升视觉语言模型在图问答中的零样本性能及跨任务迁移能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15915 2026-02-19 cs.CV cs.AI 84%

MaS-VQA: A Mask-and-Select Framework for Knowledge-Based Visual Question Answering

MaS-VQA: 一种基于掩码和选择的基于知识的视觉问答框架

Xianwei Mao, Kai Ye, Sheng Zhou, Nan Zhang, Haikuan Huang, Bin Li, Jiajun Bu

机构 * Zhejiang University, Hangzhou, China(浙江大学, 杭州, 中国) Alibaba Group, Hangzhou, China(阿里巴巴集团, 杭州, 中国)

专题命中 视觉问答 :visual question answering(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 MaS-VQA通过结合显式知识过滤与隐式知识推理,提升基于知识的视觉问答任务的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00269 2026-02-03 cs.CV cs.AI 84%

FaithSCAN: Model-Driven Single-Pass Hallucination Detection for Faithful Visual Question Answering

FaithSCAN: 基于模型的单次幻觉检测用于可靠的视觉问答

Chaodong Tong, Qi Zhang, Chen Li, Lei Jiang, Yanbing Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences (CAS) and the School of Cyber Security, University of CAS(信息工程研究所、中国科学院(CAS)和安全学院、CAS大学)

专题命中 视觉问答 :visual question answering(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 FaithSCAN通过利用VLMs的内部信号实现高效准确的视觉问答幻觉检测,克服现有方法的效率与鲁棒性限制。

Comments 21 pages, 13 figures, 8 tables. Submitted to IEEE Transactions on Big Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22398 2026-02-02 cs.CV cs.AI 84%

Jailbreaks on Vision Language Model via Multimodal Reasoning

通过多模态推理实现对视觉语言模型的逃逸攻击

Aarush Noheria, Yuguang Yao

机构 * Novi High School, MI, USA(诺维高中) Michigan State University, MI, USA(密歇根州立大学)

专题命中 视觉问答 :vision language model(title);vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种基于多模态推理的逃逸攻击框架,通过训练后链式推理和自适应噪声机制提高对视觉语言模型的安全过滤器的绕过能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17383 2026-01-27 cs.CV cs.AI 84%

Physical Prompt Injection Attacks on Large Vision-Language Models

针对大视觉-语言模型的物理提示注入攻击

Chen Ling, Kai Hu, Hangcheng Liu, Xingshuo Han, Tianwei Zhang, Changhai Ou

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院)

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出了一种无需访问模型或输入的物理提示注入攻击方法,通过物理物体注入恶意指令,成功攻击多种大视觉-语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12424 2025-12-16 cs.CV cs.LG 84%

ViInfographicVQA: A Benchmark for Single and Multi-image Visual Question Answering on Vietnamese Infographics

ViInfographicVQA:单图和多图越南信息图视觉问答基准测试

Tue-Thu Van-Dinh, Hoang-Duy Tran, Truong-Binh Duong, Mai-Hanh Pham, Binh-Nam Le-Nguyen, Quoc-Thai Nguyen

机构 * Neu.edu.vn

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 ViInfographicVQA是首个针对越南信息图VQA的基准测试,通过单图和多图任务评估模型在复杂信息图中的视觉问答能力。

Comments 10 pages, 4 figures, Accepted to AI4Research @ AAAI

详情

展开后加载摘要…

URL PDF HTML 收藏