arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-13 至 2026-05-13 共收录 13 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 13 篇

2602.02408 2026-05-13 cs.CV cs.AI 88%

ReasonEdit: Editing Vision-Language Models using Human Reasoning

ReasonEdit:通过人类推理编辑视觉语言模型

Jiaxing Qiu, Kaihua Hou, Roxana Daneshjou, Ahmed Alaa, Thomas Hartvigsen

机构 * University of Virginia(弗吉尼亚大学) University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 ReasonEdit通过引入人类推理机制,改进视觉语言模型的编辑能力,提升编辑泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11634 2026-05-13 cs.CV cs.AI 86%

Unlocking UML Class Diagram Understanding in Vision Language Models

解锁基于UML类图理解的视觉语言模型

Artem Naboichenko, René Peinl

机构 * Hof University of Applied Sciences(霍夫应用科学大学)

专题命中 视觉问答 :vision language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一个基于UML类图的视觉问答基准,构建了16000个图像-问题-答案三元组,并展示LoRA微调方法在视觉语言模型中的优越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24985 2026-05-13 cs.CV cs.AI cs.LG cs.RO 85%

DarkQA: Benchmarking Vision-Language Models on Visual-Primitive Question Answering in Low-Light Indoor Scenes

DarkQA:在低光室内场景中对视觉-原始问题进行问答的视觉语言模型基准测试

Yohan Park, Hyunwoo Ha, Wonjun Jo, Tae-Hyun Oh

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Pohang University of Science and Technology (POSTECH)(釜山科学技术大学)

专题命中 视觉问答 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 DarkQA针对低光环境下视觉语言模型的感知基本能力进行基准测试,通过多级低光条件评估,揭示模型在复杂任务中的局限性。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11782 2026-05-13 cs.CV 84%

Urban Risk-Aware Navigation via VQA-Based Event Maps for People with Low Vision

面向低视力人群的基于VQA的事件地图城市风险感知导航

Antoni Valls, Jordi Sanchez-Riera

机构 * Institut de Robòtica i Informàtica Industrial, CSIC-UPC(机器人与信息技术研究所,CSIC-UPC)

专题命中 视觉问答 :LLaVA(abstract,abstract_cn);vision-language model(abstract);visual question answering(abstract);multimodal large language model(abstract)

AI总结 本文提出基于视觉问答的事件地图框架,利用视觉语言模型进行行人场景描述和危险识别,通过三级查询结构实现细粒度场景理解,生成风险感知导航地图,验证多模态大语言模型在助视导航中的有效性。

Comments 10 pages, 6 figures, submitted to IEEE T-ITS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11439 2026-05-13 cs.CV cs.LG 82%

Instruct-ICL: Instruction-Guided In-Context Learning for Post-Disaster Damage Assessment

Instruct-ICL:基于指令的上下文学习用于灾后损害评估

Armin Zarbaft, Ehsan Karimi, Nhut Le, Maryam Rahnemoonfar

专题命中 视觉问答 :MLLM(abstract,abstract_cn);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出Instruct-ICL方法,通过指令引导的上下文学习提升预训练多模态大语言模型在灾后视觉问答中的可靠性,实验表明结合CoT推理能显著提高回答准确性。

Comments Accepted by the 2026 IEEE International Geoscience and Remote Sensing Symposium (IGARSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11301 2026-05-13 cs.AI cs.CL cs.CV 82%

LatentRouter: Can We Choose the Right Multimodal Model Before Seeing Its Answer?

LatentRouter: 在看到答案之前,我们能否选择合适的多模态模型?

Xueqi Cheng, Yushun Dong

机构 * Department of Computer Science(计算机科学系)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 LatentRouter通过多模态效用预测实现多模态大语言模型的路由,通过隐式通信和胶囊修正提升模型选择准确性,在MMR-Bench和VL-RouterBench实验中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13050 2026-05-13 cs.LG cs.AI cs.CL cs.CV cs.SD eess.AS 82%

Modality-Inconsistent Continual Learning of Multimodal Large Language Models

多模态大语言模型的模态不一致持续学习

Weiguo Pian, Shijian Deng, Shentong Mo, Mingrui Liu, Yunhui Guo, Yapeng Tian

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Carnegie Mellon University(卡内基梅隆大学) George Mason University(乔治·梅森大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出MICL,一种针对多模态大语言模型的持续学习场景,涉及不一致的模态和变化的任务类型。通过伪目标生成模块和基于指令的知识蒸馏,解决任务类型转移导致的遗忘问题,实验验证了方法的有效性。

Comments Accepted at Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10865 2026-05-13 cs.AI cs.CV cs.SE 73%

BenchCAD: A Comprehensive, Industry-Standard Benchmark for Programmatic CAD

BenchCAD: 一个全面的、行业标准的程序化CAD基准测试

Haozhe Zhang, Kaichen Liu, Miaomiao Chen, Lei Li, Shaojie Yang, Cheng Peng, Hanjie Chen

机构 * University of Virginia(弗吉尼亚大学) University of California, San Diego(加州大学圣地亚哥分校) Rice University(莱斯大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 BenchCAD通过视觉问答、代码问答、图像到代码生成和指令引导的代码编辑评估模型,发现当前系统在生成精确参数化CAD程序方面存在不足,需进一步改进工业应用能力。

Comments 9 page 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12497 2026-05-13 cs.CV 70%

From Web to Pixels: Bringing Agentic Search into Visual Perception

从网络到像素:将代理搜索引入视觉感知

Bokang Yang, Xinyi Sun, Kaituo Feng, Xingping Dong, Dongming Wu, Xiangyu Yue

机构 * Deep Research

专题命中 视觉问答 :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出感知深度研究,引入WebEye基准,通过代理搜索到像素的工作流程,解决隐藏目标身份并绑定到框、掩码或 grounded 答案,实验显示其在三个任务视图中表现最佳。

Comments Project page: https://pixel-searcher.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12074 2026-05-13 cs.CV 70%

BARISTA: A Multi-Task Egocentric Benchmark for Compositional Visual Understanding

BARISTA:一种多任务第一人称视角基准,用于组合视觉理解

Patrick Knab, Orgest Xhelili, Inis Buzi, Drago Andres Guggiana Nilo, Mohd Saquib Khan, Lorenz Kolb, Manuel Scherzer, Kerem Yildirir, Christian Bartelt, Philipp Johannes Schubert

机构 * Ramblr.ai Research(Ramblr.ai 研究院) Technical University of Clausthal(Clausthal 技术大学)

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV

AI总结 BARISTA通过185个真实世界咖啡制作视频,提供密集标注的数据集,涵盖全自动、手冲和胶囊式流程,用于评估场景理解中的多任务能力,揭示任务家族间强变化及无主导模型家族。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00400 2026-05-13 cs.AI 70%

KEPO: Knowledge-Enhanced Preference Optimization for Multimodal Reasoning with Applications to Medical VQA

KEPO:基于知识的偏好优化用于多模态推理及其在医学VQA中的应用

Fan Yang, Rui Meng, Trudi Di Qi, Ali Ezzati, Yuxin Wen

机构 * Chapman University(查普曼大学) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室) University of California, Irvine(加州大学伊文斯分校)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI

AI总结 KEPO通过质量门控的在线蒸馏和知识增强的探索策略,提升多模态推理任务的训练稳定性与推理一致性,优于强化学习和在线蒸馏基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11803 2026-05-13 cs.CV cs.AI 62%

OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models

OTT-Vid: 基于最优传输的视频大语言模型时间令牌压缩

Minseok Kang, Minhyeok Lee, Jungho Lee, Minjung Kim, Donghyeong Kim, Dayeon Lee, Heeseung Choi, Ig-jae Kim, Sangyoun Lee

机构 * Yonsei University(延世大学) LG Electronics(LG电子) KIST(韩国科学技术院)

专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 OTT-Vid通过结合空间修剪和最优传输,有效压缩视频令牌,保持高性能,实验显示在保留10%令牌的情况下,VQA和VTG性能分别达到95.8%和73.9%。

Comments 22pages, 9 figures. Code available at https://github.com/minseokii/OTT-Vid

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06371 2026-05-13 cs.CL cs.AI 57%

OASIS: A Multilingual and Multimodal Dataset for Culturally Grounded Spoken Visual QA

OASIS:一个多语言多模态数据集用于文化导向的语音视觉问答

Firoj Alam, Ali Ezzat Shahroor, Md. Arid Hasan, Zien Sheikh Ali, Hunzalah Hassan Bhatti, Mohamed Bayan Kmainasi, Shammur Absar Chowdhury, Basel Mousi, Fahim Dalvi, Nadir Durrani, Natasa Milic-Frayling

机构 * Qatar Computing Research Institute(卡塔尔计算研究 institute)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

AI总结 OASIS是一个多语言多模态数据集,涵盖图像、文本和语音,旨在评估模型在现实场景中的文化导向推理能力,包含0.92M真实图像和14.8M问答对。

Comments Multimodal Foundation Models, Large Language Models, Native, Multilingual, Language Diversity, Contextual Understanding, Culturally Informed

详情

展开后加载摘要…

URL PDF HTML 收藏