arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2472 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 231 篇

2606.19776 2026-06-19 cs.CV 新提交 93%

Occ-VLM: Occupancy Grounded Vision Language Model for Indoor Scene Understanding

Occ-VLM: 面向室内场景理解的占用接地视觉语言模型

Jianing Li, Zhou Fang, Yijiang Liu, Li Du

机构 * School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院)

专题命中 视觉问答 :VLM(title,title_cn);vision language model(title);vision-language model(abstract);visual question answering(abstract)

AI总结 提出Occ-VLM,仅用姿态RGB图像和单一2D视觉编码器,通过重建3D占用作为几何先验,实现统一的3D场景理解,在占用预测、3D VQA和密集描述任务上达到领先水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07861 2026-08-11 cs.CV cs.HC cs.IR cs.MM 新提交 92%

How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems

回答我的问题需要多少成本?基于云VLM的VQA系统基准测试

Henri Vanhuynegem, Weitao Xu, Yiran Shen, Guohao Lan

专题命中 视觉问答 :VLM(title,title_cn);vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本研究推出首个将客户端输入预处理作为受控变量的VQABench基准,评估12种预处理技术在3个VQA数据集、4个商业VLMs上的95168次API调用,明确预处理对云VLM-based VQA的成本-质量影响,为VQA系统部署提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15861 2026-06-16 cs.CV 新提交 92%

Object Tokens as a Bridge Between Segmentation and Visual Question Answering in Robotic Surgery

对象标记作为机器人手术中分割与视觉问答的桥梁

Yiping Li, Ronald de Jong, Romy van Jaarsveld, Franco Badaloni, Gino Kuiper, Jelle Ruurda, Josien Pluim, Marcel Breeuwer

机构 * Department of Biomedical Engineering, Eindhoven University of Technology(埃因霍温理工大学生物医学工程系) Department of Electrical Engineering, Eindhoven University of Technology(埃因霍温理工大学电气工程系) Department of Surgery, University Medical Center Utrecht(乌得勒支大学医学中心外科)

专题命中 视觉问答 :VLM(summary_cn,abstract);visual question answering(title,abstract);vision-language model(abstract);visual reasoning(abstract)

AI总结 提出统一框架,联合像素级分割与视觉问答,通过VLM生成对象标记引导答案预测和分割掩码,在RAMIE和EndoVis18数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03733 2026-08-05 cs.AI 新提交 90%

Failure-Informed Image Self-Augmentation for Multimodal Large Language Model Self-Improvement

面向多模态大语言模型自我改进的故障感知图像自增强

Chunyang Jiang, Pingping Zhang, Yuzhi Zhao, Wenao Ma, Zhijian Hou, Mengyang Wu, Yiyang Cai, Senkang Hu, Sitong Cheng, Chi-Min Chan, Wei Xue, Yike Guo

专题命中 视觉问答 :MLLM(summary_cn,abstract);multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.AI

AI总结 提出FISA框架,基于MLLM失败案例生成保留答案的增强图像,经自检验与双重保真过滤后,可提升视觉问答性能,且兼容文本自增强、数据效率更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02300 2026-08-04 cs.CV 新提交 90%

A General-Purpose VLM Can Teach an Astronomy Foundation Model to Better Recognize Galaxy Morphology

通用视觉语言模型(VLM)可指导天文基础模型更好地识别星系形态

Dichang Zhang, Jiaqi Deng, Yixuan Shao, Yuanpeng Liu, Jiali Cui, Zhiqiang Lao, Heather Yu, Liang Peng, Simon Birrer, Dimitris Samaras

机构 * Stony Brook University(石溪大学) University of Technology Sydney(悉尼科技大学) Futurewei Technologies(华为主机技术公司)

专题命中 视觉问答 :VLM(title,title_cn);分类 cs.CV

AI总结 该研究提出用通用视觉语言模型(VLM)作为弱监督教师,指导天文基础模型Zoobot提升星系形态识别性能,可高效适配未来大型天文巡天任务。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25343 2026-06-29 cs.CV 新提交 90%

Invoice Haystack: Benchmarking Document Retrieval and Visual Question Answering Under Strong Visual Homogeneity

发票草垛:强视觉同质性下的文档检索与视觉问答基准测试

Heethanjan Kanagalingam, Thenukan Pathmanathan, Mokeeshan Vathanakumar, Basim Azam, Sarah Monazam Erfani, Naveed Akhtar

机构 * The University of Melbourne(墨尔本大学) Lakehead University(湖首大学)

专题命中 视觉问答 :VLM(summary_cn,abstract);visual question answering(title,abstract);vision language model(abstract);分类 cs.CV

AI总结 针对视觉同质文档集合中的检索困难,提出Invoice Haystack基准和VL-RAG混合检索框架,通过文本与视觉嵌入融合及VLM验证过滤,显著提升检索准确率。

Comments Accepted to presentation at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24115 2026-06-24 cs.CV cs.AI 新提交 90%

A Benchmark for Hallucination Detection in VLMs for Gastrointestinal Endoscopy

胃肠内窥镜中视觉语言模型幻觉检测的基准测试

Aminu Lawal, Niyoj Oli, Sachin Acharya, Prashnna Gyawali, Maria Carmen Romano, Binod Bhattarai

机构 * University of Aberdeen(阿伯丁大学) Nepal Applied Mathematics and Informatics Institute for Research(尼泊尔应用数学与信息学研究所) West Virginia University(西弗吉尼亚大学)

专题命中 视觉问答 :VLM(summary_cn,abstract);LLaVA(abstract,abstract_cn);vision-language model(abstract);visual question answering(abstract)

AI总结 针对胃肠内窥镜领域,在Gut-VLM数据集上基准测试九种幻觉检测方法,发现白盒方法ReXTrust在所有五个视觉语言模型上AUC最高,平均领先19.5点。

Comments Accepted at the Medical Image Understanding and Analysis (MIUA) 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09333 2026-08-11 cs.RO 新提交 89%

DH-VLM: Dual-Horizon Cooperative Latent Reasoning for Autonomous Driving

DH-VLM:面向自动驾驶的双时域协同隐层推理框架

Ziyi Song, Chen Xia, Hang Yu, Sheng Zhou, Zhisheng Niu

机构 * Tsinghua University(清华大学)

专题命中 视觉问答 :VLM(title,title_cn)

AI总结 本文提出DH-VLM双时域协同隐层推理框架,结合基础设施与自车实现非对称语义协同,构建协同QA数据集支撑推理,在规划性能、通信成本等指标上优于现有方法,为协同自动驾驶提供实用鲁棒范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21197 2026-06-23 cs.CV cs.AI cs.LG 新提交 89%

Extraction and Analysis of Multimodal Concepts in Vision Language Models through Sparse Autoencoders

通过稀疏自编码器提取和分析视觉语言模型中的多模态概念

Sergio Lanza, Jae Hee Lee, Stefan Wermter

机构 * Knowledge Technology, Department of Informatics, University of Hamburg(汉堡大学信息学系知识技术实验室)

专题命中 视觉问答 :vision language model(title,abstract);LLaVA(abstract,abstract_cn);VLM(abstract_cn);visual question answering(abstract)

AI总结 提出基于稀疏自编码器的框架,从视觉语言模型中提取视觉、文本和多模态概念,通过余弦相似度评估概念与样本的对齐,在VQA数据集上提升视觉概念质量达45%。

Comments International Conference on Artificial Neural Networks (ICANN), 2026, Padua

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12928 2026-08-14 cs.AI 新提交 89%

Polish Medical Visual Question Answering: Vision-Language Models Underutilize Visual Evidence

波兰医学视觉问答:视觉语言模型未充分利用视觉证据

Jakub Pokrywka, Łukasz Grzybowski, Antoni Lasik, Marek Kubis, Jeremi Ignacy Kaczmarek, Wojciech Kusa

机构 * ARAAI Poland(波兰ARAAI) NASK National Research Institute(NASK国家研究院) Poznań University of Medical Sciences(波兹南医科大学) T. Marciniak Lower Silesian Specialist Hospital(T.马尔奇尼亚克下西里西亚专科医院) Adam Mickiewicz University(亚当·密茨凯维奇大学)

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(title,abstract);grounding(abstract);分类 cs.AI

AI总结 该研究构建了波兰医学VQA基准,评估多类视觉语言模型,发现模型未充分利用视觉证据,仅从文本或答案选项即可达到高于随机水平的准确率,仅GPT-5.6在部分子集上超人类表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12671 2026-06-12 cs.CV 新提交 89%

SalArt-VQA: Diagnosing Whether VLMs Understand Salient Artifacts in Generated Images

SalArt-VQA: 诊断VLM是否理解生成图像中的显著伪影

Xiaoxiao Sun, Ruotian Zhang, Junzhe Huang, James Burgess, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学) Zhejiang University(浙江大学) The University of Queensland(昆士兰大学)

专题命中 视觉问答 :VLM(title_cn,summary_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出SalArt-VQA基准,通过950张图像和3681道多选题,从检测、定位、空间基础、缺陷识别四方面评估VLM对生成图像伪影的理解,揭示高检测准确率下隐藏的失败模式。

Comments 23 pages, 7 figures, 7 tables. Dataset: https://huggingface.co/datasets/salartvqa/SalArt-VQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27304 2026-07-31 cs.LG cs.CV 新提交 89%

Position, Not Provenance: Separating Reasoning Mediation from Sycophancy in Medical Vision-Language Models

位置,而非来源:在医学视觉-语言模型中分离推理中介与逢迎行为

Supratik Bhowal, Subhrajyoti Basu, Aritra Gir Mahanta, Anik Pal Chowdhury

机构 * IEM Kolkata(印度工程管理学院 Kolkata校区) School of UEMK Kolkata(UEMK Kolkata学院) Heritage Institute of Technology Kolkata(加尔各答遗产技术学院) Indian Institute of Information Technology, Kalyani(卡利亚尼印度信息技术学院)

专题命中 视觉问答 :LLaVA(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本研究提出CoT-Mediate框架,结合双臂协议与来源控制干预,在VQA-RAD数据集上评估LLaVA-Med和MedGemma,发现上下文位置而非声明来源是医学VLMs使用生成推理的主要决定因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10819 2026-06-10 cs.CV cs.AI 新提交 89%

Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks

Earth-OneVision:将遥感多模态大语言模型扩展到更多传感器模态和任务

Miaoxin Cai, Guanqun Wang, Wei Zhang, Guangyao Zhou, Yin Zhuang, Tong Zhang, Hao Wang, He Chen, Jun Li

机构 * National Key Laboratory of Science and Technology on Space-Born Intelligent Information Processing (SBIIP), Beijing Institute of Technology(北京理工大学空间智能信息处理国家重点实验室) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) Key Laboratory of Technology in Geo-Spatial Information Processing and Application System, Chinese Academy of Sciences(中国科学院地理空间信息处理与应用系统技术重点实验室) Advanced Research Institute of Multidisciplinary Sciences, Beijing Institute of Technology(北京理工大学前沿交叉科学研究院) School of Mechatronical Engineering, Beijing Institute of Technology(北京理工大学机电学院) School of Earth and Space Sciences, Peking University(北京大学地球与空间科学学院) School of Electronics, Peking University(北京大学电子学院) School of Computer Science and Hubei Key Laboratory of Intelligent Geo-Information Processing(华中科技大学计算机科学与技术学院&湖北省智能地理信息处理重点实验室)

专题命中 视觉问答 :MLLM(summary_cn,abstract);multimodal large language model(title);grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出Earth-OneVision,一个2B参数的RS-MLLM,通过全粒度视觉语言对齐、空间语言同构序列化和渐进式跨模态适应机制,统一六种传感器模态和九类任务,在多个基准上达到或超越4B-72B模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09142 2026-06-09 cs.CV cs.AI 新提交 89%

Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models

通过视觉语言模型从自我中心视觉解码行人过街意图

Danya Li, Xiang Su, Yan Feng, Rico Krueger

机构 * Technical University of Denmark(丹麦技术大学) University of Helsinki(赫尔辛基大学) Delft University of Technology(代尔夫特理工大学)

专题命中 视觉问答 :vision language model(title,abstract);VLM(summary_cn,abstract_cn);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 利用视觉语言模型(VLM)将行人过街意图预测转化为视觉问答任务,通过参数高效微调并结合自我运动、车辆运动和眼动等上下文线索,在自我中心视频上实现了14.5%的准确率提升,创下新纪录。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03661 2026-07-07 cs.CV 新提交 89%

From Geometric Labels to Semantic Understanding of Indoor Building Components Using Multimodal Large Language Models

使用多模态大语言模型从几何标签到室内建筑组件的语义理解

Shuju Jing, Chao Yin

机构 * School of Qilu Transportation, Shandong University(山东大学齐鲁交通学院) Guangzhou Institute of Geography, Guangdong Academy of Sciences(广东省地理研究所)

专题命中 视觉问答 :MLLM(summary_cn,abstract);multimodal large language model(title,abstract);分类 cs.CV

AI总结 研究针对室内建筑组件,提出以点云为中心的多模态大语言模型Building-MLLM,通过特定机制解决语义集中问题,开发引擎编译数据集,实验表明其在多任务上表现优异,提升室内组件语言理解。

Comments 46 pages, 13 figures, accepted by Automation in Construction journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01473 2026-08-04 cs.CV cs.CL cs.LG 新提交 88%

Slot2Text: Object-Centric Visual Tokenization for Efficient and Spatially Traceable Surgical MLLMs

Slot2Text:面向高效且空间可追溯的手术多模态大语言模型的以对象为中心的视觉分词

Guiqiu Liao, Matjaz Jogan, Daniel A. Hashimoto

专题命中 视觉问答 :MLLM(summary_cn,abstract);visual question answering(abstract);grounding(abstract);multimodal large language model(abstract)

AI总结 Slot2Text将视觉输入转为槽潜变量,推出双模式手术MLLM,在多基准上实现高效推理,Slot2Text-Fast大幅降本,Slot2Text-Reason支持可追溯空间推理。

Comments 17 pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15565 2026-07-20 cs.CV cs.AI cs.LG eess.IV 新提交 88%

Ask Twice, Look Twice: Prompt Echoing Resolves the Question-First Paradox in Vision-Language Models

问两次,看两次:提示回声解决视觉语言模型中的问题优先悖论

Rakshanda Hassan Abhinandan, John Galeotti, Deva Ramanan, Gautam Rajendrakumar Gare

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究视觉语言模型中问题优先提示的悖论,发现问题前置虽能引导感知但后续答案生成阶段难关注到问题。提出问题回声方法,即在图像两侧重复问题,解决了悖论,在多基准测试中表现出色且无需训练等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23921 2026-07-28 cs.CV 新提交 88%

DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering

DDVT:用于视觉问答中答案定位的动态双级视觉Transformer融合网络

Yue Zhang, Xiangyu Li, Wanshu Fan, Xin Yang, Dongsheng Zhou

机构 * National and Local Joint Engineering Laboratory of Computer Aided Design, School of Software Engineering, Dalian University(大连大学软件工程学院计算机辅助设计国家地方联合工程实验室) School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院)

专题命中 视觉问答 :visual question answering(title,abstract);grounding(title,abstract);分类 cs.CV

AI总结 研究视觉问答中答案定位问题,提出动态双级视觉Transformer融合网络DDVT,含问题引导的动态区域级模块和跨模态多尺度聚合模块,能精确定位相关视觉内容并融合文本特征,实验证明其性能优于现有方法。

Comments Accepted by CGI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20477 2026-06-23 cs.CV cs.CL cs.LG 新提交 88%

Scalable Training of Spatially Grounded 2D Vision-Language Models for Radiology

面向放射学的空间定位2D视觉-语言模型的可扩展训练

Yusuf Salcan, Simon Ging, Robin Tibor Schirrmeister, Philipp Arnold, Elmar Kotter, Behzad Bozorgtabar, Thomas Brox

机构 * Computer Vision Group, University of Freiburg, Germany(德国弗莱堡大学计算机视觉组) Department of Radiology, Medical Center -- University of Freiburg, Germany(德国弗莱堡大学医学中心放射科) CRIION-AI Lab, Freiburg, Germany(德国弗莱堡CRIION-AI实验室)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract_cn);visual question answering(abstract);grounding(abstract)

AI总结 提出RefRad2D大规模双语数据集,通过LLM和自动分割生成空间定位数据,训练RadGrounder模型联合完成报告生成、VQA和空间定位,在外部基准上取得竞争性结果。

Comments Accepted for MICCAI 2026. First two authors: equal contribution. Last two authors: equal supervision

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12127 2026-08-13 cs.CV 新提交 87%

SCOPE-Router: Cost-Aware Open-Set VLM Routing for Execution-Oriented Tasks

SCOPE-Router:面向执行导向任务的成本感知开放集视觉语言模型路由

Tao Yu, Yifei Qu, Zhiqing Cui, Pengfei Zhou, Zhongtian Luo, Yujia Yang, Shenghua Chai, Haopeng Jin, Zhenghao Zhang, Xinming Wang, Hongzhu Yi, Wangbo Zhao, Zhenglin Wan, Yan Huang, Yeshani, Jinwen Luo, Yang You

机构 * CASIA(中国科学院自动化研究所) UCAS(中国科学院大学) NUS(新加坡国立大学) Tencent(腾讯)

专题命中 视觉问答 :VLM(title,summary_cn);分类 cs.CV

AI总结 本文提出SCOPE-Router与CRM+RCCR,构建执行导向VLM路由基准VLM-ExecRouterBench,解决现有VLM路由局限,在多基准上取得更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12319 2026-07-15 cs.CV 新提交 87%

DM-KG: A Novel Method for Boosting Spatial Cognition of Vision-Language Models in Street View Imagery

DM-KG:一种提升街景图像中视觉语言模型空间认知的新方法

Xinyue Xu, Zheng Zhang, Kunyang Ma, Ge Zhu, Lianshuai Cao, Lei Wang, Zixuan Li, Yi Cheng

机构 * Institute of Surveying and Mapping, Information Engineering University(信息工程大学测绘学院) Institute of Geographic Sciences and Natural Resources Research, Chinese Academy of Sciences(中国科学院地理科学与资源研究所)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.CV

AI总结 研究针对视觉语言模型在街景图像空间认知方面的不足,提出DM-KG框架,通过提取实体关系、结合全景分割与深度估计计算坐标并编码知识图,有效提升模型空间推理准确性,降低误差,为地理视觉问答提供新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02300 2026-07-10 cs.CV cs.SE 新提交 87%

Search-based Testing of Vision Language Models for In-Car Scene Understanding

基于搜索的车内场景理解视觉语言模型测试

Lev Sorokin, Chen Yang, Ken E. Friedl, Andrea Stocco

机构 * BMW Group, Technical University of Munich(宝马集团、慕尼黑技术大学) Technical University of Munich(慕尼黑技术大学) Technical University of Munich, fortiss GmbH(慕尼黑技术大学、fortiss GmbH)

专题命中 视觉问答 :VLM(summary_cn,abstract_cn);vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 提出ISU-Test方法,结合渲染场景生成与搜索测试,通过优化场景参数自动生成多样化车内场景,评估VLM在问答和字幕任务中的性能,相比随机生成故障率提高10倍,故障覆盖率提高3.6倍。

Comments Accepted at the Industry Track of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15663 2026-06-16 cs.CV 新提交 87%

OneFocus: Enabling Real-World X-ray Security Screening with a Unified Vision-Language Model

OneFocus: 实现基于统一视觉语言模型的真实世界X光安检

Jiali Wen, Hongxia Gao, Litao Li, Yixin Chen, Kaijie Zhang, Qianyun Liu, Xiaoqin Wen

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.CV

AI总结 针对X光违禁品检测中新型违禁品适应难和视觉理解不足的问题,提出MMXray数据集和统一视觉语言模型OneFocus,支持问答、定位、分类和图像理解四项核心任务,达到最先进性能。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21155 2026-07-24 cs.CV cs.AI 新提交 87%

CRAG-MM-Diagnostics: Enabling Stage-Wise Analysis of Knowledge-Intensive VQA

CRAG-MM诊断:实现对知识密集型视觉问答的逐阶段分析

Hanseok Oh, Parishad BehnamGhader, Benno Krojer, Hyunji Lee, Paul Liang, Siva Reddy, Verna Dankers

机构 * New York University(纽约大学) McGill University(麦吉尔大学) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) UNC Chapel Hill(北卡罗来纳大学教堂山分校) MIT(麻省理工学院)

专题命中 视觉问答 :VLM(summary_cn,abstract_cn);vision-language model(abstract);visual question answering(abstract);grounding(abstract)

AI总结 研究知识密集型视觉问答流程,引入CRAG-MM-Diagnostics诊断基准,通过逐阶段数据注释分离子问题,评估VLM并进行细粒度分析,指出知识检索和推理是主要瓶颈,还提出改进流程提升准确率。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14581 2026-07-17 cs.AI cs.CV 新提交 87%

Multi-LLM Collaborative MRI Report Generation for Visual Instruction Tuning in Brain Oncology

用于脑肿瘤视觉指令微调的多语言模型协作式MRI报告生成

Sinyoung Ra, Jonghun Kim, Hyunjin Park

专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 针对脑肿瘤缺乏配对3D成像 - 文本数据问题,提出用多语言模型协作创建3D图像 - 文本数据集,构建VLM将MRI扫描转换为令牌并与文本指令对齐,该方法在报告生成等任务中表现优于其他方法,有助于脑肿瘤诊断治疗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06959 2026-08-10 cs.CV 新提交 86%

Summarize First, Download Later: Onboard VLMs for Bandwidth-Efficient Earth Observation

先总结,后下载:面向带宽高效的地球观测的机载视觉语言模型

Junghwan Park, Sangcheol Sim, Woojin Cho, Darongsae Kwon

专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 针对地球观测卫星下行链路带宽瓶颈,提出“先总结,后下载”范式,通过机载VLM生成摘要、地面VQA验证后按需下载全分辨率图像,可降带宽消耗并加速时间敏感任务的洞察时间。

Comments IGARSS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27122 2026-07-30 cs.CV 新提交 86%

Towards Grounded GI Endoscopy VQA via Multi-Task Learning on Small VLMs

基于小型视觉语言模型多任务学习的 grounded 胃肠道内窥镜视觉问答研究

Itbaan Safwan, Ramail Khan, Muhammad Annas Shaikh, Muhammad Atif Tahir

机构 * Institute of Business and Administration(商业管理学院)

专题命中 视觉问答 :VLM(abstract,abstract_cn);grounding(abstract,abstract_cn);vision-language model(abstract);visual question answering(abstract)

AI总结 该研究针对胃肠道内窥镜视觉问答任务,提出多任务微调方案,利用现有数据集构建辅助任务,微调小型视觉语言模型,实现了准确率提升与答案-图像区域对齐优化。

Comments Accepted at EMA4MICCAI 2026 (Workshop on Efficient Medical AI, MICCAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04149 2026-07-07 cs.CV 新提交 86%

Beyond Scene Priors: Fine-Grained Traffic Scene Reasoning with Benchmarking and Query-Guided Small-Object Focus

超越场景先验:通过基准测试和查询引导的小目标聚焦进行细粒度交通场景推理

Waikit Xiu, Qiang Lu, Zian Wang, Xinjie Yang, Zhiwei Chen, Chen Sun, Xiying Li

机构 * The University of Hong Kong(香港大学) Sun Yat-Sen University(中山大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视觉问答 :MLLM(summary_cn,abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 针对安全关键交通场景中复杂问题,提出细粒度交通推理基准FGTR - Bench和文本引导小目标推理MLLM(TSR - MLLM),解决视觉语言对齐中关键小目标被忽视问题,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23881 2026-06-24 cs.CL cs.CV cs.IR 新提交 86%

Ground Then Rank: Revisiting Knowledge-Based VQA with Training-Free Entity Identification

先定位再排序:基于知识的视觉问答中无训练实体识别的再探讨

Qian Ma, Qiong Wu, Zhengyi Zhou, Yao Ma

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) AT&T Chief Data Office(AT&T首席数据办公室)

专题命中 视觉问答 :MLLM(summary_cn,abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

AI总结 针对知识型视觉问答中实体与证据双重定位瓶颈,提出解耦实体识别与段落排序的无训练IBA框架,利用MLLM候选名称选择与文本重排序器,在降低复杂度同时提升性能。

Comments Accepted by ACL 2026 Findings. Project page https://github.com/VAN-QIAN/ACL26-IBA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19646 2026-06-19 cs.IR cs.CV 新提交 86%

SAFE-Cascade: Cost-Adaptive Vision-Language Routing for Chart Question Answering

SAFE-Cascade: 面向图表问答的成本自适应视觉语言路由

Ayush Dwivedi, Qixin Wang, Ashvi Soni, Ruoteng Wang, Han Li, Animesh Mahapatra, Neeraj Agrawal, Xintao Wu

机构 * University of Arkansas(亚拉巴马大学)

专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出SAFE-Cascade系统,通过OCR和轻量语言模型先给出答案,再由学习路由器决定是否调用VLM,在ChartQA上以73.1%的VLM调用率达到69.1%准确率,减少26.9%的VLM调用和9.3%的成本。

Comments Demo paper submitted at CIKM 2026. 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏