arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-31 至 2026-03-31 共收录 16 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 16 篇

2603.27558 2026-03-31 cs.CV 85%

Learning to See through Illumination Extremes with Event Streaming in Multimodal Large Language Models

通过事件流学习在极端光照下视觉感知

Baoheng Zhang, Jiahui Liu, Gui Zhao, Weizhou Zhang, Yixuan Ma, Jun Jiang, Yingxian Chen, Wilton W. T. Fok, Xiaojuan Qi, Hayden Kwok-Hay So

机构 * The University of Hong Kong(香港大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出Event-MLLM,通过动态融合事件流与RGB帧进行全光视觉推理,引入光照指示器和光照校正损失,解决极端光照下多模态大语言模型的感知与推理问题。

Comments IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18151 2026-03-31 cs.DC cs.AR cs.CV cs.LG cs.NI 84%

AVERY: Intent-Driven Adaptive VLM Split Computing via Embodied Self-Awareness for Efficient Disaster Response Systems

AVERY:基于具身自感知的意图驱动自适应VLM分发计算以实现高效的灾害响应系统

Rajat Bhattacharjya, Sing-Yao Wu, Hyunwoo Oh, Chaewon Nam, Suyeon Koo, Mohsen Imani, Elaheh Bozorgzadeh, Nikil Dutt

机构 * University of California, Irvine(加州大学尔湾分校) Kookmin University(国民大学)

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 AVERY通过意图驱动的自适应分发计算框架,在资源受限平台高效部署VLM,利用双流分发策略提升灾害响应系统实时查询能力,实现更高的准确性和更低的能耗。

Comments Paper is currently under review. Authors' version posted for personal use and not for redistribution. Previous version of the preprint was titled: 'AVERY: Adaptive VLM Split Computing through Embodied Self-Awareness for Efficient Disaster Response Systems'

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25848 2026-03-31 cs.CV cs.AI 84%

More Thought, Less Accuracy? On the Dual Nature of Reasoning in Vision-Language Models

更多思考,更少准确性?关于视觉-语言模型中推理的双重性质

Xinyu Tian, Shu Zou, Zhaoyuan Yang, Mengqi He, Fabian Waschkowski, Lukas Wesemann, Peter Tu, Jing Zhang

机构 * Australian National University(澳大利亚国立大学) University of Melbourne(墨尔本大学) GE Research(GE全球研究院)

专题命中 视觉推理 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究揭示了视觉-语言模型中推理的双重性质:虽然增强了逻辑推理能力,但可能导致感知基础能力下降,通过提出VAPO方法改进了模型对视觉信息的依赖。

Comments Accepted to ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03821 2026-03-31 cs.CV cs.AI 84%

Beyond Recognition: Evaluating Visual Perspective Taking in Vision Language Models

超越识别:评估视觉语言模型中的视觉视角理解

Gracjan Góral, Alicja Ziarko, Piotr Miłoś, Michał Nauman, Maciej Wołczyk, Michał Kosiński

机构 * University of Warsaw(华沙大学) Polish Academy of Sciences(波兰科学院) Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) IDEAS NCBR Lute

专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文通过144个视觉任务评估VLMs的视觉视角理解能力,发现模型在场景理解上表现优异,但在空间推理和视角理解上存在明显不足。

Comments Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26742 2026-03-31 cs.CL cs.LG 84%

Do Multilingual VLMs Reason Equally? A Cross-Lingual Visual Reasoning Audit for Indian Languages

多语言视觉语言模型是否同样具备推理能力?一种针对印度语言的跨语言视觉推理审计

Swastik R

机构 * Indian Institute of Information Technology, Raichur(印度信息技术学院赖丘尔分校)

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.LG;VLM(comments)

AI总结 本文通过将MathVista、ScienceQA和MMMU的980道题翻译成印度语言,评估了8种VLM在七种语言中的表现,发现切换至印度语言时准确率下降9.8-25个百分点,且达罗毗荼语比印欧语下降更多,链式推理反而降低了部分语言的性能。

Comments 16 pages, 10 figures, 6 tables. Code and data: https://github.com/QuantumByte-01/multilingual-vlm-reasoning-audit Dataset: https://huggingface.co/datasets/Swastikr/multilingual-vlm-reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27375 2026-03-31 cs.CV 79%

Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models

弥合可验证奖励下的视觉表征与强化学习在大视觉-语言模型中的应用

Yuhang Han, Yuyang Wu, Zhengbo Jiao, Yiyu Wang, Xuyang Liu, Shaobo Wang, Hanlin Xu, Xuming Hu, Linfeng Zhang

机构 * EPIC Lab, SJTU(上海交通大学EPIC实验室) Huawei(华为) HKUST (GZ)(香港科技大学(广州))

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出KAWHI机制,通过整合结构化视觉信息提升大视觉-语言模型的多模态推理性能,改进现有统一奖励优化方法。

Comments Homepage: \url{https://kawhiiiileo.github.io/KAWHI_PAGE/}

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21356 2026-03-31 cs.CV 79%

ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models

ShotBench:视觉语言模型中的专家级电影叙事理解

Hongbo Liu, Jingwen He, Yi Jin, Dian Zheng, Yuhao Dong, Fan Zhang, Ziqi Huang, Yinan He, Yangguang Li, Weichao Chen, Yu Qiao, Wanli Ouyang, Shengjie Zhao, Ziwei Liu

机构 * Tongji University(同济大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出ShotBench基准测试,用于评估视觉语言模型对电影叙事语言的理解能力,通过专家标注的3500多对问答数据揭示现有模型在细粒度视觉线索和复杂空间推理上的不足,并开发ShotVL模型在该基准上取得新突破。

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28651 2026-03-31 cs.AI 70%

Not Search, But Scan: Benchmarking MLLMs on Scan-Oriented Academic Paper Reasoning

不是搜索,而是扫描:在面向学术论文推理的扫描任务上基准测试大语言模型

Rongjin Li, Zichen Tang, Xianghe Wang, Xinyi Hu, Zhengyu Wang, Zhengyu Lu, Yiling Huang, Jiayuan Chen, Weisheng Tan, Jiacheng Liu, Zhongjun Yang, Haihong E

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出ScholScan基准,通过扫描式任务评估大语言模型在学术论文推理中的能力,发现检索增强生成方法在扫描任务上无显著提升,揭示了当前模型在该任务上的系统性缺陷。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27349 2026-03-31 cs.CV cs.CL 70%

Inference-Time Structural Reasoning for Compositional Vision-Language Understanding

推理时的结构推理用于组合性视觉-语言理解

Amartya Bhattacharya

专题命中 视觉推理 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 本文提出统一评估和增强框架,评估四种架构各异的VLMs在Winoground基准上的表现,通过结构化关系先验提升模型能力,发现SG增强对已有能力强的模型有益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27201 2026-03-31 cs.CV 70%

Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models

理解并缓解多模态推理链模型中的幻觉

Ji Ma, Wei Suo, Peng Wang, Yanning Zhang

机构 * School of Computer Science and Ningbo Institute, Northwestern Polytechnical University, China(西北工业大学计算机学院和宁波研究院) National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology, China(国家空天地海一体化大数据应用技术国家工程实验室)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文研究多模态推理链模型中的幻觉问题,发现其源于联想推理步骤中的虚假文本生成,提出一种有效策略缓解幻觉,实验表明方法效果显著且可与其他缓解方法结合提升性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27571 2026-03-31 cs.HC 67%

RAGent: Physics-Aware Agentic Reasoning for Training-Free mmWave Human Activity Recognition

RAGent:面向无训练毫米波人类活动识别的物理感知代理推理

Mingda Han, Huanqi Yang, Zehua Sun, Wenhao Li, Yanni Yang, Guoming Zhang, Yetong Cao, Weitao Xu, Pengfei Hu

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract)

AI总结 RAGent通过物理感知代理推理实现无训练毫米波人类活动识别,利用雷达知识库进行证据驱动推理,无需领域特定训练或适应,实现跨领域鲁棒识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26737 2026-03-31 cs.CV cs.AI 62%

Beyond Static Visual Tokens: Structured Sequential Visual Chain-of-Thought Reasoning

超越静态视觉标记:结构化的顺序视觉推理

Guangfu Guo, Xiaoqian Lu, Yue Feng, Mingming Sun

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本文提出结构化顺序视觉推理方法,通过构建视觉重要性图谱并按判别顺序进行推理,提升多模态模型的视觉认知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28353 2026-03-31 cs.CV 57%

VistaGEN: Consistent Driving Video Generation with Fine-Grained Control Using Multiview Visual-Language Reasoning

VistaGEN: 通过多视角视觉语言推理实现一致的驾驶视频生成与细粒度控制

Li-Heng Chen, Ke Cheng, Yahui Liu, Lei Shi, Shi-Sheng Huang, Hongbo Fu

机构 * Hong Kong University of Science and Technology(香港科技大学) Meituan, Inc.(美团) Beijing Normal University(北京师范大学)

专题命中 视觉推理 :VLM(abstract);分类 cs.CV

AI总结 本文提出VistaGEN,通过多视角视觉语言推理实现驾驶视频生成的细粒度控制与时空一致性,引入多视角视觉语言评估器和对象级细化模块,提升长视频生成质量与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27967 2026-03-31 cs.CV 57%

Learning Multi-View Spatial Reasoning from Cross-View Relations

从跨视图关系学习多视图空间推理

Suchae Jeong, Jaehwi Song, Haeone Lee, Hanna Kim, Jian Kim, Dongjun Lee, Dong Kyu Shin, Changyeon Kim, Dongyoon Hahm, Woogyeol Jin, Juheon Choi, Kimin Lee

机构 * KAIST(韩国科学技术院) Config Hanyang University(汉阳大学) Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出Cross-View Relations数据集,通过训练视觉语言模型提升多视图空间推理能力,在MindCube和RoboSpatial基准测试中取得显著提升,并在RoboCasa任务中提高机器人操作成功率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27060 2026-03-31 cs.CV 57%

VIRST: Video-Instructed Reasoning Assistant for SpatioTemporal Segmentation

VIRST:用于时空分割的视频指导推理助手

Jihwan Hong, Jaeyoung Do

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV

AI总结 VIRST提出一种端到端框架,统一全局视频推理与像素级分割预测,通过时空融合模块和时间动态锚点更新器,提升动态场景下的分割性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11410 2026-03-31 cs.CV 57%

Seeing Isn't Orienting: A Cognitively Grounded Benchmark Reveals Systematic Orientation Failures in MLLMs Supplementary

看见并不意味着定向:一个认知基础的基准揭示了多模态大语言模型在定向任务中的系统性失败

Nazia Tasnim, Keanu Nichols, Yuting Yang, Nicholas Ikechukwu, Elva Zou, Deepti Ghadiyaram, Bryan A. Plummer

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出DORI基准,通过分解定向为四个维度,揭示多模态模型在物体定向任务中的系统性不足,指出其依赖分类启发式而非几何推理。

Comments This is a replacement and updated version for submission arXiv:2505.21649 : Right Side Up? Disentangling Orientation Understanding in MLLMs with Fine-grained Multi-axis Perception Tasks

详情

展开后加载摘要…

URL PDF HTML 收藏