arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-16 至 2026-04-16 共收录 18 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 18 篇

2604.13993 2026-04-16 cs.AI cs.CL cs.CV 86%

Reward Design for Physical Reasoning in Vision-Language Models

用于视觉语言模型中物理推理的奖励设计

Derek Lilienthal, Manisha Mukherjee, Sameera Horawalavithana

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 视觉推理 :vision-language model(title);VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨了奖励设计对视觉语言模型物理推理的影响,通过对比不同奖励信号发现,基于准确性的奖励在多数领域表现最佳,而基于注意力权重的奖励提升了空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10946 2026-04-16 cs.CV 85%

Abstract 3D Perception for Spatial Intelligence in Vision-Language Models

抽象3D感知用于视觉-语言模型中的空间智能

Yifan Liu, Fangneng Zhan, Kaichen Zhou, Yilun Du, Paul Pu Liang, Hanspeter Pfister

机构 * Tsinghua University(清华大学) Harvard University(哈佛大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出SandboxVLM框架,通过抽象边界框编码几何结构和物理动力学,提升视觉-语言模型在3D任务中的空间智能,实验证明其在零样本设置下显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04442 2026-04-16 cs.CV cs.CL 83%

Addressing Overthinking in Large Vision-Language Models via Gated Perception-Reasoning Optimization

通过门控感知-推理优化解决大视觉-语言模型中的过度思考

Xingjian Diao, Zheyuan Liu, Chunhui Zhang, Weiyi Wu, Keyi Kong, Lin Shi, Kaize Ding, Soroush Vosoughi, Jiang Gui

机构 * Dartmouth College(达特茅斯学院) University of Notre Dame(诺丁汉大学) Cornell University(康奈尔大学) Northwestern University(西北大学)

专题命中 视觉推理 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出GPRO方法,通过动态路由计算路径提升大视觉-语言模型的推理效率与准确性,减少过度思考带来的冗余响应。

Comments Accepted to Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09687 2026-04-16 cs.CV cs.AI 81%

Grid2Matrix: Revealing Digital Agnosia in Vision-Language Models

Grid2Matrix: 揭示视觉语言模型中的数字失读

Yunkai Zhang, Linda Li, Yingxin Cui, Xiyuan Ruan, Zeyu Zheng, Kezhen Chen, Yi Zhang, Diji Yang

机构 * BAIR, UC Berkeley(伯克利大学BAIR实验室) UC Santa Cruz(圣克拉拉大学) Analogy AI

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 Grid2Matrix通过控制视觉复杂度测试视觉语言模型在捕捉细节方面的不足,发现模型在小网格上表现不佳,揭示了视觉编码与语言表达间的差距,即'数字失读'。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13756 2026-04-16 cs.CL cs.CV 77%

MedRCube: A Multidimensional Framework for Fine-Grained and In-Depth Evaluation of MLLMs in Medical Imaging

MedRCube:面向医学影像中多模态大语言模型细粒度与深入评估的多维框架

Zhijie Bao, Fangke Chen, Licheng Bao, Chenhui Zhang, Wei Chen, Jiajie Peng, Zhongyu Wei

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) School of Integrated Circuits, Zhejiang University(浙江大学集成电路学院) School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院)

专题命中 视觉推理 :MLLM(summary_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出MedRCube框架,通过两阶段构建流程对33个MLLM进行细粒度评估,揭示先前方法无法获取的洞察,并引入可信度评估子集,发现快捷行为与诊断性能的显著正相关,引发临床部署的担忧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12358 2026-04-16 cs.CV 70%

Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding

为何及何时视觉标记修剪失效?对多模态大语言模型解码中相关视觉信息转移的研究

Jiwan Kim, Kibum Kim, Wonjoong Kim, Byung-Kwan Lee, Chanyoung Park

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) NVIDIA

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文研究了视觉标记修剪在复杂视觉推理任务中的失效原因,提出解码阶段感知标记修剪方法,有效缓解了修剪方法在复杂推理任务中的性能下降。

Comments Preprint, Project : https://ptkjw1997.github.io/DSTP-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01410 2026-04-16 cs.AI 70%

GraphScout: Empowering Large Language Models with Intrinsic Exploration Ability for Agentic Graph Reasoning

GraphScout: 通过内在探索能力增强大语言模型以实现代理图推理

Yuchen Ying, Weiqi Jiang, Tongya Zheng, Yu Wang, Shunyu Liu, Kaixuan Chen, Mingli Song

机构 * Zhejiang University(浙江大学) Hangzhou City University(杭州市大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉推理 :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 GraphScout通过灵活的图探索工具,使模型自主生成结构化训练数据,从而在无需人工标注的情况下提升大语言模型的图推理能力,实验显示其在多个领域表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13074 2026-04-16 cs.CL cs.CV 70%

PersonaVLM: Long-Term Personalized Multimodal LLMs

PersonaVLM:长期个性化多模态大语言模型

Chang Nie, Chaoyou Fu, Yifan Zhang, Haihua Yang, Caifeng Shan

机构 * Nanjing University(南京大学) ByteDance(字节跳动)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出PersonaVLM,一种支持长期个性化多模态大语言模型框架,通过记忆、推理和响应对齐三大能力,提升个性化交互效果,并在Persona-MME基准测试中取得显著提升。

Comments Accepted by CVPR 2026. Project page: https://PersonaVLM.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13942 2026-04-16 cs.RO 67%

Goal2Skill: Long-Horizon Manipulation with Adaptive Planning and Reflection

Goal2Skill:基于自适应规划与反思的长时程操作

Zhen Liu, Xinyu Ning, Zhe Hu, Xinxin Xie, Weize Li, Zhipeng Tang, Chongyu Wang, Zejun Yang, Hanlin Wang, Yitong Liu, Zhongzhu Pu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn)

AI总结 本文提出双系统框架,通过分离高层语义推理与低层运动执行,提升长时程操作的鲁棒性和适应性,实验表明其在RMBench任务中显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13540 2026-04-16 cs.CV cs.AI 62%

Free Lunch for Unified Multimodal Models: Enhancing Generation via Reflective Rectification with Inherent Understanding

统一多模态模型的免费午餐:通过内在理解的反思校正增强生成

Yibo Jiang, Tao Wu, Rui Jiang, Yehao Lu, Chaoxiang Cai, Zequn Qin, Xi Li

机构 * School of Software Technology, Zhejiang University(浙江大学软件技术学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) College of Computer Science(计算机科学学院)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本文提出UniRect-CoT框架,通过反思校正提升统一多模态模型的生成能力,利用内部知识校正中间结果,增强生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13448 2026-04-16 cs.CV cs.AI 62%

A Study of Failure Modes in Two-Stage Human-Object Interaction Detection

两阶段人-物交互检测中故障模式的研究

Lemeng Wang, Qinqian Lei, Vidhi Bakshi, Daniel Yi, Yifan Liu, Jiacheng Hou, Asher Seng Hao, Zheda Mai, Wei-Lun Chao, Robby T. Tan, Bo Wang

机构 * The Ohio State University(俄亥俄州立大学) National University of Singapore(新加坡国立大学) Boston University(波士顿大学) Independent Researcher(独立研究者) University of Mississippi(密西西比大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本文研究两阶段人-物交互检测模型的故障模式,通过分解检测任务为多个可解释视角,分析模型行为以识别不同失败模式,揭示高基准性能不等于 robust 视觉推理的结论。

Comments Accepted to SAUAFG Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13403 2026-04-16 cs.CV 57%

Why Multimodal In-Context Learning Lags Behind? Unveiling the Inner Mechanisms and Bottlenecks

为何多模态上下文学习滞后?揭示内部机制和瓶颈

Yu Wang, Sharon Li

机构 * Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文分析了多模态上下文学习在零样本设置中表现与少样本演示下退化的原因,揭示了模型在视觉与文本表示对齐和任务映射转移方面的不足,并提出改进方法。

Comments ACL Main 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13313 2026-04-16 cs.LG 57%

Concrete Jungle: Towards Concreteness Paved Contrastive Negative Mining for Compositional Understanding

具体丛林:迈向由具体性铺就的对比负样本挖掘以实现组合理解

Eun Woo Im, Dhruv Madhwal, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.LG

AI总结 本文提出ConcretePlant,通过增强具体性术语的修改来提升对比学习信号,解决负样本生成中的梯度失衡问题,提出Cement损失函数以动态校准惩罚,实现更有效的组合理解。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21760 2026-04-16 cs.CL cs.AI 57%

fMRI-LM: Towards a Universal Foundation Model for Language-Aligned fMRI Understanding

fMRI-LM:迈向语言对齐的fMRI理解的通用基础模型

Yuxiang Wei, Yanteng Zhang, Xi Xiao, Chengxuan Qian, Tianyang Wang, Vince D. Calhoun

机构 * TReNDS Center (Georgia Institute of Technology, Georgia State University, Emory)(TReNDS中心(佐治亚理工学院、佐治亚州立大学、埃默里大学)) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Jiangsu University(江苏大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出fMRI-LM,通过三阶段框架将fMRI与语言结合,实现跨模态脑表示,通过神经分词、预训练LLM适应及多任务微调,提升fMRI的语义理解能力。

Comments Code are available: https://github.com/yuxiangwei0808/fMRI-LM

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20490 2026-04-16 cs.MA cs.CL cs.CV 57%

RadAgents: Multimodal Agentic Reasoning for Chest X-ray Interpretation with Radiologist-like Workflows

RadAgents: 多模态代理推理用于胸片解读的放射科工作流程

Kai Zhang, Corey D Barrett, Jangwon Kim, Lichao Sun, Tara Taghavi, Krishnaram Kenthapadi

机构 * Oracle Health AI Lehigh University(莱荷大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

AI总结 RadAgents通过结合临床先验知识和任务感知的多模态推理,构建模块化、可审计的放射科工作流程,提升胸片解读的可靠性与临床一致性。

Comments MIDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23137 2026-04-16 cs.CV cs.CL 57%

When 'YES' Meets 'BUT': Can Large Models Comprehend Contradictory Humor Through Comparative Reasoning?

当‘是’遇见‘但是’:大型模型能否通过比较推理理解矛盾的幽默?

Tuo Liang, Zhe Hu, Jing Li, Hao Zhang, Yiren Lu, Yunlai Zhou, Yiran Qiao, Disheng Liu, Jeirui Peng, Jing Ma, Yu Yin

机构 * Computer and Data Sciences Department, Case Western Reserve University(卡内基梅隆大学计算机与数据科学系) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算系)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文探讨了大型视觉-语言模型在理解涉及复杂矛盾叙述的幽默时的挑战,通过分析漫画中的矛盾对比,提出YesBut基准,并评估了多种模型在比较推理任务中的表现,揭示了模型在视觉感知和叙事理解上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01773 2026-04-16 cs.RO 50%

IGen: Scalable Data Generation for Robot Learning from Open-World Images

IGen: 为机器人学习从开放世界图像中实现可扩展的数据生成

Chenghao Gu, Haolan Kang, Junchao Lin, Jinghe Wang, Duo Wu, Shuzhao Xie, Fanding Huang, Junchen Ge, Ziyang Gong, Letian Li, Hongying Zheng, Changwei Lv, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The University of Hong Kong(香港大学) Beijing University of Chemical Technology(北京化工大学) Shanghai Jiao Tong University(上海交通大学) Shenzhen University of Infomation Technology(深圳信息大学)

专题命中 视觉推理 :vision-language model(abstract)

AI总结 本文提出IGen框架,通过开放世界图像生成高质量的视觉-运动数据,验证了其在机器人学习中的有效性。

Comments 8 pages, 8 figures; Accepted to CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13706 2026-04-16 cs.CL 50%

Co-FactChecker: A Framework for Human-AI Collaborative Claim Verification Using Large Reasoning Models

Co-FactChecker:一种用于人类-人工智能协作事实核查的框架

Dhruv Sahnan, Subhabrata Dutta, Tanmoy Chakraborty, Preslav Nakov, Iryna Gurevych

机构 * MBZUAI(穆罕默德·本·拉希德人工智能技术 institute) TU Darmstadt(德累斯顿理工大学) IIT Delhi(德里印度理工学院)

专题命中 视觉推理 :grounding(abstract)

AI总结 本文提出Co-FactChecker框架,通过将模型的思考轨迹作为共享草稿,利用专家反馈指导推理,提升事实核查的准确性和可解释性。

Comments 11 pages, 3 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏