arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26117 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4478 篇

2602.00415 2026-06-02 cs.AI cs.LG 86%

PolarMem: A Training-Free Polarized Latent Graph Memory for Verifiable Vision-Language Models

PolarMem: 一种无需训练的可验证视觉语言模型极化隐式图记忆

Zhisheng Chen, Tingyu Wu, Zijie Zhou, Zhengwei Xie, Jinhan Li, Ziyan Weng, Liang Lin, Jingwei Song, Zikai Xiao, Yingwei Zhang

机构 * ICT, CAS(中国科学院信息科技研究院) UCAS(中国科学院大学) CUPB(中国政法大学) USTC(中国科学技术大学) CityU-DG(城市大学-数据科学) HKU(香港大学) ZJU(浙江大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出PolarMem,一种无需训练的极化隐式图记忆框架,通过语义一致性验证和自适应分布划分将视觉语言模型感知信号转化为HAS、NOT_HAS和Uncertain记忆状态,并采用词典逻辑感知检索协议优先保证逻辑一致性,从而提升检索密集型任务性能并减少矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26038 2026-05-26 cs.CV cs.AI 86%

DRScaffold: Boosting Dense-Scene Reasoning in Lightweight Vision Language Models

DRScaffold:提升轻量级视觉语言模型在密集场景推理中的能力

Xinrui Shi, Kai Liu, Ziqing Zhang, Jianze Li, Anqi Li, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);VLM(abstract_cn);grounding(abstract)

AI总结 针对轻量级视觉语言模型在密集场景推理中缺乏显式视觉锚定导致推理链不可靠的问题,提出DRScaffold监督微调框架,通过将监督目标分解为四个因果有序阶段,在不修改架构的情况下强制进行有根据的推理,显著提升密集场景推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23270 2026-05-25 cs.CV cs.AI cs.RO 86%

ChainFlow-VLA: Causal Flow Planning with Vision-Language Models

ChainFlow-VLA: 基于视觉语言模型的因果流规划

Xiyang Wang, Xinlin Wang, Tingguang Zhou, Gong Chen, Xingtai Gui, Zhi Xu, Xiaolei Wu, Feiyang Tan, Hangning Zhou, Mu Yang

机构 * Afari Intelligent Drive(阿法瑞智能驾驶) Tianjin University(天津大学) University of Macau(澳门大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出ChainFlow-VLA框架,通过自回归生成因果轨迹模式与扩散残差校正的统一概率模型,结合视觉语言模型语义先验,实现自动驾驶中鲁棒的轨迹规划,在NAVSIM v1排行榜上达到94.85分,匹配人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20211 2026-05-21 cs.CV cs.AI 86%

Leveraging Vision-Language Models to Detect Attention in Educational Videos

利用视觉-语言模型检测教育视频中的注意力

Gabriel Becquet, Sébastien Lallé, Vanda Luengo, Ali Abou-Hassan

机构 * Sorbonne University, CNRS, LIP6 & PHENIX(索邦大学、国家科学研究中心、LIP6与PHENIX)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文研究利用视觉-语言模型直接分析教育视频内容,结合眼动数据以提高注意力检测的准确性,但发现其在实时教育诊断中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18162 2026-05-19 cs.CV cs.AI 86%

Self-Evolving Spatial Reasoning in Vision Language Models via Geometric Logic Consistency

通过几何逻辑一致性实现视觉语言模型中的自演化空间推理

Junming Liu, Yuqi Li, Yifei Sun, Maonan Wang, Piotr Koniusz, Yirong Chen, Ding Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The City University of New York(纽约城市大学) The Chinese University of Hong Kong(香港中文大学) Data61 CSIRO(Data61澳大利亚国家科学研究院) University of New South Wales(新南威尔士大学) Australian National University(澳大利亚国立大学)

专题命中 视觉推理 :vision language model(title);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SAGE框架,通过几何和语言二元操作在视觉语言模型中实现自演化空间推理,提升模型在空间推理任务中的鲁棒性和泛化能力。

Comments 23 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10120 2026-05-12 cs.CV cs.AI 86%

MicroWorld: Empowering Multimodal Large Language Models to Bridge the Microscopic Domain Gap with Multimodal Attribute Graph

MicroWorld: 通过多模态属性图赋能多模态大语言模型,弥合微观领域差距

Manyu Li, Ruian He, Chenxi Ma, Weimin Tan, Bo Yan

机构 * Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理关键实验室) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 MicroWorld通过构建多模态属性图增强多模态大语言模型在微观领域的能力,无需领域微调即可提升推理性能,实验显示在MicroVQA和MicroBench基准上均取得显著提升。

Comments 29 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09719 2026-05-12 cs.CV cs.AI 86%

Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT

将3D空间推理蒸馏到轻量级视觉-语言模型中:利用推理链

Alaa Asfour, Christopher Indris, Leihan Chen, Tejas Vyas, Guanghui Wang

机构 * Department of Computer Science, Toronto Metropolitan University(多伦多 Metropolitan 大学计算机科学系)

专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出一种知识蒸馏框架,将7B教师模型的3D空间推理能力转移到2.29B学生模型,实现8.7倍更低的推理延迟和3倍模型压缩,同时保留54-72%的性能。引入隐藏推理链提升推理能力,学生模型联合执行空间描述、深度估计和目标检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22228 2026-05-01 cs.CV cs.AI cs.CL 86%

Lost in Space? Vision-Language Models Struggle with Relative Camera Pose Estimation

迷失在空间中?视觉-语言模型在相对相机姿态估计中挣扎

Ken Deng, Yifu Qiu, Yoni Kasten, Shay B. Cohen, Yftah Ziser

机构 * University of Edinburgh(爱丁堡大学) University of Oxford(牛津大学) NVIDIA Research(NVIDIA研究) University of Groningen(格罗宁根大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 研究视觉-语言模型在相对相机姿态估计中的表现,发现其在多视角空间推理中存在显著不足,尽管人类和专用几何方法表现良好,但VLMs仍处于初级水平,揭示了跨视角对应和投影相机运动理解等关键能力缺失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22875 2026-04-29 cs.CV cs.AI 86%

SketchVLM: Vision language models can annotate images to explain thoughts and guide users

SketchVLM:视觉语言模型可以注释图像以解释思路并引导用户

Brandon Collins, Logan Bolton, Hung Huy Nguyen, Mohammad Reza Taesiri, Trung Bui, Anh Totti Nguyen

机构 * Auburn University(阿伯拉罕大学) Adobe Research(Adobe研究)

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);VLM(abstract_cn);visual reasoning(abstract)

AI总结 SketchVLM通过生成可编辑的SVG叠加图提升视觉推理和绘图任务的准确性与注释质量,实现高达28.5%的精度提升和1.48倍的注释质量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14951 2026-04-17 cs.CV cs.AI cs.CL cs.MM 86%

RaTA-Tool: Retrieval-based Tool Selection with Multimodal Large Language Models

RaTA-Tool: 基于检索的多模态大语言模型工具选择

Gabriele Mattioli, Evelyn Turri, Sara Sarto, Lorenzo Baraldi, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出RaTA-Tool框架,利用多模态大语言模型将多模态查询转化为结构化任务描述,并通过语义丰富的工具描述检索合适工具,支持开放世界场景下的工具扩展。

Comments ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13993 2026-04-16 cs.AI cs.CL cs.CV 86%

Reward Design for Physical Reasoning in Vision-Language Models

用于视觉语言模型中物理推理的奖励设计

Derek Lilienthal, Manisha Mukherjee, Sameera Horawalavithana

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 视觉推理 :vision-language model(title);VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨了奖励设计对视觉语言模型物理推理的影响,通过对比不同奖励信号发现,基于准确性的奖励在多数领域表现最佳,而基于注意力权重的奖励提升了空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18892 2026-03-20 cs.CV cs.AI 86%

MultihopSpatial: Multi-hop Compositional Spatial Reasoning Benchmark for Vision-Language Model

MultihopSpatial: 用于视觉语言模型的多跳组合空间推理基准

Youngwan Lee, Soojin Jang, Yoorhim Cho, Seunghwan Lee, Yong-Ju Lee, Sung Ju Hwang

机构 * Electronics and Telecommunications Research Institute, South Korea(韩国电信研究院) Korea Advanced Institute of Science and Technology, South Korea(韩国科学技术院) Sungkyunkwan University, South Korea(成均馆大学) DeepAuto, South Korea(DeepAuto)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MultihopSpatial基准,针对多跳组合空间推理问题,引入Acc@50IoU指标,并通过大规模训练集提升视觉语言模型的空间推理能力。

Comments Project page: https://youngwanlee.github.io/multihopspatial

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18675 2026-03-13 cs.CV cs.AI cs.CL 86%

ReasonMap: Towards Fine-Grained Visual Reasoning from Transit Maps

ReasonMap:迈向基于交通地图的细粒度视觉推理

Sicheng Feng, Song Wang, Shuyi Ouyang, Lingdong Kong, Zikai Song, Jianke Zhu, Huan Wang, Xinchao Wang

专题命中 视觉推理 :visual reasoning(title,abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 ReasonMap是一个针对交通地图的细粒度视觉推理基准,通过评估16种MLLMs揭示开源与闭源模型在推理性能上的差异,并强调视觉支撑对高性能的重要性。

Comments CVPR 2026, website: https://fscdc.github.io/ReasonMap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14482 2026-03-12 cs.CV cs.AI 86%

TikArt: Stabilizing Aperture-Guided Fine-Grained Visual Reasoning with Reinforcement Learning

TikArt: 通过强化学习稳定引导孔细粒度视觉推理

Hao Ding, Zhichuan Yang, Weijie Ge, Ziqin Gao, Chaoyi Lu, Lei Zhao

专题命中 视觉推理 :visual reasoning(title,abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 TikArt通过强化学习引导孔机制提升细粒度视觉推理,结合语言推理与Zoom、Segment操作,实现多模态证据获取与持久记忆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20812 2026-03-02 cs.CV cs.AI cs.CL 86%

Small Drafts, Big Verdict: Information-Intensive Visual Reasoning via Speculation

小草稿,大结论:通过推测进行信息密集的视觉推理

Yuhan Liu, Lianhui Qin, Shengjie Wang

机构 * New York University(纽约大学) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);VLM(abstract);visual question answering(abstract)

AI总结 SV通过结合多个轻量级草稿专家和大型结论模型,提升信息密集视觉推理的效率和准确性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02240 2026-02-24 cs.CV cs.AI 86%

RewardMap: Tackling Sparse Rewards in Fine-grained Visual Reasoning via Multi-Stage Reinforcement Learning

RewardMap: 通过多阶段强化学习解决细粒度视觉推理中的稀疏奖励

Sicheng Feng, Kaiwen Tuo, Song Wang, Lingdong Kong, Jianke Zhu, Huan Wang

机构 * Westlake University(西湖大学) Tongji University(同济大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 RewardMap通过多阶段强化学习解决细粒度视觉推理中的稀疏奖励问题,提升多模态大语言模型的视觉理解和推理能力。

Comments ICLR 2026, website: https://fscdc.github.io/RewardMap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02422 2026-01-07 cs.CV cs.AI 86%

Watch Wider and Think Deeper: Collaborative Cross-modal Chain-of-Thought for Complex Visual Reasoning

拓宽视野并深入思考:协作式跨模态链式推理用于复杂视觉推理

Wenting Lu, Didi Zhu, Tao Shen, Donglin Zhu, Ayong Ye, Chao Wu

机构 * Fujian Normal University(福建师范大学) Zhejiang University(浙江大学) Zhejiang Normal University(浙江师范大学)

专题命中 视觉推理 :visual reasoning(title,abstract);LLaVA(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 CoCoT通过动态多区域定位和关系感知推理,提升复杂视觉推理性能,在多个基准测试中实现显著准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22183 2025-12-30 cs.CV cs.AI cs.CL 86%

Unbiased Visual Reasoning with Controlled Visual Inputs

通过受控视觉输入实现无偏视觉推理

Zhaonan Li, Shijie Lu, Fei Wang, Jacob Dineen, Xiao Ye, Zhikun Xu, Siyi Liu, Young Min Cho, Bangzheng Li, Daniel Chang, Kenny Nguyen, Qizheng Yang, Muhao Chen, Ben Zhou

机构 * Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学) University of Pennsylvania(宾夕法尼亚大学) University of California, Davis(加州大学戴维斯分校)

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 VISTA通过解耦感知与推理,利用受控接口和强化学习训练,提升了视觉推理的鲁棒性和中立性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06259 2025-12-29 cs.CV cs.AI 86%

SIFThinker: Spatially-Aware Image Focus for Visual Reasoning

SIFThinker: 基于空间的图像聚焦用于视觉推理

Zhangquan Chen, Ruihui Zhao, Chuwei Luo, Mingze Sun, Xinlei Yu, Yangyang Kang, Ruqi Huang

机构 * ByteDance(字节跳动)

专题命中 视觉推理 :visual reasoning(title,abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 SIFThinker通过结合深度增强的边界框和自然语言,提升视觉推理中的空间理解和细粒度感知能力。

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15885 2025-12-19 cs.CV cs.AI cs.CL cs.MM 86%

Seeing Beyond Words: Self-Supervised Visual Learning for Multimodal Large Language Models

超越文字:面向多模态大语言模型的自监督视觉学习

Davide Caffagni, Sara Sarto, Marcella Cornia, Lorenzo Baraldi, Pier Luigi Dovesi, Shaghayegh Roohi, Mark Granroth-Wilding, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) AMD Silo AI

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 JARVIS通过自监督视觉学习提升多模态大语言模型的视觉推理能力,无需依赖语言监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06067 2025-11-18 cs.CV cs.AI 86%

Reasoning under Vision: Understanding Visual-Spatial Cognition in Vision-Language Models for CAPTCHA

Python Song, Luke Tenyi Chang, Yun-Yun Tsai, Penghui Li, Junfeng Yang

机构 * Columbia University Department of Computer Science(哥伦比亚大学计算机科学系)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI

Comments 14pages, 11figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24152 2025-10-29 cs.CV cs.AI 86%

Enhancing Vision-Language Models for Autonomous Driving through Task-Specific Prompting and Spatial Reasoning

Aodi Wu, Xubo Luo

机构 * University of Chinese Academy of Sciences(中国科学院大学) Technology and Engineering Center for Space Utilization, Chinese Academy of Sciences(中国科学院空间利用技术与工程中心)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI

Comments RoboSense Challenge with IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20967 2025-10-27 cs.CV cs.AI 86%

3DReasonKnee: Advancing Grounded Reasoning in Medical Vision Language Models

Sraavya Sambara, Sung Eun Kim, Xiaoman Zhang, Luyang Luo, Shreya Johri, Mohammed Baharoon, Du Hyun Ro, Pranav Rajpurkar

机构 * Department of Biomedical Informatics, Harvard Medical School(生物医学信息学系,哈佛医学院) Seoul National University Hospital(首尔国立大学医院)

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);VLM(abstract);grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16962 2025-10-23 cs.CV cs.AI cs.CL 86%

Chiron-o1: Igniting Multimodal Large Language Models towards Generalizable Medical Reasoning via Mentor-Intern Collaborative Search

Haoran Sun, Yankai Jiang, Wenjie Lou, Yujie Zhang, Wenjie Li, Lilong Wang, Mianxin Liu, Lei Liu, Xiaosong Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);visual question answering(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12845 2025-10-16 cs.CL cs.AI cs.CV cs.RO 86%

VLURes: Benchmarking VLM Visual and Linguistic Understanding in Low-Resource Languages

Jesse Atuhurra, Iqra Ali, Tomoya Iwakura, Hidetaka Kamigaito, Tatsuya Hiraoka

专题命中 视觉推理 :VLM(title,abstract);vision language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11718 2025-10-14 cs.CV cs.AI 86%

CodePlot-CoT: Mathematical Visual Reasoning by Thinking with Code-Driven Images

Chengqi Duan, Kaiyue Sun, Rongyao Fang, Manyuan Zhang, Yan Feng, Ying Luo, Yufang Liu, Ke Wang, Peng Pei, Xunliang Cai, Hongsheng Li, Yi Ma, Xihui Liu

机构 * HKU(香港大学) Meituan(美团) CUHK(香港中文大学)

专题命中 视觉推理 :visual reasoning(title,abstract);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02095 2025-08-08 cs.CV cs.AI 86%

VLM4D: Towards Spatiotemporal Awareness in Vision Language Models

Shijie Zhou, Alexander Vilesov, Xuehai He, Ziyu Wan, Shuwang Zhang, Aditya Nagachandra, Di Chang, Dongdong Chen, Xin Eric Wang, Achuta Kadambi

机构 * UCLA(美国大学洛杉矶分校) Microsoft(微软公司) UCSC(加州大学圣塔克拉拉分校) USC(美国大学洛杉矶分校)

专题命中 视觉推理 :vision language model(title,abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI

Comments ICCV 2025, Project Website: https://vlm4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01029 2025-07-03 cs.LG cs.AI cs.CL 86%

PathCoT: Chain-of-Thought Prompting for Zero-shot Pathology Visual Reasoning

Junjie Zhou, Yingli Zuo, Shichang Feng, Peng Wan, Qi Zhu, Daoqiang Zhang, Wei Shao

机构 * The College of Artificial Intelligence, Nanjing University of Aeronautics(人工智能学院,南京航空航天大学) Astronautics The Key Laboratory of Brain-Machine Intelligence Technology, Ministry of Education(航空航天脑机智能技术重点实验室,教育部)

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19469 2025-06-25 cs.CV cs.AI 86%

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning

Pengfei Hao, Shuaibo Li, Hongqiu Wang, Zhizhuo Kou, Junhang Zhang, Guang Yang, Lei Zhu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong University of Science and Technology(香港科技大学) Department of Thoracic Surgery, the Seventh Affiliated Hospital, Sun Yat-sen University(中山大学第七附属医院胸外科部门) Bioengineering/Imperial-X, Imperial College London(生物工程/Imperial-X,帝国理工学院伦敦分校) ROAS Thrust, Hong Kong University of Science and Technology (Guangzhou)(ROAS项目,香港科技大学(广州)) Department of Electronic and Computer Engineering, Hong Kong SAR(香港特别行政区电子与计算机工程系)

专题命中 视觉推理 :multimodal large language model(title,abstract);grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02669 2025-06-03 cs.CV cs.CL cs.LG 86%

Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?

Simon Park, Abhishek Panigrahi, Yun Cheng, Dingli Yu, Anirudh Goyal, Sanjeev Arora

专题命中 视觉推理 :visual reasoning(title,abstract);vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏