arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-21 至 2026-04-21 共收录 170 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 16 篇

2509.25944 2026-04-21 cs.AI 87%

NuRisk: A Visual Question Answering Dataset for Agent-Level Risk Assessment in Autonomous Driving

NuRisk:面向自动驾驶中 agent 级风险评估的视觉问答数据集

Yuan Gao, Mattia Piccinini, Roberto Brusnicki, Yuchen Zhang, Johannes Betz

机构 * Professorship of Autonomous Vehicle Systems, TUM School of Engineering and Design, Technical University of Munich(自主车辆系统教授职位,TUM工程与设计学院,慕尼黑技术大学) Munich Institute of Robotics and Machine Intelligence (MIRMI)(慕尼黑机器人与机器智能研究所(MIRMI))

专题命中 视觉问答 :visual question answering(title,abstract);VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.AI

AI总结 NuRisk 数据集通过 2.9K 场景和 1.1M agent 级样本,提供基于鸟瞰图的时序图像及量化风险标注,提升自动驾驶中 agent 行为与情境的时空推理能力。

Comments 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24942 2026-04-21 cs.LG cs.AI cs.CL 84%

Finding Culture-Sensitive Neurons in Vision-Language Models

在视觉-语言模型中寻找文化敏感神经元

Xiutian Zhao, Rochelle Choenni, Rohit Saxena, Ivan Titov

机构 * University of Edinburgh(爱丁堡大学) University of Amsterdam(阿姆斯特丹大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.AI、cs.LG

AI总结 研究视觉-语言模型处理文化相关信息的神经元特性,通过CVQA基准验证文化敏感神经元的存在及其分布,提出ConAct方法提升识别效果。

Comments Accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20715 2026-04-21 cs.CV cs.CL 83%

MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding

MUSEG:通过时间感知多段定位增强视频时间理解

Fuwen Luo, Shengfeng Lou, Chi Chen, Ziyue Wang, Chenliang Li, Weizhou Shen, Jiyue Guo, Peng Li, Ming Yan, Ji Zhang, Fei Huang, Yang Liu

机构 * THUNLP-MT

专题命中 视觉问答 :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 MUSEG通过引入时间感知多段定位,提升多模态大语言模型对视频时间信息的理解能力,通过定制化强化学习训练方案实现更全面的时间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12676 2026-04-21 cs.CV cs.AI 82%

BridgeEQA: Virtual Embodied Agents for Real Bridge Inspections

BridgeEQA:用于真实桥梁检查的虚拟具身代理

Subin Varghese, Joshua Gao, Asad Ur Rahman, Vedhus Hoskere

机构 * University of Houston(德克萨斯大学休斯顿分校)

专题命中 视觉问答 :visual reasoning(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出BridgeEQA基准,通过200个真实桥梁场景和2200个开放词汇问题对,评估具身记忆问答能力,引入Image Citation Relevance指标,并提出EMVR模型提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16213 2026-04-21 cs.CV cs.AI cs.CL 82%

M4CXR: Exploring Multi-task Potentials of Multi-modal Large Language Models for Chest X-ray Interpretation

M4CXR:探索多任务潜力的多模态大语言模型在胸部X光解读中的应用

Jonggwon Park, Soobum Kim, Byungmu Yoon, Jihun Hyun, Kyoyun Choi

机构 * DEEPNOID Inc.(DEEPNOID公司)

专题命中 视觉问答 :grounding(summary_cn,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出M4CXR,一种多模态大语言模型,通过链式推理策略提升胸部X光报告生成的临床准确性,并在视觉问答和视觉 grounding 任务中表现出色。

Journal ref IEEE Transactions on Neural Networks and Learning Systems, vol. 36, no. 10, pp. 17841-17855, Oct. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16930 2026-04-21 cs.CV cs.AI 81%

CoGR-MoE: Concept-Guided Expert Routing with Consistent Selection and Flexible Reasoning for Visual Question Answering

CoGR-MoE:基于概念引导的专家路由与一致选择和灵活推理的视觉问答

Xiyin Zeng, Yi Lu, Hao Wang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

AI总结 CoGR-MoE通过整合答案选项的语义信息指导专家选择,利用选项特征重新加权专家,生成判别性表示,用于选项比较和对比学习优化,提升视觉问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18320 2026-04-21 cs.CV cs.AI 79%

EVE: Verifiable Self-Evolution of MLLMs via Executable Visual Transformations

EVE: 通过可执行视觉变换实现多模态大语言模型的可验证自进化

Yongrui Heng, Chaoya Jiang, Han Yang, Shikun Zhang, Wei Ye

机构 * National Engineering Research Center for Software Engineering, Peking University(软件工程国家级工程研究中心,北京大学) School of Control Science and Engineering, Shandong University(控制科学与工程学院,山东大学)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出EVE框架,通过可执行视觉变换实现多模态大语言模型的可验证自进化,解决伪标签方法和模板方法的不足,通过双策略架构和多维奖励系统提升模型自进化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16272 2026-04-21 cs.CV cs.AI cs.CL 79%

VEFX-Bench: A Holistic Benchmark for Generic Video Editing and Visual Effects

VEFX-Bench:一个全面的通用视频编辑和视觉特效基准测试

Xiangbo Gao, Sicong Jiang, Bangya Liu, Xinghao Chen, Minglai Yang, Siyuan Yang, Mingyang Wu, Jiongze Yu, Qi Zheng, Haozhi Wang, Jiayi Zhang, Jie Yang, Zihan Wang, Qing Yin, Zhengzhong Tu

机构 * Texas A\&M University(德克萨斯大学)

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VEFX-Bench,基于VEFX-Dataset构建,用于标准化比较视频编辑系统,通过VEFX-Reward模型提升评估准确性,揭示当前模型在视觉合理性、指令遵循和编辑局部性方面的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17570 2026-04-21 cs.CV cs.AI 79%

PBSBench: A Multi-Level Vision-Language Framework and Benchmark for Hematopathology Whole Slide Image Interpretation

PBSBench:一种多级视觉-语言框架和血液病理学全滑片图像解释基准

Yuanlong Wang, Weichi Chen, Adrian Rajab, Wenfang Liu, Yulan Jin, Andrew Srisuwananukorn, Ping Zhang

机构 * The Ohio State University(俄亥俄州立大学) The Ohio State University Wexner Medical Center(俄亥俄州立大学韦克斯纳医学中心)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PBSBench,一种针对血液病理学全滑片图像解释的多级视觉-语言框架和基准,通过构建PBSInstr数据集和PBS-VL模型,提升了对血涂片图像的理解能力。

Comments 19 pages, 12 figures, Accepted by CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18429 2026-04-21 cs.CV cs.AI 73%

Revisiting Change VQA in Remote Sensing with Structured and Native Multimodal Qwen Models

重新审视遥感中的变化视觉问答问题:结构化与原生多模态Qwen模型

Yakoub Bazi, Mohamad M. Al Rahhal, Mansour Zuair, Faroun Mohamed

机构 * Computer Engineering Department, College of Computer and Information Sciences, King Saud University(计算机工程系,计算机与信息科学学院,沙特国王大学) Applied Computer Science Department, College of Applied Computer Science, King Saud University(应用计算机科学系,应用计算机科学学院,沙特国王大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文重新审视遥感中的变化视觉问答问题,比较了结构化视觉语言模型与原生多模态模型在CDVQA基准上的表现,发现原生模型在语义变化推理中更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16756 2026-04-21 cs.AI cs.CL cs.CV cs.RO eess.AS 62%

End-to-end Listen, Look, Speak and Act

端到端听、看、说和行动

Siyin Wang, Wenyi Yu, Xianzhao Chen, Xiaohai Tian, Jun Zhang, Lu Lu, Chao Zhang

机构 * Tsinghua University(清华大学) ByteDance(字节跳动)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ELLSA模型,首个端到端全双工系统,实现视觉、文本、语音和行动的同步感知与生成,支持对话轮替、指令拒绝等复杂交互行为,推动更自然的人工智能发展。

Comments 22 pages, 8 figures

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16729 2026-04-21 cs.CV cs.AI 62%

Agentic Large Language Models for Training-Free Neuro-Radiological Image Analysis

基于代理的大型语言模型用于无训练神经放射学图像分析

Ayhan Can Erdur, Daniel Scholz, Jiazhen Pan, Benedikt Wiestler, Daniel Rueckert, Jan C. Peeken

机构 * Department of Radiation Oncology, TUM University Hospital, Munich, Germany(放射肿瘤科,慕尼黑技术大学医院,德国) Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM)(人工智能在医疗和健康领域的主任,慕尼黑技术大学) Chair for AI for Image-Guided Diagnosis and Therapy, Technical University of Munich (TUM)(人工智能在影像引导诊断和治疗领域的主任,慕尼黑技术大学) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML),德国慕尼黑) Department of Computing, Imperial College London, London, UK(计算系,伦敦帝国学院,英国伦敦) Deutsches Konsortium für Translationale Krebsforschung (DKTK), Partner Site Munich, Munich, Germany(德国转化癌症研究联盟(DKTK),慕尼黑分部,德国慕尼黑)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种无训练代理框架,利用外部工具实现脑MRI分析,涵盖预处理、病灶分割和体积分析,并通过公开BraTS数据集评估代理AI在神经放射学任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17405 2026-04-21 cs.AI 57%

STRIDE: Strategic Iterative Decision-Making for Retrieval-Augmented Multi-Hop Question Answering

STRIDE: 用于检索增强多跳问答的策略迭代决策

Wei Chen, Lili Zhao, Zhi Zheng, HuiJun Hou, Tong Xu

机构 * University of Science Technology of China \& State Key Laboratory of Cognitive Intelligence Hefei Anhui China Technology of China \& State Key Laboratory of Cognitive Intelligence

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 STRIDE通过分离战略规划、动态控制和 grounded 执行,解决多跳问答中实体早 Commit 和推理依赖缺失的问题,提升推理鲁棒性与准确性。

Comments Accepted by SIGIR 2026 Full Paper. The code repository is available at https://github.com/fanshu6hao/STRIDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16979 2026-04-21 cs.CV cs.CL 57%

DOSE: Data Selection for Multi-Modal LLMs via Off-the-Shelf Models

DOSE: 通过现成模型进行多模态大语言模型的数据选择

Biao Wu, Yiwu Zhong, Meng Fang, Ling Chen

机构 * Australian Artificial Intelligence Institute(澳大利亚人工智能研究所) Peking University(北京大学) University of Liverpool(利物浦大学)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出DOSE方法,利用现成预训练模型筛选多模态数据,提升数据质量和对齐性,减少计算成本,增强数据多样性,使模型在标准VQA和数学基准测试中表现优异。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16311 2026-04-21 cs.CL cs.AI cs.SI 57%

Multimodal Claim Extraction for Fact-Checking

多模态声明提取用于事实核查

Joycelyn Teo, Rui Cao, Zhenyun Deng, Zifeng Ding, Michael Sejr Schlichtkrull, Andreas Vlachos

机构 * Defence Science and Technology Agency, Singapore(新加坡国防科学与技术局) University of Cambridge, UK(英国剑桥大学) Queen Mary University of London, UK(英国伦敦大学学院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

AI总结 本文提出首个多模态社交媒体声明提取基准,评估了最先进的多模态大语言模型,在语义对齐、忠实度和去上下文化框架下发现基线模型难以建模修辞意图和上下文线索,引入意图感知框架MICE提升关键意图场景性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14122 2026-04-21 cs.CV 57%

EgoSound: Benchmarking Sound Understanding in Egocentric Videos

EgoSound:评估egocentric视频中声音理解的基准测试

Bingwen Zhu, Yuqian Fu, Qiaole Dong, Guolei Sun, Tianwen Qian, Yuzheng Wu, Danda Pani Paudel, Xiangyang Xue, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Nankai University(南开大学) East China Normal University(华东师范大学) KAUST(卡塔尔大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 EgoSound首次系统评估多模态大语言模型在egocentric视频中的声音理解能力,包含7个任务分类,揭示当前模型在空间和因果理解上的局限。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 45 篇

2506.05405 2026-04-21 cs.CV 92%

A VLM-based Method for Visual Anomaly Detection in Robotic Scientific Laboratories

基于VLM的方法用于机器人科学实验室中的视觉异常检测

Shiwei Lin, Chenxu Wang, Xiaozhen Ding, Yi Wang, Boyuan Du, Lei Song, Chenggang Wang, Huaping Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Physics and Electronic Information, Yantai University(烟台大学物理与电子信息学院) School of Computer and Big Data, Fuzhou University(福州大学计算机与大数据学院) Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化系)

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出基于VLM的视觉推理方法,通过四个逐步信息提示配置实现多级监督,构建了专用视觉基准以评估其在科学流程异常检测中的有效性,实验表明提供更多上下文信息可提升检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16918 2026-04-21 cs.CL cs.LG 91%

Freshness-Aware Prioritized Experience Replay for LLM/VLM Reinforcement Learning

具有新鲜度意识的优先经验回放用于LLM/VLM强化学习

Weiyu Ma, Yongcheng Zeng, Yan Song, Xinyu Cui, Jian Zhao, Xuhui Liu, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology(卡布尔大学科学与技术大学) Chinese Academy of Sciences, Institute of Automation(中国科学院自动化研究所) AI Centre, Department of Computer Science, University College London(伦敦大学学院人工智能中心) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究所)

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);分类 cs.LG

AI总结 本文提出Freshness-Aware PER,通过引入指数衰减机制解决LLM/VLM强化学习中优先级过时问题,显著提升样本效率,在多个任务中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05920 2026-04-21 cs.CV 86%

High-Resolution Visual Reasoning via Multi-Turn Grounding-Based Reinforcement Learning

通过多轮基于定位的强化学习实现高分辨率视觉推理

Xinyu Huang, Yuhao Dong, Weiwei Tian, Bo Li, Rui Feng, Ziwei Liu

机构 * Fudan University(复旦大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 视觉推理 :grounding(title,abstract);visual reasoning(title);分类 cs.CV

AI总结 本文提出MGPO框架,通过多轮对话机制使LMMs在无需额外标注的情况下提升视觉定位能力,实验表明其在MME-Realworld和V*Bench任务中表现优异。

Comments Accepted by ACL(Findings) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21278 2026-04-21 cs.CV cs.AI cs.CL cs.LG 86%

GeoRC: A Benchmark for Geolocation Reasoning Chains

GeoRC:地理定位推理链基准测试

Mohit Talreja, Joshua Diao, Jim Thannikary James, Radu Casapu, Tejas Santanam, Ethan Mendes, Alan Ritter, Wei Xu, James Hays

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出GeoRC基准,通过Champion级GeoGuessr专家生成的800条真实推理链,评估VLM生成推理链的准确性,发现大模型在生成可审计推理链上仍逊于人类专家,而小型模型表现更差。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23404 2026-04-21 cs.CV cs.CL 85%

Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning

通过文本表示引导推理来解锁多模态大语言模型中的空间推理

Jiacheng Hua, Yishu Yin, Yuhang Wu, Tai Wang, Yifei Huang, Miao Liu

机构 * College of AI, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) The University of Tokyo, Tokyo, Japan(东京大学,东京,日本)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出TRACE方法,通过生成文本表示来提升多模态大语言模型的空间推理能力,实验表明其在多个基准测试中表现优异。

Comments Accepted to ACL 2026. 22 pages, 6 figures, 10 tables. Project page: https://trace-reasoning.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17243 2026-04-21 cs.CV 85%

RemoteShield: Enable Robust Multimodal Large Language Models for Earth Observation

RemoteShield:为地球观测启用鲁棒的多模态大语言模型

Rui Min, Liang Yao, Shiyu Miao, Shengxiang Xu, Yuxuan Liu, Chuanyi Zhang, Shimin Di, Fan Liu

机构 * Hohai University(河海大学) Nanjing University(南京大学) Southeast University(东南大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出RemoteShield,一种针对地球观测的鲁棒多模态大语言模型,通过偏好学习提升在现实输入变化下的稳定性与一致性,实验显示其在多模态扰动下表现优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20879 2026-04-21 cs.CV 85%

DriveAgent-R1: Advancing VLM-based Autonomous Driving with Active Perception and Hybrid Thinking

DriveAgent-R1: 通过主动感知和混合思维推进基于视觉语言模型的自动驾驶

Weicheng Zheng, Xiaofei Mao, Nanfei Ye, Pengxiang Li, Kun Zhan, Xianpeng Lang, Hang Zhao

机构 * Shanghai Qi Zhi Institute(上海启智研究院) LiAuto Tongji University(同济大学) Tsinghua University(清华大学)

专题命中 视觉推理 :VLM(title);vision-language model(abstract);visual reasoning(abstract);grounding(abstract)

AI总结 DriveAgent-R1通过主动感知和混合思维框架,提升自动驾驶中的视觉推理能力,采用三阶段训练策略,在复杂场景中实现高效决策,展现与顶级模型相当的性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02871 2026-04-21 cs.CL cs.AI 85%

Position: Multimodal Large Language Models Can Significantly Advance Scientific Reasoning

位置:多模态大语言模型可以显著推动科学推理

Yibo Yan, Shen Wang, Jiahao Huo, Jingheng Ye, Zhendong Chu, Xuming Hu, Philip S. Yu, Carla Gomes, Bart Selman, Qingsong Wen

机构 * Squirrel AI HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Tsinghua University(清华大学) University of Illinois at Chicago(伊利诺伊大学香槟分校) Cornell University(康奈尔大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文探讨多模态大语言模型在科学推理中的应用,提出四阶段研究路线,指出当前模型在跨领域推理中的潜力与挑战,为实现通用人工智能提供新视角。

Comments Accepted by The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026, Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03331 2026-04-21 cs.CV cs.AI cs.LG 85%

MMErroR: A Benchmark for Erroneous Reasoning in Vision-Language Models

MMErroR:面向视觉-语言模型错误推理的基准测试

Yang Shi, Yifeng Xie, Minzhe Guo, Liangsi Lu, Mingxuan Huang, Jingchao Wang, Zhihong Zhu, Boyan Xu, Zhiqi Huang

机构 * Guangdong University of Technology(广东工业大学) Hong Kong Baptist University(香港 Baptist大学) Sun Yat-sen University(中山大学) Peking University(北京大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出MMErroR基准,通过1997个包含单一推理错误的样本,评估视觉-语言模型检测错误推理的能力,发现即使最佳模型也仅能正确分类66.65%的错误。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22368 2026-04-21 cs.CV cs.AI 84%

When Visuals Aren't the Problem: Evaluating Vision-Language Models on Misleading Data Visualizations

当视觉不是问题:在误导性数据可视化上评估视觉-语言模型

Harsh Nishant Lalai, Raj Sanjay Shah, Hanspeter Pfister, Sashank Varma, Grace Guo

机构 * Birla Institute of Technology and Science, Pilani(巴尔·印度理工学院和科学学院,皮拉尼) Georgia Institute of Technology(佐治亚理工学院) Harvard University(哈佛大学)

专题命中 视觉推理 :vision-language model(title);vision language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 本文评估视觉-语言模型在识别误导性数据可视化中的能力,发现模型在检测可视化设计错误上更可靠,但常误判非误导性可视化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23941 2026-04-21 cs.LG cs.CV 84%

Vision Language Models are Biased

视觉语言模型存在偏见

An Vo, Khai-Nguyen Nguyen, Mohammad Reza Taesiri, Vy Tuong Dang, Anh Totti Nguyen, Daeyoung Kim

机构 * KAIST(韩国科学技术院) College of William and Mary(威廉与玛丽学院) University of Alberta(阿尔伯塔大学) Auburn University(阿伯茨维尔大学)

专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 研究探讨了视觉语言模型在计数和识别任务中的偏见问题,发现其在不同领域表现不佳,去除背景可显著提升准确率,揭示上下文视觉线索导致偏见。

Comments Code and qualitative examples are available at: vlmsarebiased.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17830 2026-04-21 cs.RO 83%

SYMBOLIZER: Symbolic Model-free Task Planning with VLMs

SYMBOLIZER:基于VLMs的符号模型无关任务规划

Sami Azirar, Zlatan Ajanovic, Hermann Blum

机构 * RWTH Aachen(亚琛理工大学) University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔人工智能与机器学习研究院)

专题命中 视觉推理 :VLM(summary_cn,abstract);visual language model(abstract)

AI总结 本文提出SYMBOLIZER框架,利用VLMs将图像转化为符号状态,结合启发式搜索实现跨领域任务规划,优于直接VLM规划并可与基于启发式的传统方法媲美。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17233 2026-04-21 cs.CV cs.AI 82%

Enhancing Zero-shot Personalized Image Aesthetics Assessment with Profile-aware Multimodal LLM

通过基于资料的多模态大语言模型增强零样本个性化图像审美评估

Chun Wang, Chenfeng Wei, Chenyang Liu, Weihong Deng

机构 * Mashang Consumer Finance Co., Ltd.(马莎消费金融有限公司) Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视觉推理 :MLLM(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 本文提出P-MLLM,通过用户资料引导的多模态大语言模型实现零样本个性化图像审美评估,实验表明其在无历史数据情况下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17054 2026-04-21 cs.CV cs.AI 82%

mEOL: Training-Free Instruction-Guided Multimodal Embedder for Vector Graphics and Image Retrieval

mEOL:无需训练的指令引导多模态嵌入器用于矢量图形和图像检索

Kyeong Seon Kim, Baek Seong-Eun, Lee Jung-Mok, Tae-Hyun Oh

机构 * KAIST(韩国科学技术院) POSTECH

专题命中 视觉推理 :MLLM(abstract,abstract_cn);visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出无需训练的指令引导多模态嵌入框架,通过多模态大语言模型将文本、位图和SVG代码映射到对齐的嵌入空间,利用模态特定指令和结构化SVG提示实现嵌入方向控制,构建首个文本到SVG检索基准,展示出优于传统基线的性能。

Comments Round 1 early acceptance to WACV 2026, Project page: https://scene-the-ella.github.io/meol

详情

展开后加载摘要…

URL PDF HTML 收藏